ARTICLE DETAIL

资讯详情

深耕商务建站与企业官网运营的一线实战洞察。

AI学习路径实操指南:从大模型API到RAG与Agent开发

AI学习路径实操指南:从大模型API到RAG与Agent开发 很多人学 AI 的第一步就搞错了不是先买课、不是先啃西瓜书而是没想清楚自己到底要拿 AI 干什么。标题是“如果想要学习 AI 你知道一个正确的学习路径”这问题我过去五年被问了不下几百次问的人里有刚毕业的学生、写了十年业务代码的后端、做设计的、做运营的甚至还有传统行业想转行的老板。我给的答案从来都不是一套固定的课程表而是一条不断修正过的、以动手为核心的学习路线。这篇我就把这套路线完整拆开讲你可以把它当成一份私人整理的路径图跟着走、边做边调整应该能省下大半年的试错时间。1. 学习 AI 前先想清楚你要做的 AI 是哪一个“AI”聊路径之前得先把“AI”这个词拆开。现在市面上说的 AI其实至少是四个差别巨大的方向每个方向对数学、编程、硬件的要求完全不同。1.1 四个方向照着对号入座AI 应用开发主要是调用大模型 API做 AI 应用、写 Agent智能体、做 RAG 知识库还有现在很火的 AI 短剧制作、AI 电商场景优化以及 AI 编程工具的二次开发。这一层不需要自己训练模型核心是把模型能力用出花来。AI 算法工程这才是传统意义上的“搞 AI”要做数据处理、模型训练、微调、强化学习跑实验、调参数。这一层需要比较扎实的数学功底尤其是概率论和线性代数还需要能折腾 GPU 环境。AI Infra基础设施围绕大模型做推理优化、训练框架、模型部署、算力调度。这一层离底层最近需要极强的工程能力和系统知识也是目前最缺人、薪资天花板最高的方向之一。AI 产品与工具使用不写代码但要用 AI 把工作效率提上去或者用 AI 绘画、AI 视频工具做内容生产再或者做 AI 产品设计、用 AI 辅助专利撰写现在这行越来越多了本质是把 AI 当成生产力杠杆用。我说句实在话以上四个方向没有高低之分只有适不适合你。你让我一个写业务代码的人去啃 Infra 层的 kernel 优化那纯属互相折磨你让一个算法研究员天天追着 Prompt 技巧跑也是在浪费人家调模型的功力。1.2 先定终点再定起点我见过太多新手一上来就问“我该学 PyTorch 还是 TensorFlow”这问题背后是从没想过自己学了之后要干什么。如果你想在三个月内做出一个能用的 AI 小应用比如用大模型自动整理文档、做客服问答机器人那你应该走应用开发这条路。这条路对数学要求几乎为零会调 API 就行核心是掌握提示词工程、RAG、Agent 流程编排再加点前后端知识把东西包装成能用的产品。如果你是想进大厂做算法岗那对不起你躲不开线性代数、概率论、机器学习经典模型、深度学习这些硬骨头。这条路以年为单位计急不得。如果你既不写代码也不想研究算法那你完全可以走 AI 工具流路线用 Anaconda 装个 Stable Diffusion 画图、用剪映做 AI 短视频、用 Agent 工具搭建自动化的内容生产工作流。这也能创造价值甚至能直接变现。所以学习 AI 的正确路径第一步不是找教程是先拿张纸回答自己三个问题我现在的技能是什么我想去的岗位或者我想做的事是什么我能投入的时间是每天一小时还是全职这三个问题定不下来路径就是空中楼阁。2. 路径第一步把 Python 基础和应用开发常识焊死不管选哪个方向有一关是所有人绕不开的就是 Python。哪怕你想走 AI 工具流路线完全不写代码也得会基本的环境安装、文件路径这种基础操作否则你连报错都看不懂。2.1 Python 学到什么程度算过关不需要学成程序员学完基础语法、函数、类、异常处理、文件读写、列表字典推导式这几个点就够用了。然后一定要学 Jupyter Notebook 或者 Jupyter Lab 的用法因为在 AI 探索阶段你需要在里面敲代码、看输出、画图表这比用 IDE 写完整工程要高效得多。我见过有人花三个月把《利用 Python 进行数据分析》从头啃到尾结果模型 API 还没调通过一次。这就是本末倒置了。如果是做应用方向Python 掌握到能看懂别人开源代码、能改代码、能自己写一个小脚本去调用 API 就足够了剩下的语法边做边学效率要高十倍。2.2 开发环境和常用库一次装到位环境这块我推荐直接用 Anaconda或者现在叫 Miniconda 也行它自带 Python 和一大堆常用科学计算库能把环境管理、依赖安装的坑一次性帮你填了。装完基础环境之后下面这几个库是必然要用到的我按使用频率排个序python-dotenv用来管理 API Key别把密钥硬编码到代码里requests / httpx调 HTTP 接口的基础很多大模型 API 走的都是 HTTP 协议openai 或各厂商的 SDK接入大模型pandas处理结构化数据做 AI 应用时常用来清洗数据另外我强烈建议装好 AI 编程插件。用 PyCharm 的就装通义灵码或者 GitHub Copilot用 VS Code 或者 Cursor 的也有配套插件。你在学 AI 的过程中这个插件本身就是一个极好的老师它能帮你解释报错、补全代码、快速查文档。现在很多教程讲“AI 编程提示词”核心思路其实就一句话把需求描述清楚把上下文喂给它让它输出可运行的代码而不是代码片段。注意AI 编程工具生成的代码千万别直接往生产环境丢一定要自己跑一遍、理解每一行在干什么。我见过不少新手把 AI 生成的代码直接复制结果连 API 路径写错了都不知道。3. 路径第二步从调用大模型 API 开始而不是从训练模型开始这是我认为整个学习路径中最关键的一个认知转变却也是绝大多数教程讲得最含糊的地方。3.1 为什么先学调用 API很久以前流行一种观点说要学 AI 必须先学机器学习算法、先手推一遍反向传播。这个观点在深度学习早期是成立的那时候框架不成熟、模型要自己训练不懂原理的话根本没法下手。但现在完全不一样了市面上有太多成熟的模型 API推理能力比你自己从零训练出来的模型强几个数量级。在这种背景下让新手先学训练模型就像教人开车先学发动机原理一样反而不合理。正确的顺序是反过来的先学会调用最好的模型把 AI 应用做出来理解它能做什么、不能做什么。有了一定的“手感”之后如果有余力再回头补训练相关的知识。这个顺序能让你的成就感来得很快学习动力自然就保持住了。3.2 五大模型 API 逐个过一遍目前主流的大模型 API 有这几种每个我都实际跑过OpenAI 系GPT 系列生态最成熟文档最多各种框架对它的兼容性最好。如果只学一个我建议先学它的接口规范因为很多国产模型的接口都兼容 OpenAI 格式。Anthropic 系Claude 系写代码和长文本能力很强API 设计上有个 Messages 的格式初看会觉得怪但用顺了之后会发现它的角色设计比很多模型都清晰。国内模型通义千问、DeepSeek、智谱等优势是网络稳定、合规、便宜而且很多都提供开源权重。做正经项目的时候国内模型其实更应该优先考虑。开源可本地部署的模型Qwen、Llama 等适合数据不能出内网、或者想深度做模型的场景。我自己带新手的时候会让他们把同一个任务用三家不同厂家的 API 各调一遍对比一下返回质量和速度。这么做不是为了让你评测哪个模型好而是让你真正理解不同模型 API 在提示词风格、参数细节上的差异。切换过两三家之后你会豁然开朗所有的模型 API 都是在做一件事——把文本发过去把生成的文本收回来只是中间的协议细节略有不同。心得别迷信某个特定模型。模型迭代速度太快了今天最强的模型三个月后就可能被超越但你掌握的套路——怎么设计提示词、怎么搭流程、怎么做评测——是通用的长期来看才是更值钱的。3.3 用提示词工程建立第一层手感完整的提示词工程不是“你好请帮我写个文案”这种级别而是有套路的结构化表达。合格的 Prompt 包含五个要素角色设定、任务描述、输出限制、上下文/示例、补充指令。随便举个之前带学员做的案例假设你要让 AI 做一份周报你是一名资深的互联网产品运营角色设定。 请根据下面的工作日志帮我写一份本周工作周报任务描述 要求用简洁的要点式表达每条不超过50字不要出现主观评价最后用“下周计划”小节收尾输出限制。 工作日志周一更新了3篇渠道文章其中1篇进入了首页推荐……上下文 注意如果日志中出现数据请保留原始数字不要做近似处理补充指令。你可能觉得这不就是把话说明白嘛。是的提示词工程的核心还真就是把需求说清楚。但进一步要提高你还需要懂模型本身的工作原理它本质是预测下一个字token所以你把示例few-shot给得越清楚它输出的格式就越可控。这部分是很多 AI 应用开发工程师实际每天都在啃的技能。3.4 别忽视官方文档和 API 参数细节很多新手喜欢到处找“XX 模型保姆级教程”结果官网文档就在眼前却不看。我恳切建议你花半天时间老老实实把某一家 API 的官方文档翻一遍。你要注意的不只是 prompt 怎么写还有 temperature、top_p、max_tokens、frequency_penalty 这些采样参数。这些参数控制着模型的“性格”temperature 越高回答越发散、越低越保守。在需要精确答案的客服场景里temperature 我一般调到 0 到 0.3在写文案的场景里我可以调到 0.8 甚至 1.0。这种在不同场景下调节参数的直觉只能从实际调 API 的过程中慢慢积累看教程是学不来的。4. 路径第三步用 RAG 和 Agent 做出真正有用的应用如果你只是调 API 聊天那你很快会发现自己做的“应用”和新版聊天软件没啥区别只是换了个壳子。从“会调 API”到“能做出应用”中间最关键的两个台阶是 RAG检索增强生成和 Agent智能体。4.1 RAG让 AI 学会读你的私有知识库RAG 的出现是因为模型有知识截止日期而且你没法把几十万字的公司内部文档塞进 prompt 里按 token 计费太贵而且上下文窗口有限。RAG 的原理可以一句话讲完先从你的文档库里检索出跟问题最相关的几段内容然后拼到 prompt 里喂给模型让模型基于这些内容做回答。相当于给 AI 配了个搜索引擎让它先翻资料再发言。动手实现一个最小可用的 RAG 系统在 2025 年已经不算复杂主流程就四步加载文档用 LangChain 或者 LlamaIndex 这类框架读取 PDF、Word、TXT 文件底层还得有一层文档解析的功夫不过框架已经做了大部分。把文档切块按固定长度或者按层级切分成长度适中的 chunk。向量化用一个 Embedding 模型把每个 chunk 转成向量一串数字存进向量数据库。检索并回答把用户提问转成向量在向量库里做相似度查找取 top-K 个最相关 chunk拼好 prompt 发给大模型生成答案。只有亲手照着四步做一遍 RAG你才真正感受到 AI 应用开发的核心不在“模型”而在“流程编排”。你写的代码大部分不是在做推理而是在做数据的流转、存储和拼装。4.2 Agent从单次对话到多步任务执行Agent 是另一个热词。网上对 Agent 的定义五花八门我讲一个大家都能听懂的版本如果一个 AI 系统不仅能回答你的问题还能自己决定下一步做什么比如去调一个搜索工具、去执行一段代码、去访问一个网页再根据工具返回的结果继续推理那它就是一个 Agent。Agent 应用最核心的技术点是 ReAct 范式Thought推理→ Action行动→ Observation观察循环往复。AI 先想一想下一步该做什么然后调用某个工具去执行看到执行结果之后再想下一步直到完成整个任务。主流框架有 LangChain、LlamaIndex、AutoGen 等。不过我不建议你直接一上来就往上套框架因为框架封装得太好了一旦出了 bug 你根本不知道问题出在自己写的代码里还是框架里。我带新手的时候都让他们先用 Python 手写一个 Chat 循环在循环里调用模型 API让模型输出“要调用的工具名和参数”然后自己写解析逻辑再去执行工具。哪怕这个手写版只有五十行也比直接调 Agent 框架的理解深得多。等你把原理彻底搞清楚了再去用框架封装好的高阶 Agent会顺畅很多。4.3 一个实操案例从零搭一个“文档问答机器人”这里给你一个完整可跑的案例流程。假设我现在手头有一堆产品说明书 PDF想做一个能回答“某功能如何使用”的小机器人。需要用到的工具一个模型 API比如 DeepSeek 或通义千问、一个 Embedding 模型、一个向量数据库启动最快的可以用 chromadb也可以用 FAISS 这种纯文件型方案。步骤一把 PDF 解析成纯文本按每 800 字一个 chunk 切开chunk 之间保留 100 字的 overlap防止语义被切断。步骤二将每个 chunk 用 embedding 模型转成向量和 chunk 原文一起存进向量库。步骤三用户提问“怎么导出报表”同样转成向量在库里搜索最相近的 4 个 chunk。步骤四构造 prompt把这 4 个 chunk 拼进去后面接一句“如果上述内容中找不到答案请直接说不知道不要编造。”然后发给大模型。这样一个最小闭环跑通之后你可以再考虑加入引用来源标注、多轮对话改写、流式输出这些优化。4.4 进阶一点Agent 加工具调用的落地套路如果你想让 Agent 不只是回答而是能“干活”比如让它自动查天气、自动发邮件、自动操作某个网站就需要用到 Function Calling / Tool Use 机制。基本套路是你在代码里定义好若干“工具函数”然后把这些函数的 JSON Schema 描述一并传给模型 API模型在需要时返回一个 tool_call 请求。你的代码解析出“要调用哪个函数、传什么参数”执行真正的函数然后把函数的返回结果再塞回对话上下文让模型继续说下一步。这种模式最大的好处是工具的实际执行仍然是你的代码在做模型只负责做决策所以安全性和可控性都好很多。想让 Agent 干活干得好你需要把工具的描述写得非常清楚什么时候该用这个工具、参数应该填什么。这个功夫其实和前面提示词工程的技术是类似的——都是在帮模型做“决策”。5. 路径第四步多模态 AI 内容生成把创意能力变成生产力说完了对话和 Agent 类应用还得专门讲讲现在风头正劲的 AI 生成方向。相关热搜词里 AI 漫画、AI 短剧、AI 视频、AI 电商、AI 绘画都占了很大的比重而且这些方向越来越不像是“玩一玩”而是在真正进入内容产业。5.1 AI 生图的原理与实操要点AI 绘画背后是扩散模型Diffusion Model训练时不断给图片加噪直到它变成一片随机的噪音点生成时模型从一片纯噪音开始一步步“去噪”最终还原成一副符合文字描述的图像。对于创作者来说你不需要理解数学推导但你需要理解两个核心概念提示词正/反向和采样步数。正向提示词写你要什么主体、场景、风格、光线、镜头角度。反向提示词写你不要什么模糊、低质量、畸形的手、多余的肢体。采样步数steps不是越多越好常用 20~30 步之间太高了反而可能引入伪影。采样器Sampler选 DPM 2M Karras 或者 Euler a 这类常用的效果稳定。如果你想深入一些可以了解 ControlNet 这类辅助工具它能通过提取线稿、姿态、深度图等条件精确控制生成图像的构图。这在实际做漫画和短片时非常有用能保证同一角色在不同画面里长得差不多。5.2 AI 视频生成与 AI 短剧的完整工作流AI 短剧或者叫 AI 漫剧的制作是最近半年非常火的一个实操方向也是最容易入门的“AI 内容创业”切入口。一条完整的 AI 短剧制作流程按顺序是剧本阶段用大模型生成短剧剧本包括角色设定、分集大纲、每集的字幕和旁白。这个阶段核心是把人设和剧情冲突写好。分镜阶段把整个剧本拆成分镜脚本每个镜头一行包含景别全景/中景/近景、镜头语言、画面描述、台词。提示词好不好用就看这个分镜表细不细。原画阶段用 AI 生图工具比如 Midjourney、Stable Diffusion、即梦等把每个分镜生成一张高质量原画。这里要想办法保持同一角色的一致性可以给角色设计详尽的参考图再喂给工具做参考。动态化阶段用即梦/AI 视频工具把静态图变成几秒钟的动态视频片段加上运镜指令。现在有不少工具支持首尾帧可以控制画面运动轨迹。配音合成用 AI 配音工具把剧本里的台词转成声音注意根据角色性格选不同音色。剪辑发布在剪映这类工具里把所有片段拼起来加 BGM、字幕、音效调色压字幕导出。这个流程对剪辑能力的要求比 AI 能力的要求更高一点。很多人以为 AI 短剧的关键是“生成画面”其实整个视频的新手最容易翻车的地方是剧情节奏和配音违和。画面不好看还能靠提示词慢慢调故事不好看、声音出戏那是硬伤观众三秒就划走了。5.3 AI 电商场景和内容生产的新机会AI 在电商领域的价值也很大。头部商家早就在用 AI 批量生成商品图、广告文案、模特试穿效果。这里的技术要点和生图方向类似核心是做“商品一致性”让同一个商品呈现在不同背景、不同模特身上保持长得很像。电商产品经理如果学会这些 AI 工具流在简历上写“会用 AI 把新品上架素材制作周期从三天压缩到三小时”这就是很漂亮的加分项。6. 路径第五步AI Infra 和模型部署——看懂大模型的最后一公里如果你志向不只是在应用层调用 API还想深入进去可以看一眼前方的深水区AI Infra。在大模型发展到现在这个阶段训练和部署本身就是一个高门槛的工程问题非常值得懂行的去专攻。6.1 模型部署的几种主流方案即使只是在公司内部做一个 AI 应用你早晚会碰到一个场景产品要求数据不出内网或者私有化部署不让走外部 API。这时候你就绕不开模型部署。主流的部署方案有直接用 Transformers 库加载模型适合快速验证但是对于 7B、13B 级别的大模型来说资源消耗太大速度也不乐观。vLLM 做推理加速是目前开源社区里非常主流的方案。它利用 PagedAttention 连续批处理等技术能把吞吐量提升几倍到几十倍。部署起来也不难你只要把一个 Hugging Face 格式的模型目录喂给它它就会自动起一个兼容 OpenAI 格式的 HTTP 服务。TGIText Generation InferenceHugging Face 官方的推理服务和 vLLM 类似选哪个看团队习惯。Ollama / llama.cpp适合在个人电脑或者边缘设备上跑量化后模型对显存的要求会低很多。部署这层内容的坑非常多最常见的是显存爆掉、并发吞吐上不去、量化后效果打折。如果你走算法工程方向模型部署这块经验在面试里会非常有说服力。6.2 要想深入 Infra需要补哪些底子如果你看完了上面的介绍还是对底层技术特别感兴趣那你需要学的东西包括但不限于CUDA 编程、GPU 架构、分布式训练框架、模型并行策略张量并行、流水线并行、KV Cache 优化、量化原理等。但这条路不建议零基础的人直接入最好是先做了几年后端或者算法已经有很强的工程能力再往 Infra 方向转。用个不太恰当的类比AI Infra 工程师像修高速公路的做 AI 应用的是在上面跑车的。你得先把车开熟练了才知道路要怎么修。6.3 AI 大模型原理也要懂一点哪怕你不做算法最后不管你走应用方向还是工具方向我还是建议大家花一点时间理解大模型的语言机制。不用到能手推反向传播的程度但至少要理解token 和分词器的概念大模型看到的文本不是你看到的文本它是一块一 块 的 token中文一个字平均约等于 1 到 2 个 token。上下文窗口模型能接收的输入最长多少。窗口越长越贵所以 RAG 才有意义。预训练与微调的区别预训练是让模型学会“说人话”微调是让模型在某个方向变得“更专业”。自回归生成模型每生成一个 token都要把所有已生成的 token 重新算一遍这就是为什么输出越长越贵。了解这些底层概念之后你在设计应用时就能避免很多错误。比如你理解了 token 计费逻辑就不会在系统里疯狂堆 Prompt 的长度而会去想真正有效的信息是什么。7. 用 AI 编程提升学习效率AI 是你的陪练教练在学习路径的每个阶段你手上其实都已经有一个隐形的帮手了那就是 AI 编程工具。过去一年 AI 编程工具的进步非常快已经不只是补全代码那么简单而是真的能帮你实现一个完整的小功能。7.1 常用工具对比我自己常用的工具和场景如下供你参考Cursor集成度极高的 AI 编程 IDE适合做完整项目。它能在整个工程里做上下文检索你可以直接对它说“帮我找到计算价格的函数并在这个基础上加一个折扣逻辑”它会自己定位文件并修改合适的位置。GitHub Copilot老牌的王牌补全工具最适合“即在即得”的场景尤其适合写重复性强、模板化的代码。通义灵码免费且对国内模型优化好速度和中文理解都不错用 PyCharm 或者 VS Code 都能装。windsurf原名 Codeium在 Copilot 之外也常被推荐编辑体验和上下文理解不错。从学习视角看我建议你直接选一个 AI 编程工具当成日常主力。它的即时反馈比任何教程都来得直观你有不懂的语法直接问它报错看不懂直接复制给它它会帮你解释并给出修改建议。心得用 AI 编程工具学习最忌讳的是全程无脑复制。我的规矩是AI 生成的代码我一定要在本地跑一遍并且把跑出来的输出逐行理解一遍再接下一条指令。AI 帮你提速可以替代你思考不行。很多 AI “很厉害”的初学者只是靠复制粘贴堆积功能一旦报错就彻底傻眼就是训练时少了理解这个环节。7.2 AI 产品经理视角如何用 AI 辅助需求分析如果你是产品经理或者带团队现在也需要懂 AI 工具流。这类同学的核心技能不是写代码而是能用 AI 把产品需求快速原型化。我见过不少厉害的产品经理用 AI 把竞品分析、用户反馈聚类、需求优先级评估全流程自动化处理需要人判断的只剩决策本身。在 AI 辅助专利申请这种场景里同样如此你借助 AI 快速生成技术交底书的第一稿再用专业能力去润色、补充实施例和保护范围。AI 是一个效率放大器永远不能代替人对业务的理解。8. 零基础到入行各阶段学习时间线和避坑清单很多新手还关心一个问题我到底要学多久才能上手。我按每天投入约 2 小时的节奏分阶段给大家一个粗略的时间线参考8.1 时间线参考第一阶段Python API 调用第 1 到 2 个月目标会写 Python 脚本能成功调用一家大模型 API能自己封装一个简单的“聊天机器人”脚本。产出一个能用命令行对话的小工具。第二阶段RAG 基础应用第 3 到 4 个月目标能对本地文档做检索问答。产出带简单 Web 界面的“文档问答机器人”把简历背景拍进去就是项目经验。第三阶段Agent 项目实战第 5 到 6 个月目标能做一个多步骤自动执行的 Agent比如自动采集信息并生成报告。产出写技术博客记录过程和踩坑点这是最好的面试材料。第四阶段按需深入第 7 个月以后看你想走算法工程、AI Infra、还是内容创作、产品管理方向再对应的去补专项。8.2 避坑清单我把这几年看过的坑集中整理成一个清单你可以拿去对照不要花三个月死磕数学再开始写代码。正确的姿势是先做项目遇到不懂的数学概念再回头补。不要上来就学各种 Agent 框架。如果你不理解底层原理框架版本一升级你辛苦学的 API 就全废了。不要拿公司真实数据直接传给外部 API。注意合规边界真实项目中要优先考虑私有化方案。不要掉进“换模型焦虑”今天想用 GPT 明天想换 Claude 后天想换国产导致一个项目都没做完。选定一家跑通全流程远比到处尝试更有价值。不要只看教程不写代码。看十小时教程不如动手写一个会报错的小脚本。不要迷信云端 GPU。前期学习根本不需要买显卡或者租服务器本地调用 API 足够用了。8.3 日报式学习法最后分享一个我实践过很好用的技巧我管它叫“日报式学习法”每天学完以后把自己今天做的事情和踩过的坑写成几行文字丢给 AI 让它帮你整理成带知识点标签的日报。周末再把这七天的日报拿给 AI让它帮你总结一下薄弱环节并输出下周学习建议。这样做有两个好处一是每天有积累一周的成长肉眼可见二是 AI 会根据你的输出自动推荐复习内容。同时这个日报本身就是之后写简历、写博客的现成素材。9. 最后想说的一些话学了 AI 不是终点用 AI 做出东西才是。我个人在实际带人的过程中最深的一个感受是能坚持走完这条路径的人靠的从来不是多聪明而是持续动手的惯性。今天调通一个 API明天写出一个完整的 RAG 闭环半年下来回头看你已经比绝大多数停留在“想学但没开始”的人领先了太远。等你能用 RAG 搭出知识库助手、让 Agent 帮你完成一次多步任务、给 AI 短剧跑完一整条生产流程之后你自然会知道下一步要学什么。到那时候你该问自己的就是一开始那个问题反过来的版本你已经知道 AI 能为你做什么了接下来你想让它帮你做成什么。
返回列表
PREV
查看更多资讯
NEXT
返回资讯列表