返回 OpenClaw 专栏
AIDevelopment · TECH // GUIDE

AI Engineering from Scratch 学习路线:523 节 AI 工程课程怎么学?Python、LLM、RAG 与项目实战需要什么配置?

2026.09.30 · 约 12 分钟阅读

这篇文章面向已有 Python 基础、转向 AI 应用开发,或希望用项目建立作品集的学习者。核心建议是按目标和先修能力选课程入口,再用可复现的项目成果验收;代码练习优先本地完成,只有实验依赖或资源实际受限时才考虑远程环境。

AI Engineering from Scratch 学习路线:523 节 AI 工程课程怎么学?Python、LLM、RAG 与项目实战需要什么配置?

AI Engineering from Scratch 学习路线的更优选择,是按已有基础和目标项目挑选入口,而不是把全部课程节数当成必须依次打卡的清单。如果你已经会 Python,就从目标对应的 LLM、Agent 或应用工程内容切入;如果编程和数学基础尚不牢,就先补会影响后续实验的部分。基础算法与代码练习先用本地环境,只有课程实验确实涉及模型运行、训练或生产部署时,才按实验依赖评估云端资源。

适合已有 Python 基础、准备进入 LLM 工程的开发者:对照目录挑选起点,不必重复熟悉的编程内容。
适合零基础学习者:先检查先修能力,再决定从基础部分开始还是补个别知识点。
适合要做作品集的工程师:重点看能否交付可运行、可解释、可复现的项目,而非课程完成比例。

先按自己的基础选入口,而非从头刷完

截至 2026 年 9 月 30 日核对,课程官方仓库介绍了由数学基础、机器学习、深度学习、Transformer、LLM 工程到 Agent 工程等内容构成的学习路径;目录列出 523 节课、20 个阶段。官方页面也为不同目标提供了不同入口,例如已有 Python、想做生产级 LLM 应用、想构建 Agent 的学习者,并不都从同一阶段开始。官方发布记录显示,2026 年 9 月 27 日发布的 Edition 2026.10 仍为 523 节课、20 个阶段。目录可能随版本更新,制定计划前应重新核对课程官方仓库、官方学习路径和版本发布记录。

这些数字说明课程覆盖面,不代表每个人都要投入同样顺序和时长,也不能直接换算成就业能力。目录体现出一条依赖关系:机器学习和深度学习基础位于 Transformer、LLM 及后续应用主题之前。已有开发经验的人可以跳过已掌握的内容;但如果无法解释向量运算、模型训练与评估的基本逻辑,直接做应用时遇到检索结果差、输出难以评估等问题,就可能缺少定位问题所需的概念工具。

课程目录中的 523 节内容是否都要按顺序完成:不必。课程的学习说明支持按目标选择入口;实用做法是先对照目录,标出已能独立解释和复现的内容,再学习会阻碍目标项目的知识缺口。跳过一个模块前,先用小练习验证自己确实掌握了它,而不是仅凭“以前用过这个库”判断。

⚠️ 课程目录会更新,课程节数和阶段应以核对时的官方版本为准;这里的节数用于描述当前目录,不是学习者必须完成的最低要求。

零基础先验证编程与数学前置能力

如果还不能独立读写函数、处理列表和字典、读懂报错并运行小程序,直接进入 LLM 工程会把学习困难混在一起:分不清问题来自 Python 基础、数据处理,还是模型逻辑。先通过课程的基础编程和数学内容补缺,再进入机器学习与深度学习,会更容易定位错误。Python 官方教程覆盖基本语法、数据结构、控制流程和函数等内容,可用于自查基础;独立的虚拟环境也能避免不同练习的依赖相互干扰,可参照Python 官方教程。

零基础学习者可以先完成以下小练习,再决定是否进入后续阶段:

  • ✅ 写一个函数,对输入文本做清理并统计词频;能解释数据结构选择和边界情况。
  • ✅ 用小数组手算并实现向量点积,能说明输入形状和输出含义。
  • ✅ 把一个简单分类任务拆成数据、训练、预测和评估,并能解释为什么不能只看训练集结果。
  • ✅ 在独立 Python 环境中安装依赖、运行程序,并记录如何复现。

这些练习是学习者的自测办法,不是课程官方认证标准。机器学习阶段可参考 scikit-learn 官方入门文档,检查自己是否能理解数据预处理、模型选择和评估之间的关系。

没有 Python 基础时的学习安排:可以把课程作为学习路线,但“从零开始”不等于无需编程准备。先做小程序并能读懂执行结果,再进入算法与模型实验;如果课程实验依赖尚不熟悉的基础工具,先补足对应能力,避免把复制粘贴误当成掌握。

按目标项目拆出 LLM 与 RAG 路径

LLM 学习路线应从想交付的应用倒推,而不是把 LLM 理论、RAG 和 Agent 当成可互换的标签。若目标是调用模型接口并交付应用,先理解提示设计、输入输出处理、错误处理与基本评估;若目标是本地运行模型或研究模型结构,则再补模型、推理与运行环境相关实验。课程目录把 Transformer、LLM 基础与 LLM 工程分开放置,可先确认相互依赖,再按项目目标取舍。

目标为 RAG 应用时,建议按四个问题推进:

  1. 模型基础:能否解释生成模型接收什么输入、产生什么输出,以及为什么生成结果需要评估?
  2. 数据处理:文档如何清洗、切分、附上来源信息?如何检查更新后的数据有没有进入检索流程?
  3. 检索:返回的片段是否与问题相关,引用是否能回到原文?先用小型、可人工检查的数据集验证。
  4. 应用工程:如何处理检索失败、空结果、超时和错误答案?怎样留存一组固定测试问题来比较改动前后的结果?

RAG 不只是“把向量库接上模型”。相关技术文档将检索文档、把检索内容交给生成模型等环节作为关键组成;具体应用仍要确认模型、文档结构与检索实现是否兼容。可从检索增强生成模型文档理解检索和生成的关系,再做一个能展示输入文档、检索片段、输出答案及来源的最小项目。

进入 LLM 与 RAG 内容的顺序:已有 Python 基础、理解基本机器学习概念,并想先交付 LLM 应用的开发者,可从课程目录标示的 LLM 工程入口起步;想搭建 RAG 的学习者,先做小型检索问答项目,同时补齐自己无法解释的数据处理或检索基础。若目标是理解模型内部机制,再回到 Transformer 与 LLM 基础,而不是只因课程目录靠前就全量重修。

做 Agent 与生产部署时以成果验收

目标是 Agent 或生产部署时,课程目录中的 Agent 工程应与 LLM 工程、工具调用和应用工程一并考虑。会调用工具不等于系统可靠:错误工具参数可能让任务失败,缺乏权限边界可能带来安全隐患,而没有评估记录就难以确认一次修改究竟改善了什么。这里的决策重点不是“学到目录哪一节”,而是能不能拿出完整运行路径和失败处理证据。

为每个项目留下可检查的成果物:

  • ✅ 一份安装及启动说明,标明依赖、运行目录和环境变量处理方式。
  • ✅ 一段成功运行记录,包含输入、关键输出和执行结果。
  • ✅ 一组测试案例,覆盖正常输入、无效输入与工具调用失败。
  • ✅ 一份简短说明,解释 Agent 的可用工具、权限范围、失败回退和已知限制。
  • ✅ 一次从干净环境复现的记录,证明项目不是只能在原作者机器上运行。

把命令、工作目录、退出码和输出等证据一并保存,再将其延伸到作品集,其他人就更容易判断项目是否确实可复现。

用实验类型决定本地环境还是云端

AI 工程课程配置不能从 523 节课这个规模推导出来。课程不同实验需要的资源不同:纯代码或基础算法练习、调用 API、在本地运行模型、执行训练实验,不能按同一套硬件门槛处理。课程仓库给出的起步示例包含 Python 命令和向量运算练习;PyTorch 官方安装页面提供本地与云端安装选择,并说明 macOS 上的体验会因系统和 GPU 能力而异。因此,应以具体实验说明和安装验证为准,不要先假定必须购买独立 GPU。(PyTorch 官方本地安装指南)

学习任务 优先环境 选择依据 常见限制
阅读课程、运行基础 Python 代码 本地电脑 不涉及大型模型时,先确认解释器、依赖和代码能正常运行 依赖版本冲突、磁盘空间或环境未隔离
调用托管模型 API 并开发应用 本地开发环境 重点验证请求、输出处理、错误处理和测试流程 网络可用性、密钥管理和 API 使用成本
本地运行模型或做训练实验 先核对实验依赖,再选本地或远程 比较实验要求与实际可用内存、加速器、存储和运行时 不同模型与实验负载差异大,不能凭课程总量估配
长时间运行或需稳定复现的实验 评估可控的远程环境 适合本地资源不足、需固定环境或需他人复现的情况 远程费用、数据传输、访问权限和实例维护

独立 GPU 不是所有课程项目的前置条件。基础算法代码和 API 应用开发不能仅因属于 AI 课程就推断需要 GPU;涉及本地模型、训练或指定加速器的实验,则应逐项查阅对应实验文件和依赖要求。官方安装指南可用于核对操作系统和计算平台选项,但具体实验是否适合某台机器,仍要看所用模型与任务。

动手前按以下顺序检查:

  1. 打开实验说明,记录模型、数据集、依赖包、启动命令以及是否明确要求加速器。
  2. 先确认本地前置条件,检查 Python 版本、磁盘空间、内存和依赖能否满足;用独立环境安装,避免污染其他项目。可参考 Python 官方虚拟环境说明,为不同项目隔离依赖。
  3. 运行最小样例,先验证安装、输入输出和测试命令,再决定是否需要换硬件。
  4. 记录资源瓶颈,区分是显存不足、内存不足、运行太慢、依赖不兼容,还是下载或网络问题。原因不同,解决方案也不同。
  5. 仅在确有瓶颈时试用远程环境,记录实例类型、运行时限制、费用、数据传输和复现步骤;完成后及时停止不用的资源。
  6. 回到本地复核成果,确认代码、数据说明和运行方式可交接,避免项目只依赖一次性会话。

提醒:托管笔记本环境不一定持续提供固定资源。官方常见问题说明,可用硬件和资源限制可能变化;需要稳定复现时,应把这一点纳入方案,而不是把临时可用的加速器当作固定配置。(托管笔记本环境官方常见问题)

你可把学习进度整理成一个轻量决策清单:

  • ✅ 能独立完成 Python 小程序、安装依赖并定位常见报错:直接进入目标相关模块。
  • ✅ 能解释基本数学或机器学习概念,但项目尚不完整:补齐影响当前项目的基础,再继续应用练习。
  • ⚠️ 只有运行时间较长或指定实验确实受本地资源限制:评估远程资源,并记录总成本和复现条件。
  • ❌ 仅因为课程篇幅长或标注了 AI,就先购买高规格设备:暂缓,先跑通目标实验的最小样例。

用可复现作品调整路线

课程长度不能保证就业结果,也不能单独证明能力。按项目目标设置验收点,才能判断当前路径是否有效;如果一个项目能运行却无法说明数据来源、模型输入、失败处理和评估方法,就应优先补足这些缺口,而不是赶着进入下一个主题。

学习目标 阶段性成果 验收方式
Python 与算法基础 一个能运行并附测试的小型算法实现 解释输入输出,修改一个边界条件后重跑
LLM 应用 一个有明确输入输出和失败处理的应用 展示提示、异常处理与固定测试案例
RAG 应用 一个能展示检索片段与来源的问答项目 检查相关性、引用来源和检索失败回退
Agent 与生产部署 一个带工具边界、测试和部署说明的项目 从干净环境复现,并说明权限和已知限制

开始前可对照课程官方仓库中的目录和学习入口,把“能解释、能运行、能复现”作为继续学习的判断标准。每完成一个项目,再根据失败记录决定下一阶段:如果模型调用可用但检索质量差,先修数据与检索;如果流程能跑通但无法稳定复现,先补环境和测试;如果基础概念解释不清,再回补相关内容。

按实际缺口选择本地或 Mac 环境

如果现有电脑能完成代码练习和 API 应用开发,继续本地学习通常更直接;需要特定实验、稳定远程访问或固定运行环境时,再比较远程方案。远程环境的优势是可按需获取本地没有的资源,但也会增加网络依赖、数据传输、权限管理和费用核对等工作;若实验需要长期稳定重负载,或依赖本地物理接口,临时租用也未必适合。

更稳妥的做法,是先确认实验要求和自己的瓶颈,再判断是否需要远程 Mac。需要了解租用方案的价格信息,可查看 Zutcloud 的 Mac mini 租用价格页面。只有在实验依赖、运行时长或复现要求确实超过本地条件时,才值得进一步评估远程资源,而不是把设备升级当作学习路线的起点。

延伸阅读

从课程清单走向可复现的 AI 项目

先按你的 Python 基础和目标,继续阅读本站的学习路线与技术指南,确定适合自己的课程入口。

开始下一章前,先在本地整理依赖、记录运行步骤,并用一个小练习确认环境可复现。 立即订购

CI/CD

把 iOS CI/CD 落在稳定的 M4 节点上

独享 M4 · 全球节点 · 按月订阅 · OpenClaw 友好镜像

立即订购
Mac 云主机 限时优惠 · 点击查看