吴师兄大模型训练营 · S5 · 2026 · 10 周核心路线
吴师兄大模型训练营
LeetCodeAnimation 作者吴师兄主讲,适合会 Python、愿意真正动手的校招与社招开发者
不只把 LangChain Demo 跑起来,也不只看一遍模型训练脚本。从 Agent 源码、Post-Train 实验到测试、观测与部署演练,沿着一条主线把代码、实验和工程取舍真正串起来。
报名一次,课程内容两年都能回看
不用赶进度,也不是买完就丢给你自己:视频留足两年,前半年有人跟进
课程内容访问两年
已开放的课程视频、笔记和课程代码,可以在内容访问期内按自己的节奏回看。
半年答疑与助教跟进
把高频互动集中在一轮完整学习和项目推进阶段,遇到卡点有人一起定位。
2 次 1V1 复盘
先排学习顺序,再按实际进度复盘项目表达、简历或模拟面试问题。
先自测:这 5 道你能答几道
不用被题目吓住,先用它判断自己到底卡在模型、Agent,还是工程这一层
这些卡点,是不是你
真正难的往往不是没看过,而是学过的东西始终没有连成一条能交付的线
Demo 跑起来了,一追问就散
只做了主流程,说不清数据、评测、异常恢复和工程取舍。
学过很多词,但串不成一条线
RAG、Agent、微调和部署都碰过,但不知道先做什么、怎么验收。
简历写了一页,自己却讲不深
面试追问一到「为什么这么选」和「失败过什么」,就只剩下技术名词。
双非、转行、跨专业,学历够不够?
学历会影响一部分筛选,但你仍然可以把项目证据、基础能力和表达准备得更扎实
双非 / 非科班
学历会影响部分岗位的筛选,但项目证据、基础能力和表达同样需要准备。课程重点是让你把自己的职责、实验和取舍讲清楚。
Java / 后端 / 测试转行
已有的接口、数据库、部署和排障经验可以迁移到大模型应用;还需要补齐检索、Agent、评测与模型训练等环节。
跨专业 / 科研背景
可以从已有研究或业务问题出发寻找交叉点,但不能把无关经历硬改成大模型项目。1V1 会先核对事实,再决定保留、弱化或补实验。
第一次 1V1 会先看你的基础、目标岗位和可用时间,再一起排学习顺序。不硬改经历,也不套统一模板,先把你真正做过的事情讲清楚。
为什么现在值得把大模型能力补上
不是让你把已有技术栈推倒重来,而是把工程底子叠上一层新的项目能力
校招 · 应届 / 在校
与其在简历里堆很多同质化 Demo,不如完整做一个项目,把需求、选型、评测、失败和改进讲透。 面试时能展示的不只是结果,还有你的判断过程。
社招 · 在职 / 转岗
接口、数据库、部署和排障经验都可以迁移到大模型应用。 需要补的,是检索、Agent、评测与模型训练如何和原有工程能力连起来。
方向会变,岗位要求也会变。真正能留下来的,是你把一个复杂问题拆开、实现、验证并复盘的能力。
现在求职,关键是一个「讲得透」的完整项目
项目不是把页面跑出来就结束,而是你能说明为什么这么做、失败过什么、最后怎么验证
S4 → S5:三个根本升级
从 Agent 工程继续往下走,把模型实验和完整工程链路一起补上
① 模型基座层
从「一键训练现成数据集」继续学习 Post-Train:verl HybridFlow 框架、Agentic RL 范式与 SFT / Curriculum / RL 的实验链路。
② 集群级 Agent
ClaudeCode 单体 Agent + OpenClaw 集群:Gateway / Harness / Subagent / 多类沙箱 / 四帧协议,从单个 Agent 走到「一支 Agent 军团」。
③ 端到端业务
把前面模块整合成一个可运行、可测试、可观测的智能协作助手,覆盖容器化与部署演练。
为什么模型和工程都得会
大模型应用不是单独的一次调参,也不是单独的一套接口。 需要理解模型行为,也要把服务、测试、监控和部署接起来。
偏模型
会跑训练和调参,但还需要补接口、状态、测试、监控与服务化
偏工程
会搭服务和排障,但还需要理解数据、评测与模型行为的变化
模型 × 工程
能把 Agent、Post-Train 与工程基建串成一条可运行、可测试、可复盘的学习链路
系列演进
10 周路线 · 每周详解
Agent 工程 → Post-Train → 工程基建 → 多模态 / GUI → 平台整合
W1–W3 · 把 Agent 做深
从 Skill、Tools、Memory 到多 Agent 协作,把「调一个 API」变成能解释的运行机制。
W4–W7 · 把 Post-Train 做透
连起 verl、SFT、Curriculum 和 GRPO 实验,理解数据、损失、评估和反馈如何影响结果。
W8–W10 · 把工程做完
补齐服务化、测试、可观测、多模态与部署演练,最后整合成一个完整系统。
Agent Skill 体系
8 章 · 30+ 交互模块
- SkillRegistry / @skill 装饰器 / tool_schema 自动转换
- 4 级 Skill 实现 · 子进程沙箱 · ReAct 循环
- 交付:自建一套 Skill 系统;面试讲清 Skill vs Tool vs Function Call
ClaudeCode 架构
7 章:架构 / QueryLoop / Tools / Memory / Runtime / Agent Teams / 终极地图
- 消息三层结构(UI · API · Provider)
- Memory 三步:抽取 · 存储 · 注入;Subagent 协作 SpawnParams · RunRecord
- 交付:自己实现 QueryLoop + Tools + Memory + Agent Teams
OpenClaw 集群
- Gateway 控制面:把「五不同」翻译成「全相同」;四帧协议 user_msg / tool_call / tool_result / final_answer
- 4 类沙箱:subprocess(轻)→ Docker(中)→ microVM(重)→ wasm(按需)
- WebSocket 异步通信;Harness 工作流:接收 → 调度 → 改写
verl HybridFlow 训练框架
- 七层调用链:entrypoint → driver → TaskRunner → Trainer → WorkerGroup → Worker → Engine
- 结合任务约束比较 verl 与 TRL;理解 3D-HybridEngine 的训练/推理资源切换
- 附:TokenPacking / RemovePadding / 多 Rollout 后端(vLLM / SGLang / TRT-LLM)
Agentic RL 范式
- 三不变防崩溃:轨迹、奖励、概率
- 异步 Rollout:分桶 / 探测 / 池化 / 预算重分配,记录实际实验口径
- Memory 五通道:session / episodic / semantic / procedural / profile,各自设置 TTL 与写权限
SFT + Curriculum 闭环
- SFT 冷启动数据生成 + loss_mask 实现
- 课程学习:难度梯度,为什么「只有低难度」不能直接跳 RL
- 三工厂:数据 → 训练 → 评估 → 反馈闭环(Post-Train OS)
GRPO / GSPO / DAPO 自进化
- Qwen + verl 复现 GRPO
- 同一业务场景下对比 DPO vs GRPO vs GSPO vs DAPO
- 自进化 Agent 闭环:环境 → 轨迹 → 训练 → 部署 → 数据回灌
工程基建 · 6 章闯关
- 新手村:HTTP/REST · 异步 IO · 项目结构 → 沼泽:asyncio · 消息队列 · 缓存 · 数据库
- 工厂区:Docker / Compose / 多阶段构建 / 编排 → 高原:负载均衡 · 限流 · 熔断 · 灰度
- 云端:K8s · 日志 · 指标 · 链路 → BOSS 战:全量推理(vLLM 集群)+ Agent Runtime + Gateway 整合
- 可观测三件套:Prometheus · Jaeger · Loki,结合日志、指标和链路定位故障
多模态 RAG + GUI Agent
- 跨模态 Embedding(CLIP / SigLIP)
- Vision Grounding:bbox + 语义对齐,让模型「看懂」界面
- GUI ReAct 循环:截图 → 理解 → 决策 → 操作 → 反馈;浏览器自动化 + GUI 操作 SFT 数据生成
企业级平台整合(毕业项目)
- 把前 9 周整合成可运行、可测试、可观测的智能协作助手,并完成容器化与部署演练
毕业项目 · 企业智能协作助手
把前 9 周的能力整合成一个可运行、可测试、可观测的系统,并完成部署演练
目标架构覆盖多端接入、Agent 协作、技能系统、Post-Train 与可观测。 实际能写进简历的内容,以你本人完成的代码和实验记录为准。
技术栈索引 · 11 层
不用一次记住所有名词,沿着 10 周主线逐层动手
- Agent 应用:Skill 抽象 · ReAct · @skill
- Agent 工程:QueryLoop · Tools · Memory · Runtime · Teams
- Agent 集群:Gateway · WebSocket · 沙箱 · 协议
- RL 框架:verl · Ray · DataProto · 3D-HybridEngine
- RL 算法:PPO · DPO · GRPO · GSPO · DAPO
- Post-Train 闭环:SFT · Curriculum · 三工厂
- Agentic RL 范式:三不变 · 异步 Rollout · 五通道 Memory
- 训练基建:FSDP · TokenPacking · 多 Rollout 后端
- 工程:Docker · FastAPI · K8s · 可观测
- 多模态 / GUI:CLIP · Grounding · GUI ReAct
- 项目整合:平台集成、测试与部署演练
先看公开内容,再判断讲解是否适合你
不用只听销售介绍,下面这些内容都能直接打开
提供什么,你买的是服务,不只是视频
视频负责讲清楚,项目、答疑和复盘负责把学习过程真正推进下去
S5 核心路线
10 周从 Agent、Post-Train 到工程整合,每一段都对应实际产物。
30+ 周视频内容
包含 S2–S5 课程、配套笔记和课程代码,内容访问期两年。
2 次 1V1
第一次核对目标与学习顺序;第二次按阶段复盘项目表达、简历或模拟面试。
半年答疑带练
专属答疑群与助教跟进,用来定位实验、项目和学习节奏里的卡点。
课程实验算力
24GB 显存 RTX 4090,用于课程安排内的训练与实验。
题库与求职复盘
用项目题、面经和回答框架检查你能不能把自己做过的事讲清楚。
第一次 1V1
核对基础、目标岗位和时间,先把学习顺序排对。
学习与项目推进
用答疑和助教跟进处理代码、实验与项目卡点。
第二次 1V1
根据进度复盘项目表达、简历或模拟面试问题。
当期开放模块、更新范围、算力使用和 1V1 预约规则,以报名时的订单或书面说明为准。
先听 3 节课,自己感受下
不用先报名。先听方向、简历和就业市场,再判断讲解方式是不是你想要的
适合 / 暂不适合
先看自己的基础和时间是否匹配,别因为焦虑仓促报名
更适合你,如果你
- 会写 Python、会用命令行,有基本开发能力
- 准备往大模型应用开发、Agent 或 Post-Train 方向继续深入
- 愿意亲手写代码、跑实验、记录失败和重做
- 需要一条清晰主线,把零散能力串成完整项目
现在先别报,如果你
- 目前完全没有编程基础,还不会 Python 和命令行
- 只想拿到资料、代码或简历文案,不准备自己动手
- 暂时没有稳定学习时间,很难连续完成实验和项目
- 希望一门课直接换来面试、录用或薪资结果
报名后,先把你的学习路线定下来
不是买完课自己摸索,先把目标、基础和时间说清楚,再排学习顺序
按预约规则安排
报名后根据当期可预约时间,和老师一对一聊清你的情况
分析你的背景
校招 / 社招、基础、目标岗位与时间节点,逐一摸清
定制学习路线
给一份贴合你的路线再开始学,过程中按进度持续微调
报名前,常被问到的几个问题
把大家最关心的基础、学习方式、服务期和结果边界一次说清楚
零基础或转行能学吗?
转行可以,完全零编程基础暂不建议。至少需要会写 Python、能用命令行,并愿意自己调试代码。拿不准可以先发一下你的背景,我会直接告诉你该先补什么。
是视频课,还是文档自学?
课程以录播讲解为主,同时有配套笔记、课程代码和项目练习。页面上的 3 节试听和 2 个回放可以直接打开,先听讲解方式,再决定要不要继续了解。
在职很忙,能跟上吗?
录播可以自主安排,但项目不可能只靠碎片时间做完。报名前建议先用一周试听和做练习,确认自己能留出稳定时间;答疑和 1V1 能帮你排顺序,但不能代替投入。
课程和服务可以用多久?
课程内容访问期两年;答疑、助教跟进和 2 次 1V1 属于人工服务,服务期为报名后半年。可访问的更新范围和当期开放模块,报名时会一起确认。
2 次 1V1 分别做什么?
第一次主要核对你的基础、目标岗位和学习顺序;第二次根据当时进度,用于项目表达、简历或模拟面试复盘。具体预约和改期规则会在报名前说清楚。
学完一定能找到工作吗?
不能保证。求职结果还会受到基础、投入、岗位和面试表现影响。训练营能做的,是帮你排好学习顺序、把项目做完,并用自己真正完成的代码和实验准备面试表达。
价格和权益怎么确认?
当前页面价格是 8999 元。报名时会再确认当期开放模块、课程与人工服务期、算力范围、1V1 预约方式,以及订单、发票和退款规则,确认清楚再付款。
报名前先试听,再聊你是否适合
如果你会 Python 或已经有开发基础,但卡在项目做不深、技术讲不清,可以把背景、目标岗位和可用时间发给我。先判断路线是否匹配,再给你正式项目试听地址,觉得合适再报名。
微信 278166530