跳到正文

吴师兄大模型训练营 · S5 · 2026 · 10 周核心路线

吴师兄大模型训练营

LeetCodeAnimation 作者吴师兄主讲,适合会 Python、愿意真正动手的校招与社招开发者

10 周把一条完整项目链路做出来30+ 周视频与往期内容2 次 1V1半年答疑与助教跟进
先听 3 节试听课看 10 周路线

不只把 LangChain Demo 跑起来,也不只看一遍模型训练脚本。从 Agent 源码、Post-Train 实验到测试、观测与部署演练,沿着一条主线把代码、实验和工程取舍真正串起来。

10 周
S5 核心路线
30+ 周
视频与往期内容
2 次
1V1 学习与求职复盘
半年
答疑与助教跟进

这次不再停在「听懂了」

不是再收藏一套资料,而是把项目真正做完整

一条能经得住追问的项目链路,至少要做到能运行、能评测、能恢复、能部署、能讲清。训练营会把这些环节拆开练,再在毕业项目里重新接起来。

能运行能评测能恢复能部署能讲清

方向说明:课程聚焦大模型应用落地。你会同时接触 Agent、Post-Train 与工程基建,但简历里只能写自己真正完成、能够复现的部分。

报名一次,课程内容两年都能回看

不用赶进度,也不是买完就丢给你自己:视频留足两年,前半年有人跟进

课程内容访问两年

已开放的课程视频、笔记和课程代码,可以在内容访问期内按自己的节奏回看。

半年答疑与助教跟进

把高频互动集中在一轮完整学习和项目推进阶段,遇到卡点有人一起定位。

2 次 1V1 复盘

先排学习顺序,再按实际进度复盘项目表达、简历或模拟面试问题。

先自测:这 5 道你能答几道

不用被题目吓住,先用它判断自己到底卡在模型、Agent,还是工程这一层

1verl 双节点 4 卡和 TRL 的本质区别在哪?3D-HybridEngine 怎么做到训练/推理同卡切换?
2把 GRPO 的损失公式分 5 步推一遍;loss_mask 是怎么套在一条轨迹上的?
3Agent Swarm 的 Gateway 怎么把「五花八门的请求」翻译成「统一格式」?四帧协议是哪四帧?
4SFT 冷启动数据怎么造?为什么「只有低难度的课程」不能直接跳到 RL?
5ClaudeCode 的 Memory 怎么抽取、什么时机触发、又怎么注入回对话?

这些卡点,是不是你

真正难的往往不是没看过,而是学过的东西始终没有连成一条能交付的线

Demo 跑起来了,一追问就散

只做了主流程,说不清数据、评测、异常恢复和工程取舍。

学过很多词,但串不成一条线

RAG、Agent、微调和部署都碰过,但不知道先做什么、怎么验收。

简历写了一页,自己却讲不深

面试追问一到「为什么这么选」和「失败过什么」,就只剩下技术名词。

双非、转行、跨专业,学历够不够?

学历会影响一部分筛选,但你仍然可以把项目证据、基础能力和表达准备得更扎实

双非 / 非科班

学历会影响部分岗位的筛选,但项目证据、基础能力和表达同样需要准备。课程重点是让你把自己的职责、实验和取舍讲清楚。

Java / 后端 / 测试转行

已有的接口、数据库、部署和排障经验可以迁移到大模型应用;还需要补齐检索、Agent、评测与模型训练等环节。

跨专业 / 科研背景

可以从已有研究或业务问题出发寻找交叉点,但不能把无关经历硬改成大模型项目。1V1 会先核对事实,再决定保留、弱化或补实验。

第一次 1V1 会先看你的基础、目标岗位和可用时间,再一起排学习顺序。不硬改经历,也不套统一模板,先把你真正做过的事情讲清楚。

为什么现在值得把大模型能力补上

不是让你把已有技术栈推倒重来,而是把工程底子叠上一层新的项目能力

校招 · 应届 / 在校

与其在简历里堆很多同质化 Demo,不如完整做一个项目,把需求、选型、评测、失败和改进讲透。 面试时能展示的不只是结果,还有你的判断过程。

社招 · 在职 / 转岗

接口、数据库、部署和排障经验都可以迁移到大模型应用。 需要补的,是检索、Agent、评测与模型训练如何和原有工程能力连起来。

方向会变,岗位要求也会变。真正能留下来的,是你把一个复杂问题拆开、实现、验证并复盘的能力。

现在求职,关键是一个「讲得透」的完整项目

项目不是把页面跑出来就结束,而是你能说明为什么这么做、失败过什么、最后怎么验证

对比维度
只把 Demo 跑起来
把项目真正做完整
需求
拿到教程后照着复刻
先讲清问题、边界和验收方式
实现
主流程能跑就停下
补齐状态、超时、重试和降级
评测
凭感觉判断效果
留下数据、基线、bad case 和实验记录
工程
只在本地演示
完成测试、观测和部署演练
表达
背一段项目介绍
只讲本人做过并能复现的部分

S4 → S5:三个根本升级

从 Agent 工程继续往下走,把模型实验和完整工程链路一起补上

① 模型基座层

从「一键训练现成数据集」继续学习 Post-Train:verl HybridFlow 框架、Agentic RL 范式与 SFT / Curriculum / RL 的实验链路。

② 集群级 Agent

ClaudeCode 单体 Agent + OpenClaw 集群:Gateway / Harness / Subagent / 多类沙箱 / 四帧协议,从单个 Agent 走到「一支 Agent 军团」。

③ 端到端业务

把前面模块整合成一个可运行、可测试、可观测的智能协作助手,覆盖容器化与部署演练。

为什么模型和工程都得会

大模型应用不是单独的一次调参,也不是单独的一套接口。 需要理解模型行为,也要把服务、测试、监控和部署接起来。

偏模型

会跑训练和调参,但还需要补接口、状态、测试、监控与服务化

偏工程

会搭服务和排障,但还需要理解数据、评测与模型行为的变化

模型 × 工程

能把 Agent、Post-Train 与工程基建串成一条可运行、可测试、可复盘的学习链路

系列演进

S2 · 2024 H2算法体系打底14 周,系统补齐基础
S3 · 2024 秋求职急救6 周,冲刺找工作
S4 · 2025 春Agent 工程6 周,工程化落地
S5 · 2026模型 + 工程双轨10 周,本期

10 周路线 · 每周详解

Agent 工程 → Post-Train → 工程基建 → 多模态 / GUI → 平台整合

W1–W3 · 把 Agent 做深

从 Skill、Tools、Memory 到多 Agent 协作,把「调一个 API」变成能解释的运行机制。

W4–W7 · 把 Post-Train 做透

连起 verl、SFT、Curriculum 和 GRPO 实验,理解数据、损失、评估和反馈如何影响结果。

W8–W10 · 把工程做完

补齐服务化、测试、可观测、多模态与部署演练,最后整合成一个完整系统。

W1

Agent Skill 体系

8 章 · 30+ 交互模块

  • SkillRegistry / @skill 装饰器 / tool_schema 自动转换
  • 4 级 Skill 实现 · 子进程沙箱 · ReAct 循环
  • 交付:自建一套 Skill 系统;面试讲清 Skill vs Tool vs Function Call
W2

ClaudeCode 架构

7 章:架构 / QueryLoop / Tools / Memory / Runtime / Agent Teams / 终极地图

  • 消息三层结构(UI · API · Provider)
  • Memory 三步:抽取 · 存储 · 注入;Subagent 协作 SpawnParams · RunRecord
  • 交付:自己实现 QueryLoop + Tools + Memory + Agent Teams
W3

OpenClaw 集群

  • Gateway 控制面:把「五不同」翻译成「全相同」;四帧协议 user_msg / tool_call / tool_result / final_answer
  • 4 类沙箱:subprocess(轻)→ Docker(中)→ microVM(重)→ wasm(按需)
  • WebSocket 异步通信;Harness 工作流:接收 → 调度 → 改写
W4

verl HybridFlow 训练框架

  • 七层调用链:entrypoint → driver → TaskRunner → Trainer → WorkerGroup → Worker → Engine
  • 结合任务约束比较 verl 与 TRL;理解 3D-HybridEngine 的训练/推理资源切换
  • 附:TokenPacking / RemovePadding / 多 Rollout 后端(vLLM / SGLang / TRT-LLM)
W5

Agentic RL 范式

  • 三不变防崩溃:轨迹、奖励、概率
  • 异步 Rollout:分桶 / 探测 / 池化 / 预算重分配,记录实际实验口径
  • Memory 五通道:session / episodic / semantic / procedural / profile,各自设置 TTL 与写权限
W6

SFT + Curriculum 闭环

  • SFT 冷启动数据生成 + loss_mask 实现
  • 课程学习:难度梯度,为什么「只有低难度」不能直接跳 RL
  • 三工厂:数据 → 训练 → 评估 → 反馈闭环(Post-Train OS)
W7

GRPO / GSPO / DAPO 自进化

  • Qwen + verl 复现 GRPO
  • 同一业务场景下对比 DPO vs GRPO vs GSPO vs DAPO
  • 自进化 Agent 闭环:环境 → 轨迹 → 训练 → 部署 → 数据回灌
W8

工程基建 · 6 章闯关

  • 新手村:HTTP/REST · 异步 IO · 项目结构 → 沼泽:asyncio · 消息队列 · 缓存 · 数据库
  • 工厂区:Docker / Compose / 多阶段构建 / 编排 → 高原:负载均衡 · 限流 · 熔断 · 灰度
  • 云端:K8s · 日志 · 指标 · 链路 → BOSS 战:全量推理(vLLM 集群)+ Agent Runtime + Gateway 整合
  • 可观测三件套:Prometheus · Jaeger · Loki,结合日志、指标和链路定位故障
W9

多模态 RAG + GUI Agent

  • 跨模态 Embedding(CLIP / SigLIP)
  • Vision Grounding:bbox + 语义对齐,让模型「看懂」界面
  • GUI ReAct 循环:截图 → 理解 → 决策 → 操作 → 反馈;浏览器自动化 + GUI 操作 SFT 数据生成
W10

企业级平台整合(毕业项目)

  • 把前 9 周整合成可运行、可测试、可观测的智能协作助手,并完成容器化与部署演练

毕业项目 · 企业智能协作助手

把前 9 周的能力整合成一个可运行、可测试、可观测的系统,并完成部署演练

渠道层飞书 / Web / 移动 / 开放 API / 语音 —— 5 适配器 + 定时任务
网关WAF · 鉴权 / RBAC · 限流 · 消息路由 · 审计
Agent 集群总调度官 + 4 个专家 Agent(RAG / Text2SQL / SOP / 文档生成)
技能系统20+ 注册技能 · @skill 装饰器 · 版本管理
存储PostgreSQL · Milvus · Elasticsearch · Redis · MinIO/S3 · Neo4j(可选)
Post-Train 平台数据 / 训练 / 评估三工厂 + 自进化闭环
可观测Prometheus · OpenTelemetry · Loki · Jaeger

目标架构覆盖多端接入、Agent 协作、技能系统、Post-Train 与可观测。 实际能写进简历的内容,以你本人完成的代码和实验记录为准。

技术栈索引 · 11 层

不用一次记住所有名词,沿着 10 周主线逐层动手

  • Agent 应用:Skill 抽象 · ReAct · @skill
  • Agent 工程:QueryLoop · Tools · Memory · Runtime · Teams
  • Agent 集群:Gateway · WebSocket · 沙箱 · 协议
  • RL 框架:verl · Ray · DataProto · 3D-HybridEngine
  • RL 算法:PPO · DPO · GRPO · GSPO · DAPO
  • Post-Train 闭环:SFT · Curriculum · 三工厂
  • Agentic RL 范式:三不变 · 异步 Rollout · 五通道 Memory
  • 训练基建:FSDP · TokenPacking · 多 Rollout 后端
  • 工程:Docker · FastAPI · K8s · 可观测
  • 多模态 / GUI:CLIP · Grounding · GUI ReAct
  • 项目整合:平台集成、测试与部署演练

先看公开内容,再判断讲解是否适合你

不用只听销售介绍,下面这些内容都能直接打开

提供什么,你买的是服务,不只是视频

视频负责讲清楚,项目、答疑和复盘负责把学习过程真正推进下去

当前价格

¥8999

包含 10 周 S5 核心路线、30+ 周视频与往期内容、半年答疑与助教跟进、2 次 1V1、课程实验算力和配套题库。

S5 核心路线

10 周从 Agent、Post-Train 到工程整合,每一段都对应实际产物。

30+ 周视频内容

包含 S2–S5 课程、配套笔记和课程代码,内容访问期两年。

2 次 1V1

第一次核对目标与学习顺序;第二次按阶段复盘项目表达、简历或模拟面试。

半年答疑带练

专属答疑群与助教跟进,用来定位实验、项目和学习节奏里的卡点。

课程实验算力

24GB 显存 RTX 4090,用于课程安排内的训练与实验。

题库与求职复盘

用项目题、面经和回答框架检查你能不能把自己做过的事讲清楚。

1

第一次 1V1

核对基础、目标岗位和时间,先把学习顺序排对。

2

学习与项目推进

用答疑和助教跟进处理代码、实验与项目卡点。

3

第二次 1V1

根据进度复盘项目表达、简历或模拟面试问题。

当期开放模块、更新范围、算力使用和 1V1 预约规则,以报名时的订单或书面说明为准。

先听 3 节课,自己感受下

不用先报名。先听方向、简历和就业市场,再判断讲解方式是不是你想要的

适合 / 暂不适合

先看自己的基础和时间是否匹配,别因为焦虑仓促报名

更适合你,如果你

  • 会写 Python、会用命令行,有基本开发能力
  • 准备往大模型应用开发、Agent 或 Post-Train 方向继续深入
  • 愿意亲手写代码、跑实验、记录失败和重做
  • 需要一条清晰主线,把零散能力串成完整项目

现在先别报,如果你

  • 目前完全没有编程基础,还不会 Python 和命令行
  • 只想拿到资料、代码或简历文案,不准备自己动手
  • 暂时没有稳定学习时间,很难连续完成实验和项目
  • 希望一门课直接换来面试、录用或薪资结果

报名后,先把你的学习路线定下来

不是买完课自己摸索,先把目标、基础和时间说清楚,再排学习顺序

1

按预约规则安排

报名后根据当期可预约时间,和老师一对一聊清你的情况

2

分析你的背景

校招 / 社招、基础、目标岗位与时间节点,逐一摸清

3

定制学习路线

给一份贴合你的路线再开始学,过程中按进度持续微调

报名前,常被问到的几个问题

把大家最关心的基础、学习方式、服务期和结果边界一次说清楚

零基础或转行能学吗?

转行可以,完全零编程基础暂不建议。至少需要会写 Python、能用命令行,并愿意自己调试代码。拿不准可以先发一下你的背景,我会直接告诉你该先补什么。

是视频课,还是文档自学?

课程以录播讲解为主,同时有配套笔记、课程代码和项目练习。页面上的 3 节试听和 2 个回放可以直接打开,先听讲解方式,再决定要不要继续了解。

在职很忙,能跟上吗?

录播可以自主安排,但项目不可能只靠碎片时间做完。报名前建议先用一周试听和做练习,确认自己能留出稳定时间;答疑和 1V1 能帮你排顺序,但不能代替投入。

课程和服务可以用多久?

课程内容访问期两年;答疑、助教跟进和 2 次 1V1 属于人工服务,服务期为报名后半年。可访问的更新范围和当期开放模块,报名时会一起确认。

2 次 1V1 分别做什么?

第一次主要核对你的基础、目标岗位和学习顺序;第二次根据当时进度,用于项目表达、简历或模拟面试复盘。具体预约和改期规则会在报名前说清楚。

学完一定能找到工作吗?

不能保证。求职结果还会受到基础、投入、岗位和面试表现影响。训练营能做的,是帮你排好学习顺序、把项目做完,并用自己真正完成的代码和实验准备面试表达。

价格和权益怎么确认?

当前页面价格是 8999 元。报名时会再确认当期开放模块、课程与人工服务期、算力范围、1V1 预约方式,以及订单、发票和退款规则,确认清楚再付款。

报名前先试听,再聊你是否适合

如果你会 Python 或已经有开发基础,但卡在项目做不深、技术讲不清,可以把背景、目标岗位和可用时间发给我。先判断路线是否匹配,再给你正式项目试听地址,觉得合适再报名。

微信 278166530