大模型优化与智能体应用讲座整理
一场关于大模型优化与智能体应用的技术讲座整理。内容包括 DeepSeek 的五个核心 部件拆解、智能体与人工智能三大主义的关系、多智能体协作架构,以及问答环节中 关于端侧算力、垂域微调策略和自动化科研的讨论。
以下是听讲后按自己的理解重新组织的笔记,不是讲稿原文。为便于阅读做了大量压缩 和重排,讲者的个别口语化举例予以保留。
一、AI 是怎么"学以致用"的
讲者用一个通俗的四步框架描述机器学习的过程,作为后面技术内容的铺垫。
第一步,数字化感知。 人眼看到猫就知道是猫,AI 看到的则是一串数字,每个数 字代表亮度、色彩、纹理、边缘特征,本质是 0/1 串的组合。这些数字难以用结构化 数据描述。
第二步,抽丝剥茧。 神经网络第一层可能只看到边缘特征,仅凭这个无法区分猫和 猫头鹰;第二层能看出耳朵、鼻子、毛发等部位特征;经过不同层次的抽象,最终得出 结论。这些属性就是 features。
第三步,熟能生巧。 讲者这里的说法比较直白:识别过程本质上是"乱猜"。第一次 问是不是猫,答错了给它反馈;第二次再问,可能还是错;反复迭代千次万次,直到猜 对。迭代过程中学到的东西就是模型里的权重——开源大模型最终开源的也正是这些 神经网络权重。AI 并非单纯计算,而是基于概率不断逼近正确预测。
第四步,举一反三。 训练过猫、狗、狐狸之后,模型能够泛化;再进一步可以做生 成式输出,比如根据"宇宙空间中看书的一只狗"生成对应图片。
大模型"大"在哪里
到目前为止大模型没有严格定义,"大"指的是海量的参数量,也就是学习反馈过程 中存储的权重。其优势可归为三点:泛化理解能力(任务间甚至模态间迁移)、复杂推 理和生成能力(一个模型处理多个问题)、调用外部工具和自主拓展的能力——最后一点 与智能体强相关。
预训练加微调的两阶段范式,好处同样是三点:预训练用海量数据和算力换取对通用知 识的理解;通用能力强则迁移起点高,有些任务甚至无需额外训练;前期投入摊薄之 后,适配单个任务所需资源极少且可复用。
二、当前大模型研究的四个前沿方向
这部分是我认为整场讲座信息密度最高的地方。
第一,长推理。 决定大模型能力上限的指标,目标是增强复杂推理和问题求解能力。
第二,基于可验证奖励的强化学习。 大模型判断好坏必须经得起推敲——过程可见、 结果可解释。
第三,测试时计算(test-time compute)。 不改变模型本身,而是在下游任务中更 好地适配,核心是用计算预算换取更强能力。讲者的类比是:不再考前复习,而是做 完题后用不同方法反复验证答案。没有额外训练开销,成本可控。
第四,智能体框架(agent harness)。 让模型只负责推理,其余交给 harness—— 循环调度、上下文的推测与预测、容错机制。讲者认为这是目前国产大模型核心缺少 的东西,也是很多国产模型在结合智能体时难以公开推广的原因。
这第四点值得单独记一笔。它把"模型能力"和"系统工程能力"明确切开了,而后者恰恰 是从 demo 走到可交付产品之间的主要差距。
三、DeepSeek 的技术拆解
训练流程
以 V3 为基础,经过大规模强化学习得到 R1-Zero。这里的强化学习方案关注两点奖 励:准确度,以及输出格式是否规范。
flowchart TD
A["V3 基座"] --> B["大规模强化学习<br/>奖励: 准确度 + 格式规范"]
B --> C["R1-Zero"]
C --> D["能力涌现 + 冷启动数据<br/>提高可读性"]
D --> E["checkpoint 1"]
E --> F["GRPO 强化<br/>准确性 + 语言一致性"]
F --> G["checkpoint 2"]
G --> H["高质量数据集采样<br/>场景微调"]
H --> I["checkpoint 3"]
I --> J["全场景强化学习"]
J --> K["满血版"]
K --> L["蒸馏出 1.5B / 8B / 14B / 70B<br/>及多模态模型"]
中间的"能力涌现"讲者称为 aha moment,即知识涌现时的顿悟过程,可进一步提升 推理能力。
部件一:GRPO(群体相对策略优化)
与传统 PPO 相比,GRPO 删掉了价值评估模型(critic),计算量和通讯量因此节省 约三分之一。代价是需要额外开销做同一轮次的评估。两个关键作用:
- 无 critic 的优化,显著降低算力消耗;
- 群体相对评估:在一次响应的采样组里,超过平均值给奖励,低于平均值给惩 罚,保证每一批生成内容质量都较高。
规则奖励长什么样
讲者用一道小学题说明规则奖励的具体形态:「小明有五个苹果,又买了三袋,每袋四 个,一共多少个?」
第一阶段(R1-Zero 上做准确性和格式约束):答案要准确、步骤要准确;输出必须 分步而不能直接给结果,还要用 LaTeX 标准化排版并加粗最终结果。类比是考试大题只 写答案不给分——因为可能是抄的。满足格式强约束的生成内容给高奖励。
第二阶段(得到 checkpoint 2):在准确的基础上,还要用自然语言连贯地解释 计算过程,像人与人之间的自然交流。
惩罚的情况有两类:一是结果正确但没按步骤、没用标准化公式;二是语言不一致导致 无关假设,比如盲目猜想"袋子是否在回家路上漏了"——这就是幻觉。
关于幻觉的成因,讲者的解释我觉得很有意思:训练数据集中可能混有脑筋急转弯类内 容(“树上十只鸟,打掉一只还剩几只”——“都吓跑了”)。解数学题的思维与脑筋急转弯 的思维不同,但数据里两者并存,模型因此可能无端假设。幻觉在相当程度上是数据 本身造成的。
训练成本为什么能压下来
因为每一轮回答都附带思考,走一步看一步,而不是走到最后才反馈,这保证了每 轮迭代都呈向上趋势,训练过程不断接近收敛。
讲者提到一个背景:DeepSeek 公布算力开销时,外界曾质疑其只公布了单次训练成本不 合理,因为对比方的训练过程是十次、百次,每次耗资上千万美金。而 DeepSeek 未做反 驳,是因为附加思考的过程可以保证一次收敛。
对比 GPU 小时数,讲者给出的量级是对比方的二十五分之一到十分之一。
部件二:细粒度混合专家(MoE)
DeepSeek 的做法是把专家细粒度划分并引入共享专家隔离:
- 细粒度专家划分:参数总量不变的前提下从更多专家中选择激活。讲者的例子很 直观——传统请 16 组专家评判,细粒度划分后拆成 64 组、从中选 8 组,仍然只用 了四分之一的专家库,但组合可能性大大提高,成本不变。
- 共享专家机制:不同任务下由共享专家判断哪些专家参与本轮任务。
- 无辅助损失的负载均衡:根据任务复杂程度动态选择模型。
部件三:多头潜在注意力(MLA)
通过低秩联合压缩减少计算消耗:把 KV 值投射到更低维空间,需要时再恢复。此外 在旋转位置编码上做了引入,把位置信息融入高效推理过程。
部件四:多 token 预测(MTP)
训练推理时不只看一个 token 而是多个,保证更长的注意力。三点创新:可预测后续多 个 token,为每个输入位置产生多个监督信号;缓解误差累积;提高推理速度。
顺带一提讲者关于 token 译名的说法:从去年底到今年初它被统一译为「词元」—— 美国用美元、香港用港元,数字经济时代衡量流通价值的单位就叫词元。
部件五:FP8 混合精度训练
用 FP8 代替传统的 16 位和 32 位浮点数,节省约 75% 的计算开销。代价是需要人 工调整和反馈,在推理任务层面额外调参,在计算开销和精度之间找平衡。配套还有双 管道机制,在前向、后向过程中内置重叠的计算和通信模块。
可以看出,这几个部件的着力点高度一致:都在压计算消耗。
关于蒸馏
基于满血版按场景蒸馏出 1.5B、8B、14B、70B 等模型。之所以能蒸馏,是因为特定任务 下不需要额外的通用能力——做医学模型就不必保留体育知识的相关参数。
讲者的比喻:原始模型是从大海里钓鱼,蒸馏后的模型是从鱼护里钓鱼——先从海 量数据挖掘知识,再从有用知识里凝练知识。他也提到,不排除学生网络比老师网络更 强的情况。
四、智能体与三大主义
讲者在开场埋了一个问题:为什么时至今日还要谈人工智能发展之初的符号主义、连接 主义、行为主义?答案要结合智能体的演进来看。
| 阶段 | 时期 | 特征 |
|---|---|---|
| 第一阶段 | 1956 年起 | 基于规则,符号主义 |
| 第二阶段 | 1990 年后 | 基于行为和反馈式交互,行为主义 |
| 第三阶段 | 至 2022 年 | 深度学习和强化学习催生,如 AlphaGo |
| 第四阶段 | 2022 年后 | 大模型驱动,多工具调用、反思重试、多智能体协作 |
结论是三大主义共同催生了当代智能体:连接主义作基座(神经网络构建技术底 座)、符号主义作校验约束(规则、领域知识、专家经验)、行为主义作交互强 化。没有哪个更好或更快,它们在不同层面共同推进。
由此引出一个反直觉的问题:大模型出现得早,还是智能体出现得早?答案是智能体 更早。智能体的每个阶段都需要一个"AI 大脑",这个大脑不断演进,时至今日大模型 可以担任这个角色。大模型只是智能体的一个部分。
五、智能体的工作原理
从任务起点到输出,智能体要做四步:
- 理解目标——任务是什么,有哪些约束,评判标准是什么;
- 目标规划——任务拆解、步骤排序、动态重规划;
- 工具调用——搜索、代码生成、数据库、办公软件,甚至其他智能体;
- 反馈评价——结果检查、信息补充;执行失败则重走上述流程分析原因,最终输出 可验证的结果。
"可验证"这一环由谁把握?讲者的回答是人。他对"AI 取代人"的表述做了一个修 正,我觉得是全场最值得记下来的一句:
会使用 AI 的人,取代不会使用 AI 的人所承担的工作。
以医疗智能体为例,它看病好不好,不能让 AI 从业者评判,也不能用静态标准评判,而 需要医学专家做动态评判。这就是 AI+X 与 X+AI 的关系:X 在最后一步把关。
系统支撑层面的四项工作
- 知识库:RAG、传统数据库、实时信息获取;
- 记忆库:长程记忆、长短时记忆、上下文记忆;
- 工具调用:搜索、代码执行、可调用 API,决定了任务规划执行的好坏;
- 安全与权限:权限控制、关键阶段的人工确认、全过程日志留存。
多智能体协作
结构上分输入端、输出端和中间的协作中枢。中枢由主管智能体负责规划、目标理 解、任务拆分分发,以及结果收集汇总。典型分工包括检索智能体(数据采集整理、确 认来源)、数据智能体(清洗计算分析)、代码智能体(代码生成和目标实现)、审查 智能体(发现漏洞、关键阶段检查)。
最终输出需要是可核验、可验证、可约束的报告,形成集中调度 → 决策分工 → 并行 执行 → 评审优化 → 闭环执行的工作流。
治理
可交付不等于可放心用,还需要治理:任务结果的正确性与时效性、质量评估的成功率 与成本、工具调用的合规性、执行日志可追溯、关键阶段的权限划分和人工可接入。
六、关于科研智能体
讲者介绍了自己实验室部署的科研智能体,流程大致是:读取多个关键网站的最新论文并 总结 → 梳理每篇与既往相似论文的关系(通过参考文献和被引用关系找线索)→ 调用服 务器验证论文结果是否可复现 → 提出该领域接下来可能的研究方向及具体创新方案 → 在人工确认后运行这些方案,看效果是否优于被复现的论文。
他强调每一步之后都要追问"这够了吗",逐层加深,而不是停在第一步的总结报告上。
同时也给了一个冷静的判断:正因为智能体太好用,学术圈才频繁出现"论文工厂"现 象。一般科研从业者在发掘和思考上很难与之相比,因为它见多识广,读文献的速度和 分析能力可能强过大多数人。
对应的要求是科研评价也在加码:不仅查重复率、查创新性,还要查 AI 率。
七、问答环节的几个要点
问答部分的信息密度不低于正式内容,摘录四个我认为有价值的。
端侧算力与智能体能力的矛盾
问:机器人等端侧设备算力只能支持 30B 以下模型,但要达到较好的智能化水平和 工具链能力需要 100B 以上,这个矛盾怎么解?
答:方向是大小模型协同。边缘端算力受限,但边缘端任务通常也不通用,是很 专的处理——那就聚焦场景、聚焦任务本身,蒸馏出专用模型,不需要额外的通用泛化能 力。但判断它做得好不好、效率高不高,仍然需要一个大脑来控制和总体协调,这时又 需要大模型。于是形成大模型作大脑负责调度、分发、收集,小模型聚焦边缘端处理具 体任务,反馈结果由大脑统一调度交互的架构。
补充一点:这里的"小模型"不应狭隘理解为传统小模型,它也可以是从基础大模型蒸馏 出来的。二者如何协同以达到场景要求,是需要解决的工程化问题。
垂域优化:多任务联合训练还是每任务一个 adapter
问:垂域场景下从基座模型用场景数据调优,希望模型能处理多个任务,是多任务数 据联合训练一个模型好,还是每个任务独立训练一个 adapter 好?
答:视情况而定,判断依据是任务之间的差异度。医学模型迁移到教育领域,有 共性但差异也大;历史学模型迁移到体育领域,差异会更大。细分任务之间的差异决定 了该多任务同时训练还是单任务分别训练。
第二个考虑是任务之间是否存在阶段关联。工程化应用中不同任务所处阶段往往有关 联关系,训练数据所隐含的知识在不同任务下呈现的内容也不一样。这时需要结合实际 场景的专家经验——比如把阶段 A 的历史积累经验融入模型训练。做垂域训练时要考虑的 不只是本地化数据,还包括多任务场景下每个任务的专业知识如何融入。
什么时候该停止工程优化、开始训练模型
问:端侧模型在大部分情况下表现很好,但工具调用能力不足或上下文过长时开始 胡说八道。如何判断当前瓶颈应该继续做工程化优化(上下文、知识库),还是必须开 始训练专用模型?
答:分三个层面看。第一,如果算力有限而任务复杂,那一定需要额外注入专业知 识来提升性能,这时工程手段已经不够。第二,如果不是离线场景,可以把结果或数据 反馈到大脑层面做通讯,此时要优化的是边缘端与云端的任务分配,以及传输和交互内容 本身。第三,算力不够就用算法来凑,边缘端智能是一个方向——比如路上的监测摄像头 未来可直接做决策,即便算力有限也要具备执行监测任务的能力,这样通讯和及时反馈的 成本会很低。
讲者也提到一个相关概念:遥感和部分特殊领域正在提的"天数天算",即把航天采集的数 据直接在轨计算,算完再反馈给地面,形成天空地协同。
学生该如何看待自动化科研 Agent
这个问题来自一位在读硕士:GitHub 上已有很多自动化科研 agent,从检索文献、阅读 文献到自己找创新点、做实验、分析结果全流程覆盖。几乎不用自己想创新点和分析结 果了,那如何平衡能力提升与工具使用?
讲者的回答分三层:
第一,回到科研是什么。 科研问题来自哪里?一定是从应用问题中找到问题,把 它科学化、广泛化,进而解决。 用 agent 辅助科研,不等于完全代替人做科研。
第二,科研的目标不只是发论文。 他转述了一个相当尖锐的追问:如果把你发表的 论文全部下架,对你所在的研究领域会不会造成影响?如果还有点影响,说明这个问题 是有意义的;如果没有影响,那科研目标就不是为了发论文——否则没有意义。
第三,未来分两类人:让 AI 变得更好的人,和把 AI 用得更好的人。 一个是研究, 一个是用。无论哪类,都要能回答"你这项工作具体能解决什么、能改变什么、意义在哪 里"。带着任务和问题去使用 AI 作为辅助科研工具,才更有价值。
关于"导师不让用 AI",讲者在正文里也给过一个类比:可以问老师画图是否用电脑,绘 图时还要不要像古人一样磨墨。计算机是工具,未来 AI 也是工具,人手多个智能体是方 向。要用好它,也不要被它完全替代,要保留独立思考的能力。
八、面向未来的三个问题
第一,计算资源与成本。 这是训练和推理中不可回避的核心问题,未来更侧重降低 算力消耗——更短的训练周期、更省的数据量。回看前面的技术拆解,几乎每个部件都在 回答这个问题。
第二,数据质量与安全风险。 "数据投毒"这个词出现得越来越多。如果 AI 工具 老是给出你不想看到的内容,就要考虑推荐内容是否经过投毒,最简单的形式就是投广 告。
讲者举了一个我觉得很具体的例子:医生反映现在看病更难了,因为患者看病前先问 AI, 问完之后说"你说的不对"。医生无法直接否定 AI 总结的内容,但要判断是否对症,需要 花更多时间与非专业人士探讨专业知识——沟通成本反而更高了。
第三,可靠性与可解释性。 如果医生告诉患者"这是 AI 给出的诊断",患者不会相 信。可解释性、可溯源始终是绕不开的话题。
结合这三点,讲者给出的方向判断是:性价比优势、更易推广至垂直领域、更精细化与 专业化、以开源策略激发创新;同时结合智能体概念,利用强化学习实现智能体的自主 进化——终身学习、长期学习、环境交互与主动学习。
九、我的几点记录
几条对自己方向有参考价值的:
agent harness 那一点值得重视。 把模型的推理能力和系统的调度、容错、上下文管 理能力切开看,这个视角对做机器人系统的人尤其有用——机器人本来就是典型的"模型
- harness"结构,规划、执行、恢复的循环调度早就存在,只是过去没有用这套语言描 述。
大小模型协同的架构判断,和端侧机器人的现实高度吻合。 边缘算力受限但任务专 用,这个前提在移动机器人上一直成立。问答里"聚焦场景、聚焦任务,蒸馏专用模型, 由大脑统一调度"的结论,基本可以直接套用到导航和感知的分层设计上。
"什么时候该停止工程优化"那个问题问得很好,但答案偏原则。 实际项目里更需要 的是可量化的判据。这一块我认为还需要自己在具体任务上摸索。
关于自动化科研 agent 的态度,我认同"回到科研问题本身"的判断。 工具能加速文 献消化和方案验证,但"这个问题值不值得做"仍然需要自己回答。
以上整理如有理解偏差,责任在我而非讲者。