LLM 与 Reasoning Model、Agent 与 AGI 这些概念在日常讨论中经常被混用,但它们在技术上对应的是完全不同的能力层级和工程约束。混用的代价很直接:如果分不清当前 AI 能做什么、不能做什么,就会在产品决策中产生系统性误判。
把这个问题理清楚,从 Transformer 和 GPT-4 的训练机制开始:看 Agentic AI 如何让模型从"回答问题"走向"执行任务",再看更远的 Innovator 级 AI 可能需要什么样的结构变化。整条线索关注三件事:能力从何而来、边界在哪,以及演进路径上的关键依赖是什么。
不对比模型 benchmark,不追踪最新发布,不预测 AGI 何时到来。这些要么时效性太强,要么缺乏可验证的技术基础。
一、NLP 历史、Transformer 与 GPT-4
NLP 的能力跃迁本质上就三个拐点:RNN 解决了序列建模,Transformer 用 Attention 干掉了长距离依赖的瓶颈,GPT-4 则把 scaling law 推到了涌现智能的临界点。拆开看,模型能力从哪来、训练流程怎么拼,是理解这条线的关键。
1.1 从 RNN/LSTM 到现代 NLP
在 Transformer 出现之前,自然语言处理(NLP)领域长期被循环神经网络(RNN)及其变体主导。
RNN 的核心机制
RNN 就是为处理序列数据设计的。关键在于隐藏状态(hidden state)的传递:每个时间步的输出不仅取决于当前输入,还依赖于前一步的隐藏状态。这种结构理论上能捕捉序列中的时序依赖关系。
LSTM 与 GRU 的改进
标准 RNN 存在严重的梯度消失/爆炸问题,导致难以学习长距离依赖。LSTM(Long Short-Term Memory)通过引入输入门、遗忘门与输出门三个门控机制和细胞状态,在一定程度上缓解了这一问题。GRU(Gated Recurrent Unit)通过简化门控结构,在保持类似效果的同时减少了参数量。
根本约束:顺序计算的瓶颈
RNN 系列模型的根本问题是固有的顺序性:计算第 n 个时间步的隐藏状态,必须等待第 n-1 步完成。这种串行依赖导致:
- 训练难以并行化,GPU 利用率低
- 长序列的梯度传播路径过长,信息衰减严重
- 实际可建模的依赖距离通常不超过数十个 token
这些约束卡死了 RNN 架构处理长文本的能力天花板。
1.2 Transformer 与 Attention 机制
2017 年,Google 在论文《Attention Is All You Need》中提出 Transformer 架构,彻底改变了 NLP 的技术范式。
Self-Attention 的核心机制
Self-Attention 让模型直接计算序列中任意两个位置之间的依赖关系,无需通过中间状态的逐步传递:
- Query-Key-Value 计算:每个输入 token 被映射为三个向量 Q(Query)、K(Key)与 V(Value)。注意力权重通过 Q 和 K 的点积计算,再与 V 相乘得到输出。
- 并行化能力:所有位置的注意力计算可以同时进行,不再受限于序列顺序。大规模并行训练由此成为可能。
- 长距离依赖:任意两个 token 之间的交互路径长度恒为 O(1),与序列长度无关。
Multi-Head Attention 的设计
Single-head attention 可能只捕捉到特定类型的依赖关系。Multi-Head Attention 通过多组独立的 Q/K/V 投影,让模型同时关注不同子空间的信息,增强了表达能力。
Position Encoding 的必要性
由于 Self-Attention 本身对位置不敏感(permutation invariant),必须通过 Position Encoding 注入位置信息。原始 Transformer 使用正弦/余弦函数生成位置编码;后续模型(如 GPT 系列)多采用可学习的 positional embeddings。
架构选择:Encoder-Decoder vs Decoder-Only
Transformer 原始设计包含 Encoder 和 Decoder 两部分。后续发展中出现两条路径:
- Encoder-Only(如 BERT):适合理解任务,通过双向 attention 捕捉上下文
- Decoder-Only(如 GPT 系列):适合生成任务,通过自回归方式逐 token 预测
GPT 系列选择 Decoder-Only 路线,这一选择在工程上更易于规模化训练。
1.3 GPT-4 的划时代意义
GPT-4 之后,LLM 才算真正从技术演示变成了可用的工具。关键不只是参数规模,而是涌现出的综合能力。
能力边界的显著扩展
相较于 GPT-3,GPT-4 在以下维度表现出质的差异:
- 指令遵循(Instruction Following):能够理解和执行复杂的多步骤指令,超出了简单续写的能力范围
- 推理深度:在数学、逻辑与代码等需要多步推导的任务上准确率大幅提升
- 多模态理解:具备处理图像输入的能力,实现跨模态信息整合
- 安全性与对齐:通过 RLHF 训练,显著降低了有害输出的概率
涌现能力(Emergent Abilities)的观察
某些能力(如链式思维推理、上下文学习)在越过某个规模阈值后突然显现,随参数量线性增长的假设在这里失效。这就是涌现(Emergent Abilities)。GPT-4 的规模带来了大量此类能力的涌现。
关键判断:规模还是架构?
GPT-4 的能力提升来自两个因素的叠加:
- 规模效应:参数量、训练数据量与计算量的同步扩展
- 训练方法的演进:从纯自监督预训练,到引入指令微调和 RLHF
这两者的贡献难以完全解耦。我看到的工程实践基本一致:在 Transformer 架构下,规模扩展仍然是提升能力的最可靠路径。
1.4 训练一个 GPT-4 级模型的大致阶段
理解 GPT-4 的能力来源,需要拆解其训练流程。一个现代 LLM 的典型训练包含以下阶段:
阶段一:预训练(Pre-training)
预训练通过自监督学习从海量文本中学习语言模式和世界知识。数据来自互联网文本、书籍与代码等,通常达到数万亿 token 规模。核心任务只有一个:Next Token Prediction,给定前文预测下一个 token。产出是基础模型(Base Model),具备语言生成能力但缺乏指令遵循能力。
预训练阶段消耗了绝大部分计算资源(通常超过 90%),决定了模型的知识上限和基本语言能力。
阶段二:监督微调(Supervised Fine-Tuning, SFT)
监督微调的目标是让模型学会遵循指令和进行对话。数据是人工编写的指令-回复对,通常数十万到数百万条;做法是在预训练权重基础上,用标准语言建模目标继续训练。
SFT 后的模型(如早期的 ChatGPT)已经具备基本的对话能力,但可能存在输出风格不一致、产生有害内容等问题。
阶段三:基于人类反馈的强化学习(RLHF)
RLHF 的目标是让模型输出符合人类偏好(helpful, harmless, honest)。做法分两步:先训练 Reward Model,学习人类对不同输出的偏好排序;再用 PPO(Proximal Policy Optimization)等算法优化语言模型,生成高奖励的输出。
RLHF 显著改善了模型的实用性和安全性,是现代 LLM 产品化的关键环节。
阶段四:持续优化(可选)
包括对抗性测试、红队评估与特定领域的进一步微调等。
1.5 RL 学习机制
强化学习(Reinforcement Learning, RL)把 LLM 的训练方式从"模仿数据"推向"为目标优化"。
从模仿到优化
预训练和 SFT 说白了都是模仿学习:模型学习复制训练数据中的模式。RLHF 引入了优化目标,模型转向生成能够获得高奖励的输出。
Reward Model 的作用
Reward Model 是 RLHF 的核心组件。其训练过程:
- 收集同一 prompt 的多个模型输出
- 人类标注者对输出进行排序(如 A > B > C)
- 训练模型预测这种排序关系
训练好的 Reward Model 能够自动评估模型输出,为后续的 RL 优化提供奖励信号。
PPO 算法的应用
PPO 是 RLHF 中常用的策略优化算法,通过在更新时限制新旧策略的差异(clip 机制)来保证训练稳定性,并通过 Advantage 函数评估动作的好坏,指导策略更新方向。
RL 训练的约束与挑战
- Reward Hacking:模型可能找到获得高奖励但不符合人类真实意图的捷径
- 分布偏移:Reward Model 只在训练数据分布内可靠,对分布外的输出可能给出错误奖励
- 训练不稳定性:RL 训练相比监督学习更难调参,对超参数敏感
所以 RLHF 需要大量工程技巧才能稳定运行。
二、AGI 的分级框架与能力边界
模型能力强不等于离 AGI 近——得有个尺子量。OpenAI 的五级框架给出了一种从 Chatbot 到自主组织的分级方式,而真正质变发生在 Agent 这一层:模型不再只是回答问题,而是接入行动回路、自己驱动任务闭环。
2.1 OpenAI 五步规划:从 Chatbot 到 Organization
OpenAI 提出了一个五级 AGI 框架,按能力递进排列:
Level 1: Chatbots(对话系统)
当前主流 LLM 所处层级,能力边界是基于训练分布的模式匹配与文本生成,核心约束在于无持久状态、无工具调用,也无自主规划。
Level 2: Reasoners(推理者)
在特定领域达到人类专家水平的问题解决能力。技术标志是 o1/o3 系列模型展现的 System 2 风格推理,能力覆盖多步逻辑推导、数学证明与代码调试。
Level 3: Agents(智能体)
具备自主决策与工具调用能力,能够执行研究、写作与数据分析等多步骤任务。核心约束落在可靠性、安全性与权限边界上。
Level 4: Innovators(创新者)
能够进行原创性研究与发现,技术标志是提出新假设、设计实验并验证理论。当前状态:尚未达成。
Level 5: Organizations(组织级智能)
多智能体协作完成复杂组织目标,技术标志是自主分工、资源调度与长期规划。当前状态:理论构想阶段。
这套分级的好处是每一级都有可验证的边界,不是抽象的能力描述。
2.2 从 Chatbot 到 Agent:交互范式的转变
Chatbot 范式的核心问题是每一轮请求都是无状态的,模型无法在执行过程中保持上下文连续性或调用外部工具。
Agent 范式的技术特征:
持久状态管理
- 跨轮次记忆保持
- 任务执行状态的追踪与恢复
工具调用机制
- Function Calling 接口标准化
- 外部 API、数据库与计算资源的动态接入
自主决策循环
- 观察(Observation)→ 推理(Reasoning)→ 行动(Action)
- 错误检测与回退机制
这个循环在工程中的落地形态就是 Harness,即围绕模型构建的结构化运行环境,负责上下文交付、工具接口和状态管理,以及反馈验证。Agent = Model + Harness,模型提供认知能力,Harness 提供约束、验证和持续运转的基础设施。
Anthropic 在 2026 年将这个循环推到了更完整的形态:Full Harness。它由 Planner、Generator 与 Evaluator 三个角色组成,Planner 把模糊需求拆解为结构化计划,Generator 逐步执行计划,Evaluator 独立评估产出质量,不合格则打回。Generator 不自我评估。Anthropic 发现 Agent 在评价自己的产出时倾向于过度乐观,因此把生成与评估强制分离。Full Harness 相比 Solo Agent(单模型一把梭)在复杂任务上代价更高(时间 ×18、成本 ×22),但能把"做不出来"变成"做得出来"。
到这一步,LLM 的输出从文本变成了可执行的操作序列。
三、多模态、System 2 推理与计算成本重构
LLM 要从文本续写走向更复杂的能力形态,至少得在三个方向上突破:多模态扩展输入维度,System 2 推理扩展思考深度,而 TTC 和 DeepSeek-R1 则展示了计算预算的不同分配策略。三条路径各自独立,但指向同一个结论——模型能力的上限不只由参数量决定,计算怎么花同样关键。
3.1 多模态的技术定义与实现路径
多模态(Multimodal)指模型能同时处理文本、图像与音频等多种数据类型并关联它们。当前存在两条技术路径:
拼接式多模态
用独立编码器加投影层对齐,代表是早期 CLIP、Flamingo,代价是模态间语义对齐存在信息损耗。
原生多模态(Native Multimodal)
走统一 Token 空间路线,所有模态共享同一表征,代表是 GPT-4o、Gemini,优势在于跨模态推理的端到端优化。
3.2 原生多模态的工程价值
原生多模态在三个维度带来工程收益:
表征统一性
- 图像、音频与视频被编码为与文本同构的 Token 序列
- 跨模态语义检索无需显式对齐层
推理一致性
- 视觉问答、视频理解与音频分析共享同一推理路径
- 减少模态转换引入的误差累积
部署简化性
- 单一模型替代多模型 pipeline
- 降低系统复杂度与维护开销
3.3 System 2 推理:o1 的技术机制
传统 LLM 的推理属于 System 1 风格,快速、直觉且单步生成。o1 系列引入了 System 2 风格的深度推理:
技术机制
- 内部 Chain-of-Thought:模型在输出最终答案前执行多轮自我对话
- 推理时间扩展:Test-Time Compute 允许用更多计算换取更高准确性
- 过程监督:对推理路径进行奖励建模,奖励对象从最终结果扩展到推理过程
能力边界
- 在数学、代码与逻辑谜题等结构化问题上显著提升
- 对于开放性、创造性任务收益有限
- 推理成本随问题复杂度线性或超线性增长
3.4 DeepSeek-R1:效率优化的另一条路径
DeepSeek-R1 展示了通过架构创新与训练策略优化实现成本重构的可能性:
架构层面
- MLA(Multi-Head Latent Attention):压缩 KV Cache,降低长序列推理开销
- MoE(Mixture-of-Experts):稀疏激活,推理时仅调用部分参数
训练层面
- 强化学习驱动的推理能力涌现
- 绕过传统 SFT 阶段的部分开销
市场影响
- API 定价显著低于同类模型
- 验证了"高效架构 + 优化训练"路径的可行性
3.5 Test-Time Compute:计算预算的重新分配
Test-Time Compute 改变了资源分配方式:预训练阶段固定模型参数,推理阶段则根据问题难度动态分配计算资源。
技术形式
- 推理时搜索:生成多个候选答案,选择最优路径
- 自我修正:多轮迭代优化输出
- 过程验证:中间步骤的逐步验证
成本-质量权衡
- 简单问题:低计算开销,快速响应
- 复杂问题:高计算开销,深度推理
- 用户可控的预算-质量曲线
四、Transformer 的结构性约束
前面讲的是怎么让模型更强,这一章反过来——Transformer 架构本身的硬限制在哪。O(n²) 复杂度、上下文腐烂、灾难性遗忘、RAG 的结构性不足,这些不是工程上没做好,是架构设计的固有代价。拆开看,每一条都直接约束了模型的实际可用边界。
4.1 Token 维度的成本与效率问题
Transformer 的计算复杂度与序列长度呈二次关系 O(n²),这一特性带来根本性约束:
计算开销
- Attention 机制需要计算所有 Token 对之间的关联
- 序列长度翻倍,计算量增长四倍
内存开销
- KV Cache 随序列长度线性增长
- 长上下文推理的显存瓶颈
实际影响
- 长文档处理的成本急剧上升
- 实时应用的延迟约束
4.2 上下文窗口与"上下文腐烂"
上下文窗口(Context Window)就是模型单次可处理的 Token 数量上限。当前主流模型已扩展至 128K-200K Token,但长文本理解问题并没有因此完全解决。
上下文腐烂(Context Decay)
信息在序列中的位置会影响模型对其的利用效率。机制是 Attention 权重在长距离依赖上被稀释,表现为文档中间部分的信息提取准确率显著低于开头和结尾。
工程缓解策略
- 位置编码优化(RoPE、ALiBi)
- 稀疏 Attention 模式(Sliding Window、Dilated Attention)
- 分层摘要:长文档分段处理后聚合
4.3 灾难性遗忘与 Scaling Law 的两难
灾难性遗忘(Catastrophic Forgetting)
模型在新任务上训练后,旧任务性能会下降。根源在于神经网络参数的覆盖式更新机制,这构成了持续学习的实现障碍。
Scaling Law 的约束
Scaling Law 假设模型性能随参数规模、数据量与计算量可预测增长。现实是边际收益递减、数据质量瓶颈显现,因此单纯扩大规模无法解决所有问题。
技术困境
- 更大模型 → 更高训练成本 → 更低迭代频率
- 更多数据 → 质量稀释 → 噪声引入
- 更长训练 → 遗忘加剧 → 知识覆盖
4.4 长期记忆与 RAG 的局限
RAG(Retrieval-Augmented Generation)是当前解决长期记忆的主流方案,但存在结构性局限:
检索精度约束
- 语义检索依赖向量相似度,存在误召回与漏召回
- 复杂查询需要多跳推理,单轮检索难以满足
上下文整合约束
- 检索到的文档片段需要与当前查询整合
- 片段间的逻辑关系可能被忽略
知识更新约束
- 外部知识库的维护成本
- 实时性与一致性之间的权衡
替代路径探索
- 可学习的记忆机制(如 Memory Tokens)
- 外部记忆网络(如 Differentiable Neural Computer)
- 知识图谱与符号推理的融合
五、Agent(可行动的 AI)
Agent 的核心不是"能聊天",而是能拿到工具、读懂上下文、自主完成任务。这件事拆开看是一整条能力栈:工具怎么调、协议怎么定、经验怎么复用、知识怎么灌、上下文怎么工程化组装。每一层缺一块,Agent 就只是个 demo。
5.1 Agent 与 Agentic(定义)
Agent 是具备自主行动能力的系统,能在环境中感知、决策并执行操作。在 AI 语境下,Agent 的核心特征是行动回路的完整性:从感知输入到行动输出,形成可观测的反馈回路,衡量它的维度是回路是否闭环、反馈是否可用。
Agentic 描述的是系统属性,与具体架构无关。当模型或系统表现出四种行为特征时,可称为 Agentic:行为由明确或隐含的目标驱动,超出"有问才答"的被动响应;把复杂任务分解为序列化的子步骤;调用外部能力扩展自身边界;在交互过程中保持上下文连续性。
Agentic 不等于 Autonomous(完全自主)。当前主流实现处于"受控 Agentic"区间,模型拥有有限的决策空间,但执行边界由宿主系统严格限定。这种约束是工程上的必要设计,因为未受控的自主行动在开放环境中意味着不可接受的风险敞口。
Agent 与 Workflow 的边界
实践中,多数生产系统采用混合架构:Workflow 处理已知路径,Agent 处理边界情况。这种分层是对问题域复杂度的合理分解。
5.2 原生 Agentic Foundation Model 的必要性
当前主流实现采用"通用 LLM + 外部编排"的架构:模型负责生成文本,Agent 逻辑由应用层代码实现。这种分层架构存在结构性开销。
核心问题:推理与行动的割裂
通用 LLM 的输出是概率分布上的文本 token,而 Agent 行为需要结构化决策:何时调用工具、传递什么参数,以及如何解析返回。这种语义鸿沟导致:
- 延迟累积:每次工具调用需要往返于模型与编排层
- 上下文膨胀:中间结果需编码为文本重新输入
- 错误传播:解析失败会级联影响后续步骤
原生 Agentic 能力的定义
原生 Agentic Foundation Model 在架构层面内置以下能力:
- 工具感知训练:预训练阶段即接触工具定义与调用模式
- 结构化输出原生支持:无需依赖外部解析器生成函数调用
- 多步推理内建:在单次前向传播中完成"思考-行动-观察"循环
- 状态管理内置:维护跨轮次的内部工作记忆
现有进展与局限
OpenAI 的 GPT-4 Function Calling、Anthropic 的 Claude Tool Use 等,已部分实现工具调用原生化。但当前实现仍存在边界:
- 工具定义需外部注入,非模型内建知识
- 多步推理深度受限,长序列易发散
- 状态管理依赖对话历史,无真正的持久工作记忆
原生化的工程意义
原生 Agentic 能力带来的工程收益:
- 降低编排复杂度:减少应用层的状态机实现
- 压缩延迟路径:工具调用决策在模型内部完成
- 提升一致性:训练目标与推理行为对齐
原生化不等于"模型包办一切"。权限治理、资源隔离与审计追踪等安全机制,仍需宿主系统实现。模型负责"能做什么",系统负责"允许做什么"。这一边界不会随架构演进消失。
5.3 工具调用的本质形态:从 Function Calling 到 CLI,再到 Programmatic Tool Calling
工具调用是 Agent 扩展能力边界的核心机制。拆开来看就是四个原子步骤:
- Discover(发现):识别当前可用的工具集合及其能力边界
- Select(选择):基于任务目标,从工具集中选取合适的工具
- Execute(执行):调用工具并获取返回结果
- Observe(观察):解析执行结果,决定下一步行动
这四个步骤谁来实现、谁来控制,决定了不同工具调用形态的根本差异。
Function Calling:结构化选择,Host 执行
Function Calling 是当前最主流的工具调用形态:
- 模型负责 Select:基于自然语言理解,生成结构化调用指令
- Host 负责 Execute:实际函数在模型外部执行,结果返回给模型
约束与边界:
- 工具定义需以 Schema 形式预注册,模型仅能在注册集合中选择
- 参数生成受限于 Schema 约束,超出定义域会触发验证失败
- 执行环境完全隔离,模型无直接访问宿主系统的能力
好处是安全边界清晰:模型只能建议,实际执行权在宿主手里。代价是交互延迟:每次调用需往返于模型与宿主之间。
CLI:本地工具的自然接口
CLI(Command Line Interface)是工具调用的原始形态:
- 文本协议:输入输出均为非结构化文本
- 环境继承:在宿主 Shell 上下文中执行,继承环境变量与权限
- 副作用可见:可直接操作文件系统、网络与进程等
适用场景:
- 本地开发环境自动化
- 系统管理任务
- 快速原型验证
风险敞口:CLI 的无约束特性带来显著安全隐患。模型生成的命令若未经审查直接执行,可能导致数据破坏、信息泄露与未授权网络访问。生产环境中,CLI 调用需配合沙箱隔离与命令白名单,将风险控制在可接受范围。
Programmatic Tool Calling:编排权交回模型
Programmatic Tool Calling 是 Function Calling 的演进形态,核心变化是将多步工具调用的编排权交回模型,在受控代码执行环境中完成复杂任务。
关键特征:
- 代码作为中介:模型生成代码片段(如 Python),代码内部组织多步工具调用
- 受控执行环境:代码在隔离的 Runtime 中运行,资源与权限受限
- 状态内聚:中间结果在代码作用域内传递,减少上下文往返
典型实现:OpenAI 的 Code Interpreter、Claude 的 Artifacts 均属于此类。模型生成代码,代码在沙箱中执行,执行结果(输出、文件与图表)返回给用户。
边界与约束:Programmatic Tool Calling 的"受控"是关键。沙箱需实现网络访问白名单与黑名单、文件系统隔离,以及执行时间与内存上限,并禁止危险系统调用。失去这些约束,代码执行将变成攻击向量。
5.4 MCP:面向服务、共享状态与权限治理的标准接口
MCP(Model Context Protocol)是 Anthropic 于 2024 年底提出的开放协议,目标是标准化 AI 模型与外部数据源、工具之间的集成方式。先看它要解决什么问题。
MCP 的问题域定位
Function Calling 等机制解决了"单一会话内的工具调用",但在企业级部署中,有一组问题尚未被覆盖:工具与模型可能运行在不同主机,需要网络级通信协议;工具调用产生的状态需跨会话保持,不能随对话结束消失;多个客户端(不同用户、不同模型实例)需安全访问同一资源池;权限治理要回答谁可以访问什么资源、权限如何分级,以及审计如何追溯;同一工具实现还要兼容不同模型提供商的客户端。
MCP 就是为了覆盖这些边界情况。
MCP 架构概览
MCP 采用客户端-服务器架构:
- Server:暴露工具、资源与提示模板的进程,通过 STDIO 或 SSE 通信
- Client:Host 内部的 MCP SDK 实例,负责与 Server 建立连接
- Host:承载 AI 模型的应用程序(如 Claude Desktop、IDE 插件)
MCP 的核心抽象
MCP 协议定义三类可暴露实体:
- Tools(工具):可被模型调用的函数,包含输入 Schema 与执行逻辑
- Resources(资源):只读数据实体,如文件内容、数据库记录与 API 响应
- Prompts(提示模板):预定义的提示片段,可参数化复用
这三类实体均通过能力声明(Capability Declaration)在连接建立时协商,客户端据此决定可访问的接口集合。
权限治理机制
MCP 的安全模型遵循四条原则:Server 暴露的能力需经用户或管理员显式授权,非默认开放;Client 仅请求完成任务所需的最小能力子集;敏感操作(如数据修改、外部调用)需用户确认;所有工具调用与资源访问记录日志,支持事后审计。
说白了:协议层无法解决所有安全问题,最终权限决策需结合组织策略与运行时环境。
MCP 与 Function Calling 的关系
MCP 和 Function Calling 是不同层次的事情:
- Function Calling 定义"模型如何表达调用意图"
- MCP 定义"调用意图如何跨进程、跨网络传递到执行端"
二者可以共存:模型通过 Function Calling 生成 MCP 格式的调用请求,Host 通过 MCP Client 将请求路由到对应的 MCP Server。
当前局限与生态状态
截至 2025 年初,MCP 处于快速迭代期:
- 协议规范尚未完全稳定,版本兼容性需关注
- Server 生态以社区贡献为主,企业级实现有限
- 调试与监控工具链尚不成熟
- 性能开销(序列化、网络往返)在高频场景需优化
5.5 Skills:工作流、规范与可复用经验的封装层
Tooling 解决"能力如何暴露",MCP 解决"能力如何跨系统访问",但还有一个问题未被覆盖:方法如何被封装并反复调用。这就是 Skills 要做的事。
Skills 的定义
Skills 就是可复用、可分享的工作流单元,把完成特定任务的方法论(instructions、examples 与 code)打包为版本化的文件包,供 Agent 或模型加载使用。
Skills 和工具不同:工具暴露的是"能力"(能做什么),Skills 封装的是"方法"(怎么做)。
Skills 的内容构成
一个典型的 Skill 包包含五类内容:SKILL.md 是核心定义文件,描述用途、输入输出与使用场景,并注明约束条件;instructions/ 提供任务执行的分步指导,可包含条件分支与异常处理;examples/ 给出示范用例,展示正确的调用方式与预期输出;code/ 和 schema/ 可选,前者放数据转换、格式校验与 API 封装等辅助代码片段,后者定义输入输出结构(JSON Schema 等)。
Skills 因此具备自描述性:加载 Skill 的 Agent 无需外部文档即可理解其用途与用法。
Skills 解决的问题域
Skills 解决的问题域有四块:流程模块化,把复杂任务分解为可组合的 Skill 单元,降低单点复杂度;经验复用,专家定义的高质量 Skill 可被团队或社区共享,避免重复造轮子;一致性保障,同一 Skill 在不同场景下遵循相同的规范与标准;版本管理,演进可追踪、可回滚,生产环境可锁定特定版本。
Skills 与 Prompt Engineering 的关系
可以把 Skills 理解为工程化的 Prompt 管理:
- Prompt Engineering 关注单条提示的优化
- Skills 关注提示体系的结构化组织
一个 Skill 可能包含多条 Prompt,按执行阶段组织(初始化 → 信息收集 → 分析 → 输出)。这种分层之下,提示逻辑更易于维护与测试。
Skills 的加载与执行
Skills 的典型使用流程:
- 发现:Agent 从 Skill Registry(本地目录或远程仓库)检索可用 Skills
- 选择:基于任务描述,匹配最相关的 Skill
- 加载:读取 SKILL.md 与相关资源,注入系统上下文
- 执行:按 instructions 指导完成任务,必要时调用 Tools
- 反馈:记录执行结果,用于 Skill 效果评估与迭代
当前实践与工具
Skills 概念在多个平台有类似实现:
- OpenAI 的 GPTs:包含 instructions 与可选 actions,但缺乏标准化打包格式
- Anthropic 的 Projects:支持上传文档与自定义指令,偏向会话级配置
- Cursor Rules:代码编辑场景的 Skill 化实践,.cursorrules 文件定义项目级规范
- 社区方案:如 skill-library、agent-skills 等开源项目,探索标准化的 Skill 格式
标准化方向:业界正在收敛到类似结构(Markdown 定义 + 资源目录 + 版本声明),但统一标准尚未形成。
5.6 RAG 2.0:Agentic RAG 与知识图谱
RAG 通过检索外部知识增强模型输出,是 Agent 获取领域知识的主要方式。RAG 2.0 是它的演进形态,核心变化是从静态检索转向动态、多步且 Agentic 的知识获取。
RAG 1.0 的局限
传统 RAG 流程是线性的,在四类场景下失效:用户问题与文档表述存在语义鸿沟时,单次检索召回不足;答案分散在多个文档时,需要多跳关联检索;实体关系、层级结构这类结构化知识在向量空间中丢失;知识库变化后,检索策略无法同步调整。
Agentic RAG:检索即推理
Agentic RAG 将检索过程建模为可交互的决策序列:
- 查询重构:模型分析原始问题,生成多个检索变体(paraphrase、分解与扩展)
- 多源检索:并行查询多个知识源(向量库、图数据库,以及 API、搜索引擎)
- 中间推理:基于初步检索结果,决定是否需要进一步检索(多跳)
- 结果综合:整合多源信息,处理冲突与冗余,生成最终答案
关键差异:检索从预处理步骤变成生成过程的有机组成部分。模型在生成过程中可主动触发检索,形成"生成-检索-再生成"的循环。
知识图谱的集成价值
向量检索擅长语义相似度匹配,但弱于关系推理。知识图谱(Knowledge Graph)从四个方面补足这一短板:把文本中的 mention 链接到图谱中的标准实体;沿"属于"、"导致"与"位于"等预定义关系遍历导航;使用类 SPARQL 语法执行精确的多约束检索;让推理路径可追溯,满足审计需求。
混合架构实践:生产系统通常采用"向量 + 图谱"的混合方案,向量检索负责召回候选、承担粗排,图谱负责关系验证与扩展、承担精排与推理。
RAG 2.0 的工程挑战
多步检索提升质量,但增加 token 消耗与响应时间;端到端评估需覆盖检索质量、生成质量与事实准确性多个维度;向量索引与图谱结构需随源数据更新同步重建;新领域缺乏足够的问答对用于检索策略优化。
与 Agent 架构的融合
在完整 Agent 系统中,RAG 以组件形式嵌入知识获取链路:Agent 根据任务类型决定是否需要外部知识;需要时调用 RAG Skill 执行检索;检索结果作为 Observation 融入推理上下文;若结果不足,Agent 可决定重构查询或切换知识源。
融合之后,RAG 从"被动工具"变成"Agent 的可选能力"。
5.7 Prompt Engineer 与 Context Engineer
Agent 系统的输出质量,受限于两个输入维度:模型接收的指令 Prompt 与模型可访问的上下文 Context。优化这两个维度,分别对应 Prompt Engineer 与 Context Engineer 两个角色。
Prompt Engineer:指令优化
Prompt Engineer 的工作就是提升模型对任务意图的理解与执行准确度。
技术手段:
- Few-shot 示例:提供输入-输出示范,引导模型模仿
- Chain-of-Thought:要求模型显式展示推理步骤,提升复杂任务表现
- Role 定义:通过 system prompt 设定模型身份与行为边界
- 输出格式约束:使用 Schema 或模板限定输出结构,便于下游解析
演进趋势:模型能力提升之后,Prompt Engineering 的边际收益递减。GPT-4 级别模型对 prompt 格式的敏感度显著低于早期模型,"清晰描述任务"往往比"复杂技巧"更有效。
但 Prompt Engineer 的价值不会消失,重心从"技巧堆砌"转向"需求翻译":将业务需求准确转化为模型可执行的指令,这仍是需要专业判断的工作。
个人推荐:CLEAR Mode
在实际使用中,我们更倾向于采用一种可复用的 Prompt 组织方式,把它叫做 CLEAR Mode。它本质上是帮人梳理任务描述的思维框架,包含五个要素:
CLEAR Mode 的五个要素各管一件事:Context 提供必要的上下文信息,帮助模型理解问题发生的环境与前提条件,比如当前项目状态、已有假设与相关历史决策;Limitation 明确任务的边界条件与禁止事项,包括时间、资源与格式,以及安全或风格约束,防止模型在错误方向上"自由发挥";Expression 清晰、直接地表述需要模型完成的具体任务,避免多义性和隐含目标;Attempts 说明已经尝试过的方法、失败路径或已知无效方案,帮助模型避免重复低价值探索;Requirements 明确期望的输出形式、结构与粒度,或评价标准,模型更容易给出可直接使用的结果。
它做的事情是把人类隐式的任务理解过程显式展开为模型可消费的结构化信息。这不仅提升了单次输出质量,也显著降低了多轮交互中的漂移风险。
Context Engineer:上下文组织
Context Engineer 管的是模型可访问的信息集合,在有限窗口内最大化信息价值。
主要挑战在于:模型上下文窗口有限(即使长上下文模型也有 practical limit),而任务相关信息可能远超容量。Context Engineer 需回答:
- 什么信息应放入当前上下文?
- 信息以什么形式组织?
- 如何动态调整上下文内容?
技术手段:
- RAG 集成:按需检索,只加载相关信息
- 摘要与压缩:长文档预处理为紧凑表示
- 层级组织:信息按重要性分层,优先保留高层信息
- 动态加载:根据对话进展,增量引入新信息
角色融合趋势
在小型团队中,Prompt Engineer 与 Context Engineer 常由同一人承担。但随着系统复杂度增长,二者开始分化:
- Prompt Engineer 偏向"前端",面向模型接口,优化交互协议
- Context Engineer 偏向"后端",面向数据管道,优化信息供给
和传统软件工程中前端与后端的分化类似,二者需要协作,但技能栈与关注点不同。
工具与基础设施
支持这两个角色的工具链正在成熟:
- Prompt 管理:LangSmith、PromptLayer 与 Weights & Biases 等提供版本管理、A/B 测试与效果追踪
- 上下文管理:LlamaIndex、LangChain 的索引与检索模块,以及自研的 RAG Pipeline
- 评估框架:用于量化 Prompt 变更与上下文策略对输出质量的影响
Agent 系统的工程化落地需要五层能力协同:Tooling 定义能力暴露形态,MCP 实现跨系统访问,Skills 封装方法论,RAG 供给领域知识,Prompt/Context Engineering 优化交互质量。
六、Agent / Agentic 工作流范式
Agent / Agentic 的应用场景可以收敛为四类稳定的工作流范式。
6.1 研究与信息整合型工作流
这一类工作流把信息检索、交叉验证与结构化整合从人工执行转为 Agent 自动化。约束边界在于信息源的可靠性验证与输出格式的结构化程度。
Deep Research:多源信息整合的基准范式
机制拆解:Deep Research 是一类典型的"搜索-阅读-综合"工作流。其内部实现通常包含五个环节:先把用户输入的研究主题拆解为多个子查询(sub-queries),覆盖不同信息维度;再对每个子查询执行多源搜索,覆盖学术数据库、技术文档与行业报告等;随后从检索结果中提取关键信息片段,过滤低相关性内容;对冲突信息进行多源比对,标记可信度等级;最后按预设模板整合为综述文档,包含引用溯源。
适用场景:
- 技术领域入门调研(快速建立认知框架)
- 竞品功能对比分析
- 学术文献综述初稿生成
- 政策法规变动追踪
技术综述生成的开销模型
生成一份中等深度(约 5000 字)的技术综述,典型开销分布如下:
- 检索开销:10-30 次 API 调用(取决于信息源数量)
- Token 消耗:输入约 50K-100K tokens,输出约 5K-10K tokens
- 时间成本:端到端执行约 5-15 分钟
- 人工复核:约 20-30 分钟(验证关键数据与引用)
6.2 长文本与知识加工型工作流
这一类工作流处理的是超出单次上下文窗口的长文本,或需要保持一致性风格的知识库。关键机制是分段处理、风格锚定与一致性校验。
十万字级 Blog 润色:分段处理与风格锚定
长文本润色面临两个核心问题:上下文截断与风格漂移。典型解决方案:
分段处理策略:
- 按语义边界切分(章节/段落级别),绕开固定 token 长度的硬切
- 每段处理时携带"风格锚定提示"(style anchor),包含:
- 目标读者画像
- 语气要求(技术型/科普型/叙事型)
- 术语使用规范
- 禁用词汇列表
一致性校验机制:
- 建立术语表(glossary),记录全文关键术语的统一译法
- 每处理新段落前,先检索已处理段落中的相关术语
- 结尾生成"风格一致性报告",标记潜在冲突
Skills / Cowork / 文件工作流的组织:Skills 把润色任务封装为可复用的技能模板,包含预设的风格参数;Cowork 让多人协作时通过共享术语表与风格锚定文件保持一致性;文件工作流则建立"原始稿 → 分段处理 → 整合校验 → 终稿"的流水线。
6.3 数据到规范型工作流
这一类工作流把原始数据(性能指标、测试结果与用户反馈等)转化为可执行的工程规范,把隐性的经验判断变成显性的决策边界。
性能数据分析与预算规范生成
以 GPU 性能数据分析为例,典型工作流包含以下环节:
数据输入:
- 性能测试原始数据(帧时间、GPU ms 与面数,以及贴图分辨率等)
- 硬件配置信息(GPU 型号、驱动版本与分辨率等)
- 测试场景描述(复杂度等级、特效开启状态等)
分析维度:
- 相关性分析:面数/贴图预算与 GPU ms 的量化关系
- 瓶颈识别:顶点处理、像素填充与带宽占用的占比分布
- 阈值标定:不同画质档位下的性能边界
- 异常检测:离群数据点标记(可能代表测试误差或特殊场景)
规范文档的工程价值
数据到规范工作流的输出是持续演化的工程资产:作为美术资源制作时的预算参考,构成 CI/CD 流水线中的性能门禁,充当技术与美术之间的量化共识,并把个人经验沉淀为团队规范。
6.4 工程实现与调试型工作流
这类工作流面向代码生成、逆向工程与调试诊断等技术实现场景。特点是迭代性强、容错率低,需要 tight feedback loop。
Agentic Coding:代码生成的迭代范式
Agentic Coding 的核心就是"生成-验证-修复"循环:
- 生成阶段:基于需求描述生成初始代码,同步生成测试用例(若适用)
- 验证阶段:编译检查(语法错误捕获)、静态分析(代码规范、潜在 bug)与测试执行(功能正确性验证)
- 修复阶段:根据验证反馈定位问题,生成修复方案并重新验证
- 迭代终止条件:所有测试通过 / 达到最大迭代次数 / 人工介入判定
Shader 逆向:从目标效果推断实现
Shader 逆向是一类典型的"效果→实现"推断任务:
- 输入:目标效果的参考图/视频、效果描述与运行环境约束
- 推断环节:效果分解 → 技术选型 → 参数估计 → 实现生成
- 验证机制:渲染结果与参考图的视觉对比、性能指标是否符合预算,以及跨平台兼容性检查
OIT 路线推断:技术方案评估
Order-Independent Transparency(OIT)实现路线的选择涉及多维度权衡:目标平台的 GPU 特性支持,场景中的透明物体数量与分布,性能预算与质量要求的平衡点,以及实现与维护的工程开销。
RenderDoc Debug Agent:诊断自动化
RenderDoc 调试 Agent 的核心是将人工诊断流程自动化:
- 诊断流程:捕获帧分析 → 异常检测 → 根因定位 → 修复建议生成
- 自动化边界:已知问题模式可完全自动化;未知问题模式需人工介入;复杂交互问题的根因定位准确率有限
选哪种工作流范式,看任务的验证机制成熟度:验证机制越完善,自动化空间越大;验证机制越模糊,人工介入的必要性越高。
七、当前 AI Model 的局限
前面几章展示的能力,底下全站在同一组假设上:概率生成、参数记忆、离线训练。这三条假设各自带着结构性天花板,而且彼此强化——规模再大也绕不过去。逐个拆开看,就是五个没有被 scaling 解决、也不太可能被 scaling 解决的问题。
7.1 逻辑泛化困境
在实际使用中,我经常遇到一种看似矛盾、却高度一致的现象:模型在某类问题上表现稳定,一旦输入形式发生轻微变化,正确率却会骤然下降。
这指向当前 AI Model 的一个根本性局限:缺乏系统性的逻辑泛化能力(Systematic Generalization)。
分布内表现与分布外崩溃
在训练分布内,模型往往能够给出高质量输出:常见形式的数学题、模板化的代码问题,以及语义结构相对固定的问答任务。
但当问题结构发生变化,即便变化在逻辑上是等价的,模型的表现也可能明显退化:
- 更换符号体系,但保持相同逻辑规则
- 调整问题陈述顺序,但不改变实质约束
- 引入干扰信息,但核心推理路径不变
组合爆炸与覆盖困境
系统性泛化要求模型能够组合已学习的 primitive 来解决新问题。但当前 LLM 的"组合"更多是在训练分布内的插值,到不了真正的规则组合。
以数学推理为例:模型可能学会"加法"和"乘法"的独立操作,但面对需要嵌套运用的复合表达式时,错误率显著上升。这种失败源于模型缺乏对操作规则的抽象表征。
长度泛化的边界
另一个典型表现是长度泛化(Length Generalization)的局限:模型在训练时见过长度不超过 N 的序列,推理时面对长度 N+1 的同类问题,性能急剧下降。规则外推在这里失效,模型依赖的是模式匹配。
符号锚定的缺失
人类推理依赖于符号系统的显式操作:人可以操纵变量、应用规则并验证约束。当前 LLM 缺乏这种显式的符号锚定机制:
- 所有推理都在连续向量空间中进行
- 逻辑规则被隐式编码在参数中
- 缺乏可验证的中间表示
7.2 记忆与遗忘的结构性矛盾
Transformer 架构的记忆机制有三重结构性矛盾,它们决定了当前模型无法成为真正的长期学习系统。
参数记忆的不可选择性
模型的知识全部固化在参数中,这带来两个后果:
- 写入代价高昂:每次更新都需要重新训练或微调,成本极高
- 遗忘不可避免:新知识的写入会干扰已有知识的表征,导致灾难性遗忘
上下文记忆的易逝性
上下文窗口提供了一种"临时记忆",但其特性决定了它无法承担长期学习功能:
- 容量有限:即使 200K token 的窗口,也无法容纳完整的领域知识
- 访问不均:上下文腐烂(Context Decay)导致早期信息利用效率下降
- 无法积累:对话结束后,上下文内容不会写入模型能力
知识一致性的维护开销
即使通过 RAG 外置知识,系统仍需面对一致性挑战:
- 外部知识更新后,模型内部参数中的相关知识不会自动同步
- 检索到的知识片段之间可能存在冲突
- 缺乏统一的机制来仲裁知识版本
7.3 Agentic 的脆弱性
Agent 系统在实际部署中的脆弱性,来自多个系统性因素的叠加。
规划与执行的断裂
Agent 要做的就是任务规划与执行,但这一过程有多处断裂点:
- 目标理解偏差:用户意图与模型理解之间存在语义鸿沟
- 规划合理性:生成的计划可能在逻辑上可行,但在实践中因资源约束或环境变化而失败
- 执行稳定性:工具调用可能因网络、权限与接口变更等原因失败
错误累积效应
多步任务中,早期步骤的错误会级联传播:
- 第一步检索返回低质量结果
- 第二步基于错误信息生成错误假设
- 后续步骤在错误路径上越走越远
- 最终输出与预期相差甚远
缺乏有效的中间验证机制是导致错误累积的关键原因。
语义鸿沟的放大
Agent 需要与外部系统(API、数据库与文件系统等)交互,这些系统的接口语义与模型的自然语言理解之间存在鸿沟:
- 接口文档的描述与实际行为可能存在偏差
- 错误返回码的语义需要专门处理
- 状态变化的可观测性不足
RLI 实证锚点:端到端交付能力的现实检验
Scale 的 Remote Labor Index(RLI)只评估"真实远程项目的端到端交付"能力,不考核回答质量或对话流畅度。我核过 2026 年 1 月 16 日的公开榜单,即使是最先进的 Agent 系统,端到端交付能力仍处于较低水平。
RLI 满分通常为 10 分或更高,具体取决于任务复杂度基准。
对 RLI 分数的解读有两个边界:
- RLI 评估的是"独立完成端到端交付"的能力,这与 human-in-the-loop 下的生产力价值是两个维度。即使 RLI 分数较低,Agent 在有人类监督和纠错的情况下仍可能提供显著效率提升。
- RLI 低分不否定 Agent 技术的价值,它揭示的是当前技术在"完全自主"场景下的能力边界。这一边界对于设定合理的系统架构预期至关重要。
7.4 世界模型的缺失
人类能在复杂环境中有效行动,很大程度上靠内在的世界模型:对物理规律、因果关系与空间结构的心智表征。当前 LLM 没有这种稳定的世界模型。
物理一致性的缺失
模型生成的描述可能在物理上不可能:物体穿过其他物体、违反能量守恒的机械装置,以及不符合材料特性的结构设计。这种失败源于模型缺乏对物理约束的内建表征。
因果推断的局限
相关性不等于因果性,但当前模型主要学习的是统计相关性:
- 模型可能学会"火与热"的共现关系
- 但缺乏"火导致热"的因果方向理解
- 在反事实推理("如果没有火,还会热吗?")上表现不稳定
状态空间的可操作性
世界模型不仅是"知道",还包括"可操作":能够预测行动的后果。当前模型可以描述"推箱子会移动",但难以准确预测具体推力下的位移轨迹,缺乏对状态空间连续演化的建模能力。
7.5 学习闭环的断裂
真正的智能系统需要能从经验中学习,但当前 LLM 的训练范式与运行时推理之间有根本性的断裂。
离线训练与在线推理的分离
- 训练阶段:模型从大规模静态数据中学习
- 推理阶段:模型基于固定参数生成输出
- 运行时经验不会反馈到模型能力中
后果就是:模型在推理中犯了错误,它也不会"记住"这个教训,下次遇到类似情况仍会重复同样的错误。
反馈信号的稀疏性
即使引入 RLHF 等反馈机制,也面临以下约束:
- 反馈需要人工标注,成本高昂
- 反馈粒度通常只在输出层面,缺乏中间步骤的指导
- 反馈周期较长,难以支持实时学习
灾难性遗忘的阻碍
即使想要通过持续训练来更新模型,也会面临灾难性遗忘的问题:新数据的训练会干扰已有知识,难以实现"增量式"学习,需要复杂的机制来平衡新旧知识。
当前模型的脆弱性不是工程疏漏,而是概率生成、参数记忆与离线训练三条基本假设的联合结果。这些约束在旧范式内可以被压制,但不会随着规模扩大或工程优化而消失。
八、未来的 Innovator:在旧范式极限之外重构可积累系统
Transformer 与 LLM 范式在规模化训练、后训练塑形与多模态扩展,加上工具调用与 Agent 化组织之后,确实获得了前所未有的广度与实用性;同时,这一范式也稳定暴露出一组难以回避的边界。推理依赖概率生成,规则执行缺位;上下文随长度增长而腐烂;知识固化在参数里,无法被独立更新;经验难以跨时间积累;Agent 能执行任务,却不会因为做过一次就显著成长。
讨论 Level 4 的 Innovator 时,问题从"模型还不够强"变成了"系统缺少哪些不可替代的结构组件"。继续沿着现有路线扩大模型、增加数据并延长推理时间,能压低错误率、提升多场景稳定性,但它不会自然跨越到"会积累、会修正并会生成新知识"的形态。
跨越所需的能力缺口有三条。第一条是可写入且可巩固的长期记忆:经验不能只存在于一次性上下文中,也不能只隐式埋在参数里,它必须能写入并读取、能修改并巩固,能遗忘并版本化,并在未来任务中被重新调用。第二条是可预测且可证伪的世界模型:系统必须能够在内部维持环境状态的抽象表示,对未来状态做预测,对反事实做比较,并允许外部环境对这些预测进行证伪。第三条是能把经验转化为未来策略变化的学习闭环:系统必须能够围绕已有目标、世界状态与记忆缺口,持续调整自身策略,并让一次失败在下一次行为中留下可观测的影响。
所有技术方向都必须回扣这三条,否则它们最多只能构成更强的 Agent。
8.1 现阶段:在旧范式内压制失败模式
现实中的技术演进不会直接跳到结构重构,更可能是一段更长的过渡期:在不改变"概率生成 + 参数记忆 + 离线训练"这三条基本假设的前提下,尽可能把系统推到极限。
这一阶段做的事情就是把旧范式的边界推到清晰可见。只有把这条路线真正榨干,结构性缺口才会以更明确的形式暴露出来。
Pre-training:Coverage、Quality、Structure 与 Multi-Modality
Pre-training 的优化重点从"更多数据"变成了四根支柱的协同推进。
Coverage 解决覆盖问题。更完整的领域分布、更多语言与表达形态,以及更丰富的时间跨度与长尾边缘案例,降低模型在输入空间上的系统性盲区。
Quality 解决噪声问题。更精细的数据清洗、更低的重复率,以及更高的信息密度,提升参数空间中有效知识的占比,减少低质量 token 对表示学习的污染。
Structure 解决结构归纳问题。关键在于让数据更接近约束系统。数学与形式化推导、Code + Tests + Spec 的配对数据,以及工程与物理约束的显式标注、可复现实验轨迹与可控合成 curriculum,它们共同推动模型学习定义、约束,以及推导、验证与反例,统计相关性则是语言叙述层面的副产品。
Multi-Modality 解决模态覆盖问题。将图像、视频与音频,以及代码和结构化数据统一为同构 Token 流,在预训练阶段即建立跨模态的语义关联。Gemini 系列是这条路线最激进的实践者,从 1.0 到 2.5 Pro,原生多模态下,模型在视觉推理、视频理解与多模态 Agent 任务上的表现与纯文本模型拉开了结构性差距。代价是训练数据管线的复杂度和计算量成倍增长。
这四条路线可以显著提升结构归纳与 systematic generalization 的概率,但边界同样明确:这些知识仍然主要被写入参数,无法进入可更新、可选择且可版本化的长期记忆层。
Post-Training RL:从偏好对齐到可验证任务,再到 Agentic 能力塑形
后训练阶段的重心从 RLHF 向 RLVR 和更广泛的能力塑形扩展。
RLVR 的动机很直接:对于数学、代码与逻辑,以及工具调用等存在明确验证机制的任务,奖励不必来自人类偏好,而可以来自结果是否正确、是否通过测试,以及是否满足格式与约束。o1 是这条路线的标志性产物,通过 RL 训练出深度推理能力,在数学和代码任务上的准确率实现了跨级提升。o3 进一步把 RL 目标从"答案正确"扩展到"工具调用正确",模型学会在复杂多步任务中稳定地选择工具、传递参数并解析返回。
更新的方向是将 RL 与垂直领域的执行反馈结合。在 coding 场景下,SWE-RL(Meta, 2025)通过自我对弈生成 bug 并修复,用单元测试通过/失败作为奖励信号,完全不依赖人工标注;在 Agent 任务中,基于工具调用成功率、API 返回状态与任务完成度等可自动获取的信号做 RL 更新,逐步提升特定领域的 Agentic 可靠性。这在一定程度上缓解了"RLVR 无法覆盖所有开放任务"的问题,覆盖不了全部,但可以在具备执行反馈的垂直场景中逐一突破。
这条路线能够显著压低可验证任务中的低级错误率。但它仍然无法构成 Innovator 的核心机制,它优化的是行为分布与结果筛选,不等于系统已经获得跨时间积累经验的能力。只要经验仍然主要停留在参数调整与局部轨迹筛选这一层,成长就仍然是受限的。
Test-Time Compute:用搜索与验证换稳定性
推理阶段的扩展在持续深化。共同本质是:在参数固定的前提下,把更多计算预算投入到推理阶段,用更大的搜索空间与更强的验证密度换取更高的稳定性。
TTC 在宏观上有两种策略:Self-Consistency(并行采样,取多路结果的一致性作为可靠性信号)和迭代式自我修正(序列迭代,用中间反馈逐步改进单条路径)。前者用宽度换准确率,后者用深度换准确率。两者可以组合。
在这两种策略之下,具体的实现方式在分化。序列策略的代表是延长 CoT 加工具调用链:o1-pro 模式允许模型花费数千 token 在内部推理上,同时穿插多次工具调用(搜索、代码执行与文件读取),用外部验证结果修正推理路径,代价是单次请求的 token 消耗和延迟显著增加。Self-Consistency 策略的代表是 Best-of-N + Verifier:生成 N 条独立推理链,由验证器(Process Reward Model 或外部测试)选择最优输出,o3 在 ARC-AGI 上的表现主要来自这种方式,同一模型,更大的 N。两种策略的混合出现在 Tree-of-Thought / MCTS 式搜索里:Gemini Deep Think 等在推理过程中维护推理树,对每个节点用 Process Reward Model 评估后选择最优分支展开,同时允许回退和重探索,本质是把 beam search 从 token 级提升到 reasoning step 级。Self-Consistency 策略还有并行实现,即 Parallel CoT / Multi-Agent 协作:GPT-5.5 Pro 的 Parallel CoT 和 Grok Heavy 的共享 KV Cache Multi-Agent 让多个推理实例并行处理同一问题的不同子任务或路径分支,通过共享上下文状态避免重复计算,最终汇总为一致输出,相比串行 CoT,用并行计算换取更低延迟和更高覆盖度。
所有 TTC 实现的性能上限取决于验证器质量。当验证信号可靠(数学答案可验证、代码可运行测试),TTC 收益显著;当验证信号模糊(开放生成、主观判断),更多计算只会放大验证器的偏差。
这条路线在高价值、强约束且可验证的任务上具有现实的工程价值。它会持续改善 reasoning model 的表现,也会推动 Agent 在 coding、research 与数据分析,以及多步工具调用中走得更远。
第一阶段的必然边界
问题在于,以上三条路线都只是在旧范式边界内压制失败模式。它们不能通过量变自然引发质变。更好的数据无助于解决参数记忆的不可选择性,知识一旦固化在权重里就没有独立的取舍通道;更强的 RLVR 覆盖不了所有开放任务,验证机制不存在的地方,奖励信号无从构造;更多的 Test-Time Compute 能提高命中率,却无法凭空创造世界模型,它只是在固定参数上做搜索;更复杂的 Agent 框架也不会让系统自动获得可积累的经验结构,流程编排改变不了经验滞留在上下文与参数里的现实。
第一阶段的所有努力,能让系统更稳、更少错也更实用,但不会自然把系统推向 Innovator。它们更像一份极限压榨后的验尸报告:当失败模式已经被尽可能压低,而系统仍然不会因为经历过一次失败而在下一次显著更好时,就必须承认,问题已经从"优化"转向"结构重构"。
8.2 设想形态:基于可证伪预测的经验驱动系统
从第一性原理出发,Innovator 的最小必要条件可以压缩为一句话:系统能够构建关于世界的可证伪预测模型,并从预测失败中持续学习。
这句话展开后对应四个层次:World Model 做预测,Verifier 对预测做证伪,记忆把证伪后的修正结果持久化,Dynamic Learning 让这个循环在运行时持续进行。
World Model:预测与反事实推理的核心引擎
World Model 要做的是维持一个足够紧凑、足够可操作的状态表征,让系统能围绕目标、约束与历史经验进行状态演化预测。拆开看就是三件事:对环境状态做抽象表示,对行动后果做预测,对反事实路径做比较与筛选。系统因此在真正执行之前,能在内部进行一定程度的"想象"与试验。规划从"哪段 CoT 看起来更合理",变成"哪条行动路径更可能把状态推进到目标区间"。
World Model 当前存在三条不同的实现路径:
| 路线 | 代表 | 预测方式 | 核心主张 |
|---|---|---|---|
| 生成式重构 | Dreamer (V1-V3)、Sora | 在像素/token 空间忠实重构未来状态 | 完整重构才能保留全部信息 |
| JEPA(LeCun) | I-JEPA、V-JEPA 2、LeWorldModel | 在 latent space 预测抽象表征,不生成像素 | 只预测决策相关的抽象信息,过滤无关细节 |
| 混合路线(GLP/PAN) | PAN (MBZUAI, 2025) | 潜空间预测 + 生成式 decoder 做 grounding | 抽象预测需要重构 loss 做锚定 |
JEPA 的思路是:直接在 token 或像素空间中预测未来,系统会被大量表层噪声与冗余淹没。更可行的路径是在 latent space 中做状态预测,重点从表象生成转向状态关系建模。V-JEPA 2(2025 年 6 月,Meta)已经在 1M+ 小时视频上训练出 1.2B 参数的视频世界模型,并实现了零样本机器人操作规划。
生成式路线(Dreamer / Sora)则主张忠实重构每一帧细节,代价是计算开销更高、容易在无关细节上浪费建模容量。OpenAI 在 2026 年 3 月关闭 Sora 时承认了这一方向的计算成本问题。
三条路线目前没有收敛共识,各有优势和未解决问题。但无论选哪条路径,真正有工程价值的 World Model 都必须满足一组最低标准,这就是 Spatial & Physics 约束的位置。
Spatial & Physics 约束:所有 World Model 的验证下限
如果一个所谓的 World Model 不需要满足空间连续性、物理约束或时间一致性,那么它很容易退化成更复杂的语言预测器。无论 JEPA 还是 Dreamer 还是 PAN,最终产出的世界模型至少要满足三项最低标准:同一对象在不同视角与时间下具有可对齐的状态;预测受到因果与物理约束,不允许无限自洽;状态演化在时间上连续,经验可以累积并用于修正未来预测。
只有在这个下限之上,世界模型才算真正服务于规划。
World Model 仍然会面对抽象层级选择、状态压缩失真与开放世界不完备性,以及长时程预测漂移等问题。它不是 Innovator 的全部,但它是规划从语言空间走向状态空间的必要前提。
Verifier:对预测进行证伪的校准机制
有了 World Model 做预测,还需要一层机制对预测结果进行检验,这就是 Verifier。
纯语言环境在这方面天然不足。语言错误可以高度自洽,幻觉可以以合理叙述的形式出现,系统很难从中获得强烈、明确且可重复的反例信号。一个推理链可以写得很长、很连贯,但如果没有外部约束对其做证伪,长度本身不产生可靠性。
Verifier 的反馈来源按硬度分为几个层级。最硬的是物理环境反馈:碰撞、失败与偏航,以及能量不守恒,这些结果系统无法用语言自洽解释过去。往下是形式化验证,包括数学证明、代码测试与约束检查,结果二值化,对错明确。中间层是结构一致性检查,用时间连续性、空间对齐与因果方向对预测质量施加约束。最软的是人类反馈,依赖偏好排序与正确性标注,信号密度低、获取成本高。
Spatial & Physics AI 在这里的作用就是提供最硬的反馈层级。一个错误动作如果会立刻导致碰撞、失败或能量不守恒,系统就必须在记忆与策略层面对其做出修正。从这个意义上看,Spatial & Physics AI 既是 World Model 的验证标准,也是 Verifier 最可靠的信号来源。
记忆作为持久化层:Engram 与 mHC
World Model 做预测,Verifier 做证伪,但如果证伪后的修正结果无处持久化,系统就只能在当前上下文窗口内"聪明"。所以需要显式记忆系统。
为此引入两个工作性概念(借用神经科学语义,仅作工程分析中的抽象术语):
- Engram 指可写入、可读取且可修改的记忆表征。它可以是任务轨迹、策略模板与失败模式,也可以是概念抽象,或是结构化与非结构化知识的混合体。关键在于它能够被系统稳定读写,并参与未来决策。
- mHC 指记忆的分层、巩固与遗忘,以及调度机制。工作记忆支撑当前任务;短期记忆保存近期任务轨迹与局部经验;长期记忆负责概念、规则与稳定模式,以及可复用策略的持久化。系统还需要巩固与遗忘机制,决定哪些经验值得提升层级,哪些应该被快速丢弃。
如果没有 mHC 这一层治理,记忆系统会迅速退化为噪声仓库。错误经验被固化,偶发事件污染长期知识,过时规则与新规则冲突,形成另一种形式的"记忆腐烂"。
Engram 与 mHC 共同解决一整类"时间轴上的系统问题":工作记忆如何在长链路任务中保持稳定,经验如何从一次任务迁移到下一次,遗忘如何从事故变成治理策略,知识如何支持版本演化与一致性维护,以及学习结果如何真正写入未来可复用的系统状态。这些问题若继续依赖参数更新与上下文堆叠,都会在系统规模扩大后重新出现。
记忆系统自身解决"存什么、存哪里与存多久",但"下一步该学什么",即写入的目标信号从哪里来,需要与 World Model 和 Verifier 协同才能回答,这个目标信号由 Dynamic Learning 的第 5 步(Nested Learning)负责生成。
当前部分模型(如 DeepSeek V4 的"Engram Memory")已经在 KV Cache 层面做了分层管理(热/温/冷分层存储 + 预测性预加载),但这本质上仍是推理效率优化,归属 8.1 节的"旧范式内优化",不是此处讨论的跨会话可积累经验系统。两者解决的是不同层级的问题。
Dynamic Learning:把上述组件连成运行时闭环
World Model 做预测,Verifier 做证伪,记忆做持久化,但如果这三块各自存在而没有一个运行时循环把它们串起来,系统仍然不会因为运行中的经验而成长。Dynamic Learning 就是这个循环本身。
具体来说,一次完整的 Dynamic Learning 循环包含五个环节。感知与预测:World Model 基于当前状态和目标,预测行动后果。执行与观察:策略层选择行动,在环境中执行,获得结果。证伪与评估:Verifier 对结果做检验,看预测与现实的偏差是什么,这个偏差的信用如何在多步决策中分配。写入与巩固:mHC 根据评估结果决定哪些经验值得持久化、写入哪个层级,以及是否触发策略更新。调度与规划(Nested Learning):基于当前记忆缺口和世界模型的不确定区域,生成下一轮学习目标,系统由此从被动消费外部数据转向主动构造 curriculum。
RL 在这个循环中的角色是门控机制:它从后训练工具变成了决定"这次经验值不值得改变未来行为"的仲裁者。它负责回答:哪些反馈值得被长期保留,哪些错误只是局部噪声不应被固化,哪些经验足以推动策略更新。
第 5 步的 Nested Learning 是这个循环区别于普通 RL 的关键。在传统 RL 中,任务分布由环境或人类提供;在 Nested Learning 结构中,系统内部不同层级协同生成学习目标:高层模块根据当前目标、世界模型不确定性与记忆缺口提出 exploration target,中层展开为可执行子任务与验证计划,低层与环境交互、回收反馈。系统第一次获得"自己决定下一步学什么"的能力雏形。Nested Learning 的难点在于:高层任务若缺乏约束,系统会产生大量低价值目标;世界模型若不稳定,自生成任务会偏离真实问题空间;门控若太松,错误经验会被系统性固化。因此它必须与 World Model、Verifier 与 mHC 深度耦合,不能独立运转。
核心工程难题是信用分配与安全边界。一个复杂任务涉及多步决策与延迟奖励,需要决定每一步对最终结果的贡献。价值评估若不稳定,学习就会被错误梯度牵引;环境若非平稳,旧经验可能迅速失效;探索若缺乏边界,系统会以不可接受的成本试错。
Dynamic Learning 能够从"持续调形"走向"持续成长"的前提是:World Model 提供低成本的反事实试验场(不用每次都在真实环境中付出代价),Verifier 提供硬反馈信号,人类偏好这种软信号不在其列,Engram/mHC 提供正确的写入层级和错误隔离能力。三者缺一,这个循环就无法稳定运转。
系统视图:Hyper Model
把上述四层拉到一张系统图中,就得到一个最小闭环形态,暂称 Hyper Model("Hyper"不代表规模,代表同时闭合三条能力缺口)。它包含五个核心组件。感知—编码层把多模态输入转化为统一表征,过滤噪声;世界模型层维护环境内部状态,支持预测、反事实推理与 imagined simulation;记忆管理层由 Engram + mHC 构成,负责分层的写入与读取、巩固与遗忘,以及版本化;策略—执行层基于状态、目标与记忆生成行动,调用工具与环境交互;验证与学习门控层做一致性、约束与可验证性检查,决定经验如何写入记忆、哪些触发策略更新,并基于 Nested Learning 生成后续学习目标。
信息流:感知编码 → 世界模型构建内部解释并预测 → 策略层生成行动 → 验证层对结果证伪与筛选 → 记忆层持久化经验 → 反过来影响未来感知与策略。Nested Learning 在此之上持续生成适合当前能力边界的新任务分布。
在这个结构中,语言模型不再承担全部智能职责。它更适合作为表达、抽象与接口层存在,记忆本体、世界模型与学习系统的宿主角色需要更专门的结构来承担。
与当前 Agent 的根本差异在于三点:错误被内部机制吸收并影响未来行为;经验进入分层记忆系统,一次性消费被排除;推理的目标从高概率转向可验证与可证伪。
8.3 实证锚点:AlphaGo 与 AlphaFold
这不是纯粹的理论构想。在若干专门领域,这种闭环已经局部成立。
AlphaGo 的成功来自规则完全明确、状态可枚举与结果可验证,以及自我对弈能够持续生成高质量学习轨迹。围棋环境本身构成了近乎完美的硬约束闭环:世界模型明确(围棋规则本身就是 World Model),验证器天然存在(胜负判定),Nested Learning 以自博弈与 curriculum 的形式显式成立。
AlphaFold 的成功来自另一种闭环:蛋白质结构受物理化学规律约束,进化共变信息提供额外的结构线索,结构预测可以被 X-ray、Cryo-EM 等实验手段验证,借助明确的评估指标(RMSD、GDT-TS),错误预测可以直接指导模型改进。
这两个案例证明:一旦问题空间具备明确约束、可验证目标与持续学习闭环,智能系统就会呈现出完全不同于纯语言生成的能力形态。
但通用 Innovator 仍需跨越关键鸿沟。其一是约束的普遍性:围棋与蛋白质都有明确、固定的规则,真实世界的大部分问题缺乏如此清晰的约束。其二是反馈的可靠性:围棋胜负、蛋白质结构都有客观判定标准,许多真实任务的成功标准存在主观性与模糊性。其三是世界的开放性:围棋棋盘是封闭环境,真实世界持续变化,新情况不断出现。
从封闭、确定且可验证的环境,走向开放、动态而模糊的真实世界,这是从专门领域 Innovator 到通用 Innovator 之间最大的工程跨度。
九、写在最后
Transformer 通过 Attention 机制解放了并行训练,规模化预训练 + SFT + RLHF 把 LLM 从语言模型推向了通用工具;多模态与 System 2 推理进一步扩展了能力面和推理深度;Agent 化让模型从生成文本走向执行任务;但在可靠性、记忆积累和持续学习三个维度上,当前范式暴露出了结构性的天花板。
这些天花板不会因为模型更大、数据更多,或是推理更长而自然消失。它们指向的是一个更根本的问题:概率生成 + 参数记忆 + 离线训练,这三条基本假设的组合无法支撑一个"会成长"的系统。
Innovator 的设想形态可以概括为:World Model 做预测、Verifier 做证伪,Engram/mHC 做持久化、Dynamic Learning 做运行时闭环,它是对这个问题的一种工程分解。它提供的是一个分析框架:评估一个新技术方向时,可以追问它在填哪条缺口,填到什么程度,代价是什么。
对工程实践来说,有几个可以立即使用的判断尺度:
- 一个 AI 系统如果不具备跨会话的经验积累能力,它再强也只是一次性工具。对它的预期应该是"每次都从零开始,但每次都做得足够好"。
- Agent 在有验证机制的结构化任务上值得投入;在验证机制模糊的开放任务上,human-in-the-loop 仍然是必要的风控手段。
- Test-Time Compute 可以换来更高的单次准确率,但它换不来成长。需要区分"用更多计算做得更好"和"因为经历过而做得更好"。
- 对于具备硬约束和可验证目标的垂直领域(coding、数学与物理仿真),Innovator 级能力可能比通用场景更早出现。
技术路径的具体走法会随工程实践修正,但判断方向时,追问"能力从何而来、边界在哪、缺什么"仍然比追踪任何一个具体模型发布更有用。
