Agent框架演变:从模型包裹到人类注意力接口

文章探讨了AI智能体框架(Harness)的演变,指出其从外部包裹模型的工具,逐渐被模型吸收能力,并最终演变为管理人类注意力的接口。作者认为,随着模型能力增强,未来框架的核心将是协调稀缺的人类注意力资源,而非约束模型本身。

导语

自2025年末智能体开始真正“可用”以来,AI界一直在探寻其突破的原因。本文作者Dan McAteer提出,这并非单一模型能力的跃升,而是模型与包裹它的“框架”(Agent Harness)协同演进的结果。框架从最初笨拙的外部工具,逐渐被模型吸收其能力,最终将演变为一个管理人类稀缺注意力的“注意力接口”。这一演变历程,揭示了AI智能体未来发展的核心逻辑。

大纲与深读 5 章

展开「深读」看每一段讨论的问题与论据。

01

引言:代理能力的突破

  • 2025年圣诞前后,AI工程师发现代理开始有效工作,原因尚难精确界定。
  • 核心论点是模型能力与外部封装(Harness)的改进曲线在恰当时刻交叉。
  • 这一动态预示未来趋势:模型会持续吸收封装能力,剩余部分将转为管理人类注意力的界面。
深读这一段

讨论的问题:是什么导致AI代理在2025年圣诞前后开始有效工作?

论据 / 案例:引用了Transformer发明者Lukasz Kaiser在“Unsupervised Learning”播客(2025年6月)中的评论,描述了那个难以归因的“大跃进”。

02

定义代理封装(Harness)

01:54
  • 代理封装是模型权重之外,使代理工作的一切:环境、工具、上下文和护栏。
  • 它让模型得以从“培养皿中的大脑”状态突破,与真实的数字信息空间交互。
  • 封装赋予模型感知(上下文)、行动(工具)、持久化信息(记忆)和执行边界(权限)的能力。
深读这一段

讨论的问题:什么是代理封装?它的核心作用是什么?

论据 / 案例:用“给模型的大脑一个身体”的比喻来解释封装的必要性。

03

封装1.0:捆绑与实验期

02:48
  • ReAct(2022年10月)是首次在提示层面定义代理循环(推理-行动-观察),但仅是纸面封装。
  • AutoGPT/BabyAGI(2023年春)过早赋予模型全自主权,但模型能力不足,导致误差被放大,成功率极低。
  • Cursor/Copilot(2023-2024)转向“人在环中”模式,将循环控制交给人类以弥合能力差距。
  • Claude Code(2025年2月)抓住模型能力超越封装的拐点,首次在合适时机重新赋予模型自主权。
深读这一段

讨论的问题:代理封装的早期演变经历了哪些关键阶段和策略转变?

论据 / 案例:提及Answer.AI对Devin的测试显示其约15%的成功率;Claude Code在六个月内达到约10亿美元的年化收入(ARR)。

04

封装2.0:协同训练期

05:25
  • 当前封装的重要性可被量化:Harness-Bench显示同一模型在不同封装下,任务得分可有23.8分的巨大差异。
  • 强化学习已移至封装内部(如codex-1),模型与封装曲线开始交织并融合为统一系统。
  • 模型开始将封装能力吸收进自身权重(如自动上下文压缩),使封装得以简化。
  • 衡量封装进化的标准变为:在保持能力不变的前提下,能删除多少封装代码。
深读这一段

讨论的问题:当前阶段,模型与封装的关系发生了什么根本性变化?

论据 / 案例:OpenAI在ARC-AGI-3上仅通过增加“保留推理和压缩”封装,使GPT-5.6 Sol的得分从13.3%三倍增至38.3%;Anthropic团队最近删除了Claude Code 80%的系统提示。

05

封装3.0:注意力时代

08:02
  • 未来,所有能被模型吸收的封装能力(如多代理编排、工具选择、记忆)都将被吸收。
  • 吸收过程不会终结封装,而是会反转封装,使其成为代理与人类操作者之间的界面。
  • 剩余的封装将专注于管理人类中心的稀缺资源:权限、身份、信任和可解释性。
  • 这一新界面将管理代理何时可以打扰人类、何时应自行运作以及需要人类批准的决策。
深读这一段

讨论的问题:当模型持续吸收封装能力后,代理封装的最终形态会是什么?

论据 / 案例:引用了Latent Space播客中Ryan Lopopolo的观点:“唯一根本稀缺的东西是团队同步的人类注意力”;预测一年内,每家构建代理AI的公司都会发布类似AGENTS.md的“人类注意力策略文件”。

金句

  • "The answer to 'What happened?' isn't solely in the model weights. It's in the system that grew up around the weights." ——“到底发生了什么?”的答案不完全在于模型权重,而在于围绕权重发展起来的整个系统。
  • "Harness-Bench ran the same model over the same 106 tasks in different harnesses, and scores ranged from 52.4 to 76.2: a 23.8-point spread with zero change to the model." ——Harness-Bench用同一个模型在不同框架下完成相同的106项任务,分数从52.4到76.2不等:在模型本身毫无变化的情况下,产生了23.8分的差距。
  • "The only fundamentally scarce thing is the synchronous human attention of my team." ——“唯一真正稀缺的东西,是我团队同步的人类注意力。”
  • "What do the model weights absorb next? ... What's left at the end of this deletion and absorption process are the human-centric agent capabilities. Things like permissions, identity, trust and legability." ——“模型权重接下来会吸收什么?……在这个删除和吸收过程结束后,剩下的是以人类为中心的智能体能力。比如权限、身份、信任和可解释性。”
  • "The harness becomes the model's interface to our human attention. It becomes the attention-interface." ——“框架变成了模型与我们人类注意力之间的接口。它成了‘注意力接口’。”

原文链接

查看完整访谈

=== SUGGEST 无

完整内容见原文:Latent Space · Agent框架演变:从模型包裹到人类注意力接口