从“AI平权”到“可信执行”:LLM与Agent的下一阶段

作者:CherryYang 发布时间: 2026-09-29 阅读量:0 评论数:0

从“AI平权”到“可信执行”:LLM与Agent的下一阶段

摘要

如果把过去十余年的 AI 发展放在一起看,LLM 带来的变化远不止参数规模的增长和模型能力的提升。更值得关注的是,人类调用计算智能的接口也随之发生了变化。

传统机器学习要求人先把问题转换成特征、标签、模型和程序;LLM 则允许人直接用自然语言描述目标,让模型完成中间的大量转换工作。Andrej Karpathy 在 《Software Is Changing (Again)》 中把这一变化称为 Software 3.0:自然语言开始成为一种新的编程接口,LLM 则像一种可以通过语言操作的计算机。[1]

因此所谓“AI 平权”,更准确地说是一种智能调用权和软件创造权的下沉。过去只有算法工程师能够把一个自然语言需求转换成机器能力,现在普通程序员乃至非程序员也能做到这一点。

但这只是第一阶段。

随着 AI 从“给答案”进入“执行任务”,真正困难的问题开始从模型内部转移到模型外部:它有没有理解正确目标?调用了什么工具?看到的系统状态是不是真实的?一次操作超时以后究竟有没有生效?失败后能不能安全重试?生成的结果谁来验证?什么时候应该停止并交给人?

这意味着下一阶段 AI 的主线很可能不再只是继续提升模型 IQ,而是建立一套让不完全可靠的智能体能够可靠行动的计算系统。

从这个角度看,LLM、Agent、世界模型、强化学习和最近出现的 Jev 一类决策模型,并不是几条互斥路线。更可能出现的是一个异构智能体系:LLM 负责理解、推理和通用交互,Agent Harness 与 Runtime 管理状态和执行,专用模型处理高频结构化判断,世界模型承担与物理环境有关的预测,而验证与恢复系统负责把概率性的智能能力转化为可信的现实行动。


一、LLM带来的接口平权

前 LLM 时代的 AI 有一个长期存在的特点:模型能力和普通用户之间隔着一整套专业转换过程。一个业务需求首先要被算法工程师定义成任务,然后设计数据、标签和特征,再选择网络结构、训练模型、部署推理服务。即使最终效果很好,普通用户接触到的往往也只是推荐结果、搜索排序或者视觉识别结果。

LLM 改变了这层关系。人第一次可以直接把自己的意图表达给一个通用模型,而无需提前把问题彻底形式化。Karpathy 对 Software 1.0、2.0 和 3.0 的划分恰好描述了这一变化:Software 1.0 的程序由人显式编写,Software 2.0 的程序更多体现在神经网络权重中,到了 Software 3.0,人开始直接使用自然语言控制模型完成任务。[1]

因此今天的 vibe coding、自然语言数据分析、AI 写作、AI 搜索和大量 Agent 应用,其实共享着同一个基础:**“如何告诉机器做什么”的成本下降了。**过去很多需求需要先被翻译成代码、规则或者训练任务,现在自然语言本身就可以成为接口。

François Chollet 在 《On the Measure of Intelligence》 中对“模型会做很多任务”能否直接等同于智能提出过质疑。他认为,已有知识、训练数据和经验都可以提高模型在既定任务上的表现,因此评价 intelligence 还要考虑系统面对陌生任务时获取新能力的效率,也就是 skill-acquisition efficiency。[2] 这种批评很重要,但它并不影响 LLM 作为一种新接口已经产生的影响。数据库没有解决“知识是什么”,操作系统也没有回答“计算是什么”,它们仍然因为降低了复杂能力的使用成本而改变了软件世界。LLM 所做的事情有一定相似之处:它把大量“从人的意图到计算过程”的转换,变成了一种通用能力。

所以这里所谓的 AI 平权,可以先放在一个很具体的层面理解:能够调用智能的人变多了。


二、从Chatbot到Agent:AI开始执行任务

Chatbot 阶段有一个很自然的边界:模型主要产生信息。它可能写错一段文字、生成有问题的代码或者给出一个错误答案,但在人采取下一步行动之前,现实世界通常没有发生变化。

Agent 把这条边界向前推进了一步。当模型开始调用 shell、数据库、浏览器、GitHub、邮件系统和各种 API 后,一个 token 序列最终可能对应代码提交、文件修改、数据库写入、资源创建或者生产系统变更。模型由此进入一个持续循环:观察环境,根据当前状态决定下一步行动,通过工具改变环境,再读取新的反馈继续处理任务。[3]

这种循环可以简单表示为:

Observe → Decide → Act → Observe again

不同 Agent 可以在其中加入 planning、memory、subagent、reflection,也可以保持非常简单。重要的是,模型开始拥有行动能力,任务也从单次问答扩展成了一段持续运行的过程。

当前 Agent 工程的发展已经明显反映出这个变化。Anthropic 在 《Trustworthy agents in practice》 中把一个实际运行的 Agent 拆成 model、harness、tools 和 environment 等部分,并讨论这些部分如何共同影响系统行为。[3] OpenAI 的 《Introducing the Agents API》 则把 context management、tool use、subagents 和执行环境放进统一的 Agent 基础设施中。[4]

长时间任务会进一步暴露这类问题。Anthropic 在 《Effective harnesses for long-running agents》 中发现,当 coding agent 跨越多个 context window 工作时,模型容易丢失此前状态、一次承担过多任务,或者过早判断工作已经完成。为此,他们引入 initializer agent、feature list、progress file 和显式的状态交接。[5]

这说明 Agent 的表现已经很难完全归结为“底层模型够不够强”。同一个模型接入不同的工具、上下文管理方式和运行环境,最终能够完成的任务会有明显差异。过去几年里研发重心从“如何训练一个更好的模型”逐渐延伸到“如何让模型长期工作”,Agent Harness 也因此从一层简单的胶水代码逐渐变成独立的工程问题。


三、从执行到委托:验证为什么开始成为瓶颈

Agent 获得行动能力以后,下一个问题很自然地出现了:我们究竟敢把多少事情直接交给它?

代码是观察这个问题的一个好例子。代码拥有编译器、类型系统、单元测试、lint、静态分析和 benchmark,这些工具都可以给 AI 提供相对明确的反馈,因此软件开发被认为是 Agent 最容易率先成熟的领域之一。但即使在这里,从“生成更多代码”到“提高整个开发流程的效率”之间仍然存在距离。

METR 在 2025 年进行了一项随机对照实验,让 16 名有经验的开源开发者在自己熟悉的项目里完成 246 个真实任务。在当时的工具条件下,允许使用 AI 后,参与者平均完成任务的时间增加了 19%;更有意思的是,开发者自己仍然认为 AI 提高了效率。[6] 这个结果只适用于那批开发者、任务和 2025 年初的工具,不能外推成“AI 会降低开发效率”。到了 2026 年,METR 再做类似实验时又遇到了新的问题:越来越多开发者已经不愿意参加“不允许使用 AI”的实验组,选择偏差开始影响实验结果。[7]

这两件事放在一起,更值得关注的其实是生成能力和验证能力之间的关系。假设一个工程师原来每天写 500 行代码,同时有能力认真检查这 500 行;Agent 现在可以一天生成 5000 行,但测试、review 和问题定位的能力没有同步提高,多出来的代码就不会自动变成生产率。AI 可以极大提高候选方案和执行动作的产生速度,但人类审核能力并不会按照同样速度增长。

METR 在解释 Agent time horizon 时也专门提醒过类似问题。一个模型拥有 X 小时的 50% task-completion horizon,并不意味着所有低于 X 小时的任务都可以直接交给它。对于高可靠性任务,50% 的成功率几乎没有意义,即使成功率已经很高,失败后的检查和修复仍然需要计算在总成本里。[8]

这也解释了为什么 human in the loop 很难简单地随着模型进步而消失。如果 Agent 的每一个输出、每一次操作都需要人重新确认,那么 Agent 的吞吐量越高,人的审核压力也会越大。长期来看,更可扩展的方式很可能是让机器完成越来越多常规检查,把人留在异常、边界和高风险判断上。

这一点和“AI 平权”直接相关。第一阶段的平权解决的是“普通人能不能使用 AI”,Agent 开始触及第二个问题:普通人能不能把任务交给 AI,而不需要自己重新做一遍检查工作。如果后者做不到,AI 会成为一个很强的辅助工具,但任务责任仍然牢牢留在人身上。


四、模型之外:Agent正在变成一个系统问题

当 Agent 开始承担更长、更复杂的任务以后,很多传统软件系统里的问题都会重新出现。一个持续工作的 Agent 要知道当前有哪些上下文、调用过哪些工具、外部环境现在处于什么状态,还要处理权限、并发、超时、失败和状态持久化。模型负责其中最开放、最难形式化的一部分决策,但整套系统很难依赖模型临场判断完成所有事情。

这也是 AI-native workflow 和“旧流程里插入一个模型”之间的差别。Arvind Narayanan 和 Sayash Kapoor 在 《AI as Normal Technology》 中讨论电气化时提到,早期工厂只是用电动机替换蒸汽动力,生产率提升并不明显;后来工厂开始围绕电力重新设计生产线和组织方式,技术优势才逐渐释放出来。[9] AI 很可能也会经历类似过程。如果原来的流程是 A → B → C → D,把它改成 A → AI → 人审核 → B → AI → 人审核 → C,局部速度虽然变快,整体流程未必得到同样幅度的改善。

因此 Agent 的发展会逐渐涉及人和机器职责的重新划分。模型可以处理模糊需求、开放式推理和非结构化信息,传统软件继续负责权限、事务和确定性逻辑,系统可以通过测试、规则或者其他模型检查部分结果,人则处理机器难以可靠判断的异常和风险。不同场景的分工不会相同:一个写邮件草稿的 Agent 几乎不需要复杂恢复机制,一个能够修改生产数据库的 Agent 则显然需要更严格的权限、日志和状态检查。

Verification、checkpoint、retry 和 rollback 可以放在这个背景下理解。它们没有必要成为所有 Agent 的固定结构,而会随着任务时间、执行权限和失败成本增加而逐渐出现。人们今天敢把重要业务运行在数据库、分布式系统和云平台上,也并非因为这些系统永远不会出错,而是因为长期的软件工程发展形成了事务、权限、日志、监控、备份和恢复等机制。

Agent 以后如果承担越来越完整的工作,很可能也要经历类似过程。这里的目标并不是让模型永远不犯错,而是让错误发生以后,系统仍然知道发生了什么、影响到哪里,以及接下来应该怎样处理。所谓“可信执行”,可以先放在这个很具体的层面理解。


五、LLM之外,AI还会沿哪些方向发展

讨论 Agent 的系统问题,并不意味着模型本身已经接近终点。目前的证据仍然显示 LLM 和 Agent 能力在持续提高。Stanford 2026 AI Index 显示,前沿模型在 Humanity’s Last Exam、OSWorld 等测试上仍有明显进步;METR 的 Agent task-completion time horizon 也持续增长,以至于旧测试集已经越来越难区分新的前沿模型。[8][10]

只是能力提升的方式已经比早期单纯扩大参数和训练数据复杂得多。Instruction tuning、RLHF、reasoning、test-time compute、RL with verifiable rewards、tool use 和 agentic training 都逐渐加入进来,最近的讨论又开始转向模型怎样从长期环境交互中学习。

David Silver 和 Richard Sutton 在 《Welcome to the Era of Experience》 中提出,当前大模型仍高度依赖 human-generated data,而长期运行的 Agent 可以通过与环境持续互动产生自己的 experience,并根据行动后果继续学习。[11] 这条路线把学习从静态训练集延伸到了持续运行的过程。LLM 可以继续承担 reasoning 或 policy 的角色,但能力来源会逐渐加入真实环境反馈。

Yann LeCun 所推动的 world model 则面向另一类问题。语言包含大量世界知识,却很难完整覆盖人和动物通过视觉、行动和长期互动形成的物理直觉。Meta 的 《V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning》 尝试通过大规模视频学习世界状态,再利用少量机器人轨迹进行 action-conditioned planning。[12] Google DeepMind 的 《SIMA 2》 则让 Gemini 在 3D 环境中观察、行动,并使用交互经验继续学习。[13]

物理 Agent 和软件 Agent 在这里会出现很明显的差别。机器人很难直接查询“现实世界当前状态”,它必须通过摄像头、传感器和模型推断环境;软件 Agent 操作的 API、文件系统、数据库和代码仓则天然提供大量数字化状态。Coding Agent 修改代码以后可以重新读文件、运行测试,运维 Agent 执行命令以后也可以再次查询服务状态。两类 Agent 都需要理解环境,但物理世界更依赖感知和预测,软件世界则更依赖状态读取、工具语义和执行控制。

还有一类方向关注更窄的机器决策。TypeSafe 在 2026 年发布 《Introducing System One Models & Jev》 时,把 Jev 设计成只输出 choice、score 和 probability 等结构化结果的模型。[14] 它反映出的一个问题值得关注:Agent 内部很多任务只是工具选择、分类、风险判断或者有限选项决策,并不一定需要经过完整的自由文本生成。Function calling、constrained decoding、传统分类模型和各种 symbolic solver 其实都在解决类似问题,只是方式不同。Jev 目前仍然很早期,关于 calibration 的独立验证也有限,Learn Jev 的测试 就显示它在不同数据集上的表现并不一致。[15]

这些方向目前看不到一个明确的赢家,也没有必要强行把它们放进同一条路线。LLM 擅长开放语言和跨领域知识,world model 关注物理环境,experience learning 关注长期交互,专用模型处理边界更清楚的判断,传统软件继续承担确定性逻辑。未来的 AI 很可能会同时使用其中几种能力。


六、AI平权的下一步,可能是任务委托

回到最开始的“AI 平权”,这条线现在可以看得更清楚一些。

ChatGPT 首先降低了使用智能的门槛。用户不需要学习一种新的编程语言,也不必理解模型内部结构,只要能够表达需求,就可以调用过去需要专业人员才能提供的一部分能力。随后出现的 vibe coding、Agent 和各种 AI-native 开发工具又降低了创造东西的门槛,一个普通开发者能够完成的工作范围明显扩大。

Agent 开始推动第三层变化:从“帮我完成某一步”逐渐走向“这件事交给你”。生成一份文档以后,人可以直接阅读结果;一个 Agent 如果连续工作几个小时,期间调用几十个工具、修改多个文件或者操作外部系统,人已经很难再逐步检查整个过程。任务越长,委托和辅助之间的区别就越明显。

这种委托能走多远,很大程度上取决于系统怎样处理失败。一个只能靠用户重新检查全部结果来建立信心的 Agent,能够节省的时间始终有限。如果 Agent 可以被限制在明确的权限范围内,执行过程能够被记录,关键结果可以自动检查,失败以后能够停止、重试或者恢复,那么人就有机会从逐步审核转向处理异常。

这可能是“AI 平权”下一阶段一个很现实的方向。它关注的已经不只是“多少人可以调用 AI”,还包括“多少人可以把以前必须亲自盯着完成的任务交出去”。前者主要依赖模型能力和交互接口,后者还需要 Agent 周围整套系统逐渐成熟。

因此,未来 AI 的进步可能会沿两条线同时展开。一条继续提高模型的推理、泛化、感知和学习能力,另一条让这些能力能够在真实环境里持续、可控地运行。前者决定 Agent 可以处理多难的问题,后者影响人们愿意把多重要的任务交给它。

这也是本文所说“可信执行”的含义。它并不预设未来 Agent 必须采用某一种固定架构,也不要求所有错误都能提前避免。它更关心一件具体的事情:当模型开始替人行动以后,我们能否在不过度依赖人工审核的情况下,知道它做了什么,并把错误限制在可以接受和处理的范围内。


结语

LLM 已经带来了一次明显的 AI 普及。自然语言成为接口以后,调用计算智能的门槛迅速下降,原本高度集中在算法和软件团队里的能力开始扩散到更多开发者和普通用户。无论未来 AI 最终采用什么技术路线,这一步已经发生。

至于 Transformer 和 autoregressive generation 会不会长期处在 AI 的中心,现在还很难判断。Chollet 关注陌生任务上的 skill acquisition;Silver 和 Sutton 把长期环境交互视为新的学习来源;LeCun 和 V-JEPA 系列试图让模型建立对物理世界的预测能力;Jev 一类尝试则重新讨论结构化判断是否需要经过自由文本生成。[2][11][12][14] 这些工作面对的是不同问题,也很可能在未来长期共存。

Agent 的出现又把问题推到了软件系统这一层。模型开始拥有工具、状态和执行权限以后,AI 的能力已经越来越难只由一次推理的质量决定。Context、tool、memory、environment、permission、verification 和 recovery 都会影响一个 Agent 最后能够承担多长、多少风险的任务。

如果一定要借用一个计算机系统的类比,LLM 也许更像未来 AI 系统中的通用计算核心。它很重要,但一套能够长期工作的系统还需要状态、工具、运行环境和各种配套机制。今天围绕 Agent 出现的 Harness、Runtime、Memory 和 Verification,可以看作这些系统能力正在逐渐形成的迹象。

从这个角度看,LLM 带来的平权还没有结束。第一步是让更多人能够使用智能,下一步可能是让更多人能够创造智能应用,再往后,则是让人可以放心地把一部分工作交给机器。

这一步如果能够成立,AI 才会从一个越来越强的工具,逐渐变成可以被长期委托任务的计算系统。


参考资料

[1] Andrej Karpathy, Software Is Changing (Again), YC AI Startup School, 2025.

[2] François Chollet, On the Measure of Intelligence, 2019.

[3] Anthropic, Trustworthy agents in practice, 2026.

[4] OpenAI, Introducing the Agents API, 2026.

[5] Anthropic, Effective harnesses for long-running agents, 2025.

[6] METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity, 2025.

[7] METR, We are Changing our Developer Productivity Experiment Design, 2026.

[8] METR, Clarifying limitations of time horizon, 2026.

[9] Arvind Narayanan, Sayash Kapoor, AI as Normal Technology, 2025.

[10] Stanford HAI, 2026 AI Index Report: Technical Performance, 2026.

[11] David Silver, Richard S. Sutton, Welcome to the Era of Experience, 2025.

[12] Meta AI, V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning, 2025.

[13] Google DeepMind, SIMA 2: An Agent that Plays, Reasons, and Learns With You in Virtual 3D Worlds, 2025.

[14] TypeSafe AI, Introducing System One Models & Jev, 2026.

[15] Learn Jev, Jev benchmarks and cost, honestly, 2026.

评论