"大模型不会推理,但AI系统可以":Dan Roth谈从模型到智能体的范式转移

09/03/2026

大模型究竟能不能推理?

Oracle首席AI科学家Dan Roth的回答比大多数人想象的更严格。在近期与澳鹏的对谈中,Roth提出:许多AI领域最棘手的问题,已不再是模型层面的问题,而是系统层面的问题。一个LLM可以生成恰好得出正确答案的token序列,但这与“推理”的形式意义之间存在根本区别。本期AppenTalk,一起来探讨。

推理与生成:一条严格的界线

Roth对推理的定义极窄:一个推理问题,必须存在可以通过形式系统推导或证明的答案。在此定义下,仅靠LLM无法解决所有类型的推理问题,但一个AI系统可以。

区别在于:LLM可理解问题、将其转化为合适表征,并将计算委托给求解器(solver),应被理解为完整系统的能力,而非模型本身的属性。这要求提问方式从“这个模型能推理吗?”转向“这个系统能可靠判断何时需推理、调用正确机制并验证结果吗?”

推理问题必须有一个能通过形式系统推导或证明的答案。——Oracle首席AI科学家 Dan Roth

从模型到系统:智能体的架构演进

当前AI智能体正将模型与外围架构分离。架构可包含模型、工具、检索系统、专用求解器、规划机制、内存、权限和编排层(orchestration layer)。

Roth指出:有些问题需要LLM不具备的计算能力;不同任务需不同上下文;隐私和治理要求可能限制信息访问。即便上下文窗口不断扩大,把一切塞入单一上下文也无法造就最强系统。因此,核心问题不仅是底层模型能力,更是责任如何在系统组件间分布。

检索为何是难题

当AI需要的信息不在模型权重内,检索便至关重要。Roth认为检索困难在于:用户表达信息需求的方式,与信息在数据源中的呈现方式常常不一致。企业数据加剧了问题:表格名称复杂、重要信息分散且可能相互矛盾等等。

一种方法是语义增强(semantic enrichment):在运行时前向数据添加描述、摘要、元数据,使检索系统拥有更优表征。这引出了关键的系统设计问题:哪些工作应离线准备,哪些应由智能体在运行时执行?

评估的转向:从模型到编排层

在对谈中,Roth提出“失败可见性”的问题:若模型答错已知答案的问题,失败是显而易见的;但若智能体执行诸如财务分析、多系统查询等用户无法独立验证的信息,同样的失败可能根本不可见。

这要求系统不仅依赖离线基准测试,还需运行时监控(runtime monitoring)与验证。随着智能体系统纳入更多组件,仅评估最终模型输出已不足以揭示成败原因:路由决策、工具选择、检索、上下文构建、模型选择、验证等环节都是至关重要的。智能体评估正逐步转向对编排层本身的评估。