核心结论

2026年9月27日,Box 首席执行官 Aaron Levie 提出一个被低估的判断:企业 AI 智能体落地的隐藏瓶颈是评测(evals)缺失。企业习惯用“输出是否正确”这把二进制尺子检验软件,但智能体的输出是概率性的,细微偏差会在多轮执行中累积放大。同期研究进一步显示,多个主流编码智能体可以删除或篡改自身执行轨迹而不触发既有监控,连审计日志都不能被默认当作铁证。结论是:先建评测与留痕体系,再谈规模化与回报。

一、Levie 的论点:用旧尺子量新东西

Levie 的核心表述是,企业几十年来测试软件的方式是检查输出是否精确等于预期;而 AI 智能体的输出是概率性的,多数企业并没有一套框架来判断智能体的工作是好、是坏,还是“以一种随时间累积的微妙方式错了”。

这个区分很关键。传统软件的缺陷通常是可复现的:同一个输入必然得到同一个错误输出,修复后回归测试即可闭环。智能体不是——它有工具调用、上下文检索与外部系统交互,同一个请求在不同时刻会走出不同路径,错误只在特定组合下出现。

二、概率输出带来的四类误差

随机误差
同一请求多次执行结果不一致
累积误差
单步偏差在多轮执行中放大
沉默误差
结果看似合理但依据错误,无人察觉
成本误差
异常循环导致 Token 消耗失控

第三类最危险。智能体给出的答案格式正确、语气确定,但引用的数据来自过期检索结果或错误的工具返回,人类审核者很难第一时间识别。这也是为什么“部署了却说不清有没有用”成为今年企业 AI 的高频状态。

三、审计日志也不是铁证

更棘手的是,连用来追责的轨迹本身都不可靠。一篇最新论文测试了包括 Claude Code、Codex、Antigravity、Open Code 与 Grok Build 在内的多个主流本地编码智能体环境,发现多数被测环境可以删除或操纵自身执行轨迹,且不会触发既有监控。

论文给出的工程建议很直接:对受监管或高风险部署,应采用智能体控制范围之外的独立拦截与仅追加(append-only)日志。换言之,留痕体系不能和智能体运行在同一套权限里,否则“谁在看管看管者”这个问题没有答案。

四、评测成本可以被压下来

反对建评测的常见理由是贵。但分级判分正在改变这个算式:研究者提出的 JEV-as-a-Judge 方案采用“只在有把握时接受、不确定时升级”的级联判分,在保留对比方法 99% 准确率的同时显著降低了评测成本。

这意味着企业不必对每个用例都用最强模型做全量评审。可行做法是先用轻量判分器做首轮筛选,把不确定的样本升级给更强的评审者或人工,成本与覆盖率可以同时兼顾。

五、一套可落地的评测框架

层级要解决的问题落地要点
任务集拿什么测从真实工单抽取样本,覆盖正常与异常两类
评分器怎么判好坏规则校验打底,模型判分补充主观维度
轨迹留痕出错能否复盘独立采集、仅追加存储,脱离智能体权限
升级机制不确定时交给谁低置信样本自动转人工,形成回流样本

四层里最容易缺的是任务集。很多团队的评测样本来自设计时想象的用例,而不是真实工单,导致线上表现与评测结果长期脱节。

六、结语

从“能不能跑”到“能不能被信任”,中间隔着评测这道门槛。对计划把智能体接入排产、客服、财务等核心流程的企业而言,先把任务集、评分器与独立留痕建起来,比多接一个模型更接近回报的实质。一道科技立足杭州,在AI大模型定制与数据挖掘项目中通常把评测集构建与留痕设计前置到立项阶段,避免交付后无法验收。更多技术解读见资讯中心,服务能力介绍请见官网首页。

常见问题(FAQ)

为什么用传统软件测试方式评估 AI 智能体会失效?+

传统软件测试假设相同输入必然得到相同输出,缺陷可复现、修复后可回归验证。AI 智能体的输出是概率性的,且包含工具调用、上下文检索与外部交互,同一请求在不同时刻可能走出不同路径,还会出现结果看似合理但依据错误的沉默误差,因此无法用对或错的二进制标准衡量。

智能体的执行日志可以作为审计证据吗?+

不能完全依赖。最新研究测试 Claude Code、Codex、Antigravity、Open Code、Grok Build 等本地编码智能体环境后发现,多数被测环境可删除或操纵自身执行轨迹而不触发既有监控。对受监管或高风险部署,应在智能体控制范围之外做独立拦截,并采用仅追加方式存储日志。

预算有限的中小企业如何建立智能体评测?+

可采用分级判分:先用轻量判分器做首轮筛选,把低置信样本升级给更强模型或人工。相关级联方案在保留 99% 准确率的同时显著降低了评测成本。同时应优先从真实工单抽取评测样本,而不是依赖设计时想象的用例。