核心结论

结论先行:企业运行AI智能体的最大成本不是模型调用费,而是「找对工具」。微软近期公布的自评数据显示,通过并行多子问题检索、集中式记忆与单一受管理端点接入工具三项改造,其智能体系统的证据召回率提升54%、检索成本下降34%;在大型工具库中改为按需搜索而非全量加载时,输入量减少约97%。同期Anthropic把缓存读取价从每百万Token 1美元降至0.25美元,高度智能体化负载成本最高降45%;Atos已向54国5.6万名员工推广,并纳管约19000个AI智能体。对企业CIO的直接含义是:AI预算的计量单位应从「每百万Token单价」改为「每完成一个业务任务的成本」,而工具清单治理必须做在模型选型之前。

成本重估:账单的大头正在从模型转向上下文与工具

过去两年企业做AI预算,习惯用输入输出单价乘以预估Token量。这套算法在问答型应用里勉强成立,换成智能体就迅速失真,原因有三:其一,智能体会自我循环,一次请求背后可能是几十轮工具调用,消耗不可线性外推;其二,为让模型理解业务,企业常把大量文档塞进上下文,上下文本身成了最贵的耗材;其三,工具目录越堆越大,全量加载工具描述会挤占输入窗口,把成本推高在看不见的地方。微软的三个自评数字恰好对应这三处:证据召回+54%解决「喂给模型什么」,检索成本-34%解决「怎么找得快又省」,输入量-97%解决「工具目录怎么瘦身」。关键在于,这三件事换任何模型都解决不了,因为它们发生在模型之外。厂商动作也印证了这点:Anthropic下调的正是缓存读取这一多轮长上下文的主要成本项,Google虽维持Gemini 3.8 Flash标价不变,第三方实测却因输出Token增加约30%、轮次更多,单任务成本反而高出约40%。标价不动不等于账单不动,这一点值得写进每份AI采购评估报告。

微软的三条工程解法与关键数据

+54%
证据召回率提升(并行多子问题检索)
-34%
检索成本下降(带引用返回)
-97%
工具库按需搜索后输入量减少
-75%
Anthropic缓存读取价下调幅度
19000个
Atos统一纳管的AI智能体数量
5.6万人
Atos推广范围(覆盖54个国家)

具体做法值得拆解。第一条是并行多子问题检索并返回引用:把一个复杂问题拆成若干子问题同时检索,而不是串行试错,既提高召回也让每条结论可溯源。第二条是面向会话、用户与流程的集中式记忆:记忆不再挂在单次对话上,而是按用户和业务流程组织,可跨会话复用,这正是缓存命中率的来源。第三条是让智能体通过单一受管理端点接入工具,由这个端点统一承载认证与访问策略,工具不必逐个暴露给模型。对企业而言,第三条最具操作性:把工具清单收敛到一个受控网关,既是成本工程也是安全工程。Atos的案例还揭示一条规律——治理工具采购通常滞后于智能体扩散约一年,等你想到要管时,待纳管对象已是不小的存量。

治理侧同步收紧:从「模型说什么」到「模型做什么」

成本之外还有一条更隐蔽的主线:治理对象正从模型的输出内容转向模型的实际动作。Snowflake推出面向智能体接入的生产控制平面,运行时动态发放凭证、智能体永不持有生产密钥,权限绑定具名用户身份并保留完整审计轨迹;ServiceNow以数亿美元收购可跨平台运行的智能体公司,其「AI控制塔」定位被市场解读为企业软件在AI时代的价值锚点。两者指向同一句话:企业最真实的焦虑不是没有智能体,而是不知道有多少在跑、在干什么、花了多少钱。同期Snowflake二季度调整后每股收益0.62美元、营收15.5亿美元双双超预期,「AI将颠覆SaaS」的叙事被重估——智能体需要数据平台提供上下文与治理,SaaS厂商反而成了必经之路。启示是:不必恐慌性重构,但要尽快明确自己在智能体链条中的位置:数据供给方、编排方还是执行方。

一道科技解读:把工具治理做在模型选型之前

结合近期项目经验,杭州一道科技给出四步落地清单。第一步,盘点已运行的未纳管智能体与工具接口:这不依赖最终选哪家控制平面,属于现在就该做的低风险动作。第二步,收敛工具目录:微软-97%的输入量削减说明工具目录规模本身就是隐性成本炸弹,把重复、低价值、无人维护的接口下线,收益立竿见影。第三步,改造计量口径:用「每完成一个业务任务的成本」替代Token单价,并在模型升级前后做同任务对照测试,否则解释不清为什么降价了账单却涨了。第四步,前置权限边界与回滚机制:涉及金额、工艺参数、对外承诺的动作保留人工确认,所有操作留痕可审计。一道科技业务覆盖AI大模型定制开发、数据挖掘与软件外包,聚焦智能制造与制造业数字化,可协助企业完成从工具盘点、数据治理到智能体部署的全链路,更多实践参见客户案例与行业资讯。

常见问题(FAQ)

为什么说智能体的最大成本不是模型?+

因为智能体的开销主要产生在模型之外:多轮工具调用带来的重复上下文、为理解业务而塞入的长文档、以及全量加载工具描述占用的输入窗口。微软自评显示,在大型工具库中改为按需搜索后输入量减少约97%,这类优化换任何模型都无法获得,属于工程侧而非模型侧的成本。

企业现在就该做的第一步是什么?+

盘点组织内已经在运行的智能体与未纳管的接口调用。这一步不依赖最终选择哪家治理平台,风险极低却能立刻摸清存量。之后才是收敛工具目录、把计量口径改为每任务成本、以及为高后果动作设置人工确认与回滚。

模型降价后,企业AI预算为什么反而可能上升?+

因为标价不等于账单。以Google Gemini 3.8 Flash为例,其输入输出标价维持不变,但输出Token增加约30%、智能体轮次更多,第三方实测单任务成本反而高出约40%。预算应按完成一个业务任务的总成本测算,并在模型升级前后做同任务对照测试。