结论先行:智能体工程的门槛正在被平台快速抹平,但架构所有权同步向外转移。OpenAI宣布Agents API进入公开测试,把驱动Codex与企业版ChatGPT的同一套编排框架与基础设施对外开放——长会话自动上下文压缩、并行子智能体、工具检索与沙箱计算被打包进一次API调用,沙箱可由OpenAI提供也可客户自建或选用Vercel、DigitalOcean等合作方;计费仅按实际token与工具调用量,官方称可在1分钟内拉起智能体。早期客户数据显示,SafetyKit单案审核成本下降60%、Hypha智能体响应失败率降低86%、Cirridae评估分数从0.71提升至0.85并实现4倍延迟下降。但同一周Gartner在IT Symposium/Xpo 2026 APAC上警告“agent washing”——许多厂商只是把既有能力重新包装成智能体。企业真正要回答的不是“能不能做智能体”,而是审计日志能否导出、成本放大系数是否实测。
一次API调用里打包了什么:过去要自建的四层能力
在此之前,企业要在生产中跑一个可靠的智能体,通常需要自建四层工程设施。Agents API把这四层压缩成一次调用。
长会话自动上下文压缩
长程任务最大的工程难题是上下文膨胀。自动压缩让智能体在数十轮交互后仍保持关键状态,无需业务方自行实现摘要与记忆策略。
并行子智能体调度
复杂任务可被拆解后分配给多个子智能体并行执行,由编排层负责结果汇总与冲突处理。这一层过去往往需要企业自研任务编排框架。
工具检索与沙箱计算
工具数量增长后,“选哪个工具”本身成为问题。工具检索解决了规模化工具集的路由;沙箱则提供隔离的代码执行环境,可由OpenAI托管,也可客户自建或选用Vercel、DigitalOcean等合作方。
计费方式
仅按实际token与工具调用量计费,不额外收取编排层费用。这意味着成本模型变得简单,但也意味着成本完全随调用量线性放大。
早期数据:三个案例的收益落在哪
官方公布的早期客户结果对应三种不同价值来源,值得分开看。
SafetyKit的成本下降来自“少返工”——审核类任务的成本大头是人工复核;Hypha的失败率下降来自编排层的稳定性,而非模型更聪明;Cirridae的分数提升叠加4倍延迟下降,则同时受益于并行调度与上下文压缩。三者的共同点是:收益主要来自工程层,而不是模型层。这也是判断一个智能体项目值不值得做的参考口径——如果收益只能归因于模型能力提升,那多半还没到可规模化的阶段。
Gartner的冷水:“agent washing”与感知强、决策弱
9月14日,Gartner在IT Symposium/Xpo 2026 APAC首日议程中,由VP分析师Adrian Leow给出了更谨慎的判断。
其一,“代理式AI承诺变革,但今天的现实由炒作、有限的集成成熟度与尚在萌芽的生命周期管理能力共同塑造”。其二,随着对AI智能体的兴趣激增,许多供应商正在通过重新包装既有能力制造“agent washing”,而这些能力并不具备真正的智能体功能。其三,当前基于大语言模型的智能体能高效感知信息,但缺乏适应性,在情境化决策上仍然不足。
Gartner给出的建议与OpenAI的产品方向形成有趣呼应:企业应优先选择高频、低复杂度的用例,配套护栏,并同步提升员工技能。换句话说,把智能体当作需要培训与考核的岗位来对待,而不是当作一个更强的搜索框。
上生产前的两条硬约束
把四层能力交给平台,换来的是速度,付出的是控制力。对企业技术决策者,有两条约束必须在上生产前落实。
约束一:沙箱内的工具执行审计日志能否导出到自有SIEM。当智能体在沙箱中调用内部系统、执行代码、修改数据时,这些行为必须进入企业自身的可观测体系。若审计只能留在平台侧,一旦出现越权操作或数据外泄,企业既无法举证也难以复盘。这一条应写进采购谈判,而非上线后补作业。
约束二:并行子智能体的成本放大系数必须实测。官方口径是按实际token与工具调用量计费,但并行调度下,一次用户请求可能触发数十次子调用。放大系数不实测,预算就会失控。建议在灰度阶段用固定任务集实测单任务基线,再据此设定配额与熔断阈值。
在此之上还有一条架构原则:把模型与编排调用抽象成可路由层,把业务规则与提示词资产留在自己手里。智能体框架迭代极快,今天的主流方案两年后未必仍是主流;业务规则与提示词才是企业真正的沉淀。对缺乏自建AI团队的企业,借助杭州及长三角成熟的软件外包与AI大模型定制能力完成这层抽象,比采购成品智能体更具性价比。一道科技长期为企业提供智能体架构咨询与定制开发服务,若您正在评估智能体上生产路径,欢迎了解我们的服务或查看更多技术分析。
常见问题(FAQ)
需要保留的部分变了。上下文压缩、子智能体调度、沙箱隔离、工具检索这四层通用工程能力已被平台打包,企业自建的性价比大幅下降;但业务规则、提示词资产、工具集定义、审计与配额策略仍必须自有。判断标准是:与具体业务强相关的资产留在企业内部,纯工程性的通用能力交给平台。同时要注意架构可替换性——把调用抽象成可路由层,避免单一平台的定价与能力调整直接传导到成本端。
指供应商把原有的RPA、工作流引擎、聊天机器人等能力换个名称包装成“智能体”,但并无自主规划、工具调用与状态管理能力。识别方法有三:一是看它能否在无人干预下完成多步骤任务并自行处理异常;二是看是否存在独立的规划与执行循环,而非预编排的固定流程;三是要求提供失败率、任务闭环率、异常升级率等运营指标,而不是回答准确率。Gartner建议企业优先在高频、低复杂度场景中验证,并要求配套护栏。
计费按实际token与工具调用量,而一次用户请求在编排层可能被拆成数十次子调用,形成非线性放大。控制手段包括:灰度阶段实测单任务的平均子调用数与token区间;为每类任务设独立配额与熔断阈值;对长会话启用上下文压缩并限制最大轮次;把高成本子任务改为异步批处理。配额与熔断须在上生产前配好,而非账单异常后再补救。