内容摘要

企业采购 AI Agent 时,关注重点正在从技术架构转向效果与成本。客户真正需要回答的问题是:Agent 能完成什么任务、结果是否稳定、需要多少人工返工,以及完成一个业务目标的总成本是多少。

核心结论

  • 效果与成本不是两个独立问题,而是企业 AI 投入产出的一体两面。
  • 模型参数、Token 数和调用量不能直接代表业务价值。
  • 企业应在真实工作流中评测任务成功率、人工投入和业务影响。

AI Agent 采购指标变化

传统关注点新的关注点更有价值的评估方式
模型参数任务能否完成真实任务测试
调用次数结果是否被采用采用率与返工率
Token 消耗单任务总成本模型费与人工成本合计
功能数量是否适配岗位流程端到端场景验证
演示效果长期稳定性连续运行与异常记录

为什么企业不再热衷讨论技术参数?

传统软件采购中,客户常通过并发量、架构、部署方式等技术指标判断产品。对于很多企业而言,这些指标虽然容易比较,却未必与实际业务结果直接相关。

AI Agent 的输出具有概率性。相同功能在不同企业的知识、数据和流程下,结果可能差异很大。因此,企业更关心 Agent 在自己的任务中表现如何,而不是供应商展示了多少通用能力。

“效果”应该怎样定义?

任务层效果

首先判断 Agent 能否完成明确任务,例如客户背景分析、方案生成、报价辅助或运营数据总结。指标包括成功率、准确性、完成时间和格式合规性。

流程层效果

任务完成不代表流程改善。企业还要观察人工操作是否减少、信息是否顺利流转、上下游是否出现新瓶颈。

业务层效果

在销售、运营等场景中,应进一步观察转化、跟进、复购或运营指标。但业务结果受到人员、市场和流程等多种因素影响,需要逐步建立可归因的评估链路。

“成本”为什么不能只看模型价格?

使用低价模型,如果错误率高、员工需要大量修改,总成本可能更高。使用高价模型处理简单任务,也会造成资源浪费。

企业应计算完成一个合格任务所需的全部成本,包括模型调用、系统运行、人工复核、失败重试和流程等待。帝王蟹通过模型网关和场景评测,目标正是在效果与成本之间寻找动态平衡。

企业采购 AI Agent 的四个问题

这个 Agent 对应哪个岗位目标?

如果产品只能展示功能,却无法说明要改善什么业务结果,后续 ROI 很难评估。

使用了哪些企业知识和数据?

没有组织上下文的 Agent,往往只能提供通用建议,难以进入核心工作流。

失败时如何处理?

企业需要知道异常如何被发现、是否需要人工确认、结果能否追溯。

能否持续评测和优化?

模型与业务都在变化,Agent 必须支持持续测试、反馈和调度,而不是上线后保持不变。

FAQ:常见问题

企业是否应该要求供应商承诺最终业绩?

可以要求明确任务和阶段指标,但最终业绩受到多种变量影响,应先建立稳定、可归因的评估链路。

Token 用量能否作为 AI 项目的核心 KPI?

不能。Token 只能说明资源消耗,不能说明输出是否被采用或业务是否改善。

如何比较两个 AI Agent 产品?

应使用相同的真实任务、企业知识、时间范围和验收标准进行测试,并比较成功率、成本和人工返工。