大部分企业评估 AI Agent 平台时,第一反应是比模型、比演示效果。但真正让项目卡住的,几乎从来不是「模型不够聪明」——而是接不进现有系统、权限管不住、员工不用。把评估从「比能力」换成「比能不能落地」,需要的是另一套维度。

下面 6 个维度按「卡住项目的先后顺序」排列。每个维度都配了一个能当场问出来的验证问题,用来区分真实能力和演示技巧。

维度一:能不能接进现有系统

这是淘汰率最高的一关。智能体要产生业务价值,必须读得到 ERP、MES、CRM、工单、知识库这些真实数据源,并且能把结果写回去。演示环境里连的是准备好的样例数据,生产环境要面对的是内网、鉴权、限流、脏数据。

当场验证的问法

「能不能在我们内网测试环境里,现场接一个我们自己的系统,读一条真实数据并写回结果?」对方若开始讲「我们有丰富的接口能力」,而不是打开文档找你的接口类型,基本可以判断这一关的成熟度。

维度二:数据权限能不能管到字段级

AI 场景下最危险的不是「答得不准」,而是「答得太准」——把不该看到的数据答给了不该看的人。传统系统按菜单和按钮授权,智能体按语义检索,天然会绕过原来的权限边界。所以权限模型必须能下沉到数据行和字段,而不是停在后端接口层。

  • 能否按部门 / 角色限制可检索的知识范围,而不是全库检索后再过滤
  • 是否能对敏感字段做脱敏或直接屏蔽,且脱敏发生在模型看到数据之前
  • 是否有完整的调用审计日志,能回答「谁在什么时候让智能体做了什么」
  • 员工离职或调岗时,权限回收是否跟随原有账号体系自动生效

维度三:员工愿不愿意用

这一点最容易被技术评估忽略,却直接决定项目成败。最现实的做法不是训练用户改变习惯,而是把智能体放进他们已经在用的地方——如果公司日常协作在企业微信里,智能体就应该在企业微信里,而不是再多一个需要登录的网站。

一个需要员工额外记网址、额外登录、额外切窗口的 AI 工具,日活会在一到两个月内掉到个位数。这不是员工保守,是切换成本大于收益。

维度四:多个智能体能不能协作

单点问答的价值上限很低。真实业务流程往往是「查数据 → 做判断 → 生成文档 → 走审批」这样的链条,需要多个各司其职的智能体串起来。评估时要分清两类产品:只能一对一问答的,和能让智能体自主规划任务、互相调用、按流程交接的。

能力层级典型表现适用场景
单轮问答问答式交互,无法调用外部工具资料查询、简单润色
单智能体 + 工具能调接口、能读写文件,但一次只做一件事单环节自动化,如报表生成
多智能体协作自主规划步骤、互相调用、按流程交接与回退跨系统跨部门的完整业务链路

维度五:交付方式与数据边界

同样的产品能力,交付方式不同,合规结论可能完全相反。金融、政务、医疗这些行业通常不接受数据出域,此时要确认的是「私有化部署是不是真正的产品能力」,而不是「能不能定制开发一个私有化版本」。后者的代价是版本永久分叉,此后再也拿不到产品迭代。

维度六:服务商能陪跑多久

企业 AI 不是装完就结束的软件,前三个月的调优决定了最终效果。要问清楚:上线后谁负责调优、出问题的响应时效、是否提供分层培训、有没有明确的阶段性验收标准。合同里的服务条款比产品参数更能预测这个项目会不会烂尾。

如果你已经有一份待评估的候选清单,我们可以按这 6 个维度做一次免费的对照诊断,指出每一项的验证方式与常见话术陷阱。

获取选型对照清单

一个方法论上的提醒

不要把「先选平台再定场景」当成默认顺序。正确的顺序是:先找出 2 到 3 个高频、规则相对清晰、有明确验收指标的场景,再用这些场景去倒推平台需要具备什么能力。顺序颠倒的典型后果是——平台定了,场景却一直在「找」,最后只能拿一个无关痛痒的场景交差。