企业对待AI的态度,正在演变成一种集体性的精神分裂。

一边是部署率的狂飙突进。Boomi委托Forrester进行的一项覆盖北美、欧洲和亚太409名技术决策者的研究显示,86%的企业已经跨越了AI代理的试行阶段。Gartner的调查同样印证了这股热潮,75%的IT应用负责人表示正在试点、部署或已经部署了某种形式的AI代理。

另一边却是信任度的断崖式下跌。上述Boomi研究中,仅34%的受访者表示信任其AI代理所采取的行动。Gartner的数据更为刺眼:只有19%的受访者对供应商防止幻觉的能力抱有“高度或完全信任”,74%的人将AI代理视为一种新的攻击向量。

于是就有了那个荒诞的职场场景:员工问过一次AI问答助手,觉得不靠谱,此后再也不碰。企业花了大价钱部署的“智能工具”,在真实业务场景中的生命周期,有时短得惊人。

问题出在哪?或许不在于AI“不够聪明”,而在于企业从未给AI一个可以安全犯错的“试错场”。

信任的悖论:越依赖,越怀疑

信任危机的数据是冷酷的。墨尔本大学与KPMG的2025年全球调查指出,超过一半的人对AI抱持戒心,在已开发国家中,仅39%的受访者愿意信任AI。更微妙的是,全球近六成员工在工作中使用AI,但超过一半的人承认违反公司政策,甚至将敏感信息输入公共AI平台。

这是一种奇特的“假性熟悉”:人们用着AI,却并不真正信任它;企业部署着AI,却对它充满戒心。KPMG报告揭示了根源——全球六成AI使用者没有接受过任何相关训练,却自认能有效使用。这种操作层面的熟练与认知层面的隔膜,造就了一种脆弱的信任:一旦AI在真实场景中犯错,信任便瞬间瓦解。

Gartner的分析指向同一个方向。该机构预测,到2028年,LLM可观测性的投资将占到所有GenAI部署的50%,而目前这一比例仅为15%。所谓“可观测性”,关注的是幻觉率、偏差、输出质量这些在传统IT监控中根本不会出现的指标。Gartner高级首席分析师Pankaj Prasad的评论一针见血:“随着企业扩展GenAI,信任需求的增长速度超过了技术本身。”

企业需要的,不是更聪明的模型,而是一个能在真实业务发生之前,就告诉它“这个AI靠不靠谱”的方法。

数字孪生是一面镜子,照出AI的适配区和禁区

多数企业对自己的业务流程存在一种集体幻觉:管理层看到的是流程图,执行层经历的是例外和变通,系统里记录的是被迫合规的操作轨迹。这三者之间的裂缝,就是AI落地失败的温床。

西门子ICX的实践指向同一个痛点:企业的知识分散在ERP、PLM、MES、质量系统里,彼此之间缺少语义连接和业务逻辑定义。AI不知道供应商是谁,不知道BOM结构有多少层,不知道一批原材料经历了哪些质检节点。在这种状态下部署AI,等于让一个从未进过工厂的人去当车间主任。

Leonardo的案例展示了数字孪生的诊断价值。这家拥有62000名员工的航空航天防务公司,在推进AI之前先做了一件事:用ARIS建立超过5000个流程模型,覆盖所有事业部,然后启动流程挖掘来量化理论流程和实际流程之间的差距。他们的质量解决方案负责人说得很直白:“流程是理论。一旦应用,并不总是按照理论执行,我们正在用流程挖掘来解决这个问题。”

这个差距恰恰是AI选型的关键依据。流程标准化程度高、偏差小的环节,AI可以安全介入;例外频繁、依赖隐性判断的环节,AI的概率性只会放大混乱。

Celonis的分析更进一步:自动化会加速流程,如果缺乏运营透明度,它也会加速错误的传播。流程数字孪生既是诊断层,也是控制层——它识别出自动化在哪里制造了摩擦而非减少了摩擦。

富士康的80/20法则

富士康董事长刘扬伟在Computex 2025上给出了一个来自制造业前线的务实判断:生成式AI可以完成约80%的任务,但剩下的20%必须由人类智慧补全。

这20%是什么?是需要触觉与判断的环节:设备异常判断、非标准品处理、安全策略调整。AI在这些场景中能力增长开始放缓,因为它们的本质是例外管理,而例外的核心特征是训练数据中不存在相同模式。

这个80/20不是精确的科学划分,但它提供了一个可操作的诊断框架:如果一个业务流程中,标准化的、可预测的任务占比超过80%,AI介入的收益可能大于风险。如果这个比例低于50%,AI大概率会成为帮倒忙的实习生。

这个判断不应该靠直觉。数字孪生可以用历史数据回测:过去六个月中,这个环节的任务有多少是标准模式,多少是例外处理?例外的处理依据是什么——规则手册,还是个人经验?如果答案是后者,AI需要先等业务本身被重新设计。

业务本身可能需要先改

日经的文章指出了一个反直觉的事实:AI导入初期最常见的失败,是把现有业务原样交给AI。

“这个审批流程的确认工作能不能自动化?”这个需求听起来自然,但这个确认工作本身可能就是一个以人类效率为前提设计的遗留物。表单的格式、审批的粒度、例外处理的手册——这些都是为了让人能够处理而设计的。把它们原样交给AI,得到的价值极其有限。

正确的姿势是:把AI的导入当作重新设计业务的机会。有一家金融机构在引入AI处理客户咨询时,没有简单替代客服,而是重新设计了咨询分类体系,明确区分了AI可自主处理和必须升级人工的类别,并将升级路径设计为AI收集的信息和分析结果自动传递给人工。结果是,整体处理时间大幅缩短,远超让AI替代客服的简单思路。

McKinsey的研究印证了这一点:50%的AI高绩效企业在重新设计整个工作流,而不仅仅是自动化孤立的节点任务。Forrester也把延迟重新设计工作流列为AI无法规模化的三大原因之一,与集成问题和数据质量并列。

这意味着:数字孪生的诊断结果,有时候给出的答案不是用AI,而是先改业务。如果流程数字孪生显示某个环节的例外率超过60%,隐性知识依赖严重,第一步不是部署AI,而是标准化流程、显性化决策规则。改完之后,AI才有落脚点。

怎么用数字孪生做AI适配性诊断

如果手头有流程数字孪生或流程挖掘能力,以下三步可以直接操作。

第一步,量化例外率。从历史流程日志中提取每个任务节点的执行路径分布。如果一个节点有超过三种不同的处理路径,且没有明确的规则说明什么时候走哪条路,这就是AI的高风险区。AI的概率性会在这里制造混乱,而不是价值。

第二步,识别隐性规则。数字孪生不仅映射流程步骤,更应该映射决策依赖。某个审批之所以通过,是因为金额在阈值以下,还是因为申请人来自某个特定部门,而审批人知道这个部门的项目一向合规?前者可以规则化,后者是AI无法复制的上下文。

第三步,回测AI的历史吻合度。将AI模型在数字孪生环境中跑一遍过去六个月的实际任务,计算它的决策与人类专家实际决策的吻合度。吻合度超过90%的节点,可以考虑低风险试点;低于70%的节点,先不要碰。

Gartner的数据显示,2024年60%的生成式AI概念验证项目在完成后被放弃,主因是数据就绪度不足和组织变革困难,而非模型能力。数字孪生的诊断价值恰恰在于:在花真金白银之前,先把数据够不够、流程顺不顺、人愿不愿意这三个问题回答清楚。

回测:一条被忽视的验证路径

如果说数字孪生是空间维度的验证,那么“回测”就是时间维度的验证。

这个概念在金融交易领域早已成熟。一个AI交易策略在上线之前,必须用历史数据跑一遍,看它在过去市场条件下的表现如何。Perpetuals公司近期公布的BayesShield AI引擎回测结果提供了一个有趣的参照:该引擎对约10.7亿笔历史订单数据进行了375天的回测,覆盖42.9万个交易账户、7080万个仓位和超过220亿笔历史散户交易记录。

回测的纪律性在于:用与实盘完全相同的生产级代码,防止使用未来信息,在历史数据上验证策略的鲁棒性。BayesShield的回测显示,策略在比特币下跌40.2%的期间仍录得每个季度正收益,最大回撤控制在27%。这种“先回测、再实盘”的流程,恰恰是企业AI部署中普遍缺失的一环。

企业完全可以将这一逻辑迁移到管理场景中。把过去六个月的客服工单、审批记录、排产日志“喂”给AI,让它在数字孪生环境中跑一遍,然后计算它的决策与当初人类专家或实际结果之间的吻合度。吻合度高的,可以扩大权限;吻合度低的,先别碰真实业务。这不是技术难题,而是纪律问题。

可审计性:从“建议”到“证据”

信任的最终基础,是问责。

中国海洋大学学报发表的一篇关于算法审计的学术论文指出,基于元规制理论的算法审计正在成为算法规制的应然方向,其审计内容“不仅要审计数据维度的处理行为,还要审计模型架构、外部权力介入等维度的行为”。这意味着,对AI的验证不能停留在“它答得对不对”,还要追问“它为什么这么答,以及这个‘为什么’是否可以被独立审视”。

这一制度层面的演进,与Gartner的技术预测形成了呼应。Gartner建议组织“优先为高影响用例进行XAI追踪,并采用超越基本性能监控的多维可观测性平台”。所谓“可解释性”,不只是给用户一个理由,更是给审计者一条可追溯的证据链。

当AI的每一次判断都附带着“依据什么数据、经过什么推理路径、在什么约束下得出”的记录时,数字孪生中的“回测”才真正具备了审计效力。偏差不再是一个模糊的印象,而是一个可复现、可归因、可改进的具体数值。

选型:务实优先,治理先行

如果企业决定沿着这条路走,选型时需要放弃一些幻觉。

第一,聚焦“过程孪生”而非“物理孪生”。对于大多数管理类AI场景,不需要昂贵的3D物理建模。中国信通院的调研显示,42%的企业在数字孪生选型时踩了坑,最终需要二次采购。选型前先回答三个问题:业务目标是什么?数据接口是否现成?团队有没有开发能力?对于客服、审批、排产这类场景,能映射工作流和数据流转的“过程数字孪生”已经足够。

第二,把“数据整合能力”作为硬门槛。Boomi的研究揭示了一个关键分野:在信任AI代理的企业中,86%认为用于构建AI代理的iPaaS和API管理能力“至关重要”,而在不信任的企业中这一比例仅为58%——这是该研究发现的最大差距。如果数字孪生平台无法接入企业现有的MES、ERP、CRM数据流,再炫酷的3D场景也只是摆设。

第三,把“回测能力”写进采购需求。要求供应商展示:系统能否用历史数据自动完成AI决策与真实结果的偏差分析?能否输出可量化的准确率、偏差率和风险指标?如果不能,这个平台解决的就不是“信任”问题,而只是“展示”问题。

信任不是相信,而是验证

回到最初的问题:企业觉得AI不靠谱,但又不知道该怎么选。

答案或许很简单:别急着“选”AI,先给自己建一个可以验证AI的地方。数字孪生不是让AI变得更聪明的工具,而是让企业看清AI到底有多聪明、以及在哪里不够聪明的工具。

Gartner预测,到2028年,50%的组织将对数据治理采取“零信任”姿态,因为AI生成的数据正在变得与人类生成的数据无法区分。如果连数据本身都变得不可全信,那么对AI的“信任”就只能建立在一种基础上:持续的、结构化的、可审计的验证。

没有验证的信任是迷信,没有信任的部署是赌博。数字孪生提供的,恰恰是两者之间那条务实而审慎的路径。

毕竟,让AI先在镜子里照一照自己,比让它在真实业务中“撞了南墙再回头”,要便宜得多。

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐