为了提升对人工智能的信任,不要寻找一个完美无缺的系统;而应组合那些以不同方式失效的系统。
本文的核心观点最初发表于在维也纳举行的 Software Quality Days 2026 大会演讲《Beyond Quality: Measuring Trust in AI Outcomes》中。

将信任架构画布下载为 PDF 模板。
我们能信任人工智能吗?——所有人工智能实施的根本问题
关于人工智能的所有讨论,最终都会回到同一个问题:
我们能信任人工智能吗?
在某些情况下,人们说他们无法将其正式使用,因为他们身处受监管行业。另一些人说他们试用了 Cursor 或 GitHub Copilot 等人工智能工具,效果非常好。但不知为何,所有这些讨论最后都会落到一个问题上:“我们能信任人工智能吗?”
信任无处不在,但什么是信任?
想一想两个购物车:
- 一个有投币链,因此在使用前需要先投币。
- 另一个不需要任何东西。

在第一种情况下,看起来超市不信任我会在没有押金的情况下归还购物车。
在第二种情况下,超市足够信任我会把购物车归还到正确的位置,并且不会给其他驾驶者造成不便。
这只是一个小例子,但它展示了系统如何将信任传递给其利益相关者——比如我每周是在这家或那家超市购物。
信任是渐进的、主观的,并且与情境相关
这些是信任的基本属性。
- 信任不是二元的;它是某种程度。
- 信任不是系统的内在属性;有人信任某事,是为了特定目的,并且在特定情境下。
为何我们使用信任来补充质量
我们使用信任,是因为运营领域存在自然约束;当可用信息有限时,我们使用信任以更快地做出决策。
当业务领域变得过于复杂时,质量指标将失效
对于复杂性较低的业务领域,衡量成本是可接受的,因此我们可以使用经典质量指标。随着领域复杂性增加,传统衡量方式的成本会变得过高。

在这一点上,我们有一个选择。我们可以继续尝试仅基于硬性指标来做决策,或者我们可以使用我们归入信任范畴的内容:感知、社会认同、概率以及其他替代性指标。
网络安全展示了质量如何转化为信任
十年前,网络安全相对容易量化和衡量:暴力破解所需时间、基本的内部控制……
从2024年开始,攻击向量发生了变化,我们开始更多地讨论分析供应链中的第三方之必要性。
我们仍在衡量网络安全控制的质量,还是在越来越多地衡量信任?
典型的第三方漏洞评估,与其说是依据硬性的质量与安全指标,不如说更依赖合作伙伴所展示的信任指标。

人类和人工智能都可能出错
这里有一个 Munker–White 错觉。

该错觉表明,两种颜色在客观上可能完全相同,但我们仍会把它们看作不同。这只是一个例子,说明作为人类,我们可能会被误导。
人类并非完美的参照。我们也会犯错,也需要在判断周围设置控制机制。

人工智能也可能被欺骗
就人工智能而言,一个经典的例子是询问如何前往洗车店。

人工智能可能会按字面理解问题并建议步行前往。
现实的问题不是“信任或不信任”,而是这个系统会在哪里失效?
我们如何衡量信任?
信任的绝对数值可能并没有太大意义(因为我们并没有真正用于衡量信任的计量单位)。但相对数值则更为有用。
理解在一种设置中信任是更高还是更低很有帮助。这有助于我们比较不同系统并解释相关决策。
信任指标有助于我们与利益相关者沟通。与其说“我觉得它可行”,我们可以解释为何某种人工智能设置是可接受的,或为何需要额外的控制措施。
我们如何提升信任?
我的实用框架包括三个层级:
- 第一层级:个人信任
- 第二层级:系统性信任
- 第三层级:架构性信任
第一层级:个人信任
个人信任是直觉性的。你会形成自己对是否能够信任该系统的判断。
在人工智能方面,这意味着亲自上手。你对其进行测试,给它分配任务,观察它会在哪些地方出错。
信任如何量化与衡量
- 一个指标是你花在编写提示词上的时间。
- 另一个指标是你花在修正结果上的时间。
如果你在提示或修复输出上花费大量时间,这会反映你真实的信任水平。
行动计划
- 在你自己的工作中测试人工智能。
- 观察它在哪些方面有帮助、在哪些方面会出错,以及你需要投入多少精力才能使结果可用。
第二级:系统化信任
在系统化层面,我们从个人经验走向规模化。这不再只是“我知道人工智能在哪里会出错”。而是:让我们将其规模化,并针对特定领域或特定任务类别进行测试。
基本上,我们做的与第一级相同,但现在涵盖更多案例、更强结构性以及更多统计分析。
信任如何量化与衡量
- 信任的代理指标变为正确输出的概率。
其计算方式为:正确输出数量除以案例总数。此外,还需根据测试用例数量添加置信区间。
行动计划
- 在适用时使用公开基准。
- 针对特定领域使用你自己的数据集。
加入随机抽样与人工复核,以了解统计结果是否与您的真实领域需求相匹配。
第三级:架构层面的信任
在架构层面,问题再次发生变化。我们无法对人工智能给予 100% 的信任,而且很可能永远也不会。但:
我们能否使用那些我们无法 100% 信任的系统,构建出值得信赖的东西?
答案是“可以”。互联网就是一个例子:物理网络并非我们能够 100% 信任的事物,但我们仍然设法在其之上构建了互联网。
信任如何量化与衡量
第一步是分别衡量每个系统的表现。然后衡量它们协同工作时的表现。
- 重要的指标是共享故障率:所有系统在同一时间失效的情况。
行动计划
- 识别流程管道中的关键系统:人工智能、人类、政策、验证、控制。
- 衡量它们各自的信任水平。
- 测试整体架构,以确认组合系统是否能比各个部分单独运行时提供更高的信任水平。
通过结合以不同方式失效的系统来提升信任
综合信任取决于系统如何共同失效。
如果我们有系统 A 和系统 B,各自都有其信任水平,那么当我们将它们结合时会发生什么?
- 我们不能简单地将它们的信任水平相加,因为那样可能会超过 100%。
- 我们也不能简单地取最小值或最大值。
答案取决于系统的设计方式以及它们如何共同失效。

联合分析显示组合信任水平
要理解组合信任,我们需要进行联合分析。我们分别测试系统 A 和系统 B,然后也观察它们在相同案例上的表现。
例如,系统 A 的信任度为 84%,系统 B 的信任度为 91%。但当我们将它们组合在一起时,总体信任度变为 95%,因为共同失效率仅为 5%。它们并不总是在相同的案例上失败,而这正是关键所在。
可信赖的架构采用重叠的安全防护网
在软件工程中,同伴评审也以同样的方式发挥作用。另一个人可能会发现你尚未捕捉到的内容。
在航空领域,我们也能看到在控制与程序方面的冗余设计。
仅仅复制控制措施并不会显著提升可信度。我们所追求的是多样化冗余:对以不同方式发生故障的系统进行编排与协同。
并非所有冗余都切实可行
某些冗余在理论上很有用,但在现实中并不切实可行。例如,在出租车服务中,我们可以增加第二名司机,服务可能会变得更安全。但这并不现实。
因此,我们转而构建由不同系统组成的网络:法规、政策、司机评分、应用程序控制、报告机制。所有这些系统相互结合,共同提升整体信任水平。
人类在回路中是另一套信任体系
我们可以将人类在回路中视为另一套信任体系。人类带来直觉与常识,其原则不同于人工智能系统。这使得人类成为一个完美的信任因素。
架构比单个信任评分更重要
两个强大的系统如果以相同方式失效,仍可能一起失败。
同时,两个不完美的系统如果能够相互补偿,就可以形成更强的组合系统。因此,核心设计问题是:这些系统是否以不同方式失效?
我们是否刚刚重新发明了可靠性?
不完全是。
可靠性是信任的一部分,但信任涵盖更广泛的一组理念。我们不仅在问某个组件是否正常工作——我们关注的是整个决策流程:人工智能、人类、政策、控制措施以及业务含义。
信任还涉及更多利益相关方:用户、管理者、监管机构、业务责任人、参与闭环的人,以及受到该决策影响的人。
核心要点
可信的人工智能并不在于找到一个完美无缺的人工智能模型。所有系统都可能被攻破,包括人工智能系统、人类系统、业务系统、政策以及控制措施。
其思路是:
- 理解系统如何失效,然后
- 组合那些以不同方式失效的系统。
这就是实现可信的途径。
下一步是什么?当将信任嵌入更广泛的人工智能实施监督之中,并配套控制措施、审查以及绩效指标时,信任将变得更具可操作性。
Alexis Savkin 是一位战略架构师,也是 BSC Designer 的创始人;BSC Designer 是一个以平衡记分卡为核心的战略执行软件平台。他帮助组织将战略转化为可衡量的目标、关键绩效指标以及举措。Alexis 是 战略执行画布 的创建者,撰写了 100+ 篇关于战略与绩效衡量的文章,并且是 常驻演讲者。