信任:人工智能实施的基石——如何衡量、提升并为其进行设计

为了提升对人工智能的信任,不要寻找一个完美无缺的系统;而应组合那些以不同方式失效的系统。

本文的核心观点最初发表于在维也纳举行的 Software Quality Days 2026 大会演讲《Beyond Quality: Measuring Trust in AI Outcomes》中。

由 Alexis Savkin 制作的信任架构画布——信任源于组合那些以不同方式失效的系统。

将信任架构画布下载为 PDF 模板

Trust Architecture Canvas: Design Reliable Systems, Including AI-Based Ones

我们能信任人工智能吗?——所有人工智能实施的根本问题

关于人工智能的所有讨论,最终都会回到同一个问题:

我们能信任人工智能吗?

在某些情况下,人们说他们无法将其正式使用,因为他们身处受监管行业。另一些人说他们试用了 Cursor 或 GitHub Copilot 等人工智能工具,效果非常好。但不知为何,所有这些讨论最后都会落到一个问题上:“我们能信任人工智能吗?”

信任无处不在,但什么是信任?

想一想两个购物车:

  • 一个有投币链,因此在使用前需要先投币。
  • 另一个不需要任何东西

购物车作为信任实现的示例:系统如何将信任传递给其利益相关者

在第一种情况下,看起来超市不信任我会在没有押金的情况下归还购物车。

在第二种情况下,超市足够信任我会把购物车归还到正确的位置,并且不会给其他驾驶者造成不便。

这只是一个小例子,但它展示了系统如何将信任传递给其利益相关者——比如我每周是在这家或那家超市购物。

信任是渐进的、主观的,并且与情境相关

这些是信任的基本属性。

  • 信任不是二元的;它是某种程度
  • 信任不是系统的内在属性;有人信任某事,是为了特定目的,并且在特定情境下。

为何我们使用信任来补充质量

我们使用信任,是因为运营领域存在自然约束;当可用信息有限时,我们使用信任以更快地做出决策。

当业务领域变得过于复杂时,质量指标将失效

对于复杂性较低的业务领域,衡量成本是可接受的,因此我们可以使用经典质量指标。随着领域复杂性增加,传统衡量方式的成本会变得过高。

为什么我们要用“信任”来补充“质量”?

在这一点上,我们有一个选择。我们可以继续尝试仅基于硬性指标来做决策,或者我们可以使用我们归入信任范畴的内容:感知、社会认同、概率以及其他替代性指标。

网络安全展示了质量如何转化为信任

十年前,网络安全相对容易量化和衡量:暴力破解所需时间、基本的内部控制……

从2024年开始,攻击向量发生了变化,我们开始更多地讨论分析供应链中的第三方之必要性。

我们仍在衡量网络安全控制的质量,还是在越来越多地衡量信任?

典型的第三方漏洞评估,与其说是依据硬性的质量与安全指标,不如说更依赖合作伙伴所展示的信任指标

网络安全示例:为何我们用信任来补充质量

人类和人工智能都可能出错

这里有一个 Munker–White 错觉。

Munker–White illusion: can we trust humans?

该错觉表明,两种颜色在客观上可能完全相同,但我们仍会把它们看作不同。这只是一个例子,说明作为人类,我们可能会被误导。

人类并非完美的参照。我们也会犯错,也需要在判断周围设置控制机制。

That was an illusion: the colors are actually the same.

人工智能也可能被欺骗

就人工智能而言,一个经典的例子是询问如何前往洗车店。

一个洗车示例,其中人工智能产生了幻觉。

人工智能可能会按字面理解问题并建议步行前往。

现实的问题不是“信任或不信任”,而是这个系统会在哪里失效?

我们如何衡量信任?

信任的绝对数值可能并没有太大意义(因为我们并没有真正用于衡量信任的计量单位)。但相对数值则更为有用。

理解在一种设置中信任是更高还是更低很有帮助。这有助于我们比较不同系统并解释相关决策。

信任指标有助于我们与利益相关者沟通。与其说“我觉得它可行”,我们可以解释为何某种人工智能设置是可接受的,或为何需要额外的控制措施。

我们如何提升信任?

我的实用框架包括三个层级:

  • 第一层级:个人信任
  • 第二层级:系统性信任
  • 第三层级:架构性信任

第一层级:个人信任

个人信任是直觉性的。你会形成自己对是否能够信任该系统的判断。

在人工智能方面,这意味着亲自上手。你对其进行测试,给它分配任务,观察它会在哪些地方出错。

信任如何量化与衡量

  • 一个指标是你花在编写提示词上的时间
  • 另一个指标是你花在修正结果上的时间。

如果你在提示或修复输出上花费大量时间,这会反映你真实的信任水平。

行动计划

  • 在你自己的工作中测试人工智能。
  • 观察它在哪些方面有帮助、在哪些方面会出错,以及你需要投入多少精力才能使结果可用。

第二级:系统化信任

在系统化层面,我们从个人经验走向规模化。这不再只是“我知道人工智能在哪里会出错”。而是:让我们将其规模化,并针对特定领域或特定任务类别进行测试。

基本上,我们做的与第一级相同,但现在涵盖更多案例、更强结构性以及更多统计分析。

信任如何量化与衡量

  • 信任的代理指标变为正确输出的概率。

其计算方式为:正确输出数量除以案例总数。此外,还需根据测试用例数量添加置信区间。

行动计划

  • 在适用时使用公开基准。
  • 针对特定领域使用你自己的数据集。

加入随机抽样与人工复核,以了解统计结果是否与您的真实领域需求相匹配。

第三级:架构层面的信任

在架构层面,问题再次发生变化。我们无法对人工智能给予 100% 的信任,而且很可能永远也不会。但:

我们能否使用那些我们无法 100% 信任的系统,构建出值得信赖的东西?

答案是“可以”。互联网就是一个例子:物理网络并非我们能够 100% 信任的事物,但我们仍然设法在其之上构建了互联网。

信任如何量化与衡量

第一步是分别衡量每个系统的表现。然后衡量它们协同工作时的表现。

  • 重要的指标是共享故障率:所有系统在同一时间失效的情况。

行动计划

  • 识别流程管道中的关键系统:人工智能、人类、政策、验证、控制。
  • 衡量它们各自的信任水平。
  • 测试整体架构,以确认组合系统是否能比各个部分单独运行时提供更高的信任水平。

通过结合以不同方式失效的系统来提升信任

综合信任取决于系统如何共同失效。

如果我们有系统 A 和系统 B,各自都有其信任水平,那么当我们将它们结合时会发生什么?

  • 我们不能简单地将它们的信任水平相加,因为那样可能会超过 100%。
  • 我们也不能简单地取最小值或最大值。

答案取决于系统的设计方式以及它们如何共同失效。

使用信任架构画布的一个示例:决定不使用候选系统,因为它与现有系统以相同方式失效。

联合分析显示组合信任水平

要理解组合信任,我们需要进行联合分析。我们分别测试系统 A 和系统 B,然后也观察它们在相同案例上的表现。

例如,系统 A 的信任度为 84%,系统 B 的信任度为 91%。但当我们将它们组合在一起时,总体信任度变为 95%,因为共同失效率仅为 5%。它们并不总是在相同的案例上失败,而这正是关键所在。

可信赖的架构采用重叠的安全防护网

在软件工程中,同伴评审也以同样的方式发挥作用。另一个人可能会发现你尚未捕捉到的内容。

在航空领域,我们也能看到在控制与程序方面的冗余设计。

仅仅复制控制措施并不会显著提升可信度。我们所追求的是多样化冗余:对以不同方式发生故障的系统进行编排与协同。

并非所有冗余都切实可行

某些冗余在理论上很有用,但在现实中并不切实可行。例如,在出租车服务中,我们可以增加第二名司机,服务可能会变得更安全。但这并不现实。

因此,我们转而构建由不同系统组成的网络:法规、政策、司机评分、应用程序控制、报告机制。所有这些系统相互结合,共同提升整体信任水平。

人类在回路中是另一套信任体系

我们可以将人类在回路中视为另一套信任体系。人类带来直觉与常识,其原则不同于人工智能系统。这使得人类成为一个完美的信任因素。

架构比单个信任评分更重要

两个强大的系统如果以相同方式失效,仍可能一起失败。

同时,两个不完美的系统如果能够相互补偿,就可以形成更强的组合系统。因此,核心设计问题是:这些系统是否以不同方式失效?

我们是否刚刚重新发明了可靠性?

不完全是。

可靠性是信任的一部分,但信任涵盖更广泛的一组理念。我们不仅在问某个组件是否正常工作——我们关注的是整个决策流程:人工智能、人类、政策、控制措施以及业务含义。

信任还涉及更多利益相关方:用户、管理者、监管机构、业务责任人、参与闭环的人,以及受到该决策影响的人。

核心要点

可信的人工智能并不在于找到一个完美无缺的人工智能模型。所有系统都可能被攻破,包括人工智能系统、人类系统、业务系统、政策以及控制措施。

其思路是:

  1. 理解系统如何失效,然后
  2. 组合那些以不同方式失效的系统。

这就是实现可信的途径。

下一步是什么?当将信任嵌入更广泛的人工智能实施监督之中,并配套控制措施、审查以及绩效指标时,信任将变得更具可操作性。

请引用如下: Alexis Savkín, “信任:人工智能实施的基石——如何衡量、提升并为其进行设计,” BSC Designer, 15 5 月, 2026, https://bscdesigner.com/zh/heng-liang-xin-ren.htm

发表评论

这个站点使用 Akismet 来减少垃圾评论。了解你的评论数据如何被处理