Para aumentar la confianza en la IA, no busque un sistema perfecto; combine sistemas que fallan de diferentes maneras.
Las ideas centrales de este artículo se presentaron por primera vez en la charla «Más allá de la calidad: medir la confianza en los resultados de la IA» en Software Quality Days 2026 en Viena.

Descargue el Lienzo de arquitectura de confianza como una plantilla en PDF.
¿Podemos confiar en la IA? — La pregunta fundamental de todas las implementaciones de IA
Todas las discusiones sobre la IA finalmente terminan con la misma pregunta:
¿Podemos confiar en la IA?
En algunos casos, las personas dicen que no pueden usarla oficialmente porque están en una industria regulada. Otros dicen que probaron herramientas de IA como Cursor o GitHub Copilot, y funcionaron muy bien. Pero, de algún modo, todas esas discusiones terminan con una pregunta: «¿Podemos confiar en la IA?»
La confianza está en todas partes, pero ¿qué es la confianza?
Piense en dos carros de compra:
- Uno tiene una cadena para monedas, por lo que necesita introducir una moneda antes de usarlo.
- El otro no requiere nada.

En el primer caso, parece que el supermercado no confía en que yo devuelva el carro sin un depósito.
En el segundo caso, el supermercado confía lo suficiente en mí como para que devuelva el carro al lugar correcto y no cree inconvenientes para otros conductores.
Es un pequeño ejemplo, pero muestra cómo los sistemas traducen la confianza a sus partes interesadas, como yo al hacer la compra semanal en un supermercado u otro.
La confianza es gradual, subjetiva y contextual
Estas son las propiedades básicas de la confianza.
- La confianza no es binaria; es un grado de algo.
- La confianza no es una propiedad intrínseca del sistema; alguien confía en algo, para un propósito específico, en un contexto específico.
Por qué usamos la confianza para complementar la calidad
Usamos la confianza debido a las limitaciones naturales en el dominio operativo; usamos la confianza para tomar decisiones más rápidas cuando la información disponible es limitada.
Las métricas de calidad se descomponen cuando el dominio se vuelve demasiado complejo
Para dominios empresariales menos complejos, el coste de la medición es aceptable, por lo que podemos utilizar métricas clásicas de calidad. A medida que aumenta la complejidad del dominio, la medición clásica se vuelve demasiado costosa.

En este punto, usted tiene una elección. Puede seguir intentando basar las decisiones únicamente en métricas duras, o puede utilizar algo que agrupamos bajo el paraguas de la confianza: percepciones, prueba social, probabilidades y otros sustitutos.
La ciberseguridad muestra cómo la calidad se convierte en confianza
Hace una década, la ciberseguridad era relativamente fácil de cuantificar y medir: tiempo de fuerza bruta, controles internos básicos…
A partir de 2024, los vectores de ataque cambiaron y empezamos a hablar mucho más sobre la necesidad de analizar a terceros en la cadena de suministro.
¿Seguimos midiendo la calidad de los controles de ciberseguridad, o estamos midiendo cada vez más la confianza?
Una evaluación típica de vulnerabilidades de terceros consiste más en basarse en indicadores de confianza demostrados por el socio que en métricas estrictas de calidad y seguridad.

Los seres humanos y la IA son vulnerables
Aquí tiene la ilusión de Munker–White.

La ilusión muestra que dos colores pueden ser objetivamente iguales, pero aun así los vemos como diferentes. Este es solo un ejemplo de cómo, como seres humanos, podemos ser engañados.
Los seres humanos no son una referencia perfecta. También fallamos, y también necesitamos controles en torno a nuestro juicio.

La IA también puede ser engañada
En cuanto a la IA, un ejemplo clásico es preguntar cómo llegar al lavadero de coches.

La IA puede responder la pregunta de forma literal y sugerir ir caminando.
La pregunta realista no es «confiar o no confiar», sino ¿dónde falla este sistema?
¿Cómo medimos la confianza?
Probablemente, los números absolutos de confianza no tendrán mucho sentido (simplemente no tenemos una unidad de medida real para la confianza). Pero los números relativos son mucho más útiles.
Es útil entender si la confianza es mayor o menor en una configuración que en otra. Esto nos ayuda a comparar sistemas y a explicar decisiones.
Las métricas de confianza nos ayudan a hablar con las partes interesadas. En lugar de decir: «Siento que funciona», podemos explicar por qué una determinada configuración de IA es aceptable o por qué se necesitan controles adicionales.
¿Cómo mejoramos la confianza?
Mi marco práctico incluye tres niveles:
- Nivel uno: confianza personal
- Nivel dos: confianza sistemática
- Nivel tres: confianza arquitectónica
Nivel uno: Confianza personal
La confianza personal es intuitiva. Usted obtiene su propia comprensión de si puede confiar en el sistema o no.
Con la IA, esto significa poner las manos en ello. Usted lo prueba, le asigna tareas y ve dónde falla.
Cómo se cuantifica y mide la confianza
- Una métrica es el tiempo que usted dedica a redactar prompts.
- Otra es el tiempo que usted dedica a corregir el resultado.
Si usted dedica mucho tiempo a crear prompts o a reparar la salida, eso le dice algo sobre su nivel real de confianza.
Plan de acción
- Pruebe la IA en su propio trabajo.
- Observe dónde ayuda, dónde falla y cuánto esfuerzo necesita para que el resultado sea utilizable.
Nivel dos: Confianza sistemática
A nivel sistemático, pasamos de la experiencia personal a la escala. No es solo “Sé dónde falla la IA”. Es: pongamos esto a escala y pruébelo para un dominio específico o una clase específica de tareas.
Básicamente, hacemos lo mismo que en el nivel uno, pero ahora con más casos, más estructura y más estadísticas.
Cómo se cuantifica y se mide la confianza
- El proxy de la confianza se convierte en la probabilidad de un resultado correcto.
Usted la calcula como el número de resultados correctos dividido por el número total de casos. Además, usted añade un intervalo de confianza en función del número de casos de prueba.
Plan de acción
- Utilice benchmarks públicos cuando sea pertinente.
- Utilice sus propios conjuntos de datos para dominios específicos.
Agregue muestreo aleatorio y revisión humana para comprender si el resultado estadístico coincide con las necesidades reales de su dominio.
Nivel tres: confianza arquitectónica
A nivel arquitectónico, la pregunta cambia de nuevo. No confiamos en la IA al 100%, y probablemente nunca lo haremos. Pero:
¿Podemos construir algo confiable utilizando sistemas en los que no confiamos al 100%?
La respuesta es «sí». Internet es un ejemplo: las redes físicas no son algo en lo que podamos confiar al 100%, pero de algún modo logramos construir Internet sobre ellas.
Cómo se cuantifica y se mide la confianza
Primero, mida cómo funciona cada sistema por separado. Luego, mida cómo funcionan juntos.
- La métrica importante es la tasa de fallos compartida: casos en los que todos los sistemas fallan al mismo tiempo.
Plan de acción
- Identifique los sistemas clave en el flujo: IA, humanos, políticas, validaciones, controles.
- Mida sus niveles de confianza individuales.
- Pruebe toda la arquitectura para ver si el sistema combinado ofrece un nivel de confianza más alto que cada parte por separado.
Aumente la confianza combinando sistemas que fallan de diferentes maneras
La confianza combinada depende de cómo fallen los sistemas en conjunto.
Si tenemos el sistema A y el sistema B, cada uno con su propio nivel de confianza, ¿qué ocurre cuando los combinamos?
- No podemos simplemente sumar sus niveles de confianza, porque entonces podríamos superar el 100%.
- Tampoco podemos simplemente tomar el mínimo o el máximo.
La respuesta depende de cómo estén diseñados los sistemas y de cómo fallen juntos.

El análisis conjunto muestra el nivel de confianza combinado
Para comprender la confianza combinada, necesitamos un análisis conjunto. Probamos el sistema A y el sistema B por separado, y luego también observamos cómo se comportan en los mismos casos.
Por ejemplo, el sistema A tiene un 84% de confianza y el sistema B tiene un 91%. Pero cuando los combinamos, la confianza general se convierte en 95%, porque la tasa de fallos compartida es solo del 5%. No siempre fallan en los mismos casos, y esta es la parte importante.
La arquitectura confiable utiliza redes de seguridad superpuestas
En la ingeniería de software, la revisión por pares funciona de la misma manera. Otra persona puede detectar algo que usted no ha captado.
En la aviación, también vemos redundancia en los controles y procedimientos.
Simplemente duplicar los controles no aumentará mucho la confianza. Lo que buscamos es una redundancia diversa: orquestar sistemas que fallan de maneras diferentes.
No toda redundancia es realista
Cierta redundancia es útil en teoría, pero no es realista. Por ejemplo, en los servicios de taxi, podríamos añadir un segundo conductor y, probablemente, el servicio se volvería más seguro. Pero esto no es realista.
Así que, en su lugar, construimos una red de diferentes sistemas: normativas, políticas, calificaciones de conductores, controles de la aplicación, mecanismos de reporte. Todos estos sistemas se combinan y contribuyen al nivel general de confianza.
El ser humano en el circuito es un sistema de confianza más
Podemos considerar al ser humano en el circuito como otro sistema de confianza. Los seres humanos aportan intuición y sentido común, y sus principios son diferentes de los de los sistemas de IA. Esto convierte a los seres humanos en un factor de confianza perfecto.
La arquitectura importa más que las puntuaciones individuales de confianza
Dos sistemas sólidos aún pueden fallar juntos si fallan de la misma manera.
Al mismo tiempo, dos sistemas imperfectos pueden crear un sistema combinado más sólido si se compensan entre sí. Por lo tanto, la pregunta central de diseño es: ¿estos sistemas fallan de manera diferente?
¿Acabamos de reinventar la fiabilidad?
No exactamente.
La fiabilidad es parte de la confianza, pero la confianza abarca un conjunto más amplio de ideas. No solo preguntamos si un componente funciona — estamos analizando todo el flujo de decisiones: IA, personas, políticas, controles y contexto empresarial.
La confianza también implica a más partes interesadas: usuarios, directivos, reguladores, responsables de negocio, personas en el bucle y personas afectadas por la decisión.
Conclusión principal
La IA confiable no se trata de encontrar un modelo de IA perfecto. Todos los sistemas son vulnerables, incluidos los sistemas de IA, los sistemas humanos, los sistemas empresariales, las políticas y los controles.
La idea es:
- Comprender cómo fallan los sistemas y, entonces
- Combinar sistemas que fallan de maneras diferentes.
Esta es la manera de llegar a algo confiable.
¿Qué sigue? La confianza se vuelve más accionable cuando se integra en la supervisión más amplia de la implementación de IA con controles, revisiones e indicadores de desempeño.
Alexis Savkin es arquitecto de estrategia y fundador de BSC Designer, una plataforma de software de ejecución de la estrategia con el cuadro de mando integral como núcleo. Ayuda a las organizaciones a traducir la estrategia en objetivos medibles, KPI e iniciativas. Alexis es el creador del Strategy Execution Canvas, autor de más de 100 artículos sobre estrategia y medición del desempeño, y ponente habitual.