
Los agentes de inteligencia artificial están pasando de los entornos de prueba a atender directamente a clientes, pero su comportamiento en situaciones reales todavía plantea importantes dudas. El primer Lexic AI Agent Trust Index, elaborado por Lexic.AI a partir de la auditoría de 50 agentes conversacionales y más de 500 conversaciones reales de producción, sitúa en 62 puntos sobre 100 la puntuación media de confianza. Solo el 5% de los sistemas analizados alcanza la clasificación Trusted establecida por la metodología.
El análisis se ha realizado sobre agentes desplegados principalmente en España, aunque también incluye casos de otros mercados europeos, y abarca sectores como banca, seguros, energía, industria, retail y logística. A diferencia de las pruebas realizadas en entornos controlados, el índice analiza conversaciones mantenidas por los agentes con usuarios reales durante su funcionamiento en producción.
Uno de los principales resultados del análisis es que algunos de los problemas más frecuentes no están relacionados con capacidades técnicas avanzadas, sino con comportamientos básicos en la interacción con los usuarios. Alrededor de ocho de cada diez agentes analizados no se identifican correctamente como sistemas de inteligencia artificial cuando el usuario les pregunta directamente por ello. También aproximadamente ocho de cada diez sistemas presentan problemas cuando deben transferir una conversación a una persona. En algunos casos prometen realizar el escalado, pero no llegan a completarlo cuando el cliente lo solicita. El estudio señala además que uno de cada tres agentes recoge datos personales sin establecer claramente un mecanismo de consentimiento.
Estos resultados ponen de manifiesto que el funcionamiento técnico de un agente no garantiza por sí mismo que la interacción sea adecuada. Un sistema puede responder correctamente a buena parte de las consultas y, al mismo tiempo, presentar problemas cuando debe informar sobre su naturaleza, gestionar una situación que requiere intervención humana o solicitar información personal.
Seguridad, cumplimiento y experiencia de cliente
El Trust Score desarrollado por Lexic.AI combina cuatro dimensiones diferentes para evaluar el comportamiento de los agentes. La seguridad e integridad representan el 30% de la puntuación, el cumplimiento normativo otro 30%, mientras que la fiabilidad operativa y la experiencia de cliente aportan un 20% cada una. Para obtener la categoría Trusted, un agente debe alcanzar al menos 85 puntos sobre 100 y, además, no presentar ningún hallazgo crítico relacionado con seguridad o cumplimiento normativo. La metodología utiliza, entre otras referencias, el marco OWASP LLM Top 10 para la evaluación de seguridad y contempla el Reglamento europeo de Inteligencia Artificial y el RGPD en el análisis de cumplimiento.
La metodología parte de una idea cada vez más relevante a medida que aumenta el uso empresarial de agentes de IA: las pruebas realizadas antes del despliegue no necesariamente reflejan cómo se comportará un sistema cuando tenga que atender a miles de clientes y afrontar conversaciones imprevisibles.
El reto de controlar a los agentes una vez desplegados
El crecimiento de la IA agéntica está trasladando parte de la responsabilidad de las empresas desde el desarrollo del modelo hacia su supervisión una vez que entra en funcionamiento. Los agentes pueden responder preguntas, gestionar solicitudes, acceder a información y representar directamente a una marca frente a sus clientes. Por ello, sus errores pueden tener consecuencias sobre la seguridad, el cumplimiento, la reputación o la experiencia de usuario.
Lexic.AI sostiene que evaluar estos sistemas únicamente mediante simulaciones o pruebas internas puede dejar fuera comportamientos que aparecen cuando interactúan con usuarios reales. Su índice intenta precisamente medir esas situaciones mediante el análisis de conversaciones de producción y establecer una puntuación que permita identificar las áreas en las que cada sistema necesita mejorar. La compañía prevé que el Lexic AI Agent Trust Index tenga periodicidad anual, de manera que sus resultados puedan utilizarse para observar cómo evolucionan los niveles de confianza de los agentes a medida que las empresas mejoran sus sistemas y aumentan las exigencias regulatorias.
Una metodología privada, no una certificación oficial
El dato del 5% debe interpretarse teniendo en cuenta el origen del índice. Lexic.AI señala expresamente que el Trust Score y el Lexic AI Agent Trust Index son metodologías propias y que no constituyen una certificación oficial ni un sello regulatorio. La compañía tampoco es una entidad notificada bajo el Reglamento europeo de IA ni certifica jurídicamente el cumplimiento normativo de terceros.
Por tanto, el estudio no permite afirmar que únicamente el 5% de todos los agentes de IA existentes sean fiables. Lo que sí muestra es que, dentro de los 50 agentes auditados por Lexic.AI y las más de 500 conversaciones analizadas, solo uno de cada veinte alcanzó la categoría Trusted según los criterios definidos por la propia metodología. El resultado ofrece, en cualquier caso, una señal sobre uno de los grandes retos de la expansión de los agentes de IA: pasar de demostrar que pueden realizar una tarea a demostrar que pueden hacerlo de forma segura, fiable, transparente y adecuada cuando actúan directa





