Multiverse Computing ha desarrollado ProvenanceGuard, una herramienta de verificación posterior a la generación diseñada específicamente para modelos de lenguaje extenso (LLM) que utilizan el Model Context Protocol (MCP). Este protocolo permite que un agente no se limite a leer un único pasaje recuperado, sino que interactúe con múltiples herramientas —como bases de datos, registros estructurados de cuentas o herramientas de búsqueda— para sintetizar una respuesta final. El problema central que aborda ProvenanceGuard es la llamada conflación entre fuentes, un error en el que el agente emite un dato que es técnicamente correcto según la evidencia disponible, pero lo atribuye a la fuente equivocada.
Diferencias con los sistemas de verificación convencionales
En los sistemas de verificación convencionales, como RAGAS, MiniCheck o SummaC, el proceso suele consistir en agrupar toda la evidencia recuperada en un único conjunto de datos y comprobar si la afirmación del modelo está respaldada por dicha masa de información. Este enfoque, denominado verificación ciega a la fuente, ignora si el dato proviene específicamente del documento que el agente cita. Por ejemplo, un agente de soporte al cliente podría afirmar que, según el registro de una cuenta, el usuario tiene un periodo de reembolso de 30 días. Si el dato de los 30 días existe en un manual de políticas general, pero no en el registro específico de la cuenta, un verificador convencional daría la respuesta por válida porque el hecho es cierto, aunque la atribución sea falsa.
Arquitectura y flujo de trabajo de ProvenanceGuard
ProvenanceGuard opera como una capa de supervisión externa sobre el agente MCP, tratándolo como una caja negra. A diferencia de los métodos tradicionales, no colapsa la evidencia en un contexto anónimo, sino que mantiene la identidad de cada fuente a través de todo el flujo de trabajo mediante el uso de trazas de MCP, que incluyen las salidas de las herramientas y sus identificadores de fuente únicos. Este proceso no requiere un reentrenamiento del agente original, lo que facilita su despliegue en sistemas ya operativos.
El funcionamiento técnico de ProvenanceGuard se divide en cinco etapas secuenciales. Primero, el sistema descompone la respuesta del agente en afirmaciones individuales y específicas. Segundo, identifica la fuente más relevante para cada una de esas afirmaciones. Tercero, verifica si dicha fuente realmente respalda la información. Cuarto, compara la fuente identificada con la fuente que el agente ha nombrado o implicado explícitamente en su texto. Finalmente, emite un veredicto individual por cada afirmación y una decisión global de permitir o bloquear la respuesta completa.
Modelos locales y validación de datos
Para la implementación de sus pruebas, Multiverse Computing utilizó una configuración de modelos locales para garantizar el control y la privacidad de los datos. Emplearon MiniLM para la localización de fuentes relevantes, un modelo de verificación de inferencia natural (NLI) basado en DeBERTa para comprobar el respaldo de la información y un modelo de lenguaje local para la descomposición de las respuestas en afirmaciones. El sistema pone especial énfasis en la verificación de valores literales, impidiendo que fechas, números o identificadores pasen el filtro basándose únicamente en la plausibilidad sintáctica de la frase si no aparecen explícitamente en la fuente.
Mecanismos de reparación y seguridad de respuestas
En el caso de que ProvenanceGuard bloquee una respuesta, el sistema puede integrarse con un bucle de reparación similar al modelo RARR (Rewrite-Review-Revise). Este proceso intenta realizar una revisión basada estrictamente en las fuentes o, en su defecto, generar un texto de respaldo seguro que evite fabricar respuestas no verificables. Según los datos proporcionados, en una ejecución de trazas completas, el sistema resolvió todas las respuestas bloqueadas, aunque la mayoría terminó en un texto de respaldo en lugar de una redacción sustantiva, priorizando la seguridad sobre la generación de contenido.
Evaluación de eficacia en el sector médico
La eficacia del sistema fue evaluada mediante un estudio en el sector médico, un entorno donde la distinción entre la historia clínica de un paciente y la literatura médica general es crítica. Se analizaron 281 trazas reales y expertos humanos revisaron 361 afirmaciones procedentes de 40 respuestas. Los resultados muestran que, de las 139 afirmaciones que los expertos consideraron que no debían pasar el filtro, ProvenanceGuard detectó 138 de ellas. Por otro lado, el sistema mantuvo 67 afirmaciones que los expertos sí consideraban respaldadas, lo que demuestra una política de decisión conservadora que prefiere la revisión manual antes que permitir el paso de un error.
En términos de precisión, ProvenanceGuard identificó la fuente correcta en aproximadamente el 86% de los casos con fuentes identificables. Al compararlo con otros verificadores como AlignScore o RAGAS, ProvenanceGuard obtuvo la puntuación más alta en la capacidad de bloquear afirmaciones erróneas evitando bloqueos innecesarios, con un valor F1 de 0,802 frente al 0,783 de MiniCheck y el 0,758 de RAGAS Faithfulness. Además, fue el único sistema capaz de emitir el identificador de la fuente vinculado a cada afirmación.
Limitaciones técnicas y rendimiento computacional
No obstante, el sistema presenta limitaciones en escenarios de alta similitud entre fuentes. En una prueba específica con fuentes muy parecidas, aunque el valor F1 para bloquear afirmaciones fue de 0,846, la capacidad de identificar la fuente exacta cayó al 50,3%. Esto indica que diferenciar entre documentos con contenido muy similar sigue siendo un desafío técnico pendiente. A pesar de ello, el sistema demostró una capacidad total para detectar errores de atribución deliberados: en una prueba donde se alteró la fuente nombrada manteniendo la evidencia intacta en 50 casos, ProvenanceGuard detectó la totalidad de los errores.
Desde el punto de vista del rendimiento, la sobrecarga computacional de ProvenanceGuard es moderada. En la configuración local evaluada, el tiempo de procesamiento es de aproximadamente medio segundo por respuesta, con llamadas de enrutamiento y NLI que se resuelven en decenas de milisegundos. Esta eficiencia permite que el sistema actúe como una puerta de enlace offline sin penalizar significativamente la velocidad de entrega de la información.
Impacto en la arquitectura de agentes y veracidad de datos
La importancia de este avance radica en la transición de la arquitectura RAG (Generación Aumentada por Recuperación) de un solo pasaje hacia configuraciones MCP de herramientas múltiples. En estos entornos, la procedencia de la información deja de ser un detalle secundario para convertirse en un componente esencial de la veracidad. Para sectores sensibles a los datos, como el financiero o el sanitario, una atribución incorrecta puede ser tan perjudicial como un dato falso, ya que altera la interpretación legal o clínica de la información.
Este enfoque de verificación de anclaje ya está empezando a verse en otras implementaciones. Un ejemplo es NVIDIA NVFlow, que ha integrado una etapa opcional de verificación de anclaje para su agente financiero, contrastando las respuestas finales con extractos de la SEC (Securities and Exchange Commission) para emitir decisiones de validación independientes sin necesidad de modificar el entrenamiento original del modelo.
ProvenanceGuard representa un cambio de paradigma en la evaluación de agentes de IA, moviendo el foco desde la simple fidelidad del hecho hacia la precisión de la procedencia. Al mantener la conexión entre la afirmación y el identificador de la herramienta de origen, permite que los revisores humanos puedan auditar exactamente qué dato provino de qué lugar, eliminando la opacidad de los contextos agrupados y reduciendo el riesgo de alucinaciones de atribución en despliegues empresariales críticos.



