Amazon ha implementado un nuevo mecanismo de control de acceso para arquitecturas de Generación Aumentada por Recuperación (RAG) a través de la integración de Amazon Quick y Amazon Bedrock Knowledge Bases. El objetivo es resolver una de las vulnerabilidades más críticas en la IA corporativa: la filtración de información sensible cuando un modelo de lenguaje genera respuestas basadas en documentos a los que el usuario final no debería tener acceso.
Verificación de permisos mediante ACL en tiempo real
El sistema se basa en la aplicación de Listas de Control de Acceso (ACL, por sus siglas en inglés) en tiempo real. A diferencia de los métodos tradicionales, esta solución no depende únicamente de una copia de los permisos almacenada en un índice, sino que verifica la autorización del usuario directamente con la fuente de datos original en el momento exacto en que se realiza la consulta. El despliegue es compatible con ecosistemas empresariales extendidos, incluyendo Microsoft SharePoint, Google Drive y Atlassian Confluence.
Fallos estructurales del modelo RAG convencional
Para entender la importancia de este avance, es necesario analizar el funcionamiento estándar del RAG en entornos corporativos. Normalmente, las organizaciones utilizan conectores de datos que sincronizan la información y sus permisos desde la fuente hacia un índice vectorial. En este modelo, el sistema de IA replica las ACL y las almacena como atributos. Cuando un usuario hace una pregunta, la IA filtra los resultados basándose en esos atributos replicados. Sin embargo, este enfoque presenta tres fallos estructurales que Amazon busca corregir.
El primer problema radica en que el sistema de IA no es la fuente de verdad. Al replicar las ACL, el conector debe interpretar lógicas de permisos extremadamente complejas y específicas de cada plataforma, como las jerarquías de herencia de SharePoint o las reglas de denegación de Confluence. Cualquier error en el mapeo de estas reglas durante la sincronización puede provocar que un usuario acceda a datos confidenciales, como estrategias corporativas o información de recursos humanos.
El segundo punto crítico es la obsolescencia de los permisos. Las sincronizaciones suelen basarse en procesos de extracción periódicos o programados. Esto crea una ventana de riesgo: si a un empleado se le revoca el acceso a un documento en Google Drive, pero la sincronización del índice de la IA ocurre cada 24 horas, el usuario seguirá recibiendo respuestas basadas en ese documento durante ese intervalo. Algunas herramientas intentan solucionar esto mediante actualizaciones basadas en eventos, pero no todas las fuentes de datos, como Confluence, emiten notificaciones cuando cambia la membresía de un grupo.
Finalmente, la evolución constante de las plataformas de almacenamiento supone un reto operativo. Cuando SharePoint o Google Drive introducen nuevas funciones de seguridad o modifican sus modelos de compartición, los conectores de IA deben actualizarse. Mientras esa actualización no se implemente, existe la posibilidad de que se creen brechas de seguridad que expongan contenido sensible.
Arquitectura de verificación híbrida en dos etapas
La arquitectura propuesta por Amazon soluciona estas deficiencias mediante un sistema híbrido de verificación en dos etapas. La primera etapa consiste en un filtrado previo a la recuperación. Amazon Quick realiza una búsqueda semántica en el índice vectorial para localizar los fragmentos de documentos más relevantes, aplicando las ACL que ya están almacenadas en el índice. Este paso es fundamental para mantener la eficiencia del sistema, ya que realizar llamadas a la API en tiempo real para cada documento almacenado en el índice sería computacionalmente costoso y lento.
La segunda etapa es la verificación en tiempo real. Una vez que el sistema tiene un conjunto preliminar de documentos candidatos, Amazon Quick llama a las API de la fuente original, como las de Google Drive. Para ello, utiliza credenciales de cuenta de servicio proporcionadas por el administrador para generar tokens de acceso específicos del usuario mediante un proceso de suplantación. De este modo, la fuente de datos original, que es la única autoridad real sobre los permisos, confirma si el usuario tiene acceso actual a esos documentos específicos.
Solo los fragmentos de texto verificados y autorizados pasan al Modelo de Lenguaje Extenso (LLM) como contexto. El modelo utiliza entonces esta información filtrada para generar la respuesta final. Este proceso garantiza que, si un permiso ha sido revocado segundos antes de la consulta, la IA no incluirá esa información en su respuesta, eliminando la brecha de seguridad propia de los ciclos de sincronización.
Integración con Bedrock Guardrails y gobernanza de datos
Además de la gestión de ACL, Amazon ha integrado este flujo con Amazon Bedrock Guardrails. Estas herramientas permiten aplicar filtros de contenido, realizar comprobaciones de fundamentación (grounding) para reducir las alucinaciones del modelo y configurar políticas de seguridad personalizadas, asegurando que la implementación de la IA generativa sea responsable y esté alineada con las normativas de cumplimiento de la empresa.
El impacto operativo de esta tecnología es directo. Las empresas ya no necesitan gestionar la frecuencia de sincronización de los permisos ni preocuparse por la complejidad del mapeo de identidades entre distintas plataformas. La seguridad se desplaza desde un modelo de copia estática a un modelo de verificación dinámica.
Implementación corporativa en Mondelēz International
Un ejemplo real de la aplicación de esta tecnología es el caso de Mondelēz International. La compañía ha desplegado Amazon Quick para más de 35.000 empleados distribuidos en cuatro regiones geográficas. Según Jamahl Wiggins, especialista en innovación de M365 de la empresa, la prioridad absoluta de sus equipos de seguridad y cumplimiento era garantizar que los empleados solo vieran la información autorizada. La capacidad de Amazon para realizar controles de acceso en tiempo real permitió que el comité de revisión interna de la compañía aprobara la implementación, estableciendo una base sólida para la gobernanza de la IA en la organización.
En resumen, la integración de Amazon Quick y Amazon Bedrock Knowledge Bases transforma la seguridad del RAG al convertir la fuente de datos en el único validador de acceso en el momento de la consulta. Este enfoque resuelve la problemática de los datos obsoletos y los errores de mapeo de permisos, permitiendo que las organizaciones escalen sus bases de conocimientos sin comprometer la confidencialidad de sus datos más sensibles.
