Andrea Wynn, Harsh Satija, Seokhyun Baek, Anqi Liu, Eric Nalisnick y Gillian K. Hadfield han presentado un trabajo de investigación titulado Reading the Room, depositado en el repositorio arXiv el 7 de octubre de 2026. El núcleo de este estudio es la definición y evaluación de la competencia normativa, entendida como la capacidad de un sistema de inteligencia artificial para identificar, a través de la interacción directa, cuáles son las normas que rigen una comunidad específica sin depender de los conocimientos previos adquiridos durante su entrenamiento previo.

Definición de competencia normativa y alineamiento social

Los autores parten de la premisa de que las comunidades humanas se organizan mediante sistemas normativos. Estos sistemas consisten en estándares compartidos que dictan qué comportamientos son aceptables y cuáles no, apoyándose en un mecanismo de sanciones sociales para asegurar su cumplimiento. Para los investigadores, alinear los sistemas de IA, que son cada vez más autónomos, con estas normas representa uno de los mayores desafíos actuales del alineamiento, debido a que las normas sociales son extremadamente numerosas, evolucionan con rapidez y, en muchos casos, resultan arbitrarias, como ocurre con las convenciones lingüísticas o las reglas de vestimenta.

La competencia normativa se diferencia del alineamiento tradicional en que no busca que el modelo siga una lista estática de reglas predefinidas por programadores, sino que sea capaz de deducir dinámicamente el orden social de un grupo nuevo. En el desarrollo de agentes autónomos, esto implicaría que la IA pudiera entrar en un entorno desconocido y comprender, mediante la observación y el ensayo, qué conductas son penalizadas y cuáles son recompensadas por los miembros de esa comunidad, replicando la capacidad humana de leer el contexto social.

Metodología del entorno de debate multiagente

Para aislar la competencia normativa de la exposición previa a datos durante el entrenamiento, el equipo de investigación diseñó un entorno de debate comunitario multiagente. En este escenario sintético, el acceso a la capacidad de debatir está regulado por normas artificiales. El objetivo era observar si los agentes basados en LLM podían deducir estas reglas simplemente observando la interacción y las consecuencias de las acciones de otros agentes, imitando la forma en que un humano llega a comprender el contexto social de un grupo nuevo.

El experimento se centró en evaluar si los modelos podían discernir el orden social impuesto. Para ello, los investigadores implementaron diversos módulos normativos, que son componentes arquitectónicos diseñados específicamente para la inferencia de normas. El propósito de estos módulos era proporcionar al modelo una estructura lógica que le permitiera procesar la información del entorno y traducirla en una regla de comportamiento ejecutable que optimizara su rendimiento dentro de la comunidad simulada.

Estos módulos normativos actúan como una capa intermedia de procesamiento que intenta extraer la regla general a partir de ejemplos concretos de interacción. En lugar de confiar en la predicción del siguiente token basada en probabilidades estadísticas, el módulo busca identificar la estructura de la norma: quién puede hacer qué, bajo qué condiciones y cuál es la sanción asociada. Esta arquitectura intenta forzar al modelo a pasar de un procesamiento asociativo a uno inferencial.

Fracaso de los LLM en la inferencia de reglas sociales

Los resultados obtenidos muestran que los agentes LLM de referencia fracasan sistemáticamente en el aprendizaje de normas. El estudio destaca un dato crítico: los modelos no logran adoptar las reglas sociales incluso cuando hacerlo mejoraría directamente su precisión y eficacia en la tarea asignada. Esto indica que la capacidad de inferir una norma a partir de la experiencia es una función que no emerge de forma natural en los modelos de lenguaje actuales, independientemente de su potencia de cómputo.

Al probar los diferentes módulos normativos, los investigadores descubrieron que la capacidad de seguir normas es extremadamente sensible tanto al estilo de la norma como al modelo específico que impulsa el módulo normativo. Esta variabilidad sugiere que no existe una capacidad de generalización en los LLM para este tipo de tareas. Lo que funciona para un tipo de regla social no es aplicable a otra, lo que impide que la IA desarrolle una competencia normativa versátil que pueda trasladar de un contexto a otro.

Este fallo de generalización implica que el modelo no ha aprendido el concepto de norma como tal, sino que intenta ajustar su comportamiento a patrones específicos de cada escenario. Si se cambia ligeramente la naturaleza de la regla social, el agente vuelve a fallar, lo que demuestra que la arquitectura de los transformadores no está procesando la norma como una ley abstracta aplicable a múltiples situaciones, sino como un dato puntual y aislado.

Atribución no selectiva e imitación de ruido conductual

Uno de los hallazgos más significativos del estudio es la identificación de un fallo de atribución no selectiva. Los investigadores introdujeron comportamientos idiosincrásicos en el entorno; es decir, acciones repetitivas que no eran normas obligatorias ni tenían una función útil, pero que acompañaban a la norma real. Los agentes de IA tendieron a copiar indiscriminadamente tanto las reglas sociales impuestas como el ruido conductual irrelevante.

Este patrón de imitación ciega persistió incluso cuando los investigadores aplicaron penalizaciones explícitas a los agentes por imitar comportamientos innecesarios. La IA no fue capaz de distinguir entre lo que era una norma social necesaria para la convivencia o el éxito en el grupo y lo que era simplemente una manía o un comportamiento aleatorio de otros agentes. Esto demuestra que los LLM actuales operan mediante una mímica conductual superficial en lugar de un proceso de comprensión analítica del orden social.

La atribución no selectiva revela una limitación fundamental en el procesamiento de información de los LLM: la incapacidad de filtrar el ruido conductual. Mientras que un humano identifica rápidamente que un gesto repetitivo de un interlocutor es una manía personal y no una regla del grupo, la IA procesa ambos estímulos con el mismo peso. Esto sugiere que el modelo no busca la causa o la razón de la conducta, sino que simplemente replica la frecuencia de aparición de los patrones observados.

Implicaciones para la seguridad y el despliegue de agentes autónomos

La conclusión principal de Wynn y su equipo es que existe una brecha profunda entre la imitación de comportamientos y la competencia normativa. Mientras que los LLM pueden parecer socialmente competentes porque han sido entrenados con vastas cantidades de texto humano que contienen ejemplos de interacciones sociales, carecen de la capacidad de discernir el orden social impuesto en tiempo real.

Esta incapacidad representa un riesgo para el despliegue de agentes de IA autónomos en entornos humanos reales. Si un sistema no puede diferenciar entre una norma social vinculante y un comportamiento accidental, su integración en comunidades humanas podría generar fricciones o malentendidos graves. Por ejemplo, un agente autónomo en un entorno laboral podría adoptar vicios conductuales de un usuario específico y elevarlos a la categoría de norma corporativa, o ignorar reglas implícitas de jerarquía y respeto que no estén explícitamente escritas en su manual de instrucciones.

Para los desarrolladores de IA, este resultado indica que el RLHF (Reinforcement Learning from Human Feedback) y el ajuste fino no son suficientes para resolver el problema de la adaptación social. El RLHF entrena al modelo para satisfacer las preferencias del evaluador humano, pero no le enseña a inferir las reglas de un grupo desconocido. El estudio subraya que el alineamiento no puede basarse únicamente en el entrenamiento previo, sino que requiere el desarrollo de capacidades específicas de inferencia normativa que permitan a la IA leer la situación (reading the room) de manera efectiva.

Mímica conductual frente a razonamiento lógico

El trabajo diferencia claramente dos procesos: la mímica, que es la reproducción de patrones observados, y la competencia normativa, que es la comprensión de la regla subyacente que genera esos patrones. Los modelos evaluados sobresalen en la primera pero fallan totalmente en la segunda. Esta distinción es fundamental para la regulación y el diseño de futuras arquitecturas de IA, ya que sugiere que añadir más datos de entrenamiento no resolverá el problema de la adaptación social.

Anteriormente, se asumía que el aumento de la escala de los modelos y la diversidad de los datasets de entrenamiento conducirían a una comprensión más profunda de las sutilezas sociales. Sin embargo, la investigación de Wynn demuestra que la escala no produce emergencia de competencia normativa. La capacidad de discernir normas no es una propiedad que surja simplemente al aumentar los parámetros del modelo, sino que requiere una capacidad de razonamiento lógico y social que la arquitectura actual de los transformadores no posee.

En cuanto a lo que se sabe y lo que permanece en la incertidumbre, el estudio confirma que los LLM son excelentes imitadores de superficies conductuales pero deficientes en la extracción de reglas sociales dinámicas. Se ha comprobado que los módulos normativos externos no logran proporcionar una solución generalizable y que la penalización directa no corrige la tendencia a copiar el ruido conductual.

No obstante, el estudio deja abiertas preguntas sobre si otras arquitecturas, que no se basen exclusivamente en la predicción de tokens, podrían superar este obstáculo. Tampoco queda claro si la introducción de memorias a largo plazo más estructuradas o sistemas de razonamiento simbólico integrados podrían permitir a la IA categorizar los comportamientos observados en normas y manías, separando el ruido de la regla.

La investigación concluye que, hasta la fecha, no se ha logrado operacionalizar la competencia normativa en los LLM. El hecho de que la IA copie el ruido conductual a pesar de ser penalizada indica que el proceso de aprendizaje por imitación está profundamente arraigado en la arquitectura de los transformadores, dificultando la transición hacia un modelo de aprendizaje basado en la comprensión de reglas sociales dinámicas.

Este hallazgo obliga a replantear la seguridad de los agentes autónomos. Si la IA no puede discernir normas, cualquier despliegue en entornos sociales complejos dependerá enteramente de reglas rígidas y preprogramadas, eliminando la flexibilidad necesaria para la interacción humana natural. La brecha entre mímica y comprensión normativa se posiciona así como uno de los cuellos de botella más críticos para alcanzar una IA verdaderamente integrada en la sociedad.