El enfoque en el resultado frente al ahorro de tokens individuales

GitHub ha modificado su estrategia de eficiencia en Copilot, desplazando el objetivo desde la simple reducción de tokens por interacción hacia la optimización del resultado final de la tarea. Según los ingenieros Erik Kristensen y Napalys Klicius, centrarse únicamente en acortar las respuestas de las herramientas puede ser contraproducente. La empresa detectó que cuando una respuesta es excesivamente concisa y omite información crítica, el agente de IA tiende a repetir comandos o reabrir archivos para recuperar los datos perdidos.

Para validar esta tesis, el equipo analizó el uso de RTK (Rust Token Killer), una utilidad diseñada para acortar la salida de la shell antes de que el agente la procese. Los benchmarks de codificación con agentes revelaron que, aunque RTK reducía los tokens en llamadas individuales, el coste global de la tarea aumentaba. Esto sucedía porque el modelo, al carecer de detalles necesarios, añadía más turnos de interacción y arrastraba un contexto mayor en cada paso posterior, incrementando el gasto total de tokens y el tiempo de ejecución.

Compresión selectiva de ruido y preservación de contexto

Para solucionar este problema, GitHub ha desarrollado un compresor de salida selectivo que diferencia entre información esencial y ruido repetitivo. El análisis de los procesos de ejecución mostró que las salidas de instalación, construcción, pruebas y linting suelen contener patrones redundantes que no aportan valor al razonamiento del modelo. En cambio, los resultados de comandos arbitrarios o la lectura de código fuente son críticos para el éxito de la tarea.

La política de compresión implementada se divide en tres ejes. Primero, se mantienen intactos los comandos de lectura y visualización como cat, git diff y git show, así como cualquier script arbitrario. Segundo, se reorganizan los resultados de búsqueda, como los obtenidos mediante grep, agrupando las coincidencias de forma más eficiente pero sin eliminar ningún resultado. Tercero, se aplica la compresión únicamente en salidas de construcción y progreso cuando el ahorro es sustancial.

Para garantizar que esta compresión no degrade la calidad, GitHub ha establecido una ruta de recuperación directa. Si el agente detecta que necesita la información original completa, puede recuperarla. El seguimiento de esta métrica ha servido como señal de evaluación: si los agentes recurren frecuentemente al original, significa que el compresor ha eliminado datos valiosos. En las pruebas en laboratorio, no se detectó una regresión estadística en el éxito de las tareas y los agentes rara vez necesitaron recuperar los originales.

Eliminación de formatos redundantes en la lectura de archivos

Una de las optimizaciones más directas ha sido la modificación de la herramienta view, utilizada por los agentes para leer el contenido de los archivos. Anteriormente, esta herramienta añadía un prefijo con el número de línea al principio de cada renglón. Esta funcionalidad era necesaria para herramientas de edición antiguas que utilizaban dichos números para localizar los cambios, pero los sistemas actuales de Copilot ya no dependen de ellos, ya que utilizan el código circundante para realizar la coincidencia.

La eliminación de estos prefijos ha tenido un impacto directo en el coste de inferencia del modelo. En los benchmarks de codificación con agentes, se registró una caída del 5% en los costes de inferencia. Al trasladar este cambio a los usuarios reales de Copilot CLI mediante experimentos en producción, el coste diario promedio de inferencia por usuario se redujo en aproximadamente un 3%. Esta mejora no afectó a las tasas de éxito ni aumentó los fallos de edición, liberando espacio en la ventana de contexto para que el modelo se centre en el trabajo real y no en el formato.

Optimización de prompts mediante meta-prompting

GitHub ha abordado también la reducción de los prompts, que son las instrucciones enviadas al modelo en cada turno. Debido a la acumulación de definiciones de agentes, esquemas y guías del sistema, los prompts habían crecido considerablemente. Para reducir su tamaño sin alterar el comportamiento del modelo, la empresa utilizó un bucle de meta-prompting, donde el propio Copilot redactaba y refinaba versiones más cortas de sus instrucciones.

Este proceso permitió reducir el prompt aproximadamente a la mitad, aunque no estuvo exento de riesgos. Durante las pruebas en producción, se detectó una regresión donde la guía sobre el paralelismo cauteloso se transformó en una política de programación rígida. Esto provocó que agentes personalizados que deberían haber trabajado de forma independiente empezaran a ejecutarse secuencialmente, ralentizando el proceso.

Para corregir este error, el equipo desarrolló una prueba de regresión específica y sustituyó las extensas listas de acciones permitidas y prohibidas por una sola frase: los agentes independientes pueden ejecutarse en paralelo, considerando los efectos secundarios. Esta simplificación devolvió la capacidad de decisión al modelo y permitió eliminar unos 1.300 tokens del prompt de la herramienta de tareas en cada turno, manteniendo la funcionalidad original.

Impacto en el ecosistema de productos de Copilot

Estas mejoras no se limitan exclusivamente a la interfaz de línea de comandos (CLI) de Copilot. Dado que diversos productos de la familia, como la aplicación de Copilot y el sistema de revisión de código (Copilot code review), comparten la misma infraestructura técnica subyacente, todas estas herramientas se benefician de la optimización de tokens y la gestión de contexto.

La implementación de estas medidas demuestra que la eficiencia en la IA generativa aplicada al código no depende de la reducción agresiva de datos, sino de una gestión inteligente de la información. Al optimizar el flujo de datos entre la herramienta y el modelo, GitHub logra reducir los costes operativos y mejorar la disponibilidad de la ventana de contexto, lo que permite manejar tareas más complejas sin sacrificar la precisión ni la calidad del código generado.