Un ingeniero de Netflix ha creado la herramienta definitiva para ahorrar tokens

Ahorro tokens inteligencia artificial
Ahorro tokens inteligencia artificialIA

Con 50.000 estrellas en GitHub, este ingeniero de Netflix ya creado la mejor herramienta si quieres ahorrar tokens sin perder precisión, con acceso a Claude Code y otros.

Hay ya negocios que enfrentan facturas millonarias por utilizar modelos de lenguaje natural (LLM) sin pensar en el coste de los tokens –los créditos para estos LLM– y en el uso responsable de los mismos.

Recientemente, una compañía que prefiere mantenerse en el anonimato llegó a gastar 500 millones de dólares en un solo mes, un paradigma que muestra que aún sigue siendo más rentable contratar a seres humanos, en lugar de dejar todo en manos de las máquinas, que aún tienen un margen de error bastante elevado.

Para cualquier usuario normal que utilices estos LLM y no quiera gastar mucho en tokens, no es fácil encontrar y configurar un modelo potente open source, correrlo en local y ahorrar dinero.

Afortunadamente, un ingeniero sénior de software de Netflix, Tejas Chopra, ha creado una herramienta open source conocida como Headroom que promete ahorrar entre un 60% y un 95% el uso de tokens en los prompts, pero manteniendo un 100% de precisión en las respuestas.

Este ingeniero de software forma parte del equipo de plataformas de modelos de lenguaje e infraestructura de inteligencia artificial en la plataforma de streaming, y se enfrentaba a las mismas limitaciones con este tipo de servicios, por lo que decidió crear este repositorio.

Un gran alivio para todos los usuarios y negocios que utilizan habitualmente Claude Code, Cursor o Copilot para sus desarrollos, ya que el ahorro es considerable, no solo en el uso de este tipo de IA, sino también a nivel económico.

Una herramienta para que la factura no se vaya de las manos

Con el imparable avance de las capacidades de los LLM también ha crecido el consumo de tokens que requiere cada respuesta a cada prompt, la principal barrera para negocios que quieran escalar o desarrolladores individuales que no puedan permitirse pagar una suscripción mensual que suponga cientos de euros.

Headroom soluciona esto evitando el desperdicio de tokens. Esto se debe a que los agentes actuales suelen reenviar todo el historial de la conversación junto con otros archivos que consumen básicamente todos estos créditos.

Según los datos existentes que comparte Headroom, aproximadamente el 90% de los datos que lee y revisa un agente de IA pertenecen a lo que se conoce como "ruido", por lo que el agente acabará consumiendo mucho más de lo que es necesario para que la respuesta continúe siendo fiable.

Aquí entran en juego también los modelos fronterizos, los que ofrecen una API para que diferentes negocios y usuarios puedan usarlos, con versiones gratuitas que suelen acabarse con una simple conversación –más allá de esto, si no se revisan bien los límites de tokens, las facturas pueden llegar a ser desorbitadas–.

Por ejemplo, imagina que eres un ingeniero de software que utiliza un agente de estos, con un modelo como Claude Sonnet, durante una jornada de 4 horas. Fácilmente, puedes gastar en cada consulta 250.000 tokens si está corrigiendo errores en el código o realizando tareas complejas.

Ahorro gastos tokens Headroom
Ahorro gastos tokens HeadroomHeadroom

Teniendo en cuenta esto, en empresas que utilicen estos modelos y tengan un equipo de 5 programadores, el gasto podría resultar en una factura kilométrica que quizá la compañía no pueda asumir.

Para mitigar este problema, Headroom se basa en diferentes algoritmos de compresión, como SmartCrusher, que reestructura los objetos JSON repetitivos, elimina claves duplicadas y los espaciados innecesarios, sin perder los datos.

Además, también es capaz de analizar el código fuente para extraer su árbol y reducir los comentarios innecesarios para que la lógica del modelo continúe funcionando, como es CodeCompressor.

Finalmente, también utilizar Kompress-vs-base, que es un LLM ligero entrenado de forma local por el equipo de Headroom y que se distribuye en HuggingFace.

Gracias a aquella idea inicial de Chopra, hay ya numerosos repositorios abiertos que operan bajo la firma de HeadroomLabs-AI, y ya acumula aproximadamente unas 50.000 estrellas en GitHub, una cifra que marca la popularidad de Headroom.

Cómo instalar Headroom para ahorrar tokens con tu LLM preferido

Al estar escrita sobre Python, lo primero de todo que necesitarás para lanzar Headroom es tener Python 3.10 o una versión superior instalada en la máquina en la que esté corriendo tu LLM.

Para la instalación de Headroom, hay 2 opciones principales: la primera, desde PyPI mediante el comando pip install headroom-ai; en el caso de la segunda opción, clonando el repositorio oficial con el modo desarrollo de instalación, a través del comando git clone https://github.com/headroomlabs-ai/headroom. Cambiar a la carpeta con cd headroom y ejecutar después el comando pip install -e.

La opción más recomendable para usar la terminal con la mayor facilidad posible es aprovechar servicios como Claude Code o Cursor, ya que solo tendrás que añadir el comando wrap para que la herramienta pueda reconocer el tráfico entrante y saliente del LLM, así como optimizar de forma automática la configuración de la red.

Por ejemplo, si usas Claude Code, simplemente ejecuta el comando headroom wrap claude, cambiando el modelo concreto que estés utilizando en la última parte del comando.

Headroom ahorro tokens IA
Headroom ahorro tokens IAHeadroom

En la práctica, Headroom funciona como un middleware, el software conocido por optimizar otro software, un aspecto crucial si se tiene en cuenta que el presente y el futuro gira en torno a los agentes múltiples.

De momento, este ingeniero de software ha demostrado que los LLM aún pueden ser mucho más eficientes, no simplemente desde sus capacidades propias, sino también mediante herramientas de optimización concretas.

Si lo pruebas, notarás que el consumo de tokens se reduce notablemente, hasta en un 95% en algunos casos, un aspecto que continuará siendo esencial para que estos modelos de IA no acaben consumiendo créditos de usuarios y organizaciones sin sentido alguno.

Más información sobre: