Herramientas de IA

Spotify crea Shunt para Claude Code: reduce un 90% los tokens al delegar lecturas de archivos

El plugin Shunt usa Portal y modelos más baratos para descargar tareas de Claude Code. Spotify midió ahorros del 82% al 94% en grandes lecturas.

Spotify ha publicado Shunt, un plugin para Claude Code diseñado para reducir el consumo de tokens del modelo principal delegando tareas de gran volumen y poco razonamiento a modelos más baratos mediante Portal. En pruebas realizadas sobre un monorepositorio Java, la compañía obtuvo un ahorro medio cercano al 90% en los tokens utilizados para leer archivos grandes.

El resultado no significa que Shunt reduzca un 90% todo el consumo de Claude Code. La cifra corresponde específicamente a tres escenarios de lectura masiva evaluados por Spotify, donde los ahorros oscilaron entre el 82% y el 94%. La propuesta consiste en reservar Claude para las tareas que requieren más razonamiento y enviar operaciones de entrada y salida a un modelo de menor coste.

Shunt evita que Claude lea directamente archivos muy grandes

Cuando un agente de programación necesita comprender un proyecto puede consumir decenas de miles de tokens simplemente leyendo código que después resumirá. Shunt intenta evitar ese gasto mediante un hook de Claude Code que se ejecuta antes de cada operación de lectura.

Por defecto, si Claude intenta leer completamente un archivo de más de 350 líneas, el plugin bloquea la operación y lo redirige hacia una herramienta denominada bulk-reader. El límite puede modificarse mediante configuración y las lecturas específicas de una sección concreta siguen permitiéndose.

Shunt también intercepta determinados comandos de terminal utilizados para cargar archivos grandes en el contexto, incluidos cat, head, tail, less y more. Las operaciones dirigidas a información concreta pueden continuar normalmente.

Portal ejecuta la tarea con otro modelo de IA

La delegación se realiza a través de Portal by Spotify y sus AiKA Modes. Estos modos funcionan como agentes declarativos en los que una organización puede definir instrucciones, seleccionar un modelo, configurar parámetros y conectar herramientas mediante MCP.

Spotify utilizó Gemini 2.5 Flash como modelo trabajador en sus ejemplos de bulk-reader y code-writer. Sin embargo, la arquitectura no depende de ese modelo concreto: cada instalación de Portal puede configurar otros modelos y sustituir el encargado de realizar las tareas delegadas.

El modelo económico recibe los archivos y devuelve únicamente un resumen estructurado con la información solicitada. Claude Code consume ese resumen en lugar de introducir todos los archivos originales en su propio contexto.

Spotify midió ahorros de hasta el 94%

Spotify evaluó Shunt sobre un monorepositorio Java de aproximadamente 162.000 líneas. En una prueba con un único archivo de 4.014 líneas, Claude necesitó 33.684 tokens sin delegación y 5.737 con Shunt, lo que representa una reducción del 82%.

En otro escenario con 7.408 líneas repartidas entre código fuente y pruebas, el consumo pasó de 75.990 a 4.148 tokens, una reducción del 94%. Una tercera prueba que analizaba 1.281 líneas repartidas entre varios servicios bajó de 16.221 a 821 tokens, también cerca del 94%.

La media de esos tres escenarios de lectura fue aproximadamente del 90%. Se trata de pruebas realizadas por Spotify sobre un repositorio y unos flujos de trabajo concretos, por lo que el porcentaje no puede extrapolarse automáticamente a todos los proyectos ni a todas las sesiones de Claude Code.

También puede generar código sin introducirlo en el contexto de Claude

Shunt incorpora otro modo denominado code-writer destinado a tareas predecibles como generar pruebas, archivos de configuración, estructuras repetitivas o definiciones de tipos siguiendo patrones que ya existen en un proyecto.

En este caso, el modelo trabajador recibe una especificación y un archivo de referencia, genera el nuevo contenido y puede escribirlo directamente en el disco. Claude no necesita recibir como salida todo el código generado, evitando así consumir tokens adicionales en su contexto.

Spotify no asigna a este escenario un porcentaje de ahorro comparable al de bulk-reader porque las dos configuraciones no producen exactamente el mismo flujo de tokens. Sin Shunt, Claude debe leer el material de referencia y además generar el código; con la delegación, el resultado puede ir directamente a un archivo.

Shunt no delega el razonamiento complejo

Spotify establece límites claros sobre qué trabajos deben enviarse a un modelo más barato. Shunt no está pensado para delegar depuración, decisiones de arquitectura ni código crítico para la seguridad, porque esas tareas requieren razonamiento y acceso preciso al contexto.

Durante las pruebas, el modelo trabajador pudo identificar patrones superficiales, pero no detectó un problema sutil relacionado con la seguridad de hilos. Claude sí encontró posteriormente el fallo cuando recibió el contexto necesario. Este resultado llevó a Spotify a excluir explícitamente la depuración de las operaciones que Shunt intenta derivar automáticamente.

La edición también tiene limitaciones. Los resúmenes generados por el modelo delegado no proporcionan necesariamente referencias de línea suficientemente fiables para modificar código. Cuando Claude necesita realizar cambios concretos, puede leer directamente una sección delimitada del archivo.

Delegar tareas también añade latencia

Enviar una tarea desde Claude Code hacia Portal y después al modelo trabajador introduce una llamada adicional por red. Spotify indica que estas operaciones suelen tardar entre 10 y 30 segundos, mientras que Portal establece actualmente un límite de 30 segundos para cada invocación.

Por ese motivo, delegar archivos pequeños puede ser contraproducente: el ahorro de tokens no compensa siempre el retraso adicional. El umbral predeterminado de 350 líneas busca evitar precisamente que Shunt derive automáticamente trabajos demasiado pequeños.

Spotify publica los plugins para que otros equipos los utilicen

Spotify mantiene Portal AI Plugins en un repositorio público y ofrece integraciones de Portal para Claude Code, Codex y Cursor. Shunt, sin embargo, está dirigido actualmente a Claude Code y utiliza sus hooks para imponer la redirección de las lecturas grandes.

Los modos bulk-reader y code-writer pueden compartirse dentro de una organización y personalizarse con diferentes instrucciones o modelos. De este modo, una empresa puede reservar modelos avanzados para programación y razonamiento complejos mientras utiliza opciones más económicas para resumir archivos, generar código repetitivo u otras tareas intensivas en tokens.

La prueba de Spotify muestra así un enfoque diferente para controlar el coste de los agentes de programación: en lugar de intentar que un único modelo realice todo el trabajo, Shunt decide qué partes necesitan realmente al modelo principal y cuáles pueden ejecutarse con recursos más baratos sin llenar su contexto.