AI

Pi Coding Agent: el arnés minimalista hasta 2x más barato que Claude Code (benchmark de Databricks)

Pi es el agente de codificación para terminal con solo 4 herramientas y un prompt de sistema de 200 tokens. Databricks descubrió que los arneses simples como Pi reducen el coste por tarea hasta 2x con la misma calidad — y Shopify lo usó para hacer Liquid un 53% más rápido.

Keeping this site alive takes effort — your support means everything.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分! 無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!
Pi Coding Agent: el arnés minimalista hasta 2x más barato que Claude Code (benchmark de Databricks)

Conclusiones clave

  • Pi es un agente de codificación open source (MIT) creado por Mario Zechner (autor de libGDX) que incluye solo 4 herramientas (read, write, edit, bash) y un prompt de sistema de ~200 tokens, frente a los 10.000+ de sus competidores.
  • El benchmark de Databricks sobre su código de millones de líneas reveló que la elección del arnés cambia el coste por tarea más de 2x con la misma calidad; Pi envió ~3x menos contexto por turno y terminó las tareas en menos ejecuciones.
  • El benchmark también demostró que el precio por token es mala métrica: Sonnet 5 es más barato por token pero costó $2,09/tarea frente a los $1,94 de Opus 4.8, mientras GLM 5.2 open source igualó a Opus en calidad a $1,28/tarea.
  • El CEO de Shopify, Tobias Lütke, usó la extensión pi-autoresearch para optimizar Liquid: 93 commits de experimentos autónomos hicieron el parse+render un 53% más rápido con un 61% menos de asignaciones.
  • Pi no tiene sandbox ni sistema de permisos integrado (modo YOLO) — la seguridad es tuya. Es para usuarios avanzados que quieren control total, flexibilidad multi-proveedor (324 modelos) y soporte de modelos locales.

Respuestas clave

¿Qué es Pi (pi-coding-agent)?

Pi es un arnés de agente de codificación open source para terminal creado por Mario Zechner (autor de libGDX) bajo la organización Earendil Works. Incluye solo 4 herramientas principales — read, write, edit y bash — y un prompt de sistema de unas 200 tokens, confiando en que los modelos frontera modernos saben comportarse como agentes de codificación sin bloques masivos de instrucciones. Es MIT, independiente del modelo (324 modelos en más de 20 proveedores) y extensible mediante extensiones TypeScript en proceso.

¿Pi es realmente 2x más barato que Claude Code?

El benchmark interno de Databricks encontró que ejecutar el mismo modelo con el mismo esfuerzo de razonamiento a través de arneses distintos cambió el coste por tarea más de 2x en algunos casos con la misma calidad. Pi envió unas 3x menos contexto por turno, mantuvo un conjunto de trabajo más ajustado y terminó las tareas en menos ejecuciones. Combinado con Opus 4.8 a esfuerzo xhigh, Pi tuvo la mayor tasa de acierto a un coste significativamente menor que Claude Code o Codex.

¿Qué construyó Shopify con Pi?

El CEO de Shopify, Tobias Lütke, construyó pi-autoresearch, una extensión de bucle de experimentación autónoma para Pi (inspirada en el autoresearch de Andrej Karpathy). Ejecuta bucles de probar-medir-conservar-revertir sin supervisión. Lütke la usó en Liquid, el motor de plantillas Ruby de Shopify: 93 commits de ~120 experimentos automatizados hicieron el parse+render un 53% más rápido con un 61% menos de asignaciones de memoria. Otros resultados: tests unitarios 300x más rápidos y montaje de React 20% más rápido.

¿Es seguro usar Pi?

Pi no tiene sistema de permisos ni sandbox integrado — ejecuta comandos con los permisos completos del usuario que lo lanza (modo YOLO). El README apunta a opciones externas de sandboxing como Docker, Gondolin u OpenShell. Para repositorios sensibles o producción, trata el sandboxing como parte de la adopción, no como una idea tardía. Claude Code y Codex ofrecen prompts de permisos y sandboxing integrados por defecto.

¿Cómo se instala Pi?

npm install -g --ignore-scripts @earendil-works/pi-coding-agent, y luego ejecuta 'pi' en tu terminal. Configura una API key (p. ej. ANTHROPIC_API_KEY) o usa /login para acceso por suscripción (Claude Pro, ChatGPT Plus, GitHub Copilot, Gemini CLI). Define el comportamiento del proyecto en un archivo AGENTS.md e instala extensiones como pi-autoresearch con 'pi install npm:pi-autoresearch'.

Pi Coding Agent: el arnés minimalista hasta 2x más barato que Claude Code

El mercado de agentes de codificación de 2026 tiene un giro nuevo: la herramienta más simple podría ser la de mejor valor. Pi (pi-coding-agent), creado por el fundador de libGDX Mario Zechner, incluye solo cuatro herramientas y un prompt de sistema de menos de 1.000 tokens — y el benchmark interno de Databricks descubrió que este diseño minimalista superó a rivales pesados tanto en coste como en calidad.

Aquí está por qué la filosofía de “menos es más” de Pi está respaldada por datos duros, qué reveló realmente el benchmark de Databricks sobre el mercado, y quién debería cambiarse.

Qué es Pi

Pi es un arnés de agente de codificación open source para terminal de Earendil Works. Su filosofía de diseño es agresivamente minimalista: “Si no lo necesito, no se construye.”

Decisión de diseñoPiClaude Code / Codex
Herramientas por defecto4 (read, write, edit, bash)10+ (búsqueda, web, notebooks, subagentes…)
Prompt de sistema~200 tokens~10.000+ tokens
SandboxNinguno (modo YOLO)Prompts de permisos + sandbox integrados
LicenciaMIT (open source)Propietaria
Modelos324 en más de 20 proveedoresAtado al proveedor
ExtensibilidadExtensiones TypeScript en procesoHooks de shell + MCP

La apuesta: los modelos frontera ya están entrenados hasta el punto de entender inherentemente cómo actuar como agentes de codificación. No necesitan 10.000 tokens de ayuda — necesitan una interfaz limpia y gestión disciplinada del contexto. Todo lo demás es opt-in mediante extensiones.

El benchmark de Databricks: el arnés importa más que el modelo

En julio de 2026, Databricks publicó un benchmark construido sobre tareas reales de ingeniería de su código de millones de líneas (Python, Go, TypeScript, Scala y más). Los resultados sacudieron la sabiduría convencional:

1. La elección del arnés cambia el coste más de 2x

“El arnés desde el que se llama al modelo impacta drásticamente en coste y calidad. En muchos casos, arneses simples como Pi rindieron mejor en nuestras cargas de trabajo.”

Ejecutar el mismo modelo con el mismo esfuerzo de razonamiento a través de arneses distintos produjo más de 2x de diferencia en coste por tarea — con calidad idéntica. El principal factor: Pi envió ~3x menos contexto por turno, mantuvo un conjunto de trabajo más ajustado y terminó las tareas en menos ejecuciones. Es la “disciplina de contexto” de Pi.

Combinado con Opus 4.8 a esfuerzo xhigh, Pi tuvo la mayor tasa de acierto global a un coste significativamente menor que Claude Code y Codex.

2. El precio por token es una métrica terrible

ModeloPrecio/tareaTasa de finalizaciónNotas
GLM 5.2 (open source)$1,28Nivel superiorEstadísticamente empatado con Opus 4.8 en calidad
Opus 4.8$1,9487%Mejor nivel de capacidad
Sonnet 5$2,0981%Más barato por token, pero 1,9x más tokens consumidos

Sonnet 5 es ~1,7x más barato por token que Opus 4.8 — pero costó más por tarea porque trabajó más tiempo y leyó más. La lección: los modelos más baratos pueden ser más caros cuando necesitan más turnos para terminar.

3. Los modelos open source ya son conductores diarios

GLM 5.2 llegó al nivel superior de capacidad, empatando estadísticamente con Opus 4.8 en calidad a $1,28/tarea frente a los $1,94 de Opus. Databricks afirma que ya está desplegando modelos abiertos como conductores diarios para codificación.

4. Construye tu propio benchmark

Los benchmarks públicos como SWE-Bench se filtran en los datos de entrenamiento. La idea de Databricks: cualquier equipo con un historial de PRs fusionados ya tiene un benchmark sobre el que ningún modelo ha entrenado.

El avance de Shopify: optimización autónoma con Pi

La validación real más convincente viene de Shopify. El CEO Tobias Lütke construyó pi-autoresearch — una extensión de bucle de experimentación autónoma para Pi, inspirada en el concepto autoresearch de Andrej Karpathy:

Prueba una idea → Mídela → Conserva mejoras → Revierte regresiones → Repite para siempre

Usando la auto-edición de Pi, Lütke simplemente pidió a Pi que creara la extensión — Pi leyó su propia documentación de extensiones y construyó el flujo de trabajo.

Los resultados en Liquid (el motor de plantillas Ruby de Shopify con 20 años de antigüedad):

  • 93 commits de ~120 experimentos automatizados
  • parse+render un 53% más rápido
  • 61% menos asignaciones de memoria

Otros logros reportados: tests unitarios 300x más rápidos, montaje de componentes React 20% más rápido y mejor rendimiento de pnpm.

El punto clave: Pi no incluye ninguna de estas herramientas de serie. Las hace trivialmente construibles — añades complejidad solo cuando “se la gana”.

Por qué gana el minimalismo ahora

Hace un año, los arneses nativos tenían ventaja estructural porque los modelos se entrenaban alrededor de ellos. Ese argumento se ha derrumbado. La propia Anthropic recortó el prompt de sistema de Claude Code un 80% — evidencia de que la industria converge hacia la tesis de Pi: los modelos necesitan una interfaz limpia, no un muro de instrucciones.

El minimalismo de Pi también importa para la ola de modelos locales: los modelos locales tienen ventanas de contexto más pequeñas y prefills lentos, así que el prefix de prompt estable y la disciplina de contexto de Pi lo convierten en un arnés ideal para Ollama, vLLM y LM Studio.

Las advertencias honestas

Pi no es para todos. Las contrapartidas son reales:

  1. Sin sandbox ni sistema de permisos. Pi ejecuta con tus permisos completos de usuario. “La seguridad en agentes de codificación es mayormente teatro”, argumenta Zechner — pero eso significa que eres dueño de la frontera de seguridad. Usa Docker, Gondolin u OpenShell para trabajo sensible.
  2. La complejidad está en tus manos. Sin subagentes, modo plan ni búsqueda web integrados. Instalas y mantienes las extensiones tú mismo.
  3. Mantenido por una sola persona, pre-1.0. Pi es un proyecto individual con cadencia rápida (10+ releases en 8 días), pero sin SSO empresarial ni gobernanza gestionada.
  4. Consenso de la comunidad: algunos usuarios reportan que los modelos a veces fallan al editar código con el conjunto mínimo de herramientas de Pi (a menudo por cuantización con modelos locales).

Quién debería usar Pi

Elige Pi si…Elige Claude Code / Codex si…
Quieres control total del uso de tokensQuieres guardarraíles todo incluido
Ejecutas modelos locales u open sourceVives en sesiones largas con muchas herramientas
Quieres extensiones TypeScript personalizadasNecesitas subagentes y equipos integrados
Necesitas bucles de optimización autónomosNecesitas soporte empresarial y SSO
Prefieres un flujo de trabajo de terminalPrefieres una experiencia guiada gestionada

Primeros pasos

# Instalación
npm install -g --ignore-scripts @earendil-works/pi-coding-agent

# Lanzar
pi

# Configurar: define ANTHROPIC_API_KEY (o cualquier proveedor) o usa /login

# Añadir la extensión de optimización autónoma
pi install npm:pi-autoresearch

Define el comportamiento del proyecto en un archivo AGENTS.md en la raíz del repositorio. Pi es gratis y MIT — solo pagas las tarifas de API del proveedor o ejecutas modelos locales gratuitos.

Conclusión

El ascenso de Pi — validado por los datos de Databricks y la adopción a nivel de CEO en Shopify — señala un cambio en el mercado de codificación con IA: el arnés es ahora tan importante como el modelo. El mejor valor en 2026 podría venir de la herramienta que hace menos, envía menos contexto y se aparta del camino del modelo. Para usuarios avanzados que controlan su flujo de trabajo, Pi es el argumento más convincente hasta la fecha de que el minimalismo es una característica de rendimiento.