Open Source

LLM Council: monta tu propio panel de debate multi-modelo con la app de 400 líneas de Karpathy

El LLM Council de Andrej Karpathy (23.8k estrellas) convierte una IA en una sala de juntas: varios modelos de frontera responden tu consulta de forma independiente, revisan anónimamente el trabajo de los demás, y un modelo Presidente sintetiza el veredicto final. Guía completa del pipeline de 3 fases, instalación con OpenRouter, costes honestos y cuándo un consejo vence a un modelo único.

Keeping this site alive takes effort — your support means everything.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分! 無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!
LLM Council: monta tu propio panel de debate multi-modelo con la app de 400 líneas de Karpathy

Conclusiones clave

  • LLM Council es la app web local de 23.8k estrellas de Karpathy que consulta varios modelos de frontera (GPT-5.1, Gemini 3 Pro, Claude Sonnet 4.5, Grok 4) vía OpenRouter, les hace revisar y puntuar anónimamente el trabajo de los demás, y un modelo Presidente sintetiza la respuesta final — un 'Map-Reduce para la inteligencia.'
  • El pipeline de 3 fases: Fase 1 fan-out (respuestas independientes en paralelo), Fase 2 convergencia (cada modelo puntúa respuestas anonimizadas como Respuesta A/B/C, venciendo el sesgo de autopreferencia y de longitud), Fase 3 síntesis (el Presidente resuelve contradicciones y produce el veredicto final).
  • Resuelve el problema del 'sí-sí' (sycophancy): Stanford demostró que Claude está de acuerdo con los usuarios un 49% más que un humano. Un consejo reemplaza el 'espejo' de un modelo único por una sala de juntas adversarial de voces independientes.
  • Costes honestos: los consejos corren ~5.1x más lento (15-45s por consulta) y cuestan 3-7x más por consulta por el crecimiento de contexto n + n². Úsalos solo para decisiones de alto riesgo, ambiguas o irreversibles — no para chat, generación de código ni búsquedas simples.
  • Karpathy lo etiquetó como '99% vibe coded' y declaró que 'las librerías se acabaron' — el prompt de sistema y el protocolo de interacción son los activos; el código es andamiaje desechable que pides a un LLM que reescriba.

Respuestas clave

¿Qué es el LLM Council de Karpathy?

LLM Council es una app web local ligera de Andrej Karpathy (23.8k estrellas) que agrupa varios LLM en un 'consejo.' En lugar de preguntar a un modelo, tu consulta se envía a varios modelos de frontera (por defecto: OpenAI GPT-5.1, Google Gemini 3.0 Pro, Anthropic Claude Sonnet 4.5, xAI Grok 4) vía OpenRouter. Responden independientemente, revisan y puntúan anónimamente las respuestas de los demás, y un modelo Presidente designado compila la respuesta final. Es una interfaz tipo ChatGPT ejecutando un pipeline de consenso de tres fases.

¿Cómo funciona el pipeline de 3 fases del consejo?

Fase 1 (Primeras opiniones): la consulta se distribuye en paralelo a todos los modelos, cada uno responde independientemente en vista de pestañas. Fase 2 (Revisión): todas las respuestas se anonimizan (etiquetadas Respuesta A, B, C) y se envían de vuelta a cada modelo, que las puntúa por precisión y perspicacia — la anonimización previene el sesgo de autopreferencia y de marca. Fase 3 (Respuesta final): un modelo Presidente recibe la pregunta, todas las respuestas y todas las puntuaciones, resuelve contradicciones y sintetiza un veredicto final único.

¿Cuánto cuesta ejecutar un LLM Council?

Espera 3-7x el coste de una consulta de modelo único, porque una pregunta dispara N llamadas paralelas más N² evaluaciones más la síntesis del Presidente. La latencia es ~5.1x más lenta (15-45 segundos por consulta, limitada por el modelo más lento). Es económicamente racional solo cuando el coste de equivocarse supera el coste de consultar varios modelos — decisiones de alto riesgo, ambiguas o irreversibles.

¿Qué es el problema del 'sí-sí' y cómo lo arregla el consejo?

La investigación de Stanford halló que modelos como Claude están de acuerdo con la opinión implícita del usuario un 49% más que un humano — así que pedir consejo a una IA para una decisión importante te devuelve tu propia opinión con una fuente más bonita. El LLM Council reemplaza este espejo por una sala de juntas adversarial: voces independientes que se ponen a prueba mutuamente, con revisión por pares anónima que filtra alucinaciones y sesgos antes del veredicto del Presidente.

¿Cuándo NO deberías usar un consejo de LLMs?

Evítalo para aplicaciones en tiempo real (latencia de 15-45s), búsquedas factuales simples, presupuestos ajustados, generación de código (los estilos de modelos distintos crean salida inconsistente), escritura creativa (el ensemble diluye la voz) o cuando ya tienes un modelo especialista afinado. La mayoría de equipos encuentra que solo el 5-10% de las consultas merecen un consejo — las preguntas de alto valor donde la mejor respuesta posible justifica el coste.

LLM Council: monta tu propio panel de debate multi-modelo con la app de 400 líneas de Karpathy

En un mundo donde cada startup de IA hace la misma pregunta — ¿sobre qué modelo construyo? — Andrej Karpathy construyó una respuesta distinta: ¿por qué no todos?

LLM Council es una app web local de 23.8k estrellas que parece ChatGPT pero funciona como una sala de juntas. Tu consulta va a cuatro modelos de frontera a la vez. Responden independientemente, luego revisan y puntúan anónimamente el trabajo de los demás, y finalmente un modelo Presidente designado compila un veredicto sintetizado único.

Es un “hack de sábado divertido” de 400 líneas que Karpathy llama 99% vibe coded — y se ha convertido en uno de los proyectos más discutidos en IA, porque se sitúa en la intersección de dos cambios sísmicos: arquitecturas ensemble y vibe coding.

El problema: la falacia del sí-sí

La investigación de Stanford mostró que modelos como Claude están de acuerdo con la opinión implícita del usuario un 49% más que un humano — y alucinan entre el 3-48% de las veces. Pide consejo a una IA para una decisión estratégica y obtienes tu propia opinión “con una fuente más bonita.”

Depender de un modelo único crea lo que los analistas llaman Síndrome de Monocultivo de Modelos: tratas la salida de un motor probabilístico como evangelio, ciego a sus vacíos de entrenamiento, sesgos y modos de fallo. Gemini es conciso pero reacio al riesgo. Claude es literario pero excesivamente cauto. GPT es confiado pero incorrecto en temas de nicho.

Un consejo de administración con un miembro no es un consejo — es un espejo. El consejo reemplaza el espejo por una sala de juntas.

El pipeline de 3 fases

Fase 1: Primeras opiniones (divergencia)

La consulta se distribuye en paralelo a cada miembro del consejo vía asyncio.gather(). Cada modelo responde independientemente — sin pensamiento de grupo, sin sesgo de semilla. La UI muestra todas las respuestas en vista de pestañas para comparar perspectivas lado a lado.

La latencia aquí está limitada por el modelo más lento, no por la suma — una decisión crítica de UX.

Fase 2: Revisión (convergencia)

Aquí está la genialidad arquitectónica. Todas las respuestas se anonimizan — identidades de modelo eliminadas, etiquetadas simplemente “Respuesta A,” “Respuesta B,” etc. — y se envían de vuelta a cada modelo, que las puntúa por precisión y perspicacia.

¿Por qué anonimizar? Los LLM exhiben sesgo de autopreferencia documentado (favorecen la salida de su propia familia) y sesgo de longitud (favorecen respuestas verbosas). Forzar evaluación ciega hace que los jueces evalúen solo calidad semántica. Como dice la teoría, los discriminadores son más fáciles que los generadores: es más fácil reconocer una buena imagen que pintarla.

Esta fase cuesta O(N²) en contexto — cada modelo evalúa cada respuesta — que es donde se va el presupuesto de tokens.

Fase 3: Respuesta final (síntesis)

El modelo Presidente designado (por defecto: Gemini 3 Pro, elegido por su ventana de contexto larga) recibe:

  • La pregunta original
  • Todas las respuestas candidatas de la Fase 1
  • La matriz completa de puntuaciones de la Fase 2

Resuelve contradicciones — detectando que “el Modelo A cometió un error de cálculo, que el Modelo C notó” — y sintetiza una respuesta definitiva. Un Map-Reduce para la inteligencia: mapear entre modelos, reducir a un veredicto.

Instalación: de cero a consejo en 5 minutos

# 1. Clonar
git clone https://github.com/karpathy/llm-council.git && cd llm-council

# 2. Dependencias
uv sync
cd frontend && npm install && cd ..

# 3. Clave API
echo "OPENROUTER_API_KEY=sk-or-..." > .env

# 4. Opcional: personalizar el consejo (backend/config.py)
# COUNCIL_MODELS = ["openai/gpt-5.1", "google/gemini-3-pro-preview", "anthropic/claude-sonnet-4.5", "x-ai/grok-4"]
# CHAIRMAN_MODEL = "google/gemini-3-pro-preview"

# 5. Ejecutar
./start.sh   # o: uv run python -m backend.main + cd frontend && npm run dev

Abre http://localhost:5173 — una interfaz tipo ChatGPT donde tu pregunta va a todo el consejo.

Stack técnico: FastAPI (Python 3.10+, async httpx) · React + Vite + react-markdown · almacenamiento JSON en data/conversations/ · uv + npm. OpenRouter actúa como fachada unificada — cambia cualquier modelo editando config, sin cambios de código.

Los tradeoffs honestos

DimensiónModelo únicoLLM Council
Latencia~segundos15-45s (~5.1x más lento)
Coste por consulta1x3-7x (N llamadas + N² revisiones + Presidente)
Sesgo/alucinaciónRiesgo sí-síFiltrado por revisión por pares anónima
Mejor paraAlto volumen, rutinaAlto riesgo, ambiguo, irreversible
Crecimiento de contextoLinealCuadrático (n + n²)

El marco de decisión: si el coste de equivocarse supera el coste de consultar varios modelos, usa un consejo. La mayoría de equipos encuentra que el 5-10% de las consultas merecen un consejo — las preguntas de alto valor donde la mejor respuesta posible justifica el gasto.

Evítalo para: chat en tiempo real, búsquedas simples, generación de código (estilos inconsistentes), escritura creativa (voz diluida), especialistas afinados, presupuestos ajustados.

El ecosistema: la ola multi-modelo de 2026

LLM Council no fue un caso aislado — aterrizó al inicio de un cambio industrial genuino hacia la orquestación de modelos:

  • OpenRouter Fusion (marzo 2026): síntesis de respuestas multi-modelo a nivel de gateway — los agentes Deep Research prefirieron la salida fusionada a la propia
  • Maestro / RouteLLM: enrutamiento cheap-first que escala solo cuando es necesario
  • LiteLLM / Portkey: la plomería unificada debajo
  • Forks comunitarios: llm-council-plus (UI moderna, multi-proveedor, soporte Ollama, hasta 8 modelos), reconstrucciones en n8n conectadas a Claude vía MCP, despliegues dockerizados

Las 400 líneas de Karpathy anticiparon la dirección: el “modelo” con el que interactúas se está convirtiendo en un ensemble dinámico, no en un endpoint único.

La filosofía: por qué ’las librerías se acabaron'

La alerta Vibe Code del README es el artefacto real:

“El código es efímero ahora y las librerías se acabaron. Pide a tu LLM que lo cambie como quieras.”

Karpathy trata main.py no como texto sagrado sino como andamiaje temporal. Los activos son los prompts de sistema y el protocolo de interacción — el diseño del pipeline Fase 1→2→3. El pegamento de Python es desechable, reescribible por un LLM bajo demanda.

Este es el cambio del paradigma Clean Code al vibe coding: trabaja a nivel conceptual, deja que el agente maneje la implementación, itera libremente. Da escalofríos a los ingenieros de QA — y es hacia donde se dirige la industria.

Conclusión

LLM Council es engañosamente simple: 400 líneas, un fin de semana, cero intención de mantenimiento — y sin embargo demuestra un patrón que está reformando el diseño de productos de IA. Cuando necesitas una respuesta donde equivocarse es caro, un modelo es un espejo; un consejo es una sala de juntas.

Ejecútalo tú mismo, mira cuatro modelos de frontera debatir tu pregunta más difícil en revisión por pares anónima, y ve qué produce una síntesis del Presidente. El código es efímero — el patrón no.