DeepSeek Harness: el framework de agentes open source donde todo es un plugin
La fórmula está en todas partes ahora: Modelo + Harness = Agente.
El modelo razona. El harness maneja todo lo demás — ejecución de herramientas, memoria, control de contexto, sandboxing, orquestación. Y en agosto de 2026, DeepSeek publicó lo que podría ser la implementación open source de referencia más importante de esa fórmula.
DeepSeek Harness (dsh) es el framework de agentes open source del laboratorio chino: 25.9k estrellas, licencia MIT, 12.000+ commits, y una arquitectura construida sobre una idea radical — todo es un plugin.
“Los modelos, herramientas, skills, sesiones, sandboxes, filesystems, loops, orquestación y UI son TODOS plugins, y pueden mezclarse, emparejarse, reemplazarse y extenderse.”
La arquitectura: Cordis debajo de todo
dsh está impulsado por Cordis, un meta-framework de plugins cuyo diseño se describe en un paper sobre componibilidad espaciotemporal. Qué significa en la práctica:
- Sin núcleo privilegiado. Cada parte del producto — adaptador de modelo, registro de herramientas, log de sesión, incluso el propio loop de agente — es un plugin. Extiendes dsh montando un plugin junto a los demás, y los registros se deshacen cuando el plugin se descarga.
- Composición en capas. Un dsh corriendo es un árbol de plugins compuesto desde profiles y bundles (
dsh-baseprovee adaptadores de modelo, herramientas, sandbox, política de aprobación;dsh-web-appañade la UI de navegador;dsh-headlesses un runner de un solo disparo). Cada fila del árbol de config puede reemplazarse con un patch propio. - Seguridad endurecida. Como las restricciones viven en el registro de herramientas, no en el prompt, un agente de solo lectura simplemente no tiene herramientas de escritura registradas. Un comentarista de HN lo resumió: “Las restricciones a nivel de prompt aguantan hasta que una sesión larga empieza a improvisar, y entonces te enteras.”
Ejecútalo con un comando
npx @deepseek-ai/dsh web
Eso arranca la Web UI en http://127.0.0.1:3080 — un portal local para visualizar sesiones de agente, salidas de herramientas y configuración. (O clona y compila con pnpm.)
Los 9 sub-agentes: por qué multi-agente vence a un loop gigante
La mayoría de los coding agents son un modelo grande en un loop — leer archivos, planear, editar, testear, revisar, todo desde el mismo cerebro. Eso funciona para tareas diminutas y se rompe en cualquier cosa que toque más de un par de archivos.
dsh toma el enfoque opuesto: nueve sub-agentes especializados, cada uno con un trabajo estrecho y un modelo afinado:
| Sub-agente | Trabajo |
|---|---|
| File picker | Escanea el codebase, trae solo archivos relevantes (usa Gemini 3.1 Flash Lite barato para recuperación — menos ruido de contexto = salida más nítida) |
| Planner | Divide tareas grandes en pasos ordenados; el comando de entrevista /in pregunta primero |
| Editor | Diffs quirúrgicos precisos en lugar de reescribir archivos enteros — sin deriva de formato |
| Code reviewer | Revisa cada cambio, señala ediciones arriesgadas antes de enviar |
| Browser-use | Maneja una instancia real de Chromium — hace clic, rellena formularios, captura pantallas, lee lo que ve |
| Researcher | Trae docs y contexto externo |
| Terminal runner | Ejecuta comandos shell, lee la salida |
| Deep thinker | Opcional; llama a modelos premium (ej. GPT-5.4) para el razonamiento más difícil |
| Follow-up suggester | Suelta tres siguientes acciones clicables tras cada respuesta |
Los cerebros de codificación principales se cambian en medio de sesión: DeepSeek V4 Pro para trabajo multi-archivo complejo, Kimi K2.6 para análisis de contexto masivo, Miniax M2.7 para UI/creativo, DeepSeek V4 Flash para ediciones rápidas y baratas. Esa flexibilidad no la ofrece Claude Code en sus planes por defecto.
La imagen honesta de los benchmarks
Pruebas independientes de DeepSeek V4 Flash en 8 harnesses con 30 workflows multi-SaaS (Airtable, Gmail, Sheets, GitHub, Slack, PostHog — 240 ejecuciones, 53.8% de pass rate general):
| Harness | Pass rate | Tiempo mediano | Coste por éxito |
|---|---|---|---|
| Pi Agent | 66.7% | 132.2s | $0.028 |
| Prime Agent | 62.5% | 242.1s | $0.131 |
| OMP | 56.7% | 272.4s | $0.103 |
| Claude Code | 53.3% | 122.7s (más rápido) | $0.195 (solo 1.5% cache hits) |
| Codex | 53.3% | 245.0s | $0.081 (~70% cache hits) |
| DeepAgents | 53.3% | 187.1s | $0.045 |
| Hermes Agent | 50.0% | 175.5s | $0.056+ |
| OpenCode | 46.7% | 129.7s | $0.073 |
La columna de coste es la historia: Claude Code usó casi todos sus tokens de input como frescos (1.5% cache hit) vs ~70% de Codex — y el input fresco cuesta ~5x el cacheado. La optimización nativa de dsh para el context caching de DeepSeek vive exactamente en ese delta.
Por qué DeepSeek construyó esto: estrategia
- Poseer la capa de agente. Los proveedores de modelos dejaban las herramientas a terceros históricamente. Pero la lealtad del desarrollador ahora vive en la capa de workflow — y cada laboratorio de frontera quiere controlar el runtime que quema sus tokens.
- Maximizar el delta de 50x del caching. La API de DeepSeek cobra el input cacheado a ~$0.02/M vs $1/M fresco — una diferencia de 50x. Un harness que antepone secciones de prompt estables (reglas de sistema, definiciones de herramientas) captura cache hits que los clientes genéricos de terceros destruyen rutinariamente.
- Adaptación de API personalizada. El
automatic-prefix-cachede DeepSeek difiere delmoonshot-context-cachede Kimi; cada proveedor tiene sus códigos de error, semántica de retries y formatos de streaming. Un harness nativo implementa los comportamientos exactos que su propia API necesita — incluyendo limpieza de schemas MCP (aplanar$refyanyOfpara que los modelos generen parámetros válidos).
También forma parte de una ola: Alibaba Qoder, Moonshot Kimi Code, Zhipu Zcode — laboratorios chinos publicando harnesses nativos mientras los modelos fundacionales se commoditizan y la pelea se mueve a la capa de workflow.
Las advertencias honestas
- Developer preview. v0.1 con advertencia explícita: “HABRÁ CAMBIOS QUE ROMPEN COMPATIBILIDAD.” Un beta público estaba previsto para el 13 de agosto de 2026, coincidiendo con el GA de DeepSeek-V4-Pro. Espera actualizar plugins regularmente.
- Ecosistema de plugins joven. Cordis es potente pero el catálogo de plugins comunitarios es pequeño junto a VS Code o frameworks de agentes maduros.
- Overhead multi-agente. Nueve sub-agentes = más piezas móviles, más latencia, más puntos de fallo sutil que un loop de modelo único.
- Historial de seguridad del modelo. La evaluación de Cisco sobre DeepSeek R1 encontró un 100% de éxito de ataque en jailbreaks de HarmBench — el entrenamiento de bajo coste parece haber comprometido los guardrails. Usa límites de herramientas estrictos (que la arquitectura de plugins de dsh habilita) y guardrails de terceros para algo sensible.
Conclusión
DeepSeek Harness es la expresión open source más clara del paradigma Modelo + Harness = Agente. La arquitectura de “todo es un plugin” es genuinamente diferente — no un wrapper sobre un loop, sino un runtime componible donde el adaptador de modelo, las herramientas, el sandbox y la propia UI son piezas intercambiables.
Es un preview, no una plataforma de producción — la advertencia de breaking changes es real, y el ecosistema necesita tiempo. Pero para desarrolladores que quieren entender hacia dónde va la ingeniería de agentes, o que quieren un harness MIT optimizado nativamente para la API de frontera más barata del mercado, dsh es la referencia a estudiar. Todo es un plugin — y ese es el futuro de la arquitectura de agentes.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!