Open Source

DeepSeek Harness: el framework de agentes open source donde todo es un plugin

DeepSeek abrió su agent harness (dsh) bajo MIT — 25.9k estrellas, impulsado por el framework de plugins Cordis, con nueve sub-agentes especializados, soporte MCP, sandboxing y Web UI. 'Modelo + Harness = Agente' es la nueva fórmula de la industria, y DeepSeek acaba de publicar la implementación de referencia. Arquitectura, benchmarks vs Claude Code, significado estratégico y advertencias honestas.

Keeping this site alive takes effort — your support means everything.
無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分! 無程式碼也能輕鬆打造專業LINE官方帳號!一鍵導入模板,讓AI助你行銷加分!
DeepSeek Harness: el framework de agentes open source donde todo es un plugin

Conclusiones clave

  • DeepSeek Harness (dsh) es el framework de agentes open source de DeepSeek AI — 25.9k estrellas, licencia MIT, 12.000+ commits — construido sobre el meta-framework Cordis donde literalmente todo (modelos, herramientas, sesiones, sandboxes, loops, UI) es un plugin que se puede mezclar, emparejar, reemplazar y extender.
  • La fórmula industrial 'Modelo + Harness = Agente' ya es concreta: el modelo razona, el harness maneja todo lo demás — ejecución de herramientas, memoria, control de contexto, sandboxing. dsh trae 9 sub-agentes especializados (file picker, editor, reviewer, browser-use, planner, researcher, terminal runner, deep thinker, follow-up suggester) en lugar de un modelo gigante en un loop.
  • Ejecútalo con un comando: npx @deepseek-ai/dsh web arranca la Web UI en http://127.0.0.1:3080. DeepSeek V4 Pro para razonamiento duro, Kimi K2.6 para contexto grande, Miniax M2.7 para UI, V4 Flash para ediciones baratas — con cambio de modelo en medio de sesión que Claude Code no ofrece.
  • Significado estratégico: poseer la capa de harness maximiza el delta de 50x del prompt caching de DeepSeek (tokens en caché vs frescos), y forma parte de una ola de harnesses de laboratorios chinos — Alibaba Qoder, Moonshot Kimi Code, Zhipu Zcode — mientras los modelos fundacionales se commoditizan y la lealtad se mueve a la capa de workflow.
  • Advertencias honestas: developer preview v0.1 con cambios que rompen compatibilidad explícitos, ecosistema de plugins joven, overhead multi-agente (más piezas móviles, más puntos de fallo), y los modelos de DeepSeek tienen historial documentado de jailbreak (Cisco halló 100% de éxito de ataque en HarmBench para R1) — usa límites de herramientas estrictos y guardrails.

Respuestas clave

¿Qué es DeepSeek Harness?

DeepSeek Harness (dsh) es el agent harness open source de DeepSeek AI — la capa de ingeniería que envuelve LLMs y los convierte en agentes de codificación fiables. Es la realización concreta de 'Modelo + Harness = Agente': el modelo proporciona razonamiento, el harness maneja ejecución de herramientas, memoria, control de contexto, sandboxing y orquestación. Impulsado por el framework de plugins Cordis, cada componente es un plugin. Es MIT, 25.9k estrellas, y corre con npx @deepseek-ai/dsh web.

¿Qué significa 'todo es un plugin' en dsh?

En DeepSeek Harness, los modelos, herramientas, skills, estado de sesión, bases de datos, sandboxes, filesystems, loops de ejecución, capas de orquestación y la UI son TODOS plugins del framework Cordis. No hay núcleo privilegiado que parchear — extiendes dsh montando un plugin junto a los demás, y los registros se deshacen cuando el plugin se descarga. Esto permite endurecer límites de seguridad (un agente de solo lectura simplemente no tiene herramientas de escritura registradas) en lugar de depender de instrucciones a nivel de prompt que se degradan en sesiones largas.

¿Cuáles son los 9 sub-agentes de DeepSeek Harness?

En lugar de un modelo gigante en un loop, dsh orquesta sub-agentes especializados: un file picker (selecciona solo archivos relevantes para evitar dilución de contexto), planner (divide tareas en pasos con un comando de entrevista /in), editor (diffs quirúrgicos precisos en lugar de reescribir archivos enteros), code reviewer (señala ediciones arriesgadas antes de que se envíen), browser-use (maneja una instancia real de Chromium para QA), researcher (trae docs y contexto externo), terminal runner (ejecuta comandos shell), deep thinker (opcional, llama a modelos premium para razonamiento difícil) y un follow-up suggester. Cada uno usa un modelo ajustado a su trabajo.

¿Cómo se compara dsh con Claude Code y otros harnesses?

Pruebas independientes de DeepSeek V4 Flash en 8 harnesses con 30 workflows multi-SaaS mostraron a Claude Code con 53.3% de pass rate ($0.195 por éxito, solo 1.5% de cache hits), OpenCode 46.7% ($0.073), Codex 53.3% ($0.081, ~70% cache hits) y Hermes Agent 50% ($0.056). Las ventajas de dsh son el cambio multi-modelo (Claude Code te ata a Anthropic), la especialización de sub-agentes que reduce la dilución de contexto en trabajo multi-archivo, y la optimización nativa para la API de context caching barata de DeepSeek.

¿DeepSeek Harness está listo para producción?

Aún no. Está en developer preview v0.1 con una advertencia explícita: 'HABRÁ CAMBIOS QUE ROMPEN COMPATIBILIDAD.' El ecosistema de plugins es joven comparado con plataformas maduras. Un beta público estaba planeado para el 13 de agosto de 2026, coincidiendo con el GA de DeepSeek-V4-Pro. La arquitectura central es sólida y MIT, pero trátalo como preview — espera actualizar plugins y scripts mientras itera.

DeepSeek Harness: el framework de agentes open source donde todo es un plugin

La fórmula está en todas partes ahora: Modelo + Harness = Agente.

El modelo razona. El harness maneja todo lo demás — ejecución de herramientas, memoria, control de contexto, sandboxing, orquestación. Y en agosto de 2026, DeepSeek publicó lo que podría ser la implementación open source de referencia más importante de esa fórmula.

DeepSeek Harness (dsh) es el framework de agentes open source del laboratorio chino: 25.9k estrellas, licencia MIT, 12.000+ commits, y una arquitectura construida sobre una idea radical — todo es un plugin.

“Los modelos, herramientas, skills, sesiones, sandboxes, filesystems, loops, orquestación y UI son TODOS plugins, y pueden mezclarse, emparejarse, reemplazarse y extenderse.”

La arquitectura: Cordis debajo de todo

dsh está impulsado por Cordis, un meta-framework de plugins cuyo diseño se describe en un paper sobre componibilidad espaciotemporal. Qué significa en la práctica:

  • Sin núcleo privilegiado. Cada parte del producto — adaptador de modelo, registro de herramientas, log de sesión, incluso el propio loop de agente — es un plugin. Extiendes dsh montando un plugin junto a los demás, y los registros se deshacen cuando el plugin se descarga.
  • Composición en capas. Un dsh corriendo es un árbol de plugins compuesto desde profiles y bundles (dsh-base provee adaptadores de modelo, herramientas, sandbox, política de aprobación; dsh-web-app añade la UI de navegador; dsh-headless es un runner de un solo disparo). Cada fila del árbol de config puede reemplazarse con un patch propio.
  • Seguridad endurecida. Como las restricciones viven en el registro de herramientas, no en el prompt, un agente de solo lectura simplemente no tiene herramientas de escritura registradas. Un comentarista de HN lo resumió: “Las restricciones a nivel de prompt aguantan hasta que una sesión larga empieza a improvisar, y entonces te enteras.”

Ejecútalo con un comando

npx @deepseek-ai/dsh web

Eso arranca la Web UI en http://127.0.0.1:3080 — un portal local para visualizar sesiones de agente, salidas de herramientas y configuración. (O clona y compila con pnpm.)

Los 9 sub-agentes: por qué multi-agente vence a un loop gigante

La mayoría de los coding agents son un modelo grande en un loop — leer archivos, planear, editar, testear, revisar, todo desde el mismo cerebro. Eso funciona para tareas diminutas y se rompe en cualquier cosa que toque más de un par de archivos.

dsh toma el enfoque opuesto: nueve sub-agentes especializados, cada uno con un trabajo estrecho y un modelo afinado:

Sub-agenteTrabajo
File pickerEscanea el codebase, trae solo archivos relevantes (usa Gemini 3.1 Flash Lite barato para recuperación — menos ruido de contexto = salida más nítida)
PlannerDivide tareas grandes en pasos ordenados; el comando de entrevista /in pregunta primero
EditorDiffs quirúrgicos precisos en lugar de reescribir archivos enteros — sin deriva de formato
Code reviewerRevisa cada cambio, señala ediciones arriesgadas antes de enviar
Browser-useManeja una instancia real de Chromium — hace clic, rellena formularios, captura pantallas, lee lo que ve
ResearcherTrae docs y contexto externo
Terminal runnerEjecuta comandos shell, lee la salida
Deep thinkerOpcional; llama a modelos premium (ej. GPT-5.4) para el razonamiento más difícil
Follow-up suggesterSuelta tres siguientes acciones clicables tras cada respuesta

Los cerebros de codificación principales se cambian en medio de sesión: DeepSeek V4 Pro para trabajo multi-archivo complejo, Kimi K2.6 para análisis de contexto masivo, Miniax M2.7 para UI/creativo, DeepSeek V4 Flash para ediciones rápidas y baratas. Esa flexibilidad no la ofrece Claude Code en sus planes por defecto.

La imagen honesta de los benchmarks

Pruebas independientes de DeepSeek V4 Flash en 8 harnesses con 30 workflows multi-SaaS (Airtable, Gmail, Sheets, GitHub, Slack, PostHog — 240 ejecuciones, 53.8% de pass rate general):

HarnessPass rateTiempo medianoCoste por éxito
Pi Agent66.7%132.2s$0.028
Prime Agent62.5%242.1s$0.131
OMP56.7%272.4s$0.103
Claude Code53.3%122.7s (más rápido)$0.195 (solo 1.5% cache hits)
Codex53.3%245.0s$0.081 (~70% cache hits)
DeepAgents53.3%187.1s$0.045
Hermes Agent50.0%175.5s$0.056+
OpenCode46.7%129.7s$0.073

La columna de coste es la historia: Claude Code usó casi todos sus tokens de input como frescos (1.5% cache hit) vs ~70% de Codex — y el input fresco cuesta ~5x el cacheado. La optimización nativa de dsh para el context caching de DeepSeek vive exactamente en ese delta.

Por qué DeepSeek construyó esto: estrategia

  1. Poseer la capa de agente. Los proveedores de modelos dejaban las herramientas a terceros históricamente. Pero la lealtad del desarrollador ahora vive en la capa de workflow — y cada laboratorio de frontera quiere controlar el runtime que quema sus tokens.
  2. Maximizar el delta de 50x del caching. La API de DeepSeek cobra el input cacheado a ~$0.02/M vs $1/M fresco — una diferencia de 50x. Un harness que antepone secciones de prompt estables (reglas de sistema, definiciones de herramientas) captura cache hits que los clientes genéricos de terceros destruyen rutinariamente.
  3. Adaptación de API personalizada. El automatic-prefix-cache de DeepSeek difiere del moonshot-context-cache de Kimi; cada proveedor tiene sus códigos de error, semántica de retries y formatos de streaming. Un harness nativo implementa los comportamientos exactos que su propia API necesita — incluyendo limpieza de schemas MCP (aplanar $ref y anyOf para que los modelos generen parámetros válidos).

También forma parte de una ola: Alibaba Qoder, Moonshot Kimi Code, Zhipu Zcode — laboratorios chinos publicando harnesses nativos mientras los modelos fundacionales se commoditizan y la pelea se mueve a la capa de workflow.

Las advertencias honestas

  • Developer preview. v0.1 con advertencia explícita: “HABRÁ CAMBIOS QUE ROMPEN COMPATIBILIDAD.” Un beta público estaba previsto para el 13 de agosto de 2026, coincidiendo con el GA de DeepSeek-V4-Pro. Espera actualizar plugins regularmente.
  • Ecosistema de plugins joven. Cordis es potente pero el catálogo de plugins comunitarios es pequeño junto a VS Code o frameworks de agentes maduros.
  • Overhead multi-agente. Nueve sub-agentes = más piezas móviles, más latencia, más puntos de fallo sutil que un loop de modelo único.
  • Historial de seguridad del modelo. La evaluación de Cisco sobre DeepSeek R1 encontró un 100% de éxito de ataque en jailbreaks de HarmBench — el entrenamiento de bajo coste parece haber comprometido los guardrails. Usa límites de herramientas estrictos (que la arquitectura de plugins de dsh habilita) y guardrails de terceros para algo sensible.

Conclusión

DeepSeek Harness es la expresión open source más clara del paradigma Modelo + Harness = Agente. La arquitectura de “todo es un plugin” es genuinamente diferente — no un wrapper sobre un loop, sino un runtime componible donde el adaptador de modelo, las herramientas, el sandbox y la propia UI son piezas intercambiables.

Es un preview, no una plataforma de producción — la advertencia de breaking changes es real, y el ecosistema necesita tiempo. Pero para desarrolladores que quieren entender hacia dónde va la ingeniería de agentes, o que quieren un harness MIT optimizado nativamente para la API de frontera más barata del mercado, dsh es la referencia a estudiar. Todo es un plugin — y ese es el futuro de la arquitectura de agentes.