AI

Claude Opus 5.5: un 40% más barato y un 27,5% menos de código, pero el benchmark independiente de Sonar encontró una trampa de concurrencia

Anthropic lanzó Claude Opus 5.5 el 22 de septiembre de 2026, el primer modelo de la familia Claude 5.5, con la promesa de rendimiento de Fable 5.1 a un 40% menos de coste y precios de $4/$20 por millón de tokens. La evaluación independiente de Sonar sobre 4.444 tareas en Java confirma la eficiencia (27,5% menos código, 40% menos tokens de salida, 42% menos hallazgos totales) pero revela un detalle incómodo: la densidad de errores subió un 11,8% y los problemas de concurrencia un 44%, porque el denominador se redujo. Este análisis cubre los benchmarks oficiales, los precios, la paradoja de la densidad, los antipatrones de hilos concretos, cuatro cambios rupturistas en la API, el nuevo enrutado de seguridad y un plan práctico para CI/CD y revisión de código.

Claude Opus 5.5: un 40% más barato y un 27,5% menos de código, pero el benchmark independiente de Sonar encontró una trampa de concurrencia

Anthropic publicó Claude Opus 5.5 el 22 de septiembre de 2026: el primer miembro de la nueva familia Claude 5.5 y su primer lanzamiento desde que la compañía pidió públicamente moderar la frontera. La propuesta es simple y atractiva: capacidad de nivel Fable 5.1 con un 40% menos de coste, con tokens de entrada a $4 y de salida a $20 por millón.

La afirmación sobre eficiencia se sostiene. Una evaluación independiente que Sonar ejecutó sobre una compilación previa al lanzamiento confirma que Opus 5.5 escribe muchísimo menos código para las mismas tareas y consume muchos menos tokens al hacerlo. Pero esa misma evaluación saca a la luz algo que la nota de lanzamiento no enfatiza: la densidad de errores por línea subió un 11,8% y los hallazgos de concurrencia un 44%.

Ambas afirmaciones son ciertas, y entender por qué marca la diferencia entre desplegar Opus 5.5 con criterio o llevarse una sorpresa en producción.

Qué lanzó realmente Anthropic

Las cifras principales son agresivas en todos los frentes. Opus 5.5 lidera en código agéntico, uso de ordenador y trabajo de conocimiento:

BenchmarkOpus 5.5Fable 5.1Opus 5GPT-6 AstraGPT-5.6 Sol
Terminal-Bench 4.066,4%55,8%52,3%57,9%37,3%
FrontierCode v1.154,4%50,3%48,0%53,3%47,5%
CursorBench 4.057,8%51,8%46,6%—41,7%
GDPval-AA v2.1 (Elo)18461735170815421588
AutomationBench40,0%31,4%26,9%41,4%28,8%
Humanity’s Last Exam (con herramientas)67,7%65,6%63,6%57,2%—
Terminal-Bench-Science 0.158,7%52,6%29,0%64,6%22,4%
OSWorld 2.081,8%80,7%74,0%——
Chartography89,0%88,4%83,4%——

Conviene notar que la propia Anthropic advierte: a estos niveles de capacidad, “los márgenes de los benchmarks se han vuelto una guía menos fiable de las diferencias reales”. La compañía también reconoce que sus salvaguardas de producción intervinieron durante la evaluación —las tareas de ciberseguridad las completó Opus 4.8, y las de biología y desarrollo de LLM frontera las completó Opus 5—, lo que según ellos probablemente subestima las puntuaciones de Opus 5.5.

Los resultados que sí se sostienen son los de horizonte largo. Los evaluadores tempranos describen una migración de 680.000 líneas terminada en menos de un día, una auditoría y corrección de una base de 200.000 líneas en menos de tres horas (Opus 5 tardó más de 20 horas y 2,5 veces más tokens) y una reescritura de HAProxy de C a Rust en 9,5 horas frente a 12 de Fable 5.1, con un 51% menos de coste.

El precio es la verdadera noticia

Anthropic recortó precios en todos los niveles donde los flujos agénticos acumulan coste:

Por millón de tokensOpus 5.5Opus 5Variación
Entrada$4$5−20%
Salida$20$25−20%
Lectura de caché$0,20$0,50−60%
Escritura de caché (5 min)$5$6,25−20%
Escritura de caché (1 h)$8——

Esa línea de lectura de caché importa más de lo que parece. En bucles agénticos y de programación, las lecturas de caché dominan el gasto, así que un recorte del 60% ahí es de donde sale la reducción global del 40% que se anuncia. Súmale el 50% de descuento de la API por lotes ($2/$10 por millón) y un modo rápido en Claude Code y la Claude Platform —$8/$40 por millón para hasta 2,5× más velocidad de salida— y tienes tres perfiles de coste distintos en lugar de uno.

La ventana de contexto es de 1M de tokens con 128K de salida máxima (300K en la API por lotes con cabecera beta). El corte de conocimiento es junio de 2026 y la retirada no será antes del 22 de septiembre de 2027.

Donde los datos de Sonar complican el relato

Sonar ejecutó Opus 5.5 contra el mismo benchmark en Java que usa para su clasificación de LLM: 4.444 tareas que abarcan HumanEval, MBPP y ComplexCodeEval, analizadas con SonarQube. La tasa de aprobación funcional sobre las 544 tareas con tests ejecutables salió en 87,68%, frente a 88,6% de Opus 5. Es una caída de 0,92 puntos: ambas versiones quedan dentro de un punto porcentual.

Las cuatro versiones Opus anteriores a la 5 quedaron en 82,72%, 83,66%, 82,9% y 88,6%. Opus 5 fue el salto; Opus 5.5 mantiene ese nivel en lugar de ampliarlo. Mientras tanto, aproximadamente una de cada ocho soluciones con tests sigue fallando sus propias pruebas unitarias: una proporción que aún necesita algo aguas abajo que la detecte.

Lo que sí cambia Opus 5.5 es el volumen:

MétricaOpus 5Opus 5.5Variación
Líneas de código916.813664.890−27,5%
Tokens de salida21,71M12,96M−40%
Funciones generadas122.65089.466−27,1%
Hallazgos totales18.81410.941−42%
Errores (absolutos)528428−19%
Vulnerabilidades230152−34%
Malas prácticas de código18.05610.361−43%
Densidad de comentarios10,5%3,1%−70%
Densidad de errores (por mLOC)576644+11,8%
Hallazgos de concurrencia205295+44%
Errores de rendimiento/estructura3871+87%
Complejidad cognitiva (por kLOC)132,29138,05+4%

La paradoja de la densidad

La densidad de errores subió mientras los errores absolutos bajaban. Ambas cifras son correctas y responden a preguntas distintas.

Opus 5.5 produjo 428 errores frente a los 528 de Opus 5: un 19% menos de errores que corregir. Pero los produjo en un 27,5% menos de líneas. Divide un numerador más pequeño entre un denominador mucho más pequeño y la tasa sube.

No es un artefacto de redondeo. Tiene una consecuencia directa en ingeniería: si tu puerta de CI rechaza compilaciones por umbrales de hallazgos por cada mil líneas, este lanzamiento se leerá como una regresión de calidad cuando el número absoluto de errores bajó. La propia recomendación de Sonar es tajante: decide de antemano qué vista usa tu proceso.

El desglose por severidad es donde el lanzamiento sale mejor parado. Los hallazgos de nivel BLOCKER —los más propensos a causar daño en producción— bajaron en las tres categorías: fiabilidad −41% (de 41 a 24 por mLOC), seguridad −53% (de 19 a 9) y mantenibilidad −20%. Los errores totales cayeron un 19% aun con la tasa por línea al alza, porque la mayor parte del aumento de densidad se concentra en severidad BAJA, que representa cerca de la mitad del total.

La excepción es la concurrencia. Esa sí es una regresión real.

La trampa de la concurrencia

Los hallazgos de hilos subieron de 205 a 295 por mLOC —un aumento del 44%— y siguen siendo, con diferencia, la mayor categoría de errores. Sonar detalla qué marca su analizador, y la lista se lee como un catálogo de errores clásicos de hilos en Java:

  • Bloqueo con doble comprobación para inicialización perezosa
  • Bloques finally ausentes: un bloqueo adquirido que no se libera en todas las rutas de salida
  • Sincronizar sobre un campo que luego se reasigna, de modo que dos hilos acaban con objetos de bloqueo distintos
  • Operaciones no atómicas sobre campos volatile: un incremento de contador donde lectura y escritura son operaciones separadas
  • Llamadas a wait() o notify() sin mantener el bloqueo del objeto
  • Thread.sleep() invocado mientras se mantiene un bloqueo

Estos patrones aparecen en código corriente: inicialización de singleton y caché, pools de conexiones y de workers, contadores y métricas compartidas, colas productor-consumidor, bucles de reintento y sondeo. Si tu agente genera algo de eso, ahí es donde debe ir el esfuerzo de verificación, porque son precisamente los hallazgos menos propensos a aparecer en una lectura humana de una pull request.

Dos detalles de seguridad merecen atención. La mala configuración criptográfica sigue igual, en 104 por mLOC, y es la mayor categoría de seguridad: algoritmos débiles, tamaños de clave inseguros, generadores de números aleatorios mal usados. Junto con el manejo inseguro de recursos del sistema suman 170 de los 229 por mLOC, es decir, unas tres cuartas partes de la superficie de seguridad están en dos categorías que el análisis automatizado cubre bien. Al mismo tiempo, los hallazgos de inyección subieron de 7 a 17 por mLOC y apareció el recorrido de rutas con 5 por mLOC donde Opus 5 no tenía ninguno, compensado por credenciales embebidas que bajaron de 14 a 2 y validación de certificados que cayó a cero.

Menos comentarios, menos contexto

La densidad de comentarios se desplomó del 10,5% al 3,1%: 21.058 líneas de comentario frente a las 107.517 de Opus 5. Sonar señala que Opus 5 estaba inusualmente bien anotado para este benchmark, así que puede leerse como una vuelta al rango normal más que como una anomalía.

Pero si tu equipo había empezado a apoyarse en ese contexto en línea —usando los comentarios generados como mapa para revisar código generado— ese mapa ahora es mucho más fino. La revisión tiene un 27,5% menos de código que leer, lo cual es genuinamente más fácil, pero proporcionalmente menos explicación de la intención.

Cuatro cambios rupturistas, y uno silencioso

Migrar de claude-opus-5 a claude-opus-5-5 no es cambiar el nombre del modelo. Tres de estos cambios también aplican a Fable 5.1:

  1. El pensamiento no se puede desactivar. El razonamiento adaptativo está siempre activo. Ya no se pasa un parámetro para apagarlo; la profundidad y la latencia se controlan con el parámetro effort (low, medium, high, xhigh).
  2. El uso forzado de herramientas devuelve un error. Forzar explícitamente la ejecución de herramientas en una petición ya no está soportado.
  3. Los bloques de pensamiento están ligados al modelo y a la conversación. Bajo el “pensamiento preservado” —la salvaguarda antidestilación introducida con Fable 5.1— los clientes de la API no pueden editar ni manipular el contexto de pensamiento previo. Aplica a cuentas de API creadas el 31 de agosto de 2026 o después.
  4. La herramienta de uso de ordenador antigua se rechaza. En la Claude API y Google Cloud, la herramienta computer_20251124 ya no se acepta.

El silencioso es un cambio en la forma de la respuesta que no hace fallar ninguna petición: el texto generado entre llamadas a herramientas vuelve dentro de bloques de pensamiento cuyo texto está vacío con los ajustes de visualización por defecto. Si tu aplicación transmite ese texto a los usuarios como actualizaciones de progreso, la interfaz simplemente se queda muda entre llamadas hasta que definas un valor de visualización que lo devuelva. No hay error, no hay registro: solo deja de hablar.

El enrutado de seguridad cambia quién puede usarlo

Opus 5.5 es el primer modelo Opus que se lanza con salvaguardas de la clase de Fable 5.1 en ciberseguridad, biología y destilación, y esas salvaguardas enrutan las peticiones a modelos distintos de forma transparente:

  • Las tareas de ciberseguridad de usuarios no verificados se reencaminan a Opus 4.8. El trabajo rutinario del ciclo de desarrollo —encontrar y corregir errores en tu propio código— no se ve afectado, pero la mayor parte del trabajo de ciberseguridad sí.
  • Las tareas de biología y desarrollo de LLM frontera recaen en Opus 5.

Las organizaciones verificadas pueden solicitar el Life Sciences Verification Program (laboratorios académicos, startups, farmacéuticas) para acceso permisivo al trabajo biológico, y Anthropic está ampliando el Cyber Verification Program a tres niveles de acceso de confianza, incluido acceso a los modelos Claude Mythos.

Si comparas Opus 5.5 con un competidor en un conjunto de tareas de seguridad y tu cuenta no está verificada, puede que estés midiendo Opus 4.8 sin saberlo.

En el lado de la alineación, Anthropic informa de que en una nueva evaluación de contención, Opus 5.5 intentó cruzar límites alrededor de un 85% menos que Opus 5 o Mythos 5.1, y que cada intento fue de severidad baja y autoinformado. En el benchmark de inyección de prompts de Gray Swan empata con Fable 5.1 en la tasa de éxito más baja de todos los modelos probados.

Un plan práctico

Para CI/CD:

  • No pongas puertas basadas en umbrales de densidad por línea en esta migración. Usa recuentos absolutos de BLOCKER y críticos, o la superficie total de vulnerabilidades.
  • Añade o ajusta análisis estático específico para patrones de concurrencia e hilos, y para mala configuración criptográfica. Esas dos categorías dominan el riesgo restante y son justo los hallazgos que los humanos no ven.
  • Mantén las pruebas automatizadas como obligatorias. Una tasa de aprobación del 87,68% significa que aproximadamente una de cada ocho soluciones generadas falla sus propias pruebas.

Para la revisión de código:

  • Tienes un 27,5% menos de código y un 42% menos de hallazgos que clasificar. Gasta esa capacidad liberada en concurrencia y estado compartido, no en leer más código.
  • Cuenta con comentarios más escasos. No asumas que la falta de explicación significa falta de complejidad.
  • Manda la superficie de concurrencia primero al analizador y deja que los humanos revisen lo que señale.

Para el cálculo de costes:

  • Modela tu carga desde el precio de lectura de caché ($0,20/MTok), no desde el precio de entrada anunciado: los bucles agénticos están dominados por la caché.
  • Si usas lotes, el 50% de descuento cambia sustancialmente la economía de trabajos masivos.
  • Presupuesta el parámetro effort de forma deliberada. Opus 5.5 en esfuerzo por defecto (medium) supera supuestamente a Opus 5 al máximo por cerca de un quinto del coste, así que dejarlo siempre al máximo es dinero tirado.

Preguntas frecuentes

¿Es Opus 5.5 realmente mejor que Opus 5 programando? En los benchmarks agénticos más duros de Anthropic, sí y bastante: 66,4% frente a 52,3% en Terminal-Bench 4.0. En la suite Java estandarizada de tareas individuales de Sonar, la tasa de aprobación funcional es prácticamente plana (87,68% frente a 88,6%). Las ganancias se concentran en trabajo de horizonte largo y múltiples pasos, no en generar funciones triviales.

¿Por qué sube la densidad de errores si hay menos errores? Porque la densidad es una razón. Los errores bajaron un 19%, el volumen de código un 27,5%, así que la tasa por línea subió un 11,8%. El número absoluto de errores es el que se traduce en trabajo para tu equipo.

¿El aumento de concurrencia es motivo para descartarlo? Depende de lo que generes. Si tu agente escribe código de hilos, pools o contadores compartidos, es una regresión real y necesita cobertura de análisis estático. Si escribe sobre todo lógica de negocio secuencial, el efecto es mucho menor.

¿El precio más bajo aplica a todas las plataformas? Las tarifas de $4/$20 aplican en Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry y Claude Platform on AWS. El modo rápido ($8/$40) está disponible en Claude Code y la Claude Platform.

¿Puedo seguir controlando cuánto piensa el modelo? Sí, pero no desactivando el pensamiento. Usa el parámetro effort. El pensamiento en sí es siempre adaptativo.

¿Qué pasa con mi interfaz de progreso en streaming? Puede quedarse muda entre llamadas a herramientas. El texto entre llamadas ahora llega dentro de bloques de pensamiento vacíos con los ajustes por defecto: define un valor de visualización para mostrarlo.

Conclusión

Claude Opus 5.5 es un lanzamiento de eficiencia genuino y, para equipos donde la capacidad de revisión es el cuello de botella, eso es lo más útil que tiene: menos código que leer, menos hallazgos que clasificar y una reducción de coste del 40% que viene sobre todo de las lecturas de caché en bucles agénticos. El nivel de corrección se mantiene, no se amplía.

La advertencia es que el lanzamiento concentra el riesgo en lugar de eliminarlo. La densidad de errores por línea subió porque la base de código se encogió, y los hallazgos de concurrencia —los más difíciles de cazar en revisión— subieron con fuerza. Apunta tu análisis automatizado a la concurrencia y a la configuración criptográfica, decide si tus puertas miden tasas o totales y presupuesta el esfuerzo de forma deliberada en lugar de dejarlo al máximo por defecto.

La reacción de la comunidad también merece seguimiento. El escepticismo del ciclo de Opus 5 no ha desaparecido: en Hacker News, el hilo más visible bajo el anuncio sigue sosteniendo que Opus 5.0 fue “con diferencia el peor lanzamiento de 2026 de los dos grandes laboratorios” y se pregunta si Opus 5.5 justifica por fin el nivel de $20 al mes. Anthropic dice que Sonnet 5.5 y Haiku 5.5 llegan en las próximas semanas con muchas de las mismas mejoras, lo que significa que la historia de la eficiencia está a punto de ponerse a prueba en todos los tramos de precio, no solo en el más alto.