A apenas diez días de haber pedido públicamente una moratoria para el desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI divulgaron, con pocas horas de diferencia, sus nuevas propuestas: Claude Opus 5.5 y los modelos GPT-6 Sol y GPT-6 Luna, respectivamente. En este marco, la firma de Darío Amodei presenta Opus 5.5 como una IA más eficiente, capaz de encadenar múltiples pasos en tareas complejas con menor necesidad de supervisión humana.

Anthropic destaca que el modelo se desempeña especialmente bien en trabajos extensos, como revisar código, corregir errores y analizar información. En estas actividades, Opus 5.5 puede avanzar con mayor continuidad, evitando dividir el trabajo en numerosas instrucciones y supervisión constante, lo que suele requerir un flujo de trabajo más granular.

La versión está orientada a programación y a tareas profesionales que requieren consultar información, tomar decisiones intermedias y verificar resultados. Según la empresa, Opus 5.5 mejora el rendimiento de Opus 5 en varias pruebas de estas capacidades. En una evaluación de tareas de programación ejecutadas desde una terminal, Opus 5.5 obtuvo un 66,4% frente al 52,3% de su predecesor, según los datos publicados por Anthropic.

Entre los ejemplos presentados, una organización que tuvo acceso al modelo antes de su lanzamiento auditó y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había consumido más de veinte horas. La firma atribuye parte de esa diferencia a que Opus 5.5 requiere menos pasos y utiliza menos tokens, lo que contribuye a una mayor eficiencia.

La mejora, subraya la empresa, apunta a la continuidad del trabajo: que el asistente pueda avanzar durante más tiempo en un encargo amplio sin necesidad de una instrucción humana para cada avance. En programación, esto implica recorrer archivos, proponer cambios y verificar si resuelven el problema planteado. Las compañías que probaron Opus 5.5 indicaron haber completado tareas largas con menos intercambios y con un menor número de correcciones posteriores en comparación con Opus 5.

Anthropic también sostiene que el modelo entrega sus resultados de manera más clara, lo que facilita la revisión por parte de una persona antes de incorporar el trabajo a un proyecto. No obstante, la revisión humana continúa siendo necesaria: los ejemplos difundidos corresponden a pruebas con objetivos y herramientas definidos.

En cuanto a costos, la firma indicó que Opus 5.5 tiene tarifas por millón de tokens aproximadamente un 20% inferiores a las de Opus 5, y estiman que, en trabajos habituales con la configuración por defecto, el gasto total podría caer alrededor del 40% gracias a un menor consumo de tokens. Este cálculo es una estimación propia y depende del tipo de tarea.

Antes del lanzamiento, Opus 5.5 fue sometido a evaluaciones por parte de organizaciones externas como parte del proceso de validación de la versión.