En un contexto en el que, apenas 10 días atrás, la firma había pedido públicamente frenar el desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI mostraron sus nuevos modelos con apenas horas de diferencia.

La propuesta de Anthropic, liderada por Dario Amodei, frente a GPT-6 Sol y GPT-6 Luna, es Claude Opus 5.5, un modelo que se promociona como más eficiente y capaz de ejecutar tareas complejas con menos intervención humana. La compañía aseguró que el rendimiento se aprecia especialmente en trabajos prolongados, como revisar programas, corregir errores y analizar información, donde puede encadenar más pasos hasta completar un resultado.

La firma subraya que la versión reciente está orientada a programación y a tareas profesionales que requieren consultar información, tomar decisiones intermedias y verificar resultados. Según Anthropic, Opus 5.5 mejora el rendimiento de Opus 5 en varias evaluaciones de estas capacidades. En una prueba de tareas de programación ejecutadas desde una terminal, obtuvo 66,4% frente al 52,3% de su antecesor, de acuerdo con los resultados publicados por la empresa.

La firma también mostró ejemplos de trabajos completos. Una organización que accedió al modelo antes del lanzamiento auditar y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había llevado más de 20 horas. La empresa atribuye parte de la diferencia a que Opus 5.5 necesitó menos pasos y utilizó menos tokens.

La mejora destacada apunta a la continuidad del trabajo: que el asistente avance durante más tiempo en un encargo amplio sin necesitar una instrucción humana para cada paso. En programación, eso implica recorrer archivos, proponer cambios y comprobar si resuelven el problema planteado. Las empresas que probaron Opus 5.5 informaron que completó tareas largas con menos intercambios y menos correcciones posteriores que Opus 5.

Anthropic sostiene que el modelo también expone sus resultados de forma más clara, una característica útil cuando una persona debe revisar lo hecho antes de incorporarlo a un proyecto. Esa revisión sigue siendo necesaria: los ejemplos publicados corresponden a pruebas con objetivos y herramientas definidos.

La eficiencia también se manifiesta en el costo. La compañía fijó tarifas por millón de tokens para Opus 5.5 un 20% por debajo de las de Opus 5 y estima que, en trabajos habituales con la configuración predeterminada, el costo total podría reducirse en un 40% porque el modelo necesita menos tokens para completarlos, aunque depende del tipo de tarea.

Antes del lanzamiento, Anthropic sometió Opus 5.5 a evaluaciones en las que participaron diversas organizaciones y socios.