A sólo 10 días de haber pedido públicamente una pausa en el desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI anunciaron sus novedades, con apenas unas horas de diferencia entre ellas. En el centro de la atención quedó Claude Opus 5.5, el nuevo modelo de la firma encabezada por Dario Amodei, que se presenta como más eficiente y capaz de realizar tareas complejas con menos supervisión humana, en competencia con las versiones GPT-6 Sol y GPT-6 Luna.

Opus 5.5 apunta a tareas de programación y a trabajos profesionales que requieren consultar información, tomar decisiones intermedias y verificar resultados. Según la empresa, el nuevo modelo mejora el rendimiento de Opus 5 en varias evaluaciones de estas capacidades. En una prueba de tareas de programación ejecutadas desde una terminal, obtuvo un 66,4% frente al 52,3% de su predecesor.

Como ejemplo de uso, una organización que accedió al modelo antes de su lanzamiento audItó y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había requerido más de 20 horas. La firma atribuye parte de la diferencia a que Opus 5.5 necesītó menos pasos y utilizó menos tokens.

La mejora que Anthropic destaca es la continuidad de trabajo: el asistente puede avanzar durante más tiempo en un encargo amplio sin requerir una instrucción humana para cada paso. En el terreno de la programación, eso implica recorrer archivos, proponer cambios y comprobar si las soluciones resuelven el problema planteado. Quienes probaron Opus 5.5 informaron que completó tareas largas con menos intercambios y con menos correcciones posteriores que Opus 5.

La compañía también subraya que el modelo presenta sus resultados de forma más clara, lo cual es útil cuando una persona debe revisar lo hecho antes de incorporarlo a un proyecto. Aun así, la revisión sigue siendo necesaria: los ejemplos publicados corresponden a pruebas con objetivos y herramientas definidas.

En términos de eficiencia, la firma indicó tarifas por millón de tokens un 20% menores que las de Opus 5 y estimó que, en tareas habituales con la configuración predeterminada, el costo total podría reducirse hasta un 40% gracias a que el modelo utiliza menos tokens para completar los encargos, aunque el ahorro depende del tipo de tarea.

Antes del lanzamiento, Anthropic sometió Opus 5.5 a evaluaciones en las que participaron organizaciones externas.