A diez días de haber pedido públicamente una pausa en el desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI presentaron sus nuevas propuestas, con pocas horas de diferencia. En el centro de la jugada está Claude Opus 5.5, la versión de la firma liderada por Dario Amodei, que se propone como más eficiente y capaz de ejecutar tareas complejas con menor intervención humana, en competencia con GPT-6 Sol y GPT-6 Luna.

Opus 5.5 se destaca por su desempeño en trabajos extensos, como la revisión de código, la corrección de errores y el análisis de información, donde puede encadenar múltiples pasos sin requerir indicaciones constantes. Este avance es particularmente relevante para equipos que usan asistentes de IA en proyectos que antes exigían dividir las tareas en varias instrucciones y supervisarlas tramo a tramo.

La versión recién anunciada está orientada a la programación y a tareas profesionales que requieren consultar información, tomar decisiones intermedias y verificar resultados. Según Anthropic, Opus 5.5 mejora el rendimiento de Opus 5 en diversas pruebas de estas capacidades. En una evaluación de tareas de programación ejecutadas desde una terminal, el nuevo modelo obtuvo 66,4% frente a 52,3% de su predecesor.

La firma mostró ejemplos de trabajos completos para ilustrar su potencial. Una organización que accedió al modelo antes del lanzamiento auditar y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había requerido más de 20 horas. Parte de la diferencia, aseguran, se debe a que Opus 5.5 necesita menos pasos y utiliza menos tokens de procesamiento.

La mejora, señalan, apunta a la continuidad del trabajo: que el asistente avancen durante un encargo amplio sin necesitar una instrucción humana para cada paso. En programación, esto implica recorrer archivos, proponer cambios y verificar si resuelven el problema planteado. Quienes probaron Opus 5.5 reportaron completar tareas largas con menos intercambios y con menos correcciones posteriores que con Opus 5.

Además, Anthropic afirma que el modelo exhibe sus resultados de manera más clara, lo que facilita la revisión antes de incorporar los resultados a un proyecto. En esas demostraciones, la revisión sigue siendo necesaria, ya que los ejemplos publicados corresponden a pruebas con objetivos y herramientas definidos.

En cuanto a costos, la empresa detalló que Opus 5.5 aplica tarifas por millón de tokens un 20% más bajas que las de Opus 5. En escenarios habituales con la configuración predeterminada, estiman que el costo total podría caer alrededor del 40% gracias a un menor uso de tokens, aunque esto depende del tipo de tarea.

Antes del lanzamiento, Opus 5.5 pasó por evaluaciones con la participación de organizaciones externas. Entre los datos compartidos, la compañía subraya que el modelo está diseñado para posicionarse como una herramienta clave para proyectos que exigen continuidad, precisión y una revisión eficiente de los resultados antes de integrarlos a procesos.