A pocos días de haber pedido públicamente una pausa en el desarrollo de herramientas de IA, Anthropic y OpenAI anunciaron nuevas versiones de sus modelos, con apenas horas de diferencia. En el foco quedó Claude Opus 5.5, la propuesta de la firma liderada por Dario Amodei frente a competidores como GPT-6 Sol y GPT-6 Luna. Este nuevo modelo promete eficiencia superior y la capacidad de abordar tareas complejas con menor intervención humana.

Según la compañía, Opus 5.5 se destaca especialmente en trabajos extensos que requieren revisar código, corregir errores y analizar información para avanzar de manera continua. En estas tareas, el sistema puede articular múltiples pasos y continuar el flujo sin necesidad de instrucciones para cada tramo, lo que resulta relevante para usuarios que integran IA en proyectos que antes requerían segmentación y supervisión constante.

La versión enfocada en programación y trabajos profesionales que demandan consulta de información y verificación de resultados afirma una mejora respecto de Opus 5. En pruebas específicas de programación ejecutadas desde una terminal, Opus 5.5 obtuvo un rendimiento del 66,4%, frente al 52,3% de su predecesor, según datos publicados por Anthropic.

Entre los ejemplos presentados por la firma, una organización que accedió al modelo antes de su lanzamiento logró auditar y corregir un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había tomado más de 20 horas. Según la empresa, una parte significativa de esa diferencia se debe a un menor número de etapas necesarias y a una menor utilización de tokens de procesamiento de lenguaje.

La compañía subraya que la mejora se traduce en mayor continuidad del trabajo: el asistente puede avanzar por más tiempo en un encargo amplio sin requerir indicaciones humanas para cada paso. En el marco de la programación, eso implica recorrer archivos, proponer cambios y verificar si resuelven el problema planteado. Quienes ya evaluaron Opus 5.5 indicaron que completó tareas largas con menos intercambios y con menor necesidad de correcciones posteriores.

Anthropic también afirma que el modelo presenta resultados de manera más clara, lo que facilita la revisión antes de incorporar el producto a un proyecto. De todas formas, la revisión humana sigue siendo necesaria: los ejemplos mostrados responden a pruebas con objetivos y herramientas definidas.

En lo económico, la firma informó que Opus 5.5 reduce tarifas por millón de tokens en un 20% respecto de Opus 5 y estima que, usando la configuración predeterminada para tareas habituales, el costo total podría caer hasta un 40% gracias a consumir menos tokens para completar las tareas. Vale aclarar que se trata de una estimación sujeta a el tipo de tarea ejecutada.

Antes del lanzamiento, Opus 5.5 fue sometido a evaluaciones por parte de organizaciones externas, según indicó Anthropic, en busca de validar su desempeño en distintos escenarios.