A apenas 10 días de haber pedido públicamente una pausa en el desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI mostraron sus nuevos modelos con pocas horas de diferencia, buscando avanzar en rendimiento frente a competidores como GPT-6 Sol y GPT-6 Luna. El foco de Anthropic está puesto en Claude Opus 5.5, una versión que se presenta como más eficiente y capaz de ejecutar tareas complejas con menor intervención humana.
La firma, dirigida por Darío Amodei, subraya que Opus 5.5 resulta especialmente ventajoso en trabajos extensos, como revisar código, corregir errores y analizar información. En esas labores, el modelo logra encadenar múltiples pasos hasta obtener un resultado final, lo que reduce la necesidad de dar instrucciones para cada etapa del proceso. Esto podría afectar a proyectos que antes requerían dividir la tarea en varias órdenes y controlar cada tramo.
La versión 5.5 está orientada a programación y a tareas profesionales que implican consultar datos, tomar decisiones intermedias y verificar resultados. Según la empresa, Opus 5.5 mejora el rendimiento de Opus 5 en diversas pruebas que evalúan estas capacidades. En una prueba de tareas de programación ejecutadas desde una terminal, Opus 5.5 alcanzó un desempeño del 66,4%, frente al 52,3% de su predecesor, según los datos que publicó Anthropic.
Entre los ejemplos presentados, una organización que accedió al modelo antes de su lanzamiento auditó y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que, con Opus 5, había demandado más de 20 horas. La compañía señala que parte de la diferencia se debe a que Opus 5.5 requería menos pasos y consumía menos tokens (unidades de procesamiento de texto).
La mejora destacada por Anthropic apunta a la continuidad de trabajo: que el asistente pueda avanzar en una tarea extensa durante más tiempo sin necesidad de una instrucción humana para cada paso. En programación, eso implica recorrer archivos, proponer cambios y verificar su efecto. Las empresas que probaron Opus 5.5 indicaron haber completado tareas largas con menos intercambios y con menos rectificaciones posteriores que con Opus 5.
La firma también afirmó que los resultados se presentan de manera más clara, lo cual facilita la revisión previa a su incorporación en proyectos. No obstante, señalaron que la verificación humana sigue siendo necesaria, ya que los ejemplos publicados corresponden a pruebas con objetivos y herramientas bien definidas.
En lo económico, Anthropic comunicó que Opus 5.5 tiene tarifas por millón de tokens aproximadamente un 20% más bajas que Opus 5. Aun así, estiman que, en escenarios habituales con la configuración predeterminada, el costo total podría reducirse hasta un 40% gracias a la menor cantidad de tokens requeridos para completar las tareas, aunque advierten que depende del tipo de tarea.
Antes del lanzamiento, Opus 5.5 pasó por evaluaciones con organizaciones externas, parte de un proceso de validación previo a su puesta a punto comercial.



