A apenas diez días de haber solicitado públicamente una moratoria al desarrollo de herramientas de inteligencia artificial, Anthropic y OpenAI anunciaron, casi a la par, versiones más rápidas y potentes de sus modelos. En la pelea frente a GPT-6 Sol y GPT-6 Luna, la novedad de la firma encabezada por Dario Amodei es Claude Opus 5.5, una IA que se presenta como más eficiente y capaz de ejecutar tareas complejas con menor intervención humana.

Según la empresa, Opus 5.5 luce especialmente en trabajos extensos, como revisar programas, corregir errores y analizar información, al ser capaz de encadenar múltiples pasos para completar un resultado sin necesitar instrucciones humanas en cada tramo. Este enfoque apunta a usuarios que trabajan con asistentes de IA en proyectos que antes requerían dividir la labor en varias instrucciones y supervisión continua.

La versión está centrada en programación y en labores profesionales que implican consultar datos, tomar decisiones intermedias y verificar resultados. Anthropic afirmó que Opus 5.5 mejora el rendimiento respecto de Opus 5 en varias pruebas de estas capacidades. En una evaluación de tareas de programación ejecutadas desde una terminal, el nuevo modelo obtuvo un 66,4%, frente al 52,3% de su antecesor, según los datos publicados por la empresa.

La firma mostró ejemplos de trabajos completos. Una organización que accedió al modelo antes de su lanzamiento auditó y corrigió un programa de 200.000 líneas en menos de tres horas, una tarea que con Opus 5 había llevado más de 20 horas. Parte de la diferencia, explican, se debe a que Opus 5.5 requiere menos pasos y utiliza menos tokens (unidades de procesamiento de texto).

Aducen que la mejora apunta a la continuidad del trabajo: el asistente puede avanzar durante más tiempo en una tarea amplia sin necesitar una instrucción humana para cada paso. En el ámbito de la programación, eso implica recorrer archivos, proponer cambios y verificar si realmente resuelven el problema planteado. Empresas que probaron Opus 5.5 indicaron que completó tareas largas con menos intercambios y menos correcciones posteriores que Opus 5.

Anthropic subrayó también que el modelo expone sus resultados de forma más clara, lo que facilita la revisión previa de cara a incorporarlos a un proyecto. Aun así, sostuvieron, la revisión humana sigue siendo necesaria, ya que los ejemplos publicados corresponden a pruebas con objetivos y herramientas definidas.

La eficiencia se evidencia, además, en costos. La compañía fijó tarifas por millón de tokens que son aproximadamente un 20% menores que las de Opus 5 y estima que, para tareas habituales con la configuración por defecto, el costo total podría caer alrededor del 40%, dado que el modelo requiere menos tokens para completarlas. Remarcan que este ahorro depende del tipo de tarea.

Antes de su lanzamiento, Opus 5.5 fue evaluado en pruebas por organizaciones externas, sin detallar quiénes ni qué resultados arrojaron.