Anthropic tiene desde hoy un modelo con el que compite contra sí misma. La compañía ha lanzado Claude Opus 5 y, en varias de las pruebas que la compañía ha hecho publicas, el nuevo modelo rinde mejor que Fable 5, el que ocupa el escalón superior de su catálogo y cuesta exactamente el doble.
El nuevo Claude Opus 5 cuesta lo mismo que su antecesor y la mitad que el todopoderoso Fable 5. Es el cuarto lanzamiento de la compañía en menos de dos meses
Anthropic tiene desde hoy un modelo con el que compite contra sí misma. La compañía ha lanzado Claude Opus 5 y, en varias de las pruebas que la compañía ha hecho publicas, el nuevo modelo rinde mejor que Fable 5, el que ocupa el escalón superior de su catálogo y cuesta exactamente el doble.
Su precio, sin embargo, no sube. Opus 5 se cobrará a 5 dólares por millón de tokens de entrada y 25 por millón de salida, las mismas tarifas que su antecesor, Opus 4.8, estrenado hace apenas ocho semanas. Fable 5 sigue en los 10 y 50 dólares por esa misma cantidad de tokens.
La diferencia de rendimiento puede llegar a ser significativa. En Frontier-Bench, una prueba que mide si un modelo completa tareas reales de ingeniería de software de principio a fin, Opus 5 obtiene por ejemplo un 43,3% frente al 18,7% de Opus 4.8 y el 33,7% de Fable 5.
Es además el cuarto modelo que la empresa saca al mercado en menos de dos meses, después de Mythos 5, Fable 5 y Sonnet 5 en junio, y con Opus 4.8 el 28 de mayo. A este ritmo, el único miembro de la familia que aún espera actualización es Haiku, el más ligero y barato.
Opus 5 está disponible desde hoy en todas las plataformas de la compañía. Se convertirá en el modelo por defecto de Claude Max, la suscripción de consumo más cara de la compañía, y en el más potente disponible para los abonados de Claude Pro, la suscripción más barata. El lanzamiento llega justo después de que esta semana Anthropic cortara el acceso por suscripción a Fable 5. Desde el 19 de julio, sólo se puede acceder a este modelo usando créditos adicionales.
La novedad que más va a importar a las empresas no es tanto una cifra de benchmark, sino que Opus 5 permite ajustar cuánto «esfuerzo» dedica a cada tarea, lo que en la práctica significa decidir cuántos tokens se usan a cambio de obtener más precisión. Anthropic sostiene que incluso en su ajuste más bajo el modelo resuelve más tareas de automatización que cualquier rival.
Los números apuntan en esa dirección. En AutomationBench, otra conocida prueba de rendimiento, el porcentaje de aciertos es 1,5 veces el del siguiente mejor modelo para el mismo coste por tarea.
Alguno de los logros que Anthropic ha comunicado son sorprendentes. En una tarea de la prueba Frontier-Bench se entregó al modelo el plano de una pieza mecánica y se le pidió reconstruirla como modelo 3D en FreeCAD, pero se le impidió deliberadamente ver el dibujo. Opus 5 escribió su propio sistema de visión por ordenador para extraer la geometría de los píxeles en bruto y reconstruyó la pieza completa. Según Anthropic, ningún modelo rival consiguió lo mismo en cinco intentos diferentes.
Anthropic ha sido también inusualmente explícita, eso sí, con los límites del modelo. Opus 5, por ejemplo, sigue por detrás de Mythos 5 en ciberseguridad e investigación biológica. Sobre el papel, Opus 5 encuentra fallos casi igual de bien que Mythos 5, pero está muy lejos a la hora de convertirlos en un ataque funcional.
En cualquier caso, al igual que en Fable 5, cuando el modelo detecta una petición relacionada con ciberseguridad que puede ser utilizada para crear un ataque, la petición revierte a Opus 4.8, con un aviso visible en la conversación. Es también un modelo menos apto para proyectos largos que requieran trabajar durante horas o incluso días para obtener una respuesta.
Tecnología – Píxel
