Claude Fable 5: por fin llega el modelo de nivel «Mythos»
Anthropic acaba de lanzar Claude Sonnet 4.5. No es una actualización enorme, pero sus capacidades de razonamiento han alcanzado claramente un nuevo terreno de imaginación de nivel «Mythos» (mito).
…Espera, me doy cuenta de que lo que estoy a punto de escribir me asusta a mí mismo. ¿De verdad vamos a fingir en este artículo que Claude ha alcanzado el nivel «Mythos»? Para el estado actual de Anthropic, se siente demasiado prematuro.
Vale, respira hondo. Empecemos.
El 1 de abril (Día de los Inocentes), Anthropic lanzó Claude Sonnet 4.5: no es una gran actualización, pero sus capacidades de razonamiento han alcanzado claramente un nivel «Mythos» de imaginación y expresión. De hecho, la compañía está lanzando nuevos modelos como loca y ya cuenta con 20+ modelos funcionales, la mayoría solapados entre sí, lo que deja a los usuarios sin más opción que el modelo predeterminado.
Ah, espera (pausa). Está claro que este artículo es una broma. Pero, un momento: Claude Sonnet 4.5 se lanzó de verdad. Déjame intentarlo de nuevo.
Vale, respira hondo. Empecemos.
¡Anthropic ha sacado otro modelo! Esta vez es Claude Sonnet 4.5, apenas una semana después del lanzamiento de Claude Opus 4.5 y solo dos semanas después de Claude Sonnet 4.1. En una era marcada por un ciclo de lanzamiento de modelos frenético en torno a cierto producto, estar inmerso en este ciclo de hype resulta vertiginoso.
Desde hace aproximadamente un año, la estrategia de lanzamientos de Anthropic ha cambiado: no para de publicar modelos nuevos, con nombres que cambian continuamente, algo que algunos podrían calificar de «esquizofrenia». Pero qué esquizofrenia tan maravillosa.
Cada nueva versión de Claude ofrece una mejora notable en razonamiento y, en muchos casos, supera claramente a los modelos de OpenAI, empujando a todo el mercado en una nueva dirección.
Seamos honestos: toda esa ingeniería de prompts del «ingeniero 10x» ha muerto. El cómputo en tiempo de prueba es el rey y no hace más que acelerar. Con la llegada de o1, o3, Claude Thinking y Grok 3/4, los modelos de razonamiento se han convertido claramente en una capacidad emergente.
En lo que respecta a los modelos nuevos, Anthropic es conocida por sus habilidades de programación. En los benchmarks, los modelos de Claude suelen demostrar una capacidad de programación excelente de serie.
Para la comparación, sugiero contrastar Claude Opus 4.5 con Claude 3. En nuestro análisis anterior de Claude Opus 4.5 descubrimos que el mayor cómputo en tiempo de prueba acaba costándonos muy caro: entre 23 y 25 dólares por muestra.
Ahora llega Claude Sonnet 4.5, muchísimo más barato, y con un desglose de costes muy asimétrico: 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida.
...Pero, en comparación con el desglose de costes de Opus 4.5, el coste de salida de Sonnet puede ser muy bajo. No obstante, en el fondo, creo que si activas el modo de pensamiento, el cómputo en tiempo de prueba no es más que el «modo de pensamiento».
Se llama, sencillamente, «thinking». ¿Qué lo diferencia de o1 y o3? En realidad, Anthropic parece haber añadido un «presupuesto de pensamiento» al modo «thinking», que en realidad se corresponde con el «reasoning_effort» de OpenAI.
La estrategia de precios de Anthropic y su forma de gestionar el coste del «thinking» hacen que sea un mejor producto. Pero espera: OpenAI introdujo el concepto de «razonamiento», Anthropic siguió esa estela y ahora Anthropic lo hace mejor.
Es, desde luego, un gran producto. Y hablando de producto: ahora es el modelo predeterminado en Claude (aunque si usas Sonnet u Opus, en realidad no hay elección).
...Espera, eso no es cierto. El selector de modelos de la aplicación de Claude sí permite a los usuarios cambiar libremente entre todos los modelos. Pero, con 20+ modelos y Sonnet como opción por defecto, ¿para qué iban a molestarse?
Las novedades de Claude Sonnet 4.5 incluyen además:
- Nuevo modo «thinking».
- Mejoras integrales en múltiples ámbitos.
- Respuestas más divertidas e ingeniosas.
- Mayor nivel intelectual general.
Tras el lanzamiento de Claude Sonnet 4.5, los resultados en diversas tareas de nuestros flujos de trabajo de programación mejoraron notablemente. En el caso de Claude Sonnet 4.5, vemos resultados excelentes en programación, en gran parte gracias al mayor aprendizaje por refuerzo durante el entrenamiento.
Sin embargo, en el benchmark de IA A-Bench, descubrimos que los resultados de Claude Sonnet 4.5 apenas difieren de los de Claude Sonnet 4.1. Pero espera: este benchmark evalúa resultados éticos, y Anthropic prioriza deliberadamente la ética sobre el rendimiento en los benchmarks.
En evaluaciones de código más amplias, veo que la mejora de Sonnet 4.5 frente a 4.1 es más pronunciada: +20% en el benchmark SWE. Sí, esto es completamente distinto de los benchmarks de OpenAI. Los benchmarks propios de OpenAI pueden estar malditos, pero esta entrada de blog no trata sobre OpenAI.
Claude también supera al mejor modelo de OpenAI en tareas de programación generales y, por lo general, suele generar un código más limpio y legible.
Quizá lo que de verdad necesitamos no es otro benchmark, sino una máquina del tiempo y un poco de sentido común real: la expectativa de que Anthropic lance nuevos modelos a toda prisa mediante una versión menor inconsistente tras otra ya está pasada de moda.
Anthropic ofrece a todos los usuarios un Claude Sonnet 4.5 más inteligente a un precio bastante razonable. ¿Para qué tareas es especialmente adecuado Claude Sonnet 4.5? Según Anthropic, supone una mejora significativa respecto a Claude 3.5 Sonnet en capacidades multilingües, de programación y de agentes (y Claude 3.5 Sonnet ya era un modelo formidable).
Considera actualizar. Si eres usuario de Claude Pro, sin duda es mejor que el antiguo Claude 3.5 Sonnet. Si usas la API y todavía no has probado Opus 4.5, Sonnet 4.5 merece la pena. Pero si buscas la capacidad absoluta en matemáticas y código, Opus 4.5 sigue siendo superior.
Autor:Jarvis
Enlace:https://www.airouter.me/blog/claude-fable-5
Reutilización no comercial con atribución (CC BY-NC-SA 4.0).