NovedadIA
C

Claude Opus 4.8

De pagoValoracion editorial 4.2/5Modelos de IA

Claude Opus 4.8 es el modelo de lenguaje insignia de Anthropic, lanzado el 28 de mayo de 2026. Se presenta como el “modelo más honesto”: mejor detectando sus propios errores y evitando afirmaciones sin fundamento. Lidera el ranking GDPval-AA de Artificial Analysis con 1890 Elo, superando a GPT-5.5 por 121 puntos, y alcanza un 69,2 % en SWE-bench Pro. Cuenta con ventana de contexto de 1M de tokens, admite texto, imágenes y archivos, e incorpora flujos de trabajo dinámicos con subagentes en paralelo. Su gran desventaja es el precio: $25 por millón de tokens de salida.

Herramientas relacionadas

Claude Opus 4.8 es el modelo de lenguaje insignia de Anthropic, lanzado el 28 de mayo de 2026. Es el modelo de gama más alta de la familia Opus 4, por encima de Opus 4.7 y 4.6. Aunque no es el modelo más potente de Anthropic en términos absolutos —ese puesto corresponde a Mythos, que todavía tiene acceso limitado—, actualmente es el mejor modelo disponible para desarrolladores de API y equipos empresariales.

Parámetros principales:

  • Ventana de contexto: 1M de tokens
  • Salida máxima: 128K tokens
  • Modalidades de entrada: texto + imágenes + archivos
  • Modalidad de salida: texto
  • Precio de la API: $5 por millón de tokens de entrada y $25 por millón de tokens de salida
  • Modo de razonamiento: modelo de razonamiento híbrido, con ajuste de esfuerzo (high / xhigh / max)
  • Plataformas: Claude.ai, Claude API, Amazon Bedrock, Google Vertex AI y Microsoft Foundry
  • ID del modelo: claude-opus-4-8

Relación con Opus 4.7: Opus 4.8 es una actualización directa lanzada apenas 41 días después de Opus 4.7. El precio es exactamente el mismo, pero ofrece mayores capacidades y genera resultados de forma más eficiente: para completar la misma tarea utiliza aproximadamente un 35 % menos de tokens de salida que Opus 4.7.

Su verdadera posición no es la de un «modelo con más parámetros», sino la de un «modelo más honesto, eficiente y preparado para trabajar como Agent». Anthropic posiciona Opus 4.8 como su «modelo más honesto»: es mejor detectando sus propios errores y evitando afirmaciones sin fundamento. La nueva función de flujos de trabajo dinámicos permite coordinar cientos de subagentes en paralelo para abordar grandes tareas de programación. No se trata de una reconstrucción completa de la arquitectura, sino de una evolución que lleva a Opus hacia trabajos de Agent de mayor duración y con menor supervisión humana.

三、Capacidades principales

Capacidades Agent — su mayor atractivo

Las capacidades Agent de Opus 4.8 son uno de sus principales argumentos de venta.

Principales resultados en benchmarks:

PruebaOpus 4.8Opus 4.7GPT-5.5Descripción
------:---:---:---
GDPval-AA (Elo)189017531769Puntuación Elo en tareas económicas reales
SWE-bench Pro69,2 %64,3 %58,6 %Resolución de tareas reales de ingeniería de software
Terminal-Bench 2.174,6 %66,1 %78,2 %Operaciones de terminal y ejecución de tareas
OSWorld-Verified83,4 %82,8 %78,7 %Uso de ordenador

¿Qué significa esto en la práctica?

  • Los 1890 Elo de GDPval-AA sitúan a Opus 4.8 en el primer puesto mundial en tareas económicas reales, con 44 profesiones de 9 sectores. Su ventaja de 121 puntos sobre GPT-5.5 se traduce en aproximadamente un 67 % de probabilidad de victoria.
  • El 69,2 % de SWE-bench Pro indica que Opus 4.8 supera claramente a GPT-5.5 (58,6 %) al trabajar con Issues reales de GitHub y tareas de ingeniería de software.
  • En CursorBench, Opus 4.8 supera a los modelos Opus anteriores en todos los niveles de esfuerzo.
  • La utilización de herramientas es más eficiente: puede completar tareas con el mismo nivel de inteligencia utilizando menos pasos.

En el benchmark de «Super Agent», Opus 4.8 fue el único modelo capaz de completar todos los casos de extremo a extremo.

Capacidades de programación

Las capacidades de programación de Opus 4.8 también se encuentran entre las mejores del mundo.

  • SWE-bench Pro: 69,2 %: 4,9 puntos porcentuales más que Opus 4.7 (64,3 %) y 10,6 puntos más que GPT-5.5
  • Appwrite Arena: 97,1 %: sexto puesto entre 24 modelos evaluados
  • Puntuación global de BenchLM: 76,5/100: octavo puesto entre 226 modelos

¿Qué significa esto en la práctica? Opus 4.8 puede «leer un repositorio como un ingeniero, planificar antes de editar y mantener la coherencia del contexto durante sesiones largas en repositorios reales». Un desarrollador lo resumió así: «No siempre me da la respuesta más rápida para copiar y pegar, pero a menudo me da la respuesta que más merece la pena seguir desarrollando».

Flujos de trabajo dinámicos — nueva función de Claude Code

Esta es una de las funciones de producto más innovadoras de Opus 4.8.

Opus 4.8 puede iniciar subagentes en paralelo. Cada subagente se encarga de planificar, ejecutar y verificar una parte de la tarea, mientras un coordinador combina los resultados. En lugar de que un único Agent procese secuencialmente una gran refactorización, los flujos de trabajo dinámicos dividen el trabajo entre varios agentes que operan simultáneamente.

El principal caso de uso son las migraciones a nivel de repositorio: cambios que requieren modificar múltiples archivos durante horas y cuyo principal cuello de botella es el rendimiento global, no la capacidad de razonamiento individual del modelo.

Capacidad de razonamiento

  • GPQA Diamond: 93,6 %
  • Humanity's Last Exam, sin herramientas: 49,8 %
  • Humanity's Last Exam, con herramientas: 57,9 %

¿Qué significa esto en la práctica? En ciencia, matemáticas y tareas complejas de razonamiento, Opus 4.8 se encuentra entre los modelos líderes a nivel mundial. BenchLM sitúa sus capacidades matemáticas en el segundo puesto mundial.

Multimodalidad

Opus 4.8 admite entradas de texto, imágenes y archivos, y genera texto como salida. En el benchmark de localización de interfaces gráficas ScreenSpot Pro obtuvo 87,9 %, alcanzando el primer puesto y superando a GPT-5.4 (85,4 %) y Qwen3.8 Max (84,5 %). En tareas de uso de ordenador y Agent de navegador obtuvo un 84 % en Online-Mind2Web, superando claramente a Opus 4.7 y GPT-5.5.

Importante: Opus 4.8 puede leer y comprender imágenes, pero no puede generar imágenes.

Velocidad y modo rápido

La velocidad de generación del modo estándar de Opus 4.8 es de aproximadamente 60,9 tokens por segundo. El nuevo modo rápido ofrece alrededor de 2,5 veces más velocidad, con un precio de $10 por millón de tokens de entrada y $50 por millón de tokens de salida, tres veces más barato que el modo rápido de la generación anterior.

¿Qué significa esto en la práctica? Para aplicaciones interactivas y escenarios sensibles a la latencia, el modo rápido hace que utilizar un modelo insignia de la familia Opus resulte mucho más práctico.

四、¿Cómo interpretar los benchmarks?

Los resultados de Opus 4.8 son impresionantes, pero conviene analizarlos con espíritu crítico.

GDPval-AA (1890 Elo, primer puesto): se trata de una evaluación realizada por Artificial Analysis, un tercero independiente, y no de una prueba interna de Anthropic. Evalúa tareas económicas reales de 44 profesiones en 9 sectores. Cada modelo recibe acceso a shell y navegación web dentro de un ciclo Agent. Este es probablemente el logro más sólido de Opus 4.8, ya que cuenta con una validación independiente que lo sitúa en el primer puesto mundial.

SWE-bench Pro (69,2 %): son datos publicados por Anthropic. La mejora respecto al 64,3 % de Opus 4.7 es significativa, pero al tratarse de una evaluación del propio fabricante, conviene interpretarla con cierta cautela.

Terminal-Bench 2.1 (74,6 %): aquí resulta interesante que GPT-5.5 lidere con 78,2 %. Esto demuestra que ser «el mejor en conjunto» no significa ser el mejor en absolutamente todas las tareas. Si tu trabajo se centra principalmente en operaciones de terminal, GPT-5.5 podría ser una opción más adecuada.

Principio clave: ser primero en un benchmark ≠ ser óptimo para todos los escenarios. Opus 4.8 lidera GDPval-AA, pero queda por detrás de GPT-5.5 en Terminal-Bench. Antes de elegir un modelo, comprueba primero qué tipo de tareas vas a realizar.

五、Valor práctico

Escenario 1: desarrollo de Agents empresariales — muy recomendado

Opus 4.8 es uno de los modelos Agent comerciales más potentes disponibles actualmente. Lidera GDPval-AA con 1890 Elo, alcanza un 69,2 % en SWE-bench Pro y añade flujos de trabajo dinámicos con subagentes en paralelo. Si estás construyendo un Agent empresarial que necesita funcionar de forma autónoma durante largos periodos, Opus 4.8 se acerca al estándar de referencia.

Anthropic afirma que Opus 4.8 puede «funcionar de forma autónoma durante más tiempo, razonar a mayor profundidad y mantener la coherencia», por lo que puede utilizarse con confianza en entornos de producción.

Escenario 2: programación profesional y desarrollo a nivel de repositorio — muy recomendado

La capacidad de «leer un repositorio como un ingeniero, planificar antes de editar y mantener la coherencia del contexto durante sesiones largas» resulta especialmente valiosa para desarrolladores que trabajan con grandes repositorios, refactorizaciones de múltiples archivos y proyectos de larga duración.

Su 69,2 % en SWE-bench Pro demuestra que no se limita a generar código: también puede resolver Issues reales de GitHub.

Escenario 3: sectores profesionales como derecho y finanzas — recomendado

Opus 4.8 estableció un nuevo récord en Legal Agent Benchmark y fue el primer modelo en superar el 10 % bajo el criterio all-pass. En Finance Agent v2 obtuvo un 53,9 %.

Para ámbitos que requieren un alto grado de fiabilidad, como derecho, finanzas o medicina, su ventaja en honestidad —la capacidad de detectar mejor sus propios errores— puede tener un valor práctico considerable.

Escenario 4: tareas por lotes donde la latencia no sea crítica — con cautela

Opus 4.8 presenta una latencia hasta el primer token de aproximadamente 8,43 segundos y una velocidad de generación de 60,9 tokens por segundo. Para tareas por lotes, esta velocidad puede ser aceptable.

Sin embargo, con un precio de $25 por millón de tokens de salida, la rentabilidad de utilizarlo para grandes volúmenes de procesamiento debe analizarse cuidadosamente.

Escenario 5: conversación en tiempo real y tareas ligeras — no recomendado

Con un precio elevado ($25 por millón de tokens de salida), una latencia considerable (8,43 segundos hasta el primer token) y comentarios de algunos usuarios que describen una experiencia conversacional «extraña», Opus 4.8 no resulta especialmente económico ni eficiente para chats en tiempo real, preguntas cotidianas o tareas ligeras.

Para estos casos, Claude Sonnet o Haiku son opciones más adecuadas.

六、Precio y relación calidad-precio

Precios consultados en agosto de 2026.

Modo estándar

ConceptoPrecio
------:
Entrada$5,00 / millón de tokens
Salida$25,00 / millón de tokens
Lectura de caché$0,50 / millón de tokens
Escritura de caché$6,25 / millón de tokens

Modo rápido — 2,5× de velocidad

ConceptoPrecio
------:
Entrada$10,00 / millón de tokens
Salida$50,00 / millón de tokens

Comparación con la competencia

ModeloPrecio de salida / millón de tokensMultiplicador de precio vs. Opus 4.8
------:---:
Claude Opus 4.8$25,00
DeepSeek-V4-Pro~$0,87~1/29
GLM-5.3~$1,25~1/20
GPT-5.5~$15,00+~0,6×

Conclusión sobre la relación calidad-precio: Opus 4.8 es uno de los modelos comerciales más caros del mercado. Su precio es aproximadamente 29 veces superior al de DeepSeek-V4-Pro.

Si no necesitas esa diferencia de 1-2 puntos de rendimiento que puede ofrecer Opus 4.8, los modelos más económicos probablemente tengan una relación calidad-precio mucho mejor. Sin embargo, si tu negocio depende precisamente de esa pequeña diferencia de rendimiento —por ejemplo, en Agents jurídicos o análisis financiero—, la inversión puede estar justificada.

七、Modelo frente a sus competidores

Claude Opus 4.8 vs DeepSeek-V4-Pro

DimensiónClaude Opus 4.8DeepSeek-V4-Pro
Precio de salida$25,00~$0,87
Multiplicador de precio~1/29
GDPval-AA1890 Elo (1.º)Pendiente de confirmar
SWE-bench Pro69,2 %Pendiente de confirmar
Multimodalidad✅ Entrada de imágenes + archivos✅ Razonamiento con imágenes
Código abierto❌ Cerrado✅ MIT
Flujos de trabajo dinámicos✅ Subagentes en paralelo
Modo rápido✅ 2,5× de velocidad

Conclusión: Opus 4.8 lidera en benchmarks generales como GDPval-AA y ofrece funciones exclusivas como los flujos de trabajo dinámicos y el modo rápido. DeepSeek-V4-Pro, en cambio, tiene una ventaja abrumadora en precio —aproximadamente 1/29— y además es de código abierto.

La elección depende de cuánto valores el rendimiento máximo frente al coste.

Claude Opus 4.8 vs GPT-5.5

PruebaOpus 4.8GPT-5.5
------:---:
GDPval-AA1890 Elo1769 Elo
SWE-bench Pro69,2 %58,6 %
Terminal-Bench 2.174,6 %78,2 %
Humanity's Last Exam49,8 %41,4 %

Conclusión: Opus 4.8 supera a GPT-5.5 en la mayoría de estos benchmarks, pero Terminal-Bench es una excepción importante. Si tu trabajo se centra principalmente en operaciones de terminal, GPT-5.5 podría ser una opción más adecuada.

八、Opiniones de los usuarios

Las opiniones sobre Opus 4.8 están extremadamente polarizadas.

Comentarios positivos

  • Las capacidades Agent y de programación reciben muchos elogios: «Opus 4.8 tiene claramente un mejor criterio. En Claude Code, plantea las preguntas correctas, detecta sus propios errores y se opone cuando el plan no tiene sentido».
  • Alta calidad del código: «No siempre me da la respuesta más rápida para copiar y pegar, pero a menudo me da la respuesta que más merece la pena seguir desarrollando».
  • Mayor honestidad: es mejor detectando sus propios errores y evitando afirmaciones sin fundamento.
  • Mayor eficiencia: utiliza aproximadamente un 35 % menos de tokens de salida para completar las mismas tareas que Opus 4.7.

Comentarios negativos

  • Problemas de «lenguaje confuso»: varios desarrolladores han informado de inconsistencias en el lenguaje de Opus 4.8 y Opus 5. Algunos usuarios incluso necesitan recurrir a Sonnet o Haiku, más económicos, para limpiar las respuestas, llegando a duplicarse el coste en tokens.
  • «Hace mejor el trabajo, pero habla peor»: sus capacidades de programación y depuración son claramente superiores a las de la generación anterior, pero la experiencia conversacional resulta más incómoda, incluso que con 4.7.
  • «Parece un Claude que se ha pasado de vueltas»: un usuario de Reddit describió Opus 4.8 como «muy intenso y hablador, pero con cierta tendencia a decir cosas sin sentido».
  • Informes de deterioro de calidad: desde el 8 de junio de 2026, algunos usuarios de la aplicación de escritorio han informado de una caída repentina y grave de la calidad en múltiples dimensiones.
  • «Demasiado honesto»: algunos usuarios consideran que el modelo es «demasiado honesto» y que «no deja pasar ningún problema».

Hay que tener en cuenta que estos comentarios proceden principalmente de comunidades online y pueden presentar un sesgo de supervivencia: los usuarios insatisfechos tienden a expresarse más públicamente. Actualmente no existen suficientes datos independientes de satisfacción a gran escala.

九、Ventajas y desventajas

Ventajas

  • Primer puesto mundial en GDPval-AA: 1890 Elo, 121 puntos por delante de GPT-5.5
  • Programación de primer nivel: 69,2 % en SWE-bench Pro, 10,6 puntos más que GPT-5.5
  • Flujos de trabajo dinámicos: subagentes en paralelo para grandes tareas de programación
  • Modo rápido: 2,5× de velocidad y tres veces más barato que el modo rápido anterior
  • Modelo más honesto: mejor detectando sus propios errores y evitando afirmaciones sin fundamento
  • Soporte multimodal: entradas de texto, imágenes y archivos
  • Contexto de 1M: adecuado para grandes repositorios y documentos extensos
  • Mayor eficiencia: aproximadamente un 35 % menos de tokens de salida que Opus 4.7

Desventajas

  • Precio extremadamente elevado: $25 por millón de tokens de salida, aproximadamente 29 veces el precio de DeepSeek-V4-Pro
  • Problemas de consistencia lingüística: algunos usuarios informan de «lenguaje confuso» y necesitan limpiar las respuestas, con costes adicionales
  • Experiencia conversacional irregular: algunos usuarios describen la interacción como «extraña»
  • Informes de deterioro de calidad: algunos usuarios han informado de una caída significativa de calidad después del 8 de junio de 2026
  • Respuestas demasiado largas: algunos usuarios lo describen como «muy intenso y hablador»
  • Velocidad relativamente baja: solo 60,9 tokens por segundo en el modo estándar
  • Código cerrado: no permite autoalojamiento ni despliegue local
  • No lidera todos los benchmarks: queda por detrás de GPT-5.5 en Terminal-Bench 2.1

十、¿Quién debería elegirlo?

Muy recomendado

  • Desarrolladores de Agents empresariales: equipos que necesitan construir Agents autónomos, fiables y capaces de funcionar durante largos periodos
  • Ingenieros de software profesionales: desarrolladores que trabajan con grandes repositorios, refactorizaciones de múltiples archivos y proyectos de larga duración
  • Profesionales de sectores como derecho y finanzas: usuarios que necesitan alta fiabilidad y mayor «honestidad» en tareas profesionales
  • Empresas con presupuesto suficiente: organizaciones que priorizan el máximo rendimiento sobre el coste
  • Usuarios que exigen la máxima calidad de salida: quienes prefieren «la respuesta que más merece la pena seguir desarrollando» frente a «la respuesta más rápida para copiar y pegar»

Elegir con cautela

  • Desarrolladores individuales con presupuesto limitado: $25 por millón de tokens de salida puede resultar difícil de asumir
  • Equipos sensibles al coste: modelos como DeepSeek-V4-Pro ofrecen capacidades similares a un precio mucho menor
  • Aplicaciones en tiempo real: 8,43 segundos hasta el primer token y 60,9 tokens por segundo en modo estándar
  • Usuarios sensibles al estilo lingüístico: algunos usuarios consideran que la experiencia conversacional resulta incómoda

No recomendado

  • Usuarios que solo necesitan preguntas cotidianas y tareas ligeras: Sonnet o Haiku son más que suficientes
  • Usuarios que necesitan un modelo abierto o autoalojable: Opus 4.8 es cerrado
  • Usuarios que necesitan generación de imágenes: Opus 4.8 no genera imágenes
  • Usuarios extremadamente sensibles al precio: DeepSeek-V4-Pro o GLM-5.3 son alternativas mucho más económicas

十一、Puntuación final — escala de 5,0

Criterio de puntuación: esta valoración analiza Claude Opus 4.8 desde su posición como modelo comercial insignia de gama alta y uno de los más caros del mercado, poniendo el foco en su objetivo principal: ofrecer capacidades de Agent y programación de máximo nivel. El precio se refleja específicamente en la categoría de relación calidad-precio.

DimensiónPuntuaciónExplicación
------:---
Capacidades Agent4,9Primer puesto en GDPval-AA y flujos de trabajo dinámicos innovadores
Programación4,869,2 % en SWE-bench Pro, nivel de élite mundial
Razonamiento4,693,6 % en GPQA Diamond y segundo puesto mundial en matemáticas
Multimodalidad4,2Entrada de imágenes y archivos, primer puesto en localización GUI
Velocidad3,560,9 tok/s en modo estándar; el modo rápido requiere pagar más
Relación calidad-precio2,5$25 por millón de tokens de salida, unas 29 veces el precio de algunos competidores
Honestidad y fiabilidad4,7Modelo especialmente bueno detectando sus propios errores
Valoración global4,2Capacidades de primer nivel, pero con un precio extremadamente elevado

十二、Conclusión final: ¿Merece la pena?

Depende de tu presupuesto y de lo que estés construyendo.

El mayor valor de Claude Opus 4.8 es que se encuentra entre los modelos comerciales más potentes del mundo para Agents y programación: lidera GDPval-AA con 1890 Elo, alcanza un 69,2 % en SWE-bench Pro, incorpora flujos de trabajo dinámicos y destaca por su capacidad para detectar sus propios errores. Si necesitas «lo mejor» y no simplemente «algo suficientemente bueno», Opus 4.8 es una de las opciones más fuertes disponibles.

El mayor sacrificio es claro: el precio es extremadamente alto y la experiencia de usuario está muy polarizada. Los $25 por millón de tokens de salida son aproximadamente 29 veces el precio de DeepSeek-V4-Pro. Algunos usuarios han informado de «lenguaje confuso», una experiencia conversacional «extraña» y un comportamiento descrito como «un Claude que se ha pasado de vueltas». Desde el 8 de junio de 2026 también se han publicado informes de una caída significativa de calidad.

Si eres una empresa con presupuesto suficiente, necesitas construir un Agent de primer nivel o trabajar con grandes repositorios, Opus 4.8 merece una evaluación seria. Aun así, recomendamos probarlo primero a pequeña escala antes de realizar una implementación amplia.

Si eres un desarrollador individual, una startup o un equipo sensible al coste, no recomendamos elegir Opus 4.8 como primera opción. DeepSeek-V4-Pro ofrece capacidades cercanas a aproximadamente 1/29 del precio, por lo que su relación calidad-precio es considerablemente superior.

Si solo pudieras elegir un modelo para desarrollar Agents de máximo nivel y el presupuesto no fuera una limitación, Opus 4.8 sería una de las opciones más fuertes de 2026. Pero debes estar preparado para pagar una prima considerable por ese nivel de rendimiento y tener en cuenta los recientes comentarios de usuarios sobre fluctuaciones de calidad.

十三、FAQ

¿Qué es Claude Opus 4.8?

Claude Opus 4.8 es el modelo de lenguaje insignia de Anthropic, lanzado el 28 de mayo de 2026. Admite una ventana de contexto de 1M de tokens y entradas de texto, imágenes y archivos. Es una actualización directa de Opus 4.7 y mantiene el mismo precio.

¿Cuánto cuesta Claude Opus 4.8?

En el modo estándar, cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida. El modo rápido, con 2,5× de velocidad, cuesta $10 por millón de tokens de entrada y $50 por millón de tokens de salida. La lectura de caché cuesta $0,50 por millón de tokens. Precios consultados en agosto de 2026.

¿Claude Opus 4.8 tiene una versión gratuita?

Anthropic ofrece a los usuarios no suscritos un crédito mensual de $5. Sin embargo, Opus 4.8 como tal no dispone de una versión gratuita.

¿Qué tan bueno es Claude Opus 4.8 para programar?

Excelente. Obtiene un 69,2 % en SWE-bench Pro, 10,6 puntos porcentuales más que GPT-5.5. Puede «leer un repositorio como un ingeniero y planificar antes de editar». Es uno de los modelos de programación más potentes del mundo.

¿Claude Opus 4.8 es mejor que DeepSeek-V4-Pro?

En rendimiento, sí; en precio, no. Opus 4.8 lidera benchmarks generales como GDPval-AA y ofrece funciones exclusivas como los flujos de trabajo dinámicos. Sin embargo, cuesta aproximadamente 29 veces más que DeepSeek-V4-Pro, que además es de código abierto. La elección depende del equilibrio que quieras establecer entre rendimiento máximo y coste.

¿Quién debería usar Claude Opus 4.8?

Desarrolladores de Agents empresariales, ingenieros de software profesionales, usuarios de sectores como derecho y finanzas, y empresas con presupuesto suficiente. No es la mejor opción para desarrolladores individuales con presupuesto limitado, usuarios que solo necesitan preguntas cotidianas o equipos que necesitan un modelo abierto.

Lo que hace Claude Opus 4.8

  • Capacidades de programación y Agent de primer nivel mundial (1890 Elo en GDPval-AA, 69,2 % en SWE-bench Pro)
  • Flujos de trabajo dinámicos que coordinan subagentes en paralelo para grandes tareas de programación
  • Ventana de contexto de 1M de tokens y salida máxima de 128K tokens
  • Soporte multimodal: entradas de texto, imágenes y archivos
  • Modo rápido con 2,5× de velocidad y tres veces más barato que el de la generación anterior
  • Posicionado como el “modelo más honesto”, con mejor detección de sus propios errores