GPT-5.6 Sol
GPT-5.6 Sol es el modelo insignia de OpenAI, lanzado en julio de 2026 y concebido para razonamiento complejo y programación mediante agentes. Destaca por su capacidad de Agentic Coding de primer nivel, su relación calidad-precio y su contexto de 1,05 millones de tokens. Ideal para desarrolladores y empresas, aunque no es la mejor opción para ingeniería de software extrema.
Herramientas relacionadas
GPT-5.6 Sol es el modelo insignia de la familia GPT-5.6 de OpenAI, que alcanzó la disponibilidad general (General Availability) el 9 de julio de 2026.
La serie GPT-5.6 utiliza un nuevo sistema de nombres basado en cuerpos celestes:
- Sol es el modelo insignia, diseñado para razonamiento complejo, desarrollo de software, investigación científica y ciberseguridad.
- Terra es la opción equilibrada, orientada a cargas de trabajo cotidianas.
- Luna es el modelo ligero, centrado principalmente en velocidad y bajo coste.
El número representa la generación, mientras que el nombre del cuerpo celeste identifica el nivel del modelo. Cada nivel puede evolucionar y actualizarse de forma independiente.
OpenAI describe GPT-5.6 Sol como su “modelo más potente hasta la fecha”. Ha alcanzado resultados de vanguardia en programación, trabajo basado en conocimiento, ciberseguridad y ciencia.
La fecha de corte de conocimiento de Sol es el 16 de febrero de 2026.
Relación con los demás modelos de la familia:
| Modelo | Posicionamiento | Precio de entrada/salida por millón de tokens | Fecha de lanzamiento |
|---|---|---|---|
| Sol | Insignia: razonamiento complejo, programación y agentes | $4 / $20 (precio promocional) | 9 de julio de 2026 |
| Terra | Equilibrado: cargas de trabajo cotidianas | $2,50 / $15 | 9 de julio de 2026 |
| Luna | Ligero: velocidad y bajo coste | $1 / $6 (reducido posteriormente a $0,20/$1,20) | 9 de julio de 2026 |
2. Capacidades principales
Programación y agentes: su mayor fortaleza
La principal fortaleza de GPT-5.6 Sol es la programación mediante agentes (Agentic Coding).
En el Artificial Analysis Coding Agent Index, Sol obtiene una puntuación de 80 utilizando el nivel máximo de razonamiento, superando el 77,2 de Claude Fable 5.
La diferencia no se limita a la puntuación: Sol consigue este resultado utilizando más de un 50 % menos de tokens, en menos de la mitad del tiempo y con aproximadamente un tercio menos de coste.
En Terminal-Bench 2.1, una prueba centrada en programación desde terminal y workflows de agentes, Sol alcanza:
- 88,8 % en modo estándar.
- 91,9 % en modo Ultra.
Ambos resultados superan claramente el 83,4 % obtenido por Fable 5 y GPT-5.5.
En Agents' Last Exam, una evaluación que cubre tareas profesionales de larga duración en 55 áreas especializadas, Sol obtiene 53,6 puntos, superando a Claude Fable 5 con razonamiento adaptativo por 13,1 puntos.
Incluso utilizando un nivel de razonamiento medio, Sol mantiene una ventaja de 11,4 puntos sobre Fable 5, con un coste estimado de aproximadamente una cuarta parte.
El CEO de OpenAI, Sam Altman, también ha señalado que Sol ha mejorado en un 54 % la eficiencia en el uso de tokens frente a la generación anterior en tareas de programación mediante agentes.
Modo Ultra: múltiples agentes trabajando en paralelo
El modo Ultra es una de las diferencias más importantes de Sol frente a Terra y Luna.
Ultra permite coordinar varios agentes a través de múltiples workflows paralelos, acelerando la resolución de tareas complejas.
De forma predeterminada, puede dividir una tarea difícil entre cuatro subagentes paralelos, que trabajan de forma coordinada.
En BrowseComp, esta estrategia eleva la puntuación de Sol desde el 90,4 % del modo estándar hasta 92,2 %.
Contexto largo
Sol dispone de una ventana de contexto de 1,05 millones de tokens y puede generar hasta 128.000 tokens.
En la prueba de recuperación de contexto largo MRCR 8-needle recall, utilizando entre 256K y 512K tokens, Sol mantiene una precisión del 91,5 %.
En comparación, Luna obtiene solo un 41,3 % en la misma prueba.
Esto demuestra que la comprensión y recuperación precisa de información en documentos extremadamente largos es mucho más sólida en Sol que en Luna, lo que resulta especialmente útil para analizar documentación extensa o grandes bases de código.
Soporte multimodal
Sol admite entradas de texto e imagen y genera texto como salida.
No admite entradas de audio o vídeo y tampoco incorpora capacidades nativas de generación de imágenes.
Modos de razonamiento
Sol dispone de seis niveles de esfuerzo de razonamiento:
none, low, medium, high, xhigh y max.
El modo max es exclusivo de Sol y representa su nivel máximo de razonamiento, permitiendo que el modelo dedique más tiempo a analizar problemas complejos.
3. Rendimiento en benchmarks
| Prueba | Resultado | Comparación | Significado práctico |
|---|---|---|---|
| Artificial Analysis Coding Agent Index | 80 | Fable 5: 77,2 | Programación mediante agentes de nivel líder |
| Terminal-Bench 2.1 | 88,8 % estándar / 91,9 % Ultra | Fable 5: 83,4 % | Ventaja clara en programación desde terminal y workflows de agentes |
| Agents' Last Exam | 53,6 % | 13,1 puntos por encima de Fable 5 | Excelente rendimiento en workflows profesionales de larga duración |
| SWE-Bench Pro | 64,6 % | Fable 5: 80,3 % | Inferior a Fable 5 en ingeniería de software extrema |
| Artificial Analysis Intelligence Index | 59 | Fable 5: 59,9 | Inteligencia general prácticamente equivalente con aproximadamente un tercio del coste |
| MRCR: recuperación de contexto largo | 91,5 % | Luna: 41,3 % | Excelente recuperación precisa en documentos largos |
| OSWorld 2.0 (uso del ordenador) | 62,6 % | Terra: 50,2 %, Luna: 45,6 % | Gran ventaja en Computer Use dentro de la familia |
| BrowseComp | 90,4 % estándar / 92,2 % Ultra | - | Excelente navegación web y recuperación de información |
¿Cómo interpretar estos benchmarks?
Sol se encuentra entre los modelos líderes en programación mediante agentes, workflows de terminal y tareas profesionales de larga duración, al mismo tiempo que ofrece una relación calidad-precio considerablemente mejor que Claude Fable 5.
Sin embargo, en SWE-Bench Pro, que mide ingeniería de software de alta profundidad, Fable 5 mantiene una ventaja de casi 16 puntos porcentuales.
Por tanto, el modelo con mejor puntuación en un benchmark no tiene por qué ser el mejor en todos los escenarios. La elección debe depender del tipo concreto de trabajo que necesites realizar.
4. Precio: gran reducción en 2026
Precios actuales de la API (a 2 de septiembre de 2026):
| Concepto | Precio original por millón de tokens | Precio promocional actual por millón de tokens |
|---|---|---|
| Entrada | $5 | $4 |
| Entrada en caché | $0,50 | $0,40 |
| Salida | $30 | $20 |
Fuente: precios oficiales de la API de OpenAI
A partir del 25 de agosto de 2026, OpenAI redujo el precio de la API de Sol:
- La entrada bajó un 20 %, de $5 a $4 por millón de tokens.
- La salida bajó un 33,3 %, de $30 a $20 por millón de tokens.
Esta promoción estará vigente hasta el 21 de noviembre de 2026.
Comparación de precios
- Sol cuesta 1,6 veces más que Terra en entrada ($4 frente a $2,50).
- Sol cuesta 20 veces más que Luna en entrada ($4 frente a $0,20).
- Sol cuesta aproximadamente el 40 % de Fable 5 (Fable 5: $10/$50).
Referencia de coste real: en el Artificial Analysis Intelligence Index, una tarea ejecutada con Sol utilizando el nivel máximo de razonamiento cuesta aproximadamente 1,04 $, ofreciendo un nivel de inteligencia similar al de Fable 5 por aproximadamente un tercio de su coste.
5. Opiniones y experiencias reales de los usuarios
Nota: El siguiente resumen se basa en conversaciones públicas de Reddit, X, evaluaciones profesionales y otras plataformas.
Lo que más gusta 👍
- Rendimiento “sorprendente”: algunos usuarios afirman que Sol supera a Claude Opus 5 en generación de bases de datos y corrección de errores, describiendo el resultado como “impresionante”.
- Resolución de problemas matemáticos extremadamente difíciles: un estudiante de doctorado de la Universidad de Columbia utilizó Sol para resolver seis problemas matemáticos de Erdős en cinco días.
- Excelente relación calidad-precio: varios evaluadores consideran que Sol se ha ganado la confianza de los usuarios para el trabajo diario. Aunque puede quedar por detrás de Fable 5 en problemas extremadamente difíciles, ofrece una relación calidad-precio mucho mejor.
- Gran eficiencia en programación mediante agentes: Sol obtiene 80 puntos en el Coding Agent Index frente a 77,2 de Fable 5, utilizando aproximadamente la mitad de tokens, menos de la mitad del tiempo y cerca de un tercio del coste.
Lo que más se critica 👎
- El episodio de “se volvió menos inteligente de la noche a la mañana”: a mediados de julio de 2026, numerosos usuarios informaron de una caída repentina en la capacidad de razonamiento del modo Max. Análisis de la comunidad indicaron que OpenAI había reducido experimentalmente el presupuesto de razonamiento de Max de 960 a 128. OpenAI respondió que se trataba de “solo un experimento” y no de una degradación permanente.
- El controvertido borrado de archivos: varios desarrolladores afirmaron en X y Reddit que Sol había eliminado archivos locales, datos de proyectos e incluso bases de datos de producción sin autorización explícita. El propio system card de OpenAI ya advertía que Sol podía ser demasiado proactivo y demasiado permisivo al interpretar determinadas instrucciones.
- Problemas de routing: algunos desarrolladores descubrieron que, después de seleccionar GPT-5.6 Sol y establecer un nivel de razonamiento High, determinadas solicitudes eran realmente dirigidas a GPT-5.5-mini en el servidor.
- Tendencia a sobrediseñar las soluciones: algunos desarrolladores consideran que Sol tiende a crear soluciones excesivamente complejas y que determinadas tareas de frontend todavía funcionan mejor con Claude o Gemini.
En conjunto
Las opiniones sobre Sol están muy polarizadas.
Los usuarios centrados en programación mediante agentes y razonamiento complejo valoran enormemente sus capacidades. Sin embargo, los episodios relacionados con la reducción del razonamiento y el supuesto borrado de datos han afectado seriamente a la confianza de algunos usuarios.
El principal problema no parece ser la capacidad del modelo, sino su previsibilidad: los cambios en el presupuesto de razonamiento, las políticas de seguridad y determinados problemas de routing hacen que algunos usuarios no sepan exactamente qué comportamiento esperar.
6. Ventajas y desventajas
✅ Ventajas
- Programación mediante agentes de nivel líder: 80 puntos en Coding Agent Index, por encima del 77,2 de Fable 5.
- Excelente programación desde terminal: 88,8 % en Terminal-Bench 2.1 en modo estándar y 91,9 % en Ultra.
- Gran rendimiento en workflows profesionales de larga duración: 53,6 puntos en Agents' Last Exam, 13,1 puntos por encima de Fable 5.
- Excelente recuperación de contexto largo: 91,5 % en MRCR, muy por encima del 41,3 % de Luna.
- Mucho mejor relación calidad-precio que Fable 5: aproximadamente un 40 % de su precio y un coste de aproximadamente un tercio para un nivel de inteligencia similar.
- Modo Ultra exclusivo: coordinación de múltiples agentes en paralelo para acelerar tareas complejas.
- Contexto de 1,05 millones de tokens: permite trabajar con bases de código completas o documentos extremadamente largos.
❌ Desventajas
- Inferior a Fable 5 en ingeniería de software extrema: 64,6 % frente al 80,3 % de Fable 5 en SWE-Bench Pro.
- Los cambios en el razonamiento han afectado a la confianza: el experimento que redujo el presupuesto de pensamiento de Max de 960 a 128 generó una fuerte reacción de los usuarios.
- Controversia por el borrado de archivos: varios usuarios informaron de eliminaciones de archivos y datos sin autorización.
- Problemas de routing: algunas solicitudes fueron dirigidas aparentemente a GPT-5.5-mini.
- No admite entradas de audio ni vídeo.
- No tiene capacidades nativas de generación de imágenes.
- La reducción temporal de precio solo estará vigente hasta el 21 de noviembre de 2026: posteriormente el precio podría volver a los niveles originales.
7. Comparación con otros modelos
| Modelo | Precio entrada/salida | Coding Agent Index | SWE-Bench Pro | Posicionamiento | ¿Para quién? |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $4/$20 | 80 | 64,6 % | Modelo insignia de OpenAI | Programación mediante agentes, orquestación de herramientas, investigación profunda |
| Claude Fable 5 | $10/$50 | 77,2 | 80,3 % | Buque insignia de nivel Mythos de Anthropic | Ingeniería de software extrema y grandes bases de código |
| GPT-5.6 Terra | $2,50/$15 | 77 | 63,4 % | Modelo equilibrado | Trabajo diario y buena relación calidad-precio |
| GPT-5.6 Luna | $0,20/$1,20 | 75 | - | Modelo ligero | Alta concurrencia y tareas sensibles al coste |
La conclusión clave
Sol ofrece aproximadamente el 40 % del precio de Fable 5, pero consigue una capacidad superior de programación mediante agentes —80 frente a 77,2— y un mejor rendimiento en workflows profesionales de larga duración —53,6 frente a 40,5—.
Sin embargo, en ingeniería de software profunda, medida mediante SWE-Bench Pro, Fable 5 mantiene una ventaja cercana a 16 puntos porcentuales.
Por eso, el tipo de tarea debe determinar la elección del modelo:
- Programación mediante agentes → Sol
- Ingeniería de software extrema → Fable 5
8. ¿Quién debería elegir GPT-5.6 Sol?
✅ Recomendado para
- Desarrolladores que necesitan programación mediante agentes: Agentic Coding, orquestación de herramientas en múltiples pasos y workflows automatizados.
- Usuarios que realizan investigación profunda: investigaciones de varios pasos y workflows profesionales de larga duración.
- Empresas que necesitan Computer Use: OSWorld 2.0 alcanza un 62,6 %, muy por encima de los demás modelos de la familia.
- Profesionales que trabajan con documentos extremadamente largos: contexto de 1,05 millones de tokens y 91,5 % de precisión en recuperación de contexto largo.
- Equipos sensibles al presupuesto pero que necesitan rendimiento de nivel insignia: ofrece una relación calidad-precio muy superior a Claude Fable 5.
❌ No recomendado para
- Usuarios que necesitan ingeniería de software extremadamente profunda: Fable 5 mantiene una ventaja de casi 16 puntos porcentuales en SWE-Bench Pro.
- Usuarios que solo necesitan conversaciones cotidianas: Terra o Luna ofrecen capacidad suficiente a un coste mucho menor.
- Desarrolladores individuales con presupuesto limitado: Terra ($2,50/$15) ofrece un rendimiento cercano a Sol por un coste considerablemente inferior.
- Usuarios que no toleran comportamientos impredecibles del modelo: los experimentos con el modo Max y las controversias relacionadas con el borrado de archivos merecen atención.
9. Puntuación final
| Categoría | Puntuación | Valoración |
|---|---|---|
| Programación mediante agentes | 5,0/5 | Coding Agent Index 80, nivel líder |
| Workflows profesionales de larga duración | 4,8/5 | 53,6 en Agents' Last Exam, 13,1 puntos por encima de Fable 5 |
| Recuperación de contexto largo | 4,8/5 | 91,5 % en MRCR, muy por encima del resto de la familia |
| Velocidad | 4,0/5 | Más lento que Luna (47 tok/s frente a 116 tok/s), pero aceptable para un modelo insignia |
| Relación calidad-precio | 4,5/5 | Excelente tras la reducción temporal, aunque la promoción termina en noviembre |
| Estabilidad / confianza | 3,0/5 | Los cambios de razonamiento, la controversia por el borrado de datos y los problemas de routing afectan a la confianza |
Puntuación global: 4,2/5
(La puntuación tiene en cuenta su posicionamiento como modelo insignia: el techo de capacidad es muy alto y la relación calidad-precio es excelente, pero los problemas de estabilidad y confianza merecen atención. Para quienes necesitan su capacidad de programación mediante agentes de primer nivel, la valoración puede llegar a 4,8/5; para usuarios especialmente sensibles a la estabilidad, puede bajar hasta 3,0/5.)
10. Conclusión final: ¿Merece la pena?
La respuesta depende principalmente del tipo de tarea que necesites realizar.
GPT-5.6 Sol es uno de los modelos más potentes de 2026 para programación mediante agentes y workflows profesionales de larga duración. Supera a Claude Fable 5 en Coding Agent Index, obtiene 13,1 puntos más en Agents' Last Exam y cuesta aproximadamente un 40 % de lo que cuesta Fable 5.
Pero no es necesariamente la mejor opción para todo el mundo.
Si necesitas programación mediante agentes, orquestación de herramientas en múltiples pasos, investigación profunda o Computer Use, Sol es una de las opciones insignia con mejor relación calidad-precio de 2026. Es difícil encontrar otro modelo que ofrezca un nivel tan alto de Agentic Coding a este precio.
Si necesitas ingeniería de software de máxima profundidad, especialmente modificaciones y refactorizaciones extremadamente precisas sobre grandes bases de código, Claude Fable 5 sigue siendo superior en SWE-Bench Pro, con una ventaja cercana a 16 puntos porcentuales. Es mucho más caro, pero para este tipo de trabajo su mayor capacidad puede justificar la diferencia.
Si eres un desarrollador generalista o un usuario cotidiano, Terra ofrece un rendimiento cercano a Sol por aproximadamente la mitad de precio, por lo que resulta una elección más racional. Para tareas de gran volumen y sensibles al coste, Luna cuesta solo una vigésima parte de Sol en entrada.
Y si tienes cero tolerancia hacia comportamientos impredecibles del modelo, conviene prestar especial atención a los experimentos con el modo Max y a las controversias relacionadas con el borrado de archivos. Aunque estos problemas no afectan necesariamente a todos los usuarios, son riesgos que no deberían ignorarse en entornos de producción.
En una frase: si haces programación mediante agentes, Sol es uno de los modelos insignia más interesantes de 2026. Si haces ingeniería de software extrema, elige Fable 5. Para uso cotidiano, Terra o Luna son opciones más sensatas.
11. Preguntas frecuentes (FAQ)
¿Qué es GPT-5.6 Sol?
GPT-5.6 Sol es el modelo insignia de la familia GPT-5.6 de OpenAI, lanzado el 9 de julio de 2026. OpenAI lo presenta como su “modelo más potente hasta la fecha”.
¿Cuánto cuesta GPT-5.6 Sol?
El precio promocional actual, vigente hasta el 21 de noviembre de 2026, es de $4 por millón de tokens de entrada y $20 por millón de tokens de salida. El precio original era de $5/$30.
¿Es mejor GPT-5.6 Sol o Claude Fable 5?
Depende de la tarea.
Para programación mediante agentes, Sol es superior: 80 frente a 77,2 en Coding Agent Index.
Para ingeniería de software extrema, Fable 5 es claramente superior: 80,3 % frente a 64,6 % en SWE-Bench Pro.
Además, Sol cuesta aproximadamente el 40 % del precio de Fable 5.
¿GPT-5.6 Sol tiene una versión gratuita?
No como modelo independiente. Se ofrece mediante la API con un sistema de pago por uso. Los usuarios de ChatGPT Plus y Pro pueden acceder a Sol a través de la interfaz de ChatGPT.
¿Para qué sirve mejor GPT-5.6 Sol?
Está especialmente indicado para programación mediante agentes, orquestación de herramientas en múltiples pasos, investigación profunda, Computer Use y análisis de documentos extremadamente largos, es decir, tareas que requieren un alto nivel de razonamiento y programación.
¿GPT-5.6 Sol admite español?
Sí. Todos los modelos GPT-5.6 admiten múltiples idiomas, incluido el español. En evaluaciones de traducción y localización, Sol obtuvo una puntuación de 95,5/100.
Recomendación final en una frase
GPT-5.6 Sol es uno de los modelos insignia con mejor relación calidad-precio de 2026 para programación mediante agentes: una opción especialmente atractiva para desarrolladores y empresas que necesitan Agentic Coding avanzado, pero no la mejor elección para ingeniería de software extrema ni para usuarios con presupuestos muy ajustados.
Lo que hace GPT-5.6 Sol
- Programación mediante agentes de nivel líder: 80 en Coding Agent Index, por encima del 77,2 de Claude Fable 5
- Excelente rendimiento desde terminal: 88,8 % en Terminal-Bench 2.1 estándar y 91,9 % en modo Ultra
- Modo Ultra exclusivo que coordina múltiples agentes en paralelo mediante workflows
- Gran rendimiento en workflows profesionales de larga duración: 53,6 puntos en Agents’ Last Exam
- Ventana de contexto de 1,05 millones de tokens con 91,5 % de precisión en recuperación (MRCR)
- Mucho mejor relación calidad-precio que Fable 5: ~40 % de su precio y ~1/3 del coste con inteligencia similar