OpenAI presenta GPT-6 Sol y Luna con menores precios y resultados dispares en pruebas independientes

OpenAI presenta GPT-6 Sol y Luna con menores precios y resultados dispares en pruebas independientes

Imagen para ayudar a comprender el artículo

OpenAI presentó el 22 de septiembre de 2026 GPT-6 Sol y GPT-6 Luna, dos modelos que trasladan parte de las mejoras de entrenamiento de GPT-6 Astra a opciones más rápidas y económicas. La compañía atribuye a esta generación avances en tareas profesionales, precisión factual, programación, uso de computadoras y alineación.

GPT-6 Sol está orientado a trabajos complejos de programación, mientras que GPT-6 Luna se enfoca en labores de oficina, resúmenes y extracción de información.

Precios y disponibilidad

La API de GPT-6 Sol cuesta 2 dólares por cada millón de tokens de entrada y 10 dólares por cada millón de tokens de salida. OpenAI asegura que estas tarifas son un 50% inferiores al precio promocional de GPT-5.6. En GPT-6 Luna, el costo de entrada baja de 0,20 a 0,10 dólares por millón de tokens, y el de salida pasa de 1,20 a 0,50 dólares.

Los identificadores para desarrolladores son gpt-6-sol y gpt-6-luna, disponibles desde el día del anuncio. Ambos modelos también comenzaron a ofrecerse en ChatGPT Work y Codex para usuarios de los planes Plus, Pro, Business, Enterprise y Edu. Los suscriptores Free y Go pueden acceder a GPT-6 Luna desde la aplicación de escritorio. Sin embargo, MacRumors informó que, en el momento del lanzamiento, ninguno estaba disponible todavía en el modo Chat.

GitHub anunció un despliegue gradual en Copilot para VS Code, Visual Studio, Copilot CLI, agentes en la nube, la aplicación de Copilot, github.com, GitHub Mobile, JetBrains, Xcode y Eclipse. Sol llegará a los planes Copilot Pro+, Max, Business y Enterprise; Luna también estará incluido en Pro.

Las cifras publicadas por OpenAI

Según los datos de la empresa, GPT-6 Sol obtuvo un 33,2% en AutomationBench con el nivel de esfuerzo xhigh y un costo de 0,27 dólares por tarea. En Agents' Last Exam alcanzó un 56,4% con esfuerzo máximo. En DeepSWE v1.1, Sol registró un 68,8% y Luna un 66,6%, ambos con la configuración máxima. En esa misma evaluación, Claude Fable 5 llegó al 69,9% con esfuerzo xhigh, por encima de Sol.

En OSWorld 2.0 offline, GPT-6 Sol marcó un 60,5% con esfuerzo xhigh, frente al 60,3% de Claude Opus 5 con esfuerzo medio. OpenAI sostiene que su modelo consiguió un resultado similar con un costo por tarea aproximadamente 80% menor. También afirma que GPT-6 Luna, configurado al máximo, puede superar a GPT-5.6 Sol con esfuerzo medio por una décima parte del costo.

La compañía asegura además que los errores de Sol se redujeron aproximadamente a la mitad frente a GPT-5.6 Sol en una evaluación interna de factualidad basada en conversaciones reales anonimizadas. El anuncio no incluyó una verificación externa de ese resultado.

OpenAI advirtió que esas conversaciones fueron seleccionadas por contener errores y no representan el uso habitual, donde las equivocaciones factuales serían menos frecuentes. También aclaró que las pruebas de agentes y programación plantean escenarios deliberadamente difíciles, por lo que no miden la tasa de fallos en condiciones normales.

Avances y retrocesos en evaluaciones independientes

Los resultados de Artificial Analysis ofrecen una lectura más matizada. En su Coding Agent Index, GPT-6 Sol obtuvo 57 puntos con la configuración máxima, frente a los 55 de GPT-5.6 Sol. Luna, en cambio, bajó de 43 a 41 puntos respecto de su antecesor.

En el AA-Omniscience Index, Sol avanzó de 22 a 27 puntos y Luna pasó de -10 a 1. La tasa de alucinaciones medida por este índice descendió del 92% al 60% para Sol y del 93% al 77% para Luna. Terminal-Bench 4.0 también mostró incrementos: Sol subió del 40% al 44% y Luna del 12% al 13%. En AutomationBench-AA, los resultados aumentaron del 60% al 62% para Sol y del 50% al 53% para Luna.

El desempeño fue menos favorable en otras pruebas. En GDPval-AA v2.1, Sol perdió alrededor de 100 puntos Elo y Luna unos 75. En AA-Briefcase v1.1, Luna retrocedió aproximadamente 45 puntos Elo, mientras Sol se mantuvo estable.

Artificial Analysis atribuyó estas caídas a una menor calidad de presentación y a respuestas que omitían elementos exigidos por los criterios de evaluación, no a una pérdida de capacidades fundamentales. Según sus cálculos, el costo por tarea de Sol se redujo aproximadamente a la mitad, hasta 1,06 dólares, y el de Luna cayó cerca de un 60%, hasta 0,07 dólares. Pese a ese ahorro, el Intelligence Index general solo aumentó un punto para Sol y no cambió para Luna.

Anthropic mueve ficha el mismo día

Anthropic presentó Claude Opus 5.5 unos 90 minutos antes del anuncio de GPT-6 Sol y Luna. MacRumors señaló que el nuevo modelo de Anthropic supera a GPT-6 Astra en algunas tareas de programación y trabajo del conocimiento, una diferencia que dificulta las comparaciones directas de costo por tarea entre las distintas propuestas.

El lanzamiento de OpenAI combina así precios más bajos y mejoras en varios indicadores de programación con resultados menos consistentes en otras áreas. Sol supera a su predecesor en el índice independiente de agentes de código, pero Luna retrocede en esa misma medición; ambos pierden terreno en GDPval-AA. Incluso en las cifras de OpenAI, Claude Fable 5 conserva una ventaja estrecha sobre GPT-6 Sol en DeepSWE v1.1.

Source: Original Korean article - Trendy News Korea

Comentarios