- modelos
- OpenAI
- producto
GPT-6 Sol vs Luna: benchmarks, precio y cuál usar en BrainBox
OpenAI publicó GPT-6 Sol y GPT-6 Luna el 22 de septiembre de 2026 y los dos ya están en el Asistente de BrainBox: benchmarks, puntaje en Artificial Analysis, unidades de inteligencia por tarea y cuál elegir.
GPT-6 Sol y GPT-6 Luna se pueden elegir en el Asistente de BrainBox desde el 22 de septiembre de 2026, el mismo día en que OpenAI los publicó. Los dos tienen 1.050.000 tokens de contexto, 128.000 tokens de salida máxima y aceptan imágenes. Sol entra en la categoría Pro del selector y Luna en Predeterminado.
¿Qué son GPT-6 Sol y GPT-6 Luna?
Son los dos niveles que OpenAI sumó a la familia GPT-6 después de Astra. Según el anuncio, se entrenaron "con métodos similares a GPT-6 Astra", llevando sus avances en trabajo profesional, factualidad, coding, uso del computador y alineación "a modelos más rápidos y asequibles". OpenAI aclara en el mismo texto que Astra sigue siendo su mejor modelo en todos los frentes, y Astra no está en el selector de BrainBox.
| GPT-6 Sol | GPT-6 Luna | |
|---|---|---|
| Para qué | Coding complejo y flujos con agentes | Tareas enfocadas y de alto volumen |
| Contexto | 1.050.000 tokens | 1.050.000 tokens |
| Salida máxima | 128.000 tokens | 128.000 tokens |
| Entradas | Texto e imagen | Texto e imagen |
| Corte de conocimiento | 20 de abril de 2026 | 18 de mayo de 2026 |
| Niveles de esfuerzo | De ninguno a máximo | De ninguno a máximo |
| Categoría en el selector de BrainBox | Pro | Predeterminado |
| Intelligence Index de Artificial Analysis | 48 | 37 |
Las especificaciones salen de las fichas oficiales de GPT-6 Sol y GPT-6 Luna.
¿Qué dicen los benchmarks?
Artificial Analysis, que mide los modelos por su cuenta, le da 48 puntos a GPT-6 Sol en su Intelligence Index y 37 a GPT-6 Luna. Según el leaderboard, Sol queda por encima de Grok 4.7 y MiMo V2.6 Pro, que puntúan 46, y por debajo de GPT-6 Astra y Claude Fable 5.1 con 53 y de Claude Opus 5.5 con 58. Luna, con 37, es el puntaje más alto de su rango de precio.
Los benchmarks que publica OpenAI comparan costo por tarea antes que puntaje máximo:
| Benchmark, según OpenAI | GPT-6 Sol | GPT-6 Luna | Referencia que cita OpenAI |
|---|---|---|---|
| AutomationBench 1.0.6, flujos de negocio | 33,2 % en esfuerzo xhigh | Mejora 5,4 puntos sobre su predecesor | Claude Opus 5 en máximo: 26,9 % |
| Agents' Last Exam V1, trabajo profesional | 56,4 % en esfuerzo máximo | Por encima del mejor puntaje de Claude Opus 5 | |
| DeepSWE v1.1, ingeniería de software | 68,8 % en esfuerzo máximo | 66,6 % en esfuerzo máximo | Claude Fable 5 en xhigh: 69,9 % |
| OSWorld 2.0 offline, uso del computador | 60,5 % en esfuerzo xhigh | Claude Opus 5 en medio: 60,3 % |
El mejor puntaje de cada fila va en negrita.
Los valores de la competencia los reporta OpenAI a partir de informes públicos, no cada laboratorio, y OpenAI advierte que usó puntajes de Claude Fable 5 cuando los de Fable 5.1 no estaban disponibles. En AutomationBench señala además que el dato de Fable 5.1 subestima su costo porque omite las llamadas de respaldo a Opus 5, que ocurrieron en cerca del 40 % de las tareas.
Dos mejoras del anuncio se notan más en el trabajo documental que en la tabla. En la evaluación interna de factualidad de OpenAI, construida con conversaciones reales donde los usuarios marcaron errores, Sol comete "cerca de la mitad de errores que su predecesor". Y el estilo cambió: OpenAI promete "más claridad, menos jerga, menos giros raros, menos detalles de poco valor y respuestas algo más cortas sin perder sustancia".
¿Cómo trabaja el Asistente de BrainBox con estos modelos?
El Asistente de BrainBox es un agente. Tú eliges qué Boxes y archivos puede usar y qué modelo razona; el agente decide los pasos. En el chat se ve cada uno: "Listando fuentes", "Buscando en documentos", "Leyendo documento" con las páginas que abrió, "Guardando nota" cuando aparta algo para más adelante, y al final la respuesta con citas a la página.
Con un millón de tokens de contexto, cualquiera de los dos sostiene muchas lecturas en una misma conversación antes de que el agente tenga que comprimir lo leído en notas. La diferencia está en qué tan lejos llega el razonamiento entre paso y paso, y ahí Sol va por delante.
Abre el Asistente y elige las fuentes
En la barra lateral marcas los Boxes y archivos que el agente puede usar. También puedes apuntar a un archivo con @ dentro del mensaje.
Pulsa el selector de modelo
Está en la barra inferior del chat. Se abre una lista con buscador.
Escribe 'GPT-6'
Aparecen GPT-6 Sol en la categoría Pro y GPT-6 Luna en Predeterminado, con su contexto y la etiqueta de imágenes.
Elige el nivel según la tarea
Sol para revisiones largas y razonamiento complejo; Luna para preguntas frecuentes, resúmenes y lotes.
Pide la tarea
Las citas a la página, las herramientas y los pasos visibles del agente funcionan igual con los dos niveles.
Seleccionar modelo
- GPT-6 SolOpenAI
Modelo insignia para coding complejo y agentes
1.05M contextoProImágenes - GPT-6 LunaOpenAI
El nivel más eficiente de GPT-6 para trabajo de alto volumen
1.05M contextoImágenes
BrainBox es un espacio de trabajo de IA para documentos que responde con citas a la página exacta. El modelo cambia la forma de razonar; la traza a la fuente no cambia.
¿Cuántas unidades de inteligencia gasta cada tarea?
En BrainBox el consumo no se mide en tokens sino en unidades de inteligencia, y cada tarea gasta un número distinto según cuántas búsquedas y lecturas hace el agente, cuánto razona el modelo y cuánto escribe. Estimaciones para el plan estándar:
| Tarea en el Asistente | GPT-6 Sol | GPT-6 Luna |
|---|---|---|
| Pregunta puntual con citas, una o dos búsquedas | ≈ 4 unidades | ≈ 1 unidad |
| Análisis de un Excel con el intérprete de código | ≈ 11 unidades | ≈ 2 unidades |
| Revisión de un expediente con unas diez búsquedas y lecturas | ≈ 27 unidades | ≈ 4 unidades |
| Lectura completa de un contrato de 200 páginas, página por página | ≈ 29 unidades | ≈ 3 unidades |
| Informe en PDF a partir de un expediente, con código y unos quince pasos | ≈ 49 unidades | ≈ 5 unidades |
Son estimaciones: una respuesta más larga, más fuentes o más pasos del agente suben el número. Como referencia, el plan Elite incluye 400 unidades al mes. La diferencia entre los dos niveles explica por qué conviene dejar Luna como opción por defecto: para la mayoría de las preguntas, la respuesta es la misma y el gasto es una fracción.
¿Qué pasa si el Box es más grande que el contexto?
Nada se queda fuera. El Asistente no carga el Box entero en el modelo: busca en las fuentes seleccionadas y lee las páginas que responden la pregunta, cada una con su archivo y su página. Funciona igual con un Box de 200 páginas o de 20.000. El modelo decide cómo razonar sobre lo que lee; el tamaño del Box no decide qué modelo puedes elegir.
¿Cuándo conviene Sol, cuándo Luna y cuándo ninguno?
| Tarea en el Asistente | Modelo | Por qué |
|---|---|---|
| Pregunta puntual con cita | Luna | Una unidad por pregunta; la diferencia de calidad casi no se nota |
| Resumir 50 actas o clasificar documentos por lotes | Luna | El gasto por pregunta hace viable repetirlo decenas de veces |
| Comparar versiones de un contrato o revisar un expediente | Sol | Razona mejor entre paso y paso en tareas largas |
| Informe en PDF o análisis de datos con el intérprete de código | Sol | OpenAI lo posiciona para coding y flujos con agentes |
| Preguntas sobre capturas o diagramas | Cualquiera de los dos | Ambos aceptan imágenes |
| Dictamen donde el margen de error debe ser mínimo | Claude Opus 5.5 | Diez puntos por encima de Sol en el índice independiente |
Para equipos legales, la política de modelos del espacio de trabajo permite habilitar Sol para el equipo o dejar solo Luna, sin tocar cada cuenta. Las citas siguen apuntando a la página con cualquiera de los dos, así que la verificación de la respuesta es la misma.
¿En qué se diferencia de usar GPT-6 en ChatGPT?
ChatGPT Work y Codex dan acceso a los mismos modelos, según OpenAI. Lo que cambia es lo que hay alrededor.
| ChatGPT | BrainBox con GPT-6 | |
|---|---|---|
| Fuentes | Lo que pegues o adjuntes en esa conversación | Los documentos del Box, indexados: PDF, Office, audio transcrito, imágenes |
| Citas | No apunta a la página de tus archivos | Página, fragmento y contexto expandido por cada afirmación |
| Cambiar de modelo | Solo modelos de OpenAI | Sol y Luna al lado de Claude, Gemini, Grok y modelos abiertos, en el mismo chat |
| Equipo | Cuenta individual | Box compartido con roles; el administrador decide qué modelos se permiten |
| Consumo | Suscripción fija | Unidades de inteligencia por uso, según el modelo que elijas |
Artificial Analysis mide a Sol a unos 115 tokens por segundo y a Luna a unos 154 una vez que empiezan a escribir, con más de un minuto de espera antes del primer token en esfuerzo máximo. En el Asistente eso se ve como una tarea larga que avanza paso a paso durante varios minutos.
Fuentes
- OpenAI, Introducing GPT-6 Sol and Luna: anuncio del 22 de septiembre de 2026, benchmarks, factualidad, estilo y disponibilidad.
- OpenAI, fichas de GPT-6 Sol y GPT-6 Luna: contexto, salida máxima, modalidades, niveles de esfuerzo y corte de conocimiento.
- Artificial Analysis, fichas de GPT-6 Sol y GPT-6 Luna: Intelligence Index, velocidad y verbosidad.
- Artificial Analysis, leaderboard de modelos: puntajes de Claude Opus 5.5, GPT-6 Astra, Claude Fable 5.1, Grok 4.7 y MiMo V2.6 Pro.
Preguntas frecuentes
- ¿Qué diferencia hay entre GPT-6 Sol y GPT-6 Luna?
- El nivel de razonamiento y el consumo. OpenAI describe a Sol como su modelo para coding complejo y flujos con agentes, y a Luna como el más eficiente para tareas enfocadas y de alto volumen. Los dos tienen 1.050.000 tokens de contexto, 128.000 tokens de salida máxima y aceptan imágenes. Artificial Analysis puntúa a Sol en 48 y a Luna en 37 en su Intelligence Index. En BrainBox, una revisión de expediente son unas 27 unidades con Sol y 4 con Luna.
- ¿Cuánto cuesta usarlos en BrainBox?
- El consumo se mide en unidades de inteligencia. Estimaciones en el plan estándar: una pregunta puntual con citas, unas 4 unidades con Sol y 1 con Luna; un análisis de datos con el intérprete de código, unas 11 con Sol y 2 con Luna; una revisión de expediente, unas 27 con Sol y 4 con Luna; un informe en PDF, unas 49 con Sol y 5 con Luna.
- ¿Cuál conviene para el día a día?
- Luna para la mayoría de las preguntas: una fuente, una búsqueda, una respuesta con citas. Sol cuando la tarea encadena muchos pasos, como revisar un expediente completo, cruzar un pliego con sus adendas o generar un informe. Cambiar de modelo en el selector no reinicia el chat, así que puedes empezar con Luna y subir a Sol si la respuesta se queda corta.
- ¿En qué planes están disponibles?
- Luna está en la categoría Predeterminado y Sol en la categoría Pro del selector. En cuentas personales, los modelos Pro aparecen para los planes de pago; en un espacio de trabajo depende de la política de modelos que haya definido el administrador.
- ¿Son mejores que Claude para mis documentos?
- Depende de la tarea. En el Intelligence Index de Artificial Analysis, Claude Opus 5.5 puntúa 58 y GPT-6 Sol 48. En los benchmarks que publica OpenAI, Sol queda a 1,1 puntos de Claude Fable 5 en DeepSWE v1.1 con un costo por tarea mucho menor. Para un dictamen donde el margen de error debe ser mínimo, Opus 5.5 sigue por delante; para volumen y tareas repetidas, Luna gasta una fracción de las unidades.
- ¿Qué pasa si mi Box es más grande que el contexto?
- Nada se queda fuera. El Asistente no carga el Box entero de una vez: busca en las fuentes que elegiste y lee las páginas que responden la pregunta, cada una con su cita. El tamaño del Box no limita qué modelo puedes usar.
Escrito por
BrainBox Team
Inteligencia documental, por ExaByte Company
Construimos BrainBox — la plataforma que los equipos usan para preguntar sobre sus propios documentos y obtener respuestas con citas exactas de página.
Sigue leyendo
Claude Opus 5.5 en BrainBox: benchmarks, precio y cuándo elegirlo
Anthropic publicó Claude Opus 5.5 el 22 de septiembre de 2026 y ya se puede elegir en el Asistente de BrainBox: es el número uno del Intelligence Index de Artificial Analysis, con benchmarks, unidades de inteligencia por tarea y cuándo conviene.
Grok 4.7 en BrainBox: benchmarks, precio y cuándo elegirlo
Grok 4.7 de xAI ya se puede elegir en el Asistente de BrainBox: benchmarks frente a Grok 4.6, puntaje en Artificial Analysis, unidades de inteligencia que gasta por tarea y para qué trabajo documental conviene.
Xiaomi MiMo V2.6 Pro vs Flash: benchmarks, precio y cuál usar en BrainBox
MiMo V2.6 Pro y Flash de Xiaomi, pesos abiertos MIT y 1M de contexto, ya están en el Asistente de BrainBox: benchmarks, puntaje en Artificial Analysis, unidades de inteligencia por tarea y cuál elegir.