# Grok 4.7 en BrainBox: benchmarks, precio y cuándo elegirlo

> Grok 4.7 de xAI ya se puede elegir en el Asistente de BrainBox: benchmarks frente a Grok 4.6, puntaje en Artificial Analysis, unidades de inteligencia que gasta por tarea y para qué trabajo documental conviene.

- Source: https://www.brainbox.com.co/es/blog/grok-4-7-en-brainbox-benchmarks-precio-y-cuando-elegirlo
- Author: BrainBox Team
- Published: 2026-09-21
- Updated: 2026-09-22
- Language: es
- Tags: modelos, xAI, producto

## Summary

Grok 4.7 es el nuevo modelo insignia de xAI, publicado el 21 de septiembre de 2026, y desde ese día se puede elegir en el Asistente de BrainBox con ventana de contexto de 500K tokens y entrada de imágenes. Artificial Analysis lo puntúa 46 en su Intelligence Index v4.3, dos puntos más que Grok 4.6, y xAI reporta 71,0 % en DeepSWE v1.1. En BrainBox gasta entre un 10 % y un 20 % menos unidades de inteligencia que Grok 4.6 en la misma tarea: unas 3 por pregunta con citas y unas 20 por revisión de un expediente. Conviene para tareas largas de muchos pasos; para la pregunta corta, el modelo por defecto gasta menos.

---
Grok 4.7 se puede elegir en el Asistente de BrainBox desde el 21 de septiembre de 2026, el mismo día en que [xAI lo publicó](https://x.ai/news/grok-4-7). Aparece en la categoría Pro del selector de modelos con una ventana de [500K tokens](https://artificialanalysis.ai/articles/benchmarking-grok-4-7) y entrada de imágenes. Es el sucesor de Grok 4.6, que sigue disponible, y en BrainBox gasta menos unidades de inteligencia en la misma tarea.

> **Para recordar**
>
> Grok 4.7 mejora en tareas largas de coding y agentes y gasta menos unidades de inteligencia que Grok 4.6. En BrainBox conviene para revisiones de expedientes con muchos pasos; para la pregunta corta con cita, el modelo por defecto sigue gastando menos.

## ¿Qué es Grok 4.7 y qué mejora frente a Grok 4.6?

Grok 4.7 es el modelo insignia de xAI para coding, agentes y trabajo de conocimiento. Según [el anuncio de xAI](https://x.ai/news/grok-4-7), usa "un modelo base nuevo y más grande" que Grok 4.6, se entrenó con "una fase de refuerzo más larga sobre una mezcla más difícil de tareas, con peso en problemas que toman muchas horas en completarse" y es "mejor verificando su propio trabajo". La ventana de contexto se mantiene en 500K tokens, [sin cambios frente a Grok 4.6](https://artificialanalysis.ai/articles/benchmarking-grok-4-7).

En los benchmarks que [publica xAI](https://x.ai/news/grok-4-7), Grok 4.7 sube en todas las pruebas frente a Grok 4.6, supera a Claude Fable 5.1 en EEBench y en el benchmark legal de Harvey, y queda por debajo en CursorBench, Terminal-Bench y HealthBench. Los valores de la competencia también los reporta xAI, no cada laboratorio.

| Benchmark, según xAI | Grok 4.6 | Grok 4.7 | Claude Fable 5.1 | GPT-5.6 Sol |
|---|---|---|---|---|
| DeepSWE v1.1, agente de software | 65,2 % | 71,0 % | 70,0 % | 72,7 % |
| CursorBench 4.0, coding en el editor | 40,4 % | 46,3 % | 51,8 % | 41,7 % |
| Terminal-Bench 4.0, agente en terminal | 20,3 % | 38,0 % | 57,9 % | 37,3 % |
| HealthBench Professional | 48,5 % | 56,7 % | 62,1 % | 60,5 % |
| EEBench, ingeniería eléctrica | 53,0 % | 64,0 % | 56,4 % | 39,4 % |
| Harvey Legal Agent Benchmark | 15,8 % | 19,6 % | 6,7 % | 2,5 % |

[Artificial Analysis](https://artificialanalysis.ai/articles/benchmarking-grok-4-7), que mide los modelos de forma independiente, le da 46 puntos en su Intelligence Index v4.3, dos más que Grok 4.6. Con eso xAI entra entre los cuatro laboratorios con mejor puntuación, pero queda a siete puntos de Claude Fable 5.1 y GPT-6 Astra, que [puntúan 53](https://artificialanalysis.ai/leaderboards/models) en su configuración máxima. En el Coding Agent Index del mismo informe, Grok 4.7 con Grok Build obtiene 56, cuarto puesto detrás de Claude Fable 5.1, GPT-6 Astra y Claude Opus 5.

Grok 4.7 es hablador: según [el mismo informe](https://artificialanalysis.ai/articles/benchmarking-grok-4-7), genera unos 81.000 tokens de salida por tarea del índice, frente a 36.000 de Grok 4.6, así que razona más y una respuesta suya gasta más unidades. También alucina menos: en AA-Omniscience, la prueba de conocimiento de Artificial Analysis, su tasa de alucinación baja de 34 % a 29 %, y la precisión casi igual, 47 % frente a 48 %.

## ¿Cómo trabaja el Asistente de BrainBox con Grok 4.7?

El Asistente de BrainBox es un agente. Tú eliges qué Boxes y archivos puede usar y qué modelo razona; el agente decide los pasos. En el chat se ve cada uno: "Listando fuentes", "Buscando en documentos", "Leyendo documento" con las páginas que abrió, "Guardando nota" cuando aparta algo para más adelante, y al final la respuesta con citas a la página. Para un expediente grande no carga todo de una vez: busca, lee las páginas que importan, y si la tarea lo pide, lee un documento completo.

Grok 4.7 se entrenó para tareas que encadenan muchos pasos, y eso es lo que el Asistente hace en una revisión: varias búsquedas, varias lecturas, un cruce entre documentos y una respuesta larga. Ahí es donde se nota la mejora frente a Grok 4.6.

## ¿Cómo se elige Grok 4.7 en BrainBox?

  - **Abre el Asistente y elige las fuentes** En la barra lateral marcas los Boxes y archivos que el agente puede usar. También puedes apuntar a un archivo con @ dentro del mensaje.
  - **Pulsa el selector de modelo** Está en la barra inferior del chat. Se abre una lista con buscador.
  - **Escribe 'Grok'** Aparecen Grok 4.7 y Grok 4.6 con su contexto y las etiquetas Pro e Imágenes.
  - **Elige Grok 4.7** Si no lo ves, tu plan personal no incluye la categoría Pro o la política del espacio de trabajo no lo permite.
  - **Pide la tarea** Las citas a la página, las herramientas y los pasos visibles del agente funcionan igual con cualquier modelo.

*Simulación del selector de modelos del Asistente de BrainBox con Grok 4.7 elegido.*

BrainBox es un espacio de trabajo de IA para documentos que responde con citas a la página exacta. El modelo cambia la forma de razonar; la traza a la fuente no cambia.

## ¿Cuántas unidades de inteligencia gasta Grok 4.7 por tarea?

En BrainBox el consumo no se mide en tokens sino en unidades de inteligencia, y cada tarea gasta un número distinto según cuántas búsquedas y lecturas hace el agente, cuánto razona el modelo y cuánto escribe. Estimaciones para el plan estándar:

| Tarea en el Asistente | Grok 4.7 | Grok 4.6 |
|---|---|---|
| Pregunta puntual con citas, una o dos búsquedas | ≈ 3 unidades | ≈ 3 unidades |
| Análisis de un Excel con el intérprete de código | ≈ 8 unidades | ≈ 9 unidades |
| Revisión de un expediente con unas diez búsquedas y lecturas | ≈ 20 unidades | ≈ 25 unidades |
| Lectura completa de un contrato de 200 páginas, página por página | ≈ 22 unidades | ≈ 28 unidades |
| Informe en PDF a partir de un expediente, con código y unos quince pasos | ≈ 35 unidades | ≈ 42 unidades |
| Expediente de 450 páginas leído entero en una sola pasada | ≈ 95 unidades | ≈ 120 unidades |

Son estimaciones: una respuesta más larga, más fuentes seleccionadas o más pasos del agente suben el número. Como referencia, el plan Elite incluye 400 unidades al mes.

> **El salto de las 300 páginas**
>
> Con Grok 4.7, un solo paso que lleve más de unas 300 páginas de contexto gasta cerca del doble de unidades por página. El Asistente rara vez llega ahí porque lee por páginas y guarda notas, pero si pides "léete el expediente entero de una vez" sobre 450 páginas, cuenta con unas 95 unidades frente a las 20 de una revisión por partes. Para expedientes grandes, pide la revisión y deja que el agente elija qué leer.

## ¿Qué pasa si el Box es más grande que el contexto de Grok 4.7?

Nada se queda fuera. El Asistente no carga el Box entero en el modelo: busca en las fuentes seleccionadas y lee las páginas que responden la pregunta, cada una con su archivo y su página. Funciona igual con un Box de 200 páginas o de 20.000. El modelo decide cómo razonar sobre lo que lee; el tamaño del Box no decide qué modelo puedes elegir.

## ¿Para qué tareas conviene elegirlo?

Grok 4.7 encaja con las tareas de muchos pasos: revisar un expediente de decenas de documentos, [comparar versiones de un contrato](/es/blog/comparar-dos-versiones-de-un-contrato-con-ia), cruzar un pliego con sus adendas o [pedir un informe que salga como PDF](/es/blog/pedir-un-informe-a-la-ia-y-recibir-pdf-o-powerpoint). En el Harvey Legal Agent Benchmark, [que xAI reporta](https://x.ai/news/grok-4-7), Grok 4.7 obtiene 19,6 % frente a 15,8 % de Grok 4.6, 6,7 % de Claude Fable 5.1 y 2,5 % de GPT-5.6 Sol. Es una cifra baja en términos absolutos para todos los modelos. Un dictamen generado con Grok 4.7 se revisa igual que uno generado con cualquier otro modelo.

| Tarea en el Asistente | ¿Grok 4.7? | Alternativa |
|---|---|---|
| Pregunta puntual con cita | No hace falta; un modelo por defecto responde igual con menos unidades | Predeterminado o Flash |
| Revisión de un expediente completo | Sí, tareas largas con muchos pasos es su punto fuerte | Claude o GPT si el presupuesto lo permite |
| Análisis de datos con el intérprete de código | Sí, mejora en coding frente a 4.6 | Claude Fable 5.1 [lidera](https://artificialanalysis.ai/articles/benchmarking-grok-4-7) en agentes de coding |
| Preguntas sobre capturas o diagramas | Sí, acepta imágenes | Cualquier otro modelo con la etiqueta Imágenes |
| Lectura de más de 300 páginas en una sola pasada | Con cuidado, el gasto de unidades casi se dobla | [MiMo V2.6 de Xiaomi](/es/blog/xiaomi-mimo-v2-6-pro-vs-flash-benchmarks-precio-y-cual-usar-en-brainbox), 1M de contexto sin salto de consumo |

El modelo se puede probar en la misma conversación: cambia de Grok 4.6 a 4.7 en el selector, repite la pregunta y compara. Las citas siguen apuntando a la página, así que la [verificación de la respuesta](/es/blog/como-verificar-respuestas-de-ia-documental) es la misma con los dos.

## ¿En qué se diferencia de usar Grok en la app de xAI?

La app de Grok, Cursor y Grok Build dan acceso al mismo modelo, [según xAI](https://x.ai/news/grok-4-7). Lo que cambia es lo que hay alrededor.

| | App de Grok | BrainBox con Grok 4.7 |
|---|---|---|
| Fuentes | Lo que pegues o adjuntes en esa conversación | Los documentos del Box, indexados: PDF, Office, audio transcrito, imágenes |
| Citas | No apunta a la página de tus archivos | Página, fragmento y contexto expandido por cada afirmación |
| Cambiar de modelo | Solo modelos de xAI | Grok 4.7 al lado de Claude, GPT, Gemini y modelos abiertos, en el mismo chat |
| Equipo | Cuenta individual | Box compartido con roles; el administrador decide qué modelos se permiten |
| Consumo | Suscripción fija | Unidades de inteligencia por uso, según el modelo que elijas |

Para equipos legales, la política de modelos del espacio de trabajo permite habilitar Grok 4.7 para el equipo o bloquearlo, sin tocar cada cuenta. El resto del [espacio de trabajo documental](/es/blog/brainbox-2026-espacio-de-trabajo-documental) funciona igual con cualquier modelo.

Una tarea completa del índice de Artificial Analysis le tomó a Grok 4.7 [unos 7,1 minutos de media](https://artificialanalysis.ai/articles/benchmarking-grok-4-7); en BrainBox, una revisión larga puede tardar varios minutos y se ve avanzar paso a paso en el chat.

## Fuentes

- xAI, [Introducing Grok 4.7](https://x.ai/news/grok-4-7): anuncio del 21 de septiembre de 2026, tabla de benchmarks y disponibilidad.
- Artificial Analysis, [Benchmarking Grok 4.7](https://artificialanalysis.ai/articles/benchmarking-grok-4-7): Intelligence Index, Coding Agent Index, tokens por tarea, AA-Omniscience, contexto de 500K.
- Artificial Analysis, [leaderboard de modelos](https://artificialanalysis.ai/leaderboards/models): puntajes de Claude Fable 5.1, GPT-6 Astra y Grok 4.6.
- Artificial Analysis, [ficha de Grok 4.7](https://artificialanalysis.ai/models/grok-4-7): contexto y modalidades.

## FAQ

### ¿Qué cambia entre Grok 4.6 y Grok 4.7?

Según xAI, Grok 4.7 usa un modelo base más grande, un entrenamiento por refuerzo más largo con tareas que toman horas y verifica mejor su propia salida. En DeepSWE v1.1 pasa de 65,2 % a 71,0 %; en el Harvey Legal Agent Benchmark, de 15,8 % a 19,6 %. En el Intelligence Index de Artificial Analysis sube de 44 a 46. La ventana de contexto se mantiene en 500K tokens. En BrainBox, además, la misma tarea gasta entre un 10 % y un 20 % menos unidades de inteligencia que con Grok 4.6.

### ¿Cuánto cuesta usar Grok 4.7 en BrainBox?

El consumo se mide en unidades de inteligencia, no en tokens. Estimaciones en el plan estándar: una pregunta puntual con citas, unas 3 unidades; un análisis de datos con el intérprete de código, unas 8; una revisión de expediente con búsquedas y lecturas, unas 20; un informe en PDF a partir de un expediente, unas 35. En cada caso gasta entre un 10 % y un 20 % menos que Grok 4.6.

### ¿En qué planes está disponible?

Grok 4.7 está en la categoría Pro del selector. En cuentas personales aparece para los planes de pago; en un espacio de trabajo depende de la política de modelos que haya definido el administrador. Si no lo ves, revisa la política de IA del workspace.

### ¿Grok 4.7 lee imágenes?

Sí. En BrainBox está marcado con soporte de imágenes, así que puedes adjuntar una captura o un diagrama a la pregunta, o preguntar sobre las imágenes indexadas del Box.

### ¿Es mejor que Claude o GPT para mis documentos?

En el Intelligence Index de Artificial Analysis, Claude Fable 5.1 y GPT-6 Astra puntúan 53 frente a 46 de Grok 4.7. En agentes de coding también va detrás. A favor tiene el consumo: una revisión larga de un expediente gasta bastantes menos unidades de inteligencia que con esos modelos. En la pregunta puntual con cita, ni la diferencia de calidad ni la de consumo se perciben.

### ¿Qué pasa si mi Box es más grande que el contexto de Grok 4.7?

Nada se queda fuera. El Asistente no carga el Box entero de una vez: busca en las fuentes que elegiste y lee las páginas que responden la pregunta, cada una con su cita. El tamaño del Box no limita qué modelo puedes usar.

### ¿Sigue disponible Grok 4.6?

Sí. Grok 4.6 sigue en el selector y gasta algo más de unidades de inteligencia por tarea. Las conversaciones que ya usaban 4.6 no cambian de modelo por sí solas.
