- modelos
- Anthropic
- producto
Claude Opus 5.5 en BrainBox: benchmarks, precio y cuándo elegirlo
Anthropic publicó Claude Opus 5.5 el 22 de septiembre de 2026 y ya se puede elegir en el Asistente de BrainBox: es el número uno del Intelligence Index de Artificial Analysis, con benchmarks, unidades de inteligencia por tarea y cuándo conviene.
Claude Opus 5.5 se puede elegir en el Asistente de BrainBox desde el 22 de septiembre de 2026, el mismo día en que Anthropic lo publicó. Aparece en la categoría Pro del selector con un millón de tokens de contexto, 128.000 tokens de salida máxima y entrada de imágenes. Es el sucesor de Claude Opus 5, que sigue disponible, y en BrainBox gasta menos unidades de inteligencia en la misma tarea.
¿Qué es Claude Opus 5.5 y qué mejora frente a Opus 5?
Es el modelo de frontera de Anthropic para agentes de larga duración, coding y trabajo de conocimiento. La documentación de Anthropic recomienda empezar por Opus 5.5 para la mayoría de las cargas de trabajo y dejar Fable 5.1 para razonamiento exigente. Trae pensamiento adaptativo siempre activo, un millón de tokens de contexto y 128.000 tokens de salida máxima.
Anthropic afirma que genera texto "más de un 30 % más rápido que Opus 5" y que usa menos tokens y menos llamadas para terminar el mismo trabajo. En los benchmarks que publica, la mejora frente a Opus 5 es grande en tareas de agente:
| Benchmark, según Anthropic | Opus 5 | Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 52,3 % | 66,4 % | 55,8 % | 57,9 % |
| FrontierCode v1.1 | 48,0 % | 54,4 % | 50,3 % | 53,3 % |
| CursorBench 4.0 | 46,6 % | 57,8 % | 51,8 % | |
| AutomationBench | 26,9 % | 40,0 % | 31,4 % | 41,4 % |
| Humanity's Last Exam | 63,6 % | 67,7 % | 65,6 % | 57,2 % |
| OSWorld 2.0 | 74,0 % | 81,8 % | 80,7 % | |
| Terminal-Bench-Science 0.1 | 29,0 % | 58,7 % | 52,6 % | 64,6 % |
El mejor puntaje de cada fila va en negrita.
Los valores de la competencia los reporta Anthropic, no cada laboratorio, y la propia tabla marca errores estándar de entre 1,6 y 5 puntos, así que las diferencias pequeñas no significan mucho. Anthropic también reconoce que GPT-6 Astra queda por delante en AutomationBench y en Terminal-Bench-Science.
La medición independiente va en la misma dirección. Artificial Analysis le da 58 puntos en su Intelligence Index en esfuerzo máximo, "el puntaje más alto que hemos medido por varios puntos", cinco por encima de GPT-6 Astra y Claude Fable 5.1, que empatan en 53, y siete sobre Opus 5. Lidera seis de las diez evaluaciones del índice, entre ellas Humanity's Last Exam con 61,4 % y SciCode con 66,9 %, y queda detrás en tres: CritPt, AA-LCR y GDP.pdf.
¿Cómo trabaja el Asistente de BrainBox con Opus 5.5?
El Asistente de BrainBox es un agente. Tú eliges qué Boxes y archivos puede usar y qué modelo razona; el agente decide los pasos. En el chat se ve cada uno: "Listando fuentes", "Buscando en documentos", "Leyendo documento" con las páginas que abrió, "Guardando nota" cuando aparta algo para más adelante, y al final la respuesta con citas a la página.
Opus 5.5 está entrenado para exactamente ese patrón. Anthropic lo presenta para "trabajos largos y dispersos como migraciones y auditorías de un código entero" y para análisis financiero y trabajo de conocimiento. En una revisión de expediente eso se nota en que encadena más pasos sin perder el hilo de lo que ya leyó.
Abre el Asistente y elige las fuentes
En la barra lateral marcas los Boxes y archivos que el agente puede usar. También puedes apuntar a un archivo con @ dentro del mensaje.
Pulsa el selector de modelo
Está en la barra inferior del chat. Se abre una lista con buscador.
Escribe 'Opus'
Aparecen Claude Opus 5.5 y las versiones anteriores, con su contexto y las etiquetas Pro e Imágenes.
Elige Claude Opus 5.5
Si no lo ves, tu plan personal no incluye la categoría Pro o la política del espacio de trabajo no lo permite.
Pide la tarea
Las citas a la página, las herramientas y los pasos visibles del agente funcionan igual con cualquier modelo.
Seleccionar modelo
- Claude Opus 5.5Anthropic
El Opus más reciente para agentes de larga duración, coding y trabajo de conocimiento
1M contextoProImágenes - Claude Opus 5Anthropic
Opus anterior para agentes de larga duración y trabajo profesional
1M contextoProImágenes
BrainBox es un espacio de trabajo de IA para documentos que responde con citas a la página exacta. El modelo cambia la forma de razonar; la traza a la fuente no cambia.
¿Cuántas unidades de inteligencia gasta Opus 5.5 por tarea?
En BrainBox el consumo no se mide en tokens sino en unidades de inteligencia, y cada tarea gasta un número distinto según cuántas búsquedas y lecturas hace el agente, cuánto razona el modelo y cuánto escribe. Estimaciones para el plan estándar, con GPT-6 Sol al lado como referencia:
| Tarea en el Asistente | Opus 5.5 | Opus 5 | GPT-6 Sol |
|---|---|---|---|
| Pregunta puntual con citas, una o dos búsquedas | ≈ 7 unidades | ≈ 8 unidades | ≈ 4 unidades |
| Análisis de un Excel con el intérprete de código | ≈ 22 unidades | ≈ 27 unidades | ≈ 11 unidades |
| Revisión de un expediente con unas diez búsquedas y lecturas | ≈ 52 unidades | ≈ 65 unidades | ≈ 27 unidades |
| Lectura completa de un contrato de 200 páginas, página por página | ≈ 57 unidades | ≈ 71 unidades | ≈ 29 unidades |
| Informe en PDF a partir de un expediente, con código y unos quince pasos | ≈ 95 unidades | ≈ 118 unidades | ≈ 49 unidades |
Son estimaciones: una respuesta más larga, más fuentes o más pasos del agente suben el número, y Opus 5.5 tiende a respuestas largas. Como referencia, el plan Elite incluye 400 unidades al mes, así que una revisión de expediente al día con Opus 5.5 consume buena parte del mes.
¿Qué pasa si el Box es más grande que el contexto?
Nada se queda fuera. El Asistente no carga el Box entero en el modelo: busca en las fuentes seleccionadas y lee las páginas que responden la pregunta, cada una con su archivo y su página. Funciona igual con un Box de 200 páginas o de 20.000. El modelo decide cómo razonar sobre lo que lee; el tamaño del Box no decide qué modelo puedes elegir.
¿Para qué tareas conviene elegirlo?
Opus 5.5 es el modelo más capaz del selector y el que más gasta. Lo que hay que decidir en cada tarea es si esa diferencia de consumo se justifica.
| Tarea en el Asistente | ¿Opus 5.5? | Alternativa |
|---|---|---|
| Pregunta puntual con cita | No hace falta; un modelo por defecto responde igual con muchas menos unidades | GPT-6 Luna |
| Dictamen o revisión donde equivocarse sale caro | Sí, es el puntaje más alto del índice independiente | GPT-6 Sol si el presupuesto manda |
| Comparar versiones de un contrato con muchas adendas | Sí, encadena más pasos sin perder el hilo | GPT-6 Sol |
| Informe en PDF o análisis de datos con el intérprete de código | Sí, si el informe se va a defender ante un comité | GPT-6 Sol para borradores |
| Resúmenes por lotes o clasificación de documentos | No, el gasto no se justifica | GPT-6 Luna |
| Preguntas sobre capturas o diagramas | Sí, acepta imágenes | Cualquier otro modelo con la etiqueta Imágenes |
Un equipo legal puede dejar Opus 5.5 habilitado solo para los dictámenes finales y trabajar el día a día con un modelo por defecto, desde la política de modelos del espacio de trabajo. Las citas siguen apuntando a la página con cualquiera, así que la verificación de la respuesta es la misma.
¿Y la seguridad?
Anthropic reporta que en su evaluación de contención, Opus 5.5 "intentó sortear los límites cerca de un 85 % menos que Opus 5", que es el modelo con mejor resultado en su auditoría de alineación hasta la fecha y que iguala o supera a Opus 5 en resistencia a inyección de prompts en todos los escenarios que probaron. Son evaluaciones de la propia empresa y miden situaciones difíciles a propósito, no el uso típico. En el Asistente, la protección práctica sigue siendo la misma: el agente pide aprobación antes de acciones sensibles sobre tus archivos y cada afirmación lleva su cita.
Anthropic cuenta que Opus 5.5 completó una migración de 680.000 líneas de código en menos de un día; en el Asistente, una revisión larga puede tardar varios minutos y se ve avanzar paso a paso en el chat.
Fuentes
- Anthropic, Introducing Claude Opus 5.5: anuncio del 22 de septiembre de 2026, tabla de benchmarks, velocidad, eficiencia y evaluaciones de seguridad.
- Anthropic, resumen de modelos: contexto de un millón de tokens, salida máxima, pensamiento adaptativo y recomendación de uso.
- Artificial Analysis, Claude Opus 5.5 takes the top spot: Intelligence Index, evaluaciones que lidera, tokens de salida por tarea y comparación con GPT-6 Astra y Fable 5.1.
- Artificial Analysis, ficha de Claude Opus 5.5: puntaje por nivel de esfuerzo, contexto, modalidades y verbosidad.
- Artificial Analysis, leaderboard de modelos: puntajes de GPT-6 Astra, GPT-6 Sol, Claude Fable 5.1 y los niveles de esfuerzo de Opus 5.5.
Preguntas frecuentes
- ¿Qué cambia entre Claude Opus 5 y Opus 5.5?
- Según Anthropic, Opus 5.5 rinde a la altura de Claude Fable 5.1 en la mayoría de las tareas, genera texto más de un 30 % más rápido que Opus 5 y usa menos tokens y menos llamadas para terminar el mismo trabajo. En Terminal-Bench 4.0 pasa de 52,3 % a 66,4 %, y en Humanity's Last Exam de 63,6 % a 67,7 %. En el Intelligence Index de Artificial Analysis sube de 51 a 58. En BrainBox, la misma tarea gasta cerca de un 20 % menos unidades de inteligencia.
- ¿Cuánto cuesta usar Opus 5.5 en BrainBox?
- El consumo se mide en unidades de inteligencia, no en tokens. Estimaciones en el plan estándar: una pregunta puntual con citas, unas 7 unidades; un análisis de datos con el intérprete de código, unas 22; una revisión de expediente con búsquedas y lecturas, unas 52; un informe en PDF a partir de un expediente, unas 95. Es el nivel más alto del selector, y para la mayoría de las preguntas un modelo por defecto gasta mucho menos.
- ¿En qué planes está disponible?
- Opus 5.5 está en la categoría Pro del selector. En cuentas personales aparece para los planes de pago; en un espacio de trabajo depende de la política de modelos que haya definido el administrador. Si no lo ves, revisa la política de IA del workspace.
- ¿Es mejor que GPT-6 para mis documentos?
- En el Intelligence Index de Artificial Analysis, Opus 5.5 puntúa 58 frente a 53 de GPT-6 Astra y 48 de GPT-6 Sol. Lidera seis de las diez evaluaciones del índice. La contrapartida es el consumo: Artificial Analysis lo describe como muy verboso, y en BrainBox una revisión larga gasta cerca del doble de unidades que con GPT-6 Sol.
- ¿Qué pasa si mi Box es más grande que el contexto?
- Nada se queda fuera. El Asistente no carga el Box entero de una vez: busca en las fuentes que elegiste y lee las páginas que responden la pregunta, cada una con su cita. El tamaño del Box no limita qué modelo puedes usar.
- ¿Sigue disponible Claude Opus 5?
- Sí. Opus 5 sigue en el selector y gasta algo más de unidades de inteligencia por tarea que Opus 5.5. Las conversaciones que ya usaban Opus 5 no cambian de modelo por sí solas.
Escrito por
BrainBox Team
Inteligencia documental, por ExaByte Company
Construimos BrainBox — la plataforma que los equipos usan para preguntar sobre sus propios documentos y obtener respuestas con citas exactas de página.
Sigue leyendo
GPT-6 Sol vs Luna: benchmarks, precio y cuál usar en BrainBox
OpenAI publicó GPT-6 Sol y GPT-6 Luna el 22 de septiembre de 2026 y los dos ya están en el Asistente de BrainBox: benchmarks, puntaje en Artificial Analysis, unidades de inteligencia por tarea y cuál elegir.
Grok 4.7 en BrainBox: benchmarks, precio y cuándo elegirlo
Grok 4.7 de xAI ya se puede elegir en el Asistente de BrainBox: benchmarks frente a Grok 4.6, puntaje en Artificial Analysis, unidades de inteligencia que gasta por tarea y para qué trabajo documental conviene.
Xiaomi MiMo V2.6 Pro vs Flash: benchmarks, precio y cuál usar en BrainBox
MiMo V2.6 Pro y Flash de Xiaomi, pesos abiertos MIT y 1M de contexto, ya están en el Asistente de BrainBox: benchmarks, puntaje en Artificial Analysis, unidades de inteligencia por tarea y cuál elegir.