Ir al contenido principal
  • modelos
  • Anthropic
  • producto

Claude Opus 5.5 en BrainBox: benchmarks, precio y cuándo elegirlo

Anthropic publicó Claude Opus 5.5 el 22 de septiembre de 2026 y ya se puede elegir en el Asistente de BrainBox: es el número uno del Intelligence Index de Artificial Analysis, con benchmarks, unidades de inteligencia por tarea y cuándo conviene.

BrainBox Team9 min de lectura
Ver en Markdown

Claude Opus 5.5 se puede elegir en el Asistente de BrainBox desde el 22 de septiembre de 2026, el mismo día en que Anthropic lo publicó. Aparece en la categoría Pro del selector con un millón de tokens de contexto, 128.000 tokens de salida máxima y entrada de imágenes. Es el sucesor de Claude Opus 5, que sigue disponible, y en BrainBox gasta menos unidades de inteligencia en la misma tarea.

¿Qué es Claude Opus 5.5 y qué mejora frente a Opus 5?

Es el modelo de frontera de Anthropic para agentes de larga duración, coding y trabajo de conocimiento. La documentación de Anthropic recomienda empezar por Opus 5.5 para la mayoría de las cargas de trabajo y dejar Fable 5.1 para razonamiento exigente. Trae pensamiento adaptativo siempre activo, un millón de tokens de contexto y 128.000 tokens de salida máxima.

Anthropic afirma que genera texto "más de un 30 % más rápido que Opus 5" y que usa menos tokens y menos llamadas para terminar el mismo trabajo. En los benchmarks que publica, la mejora frente a Opus 5 es grande en tareas de agente:

Benchmark, según AnthropicOpus 5Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.052,3 %66,4 %55,8 %57,9 %
FrontierCode v1.148,0 %54,4 %50,3 %53,3 %
CursorBench 4.046,6 %57,8 %51,8 %
AutomationBench26,9 %40,0 %31,4 %41,4 %
Humanity's Last Exam63,6 %67,7 %65,6 %57,2 %
OSWorld 2.074,0 %81,8 %80,7 %
Terminal-Bench-Science 0.129,0 %58,7 %52,6 %64,6 %

El mejor puntaje de cada fila va en negrita.

Los valores de la competencia los reporta Anthropic, no cada laboratorio, y la propia tabla marca errores estándar de entre 1,6 y 5 puntos, así que las diferencias pequeñas no significan mucho. Anthropic también reconoce que GPT-6 Astra queda por delante en AutomationBench y en Terminal-Bench-Science.

La medición independiente va en la misma dirección. Artificial Analysis le da 58 puntos en su Intelligence Index en esfuerzo máximo, "el puntaje más alto que hemos medido por varios puntos", cinco por encima de GPT-6 Astra y Claude Fable 5.1, que empatan en 53, y siete sobre Opus 5. Lidera seis de las diez evaluaciones del índice, entre ellas Humanity's Last Exam con 61,4 % y SciCode con 66,9 %, y queda detrás en tres: CritPt, AA-LCR y GDP.pdf.

¿Cómo trabaja el Asistente de BrainBox con Opus 5.5?

El Asistente de BrainBox es un agente. Tú eliges qué Boxes y archivos puede usar y qué modelo razona; el agente decide los pasos. En el chat se ve cada uno: "Listando fuentes", "Buscando en documentos", "Leyendo documento" con las páginas que abrió, "Guardando nota" cuando aparta algo para más adelante, y al final la respuesta con citas a la página.

Opus 5.5 está entrenado para exactamente ese patrón. Anthropic lo presenta para "trabajos largos y dispersos como migraciones y auditorías de un código entero" y para análisis financiero y trabajo de conocimiento. En una revisión de expediente eso se nota en que encadena más pasos sin perder el hilo de lo que ya leyó.

  1. Abre el Asistente y elige las fuentes

    En la barra lateral marcas los Boxes y archivos que el agente puede usar. También puedes apuntar a un archivo con @ dentro del mensaje.

  2. Pulsa el selector de modelo

    Está en la barra inferior del chat. Se abre una lista con buscador.

  3. Escribe 'Opus'

    Aparecen Claude Opus 5.5 y las versiones anteriores, con su contexto y las etiquetas Pro e Imágenes.

  4. Elige Claude Opus 5.5

    Si no lo ves, tu plan personal no incluye la categoría Pro o la política del espacio de trabajo no lo permite.

  5. Pide la tarea

    Las citas a la página, las herramientas y los pasos visibles del agente funcionan igual con cualquier modelo.

Seleccionar modelo

Seleccionar modelo

Opus
  • Logo de Anthropic
    Claude Opus 5.5Anthropic

    El Opus más reciente para agentes de larga duración, coding y trabajo de conocimiento

    1M contextoProImágenes
  • Logo de Anthropic
    Claude Opus 5Anthropic

    Opus anterior para agentes de larga duración y trabajo profesional

    1M contextoProImágenes
Simulación del selector de modelos del Asistente de BrainBox con Claude Opus 5.5 elegido.

BrainBox es un espacio de trabajo de IA para documentos que responde con citas a la página exacta. El modelo cambia la forma de razonar; la traza a la fuente no cambia.

¿Cuántas unidades de inteligencia gasta Opus 5.5 por tarea?

En BrainBox el consumo no se mide en tokens sino en unidades de inteligencia, y cada tarea gasta un número distinto según cuántas búsquedas y lecturas hace el agente, cuánto razona el modelo y cuánto escribe. Estimaciones para el plan estándar, con GPT-6 Sol al lado como referencia:

Tarea en el AsistenteOpus 5.5Opus 5GPT-6 Sol
Pregunta puntual con citas, una o dos búsquedas≈ 7 unidades≈ 8 unidades≈ 4 unidades
Análisis de un Excel con el intérprete de código≈ 22 unidades≈ 27 unidades≈ 11 unidades
Revisión de un expediente con unas diez búsquedas y lecturas≈ 52 unidades≈ 65 unidades≈ 27 unidades
Lectura completa de un contrato de 200 páginas, página por página≈ 57 unidades≈ 71 unidades≈ 29 unidades
Informe en PDF a partir de un expediente, con código y unos quince pasos≈ 95 unidades≈ 118 unidades≈ 49 unidades

Son estimaciones: una respuesta más larga, más fuentes o más pasos del agente suben el número, y Opus 5.5 tiende a respuestas largas. Como referencia, el plan Elite incluye 400 unidades al mes, así que una revisión de expediente al día con Opus 5.5 consume buena parte del mes.

¿Qué pasa si el Box es más grande que el contexto?

Nada se queda fuera. El Asistente no carga el Box entero en el modelo: busca en las fuentes seleccionadas y lee las páginas que responden la pregunta, cada una con su archivo y su página. Funciona igual con un Box de 200 páginas o de 20.000. El modelo decide cómo razonar sobre lo que lee; el tamaño del Box no decide qué modelo puedes elegir.

¿Para qué tareas conviene elegirlo?

Opus 5.5 es el modelo más capaz del selector y el que más gasta. Lo que hay que decidir en cada tarea es si esa diferencia de consumo se justifica.

Tarea en el Asistente¿Opus 5.5?Alternativa
Pregunta puntual con citaNo hace falta; un modelo por defecto responde igual con muchas menos unidadesGPT-6 Luna
Dictamen o revisión donde equivocarse sale caroSí, es el puntaje más alto del índice independienteGPT-6 Sol si el presupuesto manda
Comparar versiones de un contrato con muchas adendasSí, encadena más pasos sin perder el hiloGPT-6 Sol
Informe en PDF o análisis de datos con el intérprete de códigoSí, si el informe se va a defender ante un comitéGPT-6 Sol para borradores
Resúmenes por lotes o clasificación de documentosNo, el gasto no se justificaGPT-6 Luna
Preguntas sobre capturas o diagramasSí, acepta imágenesCualquier otro modelo con la etiqueta Imágenes

Un equipo legal puede dejar Opus 5.5 habilitado solo para los dictámenes finales y trabajar el día a día con un modelo por defecto, desde la política de modelos del espacio de trabajo. Las citas siguen apuntando a la página con cualquiera, así que la verificación de la respuesta es la misma.

¿Y la seguridad?

Anthropic reporta que en su evaluación de contención, Opus 5.5 "intentó sortear los límites cerca de un 85 % menos que Opus 5", que es el modelo con mejor resultado en su auditoría de alineación hasta la fecha y que iguala o supera a Opus 5 en resistencia a inyección de prompts en todos los escenarios que probaron. Son evaluaciones de la propia empresa y miden situaciones difíciles a propósito, no el uso típico. En el Asistente, la protección práctica sigue siendo la misma: el agente pide aprobación antes de acciones sensibles sobre tus archivos y cada afirmación lleva su cita.

Anthropic cuenta que Opus 5.5 completó una migración de 680.000 líneas de código en menos de un día; en el Asistente, una revisión larga puede tardar varios minutos y se ve avanzar paso a paso en el chat.

Fuentes

  • Anthropic, Introducing Claude Opus 5.5: anuncio del 22 de septiembre de 2026, tabla de benchmarks, velocidad, eficiencia y evaluaciones de seguridad.
  • Anthropic, resumen de modelos: contexto de un millón de tokens, salida máxima, pensamiento adaptativo y recomendación de uso.
  • Artificial Analysis, Claude Opus 5.5 takes the top spot: Intelligence Index, evaluaciones que lidera, tokens de salida por tarea y comparación con GPT-6 Astra y Fable 5.1.
  • Artificial Analysis, ficha de Claude Opus 5.5: puntaje por nivel de esfuerzo, contexto, modalidades y verbosidad.
  • Artificial Analysis, leaderboard de modelos: puntajes de GPT-6 Astra, GPT-6 Sol, Claude Fable 5.1 y los niveles de esfuerzo de Opus 5.5.

Preguntas frecuentes

¿Qué cambia entre Claude Opus 5 y Opus 5.5?
Según Anthropic, Opus 5.5 rinde a la altura de Claude Fable 5.1 en la mayoría de las tareas, genera texto más de un 30 % más rápido que Opus 5 y usa menos tokens y menos llamadas para terminar el mismo trabajo. En Terminal-Bench 4.0 pasa de 52,3 % a 66,4 %, y en Humanity's Last Exam de 63,6 % a 67,7 %. En el Intelligence Index de Artificial Analysis sube de 51 a 58. En BrainBox, la misma tarea gasta cerca de un 20 % menos unidades de inteligencia.
¿Cuánto cuesta usar Opus 5.5 en BrainBox?
El consumo se mide en unidades de inteligencia, no en tokens. Estimaciones en el plan estándar: una pregunta puntual con citas, unas 7 unidades; un análisis de datos con el intérprete de código, unas 22; una revisión de expediente con búsquedas y lecturas, unas 52; un informe en PDF a partir de un expediente, unas 95. Es el nivel más alto del selector, y para la mayoría de las preguntas un modelo por defecto gasta mucho menos.
¿En qué planes está disponible?
Opus 5.5 está en la categoría Pro del selector. En cuentas personales aparece para los planes de pago; en un espacio de trabajo depende de la política de modelos que haya definido el administrador. Si no lo ves, revisa la política de IA del workspace.
¿Es mejor que GPT-6 para mis documentos?
En el Intelligence Index de Artificial Analysis, Opus 5.5 puntúa 58 frente a 53 de GPT-6 Astra y 48 de GPT-6 Sol. Lidera seis de las diez evaluaciones del índice. La contrapartida es el consumo: Artificial Analysis lo describe como muy verboso, y en BrainBox una revisión larga gasta cerca del doble de unidades que con GPT-6 Sol.
¿Qué pasa si mi Box es más grande que el contexto?
Nada se queda fuera. El Asistente no carga el Box entero de una vez: busca en las fuentes que elegiste y lee las páginas que responden la pregunta, cada una con su cita. El tamaño del Box no limita qué modelo puedes usar.
¿Sigue disponible Claude Opus 5?
Sí. Opus 5 sigue en el selector y gasta algo más de unidades de inteligencia por tarea que Opus 5.5. Las conversaciones que ya usaban Opus 5 no cambian de modelo por sí solas.

Escrito por

BrainBox Team

Inteligencia documental, por ExaByte Company

Construimos BrainBox — la plataforma que los equipos usan para preguntar sobre sus propios documentos y obtener respuestas con citas exactas de página.