Claude Opus 4.8: referencia histórica del modelo
1M tokens · Text / Vision / Code · Prompt cache
Okou ya no ejecuta Claude Opus 4.8. Esta página se mantiene como referencia de sus especificaciones, precios y benchmarks. Para el mismo tipo de trabajo, usa Claude Opus 5.5.
Ver Claude Opus 5.5Claude Opus 4.8 es el lanzamiento insignia de Anthropic del 28 de mayo de 2026, una actualización directa de Opus 4.7 al mismo precio de lista del proveedor de $5/$25. Registra las puntuaciones más altas que Anthropic haya lanzado en SWE-bench Pro (69,2%), OSWorld-Verified (83,4%), MCP-Atlas (82,2%) y Humanity's Last Exam (57,9% con herramientas), y es el primer modelo en superar el 10% en el estándar all-pass de agente legal.
Los dos cambios estructurales que vale la pena conocer son los flujos de trabajo dinámicos (planificar un trabajo y desplegarlo en cientos de subagentes paralelos en una sola sesión) y un recorte de precio del modo rápido a 2,5× de velocidad por $10/$50 por 1M tokens — tres veces más barato que el modo rápido de modelos Claude anteriores. Los niveles de esfuerzo se expanden a high (predeterminado), extra y max. Anthropic mismo presenta el lanzamiento como una "mejora modesta pero tangible" en lugar de un salto.
¿Qué es Claude Opus 4.8?
28 de mayo de 2026
Las lecturas independientes (LLM Stats, VentureBeat, Vellum) corroboran el orden relativo frente a 4.7 y los competidores: 4.8 gana en cada celda del conjunto de comparación publicado por Anthropic excepto Terminal-Bench 2.1, donde GPT-5.5 sigue liderando (78,2% vs 74,6% de 4.8). El salto de 4.7 a 4.8 en SWE-bench Pro es de +4,9 puntos; en USAMO 2026 es de +27,4; en el nuevo F1 de contexto largo GraphWalks de 1M tokens es de +27,8. Trata las puntuaciones absolutas como direccionales — SWE-bench Verified se está acercando a la saturación en todos los modelos frontera.
Qué destaca de Claude Opus 4.8
Características principales de arquitectura y capacidades.
Opus 4.8 mantiene la ventana de contexto de 1M tokens y la salida máxima de 128K de Opus 4.7, facturada a precio de entrada estándar en toda la ventana. El control de esfuerzo se expande a tres niveles: high (el nuevo predeterminado), extra (xhigh dentro de Claude Code) y max. La API de Messages ahora acepta entradas de sistema a mitad de conversación sin romper el caché de prompts. Los flujos de trabajo dinámicos permiten a Claude planificar y despachar cientos de subagentes paralelos en una sola sesión. El modo rápido funciona a ~2,5× la velocidad estándar por $10 / $50 por 1M tokens. Las entradas multimodales a través de texto, visión y código no cambian.
Especificaciones rápidas
Benchmarks de Claude Opus 4.8
Puntuaciones reportadas por el proveedor de la system card de Opus 4.8 de Anthropic, con comparaciones contra Opus 4.7, GPT-5.5 y Gemini 3.1 Pro a esfuerzo máximo y promedios de 5 intentos. 4.8 lidera en seis de las siete celdas que Anthropic publica; GPT-5.5 conserva el liderazgo en Terminal-Bench 2.1. SWE-bench Verified se está acercando a la saturación en todos los modelos frontera — el conjunto más difícil SWE-bench Pro es la señal más duradera.
Precios de Claude Opus 4.8
Precios históricos del proveedor por millón de tokens. Son datos de referencia, no cargos actuales de Okou.
Cómo se comporta Claude Opus 4.8 en la práctica
Comportamiento observado en ejecuciones de agentes en producción.
Ediciones de código al primer intento
Anthropic reporta que Opus 4.8 tiene alrededor de cuatro veces menos probabilidades que 4.7 de pasar por alto fallos al revisar código, y el salto de +4,9 puntos en SWE-bench Pro (69,2% vs 64,3%) respalda eso en el conjunto de codificación más difícil y menos saturado. Elige 4.8 para parches que deben aplicarse limpiamente en muchos archivos.
Recuperación de contexto largo
GraphWalks F1 a 1M tokens salta de 40,3% a 68,1% — la mayor ganancia en un solo benchmark del lanzamiento. La ventana de 1M tokens ahora es realmente utilizable en el extremo superior de su rango, no solo nominalmente.
Honestidad y exceso de confianza
Anthropic reporta una reducción de más de diez veces en el exceso de confianza frente a 4.7, 0% en reportar acríticamente resultados defectuosos (un primero para la familia Claude) y una tasa del 3,7% de no plantear eventos importantes al usuario. La incidencia de desalineación es ~1,9, prácticamente empatada con el Mythos Preview mejor alineado de Anthropic.
Velocidad y modo rápido
La velocidad estándar es comparable a Opus 4.7. El cambio de precio es el titular: el modo rápido a 2,5× de velocidad cuesta $10 / $50 por 1M tokens, tres veces más barato que el modo rápido de modelos Claude anteriores. Vale la pena usarlo para pasos de orquestación donde importa la latencia de reloj de pared.
Advertencia sobre inyección de prompts
La system card de Anthropic nota que 4.8 es algo menos robusto a la inyección de prompts agéntica que 4.7 — el red-teaming de Gray Swan muestra una tasa de éxito de ataque de ~9,6% frente al 6,0% en 4.7. Los equipos que ejecutan 4.8 en pipelines que manejan entradas no confiables deberían revisar su enfoque de sandboxing.
Mejores tareas para Claude Opus 4.8
La migración a escala de código base que solía necesitar un sprint
Pásale a Opus 4.8 una migración que toca unos cientos de archivos — cambio de ORM, salto de versión de framework, corrección de seguridad en un monorepo — y deja que los flujos de trabajo dinámicos desplieguen el trabajo a subagentes paralelos dentro de una sola sesión. El salto de +4,9 puntos en SWE-bench Pro y la reducción cuádruple de fallos pasados por alto en la revisión de código son lo que rinde frutos en este tipo de ejecución.
La ejecución de investigación de 1M tokens que realmente se sostiene
Suelta un borrador de contrato de 200 páginas, tres propuestas de competidores y las opiniones legales del último trimestre en la ventana, luego pide a Opus 4.8 que marque cada cláusula más restrictiva que el mercado. GraphWalks a 1M saltando de 40,3% a 68,1% es lo que hace que este tipo de síntesis entre documentos sea recientemente confiable.
El orquestador de agentes que no miente sobre su trabajo
Usa 4.8 como el planificador que divide una solicitud en diez pasos, despacha cada uno a subagentes más baratos y reporta el resultado. La tasa del 0% en reportar acríticamente resultados defectuosos, combinada con la caída de diez veces en exceso de confianza, es la razón por la que los equipos de producción recurren a 4.8 cuando el autoinforme del propio agente debe ser confiable.
El flujo sensible a la latencia que finalmente cuadra en modo rápido
El modo rápido a 2,5× de velocidad solía costar tres veces lo que cuesta ahora ($10/$50 por 1M frente al nivel anterior). Para copilotos interactivos, resumidores on-call o cualquier paso donde la latencia de reloj de pared domine la experiencia, el modo rápido de 4.8 ahora es la elección predeterminada en la familia Claude.
Cuándo evitar Claude Opus 4.8
Evita Opus 4.8 en trabajo rutinario de alto volumen donde Sonnet 4.6 alcanza la misma calidad a una fracción del costo, en respuestas de chat sensibles a la latencia donde Kimi K2.7 Code es mucho más rápido, en codificación agéntica de terminal donde GPT-5.5 sigue liderando Terminal-Bench 2.1 (78,2% vs 74,6% de 4.8), y en pipelines que ingieren entradas no confiables sin sandboxing — la robustez de 4.8 a la inyección de prompts es ligeramente más débil que la de 4.7.
Claude Opus 4.8 vs otros modelos
Claude Opus 4.8 vs GPT-5.5
Opus 4.8 lidera en seis de las siete celdas del conjunto de comparación de Anthropic, con las mayores brechas en SWE-bench Pro (69,2% vs 58,6%) y OSWorld-Verified (83,4% vs 78,7%). GPT-5.5 conserva el liderazgo en Terminal-Bench 2.1 (78,2% vs 74,6%). Elige 4.8 para codificación entre archivos y agentes de uso de computadora; elige GPT-5.5 específicamente cuando domine el trabajo en terminal.
Claude Opus 4.8 vs Gemini 3.1 Pro
Opus 4.8 lidera por amplios márgenes en SWE-bench Pro (+15,0) y OSWorld-Verified (+7,2). Los dos modelos se mantienen dentro del ruido en benchmarks científicos saturados como GPQA Diamond. Predetermina 4.8 para trabajo agéntico; considera Gemini específicamente cuando necesites la historia de integración de herramientas de Google.
Preguntas frecuentes
¿Cómo se compara el precio de Opus 4.8 con 4.7?
El precio regular es idéntico: $5 por 1M tokens de entrada, $25 por 1M tokens de salida, $0,50 por 1M de entrada cacheada. El cambio es el modo rápido, ahora $10 / $50 por 1M tokens a 2,5× de velocidad — tres veces más barato que el modo rápido de modelos Claude anteriores.
¿Qué son los flujos de trabajo dinámicos?
Una nueva capacidad que permite a Opus 4.8 planificar una tarea y luego ejecutar cientos de subagentes paralelos dentro de una sola sesión. Anthropic posiciona esto como el camino hacia migraciones a escala de código base de cientos de miles de líneas de código en una sola ejecución de agente.
¿Qué niveles de esfuerzo soporta Opus 4.8?
Tres niveles: high (el nuevo predeterminado), extra (xhigh en Claude Code) y max. Los ajustes más altos gastan más tokens en razonamiento antes de producir una respuesta; los ajustes más bajos favorecen la velocidad y la eficiencia del límite de tasa.
¿Opus 4.8 soporta caché de prompts?
Sí. La entrada cacheada se factura a $0,50 por 1M tokens, un descuento de 10× sobre la porción cacheada. La API de Messages ahora también acepta entradas de sistema a mitad de conversación sin romper el caché.
Alternativas
Disponibilidad de Claude Opus 4.8 en Okou
Claude Opus 4.8 ya no se ofrece en Okou. Consulta Claude Opus 5.5 como alternativa compatible. Esta página conserva información histórica del modelo, no precios actuales de Okou.

