← Todos os modelos

Claude Opus 4.8: referência histórica do modelo

1M tokens · Text / Vision / Code · Prompt cache

A Okou não executa mais o Claude Opus 4.8. Esta página é mantida como referência de especificações, preços e benchmarks. Para o mesmo tipo de trabalho, use o Claude Opus 5.5.

Ver Claude Opus 5.5

O Claude Opus 4.8 é o lançamento de ponta da Anthropic em 28 de maio de 2026, uma atualização direta do Opus 4.7 pelo mesmo preço de tabela do fornecedor de $5/$25. Ele registra as maiores pontuações de SWE-bench Pro (69,2%), OSWorld-Verified (83,4%), MCP-Atlas (82,2%) e Humanity's Last Exam (57,9% com ferramentas) que a Anthropic já entregou, e é o primeiro modelo a ultrapassar 10% no padrão de aprovação total do agente jurídico.

As duas mudanças estruturais que vale conhecer são os fluxos de trabalho dinâmicos (planejar uma tarefa e distribuí-la entre centenas de subagentes em paralelo em uma única sessão) e um corte no preço do modo rápido para 2,5× de velocidade a $10/$50 por 1M de tokens — três vezes mais barato do que o modo rápido nos modelos Claude anteriores. Os níveis de esforço se expandem para high (padrão), extra e max. A própria Anthropic descreve o lançamento como uma "melhoria modesta, mas tangível", em vez de um salto.

O que é o Claude Opus 4.8?

28 de maio de 2026

Análises independentes (LLM Stats, VentureBeat, Vellum) corroboram a ordenação relativa em relação ao 4.7 e aos concorrentes: o 4.8 vence em todas as células do conjunto de comparação publicado pela Anthropic, exceto no Terminal-Bench 2.1, onde o GPT-5.5 ainda lidera (78,2% vs. 74,6% do 4.8). O salto do 4.7 para o 4.8 no SWE-bench Pro é de +4,9 pontos; no USAMO 2026 é de +27,4; e no novo F1 de contexto longo de 1M de tokens do GraphWalks é de +27,8. Trate as pontuações absolutas como direcionais — o SWE-bench Verified está se aproximando da saturação em todos os modelos de ponta.

O que se destaca no Claude Opus 4.8

Principais recursos de arquitetura e capacidade.

O Opus 4.8 mantém a janela de contexto de 1M de tokens e a saída máxima de 128K do Opus 4.7, faturadas pelo preço de entrada padrão em toda a janela. O controle de esforço se expande para três níveis: high (o novo padrão), extra (xhigh dentro do Claude Code) e max. A Messages API agora aceita entradas de sistema no meio da conversa sem quebrar o cache de prompt. Os fluxos de trabalho dinâmicos permitem que o Claude planeje e despache centenas de subagentes em paralelo em uma única sessão. O modo rápido roda a aproximadamente 2,5× a velocidade padrão por $10 / $50 por 1M de tokens. As entradas multimodais em texto, visão e código permanecem inalteradas.

Especificações em resumo

FamíliaGeração Claude 4
ModalidadesTexto, visão, código
IdiomasInglês em primeiro lugar, multilíngue
Cache de promptSuportado (Anthropic)
Janela de contexto1M de tokens
Saída máximaAté 128K de tokens
Níveis de esforçoHigh (padrão) / Extra / Max
Preço de tabela do fornecedor$5 de entrada / $25 de saída por 1M (modo rápido $10/$50, 2,5× de velocidade)

Benchmarks do Claude Opus 4.8

Pontuações reportadas pelo fornecedor a partir do system card do Opus 4.8 da Anthropic, com comparações em relação ao Opus 4.7, GPT-5.5 e Gemini 3.1 Pro em esforço máximo e médias de 5 tentativas. O 4.8 lidera em seis das sete células que a Anthropic publica; o GPT-5.5 mantém a liderança no Terminal-Bench 2.1. O SWE-bench Verified está se aproximando da saturação em todos os modelos de ponta — o conjunto mais difícil do SWE-bench Pro é o sinal mais duradouro.

SWE-bench Verifiedreportado pelo fornecedor; acima dos 87,6% do Opus 4.7
88,6%
SWE-bench Prolidera o campo (4.7: 64,3%, GPT-5.5: 58,6%, Gemini 3.1 Pro: 54,2%)
69,2%
Terminal-Bench 2.1acima dos 66,1% do 4.7 no 2.0; o GPT-5.5 lidera aqui com 78,2%
74,6%
OSWorld-Verified (uso de computador)lidera o campo (4.7: 82,8%, GPT-5.5: 78,7%)
83,4%
Online-Mind2Web (agente de navegador)reportado pelo fornecedor
84%
MCP-Atlasacima dos 77,3% do Opus 4.7
82,2%
BrowseComp (agente único)acima dos 79,3% do Opus 4.7
84,3%
GraphWalks F1 de contexto longo (1M de tokens)acima dos 40,3% do Opus 4.7
68,1%
Humanity's Last Exam (com ferramentas)49,8% sem ferramentas; lidera o campo
57,9%
GPQA Diamondestável vs. 4.7 — saturado em todos os modelos de ponta
~93%
USAMO 2026 (matemática)acima dos 69,3% do Opus 4.7
96,7%
GDPval-AA (trabalho de conhecimento)lidera (4.7: 1753, GPT-5.5: 1769)
1890 Elo
Finance Agent v2lidera o campo
53,9%
Aprovação total do agente jurídicoprimeiro modelo a ultrapassar esse padrão
>10%

Preços do Claude Opus 4.8

Preços históricos do provedor por milhão de tokens. São valores de referência, não cobranças atuais da Okou.

Entrada$5.00
Saída$25.00
Leitura de cache$0.50
Escrita de cache$6.25

Como o Claude Opus 4.8 se comporta na prática

Comportamento observado em execuções de agentes em produção.

Edições de código de primeira tentativa

A Anthropic relata que o Opus 4.8 tem cerca de quatro vezes menos probabilidade do que o 4.7 de deixar passar falhas ao revisar código, e o salto de +4,9 pontos no SWE-bench Pro (69,2% vs. 64,3%) confirma isso no conjunto de programação mais difícil e menos saturado. Escolha o 4.8 para patches que precisam ser aplicados sem erros em vários arquivos.

Recuperação de contexto longo

O F1 do GraphWalks em 1M de tokens salta de 40,3% para 68,1% — o maior ganho em um único benchmark no lançamento. A janela de 1M de tokens agora é de fato utilizável na extremidade superior de sua faixa, não apenas nominal.

Honestidade e excesso de confiança

A Anthropic relata uma redução de mais de dez vezes no excesso de confiança em relação ao 4.7, 0% em relatar resultados falhos sem crítica (uma primazia para a família Claude) e uma taxa de 3,7% de falha em levar eventos importantes ao usuário. A incidência de desalinhamento é de aproximadamente 1,9, praticamente empatada com o Mythos Preview, o mais bem alinhado da Anthropic.

Velocidade e modo rápido

A velocidade padrão é comparável à do Opus 4.7. A mudança de preço é o destaque: o modo rápido a 2,5× de velocidade custa $10 / $50 por 1M de tokens, três vezes mais barato do que o modo rápido nos modelos Claude anteriores. Vale a pena usar em etapas de orquestração onde a latência de tempo real importa.

Ressalva sobre injeção de prompt

O system card da Anthropic observa que o 4.8 é um pouco menos robusto à injeção de prompt agêntica do que o 4.7 — o red-teaming da Gray Swan mostra uma taxa de sucesso de ataque de aproximadamente 9,6% versus 6,0% no 4.7. Equipes que executam o 4.8 em pipelines que lidam com entradas não confiáveis devem revisar sua abordagem de sandboxing.

Melhores tarefas de agente para o Claude Opus 4.8

A migração em escala de base de código que costumava exigir um sprint

Entregue ao Opus 4.8 uma migração que toca algumas centenas de arquivos — troca de ORM, atualização de versão de framework, correção de segurança em um monorepo — e deixe os fluxos de trabalho dinâmicos distribuírem o trabalho a subagentes em paralelo dentro de uma única sessão. O salto de +4,9 pontos no SWE-bench Pro e a redução de quatro vezes nas falhas deixadas passar na revisão de código são o que se traduzem nesse tipo de execução.

A pesquisa de 1M de tokens que realmente se sustenta

Coloque na janela uma minuta de contrato de 200 páginas, três propostas de concorrentes e os pareceres jurídicos do último trimestre, e então peça ao Opus 4.8 que sinalize cada cláusula mais rígida do que o mercado. O salto do GraphWalks em 1M de 40,3% para 68,1% é o que torna esse tipo de síntese entre documentos confiável pela primeira vez.

O orquestrador de agentes que não mente sobre seu trabalho

Use o 4.8 como o planejador que divide uma solicitação em dez etapas, despacha cada uma para subagentes mais baratos e relata o resultado. A taxa de 0% em relatar resultados falhos sem crítica, combinada com a queda de dez vezes no excesso de confiança, é a razão pela qual as equipes de produção recorrem ao 4.8 quando o próprio relato do agente precisa ser confiável.

O fluxo sensível à latência que finalmente fecha a conta no modo rápido

O modo rápido a 2,5× de velocidade costumava custar três vezes o que custa agora ($10/$50 por 1M vs. a camada anterior). Para copilotos interativos, sumarizadores de plantão ou qualquer etapa em que a latência de tempo real domine a experiência, o 4.8 em modo rápido agora é a escolha padrão na família Claude.

Quando dispensar o Claude Opus 4.8

Evite o Opus 4.8 em trabalho rotineiro de alto volume, onde o Sonnet 4.6 atinge o mesmo nível de qualidade por uma fração do custo, em respostas de chat críticas para latência, onde o Kimi K2.7 Code é muito mais rápido, em programação agêntica de terminal, onde o GPT-5.5 ainda lidera o Terminal-Bench 2.1 (78,2% vs. 74,6% do 4.8), e em pipelines que ingerem entradas não confiáveis sem sandboxing — a robustez do 4.8 à injeção de prompt é ligeiramente mais fraca do que a do 4.7.

Claude Opus 4.8 vs outros modelos

Claude Opus 4.8 vs GPT-5.5

O Opus 4.8 lidera em seis das sete células do conjunto de comparação da Anthropic, com as maiores diferenças no SWE-bench Pro (69,2% vs. 58,6%) e no OSWorld-Verified (83,4% vs. 78,7%). O GPT-5.5 mantém a liderança no Terminal-Bench 2.1 (78,2% vs. 74,6%). Escolha o 4.8 para programação entre arquivos e agentes de uso de computador; escolha o GPT-5.5 especificamente quando o trabalho conduzido por terminal predominar.

Claude Opus 4.8 vs Gemini 3.1 Pro

O Opus 4.8 lidera por margens amplas no SWE-bench Pro (+15,0) e no OSWorld-Verified (+7,2). Os dois modelos ficam dentro da margem de ruído em benchmarks de ciência saturados, como o GPQA Diamond. Use o 4.8 como padrão para trabalho agêntico; considere o Gemini especificamente quando você precisar da integração de ferramentas do Google.

Perguntas frequentes

Como o preço do Opus 4.8 se compara ao do 4.7?

O preço regular é idêntico: $5 por 1M de tokens de entrada, $25 por 1M de tokens de saída, $0,50 por 1M de entrada em cache. A mudança é o modo rápido, agora $10 / $50 por 1M de tokens a 2,5× de velocidade — três vezes mais barato do que o modo rápido nos modelos Claude anteriores.

O que são fluxos de trabalho dinâmicos?

Uma nova capacidade que permite ao Opus 4.8 planejar uma tarefa e então executar centenas de subagentes em paralelo dentro de uma única sessão. A Anthropic posiciona isso como o caminho para migrações em escala de base de código abrangendo centenas de milhares de linhas de código em uma única execução de agente.

Quais níveis de esforço o Opus 4.8 suporta?

Três níveis: high (o novo padrão), extra (xhigh no Claude Code) e max. Configurações mais altas gastam mais tokens em raciocínio antes de produzir uma resposta; configurações mais baixas favorecem a velocidade e a eficiência de limite de taxa.

O Opus 4.8 suporta cache de prompt?

Sim. A entrada em cache é faturada a $0,50 por 1M de tokens, um desconto de 10× sobre a parte em cache. A Messages API agora também aceita entradas de sistema no meio da conversa sem quebrar o cache.

Alternativas

Disponibilidade do Claude Opus 4.8 na Okou

Claude Opus 4.8 não é mais oferecido na Okou. Consulte Claude Opus 5.5 como alternativa atualmente suportada. Esta página preserva informações históricas, não os preços atuais da Okou.