Claude Opus 4.8: referência histórica do modelo
1M tokens · Text / Vision / Code · Prompt cache
A Okou não executa mais o Claude Opus 4.8. Esta página é mantida como referência de especificações, preços e benchmarks. Para o mesmo tipo de trabalho, use o Claude Opus 5.5.
Ver Claude Opus 5.5O Claude Opus 4.8 é o lançamento de ponta da Anthropic em 28 de maio de 2026, uma atualização direta do Opus 4.7 pelo mesmo preço de tabela do fornecedor de $5/$25. Ele registra as maiores pontuações de SWE-bench Pro (69,2%), OSWorld-Verified (83,4%), MCP-Atlas (82,2%) e Humanity's Last Exam (57,9% com ferramentas) que a Anthropic já entregou, e é o primeiro modelo a ultrapassar 10% no padrão de aprovação total do agente jurídico.
As duas mudanças estruturais que vale conhecer são os fluxos de trabalho dinâmicos (planejar uma tarefa e distribuí-la entre centenas de subagentes em paralelo em uma única sessão) e um corte no preço do modo rápido para 2,5× de velocidade a $10/$50 por 1M de tokens — três vezes mais barato do que o modo rápido nos modelos Claude anteriores. Os níveis de esforço se expandem para high (padrão), extra e max. A própria Anthropic descreve o lançamento como uma "melhoria modesta, mas tangível", em vez de um salto.
O que é o Claude Opus 4.8?
28 de maio de 2026
Análises independentes (LLM Stats, VentureBeat, Vellum) corroboram a ordenação relativa em relação ao 4.7 e aos concorrentes: o 4.8 vence em todas as células do conjunto de comparação publicado pela Anthropic, exceto no Terminal-Bench 2.1, onde o GPT-5.5 ainda lidera (78,2% vs. 74,6% do 4.8). O salto do 4.7 para o 4.8 no SWE-bench Pro é de +4,9 pontos; no USAMO 2026 é de +27,4; e no novo F1 de contexto longo de 1M de tokens do GraphWalks é de +27,8. Trate as pontuações absolutas como direcionais — o SWE-bench Verified está se aproximando da saturação em todos os modelos de ponta.
O que se destaca no Claude Opus 4.8
Principais recursos de arquitetura e capacidade.
O Opus 4.8 mantém a janela de contexto de 1M de tokens e a saída máxima de 128K do Opus 4.7, faturadas pelo preço de entrada padrão em toda a janela. O controle de esforço se expande para três níveis: high (o novo padrão), extra (xhigh dentro do Claude Code) e max. A Messages API agora aceita entradas de sistema no meio da conversa sem quebrar o cache de prompt. Os fluxos de trabalho dinâmicos permitem que o Claude planeje e despache centenas de subagentes em paralelo em uma única sessão. O modo rápido roda a aproximadamente 2,5× a velocidade padrão por $10 / $50 por 1M de tokens. As entradas multimodais em texto, visão e código permanecem inalteradas.
Especificações em resumo
Benchmarks do Claude Opus 4.8
Pontuações reportadas pelo fornecedor a partir do system card do Opus 4.8 da Anthropic, com comparações em relação ao Opus 4.7, GPT-5.5 e Gemini 3.1 Pro em esforço máximo e médias de 5 tentativas. O 4.8 lidera em seis das sete células que a Anthropic publica; o GPT-5.5 mantém a liderança no Terminal-Bench 2.1. O SWE-bench Verified está se aproximando da saturação em todos os modelos de ponta — o conjunto mais difícil do SWE-bench Pro é o sinal mais duradouro.
Preços do Claude Opus 4.8
Preços históricos do provedor por milhão de tokens. São valores de referência, não cobranças atuais da Okou.
Como o Claude Opus 4.8 se comporta na prática
Comportamento observado em execuções de agentes em produção.
Edições de código de primeira tentativa
A Anthropic relata que o Opus 4.8 tem cerca de quatro vezes menos probabilidade do que o 4.7 de deixar passar falhas ao revisar código, e o salto de +4,9 pontos no SWE-bench Pro (69,2% vs. 64,3%) confirma isso no conjunto de programação mais difícil e menos saturado. Escolha o 4.8 para patches que precisam ser aplicados sem erros em vários arquivos.
Recuperação de contexto longo
O F1 do GraphWalks em 1M de tokens salta de 40,3% para 68,1% — o maior ganho em um único benchmark no lançamento. A janela de 1M de tokens agora é de fato utilizável na extremidade superior de sua faixa, não apenas nominal.
Honestidade e excesso de confiança
A Anthropic relata uma redução de mais de dez vezes no excesso de confiança em relação ao 4.7, 0% em relatar resultados falhos sem crítica (uma primazia para a família Claude) e uma taxa de 3,7% de falha em levar eventos importantes ao usuário. A incidência de desalinhamento é de aproximadamente 1,9, praticamente empatada com o Mythos Preview, o mais bem alinhado da Anthropic.
Velocidade e modo rápido
A velocidade padrão é comparável à do Opus 4.7. A mudança de preço é o destaque: o modo rápido a 2,5× de velocidade custa $10 / $50 por 1M de tokens, três vezes mais barato do que o modo rápido nos modelos Claude anteriores. Vale a pena usar em etapas de orquestração onde a latência de tempo real importa.
Ressalva sobre injeção de prompt
O system card da Anthropic observa que o 4.8 é um pouco menos robusto à injeção de prompt agêntica do que o 4.7 — o red-teaming da Gray Swan mostra uma taxa de sucesso de ataque de aproximadamente 9,6% versus 6,0% no 4.7. Equipes que executam o 4.8 em pipelines que lidam com entradas não confiáveis devem revisar sua abordagem de sandboxing.
Melhores tarefas de agente para o Claude Opus 4.8
A migração em escala de base de código que costumava exigir um sprint
Entregue ao Opus 4.8 uma migração que toca algumas centenas de arquivos — troca de ORM, atualização de versão de framework, correção de segurança em um monorepo — e deixe os fluxos de trabalho dinâmicos distribuírem o trabalho a subagentes em paralelo dentro de uma única sessão. O salto de +4,9 pontos no SWE-bench Pro e a redução de quatro vezes nas falhas deixadas passar na revisão de código são o que se traduzem nesse tipo de execução.
A pesquisa de 1M de tokens que realmente se sustenta
Coloque na janela uma minuta de contrato de 200 páginas, três propostas de concorrentes e os pareceres jurídicos do último trimestre, e então peça ao Opus 4.8 que sinalize cada cláusula mais rígida do que o mercado. O salto do GraphWalks em 1M de 40,3% para 68,1% é o que torna esse tipo de síntese entre documentos confiável pela primeira vez.
O orquestrador de agentes que não mente sobre seu trabalho
Use o 4.8 como o planejador que divide uma solicitação em dez etapas, despacha cada uma para subagentes mais baratos e relata o resultado. A taxa de 0% em relatar resultados falhos sem crítica, combinada com a queda de dez vezes no excesso de confiança, é a razão pela qual as equipes de produção recorrem ao 4.8 quando o próprio relato do agente precisa ser confiável.
O fluxo sensível à latência que finalmente fecha a conta no modo rápido
O modo rápido a 2,5× de velocidade costumava custar três vezes o que custa agora ($10/$50 por 1M vs. a camada anterior). Para copilotos interativos, sumarizadores de plantão ou qualquer etapa em que a latência de tempo real domine a experiência, o 4.8 em modo rápido agora é a escolha padrão na família Claude.
Quando dispensar o Claude Opus 4.8
Evite o Opus 4.8 em trabalho rotineiro de alto volume, onde o Sonnet 4.6 atinge o mesmo nível de qualidade por uma fração do custo, em respostas de chat críticas para latência, onde o Kimi K2.7 Code é muito mais rápido, em programação agêntica de terminal, onde o GPT-5.5 ainda lidera o Terminal-Bench 2.1 (78,2% vs. 74,6% do 4.8), e em pipelines que ingerem entradas não confiáveis sem sandboxing — a robustez do 4.8 à injeção de prompt é ligeiramente mais fraca do que a do 4.7.
Claude Opus 4.8 vs outros modelos
Claude Opus 4.8 vs GPT-5.5
O Opus 4.8 lidera em seis das sete células do conjunto de comparação da Anthropic, com as maiores diferenças no SWE-bench Pro (69,2% vs. 58,6%) e no OSWorld-Verified (83,4% vs. 78,7%). O GPT-5.5 mantém a liderança no Terminal-Bench 2.1 (78,2% vs. 74,6%). Escolha o 4.8 para programação entre arquivos e agentes de uso de computador; escolha o GPT-5.5 especificamente quando o trabalho conduzido por terminal predominar.
Claude Opus 4.8 vs Gemini 3.1 Pro
O Opus 4.8 lidera por margens amplas no SWE-bench Pro (+15,0) e no OSWorld-Verified (+7,2). Os dois modelos ficam dentro da margem de ruído em benchmarks de ciência saturados, como o GPQA Diamond. Use o 4.8 como padrão para trabalho agêntico; considere o Gemini especificamente quando você precisar da integração de ferramentas do Google.
Perguntas frequentes
Como o preço do Opus 4.8 se compara ao do 4.7?
O preço regular é idêntico: $5 por 1M de tokens de entrada, $25 por 1M de tokens de saída, $0,50 por 1M de entrada em cache. A mudança é o modo rápido, agora $10 / $50 por 1M de tokens a 2,5× de velocidade — três vezes mais barato do que o modo rápido nos modelos Claude anteriores.
O que são fluxos de trabalho dinâmicos?
Uma nova capacidade que permite ao Opus 4.8 planejar uma tarefa e então executar centenas de subagentes em paralelo dentro de uma única sessão. A Anthropic posiciona isso como o caminho para migrações em escala de base de código abrangendo centenas de milhares de linhas de código em uma única execução de agente.
Quais níveis de esforço o Opus 4.8 suporta?
Três níveis: high (o novo padrão), extra (xhigh no Claude Code) e max. Configurações mais altas gastam mais tokens em raciocínio antes de produzir uma resposta; configurações mais baixas favorecem a velocidade e a eficiência de limite de taxa.
O Opus 4.8 suporta cache de prompt?
Sim. A entrada em cache é faturada a $0,50 por 1M de tokens, um desconto de 10× sobre a parte em cache. A Messages API agora também aceita entradas de sistema no meio da conversa sem quebrar o cache.
Alternativas
Disponibilidade do Claude Opus 4.8 na Okou
Claude Opus 4.8 não é mais oferecido na Okou. Consulte Claude Opus 5.5 como alternativa atualmente suportada. Esta página preserva informações históricas, não os preços atuais da Okou.

