A 28 de maio de 2026, a Anthropic lançou o Claude Opus 4.8, conquistando o 1.º lugar no Artificial Analysis Intelligence Index com uma pontuação de 61,4, destronando o GPT-5.5 pela primeira vez desde o lançamento da OpenAI em abril. A atualização traz um salto de 4,9 pontos no SWE-bench Pro (69,2% vs. 64,3%), quatro vezes menos falhas de código não sinalizadas, e pontuações de alinhamento equivalentes às do Claude Mythos Preview. Os preços mantêm-se iguais aos do Opus 4.7, a $5/$25 por milhão de tokens, enquanto o modo rápido cai para um terço do custo anterior. A Anthropic lançou mais tarde esse modelo de classe Mythos publicamente como Claude Fable 5, com um preço do dobro do Opus 4.8 e que recua para o Opus 4.8 em pedidos de alto risco.
O Opus 4.8 já foi entretanto substituído. O Claude Opus 5 chegou a 24 de julho de 2026 ao mesmo preço de $5 / $25 por milhão de tokens, e a Anthropic lista agora o Opus 4.8 entre os modelos legados, com uma nota a sugerir a migração. Tudo o que se segue é o registo do dia de lançamento do que o Opus 4.8 ofereceu em maio de 2026, com os benchmarks atribuídos ao modelo que os alcançou.
Juntamente com o modelo, a Anthropic lançou três funcionalidades de plataforma: o Dynamic Workflows, para executar centenas de subagentes em paralelo no Claude Code, o controlo de esforço em todos os planos do claude.ai, e uma melhoria na Messages API que permite aos programadores injetar diretivas de sistema a meio da conversa sem quebrar a cache de prompts.
O Opus 4.8 está disponível agora através da Claude API, da Amazon Bedrock, do Google Cloud Vertex AI e do Microsoft Foundry.
O Que Mudou no Opus 4.8
O Opus 4.8 não foi um novo nível de modelo. Substituiu o Opus 4.7 como o modelo Claude mais avançado disponível ao público em geral, posição que manteve até o Claude Opus 5 chegar a 24 de julho de 2026. A Anthropic posiciona-o como um colaborador mais forte, melhor a detetar os seus próprios erros, mais consistente em projetos de longa duração e significativamente mais honesto sobre o que sabe e não sabe.
Os maiores ganhos estão na programação agêntica e no trabalho de conhecimento. O SWE-bench Pro sobe de 64,3% para 69,2%. Os concorrentes de pesos abertos também se estão a aproximar; o Nex-N2-Pro regista 58,8% no mesmo teste SWE-bench Pro. Uma abordagem diferente vai ainda mais longe: o orquestrador Fugu, da Sakana AI, obtém 73,7 no SWE-Bench Pro ao distribuir o trabalho por um conjunto de modelos, ultrapassando ligeiramente os 69,2 do Opus 4.8. O GDPval-AA, o benchmark que mede trabalho real com valor económico, sobe de 1.753 para 1.890 Elo, implicando uma taxa de vitória de cerca de 67% frente ao GPT-5.5 em comparações diretas. O Terminal-Bench 2.1 melhora 8,5 pontos, para 74,6%, embora o GPT-5.5 ainda lidere esse benchmark em particular com 78,2%.
A mudança mais interessante está na honestidade e na autocorreção. O Opus 4.8 é o primeiro modelo Claude a obter 0% em relatar resultados falhos sem espírito crítico, e apresenta uma redução de mais de dez vezes no excesso de confiança em comparação com o Opus 4.7. A equipa de alinhamento da Anthropic escreve que o modelo «atinge novos máximos nas nossas medidas de traços pró-sociais», com taxas de comportamento desalinhado substancialmente mais baixas do que no Opus 4.7 e comparáveis às do restrito Claude Mythos Preview.
Eis um resumo rápido das novidades:
- SWE-bench Pro: 64,3% → 69,2% (+4,9 pontos)
- GDPval-AA: 1.753 → 1.890 Elo (+137 Elo)
- Terminal-Bench 2.1: 66,1% → 74,6% (+8,5 pontos)
- HLE (com ferramentas): 54,7% → 57,9% (+3,2 pontos)
- OSWorld-Verified: 83,4%, na liderança face a todos os concorrentes
- BrowseComp: 79,3% → 84,3% (+5,0 pontos)
- Deteção de falhas de código: 4× menos falhas não sinalizadas
- Alinhamento: Próximo dos níveis do Mythos Preview
- Modo rápido: 3× mais barato do que a geração anterior
Resultados dos Benchmarks
Programação
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Verified | 88,6% | 87,6% | N/A | N/A |
| SWE-bench Pro | 69,2% | 64,3% | 58,6% | 54,2% |
| SWE-bench Multilingual | 84,4% | N/A | N/A | N/A |
| Terminal-Bench 2.1 | 74,6% | 66,1% | 78,2% | 70,3% |
| CursorBench | Lidera em todos os níveis de esforço | Referência | N/A | N/A |
O número em destaque é o SWE-bench Pro, com 69,2%. Esta é a variante mais difícil, que testa a resolução real de pull requests em bases de código complexas, e o Opus 4.8 lidera agora todos os modelos da comparação por uma margem larga, 10,6 pontos acima do GPT-5.5 e 15 pontos acima do Gemini 3.1 Pro.
O Terminal-Bench 2.1 é o único benchmark de programação em que o GPT-5.5 ainda vence (78,2% vs. 74,6%). Este mede fluxos de trabalho de linha de comandos com várias ferramentas, que exigem planeamento, iteração e recuperação de erros. A diferença encurtou de 12,1 pontos no Opus 4.7 para 3,6 pontos no Opus 4.8, mas continua a existir.
Michael Truell, cofundador da Cursor, referiu que o Opus 4.8 «supera o Opus anterior no CursorBench em todos os níveis de esforço», com «chamadas de ferramentas mais eficientes, menos passos e melhor conclusão em tarefas mais longas».
Tarefas Agênticas
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| OSWorld-Verified | 83,4% | 82,8% | 78,7% | 76,2% |
| Online-Mind2Web | 84,0% | N/A | N/A | N/A |
| MCP-Atlas | 82,2% | 77,3% | N/A | N/A |
| Super-Agent Benchmark | Conclui todos os casos | N/A | Incompleto | N/A |
| BrowseComp (agente único) | 84,3% | 79,3% | 84,4% | 85,9% |
| BrowseComp (multiagente) | 88,5% | N/A | N/A | N/A |
É no desempenho agêntico que os ganhos mais claros aparecem. O OSWorld-Verified (o benchmark para conduzir uma máquina virtual, navegar por interfaces e concluir tarefas mistas de software) atinge 83,4%, à frente de todos os concorrentes. Kay Zhu, cofundador da GenSpark, descreve o Opus 4.8 como «o único modelo que conclui todos os casos do Super-Agent do início ao fim, superando o Opus anterior e o GPT-5.5 em paridade de custo».
Miguel Gonzalez, líder técnico da BrowserBase, reporta 84% no Online-Mind2Web, descrevendo-o como «o modelo de uso de computador e agente de navegador mais forte que testámos», com «um salto significativo em relação ao 4.7 e ao GPT-5.5».
Raciocínio e Conhecimento
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|
| GPQA Diamond | 93,6% | 94,2% | 93,6% | N/A |
| HLE (sem ferramentas) | 49,8% | 46,9% | 41,4% | N/A |
| HLE (com ferramentas) | 57,9% | 54,7% | 52,2% | N/A |
| USAMO 2026 | 96,7% | N/A | N/A | N/A |
| GDPval-AA | 1.890 Elo | 1.753 Elo | 1.769 Elo | N/A |
O GDPval-AA é o destaque. Com 1.890 Elo, o Opus 4.8 lidera face ao GPT-5.5 por 121 pontos e face ao Opus 4.7 por 137 pontos. A Artificial Analysis nota que o Opus 4.8 consegue isto usando menos 15% de turnos e menos 35% de tokens de saída do que o seu antecessor, ainda que precise de cerca de mais 30% de turnos do que o GPT-5.5 para concluir as tarefas.
O GPQA Diamond baixou ligeiramente de 94,2% para 93,6%, uma variação negligenciável. O Humanity’s Last Exam melhorou nas duas configurações: 49,8% sem ferramentas (subindo de 46,9%) e 57,9% com ferramentas (subindo de 54,7%), liderando face a todos os concorrentes em ambas.
Trabalho de Conhecimento
| Benchmark | Opus 4.8 | Opus 4.7 | GPT-5.5 | Gemini 3.5 Flash |
|---|---|---|---|---|
| Finance Agent v2 | 53,9% | N/A | N/A | 57,9% |
| Legal Agent Benchmark | Máximo registado | N/A | N/A | N/A |
Niko Grupen, diretor de investigação aplicada da Harvey AI, reporta que o Opus 4.8 alcançou «a pontuação mais alta de sempre no Legal Agent Benchmark» e foi «o primeiro modelo a ultrapassar os 10% no padrão all-pass», acrescentando que «o ganho de precisão traduz-se diretamente em mais trabalho jurídico que pode ser delegado com segurança».
Michael Ran, da Bridgewater Associates, descreve «uma qualidade de análise consistentemente superior à do Opus anterior», com «resultados mais rápidos e ricos, melhor relação sinal-ruído», e o modelo a «sinalizar proativamente problemas de entrada e de saída».
Feedback Empresarial da Box AI
Aaron Levie, CEO da Box, partilhou resultados detalhados de benchmarking ao testar o Opus 4.8 com agentes da Box AI em fluxos de trabalho empresariais complexos de documentos:
- Redação de relatórios: o Opus 4.8 supera na maioria das tarefas. Nos relatórios de bens industriais, obteve 87% vs. 77% do Opus 4.7. Na avaliação de lançamento de produtos de consumo, 90% vs. 84%.
- Revisão jurídica de NDA: consistência quase perfeita em todos os testes, identificando mais cláusulas relevantes e sinalizando mais problemas potenciais do que o Opus 4.7.
- Análise de dados financeiros: na análise de empréstimos corporativos, comparando estruturas de empréstimo sindicado com bilateral, o Opus 4.8 lidera por quase 8 pontos percentuais na extração precisa de métricas.
- Análise de subvenções do setor público: extraiu e validou corretamente quase todos os pontos de dados de elegibilidade exigidos, identificando detalhes específicos que o Opus 4.7 «ignorou ou interpretou mal».
O Opus 4.8 está a ser disponibilizado aos clientes da Box para implementação em agentes da Box AI.
Artificial Analysis Intelligence Index
No lançamento, o Opus 4.8 conquistou o 1.º lugar no Artificial Analysis Intelligence Index, com uma pontuação de 61,4 entre 149 modelos analisados. Foi um salto de +4,1 pontos face ao Opus 4.7 (57,3) e +1,2 pontos acima do GPT-5.5 em esforço máximo (60,2), que detinha o topo desde abril.
| Modelo | Intelligence Index | Input $/M | Output $/M | Contexto |
|---|---|---|---|---|
| Claude Opus 4.8 | 61,4 | $5.00 | $25.00 | 1M |
| GPT-5.5 | 60,2 | $5.00 | $30.00 | 922K |
| Claude Opus 4.7 | 57,3 | $5.00 | $25.00 | 1M |
| Qwen3.7-Max | 56,6 | $2.50 | $7.50 | 1M |
| Gemini 3.5 Flash | 55,3 | $1.50 | $9.00 | 1M |
| DeepSeek V4 Pro | 52,0 | $1.74 | $3.48 | 1M |
Essa versão do índice agregava dez avaliações: GDPval-AA, Terminal-Bench Hard, τ²-Bench Telecom, AA-LCR, AA-Omniscience, Humanity’s Last Exam, GPQA Diamond, SciCode, IFBench e CritPt.
A tabela já mudou duas vezes desde então. A Artificial Analysis rebasou o Intelligence Index para a v4.1, uma combinação diferente de nove avaliações, pelo que todos os números na tabela acima estão na escala retirada e não são comparáveis às pontuações atuais. A Artificial Analysis avançou entretanto novamente para a v4.1.1, onde o Claude Fable 5.1 lidera com 66, o Claude Opus 5 pontua 63, o Claude Fable 5 pontua 62, e o GPT-5.6 Sol e o GPT-6 Astra, lançado a 3 de setembro de 2026, pontuam ambos 61. O Opus 4.8 foi repontuado em 56 na v4.1, o que o colocou em 10.º de 190 modelos analisados, em vez de primeiro.
Melhorias específicas de pontos face ao Opus 4.7: o Terminal-Bench Hard ganhou 6,8 pontos, o τ²-Bench Telecom ganhou 5,9 pontos, e o IFBench ganhou 3,6 pontos. O desempenho no AA-LCR, no GPQA e no SciCode manteve-se praticamente estável.
Uma ressalva da Artificial Analysis: o Opus 4.8 está «entre os modelos líderes em inteligência, mas particularmente caro em comparação com outros modelos de preço semelhante» e é «mais lento do que a média e muito verboso», produzindo cerca de 110 milhões de tokens durante toda a avaliação do Intelligence Index, face a uma média de 35 milhões de tokens. O custo total da avaliação foi de $4,685.85.
Honestidade e Alinhamento
Esta é possivelmente a mudança mais significativa no Opus 4.8, mesmo não tendo um único número de benchmark em destaque.
O Opus 4.8 tem quatro vezes menos probabilidade do que o Opus 4.7 de deixar passar falhas de código sem as sinalizar. Produz 17 vezes menos resumos de código agênticos desonestos, em comparação com o Claude Sonnet 4.6, o nível intermédio que a Anthropic entretanto renovou como Claude Sonnet 5. É o primeiro modelo Claude a obter 0% em relatar resultados falhos sem espírito crítico. O excesso de confiança (afirmar certeza sobre algo de que não deveria estar certo) caiu mais de 10× face ao Opus 4.7.
A equipa de alinhamento da Anthropic avaliou que as taxas de comportamento desalinhado, incluindo engano e cooperação com utilização indevida, são «substancialmente mais baixas do que no Opus 4.7» e igualam agora o Claude Mythos Preview, o modelo restrito que era anteriormente a referência de alinhamento. Os detalhes dos testes de segurança pré-implementação estão publicados no system card completo.
Para os utilizadores do dia a dia, isto traduz-se num modelo mais disposto a dizer «não sei» e menos propenso a gerar respostas erradas com confiança. Para os programadores que constroem agentes autónomos, significa um risco menor de o modelo produzir silenciosamente código com erros ou relatórios de estado enganadores em fluxos de trabalho sem supervisão.
Scott Wu, CEO da Cognition (Devin), confirmou isto na prática: «O Opus 4.8 usa as ferramentas de forma limpa e segue instruções com consistência para engenharia autónoma. Resolve os problemas de verbosidade nos comentários e de chamadas de ferramentas que vimos no 4.7.»
Dynamic Workflows
O maior lançamento de plataforma junto com o Opus 4.8 é o Dynamic Workflows, agora disponível como pré-visualização de investigação no Claude Code para utilizadores dos planos Enterprise, Team e Max.
O Dynamic Workflows permite ao Claude orquestrar centenas de subagentes em paralelo dentro de uma única sessão do Claude Code. O sistema planeia o trabalho, distribui-o pelos subagentes, verifica os resultados e reporta-os, tudo sem orquestração manual.
O caso de uso prático que a Anthropic destaca são migrações à escala de toda a base de código, abrangendo centenas de milhares de linhas de código. O Claude Code com o Opus 4.8 consegue realizar uma migração do início ao merge, usando a suite de testes existente como critério de qualidade.
Trata-se de um passo significativo além da simples edição de vários ficheiros. Em vez de percorrer os ficheiros sequencialmente, o Claude pode criar agentes separados para alterações independentes, executá-los em paralelo e coordenar os resultados. Pense nisto como a diferença entre um único programador a percorrer um backlog e um team lead a distribuir tarefas.
O Dynamic Workflows também está disponível através da Claude API, do Bedrock, do Vertex AI e do Microsoft Foundry.
Controlo de Esforço
A Anthropic introduziu um novo controlo que permite aos utilizadores escolher quanto esforço computacional o Claude aplica a uma resposta. Está disponível em todos os planos do claude.ai e do Cowork.
As definições funcionam da seguinte forma:
- Esforço baixo: respostas mais rápidas, menor consumo do limite de taxa. Ideal para perguntas simples.
- Esforço alto (predefinição): equilíbrio entre qualidade e velocidade. Usa aproximadamente o mesmo número de tokens do que o Opus 4.7, mas com melhores resultados.
- Extra / xhigh: pensamento mais frequente e mais profundo. Recomendado para tarefas difíceis e fluxos de trabalho assíncronos de longa duração.
- Máximo: consumo de tokens mais elevado. Melhor desempenho ao custo mais alto.
Os limites de taxa no Claude Code foram alargados para acomodar níveis de esforço mais elevados. A Anthropic recomenda a definição predefinida «alto» para a maioria do trabalho, notando que já supera o resultado predefinido do Opus 4.7 com orçamentos de tokens semelhantes.
Melhoria da Messages API
Os programadores podem agora inserir entradas de sistema diretamente dentro do array de mensagens durante uma conversa. Isto significa que é possível atualizar as instruções do Claude (permissões, orçamentos de tokens, contexto do ambiente) a meio de uma tarefa, sem quebrar a cache de prompts e sem passar a atualização por um turno do utilizador.
Isto é especialmente relevante para quem constrói agentes e precisa de ajustar o comportamento do Claude à medida que uma tarefa avança, sem repor o contexto em cache. É uma alteração técnica, mas remove um ponto de atrito real em fluxos de trabalho com várias etapas.
Preços e Disponibilidade
O Opus 4.8 é lançado ao mesmo preço do Opus 4.7:
| Nível | Input | Output |
|---|---|---|
| Padrão | $5.00 / 1M tokens | $25.00 / 1M tokens |
| Modo rápido (2,5× velocidade) | $10.00 / 1M tokens | $50.00 / 1M tokens |
| Cache de prompts (acerto de cache) | $0.50 / 1M tokens | N/A |
O modo rápido é agora 3× mais barato do que era em modelos anteriores. Com 2,5× a velocidade, isto torna-o uma opção prática para aplicações sensíveis à latência, onde antes era proibitivo em termos de custo.
A cache de prompts a $0.50 por milhão de tokens de entrada representa um desconto de 90% em contexto repetido, o que se traduz em ganhos significativos para fluxos de trabalho de agentes que consultam repetidamente os mesmos documentos ou instruções.
Janela de contexto: 1 milhão de tokens (cerca de 1.500 páginas A4)
Output máximo: 128.000 tokens
ID do modelo: claude-opus-4-8
Modalidades de entrada: texto e imagem
Modalidades de saída: apenas texto
Plataformas: Claude API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry
| Métrica | Opus 4.8 | GPT-5.5 | Qwen3.7-Max | Gemini 3.5 Flash |
|---|---|---|---|---|
| Preço de entrada | $5.00 | $5.00 | $2.50 | $1.50 |
| Preço de saída | $25.00 | $30.00 | $7.50 | $9.00 |
| Janela de contexto | 1M | 922K | 1M | 1M |
| Intelligence Index | 61,4 | 60,2 | 56,6 | 55,3 |
As pontuações do índice na tabela acima são os valores de maio de 2026, antes do reajuste para a v4.1. No nível de fronteira, o Opus 4.8 era $5 mais barato por milhão de tokens de saída do que o GPT-5.5 ($25 vs. $30), com uma pontuação mais alta no Intelligence Index. A alternativa mais económica é o Qwen3.7-Max, a $2.50/$7.50, que troca 4,8 pontos do Intelligence Index por uma redução de preço de cerca de 70%.
Como Se Compara
Face ao Opus 4.7: uma atualização clara em todos os aspetos. Os benchmarks de programação melhoram entre 5 e 8 pontos. O trabalho de conhecimento salta 137 Elo. O alinhamento melhora drasticamente. Mesmo preço. Não há razão para continuar no 4.7.
Face ao GPT-5.5: resultados divididos que pendem para o Opus 4.8. O Claude lidera claramente no SWE-bench Pro (+10,6 pontos), no GDPval-AA (+121 Elo), no OSWorld-Verified (+4,7 pontos) e no Humanity’s Last Exam. O GPT-5.5 mantém o Terminal-Bench 2.1 (+3,6 pontos) e o FrontierMath Tier 4. No Intelligence Index, o Opus 4.8 fica ligeiramente à frente por 1,2 pontos. O GPT-5.5 é $5 mais caro por milhão de tokens de saída.
Face ao Gemini 3.5 Flash: uma classe de peso diferente. O Gemini 3.5 Flash (55,3 no Intelligence Index) custa cerca de 70% menos e é aproximadamente 4× mais rápido. Para trabalho sensível ao orçamento e à latência, o Flash continua a ser a melhor opção. O Opus 4.8 é a escolha quando a inteligência bruta e a fiabilidade agêntica importam mais do que o custo por token.
Face ao Claude Mythos Preview: na altura, o Mythos era o nível de maior inteligência e estava disponível apenas a organizações selecionadas para aplicações de cibersegurança, com um lançamento geral «esperado nas próximas semanas», dependente de salvaguardas de ciber mais fortes. Isso resolveu-se a 9 de junho de 2026: a Anthropic lançou o Claude Fable 5 como o seu modelo mais capaz amplamente disponível, e lançou o Claude Mythos 5 em simultâneo, ainda apenas por convite para trabalho de cibersegurança defensiva no âmbito do Project Glasswing. O Opus 4.8 foi o melhor modelo Claude que a maioria das pessoas conseguia realmente usar, até o Opus 5 o substituir.
Onde Se Situa na Linha Claude
| Modelo | AA Intelligence Index (v4.1.1) | Melhor Para | Preços |
|---|---|---|---|
| Claude Mythos 5.1 | Sem pontuação | Cibersegurança e ciências da vida, apenas por convite | Igual ao Fable 5.1 |
| Claude Fable 5.1 | 66 | Maior capacidade disponível, agentes de longa duração | $10 / $50 |
| Claude Fable 5 | 62 | Substituído pelo Fable 5.1, mesmo preço | $10 / $50 |
| Claude Opus 5 | 63 | Programação agêntica complexa e trabalho empresarial | $5 / $25 |
| Claude Opus 4.8 (legado) | 56 (v4.1) | Substituído pelo Opus 5, mesmo preço | $5 / $25 |
| Claude Sonnet 5 | Não publicado | Equilíbrio entre velocidade e inteligência | $2 / $10 |
| Claude Haiku 4.5 | Não publicado | Alto rendimento, sensível ao custo | $1 / $5 |
O Opus 4.8 substituiu o Opus 4.7 como o modelo de fronteira predefinido, e o Opus 5 entretanto substituiu-o nesse lugar. O caminho de atualização mantém a mesma forma: Haiku para volume, Sonnet para trabalho do dia a dia, Opus para problemas difíceis e agentes autónomos, e a linha Fable quando uma carga de trabalho precisa da maior capacidade que a Anthropic vende. A própria orientação da Anthropic diz «comece com o Claude Opus 5 para programação agêntica complexa e trabalho empresarial», e «para cargas de trabalho que precisam da maior capacidade disponível, use o Claude Fable 5». Essa formulação é anterior ao Claude Fable 5.1, lançado a 1 de setembro de 2026, que agora lidera a linha Fable ao mesmo preço.
Destaques dos Primeiros Testadores
A amplitude do feedback dos primeiros testadores é notável. Eis uma amostra:
| Organização | Testador | Citação Principal |
|---|---|---|
| Shopify | Tom Pritchard, Engenheiro Sénior | «Melhor discernimento. Faz as perguntas certas, deteta erros, contesta planos mal fundamentados.» |
| Cursor | Michael Truell, Cofundador/CEO | «Supera o Opus anterior no CursorBench em todos os níveis de esforço. Menos passos, melhor conclusão.» |
| Cognition (Devin) | Scott Wu, CEO | «Usa as ferramentas de forma limpa, segue instruções com consistência. Resolve os problemas de verbosidade nos comentários do 4.7.» |
| Harvey AI | Niko Grupen, Diretor de Investigação Aplicada | «Pontuação mais alta no Legal Agent Benchmark. Primeiro a ultrapassar os 10% no padrão all-pass.» |
| BrowserBase | Miguel Gonzalez, Líder Técnico | «Modelo de uso de computador mais forte testado. 84% no Online-Mind2Web, um salto significativo em relação ao 4.7 e ao GPT-5.5.» |
| Databricks | Hanlin Tang, CTO de Redes Neuronais | «Mudança de patamar no raciocínio agêntico. Raciocínio multimodal sobre PDF/diagramas com tokens 61% mais baratos do que o 4.7.» |
| Thomson Reuters | Joel Hron, CTO | «Melhorias significativas na consistência e no raciocínio para fluxos de trabalho profissionais de alto risco.» |
| Bridgewater | Michael Ran, Associado de Investimento Sénior | «Qualidade de análise consistentemente superior. Sinaliza proativamente problemas de entrada/saída.» |
| Hebbia | Aabhas Sharma, CTO | «Melhor precisão nas citações e eficiência de tokens na recuperação de documentos financeiros densos.» |
| Box | Aaron Levie, CEO | «Mensuravelmente melhor no trabalho gerativo e analítico com que as empresas mais se preocupam.» |
| Every | Katie Parrott, Redatora Sénior | «Grande atualização de qualidade de vida: colaboração mais rápida e fácil, melhor retenção de estilo entre sessões.» |
O padrão nestas citações é consistente: melhor discernimento, menos passos desperdiçados, conclusão mais forte. Vários testadores destacam especificamente as melhorias na fiabilidade e na autocorreção. A nota da Shopify sobre o modelo «contestar planos mal fundamentados» alinha diretamente com os ganhos de alinhamento que a Anthropic mediu.
O Que Isto Significa
Para Programadores
O Opus 4.8 é uma substituição direta. Use o ID de modelo claude-opus-4-8 na API. Vale a pena adotar a melhoria de entradas de sistema da Messages API para quem constrói agentes de várias etapas, já que elimina a necessidade de reestruturar prompts ao atualizar instruções a meio de uma tarefa.
Vale a pena testar o Dynamic Workflows no Claude Code para quem lida com migrações ou refatorações em larga escala. A abordagem de subagentes em paralelo deverá reduzir significativamente o tempo real de execução em tarefas que, de outra forma, correriam sequencialmente.
Para Utilizadores do Claude Code
Experimente as novas definições de esforço. A predefinição «alto» já supera a predefinição do Opus 4.7. Experimente «extra» ou «máximo» para sessões complexas de depuração ou refatorações em vários ficheiros. Quem estiver no Enterprise, Team ou Max pode experimentar o Dynamic Workflows para alterações em toda a base de código.
Para Utilizadores de IA no Dia a Dia
As melhorias de qualidade de vida importam mais do que as diferenças de benchmark. O Opus 4.8 tem menos tendência a inventar coisas com confiança, é mais capaz de sinalizar quando não tem a certeza, e é melhor a manter o contexto em conversas longas. Para trabalho criativo e analítico, os «resultados mais rápidos e ricos» que os primeiros testadores descrevem traduzem-se em menos ciclos de idas e voltas para obter um resultado útil. O Opus 4.8 manteve-se nos planos pagos Pro e Max durante todo o seu percurso. O mesmo acontece com o seu sucessor. O Opus 5 é agora o modelo predefinido no Claude Max e o modelo mais forte no Claude Pro. Para quem está a ponderar o custo, o nosso guia sobre o nível gratuito do Claude mostra o que é possível fazer sem pagar.
Para quem quer comparar os modelos Claude atuais com o GPT-5.6, o Gemini e o DeepSeek V4 numa única aplicação, o Fello AI reúne os principais modelos numa única aplicação nativa para Mac, iPhone e iPad, por $9.99/mês. Tem cerca de 30 a 50 MB, uma classificação de 4,7 estrelas em mais de 27.000 avaliações, e figura consistentemente entre as melhores aplicações de IA para iPhone. E se o Claude alguma vez deixar de responder a meio de uma tarefa, o nosso guia sobre o que fazer quando o Claude AI não responde aborda as verificações de estado e as alternativas mais rápidas.
O Que Vem a Seguir
O Opus 4.8 foi o quinto lançamento Opus da Anthropic em sete meses, e o ritmo que sinalizou manteve-se. A empresa tinha assinalado, na altura, dois movimentos futuros: um modelo de custo mais baixo com capacidades equivalentes ao Opus e um nível de maior inteligência que superasse o Opus. Ambos foram lançados. O Claude Fable 5 e o Claude Mythos 5 chegaram juntos a 9 de junho de 2026, e o Claude Sonnet 5 seguiu-se a $2 / $10 por milhão de tokens, com uma janela de contexto de 1M.
O Mythos não se tornou num produto de acesso direto. O Claude Mythos 5 é oferecido em disponibilidade limitada a clientes aprovados no âmbito do Project Glasswing, sem inscrição direta, e partilha as especificações e o preço do Fable 5. Segundo a própria Anthropic, o Opus 5 «continua atrás do Mythos 5 em tarefas de cibersegurança», o que é uma divisão deliberada e não uma lacuna que a empresa esteja a tentar fechar. Ambas as configurações foram renovadas a 1 de setembro de 2026 pelo Claude Fable 5.1 e Mythos 5.1.
O Opus 4.8 manteve o topo da linha Claude de acesso geral durante pouco menos de dois meses. Para quem está a escolher um modelo agora, o Opus 5 é a escolha predefinida ao mesmo preço. A única razão para continuar no Opus 4.8 é um ID de modelo fixado que ainda não foi migrado.