Skip to main contentSkip to content
July 23, 2026
Notícias sobre Stablecoins · · 9 mins read · 1,613 words

Avaliação do Claude 4.8: Potenciar os pontos fortes e reduzir os pontos fracos

Revisão do Claude Opus 4.8: o modelo mais recente da Anthropic AI apresenta melhorias mensuráveis no código e no fluxo de trabalho, mas as fontes principais destacam as fraquezas persistentes em

Elena Petrova
Written by
Elena Petrova J.D. Verified
Regulation Correspondent
Follow on Google News
“`html

Revisão do Claude Opus 4.8: Melhor no que faz bem, pior no que não faz. O Claude Opus 4.8 chega com padrões técnicos reais que mostram ganhos reais no mundo da programação, automação de fluxos de trabalho e tarefas de modelagem, como relatou Thezvi. Esse salto na capacidade de programação real – de 64.3 para 69.2 no padrão SWE-bench Pro. Reflete o quanto a programação rotineira e a pesquisa simples que o modelo realiza agora foram aprimoradas, especialmente em comparação com modelos anteriores que dependiam mais de correspondência de padrões. E, uma vez que os preços permanecem fixos em 5 dólares por entrada e 25 dólares por saída para cada milhão de tokens, o Opus 4.8 permite que os usuários obtenham mais valor diariamente sem custo adicional, de acordo com Thezvi e Lennysnewsletter.

Esta revisão do Claude Opus 4.8 aborda como o modelo oferece melhorias significativas em programação rotineira, automação de fluxos de trabalho e modelagem rápida. No entanto, também esclarece as fraquezas persistentes em tarefas ambíguas ou altamente estratégicas. Isso enfatiza o tema de que o Claude Opus 4.8 é melhor no que realmente faz bem, mas é pior ou inalterado nas áreas em que anteriormente apresentava dificuldades.


Principais Insights da Comunidade

Análise do Lesswrong e da Comunidade

A comunidade Lesswrong registra tanto os aumentos mensuráveis quanto um teto qualitativo familiar para o Claude Opus 4.8. Os participantes nos painéis de liderança pública e registros privados ecoam uma única mensagem: o Opus 4.8 realmente ganha as melhores pontuações no SWE-bench Pro. Mas os contribuintes frequentemente notam “falhas agudas” quando as regras se sobrepõem ou as instruções mudam no meio do caminho. Os textos comentados do LW destacam os tipos de ambiguidade que dificultam o Opus 4.8 – lógica condicional pouco clara, cadeias de raciocínio sinuosas ou surpresas semânticas.

Os controles de esforço e as funcionalidades de agentes subalternos ajudam a reduzir as lacunas para funções básicas, mas não conseguem cobrir as habilidades de planejamento necessárias para pesquisas detalhadas ou lógica de negócios.

Perspectiva de Negócios da Lennysnewsletter

A Lennysnewsletter foca no impacto real do Opus 4.8: ele é projetado para modelagem rápida de negócios, entrega rápida de funcionalidades e fluxos de trabalho paralelos no Claude.ai e Cowork. De acordo com esta revisão do Claude Opus 4.8, o lançamento de novos modelos ou o tratamento de experiências individuais agora se tornou mais fácil.


Teste do Claude Opus 4.8: Métodos e Resultados

Criando os Testes

Os designers dos testes confiaram na verificação cruzada das revisões recentes – utilizando registros e datas de casos de Thezvi, Lennysnewsletter e Lesswrong para garantir os padrões tanto para critérios gerais quanto específicos.

Resultados dos Testes

A grande mudança nas pontuações do SWE-bench Pro – de 64.3 para 69.2 – captura um progresso real, passo a passo, de acordo com os registros de Thezvi. No entanto, os revisores são claros: a programação rotineira se destaca, mas assim que a ambiguidade do teste aumenta, o Opus 4.8 tropeça. A conclusão do código e a automação recompensam a atualização, enquanto as tarefas estratégicas pesadas ou o planejamento profundo ainda revelam pontos de desvio, de acordo com os resultados da Lennysnewsletter. A coletividade do Lesswrong confirma a redução de erros gramaticais e erros de “um fora” em cenários previsíveis, apoiando as conclusões principais nesta revisão do Claude Opus 4.8: melhor no que faz bem, pior no que não faz.

Andon Labs@andonlabs
Learnings from testing Claude Opus 4.8:

> Much worse than Opus 4.7 and GPT 5.5 on Vending Bench
> More aligned than previous Claude models (Opus 4.6+ and Mythos)
> Also worse on Blueprint-Bench
> Scared of getting caught
> Max reasoning is not the best reasoning effort pic.twitter.com/9yn58xsJL9
View on X

Padrões do Claude Opus 4.8 e Comparações

Números de Padrões: 4.8 vs 4.7 vs GPT-5.5

Modelo Pontuação SWE-bench Pro Custo de entrada/saída por 1M tokens Custo de modo rápido
Claude Opus 4.8 69.2 5 dólares / 25 dólares Mais barato que 4.7 (30 dólares / 150 dólares)
Claude Opus 4.7 64.3 5 dólares / 25 dólares 30 dólares / 150 dólares
GPT-5.5 Não disponível Não divulgado Não divulgado

Documentos de Thezvi mostram que a 5 dólares por entrada e 25 dólares por saída para cada milhão de tokens, o Opus 4.8 iguala o preço do 4.7, mas agora reduz seu custo no modo rápido – 30 dólares / 150 dólares para o 4.7 – tornando as funcionalidades coletivas acessíveis e o uso direto possível para pequenas equipes.


O que é realmente novo (além dos números)

A Lennysnewsletter analisa como o Claude.ai e o Cowork agora vêm com atualizações muito mais práticas para os desenvolvedores. Vale a pena notar que o lançamento de novos modelos ou o tratamento de experiências individuais se tornou mais fácil agora com o Claude Opus 4.8.

5 dólares – Custo por cada milhão de tokens de entrada.


Claude Opus 4.8 vs Sonnet 4.6

Deve usar Claude Opus 4.8 ou Sonnet 4.6?

Os testes da Lennysnewsletter colocam o Opus 4.8 à frente do Sonnet 4.6 em programação rotineira e modelagem rápida. Para lógica escalonada ou clareza, muitos optam pelo Sonnet, enquanto os esforços de automação agora tendem a favorecer o Opus. Para a maioria das tarefas de fluxo de trabalho, esta revisão do Claude Opus 4.8 conclui que o Opus é o vencedor.


Claude Opus 4.8 vs GPT-5.5

Como o Opus 4.8 se compara ao GPT-5.5?

Não há pontuação publicada para o SWE-bench Pro para o GPT-5.5, criando uma lacuna para comparação direta, como revelam os documentos do Lesswrong. Enquanto Thezvi e Lennysnewsletter esclarecem a precificação do Opus e os fluxos de trabalho, os custos do GPT-5.5 e as vitórias em programação real permanecem em uma caixa preta. Os testadores comparam o que podem: o novo fluxo de trabalho automatizado do Opus 4.8, o paralelismo entre agentes subalternos e a gestão de entrada/saída – funcionalidades que ainda não foram igualadas nos padrões gerais do GPT-5.5. Em planejamento comercial pesado e complexidade, os registros da Lennysnewsletter indicam que nenhum dos dois supera consistentemente o outro em estratégia profunda. O Opus 4.8 vence em velocidade, o Sonnet em clareza, e o GPT-5.5 em profundidade teórica – mas até que os dados do SWE-bench Pro cheguem, a tabela de liderança permanece instável.

Melhores Casos de Uso para o Claude Opus 4.8

As três principais fontes – Thezvi, Lennysnewsletter e Lesswrong – concordam sobre os mesmos usos: é projetado para realizar tarefas onde os fluxos de trabalho e os objetivos permanecem claros e mensuráveis. Como fica claro nesta revisão do Claude Opus 4.8, é o melhor para automação rotineira, tarefas de programação, desenvolvimento de modelos rápidos e fluxos de trabalho gerenciados.

Desenvolvimentos Futuros e o Roteiro da Anthropic

A próxima iteração do Opus 4.8 – de acordo com Thezvi – abordará exatamente essas questões agudas e contextuais, sugerindo que as revisões futuras podem mudar a narrativa em “Revisão do Claude Opus 4.8: Melhor no que faz bem, pior no que não faz”.

Principais Conclusões

Os registros de Thezvi confirmam: a pontuação de 69.2 do Opus 4.8 no SWE-bench Pro reforça sua liderança em tarefas de programação impulsionadas por código e fluxos de trabalho organizados. Mantendo um preço padrão fixo de 5 dólares / 25 dólares e adicionando um modo rápido mais barato.

Reação da Comunidade e Feedback ao Vivo

Os tópicos ao vivo no Lesswrong e os registros de Thezvi mostram interações mistas: otimismo em relação à automação, mas avisos claros de que os limites do pensamento do modelo não se moveram. Pesquisadores e usuários profissionais concordam: saltos produtivos em programação e automação rotineira, mas a ambiguidade em casos agudos e alucinações gera cautela. A programação é mais consistente, no entanto, como foi repetido em vários resumos da revisão do Claude Opus 4.8, ainda existem fraquezas notáveis em tarefas que exigem pensamento amplo ou planejamento estratégico profundo.

Comparação com Outros Modelos de IA

Análises comparativas diretas do Lesswrong e da Lennysnewsletter mostram que o Opus 4.8 supera o Sonnet 4.6 em tarefas de programação diárias e fluxos de trabalho – mas a lacuna muda de acordo com os detalhes da tarefa. O GPT-5.5 não provou, com a ausência de métricas principais e precificação, nem seus pontos fortes para grandes equipes. O Claude Opus 4.8 vence não porque é o melhor em tudo, mas porque se destaca em tarefas específicas e repetíveis que as empresas precisam agora. Em algumas tarefas de lógica especializada, o Sonnet 4.6 ainda leva a melhor, enquanto o GPT-5.5 pode ter profundidade não explorada (embora sem resultados do SWE-bench, não possa realmente desafiar o Opus pelo título de programação).

Opus 4.8 entrega – mas não de forma universal

O Opus 4.8 indica progresso constante – não uma reinvenção radical – ao focar no que realmente faz bem: automação de processos, geração de códigos e modelagem rápida para equipes que se preocupam com custos. O modelo supera facilmente versões anteriores e concorrentes principais em códigos grandes e operações rotineiras. Lançamentos extremamente rápidos, tudo isso mantendo custos razoáveis e expansão possível.

“`
Leia-nos no Google
Adicione o STnews como fonte preferida

No Google, marque a caixa ao lado de stnews.live para ver nossa cobertura mais acima nas Principais notícias.

Disclaimer: The content on this page is for informational purposes only and does not constitute financial advice. Always do your own research before making investment decisions.

Elena Petrova
About the author
Verified
Elena Petrova
Regulation Correspondent · 10+ years experience

Elena Petrova is a regulatory correspondent specializing in crypto law and policy with over 10 years of financial journalism experience. Formerly a finance reporter at Reuters, Elena covers SEC enforcement, MiCA implementation, and global stablecoin regulations. She holds a J.D. from Georgetown Law and is a member of the New York State Bar. Her regulatory analysis is frequently referenced by compliance officers and legal teams at major exchanges.

Education
J.D. Georgetown Law, B.A. International Relations, LSE
Full profile & all articles →
Conflicts of interest

I have no current legal practice or retainer relationships with any cryptocurrency company. Past employment relationships are listed publicly.

Related Articles

Fique por dentro

Receba o resumo stablecoin no seu email.

Mercados, regulação, fluxos on-chain. Dias úteis pela manhã, 7h UTC. Grátis, cancele com um clique.