▲ Guia de modelo · lançado em 24 de julho de 2026 · claude-opus-5
O botão de esforço é o modelo.
Opus 5 é o primeiro Claude em que a principal coisa que você ajusta não é a redação do seu prompt — é o quanto você manda ele se esforçar. Qualidade de ponta a $5/$25 por milhão de tokens, metade do preço do Fable 5.
Aqui está o que realmente mudou, o que apagar dos seus prompts antigos e quais dos nove blocos de prompt vale a pena manter.
Compilado a partir da documentação do Opus 5 da Anthropic e da cobertura do dia de lançamento · Princípios de prompting, não achismo.
▲ 01 — os números
O que você está comprando.
Mesmo preço do Opus 4.8. Aproximadamente o dobro da pontuação no benchmark agêntico mais difícil da Anthropic.
- Entrada
- $5 / M tokens
- Saída
- $25 / M tokens
- Contexto
- 1M padrão e máximo
- Saída máx.
- 128k tokens
- Thinking
- Ligado por padrão
- Modo rápido
- 2,5× a $10/$50
| Benchmark | Resultado | Leitura |
|---|---|---|
| Frontier-Bench v0.1 | 43,3% vs 18,7% (Opus 4.8) | Mais do que o dobro, com custo por tarefa menor |
| CursorBench 3.2 | A 0,5% do Fable 5 | Metade do preço para uma codificação quase equivalente |
| ARC-AGI 3 | 3× o segundo melhor modelo | Diferença real de raciocínio inédito, não um arredondamento |
| OSWorld 2.0 (uso de computador) | Supera o melhor resultado do Fable 5 | Com cerca de um terço do custo |
| Zapier AutomationBench | ~1,5× o segundo melhor; 100% em tarefas de retenção | Automação de negócios real, não tarefas de brinquedo |
| Química orgânica (interno) | +10,2 pts sobre o 4.8 | Melhor Claude disponível ao público para ciências |
| Redlines jurídicos na primeira rodada | ~2× o Opus 4.8 | Primeiras versões de nível profissional, não apenas esboços |
A Harvey relatou que o Opus 5 igualou a qualidade de saída do Opus 4.8 no esforço máximo, cortando o uso médio de tokens em 26%. A economia não está no preço de tabela — é que um esforço mais baixo agora atinge o patamar que antes exigia esforço máximo do modelo antigo.
▲ 02 — a escala de esforço
Escolha um degrau, depois pare de mexer.
O esforço governa cada token da resposta — thinking, chamadas de ferramentas e argumentos — não só o raciocínio. Esforço mais baixo significa menos chamadas de ferramentas, menos preâmbulo, confirmações mais concisas.
| Nível | Use para | Veredito no Opus 5 |
|---|---|---|
low | Classificação, buscas simples, subagentes, chat de alto volume | use à vontade — substancialmente mais forte que os "lows" anteriores do Opus |
medium | Trabalho agêntico de rotina, equilíbrio entre custo e velocidade | use à vontade — sua principal alavanca de custo |
high (padrão) | Raciocínio complexo, a maior parte do trabalho intelectual | padrão seguro — idêntico a omitir o parâmetro |
xhigh | Codificação, execuções agênticas acima de 30 minutos, busca profunda | comece aqui para código — recomendação da própria Anthropic |
max | Apenas problemas genuinamente de ponta | meça antes — custo alto, diferença pequena na maioria dos casos |
No Claude Code e no claude.ai
Digite /effort xhigh para uma sessão de codificação de verdade ou execução de agente; deixe em high para edições e perguntas rápidas. Baixe para medium quando estiver fazendo algo repetitivo e quiser velocidade. ultracode no menu do Claude Code não é um sexto nível da API — é xhigh mais permissão permanente para disparar fluxos multiagente.
Na API
0 · output_config.effort
{
"model": "claude-opus-5",
"max_tokens": 64000,
"stream": true,
"output_config": { "effort": "xhigh" },
"messages": [{ "role": "user", "content": "..." }]
}Em xhigh ou max, defina um max_tokens alto — 64k é um bom ponto de partida — porque ele limita o thinking somado ao texto de resposta. E use streaming: 64k de saída pode ultrapassar o limite de tempo sem streaming.
1. O esforço controla o volume de thinking, não o tamanho visível da resposta. Baixá-lo não vai encurtar a resposta — você precisa pedir concisão em palavras. 2. Mudar o esforço no meio de uma conversa invalida o cache do prompt, porque o esforço molda o prompt renderizado. Escolha um nível por sessão. 3. thinking: {"type":"disabled"} em xhigh ou max retorna erro 400. Essa é a mudança que quebra compatibilidade com o 4.8.
▲ 03 — migração
As instruções para apagar.
A ação de maior impacto que você pode tomar num prompt antigo do Opus 4.8 é remover coisas dele. O Opus 5 já executa vários dos comportamentos que seu prompt tentava compensar, e pedir de novo faz ele fazer duas vezes.
| Se o seu prompt diz… | Faça isto | Porque |
|---|---|---|
| "Inclua uma etapa final de verificação" / "use um subagente para verificar" | delete | Ele já se autoverifica. A instrução causa verificação excessiva e gasta tokens sem ganho de qualidade. |
| "Verifique novamente sua resposta antes de responder" | delete | Mesmo problema cumulativo — ele já detecta e corrige os próprios erros. |
| "Relate apenas problemas de alta severidade" (revisão de código) | delete | Ele segue isso ao pé da letra e subrrelata. Peça tudo e filtre numa segunda passada. |
| "Não pense" / "não raciocine" | delete | Aumenta a chance de tags XML internas vazarem para a saída visível. |
| Contornos de visão ajustados para modelos mais antigos | re-test | A precisão em gráficos, diagramas e replicação de UI saltou; a muleta agora pode atrapalhar. |
| Padrões de esforço herdados do 4.8 / 4.7 | re-sweep | Low e medium agora atingem patamares que antes não atingiam. Refaça o teste com suas próprias avaliações. |
| thinking: {"type":"adaptive"} | keep | Ainda válido, agora equivalente ao padrão. Mas reveja max_tokens: o thinking agora conta contra esse limite. |
O que adicionar em vez disso
As arestas do Opus 5 têm todas o mesmo formato — ele faz mais. Respostas mais longas, documentos mais longos, mais narração, mais delegação, escopo mais amplo. Cada prompt abaixo corta um desses excessos.
▲ 04 — a biblioteca de prompts
Nove blocos que valem a pena manter.
Cole num prompt de sistema, num CLAUDE.md, ou no topo de um chat longo. Cada um mira um comportamento medido específico, não uma sensação vaga.
1 · Concisão — produtos voltados ao usuário
Keep responses focused, brief, and concise. Keep disclaimers and caveats short, and spend most of the response on the main answer. When asked to explain something, give a high-level summary unless an in-depth explanation is specifically requested.
As respostas padrão do Opus 5 são mais longas que as do 4.8. Este é o ajuste — o esforço não resolve isso.
2 · O lembrete no fim do prompt
<tone_preference> Keep outputs reasonably concise. </tone_preference>
Num prompt de sistema longo, combine a instrução completa perto do início com este lembrete curto perto do fim.
3 · Ritmo de narração durante execuções de agente
Before your first tool call, say in one sentence what you're about to do. While working, give a brief update only when you find something important or change direction. When you finish, lead with the outcome: your first sentence should answer "what happened" or "what did you find," with supporting detail after it for readers who want it.
O Opus 5 anuncia o que vai fazer, muitas vezes de forma longa. Descreva o ritmo que você quer; exemplos positivos funcionam melhor do que proibições.
4 · Tamanho de entregáveis escritos
Match the length of written documents to what the task needs: cover the substance, but do not pad with filler sections, redundant summaries, or boilerplate.
Arquivos gravados em disco — relatórios, Markdown, resumos — incham de forma independente da verbosidade da conversa. É uma alavanca separada.
5 · Controle de escopo
Deliver what was asked, at the scope intended. Make routine judgment calls yourself, and check in only when different readings of the request would lead to materially different work. If the request seems mistaken or a better approach exists, say so in a sentence and continue with the task as asked rather than quietly narrowing, widening, or transforming it. Finish the whole task, and stop short of actions that are clearly beyond what was asked.
O melhor bloco de uso geral desta página. O Opus 5 vai aplicar o próprio julgamento sobre o que a tarefa "deveria" ser, a menos que você trace a linha.
6 · Limite a criação de subagentes
Delegate to a subagent only for large tasks that are genuinely independent and parallelizable, such as a wide multi-file investigation. Do not delegate work you can finish yourself in a handful of tool calls, and do not use subagents to verify or double-check your own work. If one subagent can complete the task, use one rather than several, and keep spawn counts low.
A delegação multiplica custo e tempo de execução em tarefas pequenas. O Opus 5 recorre a isso com mais facilidade do que o 4.8.
7 · Pare de narrar correções
Only correct an earlier statement when the error would change the user's code, conclusions, or decisions. State corrections plainly and briefly, then continue the task. For slips that change nothing for the user, make the fix and move on without noting it.
A autocorreção é um recurso; narrar cada autocorreção para um cliente não é.
8 · Revisão de código que encontra tudo
Review this change and report every issue you find, including low-severity ones and anything you are only moderately confident about. Do not filter for severity — I will triage in a separate pass. For each finding give the file and line, a one-sentence statement of the defect, and a concrete failure scenario with inputs and the wrong result.
Precisão e recall são altos no Opus 5, e a precisão se mantém mesmo com esforço mais baixo — então rode uma passada rápida em medium na hora da revisão e uma passada minuciosa em xhigh depois.
9 · Se você precisar desativar o thinking
You may say a brief sentence before using a tool. Do not include internal or system XML tags in your response.
Com o thinking desligado, o Opus 5 ocasionalmente escreve uma chamada de ferramenta como texto puro (ela nunca é executada, e contamina turnos seguintes) ou vaza tags. Essas duas linhas mitigam ambos os casos. Melhor ainda: deixe o thinking ligado e baixe o esforço.
▲ Nove prompts são um começo, não um sistema
Prompting não é uma estratégia. Querer um plano de 90 dias que roda seu negócio inteiro com IA é.
Construir meu roadmap de IA de 90 dias →▲ 05 — roteamento
Para que apontar o modelo.
Onde o modelo justifica o preço, e onde um mais barato daria conta.
Dê a especificação completa e saia
O Opus 5 é mais forte em recursos multiarquivo, grandes refatorações e trabalho de ponta a ponta, e ele termina em vez de deixar stubs e TODOs. Entregue a especificação completa de uma vez, em vez de passar os passos aos poucos.
Revisão de código em duas velocidades
Bugs reais a uma taxa alta por passada, com achados extras que na maioria são reais. A precisão se mantém em esforço baixo, então rode barato na hora do commit e a fundo antes do lançamento.
Visão com ferramentas, não só thinking
Gráficos, documentos densos, diagramas e replicação de UI. Dê a ele bash e ferramentas de recorte para que possa inspecionar e verificar visualmente — isso supera gastar o orçamento só em thinking.
O milhão de tokens completo
O contexto de 1M é padrão e máximo ao mesmo tempo, e o seguimento de instruções, as chamadas de ferramentas e o raciocínio se mantêm consistentes ao longo de toda a janela. Trabalho com o repositório inteiro ou uma sala de negócios inteira está ao alcance.
Planilhas e apresentações
Pastas de trabalho com múltiplas planilhas e fórmulas não triviais, e slides bem estruturados. Ele segue um modelo padrão da casa — mas só se você entregar um.
Orquestração
Times de subagentes escritor-verificador se mantêm coesos, com poucos agentes atropelando o trabalho uns dos outros. Limite a contagem de disparos por custo, não por correção.
▲ 06 — silenciosamente úteis
Quatro mudanças que ninguém colocou na manchete.
Mínimo do cache de prompt caiu para 512 tokens (de 1.024). Prompts de sistema curtos que nunca conseguiam cache no 4.8 agora conseguem, sem mudar código.
Mudanças de ferramentas no meio da conversa (beta). Adicione ou remova ferramentas entre turnos sem invalidar o cache — cabeçalho mid-conversation-tool-changes-2026-07-01.
Modo de fallback padrão (beta). fallbacks: "default" roteia recusas por categoria para as alternativas recomendadas pela Anthropic, em vez de uma lista que você mesmo mantém — cabeçalho server-side-fallback-2026-07-01.
Modo rápido. 2,5× de throughput ao dobro do preço ($10/$50), apenas na Claude API — ainda não disponível no Bedrock, Google Cloud ou Microsoft Foundry.
Fundador —
Agora você sabe como rodar o Opus 5: o dial de esforço, o que tirar dos seus prompts, os nove blocos que aguentam prazos reais.
Prompting é os 20% fáceis. Os outros 80% são decidir para onde apontar primeiro, em que ordem, dentro de um negócio que ainda precisa fechar a folha de pagamento. Essa é a parte que construímos com você — um roadmap de 90 dias, não mais um pacote de prompts.
— Italo
As ferramentas mudam. Os princípios de prompting não.
— por que este guia não vai ficar desatualizado no mês que vem
▲ Respostas diretas · sem enrolação
▲ 07 — respostas diretas
As perguntas que todo mundo está fazendo.
Não exatamente, e esse é o ponto. O Opus 5 fica a 0,5% do Fable 5 no CursorBench 3.2 e o supera no uso de computador do OSWorld, com metade a um terço do custo. O Fable 5 continua à frente no trabalho mais difícil, de longo prazo, ambíguo e multi-dia. Se uma tarefa leva horas ou dias para uma pessoa e ninguém ainda resolveu, é o Fable. Todo o resto é Opus 5.
▲ Ainda tem dúvidas sobre rodar seu negócio com isso
Pule a tentativa e erro. Consiga o plano de 90 dias que transforma essas respostas em receita.
Conseguir meu roadmap grátis →▲ A aventura é a subida