▲ Todos os principais modelos, numa página só — atualizado em 24/07/2026
O melhor LLM em 2026: todos os principais modelos comparados.
Claude, GPT, Gemini, Grok, Llama, DeepSeek, Mistral e Qwen — em preço, contexto e nos benchmarks que as pessoas realmente citam.
Escolher um modelo não deveria exigir ler onze blogs de fornecedores e cruzar três leaderboards. Esta página faz esse trabalho, e diz claramente em quais números você pode confiar e em quais não pode.
▲ 01 — antes de um único número
Como ler esta página
Retirado diretamente da documentação de preços e de modelos publicada pela própria Anthropic. Todo preço e janela de contexto da Claude nesta página é oficial.
Todo número que não é da Anthropic nesta página — OpenAI, Google, xAI, Meta, DeepSeek, Mistral, Alibaba — veio de sites agregadores secundários (rastreadores de leaderboard, resumos de model card, posts de blog), porque nenhuma página oficial de preços de primeira parte foi consultada para nenhum deles nesta pesquisa. Trate como direcional, não confirmado pelo fornecedor.
Um pequeno número de valores se contradiz entre fontes — o preço do Mistral Large 3 é citado de duas formas diferentes, sem como reconciliar a partir desta pesquisa. Mostrado como faixa, sinalizado, nunca calculado numa média falsa.
Alguns "vencedores" de categoria são medidos em benchmarks diferentes por fontes diferentes — a comparação de uso de computador mistura pontuações do OSWorld e do Online-Mind2Web, por exemplo. Marcado como apenas direcional, não um confronto direto limpo.
Nada que a pesquisa não conseguiu confirmar foi estimado aqui. A geração atual do modelo principal da Qwen (3.6/3.7, que substitui o Qwen 3.5 perfilado abaixo), o status real do DeepSeek R2/V5, e um benchmark pontuado de escrita longa para qualquer fornecedor foram todas lacunas nesta pesquisa — estão nomeadas como lacunas, não preenchidas por estimativa.
▲ 02 — a escada de preços
Preço de saída, cada nível, $/MTok
Ordenado do mais barato ao mais caro. Barras douradas são o preço oficial da Anthropic; barras em teal são números não confirmados de agregador para todo outro fornecedor.
▲ 03 — a matriz de benchmarks
Cinco números que todo mundo cita
SWE-bench Verified (codificação), GPQA Diamond (raciocínio/ciência), Artificial Analysis Intelligence Index (composto), janela de contexto e preço de saída. n/a significa que o número não apareceu nesta pesquisa — não que o modelo não o reporte.
| Modelo | SWE-bench Verified | GPQA Diamond | AA Index | Contexto | Saída $/MTok | |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 96,0 | n/a | n/a | 1.000.000 | $25 | Não confirmado — agregador |
| Claude Fable 5 | 95,0 | n/a | ~60 | 1.000.000 | $50 | Não confirmado — agregador |
| Claude Opus 4.8 | n/a | n/a | 61,4 | 1.000.000 | $25 | Não confirmado — agregador |
| Claude Sonnet 5 | n/a | n/a | n/a | 1.000.000 | $15 | Oficial |
| GPT-5.6 Sol | n/a | 94,1–94,6 | ~55* | ~1.050.000 | $30 | Não confirmado — agregador |
| Gemini 3.1 Pro | 80,6 | 94,3 | n/a | 1.000.000 | $12–18 | Não confirmado — agregador |
| Gemini 3.6 Flash | n/a | n/a | n/a | 1.048.576 | $7,50 | Não confirmado — agregador |
| Grok 4.5 | n/a | n/a | 54 | n/a | $6 | Não confirmado — agregador |
| DeepSeek V4 Pro | 80,6 | n/a | n/a | 1.000.000 | $0,87 | Não confirmado — agregador |
| Mistral Large 3 | n/a | n/a | 16,2 | 128.000 | $1,50–6* | Fontes em disputa |
| Qwen 3.5-397B-A17B | n/a | n/a | n/a | n/a | $3,60 | Não confirmado — agregador |
| Llama 5 "Avocado" | n/a | n/a | n/a | 5.000.000* | pesos abertos | Não confirmado — agregador |
* As fontes discordam sobre qual modelo lidera o AA Intelligence Index (o ~55 do GPT-5.6 Sol é citado via GPT-5.5; o 16,2 do Mistral Large 3 e sua faixa de preço estão ambos em disputa entre rastreadores).
Qualidade vs. preço — a fronteira de valor
Apenas modelos com uma pontuação SWE-bench Verified reportada E um preço são plotados. Canto inferior esquerdo é barato-e-fraco; superior esquerdo é a fronteira de valor.
▲ 04 — as doze categorias
Vencedor, por que importa
01 · CODIFICAÇÃO AGÊNTICA
Não confirmado — agregadorClaude Opus 5
96% no SWE-bench Verified, o maior número encontrado entre as fontes, por menos da metade do preço do Fable 5.
02 · CODIFICAÇÃO DO DIA A DIA / TRABALHO DE IDE
OficialClaude Sonnet 5
Qualidade de codificação quase-Opus a preço de introdução de $2/$10 até 31 de agosto de 2026 — a escolha padrão para autocompletar e agente.
03 · MELHOR CUSTO-BENEFÍCIO (QUALIDADE POR DÓLAR)
Não confirmado — agregadorDeepSeek V4 Pro
Iguala a pontuação de SWE-bench de um modelo principal do Google a cerca de 1/28 do custo de saída por token do Opus 4.8.
04 · CONTEXTO LONGO / TRABALHO COM O REPOSITÓRIO INTEIRO
Não diretamente comparávelLlama 5 "Avocado"
Janela alegada de 5M tokens — a maior encontrada, mas não verificada e com forte tom de marketing. Escolha mais segura: o nível de 1M de contexto da Anthropic/Google.
05 · RACIOCÍNIO E MATEMÁTICA
Não confirmado — agregadorGemini 3.1 Pro
GPQA Diamond 94,3% (alegado o maior já registrado) e o maior salto único em benchmark de raciocínio encontrado (ARC-AGI-2: 31,1% → 77,1%).
06 · ESCRITA E PROSA LONGA
Não diretamente comparávelClaude Opus 4.8
Não existe benchmark de escrita de terceiros para nenhum fornecedor — isso ranqueia apenas com base na linguagem documentada de descrição do modelo, a categoria com evidência mais fraca desta página.
07 · VISÃO E COMPREENSÃO DE DOCUMENTOS
Não confirmado — agregadorGemini 3.1 Pro / 3.6 Flash
O único fornecedor confirmado a aceitar entrada nativa de vídeo e áudio em toda a sua linha, até o nível mais barato.
08 · USO DE COMPUTADOR / AUTOMAÇÃO DE NAVEGADOR
Não diretamente comparávelGPT-5.4
Líder reportado no OSWorld com 75,0% — mas isso é medido num benchmark diferente (OSWorld vs Online-Mind2Web) do vice-líder, então trate este ranking apenas como direcional.
09 · MELHOR MODELO DE PESOS ABERTOS
Não confirmado — agregadorDeepSeek V4 Pro-Max
Maior pontuação confirmada de SWE-bench em pesos abertos (80,6%), corroborada por múltiplas fontes com números específicos.
10 · BARATO/RÁPIDO, ALTO VOLUME
Não confirmado — agregadorDeepSeek V4 Flash
$0,14/$0,28 por MTok — o menor preço por token verificado encontrado, cerca de 7x mais barato que o Haiku 4.5.
11 · TRABALHO CORPORATIVO DE CONHECIMENTO
OficialClaude Opus 5 / Opus 4.8
A capacidade nativa de geração de planilha/slide mais concretamente documentada (Agent Skills xlsx/pptx com fórmulas reais) encontrada entre todos os fornecedores.
12 · ORQUESTRAÇÃO MULTIAGENTE
OficialClaude Opus 5
O único fornecedor com uma API coordenadora multiagente documentada e de primeira classe (até 20 agentes na lista) em vez de um padrão via prompt.
Doze vencedores. Uma decisão restante.
Saber qual modelo vence não diz o que construir com ele.
A MentorMe transforma o modelo que você escolheu num roadmap de 90 dias para o seu negócio de verdade — não uma biblioteca genérica de prompts.
Construir meu roadmap de 90 dias grátis →Modelo certo, plano errado ainda é nenhum plano.
— por que esta página termina com um roadmap, não só um leaderboard
▲ O modelo é uma ferramenta, não uma estratégia
▲ 05 — diretório completo de modelos
Cada modelo, por fornecedor
Anthropic
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Claude Fable 5 | $10 / $50 | 1M | Não |
| Claude Opus 5 | $5 / $25 | 1M | Não |
| Claude Opus 4.8 | $5 / $25 | 1M | Não |
| Claude Sonnet 5 | $3 / $15 ($2/$10 introdução) | 1M | Não |
| Claude Haiku 4.5 | $1 / $5 | 200K | Não |
OpenAI
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| GPT-5.6 Sol | ~$5 / $30 | ~1,05M | Não |
| GPT-5.6 Terra | ~$2,50 / $15 | ~1,05M | Não |
| GPT-5.6 Luna | ~$1 / $6 | ~1,05M | Não |
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Gemini 3.1 Pro | ~$2–4 / $12–18 | 1M | Não |
| Gemini 3.6 Flash | ~$1,50 / $7,50 | 1.048.576 | Não |
xAI
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Grok 4.5 | ~$2 / $6 | n/a | Não |
| Grok 4.3 / 4.20 | ~$1,25 / $2,50 | n/a | Não |
| Grok 4.1 Fast | ~$0,20 / $0,50 | n/a | Não |
Meta
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Llama 5 "Avocado" | pesos abertos | 5M (alegado) | Sim |
DeepSeek
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| DeepSeek V4 Pro / Pro-Max | ~$0,44 / $0,87 | 1M (alegado) | Sim |
| DeepSeek V4 Flash | ~$0,14 / $0,28 | 1M (alegado) | Sim |
Mistral
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Mistral Large 3 | $0,50–2 / $1,50–6 (disputado) | 128K | Não confirmado |
Alibaba
| Modelo | Preço ($/MTok entrada/saída) | Contexto | Pesos abertos |
|---|---|---|---|
| Qwen 3.5-397B-A17B | ~$0,60 / $3,60 | n/a | Sim |
| Qwen 3.5 Plus | ~$0,40 / $2,40 | n/a | Sim |
| Qwen 3.5 Flash | ~$0,10 / $0,40 | n/a | Sim |
"*" marca um número alegado tratado com real ceticismo nesta página — o contexto de 5M do Llama 5 e o preço disputado do Mistral Large 3 são os principais exemplos.
▲ 06 — quem deveria trocar para o quê
Seis tipos de usuário, seis movimentos
Dev solo (projetos paralelos, ferramentas pessoais)
Claude Sonnet 5 no preço de introdução ($2/$10) — qualidade de codificação quase-Opus, barato o suficiente para iteração diária, o preço de introdução vale até 31 de agosto de 2026.
Startup lançando produto
Sonnet 5 para o caminho principal de agente/codificação; DeepSeek V4 Pro para tarefas de fundo de alto volume e baixo risco, cortando o gasto com inferência em cerca de 10–20x.
Empresa (planilhas, jurídico, financeiro)
Claude Opus 5 pela geração nativa documentada de .xlsx/.pptx e o maior número verificado de SWE-bench; combine com o Gemini 3.1 Pro para ingestão de documentos muito longos.
Pesquisador (raciocínio, matemática, ciência)
Gemini 3.1 Pro pelos ganhos no GPQA Diamond e ARC-AGI-2, com o GPT-5.6 Sol como checagem cruzada quase empatada — rodar os dois é um seguro barato dado o quanto estão próximos.
App de API de alto volume (chatbots, pipelines)
DeepSeek V4 Flash ($0,14/$0,28) se você tolerar um SLA/suporte menos comprovado, ou Claude Haiku 4.5 ($1/$5) pela confiabilidade de primeira parte.
Usuário não técnico do dia a dia
Claude no Sonnet 5 ou Opus 5 para qualidade de escrita e raciocínio sem precisar pensar em IDs de modelo, ou Gemini se você já estiver dentro do Google Workspace.
Seis movimentos acima. Um deles é o seu.
Leia a seguir os guias mais profundos dos modelos da Anthropic.
Esta página classifica o Opus 5 como o vencedor em codificação agêntica e orquestração multiagente. Veja exatamente como ele e o Fable 5 se comportam dentro de um fluxo de trabalho real de fundador.
▲ 07 — respostas diretas
O que as pessoas estão realmente buscando
Qual é o melhor LLM em 2026?
Não há um único "melhor" modelo — depende do trabalho. Para codificação agêntica, o Claude Opus 5 traz a maior pontuação reportada de SWE-bench Verified encontrada nesta pesquisa (96%, não confirmado-secundário). Em qualidade por dólar, o DeepSeek V4 Pro iguala a pontuação de codificação de um modelo principal do Google a cerca de 1/28 do preço de saída. Escolha por categoria, não pela manchete.
Qual é o melhor modelo de IA para programar?
Claude Opus 5 para o trabalho agêntico mais difícil, Claude Sonnet 5 para uso do dia a dia em IDE/autocompletar por uma fração do preço (preço de introdução $2/$10 por MTok até 31 de agosto de 2026), e DeepSeek V4 Pro se custo por token for a restrição decisiva. Todos os números de benchmark de fora da Anthropic aqui são não confirmados-secundários — verifique antes de decidir uma compra só com base neles.
Qual é o LLM mais barato com bom desempenho?
DeepSeek V4 Flash é o menor preço verificado encontrado ($0,14 entrada / $0,28 saída por MTok, não confirmado-secundário). Claude Haiku 4.5 ($1/$5, preço oficial da Anthropic) custa mais, mas carrega SLA de primeira parte e maturidade de suporte que as opções mais baratas de pesos abertos ainda não têm histórico comprovado.
O Llama 5 é realmente melhor que o Claude e o Gemini?
Trate essa alegação com bastante ceticismo. A linguagem do Llama 5 de "iguala ou supera o GPT-5 e o Gemini 2.0" é comparação vaga e sem fonte, de marketing, não uma execução de benchmark pontuada, e ainda referencia um ponto de comparação de 2026 já desatualizado (Gemini 2.0). Nenhuma tabela de benchmark independente para o Llama 5 foi encontrada nesta pesquisa. Sua alegação de janela de contexto de 5M tokens é a maior encontrada em qualquer lugar, se ela se confirmar — mas não foi verificada de forma independente.
Quão confiáveis são os preços desta página?
Os preços e janelas de contexto da Anthropic são oficiais, retirados da própria documentação da Anthropic. Todos os outros números de fornecedores vieram de sites agregadores secundários, não das páginas de preço dos fornecedores, e alguns se contradizem abertamente — só o Mistral Large 3 tem duas cotações de preço mutuamente excludentes em circulação. Confirme qualquer número que não seja da Anthropic na própria página de preços do fornecedor antes de planejar orçamento com base nele.
Fundador —
Escolher o modelo certo é a parte fácil. Qualquer um consegue ler um leaderboard. A parte difícil é saber o que realmente construir com ele — qual fluxo de trabalho, qual oferta, quais 90 dias de movimentos transformam um modelo mais inteligente em mais receita.
Essa é a parte que uma página de comparação não consegue fazer por você. Essa é a parte que a gente faz.
Escolha seu modelo. Depois venha construir o plano.
— Italo
▲ O modelo está escolhido. O plano não.