MentorMe

Todos os principais modelos, numa página só — atualizado em 24/07/2026

O melhor LLM em 2026: todos os principais modelos comparados.

Claude, GPT, Gemini, Grok, Llama, DeepSeek, Mistral e Qwen — em preço, contexto e nos benchmarks que as pessoas realmente citam.

Escolher um modelo não deveria exigir ler onze blogs de fornecedores e cruzar três leaderboards. Esta página faz esse trabalho, e diz claramente em quais números você pode confiar e em quais não pode.

▲ 01 — antes de um único número

Como ler esta página

Oficial

Retirado diretamente da documentação de preços e de modelos publicada pela própria Anthropic. Todo preço e janela de contexto da Claude nesta página é oficial.

Não confirmado — agregador

Todo número que não é da Anthropic nesta página — OpenAI, Google, xAI, Meta, DeepSeek, Mistral, Alibaba — veio de sites agregadores secundários (rastreadores de leaderboard, resumos de model card, posts de blog), porque nenhuma página oficial de preços de primeira parte foi consultada para nenhum deles nesta pesquisa. Trate como direcional, não confirmado pelo fornecedor.

Fontes em disputa

Um pequeno número de valores se contradiz entre fontes — o preço do Mistral Large 3 é citado de duas formas diferentes, sem como reconciliar a partir desta pesquisa. Mostrado como faixa, sinalizado, nunca calculado numa média falsa.

Não diretamente comparável

Alguns "vencedores" de categoria são medidos em benchmarks diferentes por fontes diferentes — a comparação de uso de computador mistura pontuações do OSWorld e do Online-Mind2Web, por exemplo. Marcado como apenas direcional, não um confronto direto limpo.

Nada que a pesquisa não conseguiu confirmar foi estimado aqui. A geração atual do modelo principal da Qwen (3.6/3.7, que substitui o Qwen 3.5 perfilado abaixo), o status real do DeepSeek R2/V5, e um benchmark pontuado de escrita longa para qualquer fornecedor foram todas lacunas nesta pesquisa — estão nomeadas como lacunas, não preenchidas por estimativa.

▲ 02 — a escada de preços

Preço de saída, cada nível, $/MTok

Ordenado do mais barato ao mais caro. Barras douradas são o preço oficial da Anthropic; barras em teal são números não confirmados de agregador para todo outro fornecedor.

Preço de saída por milhão de tokens, por modeloGráfico de barras horizontais com 19 modelos ordenados do mais barato ao mais caro por preço de saída em dólares por milhão de tokens. Barras da Anthropic são marcadas como oficiais; toda outra barra é um número não confirmado de agregador.DeepSeek V4 Flash$0.28Qwen 3.5 Flash$0.40Grok 4.1 Fast$0.50DeepSeek V4 Pro$0.87Qwen 3.5 Plus$2.40Claude Haiku 4.5$5.00GPT-5.6 Luna$6.00Qwen 3.5-397B-A17B$3.60Grok 4.3 / 4.20$2.50Gemini 3.6 Flash$7.50GPT-5.6 Terra$15.00Claude Sonnet 5 (introdução, até 31/8)$10.00Claude Sonnet 5 (padrão)$15.00Grok 4.5$6.00Gemini 3.1 Pro (<200K ctx)$12.00Gemini 3.1 Pro (>200K ctx)$18.00GPT-5.6 Sol$30.00Claude Opus 5$25.00Claude Fable 5$50.00

▲ 03 — a matriz de benchmarks

Cinco números que todo mundo cita

SWE-bench Verified (codificação), GPQA Diamond (raciocínio/ciência), Artificial Analysis Intelligence Index (composto), janela de contexto e preço de saída. n/a significa que o número não apareceu nesta pesquisa — não que o modelo não o reporte.

ModeloSWE-bench VerifiedGPQA DiamondAA IndexContextoSaída $/MTok
Claude Opus 596,0n/an/a1.000.000$25Não confirmado — agregador
Claude Fable 595,0n/a~601.000.000$50Não confirmado — agregador
Claude Opus 4.8n/an/a61,41.000.000$25Não confirmado — agregador
Claude Sonnet 5n/an/an/a1.000.000$15Oficial
GPT-5.6 Soln/a94,1–94,6~55*~1.050.000$30Não confirmado — agregador
Gemini 3.1 Pro80,694,3n/a1.000.000$12–18Não confirmado — agregador
Gemini 3.6 Flashn/an/an/a1.048.576$7,50Não confirmado — agregador
Grok 4.5n/an/a54n/a$6Não confirmado — agregador
DeepSeek V4 Pro80,6n/an/a1.000.000$0,87Não confirmado — agregador
Mistral Large 3n/an/a16,2128.000$1,50–6*Fontes em disputa
Qwen 3.5-397B-A17Bn/an/an/an/a$3,60Não confirmado — agregador
Llama 5 "Avocado"n/an/an/a5.000.000*pesos abertosNão confirmado — agregador

* As fontes discordam sobre qual modelo lidera o AA Intelligence Index (o ~55 do GPT-5.6 Sol é citado via GPT-5.5; o 16,2 do Mistral Large 3 e sua faixa de preço estão ambos em disputa entre rastreadores).

Qualidade vs. preço — a fronteira de valor

Apenas modelos com uma pontuação SWE-bench Verified reportada E um preço são plotados. Canto inferior esquerdo é barato-e-fraco; superior esquerdo é a fronteira de valor.

Pontuação reportada de benchmark de codificação versus preço de saídaGráfico de dispersão de cinco modelos com uma pontuação SWE-bench Verified reportada, eixo x preço de saída por milhão de tokens, eixo y pontuação SWE-bench Verified. Todas as pontuações de benchmark plotadas aqui são números não confirmados-secundários de agregador, não confirmados pelo fornecedor.$0$10$20$30$40$5055%65%75%85%95%Preço de saída, $/MTokSWE-bench Verified, %DeepSeek V4 ProGemini 3.1 ProClaude Opus 4.6Claude Opus 5Claude Fable 5
Cada ponto = um modeloNão confirmado — agregador

▲ 04 — as doze categorias

Vencedor, por que importa

01 · CODIFICAÇÃO AGÊNTICA

Não confirmado — agregador

Claude Opus 5

96% no SWE-bench Verified, o maior número encontrado entre as fontes, por menos da metade do preço do Fable 5.

02 · CODIFICAÇÃO DO DIA A DIA / TRABALHO DE IDE

Oficial

Claude Sonnet 5

Qualidade de codificação quase-Opus a preço de introdução de $2/$10 até 31 de agosto de 2026 — a escolha padrão para autocompletar e agente.

03 · MELHOR CUSTO-BENEFÍCIO (QUALIDADE POR DÓLAR)

Não confirmado — agregador

DeepSeek V4 Pro

Iguala a pontuação de SWE-bench de um modelo principal do Google a cerca de 1/28 do custo de saída por token do Opus 4.8.

04 · CONTEXTO LONGO / TRABALHO COM O REPOSITÓRIO INTEIRO

Não diretamente comparável

Llama 5 "Avocado"

Janela alegada de 5M tokens — a maior encontrada, mas não verificada e com forte tom de marketing. Escolha mais segura: o nível de 1M de contexto da Anthropic/Google.

05 · RACIOCÍNIO E MATEMÁTICA

Não confirmado — agregador

Gemini 3.1 Pro

GPQA Diamond 94,3% (alegado o maior já registrado) e o maior salto único em benchmark de raciocínio encontrado (ARC-AGI-2: 31,1% → 77,1%).

06 · ESCRITA E PROSA LONGA

Não diretamente comparável

Claude Opus 4.8

Não existe benchmark de escrita de terceiros para nenhum fornecedor — isso ranqueia apenas com base na linguagem documentada de descrição do modelo, a categoria com evidência mais fraca desta página.

07 · VISÃO E COMPREENSÃO DE DOCUMENTOS

Não confirmado — agregador

Gemini 3.1 Pro / 3.6 Flash

O único fornecedor confirmado a aceitar entrada nativa de vídeo e áudio em toda a sua linha, até o nível mais barato.

08 · USO DE COMPUTADOR / AUTOMAÇÃO DE NAVEGADOR

Não diretamente comparável

GPT-5.4

Líder reportado no OSWorld com 75,0% — mas isso é medido num benchmark diferente (OSWorld vs Online-Mind2Web) do vice-líder, então trate este ranking apenas como direcional.

09 · MELHOR MODELO DE PESOS ABERTOS

Não confirmado — agregador

DeepSeek V4 Pro-Max

Maior pontuação confirmada de SWE-bench em pesos abertos (80,6%), corroborada por múltiplas fontes com números específicos.

10 · BARATO/RÁPIDO, ALTO VOLUME

Não confirmado — agregador

DeepSeek V4 Flash

$0,14/$0,28 por MTok — o menor preço por token verificado encontrado, cerca de 7x mais barato que o Haiku 4.5.

11 · TRABALHO CORPORATIVO DE CONHECIMENTO

Oficial

Claude Opus 5 / Opus 4.8

A capacidade nativa de geração de planilha/slide mais concretamente documentada (Agent Skills xlsx/pptx com fórmulas reais) encontrada entre todos os fornecedores.

12 · ORQUESTRAÇÃO MULTIAGENTE

Oficial

Claude Opus 5

O único fornecedor com uma API coordenadora multiagente documentada e de primeira classe (até 20 agentes na lista) em vez de um padrão via prompt.

Doze vencedores. Uma decisão restante.

Saber qual modelo vence não diz o que construir com ele.

A MentorMe transforma o modelo que você escolheu num roadmap de 90 dias para o seu negócio de verdade — não uma biblioteca genérica de prompts.

Construir meu roadmap de 90 dias grátis →

Modelo certo, plano errado ainda é nenhum plano.

— por que esta página termina com um roadmap, não só um leaderboard

O modelo é uma ferramenta, não uma estratégia

▲ 05 — diretório completo de modelos

Cada modelo, por fornecedor

Anthropic

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Claude Fable 5$10 / $501MNão
Claude Opus 5$5 / $251MNão
Claude Opus 4.8$5 / $251MNão
Claude Sonnet 5$3 / $15 ($2/$10 introdução)1MNão
Claude Haiku 4.5$1 / $5200KNão

OpenAI

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
GPT-5.6 Sol~$5 / $30~1,05MNão
GPT-5.6 Terra~$2,50 / $15~1,05MNão
GPT-5.6 Luna~$1 / $6~1,05MNão

Google

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Gemini 3.1 Pro~$2–4 / $12–181MNão
Gemini 3.6 Flash~$1,50 / $7,501.048.576Não

xAI

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Grok 4.5~$2 / $6n/aNão
Grok 4.3 / 4.20~$1,25 / $2,50n/aNão
Grok 4.1 Fast~$0,20 / $0,50n/aNão

Meta

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Llama 5 "Avocado"pesos abertos5M (alegado)Sim

DeepSeek

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
DeepSeek V4 Pro / Pro-Max~$0,44 / $0,871M (alegado)Sim
DeepSeek V4 Flash~$0,14 / $0,281M (alegado)Sim

Mistral

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Mistral Large 3$0,50–2 / $1,50–6 (disputado)128KNão confirmado

Alibaba

ModeloPreço ($/MTok entrada/saída)ContextoPesos abertos
Qwen 3.5-397B-A17B~$0,60 / $3,60n/aSim
Qwen 3.5 Plus~$0,40 / $2,40n/aSim
Qwen 3.5 Flash~$0,10 / $0,40n/aSim

"*" marca um número alegado tratado com real ceticismo nesta página — o contexto de 5M do Llama 5 e o preço disputado do Mistral Large 3 são os principais exemplos.

▲ 06 — quem deveria trocar para o quê

Seis tipos de usuário, seis movimentos

Dev solo (projetos paralelos, ferramentas pessoais)

Claude Sonnet 5 no preço de introdução ($2/$10) — qualidade de codificação quase-Opus, barato o suficiente para iteração diária, o preço de introdução vale até 31 de agosto de 2026.

Startup lançando produto

Sonnet 5 para o caminho principal de agente/codificação; DeepSeek V4 Pro para tarefas de fundo de alto volume e baixo risco, cortando o gasto com inferência em cerca de 10–20x.

Empresa (planilhas, jurídico, financeiro)

Claude Opus 5 pela geração nativa documentada de .xlsx/.pptx e o maior número verificado de SWE-bench; combine com o Gemini 3.1 Pro para ingestão de documentos muito longos.

Pesquisador (raciocínio, matemática, ciência)

Gemini 3.1 Pro pelos ganhos no GPQA Diamond e ARC-AGI-2, com o GPT-5.6 Sol como checagem cruzada quase empatada — rodar os dois é um seguro barato dado o quanto estão próximos.

App de API de alto volume (chatbots, pipelines)

DeepSeek V4 Flash ($0,14/$0,28) se você tolerar um SLA/suporte menos comprovado, ou Claude Haiku 4.5 ($1/$5) pela confiabilidade de primeira parte.

Usuário não técnico do dia a dia

Claude no Sonnet 5 ou Opus 5 para qualidade de escrita e raciocínio sem precisar pensar em IDs de modelo, ou Gemini se você já estiver dentro do Google Workspace.

Seis movimentos acima. Um deles é o seu.

Leia a seguir os guias mais profundos dos modelos da Anthropic.

Esta página classifica o Opus 5 como o vencedor em codificação agêntica e orquestração multiagente. Veja exatamente como ele e o Fable 5 se comportam dentro de um fluxo de trabalho real de fundador.

▲ 07 — respostas diretas

O que as pessoas estão realmente buscando

Qual é o melhor LLM em 2026?

Não há um único "melhor" modelo — depende do trabalho. Para codificação agêntica, o Claude Opus 5 traz a maior pontuação reportada de SWE-bench Verified encontrada nesta pesquisa (96%, não confirmado-secundário). Em qualidade por dólar, o DeepSeek V4 Pro iguala a pontuação de codificação de um modelo principal do Google a cerca de 1/28 do preço de saída. Escolha por categoria, não pela manchete.

Qual é o melhor modelo de IA para programar?

Claude Opus 5 para o trabalho agêntico mais difícil, Claude Sonnet 5 para uso do dia a dia em IDE/autocompletar por uma fração do preço (preço de introdução $2/$10 por MTok até 31 de agosto de 2026), e DeepSeek V4 Pro se custo por token for a restrição decisiva. Todos os números de benchmark de fora da Anthropic aqui são não confirmados-secundários — verifique antes de decidir uma compra só com base neles.

Qual é o LLM mais barato com bom desempenho?

DeepSeek V4 Flash é o menor preço verificado encontrado ($0,14 entrada / $0,28 saída por MTok, não confirmado-secundário). Claude Haiku 4.5 ($1/$5, preço oficial da Anthropic) custa mais, mas carrega SLA de primeira parte e maturidade de suporte que as opções mais baratas de pesos abertos ainda não têm histórico comprovado.

O Llama 5 é realmente melhor que o Claude e o Gemini?

Trate essa alegação com bastante ceticismo. A linguagem do Llama 5 de "iguala ou supera o GPT-5 e o Gemini 2.0" é comparação vaga e sem fonte, de marketing, não uma execução de benchmark pontuada, e ainda referencia um ponto de comparação de 2026 já desatualizado (Gemini 2.0). Nenhuma tabela de benchmark independente para o Llama 5 foi encontrada nesta pesquisa. Sua alegação de janela de contexto de 5M tokens é a maior encontrada em qualquer lugar, se ela se confirmar — mas não foi verificada de forma independente.

Quão confiáveis são os preços desta página?

Os preços e janelas de contexto da Anthropic são oficiais, retirados da própria documentação da Anthropic. Todos os outros números de fornecedores vieram de sites agregadores secundários, não das páginas de preço dos fornecedores, e alguns se contradizem abertamente — só o Mistral Large 3 tem duas cotações de preço mutuamente excludentes em circulação. Confirme qualquer número que não seja da Anthropic na própria página de preços do fornecedor antes de planejar orçamento com base nele.

Fundador —

Escolher o modelo certo é a parte fácil. Qualquer um consegue ler um leaderboard. A parte difícil é saber o que realmente construir com ele — qual fluxo de trabalho, qual oferta, quais 90 dias de movimentos transformam um modelo mais inteligente em mais receita.

Essa é a parte que uma página de comparação não consegue fazer por você. Essa é a parte que a gente faz.

Escolha seu modelo. Depois venha construir o plano.

— Italo

O modelo está escolhido. O plano não.

Transforme o modelo certo no seu plano de 90 dias.

Construir meu roadmap de 90 dias →
Roadmap grátis · 4 minutos · sem cartãoConstruído em torno do seu negócio — não um modelo genérico