MentorMe

Tous les grands modèles, une seule page — mis à jour le 24/07/2026

Le meilleur LLM en 2026 : tous les grands modèles comparés.

Claude, GPT, Gemini, Grok, Llama, DeepSeek, Mistral et Qwen — sur le prix, le contexte, et les benchmarks que tout le monde cite.

Choisir un modèle ne devrait pas exiger de lire onze blogs d'éditeurs et de recouper trois classements. Cette page fait ce travail à votre place, et vous dit clairement quels chiffres sont fiables et lesquels ne le sont pas.

▲ 01 — avant le premier chiffre

Comment lire cette page

Officiel

Tiré directement de la documentation officielle d'Anthropic sur les tarifs et les modèles. Chaque prix et fenêtre de contexte Claude sur cette page est officiel.

Non vérifié — agrégateur

Chaque chiffre non-Anthropic sur cette page — OpenAI, Google, xAI, Meta, DeepSeek, Mistral, Alibaba — provient de sites agrégateurs secondaires (trackers de classements, résumés de fiches modèles, articles de blog), car aucune page de tarifs officielle de premier éditeur n'a été consultée pour aucun d'eux dans cette recherche. À traiter comme directionnellement utile, pas confirmé par l'éditeur.

Sources contradictoires

Un petit nombre de chiffres se contredisent selon les sources — le tarif de Mistral Large 3 est cité de deux manières différentes sans possibilité de les réconcilier à partir de cette recherche. Présenté comme une fourchette, signalé, jamais moyenné en un faux chiffre unique.

Non directement comparable

Certains « gagnants » de catégorie sont mesurés sur des benchmarks différents selon les sources — la comparaison de l'usage d'ordinateur mélange par exemple les scores OSWorld et Online-Mind2Web. Marqué comme directionnel uniquement, pas une confrontation directe propre.

Rien de ce que la recherche n'a pas pu établir n'est deviné ici. La génération phare actuelle de Qwen (3.6/3.7, qui succède au Qwen 3.5 présenté ci-dessous), le statut réel de DeepSeek R2/V5, et un benchmark d'écriture longue scoré pour tout éditeur étaient tous des lacunes dans cette recherche — elles sont nommées comme des lacunes, pas comblées.

▲ 02 — l'échelle de prix

Prix de sortie, tous paliers, $/MTok

Trié du moins cher au plus cher. Les barres dorées sont les tarifs officiels d'Anthropic ; les barres sarcelle sont des chiffres d'agrégateurs non vérifiés pour tous les autres éditeurs.

Prix de sortie par million de tokens, par modèleDiagramme à barres horizontales de 19modèles triés du moins cher au plus cher en prix de sortie en dollars par million de tokens. Les barres Anthropic sont marquées officielles ; toutes les autres sont des chiffres d'agrégateurs non vérifiés.DeepSeek V4 Flash$0.28Qwen 3.5 Flash$0.40Grok 4.1 Fast$0.50DeepSeek V4 Pro$0.87Qwen 3.5 Plus$2.40Claude Haiku 4.5$5.00GPT-5.6 Luna$6.00Qwen 3.5-397B-A17B$3.60Grok 4.3 / 4.20$2.50Gemini 3.6 Flash$7.50GPT-5.6 Terra$15.00Claude Sonnet 5 (lancement, jusqu'au 31 août)$10.00Claude Sonnet 5 (standard)$15.00Grok 4.5$6.00Gemini 3.1 Pro (<200K ctx)$12.00Gemini 3.1 Pro (>200K ctx)$18.00GPT-5.6 Sol$30.00Claude Opus 5$25.00Claude Fable 5$50.00

▲ 03 — la matrice de benchmarks

Cinq chiffres que tout le monde cite

SWE-bench Verified (code), GPQA Diamond (raisonnement/science), Artificial Analysis Intelligence Index (composite), fenêtre de contexte, et prix de sortie. n/dsignifie que le chiffre n'a pas été trouvé dans cette recherche — pas que le modèle ne le publie pas.

ModèleSWE-bench VerifiedGPQA DiamondIndice AAContexteSortie $/MTok
Claude Opus 596.0n/dn/d1 000 00025 $Non vérifié — agrégateur
Claude Fable 595.0n/d~601 000 00050 $Non vérifié — agrégateur
Claude Opus 4.8n/dn/d61.41 000 00025 $Non vérifié — agrégateur
Claude Sonnet 5n/dn/dn/d1 000 00015 $Officiel
GPT-5.6 Soln/d94.1–94.6~55*~1 050 00030 $Non vérifié — agrégateur
Gemini 3.1 Pro80.694.3n/d1 000 00012–18 $Non vérifié — agrégateur
Gemini 3.6 Flashn/dn/dn/d1 048 5767,50 $Non vérifié — agrégateur
Grok 4.5n/dn/d54n/d6 $Non vérifié — agrégateur
DeepSeek V4 Pro80.6n/dn/d1 000 0000,87 $Non vérifié — agrégateur
Mistral Large 3n/dn/d16.2128 0001,50–6 $*Sources contradictoires
Qwen 3.5-397B-A17Bn/dn/dn/dn/d3,60 $Non vérifié — agrégateur
Llama 5 « Avocado »n/dn/dn/d5 000 000*poids ouvertsNon vérifié — agrégateur

* Les sources ne s'accordent pas sur le modèle en tête de l'indice AA Intelligence (le ~55 de GPT-5.6 Sol est cité via GPT-5.5 ; le 16,2 et la fourchette de prix de Mistral Large 3 sont tous deux contestés selon les trackers.

Qualité vs prix — la frontière de valeur

Seuls les modèles avec à la fois un score SWE-bench Verified rapporté et un prix sont tracés. En bas à gauche, c'est bon marché et faible ; en haut à gauche, c'est la frontière de valeur.

Score de benchmark de code rapporté versus prix de sortieNuage de points de cinq modèles avec un score SWE-bench Verified rapporté, axe des x le prix de sortie par million de tokens, axe des y le score SWE-bench Verified. Tous les scores de benchmark tracés ici sont des chiffres d'agrégateurs non vérifiés-secondaires, non confirmés par les éditeurs.$0$10$20$30$40$5055%65%75%85%95%Prix de sortie, $/MTokSWE-bench Verified, %DeepSeek V4 ProGemini 3.1 ProClaude Opus 4.6Claude Opus 5Claude Fable 5
Chaque point = un modèleNon vérifié — agrégateur

▲ 04 — les douze catégories

Gagnant, et pourquoi ça compte

01 · CODE AGENTIQUE

Non vérifié — agrégateur

Claude Opus 5

96 % sur SWE-bench Verified, le chiffre le plus élevé trouvé toutes sources confondues, à moins de la moitié du prix de Fable 5.

02 · CODE QUOTIDIEN / TRAVAIL EN IDE

Officiel

Claude Sonnet 5

Qualité de code proche d'Opus au tarif de lancement 2 $/10 $ jusqu'au 31 août 2026 — le choix par défaut pour l'autocomplétion et l'agent.

03 · MEILLEUR RAPPORT QUALITÉ-PRIX

Non vérifié — agrégateur

DeepSeek V4 Pro

Égale le score SWE-bench d'un modèle phare de Google pour environ 1/28e du coût par token en sortie d'Opus 4.8.

04 · CONTEXTE LONG / TRAVAIL SUR DÉPÔT ENTIER

Non directement comparable

Llama 5 « Avocado »

Fenêtre revendiquée de 5M tokens — la plus grande trouvée, mais non vérifiée et très marketing. Choix plus sûr : le palier à contexte 1M d'Anthropic/Google.

05 · RAISONNEMENT & MATHÉMATIQUES

Non vérifié — agrégateur

Gemini 3.1 Pro

GPQA Diamond 94,3 % (revendiqué comme le plus élevé jamais enregistré) et le plus grand bond sur un seul benchmark de raisonnement trouvé (ARC-AGI-2 : 31,1 % → 77,1 %).

06 · ÉCRITURE & PROSE LONGUE

Non directement comparable

Claude Opus 4.8

Aucun benchmark d'écriture tiers n'existe pour aucun éditeur — ce classement repose uniquement sur le langage descriptif documenté des modèles, la catégorie la moins étayée de cette page.

07 · VISION & COMPRÉHENSION DE DOCUMENTS

Non vérifié — agrégateur

Gemini 3.1 Pro / 3.6 Flash

Le seul éditeur confirmé à prendre en charge nativement la vidéo et l'audio en entrée sur toute sa gamme, jusqu'au palier le moins cher.

08 · USAGE D'ORDINATEUR / AUTOMATISATION NAVIGATEUR

Non directement comparable

GPT-5.4

Leader rapporté sur OSWorld à 75,0 % — mais mesuré sur un benchmark différent (OSWorld vs Online-Mind2Web) que le second, donc à traiter comme directionnel uniquement.

09 · MEILLEUR MODÈLE À POIDS OUVERTS

Non vérifié — agrégateur

DeepSeek V4 Pro-Max

Le score SWE-bench confirmé le plus élevé en poids ouverts (80,6 %), corroboré par plusieurs sources avec des chiffres précis.

10 · TRAVAIL BON MARCHÉ/RAPIDE, GROS VOLUMES

Non vérifié — agrégateur

DeepSeek V4 Flash

0,14 $/0,28 $ par MTok — le prix le plus bas vérifié trouvé, environ 7 fois moins cher que Haiku 4.5.

11 · TRAVAIL DE CONNAISSANCE EN ENTREPRISE

Officiel

Claude Opus 5 / Opus 4.8

La capacité de génération native de tableurs/présentations la plus concrètement documentée (Agent Skills xlsx/pptx avec de vraies formules) trouvée chez tout éditeur.

12 · ORCHESTRATION MULTI-AGENTS

Officiel

Claude Opus 5

Le seul éditeur avec une API de coordination multi-agents documentée et de première classe (jusqu'à 20 agents en équipe) plutôt qu'un schéma obtenu par prompt.

Douze gagnants. Une décision restante.

Savoir quel modèle gagne ne vous dit pas quoi construire avec.

MentorMe transforme le modèle que vous choisissez en une feuille de route sur 90 jours pour votre entreprise réelle — pas une bibliothèque de prompts générique.

Construire ma feuille de route gratuite sur 90 jours →

Le bon modèle, le mauvais plan, ça reste aucun plan.

— pourquoi cette page se termine par une feuille de route, pas juste un classement

Le modèle est un outil, pas une stratégie

▲ 05 — annuaire complet des modèles

Chaque modèle, par éditeur

Anthropic

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Claude Fable 510 $ / 50 $1MNon
Claude Opus 55 $ / 25 $1MNon
Claude Opus 4.85 $ / 25 $1MNon
Claude Sonnet 53 $ / 15 $ (2 $/10 $ lancement)1MNon
Claude Haiku 4.51 $ / 5 $200KNon

OpenAI

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
GPT-5.6 Sol~5 $ / 30 $~1,05MNon
GPT-5.6 Terra~2,50 $ / 15 $~1,05MNon
GPT-5.6 Luna~1 $ / 6 $~1,05MNon

Google

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Gemini 3.1 Pro~2–4 $ / 12–18 $1MNon
Gemini 3.6 Flash~1,50 $ / 7,50 $1 048 576Non

xAI

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Grok 4.5~2 $ / 6 $n/dNon
Grok 4.3 / 4.20~1,25 $ / 2,50 $n/dNon
Grok 4.1 Fast~0,20 $ / 0,50 $n/dNon

Meta

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Llama 5 « Avocado »poids ouverts5M (revendiqué)Oui

DeepSeek

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
DeepSeek V4 Pro / Pro-Max~0,44 $ / 0,87 $1M (revendiqué)Oui
DeepSeek V4 Flash~0,14 $ / 0,28 $1M (revendiqué)Oui

Mistral

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Mistral Large 30,50–2 $ / 1,50–6 $ (contesté)128KNon confirmé

Alibaba

ModèlePrix ($/MTok entrée/sortie)ContextePoids ouverts
Qwen 3.5-397B-A17B~0,60 $ / 3,60 $n/dOui
Qwen 3.5 Plus~0,40 $ / 2,40 $n/dOui
Qwen 3.5 Flash~0,10 $ / 0,40 $n/dOui

« * » marque un chiffre revendiqué traité avec un vrai scepticisme dans cette page — le contexte de 5M de Llama 5 et le tarif contesté de Mistral Large 3 en premier lieu.

▲ 06 — qui devrait passer à quoi

Six profils d'utilisateurs, six choix

Développeur solo (projets personnels, outils perso)

Claude Sonnet 5 au tarif de lancement (2 $/10 $) — qualité de code proche d'Opus, assez bon marché pour l'itération quotidienne, tarif de lancement jusqu'au 31 août 2026.

Startup qui expédie un produit

Sonnet 5 pour le chemin agent/code principal ; DeepSeek V4 Pro pour les tâches de fond à gros volume et faible enjeu, afin de réduire le coût d'inférence d'environ 10 à 20 fois.

Entreprise (tableurs, juridique, finance)

Claude Opus 5 pour la génération native documentée de .xlsx/.pptx et le score SWE-bench vérifié le plus élevé ; associez-le à Gemini 3.1 Pro pour l'ingestion de très longs documents.

Chercheur (raisonnement, mathématiques, science)

Gemini 3.1 Pro pour les gains sur GPQA Diamond et ARC-AGI-2, avec GPT-5.6 Sol comme vérification croisée quasi à égalité — faire tourner les deux est une assurance peu coûteuse vu à quel point ils sont proches.

Application API à haut volume (chatbots, pipelines)

DeepSeek V4 Flash (0,14 $/0,28 $) si vous tolérez un SLA/support moins éprouvé, ou Claude Haiku 4.5 (1 $/5 $) pour une fiabilité de premier éditeur.

Utilisateur quotidien non technique

Claude sur Sonnet 5 ou Opus 5 pour la qualité d'écriture et de raisonnement sans avoir à réfléchir aux identifiants de modèles, ou Gemini si vous êtes déjà dans Google Workspace.

Six choix ci-dessus. L'un d'eux est le vôtre.

Lisez ensuite les guides Anthropic plus approfondis.

Cette page classe Opus 5 comme gagnant en code agentique et orchestration multi-agents. Voyez exactement comment lui et Fable 5 se comportent dans un vrai workflow d'entrepreneur.

▲ 07 — des réponses franches

Ce que les gens recherchent vraiment

Quel est le meilleur LLM en 2026 ?

Il n'existe pas un seul « meilleur » modèle — cela dépend de la tâche. Pour le code agentique, Claude Opus 5 affiche le score SWE-bench Verified rapporté le plus élevé trouvé dans cette recherche (96 %, non vérifié-secondaire). Pour le meilleur rapport qualité-prix brut, DeepSeek V4 Pro égale le score de code d'un modèle phare de Google pour environ 1/28e du prix de sortie. Choisissez par catégorie, pas par gros titre.

Quel est le meilleur modèle IA pour coder ?

Claude Opus 5 pour le travail agentique le plus difficile, Claude Sonnet 5 pour l'usage quotidien en IDE/autocomplétion à une fraction du prix (tarif de lancement 2 $/10 $ par MTok jusqu'au 31 août 2026), et DeepSeek V4 Pro si le coût par token est la contrainte décisive. Tous les chiffres de benchmark non-Anthropic ici sont non vérifiés-secondaires — vérifiez avant de fonder une décision d'achat dessus seuls.

Quel est le LLM le moins cher avec de bonnes performances ?

DeepSeek V4 Flash est le prix vérifié le plus bas trouvé (0,14 $ en entrée / 0,28 $ en sortie par MTok, non vérifié-secondaire). Claude Haiku 4.5 (1 $/5 $, tarif officiel Anthropic) coûte plus cher mais offre un SLA et une maturité de support de premier éditeur que les options open-weights moins chères n'ont pas encore prouvés.

Llama 5 est-il vraiment meilleur que Claude et Gemini ?

Traitez cette affirmation avec un vrai scepticisme. Le langage « égale ou dépasse GPT-5 et Gemini 2.0 » de Llama 5 est un marketing comparatif vague et non sourcé, pas un résultat de benchmark scoré, et il fait référence à un point de comparaison 2026 déjà daté (Gemini 2.0). Aucun tableau de benchmark indépendant pour Llama 5 n'a été trouvé dans cette recherche. Sa fenêtre de contexte revendiquée de 5M tokens est la plus grande trouvée où que ce soit, si elle se confirme — mais elle n'a pas été vérifiée indépendamment.

Quelle est la fiabilité des prix sur cette page ?

Les tarifs et fenêtres de contexte d'Anthropic sont officiels, tirés directement de la documentation d'Anthropic. Tous les autres chiffres d'éditeurs proviennent de sites agrégateurs secondaires, pas des pages de tarifs des éditeurs, et certains se contredisent carrément — Mistral Large 3 a à lui seul deux devis de prix mutuellement exclusifs en circulation. Confirmez tout chiffre non-Anthropic sur la page de tarifs de l'éditeur lui-même avant de baser un budget dessus.

Fondateur —

Choisir le bon modèle, c'est la partie facile. N'importe qui peut lire un classement. La partie difficile, c'est de savoir quoi construire vraiment avec — quel workflow, quelle offre, quels 90 jours d'actions transforment un modèle plus intelligent en plus de revenu.

C'est la partie qu'une page de comparaison ne peut pas faire pour vous. C'est la partie qu'on fait.

Choisissez votre modèle. Puis venez construire le plan.

— Italo

Le modèle est choisi. Pas le plan.

Transformez le bon modèle en votre plan sur 90 jours.

Construire ma feuille de route sur 90 jours →
Feuille de route gratuite · 4 minutes · sans carteConstruite autour de votre entreprise — pas un modèle générique