MentorMe

Jedes große Modell, eine Seite — aktualisiert am 24.07.2026

Das beste LLM 2026: jedes große Modell im Vergleich.

Claude, GPT, Gemini, Grok, Llama, DeepSeek, Mistral und Qwen — nach Preis, Kontext und den Benchmarks, die tatsächlich zitiert werden.

Ein Modell auszuwählen sollte nicht bedeuten, elf Anbieter-Blogs zu lesen und drei Leaderboards querzuprüfen. Diese Seite übernimmt diese Arbeit — und sagt Ihnen klar, welchen Zahlen Sie trauen können und welchen nicht.

▲ 01 — bevor auch nur eine Zahl kommt

Wie Sie diese Seite lesen sollten

Offiziell

Direkt aus Anthropics eigener veröffentlichter Preis- und Modelldokumentation entnommen. Jeder Claude-Preis und jedes Kontextfenster auf dieser Seite ist offiziell.

Unbestätigt — Aggregator

Jede Nicht-Anthropic-Zahl auf dieser Seite — OpenAI, Google, xAI, Meta, DeepSeek, Mistral, Alibaba — stammt aus Sekundärquellen-Aggregatoren (Leaderboard-Tracker, Modellkarten-Zusammenfassungen, Blogbeiträge), da in diesem Rechercheschritt für keinen von ihnen eine offizielle Preisseite aus erster Hand abgerufen wurde. Behandeln Sie diese als richtungsweisend, nicht als anbieterbestätigt.

Umstrittene Quellen

Eine kleine Anzahl von Zahlen widerspricht sich zwischen den Quellen — der Preis von Mistral Large 3 wird in dieser Recherche auf zwei verschiedene Arten zitiert, ohne dass sie sich auflösen lassen. Gezeigt als Spanne, gekennzeichnet, nie zu einer falschen Einzelzahl gemittelt.

Nicht direkt vergleichbar

Manche Kategorien-„Gewinner" werden von unterschiedlichen Quellen auf unterschiedlichen Benchmarks gemessen — der Computernutzungs-Vergleich etwa vermischt OSWorld- und Online-Mind2Web-Werte. Als nur richtungsweisend markiert, kein sauberer Kopf-an-Kopf-Vergleich.

Nichts, was die Recherche nicht festnageln konnte, wird hier geraten. Qwens aktuelle Flaggschiff-Generation (3.6/3.7, die die unten porträtierte Qwen 3.5 ablöst), der tatsächliche Status von DeepSeek R2/V5, und ein bewerteter Langtext-Schreib-Benchmark für irgendeinen Anbieter waren allesamt Lücken in diesem Durchgang — sie werden als Lücken benannt, nicht aufgefüllt.

▲ 02 — die Preisleiter

Output-Preis, jede Stufe, $/MTok

Sortiert vom günstigsten zum teuersten. Goldene Balken sind Anthropics offizielle Preise; türkisfarbene Balken sind unbestätigte Aggregator-Zahlen für jeden anderen Anbieter.

Output-Preis pro Million Token, nach ModellHorizontales Balkendiagramm von 19 Modellen, sortiert vom günstigsten zum teuersten Output-Preis in Dollar pro Million Token. Anthropic-Balken sind als offiziell markiert; jeder andere Balken ist eine unbestätigte Aggregator-Zahl.DeepSeek V4 Flash$0.28Qwen 3.5 Flash$0.40Grok 4.1 Fast$0.50DeepSeek V4 Pro$0.87Qwen 3.5 Plus$2.40Claude Haiku 4.5$5.00GPT-5.6 Luna$6.00Qwen 3.5-397B-A17B$3.60Grok 4.3 / 4.20$2.50Gemini 3.6 Flash$7.50GPT-5.6 Terra$15.00Claude Sonnet 5 (Einführungspreis, bis 31.8.)$10.00Claude Sonnet 5 (Standard)$15.00Grok 4.5$6.00Gemini 3.1 Pro (<200K Kontext)$12.00Gemini 3.1 Pro (>200K Kontext)$18.00GPT-5.6 Sol$30.00Claude Opus 5$25.00Claude Fable 5$50.00

▲ 03 — die Benchmark-Matrix

Fünf Zahlen, die alle zitieren

SWE-bench Verified (Coding), GPQA Diamond (Reasoning/Wissenschaft), Artificial Analysis Intelligence Index (Komposit-Wert), Kontextfenster und Output-Preis. n/a bedeutet, dass die Zahl in diesem Rechercheschritt nicht gefunden wurde — nicht, dass das Modell sie nicht angibt.

ModellSWE-bench VerifiedGPQA DiamondAA IndexKontextOutput $/MTok
Claude Opus 596,0n/an/a1.000.000$25Unbestätigt — Aggregator
Claude Fable 595,0n/a~601.000.000$50Unbestätigt — Aggregator
Claude Opus 4.8n/an/a61,41.000.000$25Unbestätigt — Aggregator
Claude Sonnet 5n/an/an/a1.000.000$15Offiziell
GPT-5.6 Soln/a94,1–94,6~55*~1.050.000$30Unbestätigt — Aggregator
Gemini 3.1 Pro80,694,3n/a1.000.000$12–18Unbestätigt — Aggregator
Gemini 3.6 Flashn/an/an/a1.048.576$7,50Unbestätigt — Aggregator
Grok 4.5n/an/a54n/a$6Unbestätigt — Aggregator
DeepSeek V4 Pro80,6n/an/a1.000.000$0,87Unbestätigt — Aggregator
Mistral Large 3n/an/a16,2128.000$1,50–6*Umstrittene Quellen
Qwen 3.5-397B-A17Bn/an/an/an/a$3,60Unbestätigt — Aggregator
Llama 5 „Avocado"n/an/an/a5.000.000*offene GewichteUnbestätigt — Aggregator

* Quellen sind sich uneinig, welches Modell den AA Intelligence Index anführt (GPT-5.6 Sols ~55 wird über GPT-5.5 zitiert; Mistral Large 3s 16,2 und Preisspanne sind beide über Tracker hinweg umstritten.

Qualität vs. Preis — die Wertgrenze

Nur Modelle mit sowohl einem berichteten SWE-bench-Verified-Wert als auch einem Preis sind geplottet. Unten links ist günstig-und-schwach; oben links ist die Wertgrenze.

Berichteter Coding-Benchmark-Wert gegen Output-PreisStreudiagramm von fünf Modellen mit berichtetem SWE-bench-Verified-Prozentwert, X-Achse Output-Preis pro Million Token, Y-Achse SWE-bench-Verified-Wert. Alle hier geplotteten Benchmark-Werte sind unbestätigte Sekundärquellen-Angaben, nicht vom Anbieter bestätigt.$0$10$20$30$40$5055%65%75%85%95%Output-Preis, $/MTokSWE-bench Verified, %DeepSeek V4 ProGemini 3.1 ProClaude Opus 4.6Claude Opus 5Claude Fable 5
Jeder Punkt = ein ModellUnbestätigt — Aggregator

▲ 04 — die zwölf Kategorien

Gewinner, warum es zählt

01 · AGENTISCHES CODING

Unbestätigt — Aggregator

Claude Opus 5

96 % SWE-bench Verified, der höchste über alle Quellen gefundene Wert, bei unter der Hälfte von Fable 5s Preis.

02 · ALLTÄGLICHES CODING / IDE-ARBEIT

Offiziell

Claude Sonnet 5

Nahezu Opus-Coding-Qualität zum Einführungspreis von $2/$10 bis 31. August 2026 — die Standardwahl für Autocomplete und Agenten.

03 · BESTES PREIS-LEISTUNGS-VERHÄLTNIS

Unbestätigt — Aggregator

DeepSeek V4 Pro

Erreicht den SWE-bench-Wert eines Google-Flaggschiffs bei rund einem 28stel der Output-Kosten von Opus 4.8 pro Token.

04 · LANGER KONTEXT / GANZE-REPO-ARBEIT

Nicht direkt vergleichbar

Llama 5 „Avocado"

Behauptetes 5M-Token-Fenster — größtes gefundenes, aber unbestätigt und marketinglastig. Sichererer Griff: die 1M-Kontext-Stufe von Anthropic/Google.

05 · REASONING & MATHEMATIK

Unbestätigt — Aggregator

Gemini 3.1 Pro

GPQA Diamond 94,3 % (behauptet höchster je verzeichneter Wert) und der größte gefundene Einzelsprung bei einem Reasoning-Benchmark (ARC-AGI-2: 31,1 % → 77,1 %).

06 · SCHREIBEN & LANGTEXT

Nicht direkt vergleichbar

Claude Opus 4.8

Für keinen Anbieter existiert ein unabhängiger Schreib-Benchmark — diese Einstufung stützt sich nur auf dokumentierte Modellbeschreibungssprache, die am schwächsten belegte Kategorie auf dieser Seite.

07 · VISION & DOKUMENTENVERSTÄNDNIS

Unbestätigt — Aggregator

Gemini 3.1 Pro / 3.6 Flash

Der einzige bestätigte Anbieter, der über sein gesamtes Angebot hinweg nativ Video- und Audio-Input unterstützt, bis zur günstigsten Stufe.

08 · COMPUTERNUTZUNG / BROWSER-AUTOMATISIERUNG

Nicht direkt vergleichbar

GPT-5.4

Berichteter OSWorld-Spitzenwert von 75,0 % — aber dies wird auf einem anderen Benchmark gemessen (OSWorld vs. Online-Mind2Web) als beim Verfolger, behandeln Sie dieses Ranking daher nur als Richtungsangabe.

09 · BESTES OPEN-WEIGHTS-MODELL

Unbestätigt — Aggregator

DeepSeek V4 Pro-Max

Höchster bestätigter Open-Weights-SWE-bench-Wert (80,6 %), über mehrere Quellen mit konkreten Zahlen untermauert.

10 · GÜNSTIG/SCHNELL, HOHES VOLUMEN

Unbestätigt — Aggregator

DeepSeek V4 Flash

$0,14/$0,28 pro MTok — der niedrigste gefundene, verifizierte Preis pro Token, rund 7-mal günstiger als Haiku 4.5.

11 · WISSENSARBEIT FÜR UNTERNEHMEN

Offiziell

Claude Opus 5 / Opus 4.8

Die konkreteste dokumentierte native Tabellen-/Folien-Erzeugungsfähigkeit (Agent Skills xlsx/pptx mit echten Formeln), die über alle Anbieter hinweg gefunden wurde.

12 · MULTI-AGENT-ORCHESTRIERUNG

Offiziell

Claude Opus 5

Der einzige Anbieter mit einer dokumentierten, erstklassigen Multi-Agent-Koordinator-API (bis zu 20 Roster-Agenten) statt eines per Prompt gebauten Musters.

Zwölf Gewinner. Eine Entscheidung bleibt.

Zu wissen, welches Modell gewinnt, sagt Ihnen nicht, was Sie damit bauen sollen.

MentorMe verwandelt das Modell, das Sie wählen, in eine 90-Tage-Roadmap für Ihr tatsächliches Geschäft — keine generische Prompt-Bibliothek.

Meine kostenlose 90-Tage-Roadmap erstellen →

Richtiges Modell, falscher Plan ist immer noch kein Plan.

— warum diese Seite mit einer Roadmap endet, nicht nur mit einem Leaderboard

Das Modell ist ein Werkzeug, keine Strategie

▲ 05 — vollständiges Modellverzeichnis

Jedes Modell, nach Anbieter

Anthropic

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Claude Fable 5$10 / $501MNein
Claude Opus 5$5 / $251MNein
Claude Opus 4.8$5 / $251MNein
Claude Sonnet 5$3 / $15 ($2/$10 Einführungspreis)1MNein
Claude Haiku 4.5$1 / $5200KNein

OpenAI

ModellPreis ($/MTok in/out)KontextOffene Gewichte
GPT-5.6 Sol~$5 / $30~1,05MNein
GPT-5.6 Terra~$2,50 / $15~1,05MNein
GPT-5.6 Luna~$1 / $6~1,05MNein

Google

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Gemini 3.1 Pro~$2–4 / $12–181MNein
Gemini 3.6 Flash~$1,50 / $7,501.048.576Nein

xAI

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Grok 4.5~$2 / $6n/aNein
Grok 4.3 / 4.20~$1,25 / $2,50n/aNein
Grok 4.1 Fast~$0,20 / $0,50n/aNein

Meta

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Llama 5 „Avocado"offene Gewichte5M (behauptet)Ja

DeepSeek

ModellPreis ($/MTok in/out)KontextOffene Gewichte
DeepSeek V4 Pro / Pro-Max~$0,44 / $0,871M (behauptet)Ja
DeepSeek V4 Flash~$0,14 / $0,281M (behauptet)Ja

Mistral

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Mistral Large 3$0,50–2 / $1,50–6 (umstritten)128KUnbestätigt

Alibaba

ModellPreis ($/MTok in/out)KontextOffene Gewichte
Qwen 3.5-397B-A17B~$0,60 / $3,60n/aJa
Qwen 3.5 Plus~$0,40 / $2,40n/aJa
Qwen 3.5 Flash~$0,10 / $0,40n/aJa

„*" markiert eine behauptete Zahl, die auf dieser Seite mit echter Skepsis behandelt wird — Llama 5s 5M-Kontext und Mistral Large 3s umstrittene Preise allen voran.

▲ 06 — wer auf was umsteigen sollte

Sechs Nutzertypen, sechs Züge

Solo-Entwickler (Nebenprojekte, persönliche Tools)

Claude Sonnet 5 zum Einführungspreis ($2/$10) — nahezu Opus-Coding-Qualität, günstig genug für tägliche Iteration, Einführungspreis läuft bis 31. August 2026.

Startup mit Produkt im Einsatz

Sonnet 5 für den Kern-Agenten-/Coding-Pfad; DeepSeek V4 Pro für Hochvolumen-, risikoarme Hintergrundaufgaben, um die Inferenzkosten um geschätzt das 10- bis 20-fache zu senken.

Unternehmen (Tabellen, Recht, Finanzen)

Claude Opus 5 für dokumentierte native .xlsx-/.pptx-Erzeugung und den höchsten bestätigten SWE-bench-Wert; kombiniert mit Gemini 3.1 Pro für sehr lange Dokumentenverarbeitung.

Forscher (Reasoning, Mathematik, Wissenschaft)

Gemini 3.1 Pro für GPQA-Diamond- und ARC-AGI-2-Zugewinne, mit GPT-5.6 Sol als nahezu gleichauf liegender Gegenprobe — beide laufen zu lassen ist bei so knappem Abstand eine günstige Absicherung.

Hochvolumen-API-Anwendung (Chatbots, Pipelines)

DeepSeek V4 Flash ($0,14/$0,28), falls Sie geringere SLA-/Support-Reife tolerieren können, oder Claude Haiku 4.5 ($1/$5) für First-Party-Zuverlässigkeit.

Nicht-technischer Alltagsnutzer

Claude auf Sonnet 5 oder Opus 5 für Schreib- und Reasoning-Qualität, ohne über Modell-IDs nachdenken zu müssen, oder Gemini, falls Sie bereits in Google Workspace sind.

Sechs Züge oben. Einer davon ist Ihrer.

Lesen Sie als Nächstes die tieferen Anthropic-Modell-Leitfäden.

Diese Seite führt Opus 5 als Gewinner bei agentischem Coding und Multi-Agent-Arbeit. Sehen Sie genau, wie es und Fable 5 in einem echten Gründer-Workflow abschneiden.

▲ 07 — klare Antworten

Was Leute tatsächlich suchen

Was ist das beste LLM 2026?

Es gibt kein einzelnes „bestes" Modell — es hängt von der Aufgabe ab. Für agentisches Coding erzielt Claude Opus 5 den höchsten in dieser Recherche gefundenen SWE-bench-Verified-Wert (96 %, unbestätigt/Sekundärquelle). Beim reinen Preis-Leistungs-Verhältnis erreicht DeepSeek V4 Pro den Coding-Wert eines Google-Flaggschiffs bei rund einem 28stel des Output-Preises. Wählen Sie nach Kategorie, nicht nach Schlagzeile.

Was ist das beste KI-Modell zum Programmieren?

Claude Opus 5 für die anspruchsvollste agentische Arbeit, Claude Sonnet 5 für alltägliche IDE-/Autocomplete-Nutzung zu einem Bruchteil des Preises (Einführungspreis $2/$10 pro MTok bis 31. August 2026), und DeepSeek V4 Pro, wenn Kosten pro Token die entscheidende Größe sind. Alle Nicht-Anthropic-Benchmark-Zahlen hier sind unbestätigt/Sekundärquelle — vor einer alleinigen Kaufentscheidung prüfen.

Was ist das günstigste LLM mit guter Leistung?

DeepSeek V4 Flash ist der niedrigste gefundene, verifizierte Preis ($0,14 Input / $0,28 Output pro MTok, unbestätigt/Sekundärquelle). Claude Haiku 4.5 ($1/$5, offizieller Anthropic-Preis) kostet mehr, bringt aber First-Party-SLA und Support-Reife, für die die günstigeren Open-Weights-Optionen noch keine Erfolgsbilanz haben.

Ist Llama 5 wirklich besser als Claude und Gemini?

Behandeln Sie diese Behauptung mit echter Skepsis. Llama 5s „entspricht oder übertrifft GPT-5 und Gemini 2.0"-Sprache ist vage, unbelegte Vergleichsmarketing, kein bewerteter Benchmark-Lauf, und sie bezieht sich auf einen veralteten 2026er Vergleichspunkt (Gemini 2.0). In dieser Recherche wurde keine unabhängige Benchmark-Tabelle für Llama 5 gefunden. Die 5M-Token-Kontext-Behauptung ist die größte überhaupt gefundene, falls sie sich bestätigt — aber sie wurde nicht unabhängig verifiziert.

Wie zuverlässig sind die Preise auf dieser Seite?

Anthropics Preise und Kontextfenster sind offiziell, direkt aus Anthropics eigener Dokumentation. Alle anderen Anbieterzahlen stammen aus Sekundärquellen-Aggregatoren, nicht von den Preisseiten der Anbieter selbst, und einige widersprechen sich direkt — Mistral Large 3 allein hat zwei sich gegenseitig ausschließende Preisangaben im Umlauf. Bestätigen Sie jede Nicht-Anthropic-Zahl auf der eigenen Preisseite des Anbieters, bevor Sie damit budgetieren.

Gründer —

Das richtige Modell zu wählen ist der einfache Teil. Jeder kann ein Leaderboard lesen. Der schwierige Teil ist zu wissen, was man damit tatsächlich baut — welchen Workflow, welches Angebot, welche 90 Tage an Schritten ein klügeres Modell in mehr Umsatz verwandeln.

Das ist der Teil, den eine Vergleichsseite nicht für Sie übernehmen kann. Das ist der Teil, den wir übernehmen.

Wählen Sie Ihr Modell. Dann kommen Sie und bauen Sie den Plan.

— Italo

Das Modell ist gewählt. Der Plan nicht.

Verwandeln Sie das richtige Modell in Ihren 90-Tage-Plan.

Meine 90-Tage-Roadmap erstellen →
Kostenlose Roadmap · 4 Minuten · keine KreditkarteUm Ihr Geschäft herum gebaut — keine Vorlage