MentorMe

Modell-Leitfaden · erschienen am 24. Juli 2026 · claude-opus-5

Der Regler ist das Modell.

Bei Opus 5 stellen Sie zum ersten Mal nicht in erster Linie die Formulierung Ihres Prompts ein — sondern wie hart Sie das Modell arbeiten lassen. Leistung auf Frontier-Niveau für $5/$25 pro Million Token, halb so viel wie Fable 5.

Hier lesen Sie, was sich wirklich geändert hat, was Sie aus alten Prompts streichen sollten und welche neun Prompt-Bausteine sich lohnen.

Zusammengestellt aus Anthropics Opus-5-Dokumentation und Launch-Tag-Berichterstattung · Prompting-Prinzipien, kein Bauchgefühl.

01 — die Zahlen

Was Sie bekommen.

Gleicher Preis wie Opus 4.8. Etwa doppelt so gut auf Anthropics anspruchsvollstem agentischem Benchmark.

Input
$5 / Mio. Token
Output
$25 / Mio. Token
Kontext
1M Standard & Maximum
Max. Output
128k Token
Thinking
An standardmäßig
Fast Mode
2,5× für $10/$50
BenchmarkErgebnisBedeutet
Frontier-Bench v0.143,3 % vs. 18,7 % (Opus 4.8)Mehr als doppelt so gut, bei geringeren Kosten pro Aufgabe
CursorBench 3.2Innerhalb von 0,5 % zu Fable 5Halber Preis für nahezu gleichwertiges Coding
ARC-AGI 33× so gut wie das nächstbeste ModellEin Sprung bei neuartigem Schlussfolgern, kein Rundungsfehler
OSWorld 2.0 (Computernutzung)Schlägt Fable 5s BestwertBei rund einem Drittel der Kosten
Zapier AutomationBench~1,5× nächstbestes Modell; 100 % bei Churn-AufgabenEchte Geschäftsautomatisierung, keine Spielaufgaben
Organische Chemie (intern)+10,2 Punkte gegenüber 4.8Bestes allgemein verfügbares Claude-Modell für Wissenschaft
Erste juristische Redlines~2× Opus 4.8Professionelle Erstentwürfe, keine Gliederungen
Die wichtigste Kennzahl im Produktivbetrieb

Harvey berichtete, dass Opus 5 die Ausgabequalität von Opus 4.8 bei maximalem Reasoning erreicht — bei 26 % weniger durchschnittlichem Tokenverbrauch. Die eigentliche Ersparnis ist nicht der Listenpreis — sondern dass niedrigerer Effort jetzt die Messlatte reißt, für die das alte Modell maximalen Effort brauchte.

02 — die Effort-Skala

Eine Stufe wählen, dann nicht mehr herumtüfteln.

Effort steuert jedes Token der Antwort — Thinking, Tool-Aufrufe und Argumente — nicht nur das Reasoning. Niedrigerer Effort bedeutet weniger Tool-Aufrufe, weniger Vorrede, knappere Bestätigungen.

StufeEinsatzbereichUrteil zu Opus 5
lowKlassifizierung, Nachschlagen, Subagenten, hochfrequenter Chatfrei nutzen — deutlich stärker als frühere Opus-Low-Stufen
mediumRoutinemäßige agentische Arbeit, Kosten-Geschwindigkeits-Balancefrei nutzen — Ihr wichtigster Kostenhebel
high (Standard)Komplexes Reasoning, die meiste Wissensarbeitsicherer Standard — identisch mit dem Weglassen des Parameters
xhighCoding, agentische Läufe über 30 Minuten, TiefensucheStartpunkt für Code — Anthropics eigene Empfehlung
maxNur wirklich frontier-mäßige Problemeerst messen — hohe Kosten, kleiner Zugewinn bei den meisten Aufgaben

In Claude Code und claude.ai

Geben Sie /effort xhigh für eine echte Coding-Session oder einen Agentenlauf ein; belassen Sie es bei high für schnelle Änderungen und Fragen. Wechseln Sie zu medium, wenn Sie etwas Repetitives erledigen und Geschwindigkeit wollen. ultracode im Claude-Code-Menü ist keine sechste API-Stufe — es ist xhigh plus dauerhafte Berechtigung, Multi-Agent-Workflows zu starten.

In der API

0 · output_config.effort

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "stream": true,
  "output_config": { "effort": "xhigh" },
  "messages": [{ "role": "user", "content": "..." }]
}

Bei xhigh oder max sollten Sie max_tokens hoch ansetzen — 64k ist ein vernünftiger Startwert —, weil dieser Wert Thinking plus Antworttext gemeinsam begrenzt. Und streamen Sie: 64k Output kann das Zeitlimit ohne Streaming überschreiten.

Drei Fallstricke

1. Effort steuert die Menge des Thinkings, nicht die sichtbare Antwortlänge. Ihn zu senken macht die Antwort nicht kürzer — dafür müssen Sie explizit um Kürze bitten. 2. Eine Effort-Änderung mitten im Gespräch invalidiert Ihren Prompt-Cache, weil Effort den gerenderten Prompt formt. Wählen Sie eine Stufe pro Sitzung. 3. thinking: {"type":"disabled"} bei xhigh oder max liefert einen 400er-Fehler. Das ist die Breaking Change gegenüber 4.8.

03 — Migration

Die Anweisungen, die Sie streichen sollten.

Das Wirksamste, was Sie mit einem alten Opus-4.8-Prompt tun können, ist, Dinge herauszunehmen. Opus 5 zeigt bereits einige der Verhaltensweisen, die Ihr Prompt bisher kompensieren musste — es zweimal zu sagen, lässt es die Sache zweimal tun.

Wenn Ihr Prompt sagt …Tun Sie dasWeil
„Füge einen abschließenden Verifizierungsschritt ein" / „Nutze einen Subagenten zur Verifizierung"streichenEs verifiziert sich selbst. Die Anweisung führt zu Über-Verifizierung und verbrennt Token ohne Qualitätsgewinn.
„Prüfe deine Antwort vor dem Absenden noch einmal"streichenDasselbe Problem — es erkennt und korrigiert eigene Fehler bereits selbst.
„Melde nur Probleme mit hoher Schwere" (Code-Review)streichenEs befolgt das wörtlich und meldet zu wenig. Fordern Sie alles an, filtern Sie in einem zweiten Durchgang.
„Denke nicht nach" / „Argumentiere nicht"streichenErhöht die Wahrscheinlichkeit, dass interne XML-Tags in die sichtbare Ausgabe durchsickern.
Vision-Workarounds, die auf ältere Modelle zugeschnitten sinderneut testenGenauigkeit bei Diagrammen, Charts und UI-Nachbildung ist gesprungen; die Krücke könnte jetzt schaden.
Von 4.8 / 4.7 übernommene Effort-Standardwerteneu durchmessenlow und medium reißen jetzt Messlatten, die sie früher nicht schafften. Führen Sie den Sweep erneut auf Ihren eigenen Evals aus.
thinking: {"type":"adaptive"}behaltenWeiterhin gültig, jetzt gleichbedeutend mit dem Standard. Aber prüfen Sie max_tokens neu: Thinking zählt nun dagegen.

Was Sie stattdessen ergänzen sollten

Opus 5s raue Kanten haben alle dieselbe Form — es macht mehr. Längere Antworten, längere Dokumente, mehr Kommentierung, mehr Delegation, weiterer Umfang. Jeder Prompt unten stutzt eines davon zurecht.

04 — die Prompt-Bibliothek

Neun Bausteine, die sich lohnen.

Einfügen in einen System-Prompt, eine CLAUDE.md oder den Anfang eines langen Chats. Jeder zielt auf ein konkretes gemessenes Verhalten, nicht auf ein Bauchgefühl.

1 · Kürze — nutzerorientierte Produkte

Keep responses focused, brief, and concise. Keep disclaimers and caveats short, and spend most of the response on the main answer. When asked to explain something, give a high-level summary unless an in-depth explanation is specifically requested.

Opus 5s Standardantworten fallen länger aus als bei 4.8. Das hier ist die Lösung — Effort ist es nicht.

2 · Die Erinnerung am Prompt-Ende

<tone_preference>
Keep outputs reasonably concise.
</tone_preference>

In einem langen System-Prompt kombinieren Sie die vollständige Anweisung oben mit dieser kurzen Erinnerung am Ende.

3 · Kommentierungs-Rhythmus bei Agentenläufen

Before your first tool call, say in one sentence what you're about to do. While working, give a brief update only when you find something important or change direction. When you finish, lead with the outcome: your first sentence should answer "what happened" or "what did you find," with supporting detail after it for readers who want it.

Opus 5 kündigt an, was es vorhat — oft ausführlich. Beschreiben Sie den gewünschten Rhythmus; positive Beispiele wirken besser als Verbote.

4 · Länge schriftlicher Deliverables

Match the length of written documents to what the task needs: cover the substance, but do not pad with filler sections, redundant summaries, or boilerplate.

Auf die Festplatte geschriebene Dateien — Reports, Markdown, Zusammenfassungen — blähen sich unabhängig von der Gesprächslänge auf. Das ist ein eigener Hebel.

5 · Umfangskontrolle

Deliver what was asked, at the scope intended. Make routine judgment calls yourself, and check in only when different readings of the request would lead to materially different work. If the request seems mistaken or a better approach exists, say so in a sentence and continue with the task as asked rather than quietly narrowing, widening, or transforming it. Finish the whole task, and stop short of actions that are clearly beyond what was asked.

Der vielseitigste Baustein auf dieser Seite. Opus 5 wendet sein eigenes Urteil darüber an, was die Aufgabe „eigentlich sein sollte", wenn Sie die Grenze nicht ziehen.

6 · Subagenten-Erzeugung begrenzen

Delegate to a subagent only for large tasks that are genuinely independent and parallelizable, such as a wide multi-file investigation. Do not delegate work you can finish yourself in a handful of tool calls, and do not use subagents to verify or double-check your own work. If one subagent can complete the task, use one rather than several, and keep spawn counts low.

Delegation vervielfacht Kosten und Laufzeit bei kleinen Aufgaben. Opus 5 greift bereitwilliger danach als 4.8.

7 · Korrekturen nicht mehr kommentieren

Only correct an earlier statement when the error would change the user's code, conclusions, or decisions. State corrections plainly and briefly, then continue the task. For slips that change nothing for the user, make the fix and move on without noting it.

Selbstkorrektur ist ein Feature; jede Selbstkorrektur einem Kunden gegenüber zu kommentieren, ist keins.

8 · Code-Review, das alles findet

Review this change and report every issue you find, including low-severity ones and anything you are only moderately confident about. Do not filter for severity — I will triage in a separate pass. For each finding give the file and line, a one-sentence statement of the defect, and a concrete failure scenario with inputs and the wrong result.

Präzision und Trefferquote sind bei Opus 5 beide hoch, und die Genauigkeit hält auch bei niedrigerem Effort — führen Sie also einen schnellen medium-Durchgang beim Review durch und einen gründlichen xhigh-Durchgang später.

9 · Falls Sie Thinking deaktivieren müssen

You may say a brief sentence before using a tool.
Do not include internal or system XML tags in your response.

Mit deaktiviertem Thinking schreibt Opus 5 gelegentlich einen Tool-Aufruf als reinen Text (er wird nie ausgeführt und vergiftet spätere Turns) oder lässt Tags durchsickern. Diese zwei Zeilen mindern beides. Besser: Thinking eingeschaltet lassen und stattdessen den Effort senken.

Neun Prompts sind ein Anfang, kein System

Prompting ist keine Strategie. Ein 90-Tage-Plan, der Ihr ganzes Geschäft auf KI umstellt, ist eine.

Meine 90-Tage-KI-Roadmap erstellen →

05 — Routing

Wofür Sie es einsetzen sollten.

Wo das Modell seinen Preis rechtfertigt — und wo ein günstigeres reichen würde.

Gesamte Spezifikation übergeben, dann in Ruhe lassen

Opus 5 ist am stärksten bei mehrteiligen Features, großen Refactorings und End-to-End-Arbeit, und es liefert fertig ab statt Stubs und TODOs zu hinterlassen. Übergeben Sie die vollständige Spezifikation im Voraus, statt Schritte tröpfchenweise zu füttern.

Zweistufiges Code-Review

Echte Bugs mit hoher Trefferquote pro Durchgang, wobei zusätzliche Funde meist ebenfalls real sind. Die Genauigkeit hält auch bei niedrigem Effort — lassen Sie es also günstig beim Commit laufen und gründlich vor dem Release.

Vision mit Tools, nicht nur mit Thinking

Charts, dichte Dokumente, Diagramme und UI-Nachbildung. Geben Sie ihm Bash- und Zuschneide-Tools, damit es prüfen und visuell verifizieren kann — das schlägt, das Budget allein ins Thinking zu stecken.

Die volle Million Token

1M Kontext ist zugleich Standard und Maximum, und Instruction Following, Tool-Aufrufe und Reasoning bleiben über das gesamte Fenster hinweg konsistent. Ganze-Repo- und Ganzer-Deal-Room-Arbeit ist möglich.

Tabellenkalkulationen und Präsentationen

Mehrblatt-Arbeitsmappen mit nicht-trivialen Formeln und gut strukturierte Folien. Es folgt einer Hausvorlage — aber nur, wenn Sie ihm eine geben.

Orchestrierung

Writer-Verifier-Subagenten-Teams funktionieren zuverlässig, ohne dass sich wenige Agenten gegenseitig ins Gehege kommen. Begrenzen Sie die Anzahl der Spawns aus Kostengründen, nicht aus Korrektheitsgründen.

06 — still nützlich

Vier Änderungen, die es nicht in die Schlagzeile schafften.

Prompt-Cache-Minimum auf 512 Token gesenkt (von 1.024). Kurze System-Prompts, die bei 4.8 nie cachen konnten, können es jetzt — ohne Codeänderung.

Tool-Änderungen mitten im Gespräch (Beta). Tools zwischen Turns hinzufügen oder entfernen, ohne den Cache zu invalidieren — Header mid-conversation-tool-changes-2026-07-01.

Default-Fallbacks-Modus (Beta). fallbacks: "default" leitet Ablehnungen nach Kategorie zu Anthropics empfohlenen Alternativen um, statt zu einer selbst gepflegten Liste — Header server-side-fallback-2026-07-01.

Fast Mode. 2,5-facher Durchsatz zum doppelten Preis ($10/$50), nur über die Claude API — noch nicht auf Bedrock, Google Cloud oder Microsoft Foundry.

Gründer —

Jetzt wissen Sie, wie man Opus 5 fährt: den Effort-Regler, was Sie aus Ihren Prompts streichen sollten, die neun Bausteine, die echten Deadlines standhalten.

Prompting sind die einfachen 20 %. Die anderen 80 % sind die Entscheidung, worauf man es zuerst richtet, in welcher Reihenfolge, in einem Unternehmen, das immer noch Gehälter zahlen muss. Das ist der Teil, den wir mit Ihnen bauen — eine 90-Tage-Roadmap, kein weiteres Prompt-Paket.

— Italo

Tools ändern sich. Prompting-Prinzipien nicht.

— warum dieser Leitfaden nächsten Monat nicht veraltet sein wird

Klare Antworten · keine Verkaufsshow

07 — klare Antworten

Die Fragen, die alle stellen.

Nicht ganz, und genau das ist der Punkt. Opus 5 liegt bei CursorBench 3.2 innerhalb von 0,5 % zu Fable 5 und schlägt es bei OSWorld-Computernutzung — zur Hälfte bis einem Drittel der Kosten. Fable 5 bleibt vorn bei den härtesten, langwierigsten, mehrtägigen, mehrdeutigen Aufgaben. Wenn eine Aufgabe für einen Menschen Stunden oder Tage dauert und noch niemand sie gelöst hat, ist das Fable. Alles andere ist Opus 5.

Noch Fragen dazu, wie Sie Ihr Geschäft darauf aufbauen

Überspringen Sie das Ausprobieren. Holen Sie sich den 90-Tage-Plan, der diese Antworten in Umsatz verwandelt.

Meine kostenlose Roadmap holen →

Das Abenteuer ist der Aufstieg

Das Modell kennen. Jetzt das Geschäft bauen.

Meine 90-Tage-Roadmap erstellen →
Kostenlose Roadmap · 4 Minuten · keine KreditkarteUm Ihr Geschäft herum gebaut — keine Vorlage