Claude Opus 5.5 und GPT-6 Sol/Luna: Zwei Modell-Releases binnen 90 Minuten
Am 22. September 2026 haben Anthropic und OpenAI innerhalb von rund anderthalb Stunden je ein neues Modell für Coding-Agenten veröffentlicht – wie das KI-Analyse-Blog Handy AI beschreibt (öffnet in neuem Tab), zog OpenAI mit GPT-6 Sol und GPT-6 Luna „about 90 minutes after Anthropic put out Claude Opus 5.5" nach. Für Teams, die eigene Automatisierungen, Chat-Agenten oder Coding-Workflows auf Basis dieser APIs betreiben, ist weniger der Timing-Zufall interessant als das, was sich in beiden Ankündigungen wiederholt: massive Preissenkungen bei gleichzeitig besseren Benchmark-Werten. Dieser Beitrag ordnet ein, was belegt ist, und was das für die Wahl eines Modells in der Praxis bedeutet.
Claude Opus 5.5: 40 Prozent günstiger, laut Anthropic bestes Sicherheitsergebnis bisher
Anthropic stellt Opus 5.5 (öffnet in neuem Tab) als „the first model in our new Claude 5.5 family" vor. Die zentrale Aussage aus der Ankündigung: Das Modell „performs at the level of Claude Fable 5.1 on most work and costs 40% less to run than Opus 5." Konkret bei den Tokenpreisen, laut Claude Platform Docs (öffnet in neuem Tab):
| Preis pro 1 Mio. Token | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Input | 4 $ | 5 $ |
| Output | 20 $ | 25 $ |
| Cache-Lesevorgänge | 0,20 $ | 0,50 $ |
| Cache-Schreibvorgänge (5 Min.) | 5 $ | 6,25 $ |
Cache-Lesevorgänge sind laut Anthropic „the majority of agentic and coding work costs" – hier sinkt der Preis um 60 Prozent, während Input und Output um 20 Prozent günstiger werden. In Summe kommt Anthropic für „typical workloads" auf die genannten 40 Prozent Ersparnis.
Bei den Benchmarks, die Anthropic selbst veröffentlicht, liegt Opus 5.5 auf Terminal-Bench 4.0 bei 66,4 Prozent gegenüber 52,3 Prozent für Opus 5 und 57,9 Prozent für OpenAIs GPT-6 Astra. Auf FrontierCode v1.1 (Hauptdatensatz) erreicht Opus 5.5 bei Standardaufwand („medium") laut Anthropic 54,6 Prozent – mehr als jedes andere getestete Modell, bei rund einem Fünftel der Kosten von GPT-6 Astras Bestwert (53,3 Prozent). Wichtig für die Einordnung: Diese Zahlen stammen aus Anthropics eigener Veröffentlichung, die Vergleichswerte für GPT-6 Astra und GPT-5.6 Sol sind laut Anthropic „as reported by OpenAI" übernommen – es handelt sich also um vom Hersteller selbst gewählte und veröffentlichte Benchmarks, nicht um eine unabhängige Prüfung.
Ein zweiter Aspekt betrifft nicht Geschwindigkeit oder Kosten, sondern Verhalten: Anthropic beschreibt, Opus 5.5 sei „much less likely than recent models to take hard-to-reverse actions or act outside the boundaries it's been given" und „more resistant than Opus 5 to prompt injection" – laut dem unternehmenseigenen automatisierten Verhaltensaudit das bislang stärkste Ergebnis. Für Unternehmen, die Agenten mit Zugriff auf reale Systeme (E-Mail-Postfächer, Ablagesysteme, Zahlungsprozesse) laufen lassen, ist diese Eigenschaft praktisch relevanter als der Benchmark-Wert – vorausgesetzt, man verlässt sich nicht blind darauf und behält menschliche Freigaben bei kritischen Schritten bei.
Technisch bringt Opus 5.5 laut den Claude Platform Docs (öffnet in neuem Tab) vier Änderungen mit sich, die bestehenden Code brechen können: Thinking-Modus lässt sich nicht mehr deaktivieren, erzwungene Tool-Nutzung liefert einen Fehler, Thinking-Blöcke sind an Modell und Konversation gebunden, und das ältere Computer-Use-Tool computer_20251124 wird über API und Google Cloud nicht mehr akzeptiert. Wer produktiv auf Opus 5 aufsetzt, sollte diese vier Punkte vor einem Umstieg prüfen, nicht erst danach.
GPT-6 Sol und Luna: halbierte API-Preise gegenüber der Vorgängergeneration
OpenAI positioniert (öffnet in neuem Tab) Sol und Luna als die günstigeren Geschwister von GPT-6 Astra, das laut OpenAI „earlier this month" erschien. Die Preissenkung ist tabellarisch klar beziffert:
| Modell | Input (vorher → jetzt) | Output (vorher → jetzt) |
|---|---|---|
| GPT-6 Sol (vs. GPT-5.6 Sol) | 4 $ → 2 $ | 20 $ → 10 $ |
| GPT-6 Luna (vs. GPT-5.6 Luna) | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ |
Beide Preise pro 1 Million Token, jeweils 50 Prozent unter der „GPT-5.6 promotional pricing", so OpenAI. Auf dem von Zapier betriebenen AutomationBench, der laut OpenAI End-to-End-Workflows über 47 Werkzeuge in Vertrieb, Marketing, Betrieb, Support, Finanzen und HR testet, gibt OpenAI an, dass „GPT‑6 Sol at xhigh effort outperforms Claude Opus 5 at max effort at just 9% of Opus 5's cost per task." Auch hier gilt: Es ist die eigene Auswertung des Herstellers, nicht die eines unabhängigen Labors – AutomationBench wird zwar von Zapier betrieben, aber die konkreten Kostenvergleiche stammen aus OpenAIs Ankündigung.
Bei der Faktentreue nennt OpenAI eine interne Auswertung auf Basis „de-identified real-world conversations where users flagged mistakes by our models": GPT-6 Sol mache demnach „about half as many mistakes as its predecessor". OpenAI weist selbst darauf hin, dass diese fehleranfälligen Gespräche nicht repräsentativ für die typische Nutzung sind, in der Fehler seltener auftreten – ein Hinweis, der in Marketingmaterial oft fehlt und hier positiv auffällt.
Was das für die Modellwahl in der Praxis bedeutet
Für Teams, die Coding-Agenten oder Automatisierungen mit Claude- oder OpenAI-APIs betreiben, ergeben sich aus beiden Ankündigungen drei konkrete Punkte, keine Empfehlung für ein bestimmtes Modell:
Cache-Lesevorgänge sind der größte Hebel bei agentischer Arbeit. Sowohl Anthropics 60-Prozent-Rabatt auf Cache-Reads als auch OpenAIs verbesserte Prompt-Caching-Dashboards zielen auf denselben Kostentreiber: Agenten, die über viele Schritte denselben Kontext wiederverwenden. Wer heute schon mit Claude Code oder der OpenAI-API arbeitet, sollte vor einem Modellwechsel prüfen, wie hoch die eigene Cache-Trefferquote tatsächlich ist – das lässt sich bei OpenAI direkt über das Prompt Caching Dashboard (öffnet in neuem Tab) auslesen.
Ein Preisvergleich ohne Aufgabenbezug führt in die Irre. Die Modell-ID allein (claude-opus-5-5, gpt-6-sol, gpt-6-luna) sagt nichts darüber, ob ein Modell die eigene Aufgabe zuverlässig löst. Beide Hersteller reichen dafür unterschiedliche Benchmarks ein, die sich naturgemäß in ihrem eigenen Vergleich am besten schlagen. Praktisch bedeutet das: vor einem Wechsel den eigenen Anwendungsfall – Dokumentenanalyse, Codeänderung, Support-Automatisierung – mit einer kleinen, aber repräsentativen Testmenge auf beiden Modellen laufen lassen, statt sich auf die veröffentlichten Diagramme zu verlassen.
Breaking Changes sind bei jedem Versionssprung wahrscheinlicher als bei kleineren Updates. Die vier von Anthropic dokumentierten Änderungen an Opus 5.5 – vor allem der erzwungene Thinking-Modus und die geänderte Tool-Use-Fehlerbehandlung – betreffen jede Integration, die feste Annahmen über das Antwortformat trifft. Wer produktive Agenten betreibt, sollte neue Modell-IDs zunächst in einer Staging-Umgebung testen, bevor der Produktivbetrieb umgestellt wird – unabhängig davon, wie überzeugend die Ankündigung klingt.
Einordnung
Beide Ankündigungen fallen in ein Muster, das sich bei praktisch jedem Modell-Release der letzten Monate wiederholt: niedrigere Preise, bessere Benchmark-Werte, Verweis auf Kundenzitate aus Vorabtests. Das macht die Zahlen nicht falsch, aber es lohnt sich, sie als das zu lesen, was sie sind – Herstellerangaben zum eigenen Produkt, nicht unabhängig geprüfte Ergebnisse. Für die tägliche Arbeit mit Coding-Agenten zählt am Ende weniger, welches Modell auf welchem Balkendiagramm vorn liegt, sondern ob es die eigene, wiederkehrende Aufgabe zuverlässig und zu vertretbaren Kosten löst. Das lässt sich nur mit den eigenen Daten und dem eigenen Anwendungsfall testen – beide Anbieter haben mit den gesenkten Preisen zumindest die Hürde dafür gesenkt.
Das könnte Sie auch interessieren
Alle zu „Claude Code“
Superpowers: Das Skill-Framework für Coding-Agenten mit über 285.000 GitHub-Sternen
Superpowers von Jesse Vincent bündelt Skills wie TDD und Subagent-Review zu einem Workflow für Claude Code, Codex und Hermes Agent. Ein Blick auf Funktionsweise, Installation und die geteilten Reaktionen der Entwicklercommunity.

Video Use: Wenn ein Coding-Agent den Videoschnitt übernimmt
Video Use von Browser Use ist auf GitHub auf über 26.000 Sterne gestiegen: ein Open-Source-Werkzeug, das Claude Code und ähnliche Agenten Rohmaterial per Gespräch schneiden lässt. Architektur, Grenzen und Einordnung.
Themen dieses Beitrags
Lasst uns über eure Zukunft sprechen
Habt ihr eine Idee, ein Projekt oder einfach eine Frage? Wir freuen uns auf eure Nachricht und melden uns innerhalb von 24 Stunden bei euch.
