GPT-6 Astra gegen Claude: Wer wirklich vom Chatbot zum Agenten wird

com.pany | ai solutions Logo

Am 3. September 2026 hat OpenAI mit GPT-6 Astra ein Modell vorgestellt, das nach eigener Aussage die „AGI era“ einläutet. Das sagt zumindest OpenAI-Präsident Greg Brockman. Der eigentliche Bruch liegt aber woanders. Astra soll nicht mehr nur antworten, sondern Aufgaben selbstständig planen und über mehrere Anwendungen hinweg ausführen. Bildschirme bedienen, Formulare ausfüllen, Software testen, Sicherheitslücken finden. Für Unternehmen klingt das verlockend. Für alle, die schon länger mit Claude arbeiten, klingt es vertraut, denn genau in diese Richtung bewegt sich Anthropic seit Monaten ebenfalls. Also lohnt sich der nüchterne Vergleich.

Was Astra können soll

Microsoft, das Astra über Azure und Foundry in Unternehmen bringt, beschreibt den Wandel klar. Es geht nicht mehr darum, wie gut ein Modell chattet, sondern wie gut es für Menschen arbeitet. Astra recherchiert, erstellt Dokumente und Präsentationen, analysiert Daten und bedient bestehende Software über Bildschirm und Browser, selbst wenn keine passende Schnittstelle existiert. Ein Mitarbeiter gibt ein Ziel vor, Astra entwickelt daraus einen mehrstufigen Plan und legt am Ende ein Ergebnis zur Prüfung vor.

Bei den Benchmarks legt OpenAI tatsächlich vor. FrontierMath Tier 4 mit 97,6 Prozent, ARC-AGI-3 mit 98,6 Prozent. Auf dem Agentic-Coding-Vergleich Agents‘ Last Exam kommt Astra auf 59,3 Prozent, Claude Opus 5 liegt bei 55,5 Prozent, Claude Fable 5 bei 48,7 Prozent. Bei ExploitBench, dem Test für automatisiertes Aufspüren und Ausnutzen von Sicherheitslücken, erreicht Astra 100 Prozent gegenüber 70 Prozent bei Opus 5. Auch bei BenchCAD und beim wissenschaftlichen Terminal-Bench Science liegt Astra vor allen aktuellen Claude Modellen, teils deutlich.

Wo Claude dagegenhält

Jetzt der Teil, der in den OpenAI Pressemitteilungen naturgemäß fehlt. Artificial Analysis, eine der wenigen unabhängigen Stellen, die Modelle unter gleichen Bedingungen testet, kommt in ihrem Intelligence Index zu einem anderen Schluss: Claude Opus 5 ist insgesamt intelligenter als Astra und kostet dabei etwa die Hälfte pro Token. Genauer: 82,04 Punkte für Opus 5 gegen 81,8 für Astra, wobei sich die Unsicherheitsbereiche überschneiden. Kein klarer Sieg für keine Seite, aber auch kein Beleg für Astras behaupteten Vorsprung.

Bei den Kosten ist die Sache eindeutig. Astra kostet zehn Dollar pro Million Input Tokens und fünfzig Dollar pro Million Output Tokens, also exakt doppelt so viel wie Opus 5 mit fünf und fünfundzwanzig Dollar. Gegenüber Claude Fable 5.1 liegt Astra bei den reinen Tokenpreisen gleichauf, verlangt aber für gecachte Eingaben das Vierfache. Wer viel mit langlaufenden Agenten arbeitet, bei denen ständig auf denselben Kontext zurückgegriffen wird, merkt diesen Unterschied im Monatsbudget deutlich.

Bei Coding Agenten dreht sich das Bild sogar zugunsten von Fable 5.1. Es erreicht den gleichen Wert im Coding Agent Index wie Astra, aber zu einem Bruchteil der Kosten pro erledigter Aufgabe. Für lang laufende Coding Pipelines und wissenschaftliche Forschungsagenten bleibt Fable 5.1 laut mehreren unabhängigen Auswertungen die wirtschaftlichere Wahl.

Verfügbarkeit ist auch ein Argument

Ein Punkt, der in Benchmark Tabellen gerne untergeht: Claude Opus 5 ist seit dem 24. Juli 2026 breit verfügbar, über die Claude API, AWS, Google Cloud, Microsoft Foundry und OpenRouter, mit einer zugesagten Mindestlaufzeit bis Juli 2027. Astra dagegen startet gestaffelt, zunächst nur für ausgewählte Organisationen im Daybreak Programm, danach folgen ChatGPT Plus, Pro, Business und Enterprise „in den kommenden Tagen“. Wer heute produktiv bauen will, baut also erst einmal auf Claude oder auf GPT-5.6 Sol, nicht auf ein Modell, das es offiziell erst in Ausschnitten gibt.

Die Risikoseite

OpenAI stuft Astra im eigenen Preparedness Framework erstmals als kritisch bei Cybersicherheit ein. Mit den passenden Werkzeugen kann das Modell selbstständig unbekannte Schwachstellen finden und Angriffe entwickeln. Gleichzeitig räumt OpenAI ein, dass sich die internen Denkprozesse des Modells schlechter überwachen lassen als bei Vorgängermodellen. Ein leistungsfähigeres System, das gleichzeitig schwerer zu kontrollieren ist, ist keine beruhigende Kombination.

Anthropic hat bei Fable 5.1 den umgekehrten Weg gewählt und die Ablehnungsschwelle für sicherheitskritische und biologische Anfragen bewusst verschärft, mit dem bekannten Nebeneffekt, dass auch legitime Anfragen häufiger blockiert werden als bei Opus 5. Zwei unterschiedliche Antworten auf dasselbe Problem: OpenAI baut ein potenziell gefährlicheres Werkzeug und sichert es über Zugriffsbeschränkungen ab, Anthropic bremst das Werkzeug selbst stärker ein. Welcher Ansatz der richtige ist, wird sich erst zeigen, wenn genug Unternehmen beide Systeme im Alltag einsetzen.

Was das für die Praxis heißt

Wer auf reine Spitzenwerte in Mathematik, abstraktem Denken oder Cybersecurity-Automatisierung schaut, kommt an Astra aktuell kaum vorbei. Wer dagegen einen Agenten für langlaufende Coding-Aufgaben, wissenschaftliche Recherche oder ein günstiges Kostenmodell mit verlässlicher Verfügbarkeit braucht, ist mit Claude Opus 5 oder Fable 5.1 nach wie vor besser bedient, und zwar nicht nur auf dem Papier, sondern auch im Preis pro erledigter Aufgabe. Die Schlagzeile „OpenAI schlägt Anthropic überall“ hält der zweiten Zahlenreihe schlicht nicht stand. Bei genauerem Hinsehen ist das Rennen enger, als die Pressemitteilung suggeriert, und genau das macht es gerade jetzt interessant.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert