Zuerst die Schlussfolgerung
- GPT-6 Astra ist kein allgemeiner Ersatz für GPT-5.6 Sol. Es ist ein gezieltes Upgrade für lange Agent- und Computer-Use-Aufgaben. Für kurzen Chat, Klassifikation und hochvolumige Extraktion bleiben Sol / Terra / Luna die bessere Wahl.
- Die offiziellen Standard-Preise machen Astra genau 2.5× so teuer wie Sol ($10 / $50 vs. $4 / $20 pro Million Token). Entscheidend ist nicht das Preisschild, sondern die Wahrscheinlichkeit, einmal fertig zu werden, und die Retry-Steuer.
- Coding: Offiziell liegt Terminal-Bench 4.0 bei Astra 57,9% gegen Sol 37,3%; DeepSWE trennt nur 1,4 Punkte. Tägliche Patches nicht wegen eines neuen Namens umlegen.
- Computer Use: OSWorld 2.0 steht 72,6% gegen 65,7%, Wanduhr etwa 40 gegen 75 Minuten (rund 47% weniger). Browser- und Desktop-Marathons sind Astras Heimspiel.
- Die Wasserscheide der Token-Kosten ist Aufgabenform × Output-Anteil × ob der Host den Deckel schließt. Den Agenten auf einem dauerhaft laufenden Cloud Mac zu parken — statt nur das Standardmodell zu tauschen — senkt die Rechnung oft stärker. Wer ohnehin Mac mini mieten will, legt Host und Desktop-Sitzung auf dieselbe immer wache Box.
Die Modellgeneration ist nicht die Wasserscheide. Aufgabenform und die Chance, einmal fertig zu werden, sind es.
0. Zuerst die Schlussfolgerung
Stand 2026-09-10 positioniert die Launch-Notiz von OpenAI GPT-6 Astra (API: gpt-6-astra) als neues Flaggschiff für Intelligenz und Alignment und vergleicht es ausdrücklich mit GPT-5.6 Sol. Beide bieten rund 1.05M Kontext und maximal 128k Output. Die Lücke liegt nicht im Fenster. Sie liegt darin, ob eine lange Kette auf der Schiene bleibt, ob Desktop-Steuerung in Timeout läuft und ob Retries die Rechnung durchschlagen.
Ein Satz für alle, die heute entscheiden müssen: Ist Ihr Hauptpfad ein Terminal-Agent, ein werkzeugübergreifendes Refactoring oder Browser-/Desktop-Computer-Use, gehört Astra in die erste A/B-Charge; ist Ihr Hauptpfad tägliche Completion in Cursor, Klassifikation oder High-QPS-Routing, bleibt GPT-5.6 der bessere Kauf. Das ist keine Abstimmung darüber, wer klüger ist. Es ist die Frage, wer Sie seltener zweimal zahlen lässt.
Im Juli haben wir geschrieben, welche GPT-5.6-Stufe Sie gegen Claude und Gemini einsetzen. Jener Text war die 5.6-Familie plus herstellerübergreifendes Routing. Dieser beantwortet eine neuere Frage: Astra ist da — soll 5.6 der Default bleiben?
1. Warum die Upgrade-Frage vom Stückpreis gekapert wird
Das alte Playbook scheitert auf langweilige Weise. Ein Team sieht Astra, stellt Cursor, Codex und den selbst gebauten Agenten von gpt-5.6 (Alias auf Sol) auf gpt-6-astra um und budgetiert mit „Input-Preis × geschätzte Token“. Drei Ergebnisse tauchen auf:
- Kurzer Chat, JSON-Extrakt, Ticket-Klassifikation: Der Token-Verbrauch bewegt sich kaum, die Rechnung ist ×2.5, die Qualität fühlt sich flach an.
- Lange Refactors, Datenbankmigrationen, Abhängigkeiten installieren und dann im Terminal testen: Astra irrt weniger und retried weniger. Die Wanduhr fällt. Die Kosten pro fertigem Job können mithalten oder gewinnen.
- Computer-Use-Formulare, CRM, Frontend-QA: Sol verbrennt oft über eine Stunde und braucht trotzdem einen Menschen. Offizielle Latenzsimulationen setzen Astra grob auf die Hälfte der Zeit — wenn die Desktop-Sitzung nicht stirbt, sobald ein Laptopdeckel zugeht.
Deshalb ist „lohnt sich das Upgrade?“ als Suche nach „ist Astra teuer?“ die falsche Frage. Das 2.5×-Schild ist sauber: offizieller Standard steht bei $10 / $50 pro Million Input/Output; Sol bei $4 / $20. Was Sie von einem Poster nicht raten können, ist, ob beide Modelle auf demselben Job dieselbe Menge Output-Token schreiben und ob ein Fehlschlag die Schleife noch einmal kauft.
Artificial Analysis spaltet das in zwei Kurven. Auf dem Coding Agent Index verbraucht Astra bei max effort etwa ein Drittel der Sol-Token, sodass die Kosten pro Aufgabe Sol treffen können und trotzdem zwei Punkte höher liegen. Auf dem Intelligence Index fallen die Token nur um etwa 10%, das 2.5×-Schild gewinnt, und Astra ist rund 75% teurer. Ein unabhängiger Index ist nicht Ihr Repo. Er erklärt aber, warum „alles upgraden“ und „nichts upgraden“ beide dumm sind.
Eine dritte Kostenart steht nie auf der Preisliste: MCP-Timeouts, Deckelschlaf, Keychain-Dialoge, getötetes xcodebuild. Jedes davon lässt das Modell dasselbe Denken noch einmal schreiben. Wie Werkzeuge und Schemas stabil bleiben, steht in dem KI-Agent-Stack 2026. Ob der Host den Laptop verlassen sollte, steht in MCP auf Cloud Mac vs. VPS vs. lokal — genau die Entscheidung, die Teams treffen, wenn sie dauerhaft Mac mini mieten statt nachts den Deckel zuzuklappen.
2. Zuerst klassifizieren: „GPT-6“ und „GPT-5.6“ sind keine zwei Knöpfe
2.1 Spur A: GPT-6 Astra Standard
Flaggschiff-Reasoning plus Tool-Schleifen plus Computer Use. OpenAI betont Terminal-Engineering, Browsing, professionelle Artefakte und Desktop-Arbeit in wissenschaftlicher Software. ChatGPT Plus / Pro / Business / Enterprise rollen über Tage aus; API, Azure und Bedrock kommen parallel. Enterprise-Workspaces sind standardmäßig aus, bis ein Admin sie einschaltet. Nutzen Sie es für harte, lange, bildschirmberührende Arbeit — nicht als seitenweiten Completions-Default.
2.2 Spur B: GPT-5.6 Sol (Alias gpt-5.6)
Der Produktionsdefault der meisten Teams seit Juli 2026. Dasselbe Fenster wie Astra, etwa 60% günstiger pro Token. Tägliches Agent-Coding funktioniert weiter. Offizielles Terminal-Bench 4.0 hängt jetzt deutlich hinterher; DeepSWE- und BrowseComp-artige „Repo lesen / abrufen“-Lücken sind klein. Stabile Pipelines sollten regressen, bevor sie ersetzen.
2.3 Spur C: GPT-5.6 Terra / Luna
Terra deckt mittleres Pair-Programming ab. Luna deckt hochvolumige Entwürfe und Klassifikation ab. Astra setzt sie nicht außer Dienst. Luna-Traffic auf Astra zu routen ist der häufigste Weg, Geld anzuzünden.
2.4 Spur D: Astra Fast
Offiziell: bis etwa 2× Tempo bei 2× Standard (rund $20 / $100 im Kurzkontext-Band). Nur wenn ein Mensch wartet. Batch / Flex liegt bei etwa dem halben Preis, für Offline-Evals.
2.5 Spur E: der versteckte Host
Computer Use auf der Responses API braucht eine lebende Desktop-Sitzung — siehe den offiziellen Computer-Use-Leitfaden. Das Modell verkauft Urteil. Klicks, Browser und Tests laufen auf einer Maschine. Deckel zu = tote Sitzung = Token noch einmal kaufen. Wie Langzeit-Gedächtnis geschichtet werden sollte, steht in der Architektur für AI-Agent-Memory. Ein Cloud Mac, auf dem Sie Mac mini mieten statt den Laptop zuzuklappen, hält genau diese Sitzung wach.
3. Vergleich unter einem Fünf-Spalten-Kopf
Legen Sie „Modell tauschen“ und „Host tauschen“ in dieselbe Tabelle, damit Sie keine IQ-Poster vergleichen.
| Option | Einstieg | Ausführung | Kontext | Kosten | Rechtegrenze |
|---|---|---|---|---|---|
| GPT-6 Astra Standard | API gpt-6-astra / Codex / ChatGPT | Lange Agenten, Terminal, Desktop, Browse; stärkeres offizielles Alignment | 1.05M; Codex kann Notizen über Fenster halten (experimentell) | $10 / $50; Cache-Read $1; Fast nochmals ×2 | Enterprise standardmäßig aus; Computer Use braucht eine Bestätigungsrichtlinie |
| GPT-5.6 Sol | API gpt-5.6-sol / Alias gpt-5.6 | Weiter ein Coding-Flaggschiff; schwächer bei hartem Terminal und Desktop | 1.05M, Compaction-Zusammenfassungen | $4 / $20; gleiche Form, günstiger | Bereits der Produktionsdefault; billig zu behalten |
| GPT-5.6 Terra / Luna | Gerouteter Fallback | Mittleres Pair-Programming / hochvolumige Extraktion | Kurzer Kontext reicht | Deutlich unter Sol | Diese nicht auf Astra upgraden |
| Astra Fast | Dasselbe Modell, Tempospur | Wenn ein Mensch wartet | Dasselbe Fenster | Standard ×2 | Niemals der Default |
| Ausführungshost (versteckt) | Laptop / VPS / Cloud Mac | Läuft MCP, Browser, xcodebuild — nicht Inference | Repo, Zertifikate, immer wacher Desktop | Tagesmiete der Maschine + Token, die Retries verschwenden | Prozessbenutzer und Egress |
Zitieren Sie das: Ein neueres Flaggschiff repariert nicht „Deckel zu kauft dieselbe Computer-Use-Runde noch einmal“; ein billigeres Sol repariert nicht „Terminal-Erfolg liegt zwanzig Punkte schlechter“. Der Stückpreis ist eine Strichmarke auf der Spur.
3.1 Offizielle und unabhängige Boards: Coding / Agent / Computer Use
Zahlen aus der OpenAI-Notiz vom September 2026 und von Artificial Analysis. Baseline, nicht Ihre Abnahme. Wir erfinden keine Laborrechnungen. Fahren Sie dieselbe Aufgabe, dasselbe Harness, denselben Effort.
| Achse | GPT-6 Astra | GPT-5.6 Sol | So lesen |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | Harter Terminal / Umgebung / Daten — Astras Feld |
| DeepSWE v1.1 | 74.1% | 72.7% | Tägliche Repo-Fixes liegen nah; nicht für 1,4 Punkte umlegen |
| FrontierCode 1.1 Main | 53.3% | 47.5% | Härteres Coding bewegt sich; prüfen Sie trotzdem Ihren Sprachstack |
| AA Coding Agent Index | 67.0 | 65.1 | Werte nah; Astra braucht weniger Token, Kosten/Job können sich treffen |
| OSWorld 2.0 | 72.6% ≈40 min | 65.7% ≈75 min | Computer Use: höherer Score + rund 47% weniger Zeit |
| Agents' Last Exam | 59.3% | 53.6% | Lange Workflows in echter Profisoftware |
| AutomationBench | 41.4% | 18.1% | App-übergreifende Automatisierung — die breiteste Lücke |
| ScreenSpot-Pro | 92.7% | 76.9% | Wohin auf dem Bildschirm klicken |
| AA Intelligence Index | 61.2 | 60.9 | Allgemeine Intelligenz ist ein Unentschieden; Astra rund 75% teurer |
3.2 Token-Kosten im Feldtest: nachvollziehbare Arithmetik, keine erfundenen Rechnungen
„Feldtest“ heißt hier zwei Dinge: (1) offizielle Preise auf derselben Aufgabenform; (2) die von AA veröffentlichte Token-Effizienz als Stresstest, nicht als Ihre Rechnung. Steuer, Cache-Treffer und Fast ändern die Dollar. Die Verhältnisse sind stabiler.
| Form | Annahme (in/out) | Sol | Astra | Urteil |
|---|---|---|---|---|
| Kurze Klassifikation / JSON | Beide 100k / 20k | $0.80 | $2.00 | Astra 2.5× — auslassen |
| Täglicher Patch (ähnlicher Verbrauch) | 200k / 80k | $2.40 | $6.00 | Zuerst A/B der Erfolgsrate; Default Sol |
| Hartes Agent-Coding (AA: Astra-Token ≈⅓) | Sol 300k/150k; Astra 100k/50k | $4.20 | $3.50 | Astra kann günstiger sein, wenn es einmal fertig wird |
| Ein Computer-Use-Job | 75 gegen 40 min; Sol retried mehr | Billiges Schild + Retry-Steuer | Teures Schild + eine Schleife weniger | Pro erfolgreichem Job gewinnt Astra oft |
| Ein Deckel-zu-Retry | Den letzten Output noch einmal kaufen | +$3.00 (Beispiel) | +$2.50 (Beispiel) | Den Host wechseln, nicht das Modell |
OpenAI selbst schreibt, die geschätzten API-Kosten pro Terminal-Bench-4.0-Aufgabe seien auf Astra etwa 9% niedriger als auf Sol — trotz des 2.5×-Schilds. Das gilt nur, wenn Sie weniger scheitern und weniger Fülltext schreiben. Abnahme sollte Dollar pro erfolgreichem Job + Wanduhr + menschliche Übernahmen sein, nicht der Posterpreis pro Million Token.
4. So wählen Sie
| Option | Einstieg | Ausführung | Kontext | Kosten | Rechtegrenze |
|---|---|---|---|---|---|
| API lernen / Demos | ChatGPT oder Sol | Niedriger Effort, Schritte deckeln | Einzeldatei | Ziel nahe $0 | Nur Testschlüssel |
| Wöchentliches Produkt, niedriges DAU | Default Sol / Terra | Nur harte Jobs auf Astra routen | Kurzer Kontext + gecachtes System | Output mit 3–8× Input budgetieren | Backend-Proxy; keine Browser-Keys |
| Harter Terminal / großes Refactor | Astra Standard | max/xhigh; einen Breaker auslösen | Repo-Digest, nicht der ganze Baum | Den erfolgreichen Job bepreisen, nicht das Schild | MCP wach halten, damit Sie Token nicht nachkaufen |
| Browser- / Desktop-Computer-Use | Astra + Responses API | Bestätigungsrichtlinie an | Eine echte GUI-Sitzung | Die Wanduhr ist die teure Zeile | Nicht auf einem Laptop mit zuklappendem Deckel |
| High-QPS-Klassifikation / Extrakt | Luna oder günstiger | Astra verbieten | Kurzes Fenster | Stückpreis-sensibel | Rate-Limit + Tagescap |
| iOS / Xcode auf derselben Box | Host auf Cloud Mac | Das Modell inferiert nur | Zertifikate und DerivedData bleiben auf dem Mac | Tagesmiete der Maschine + getaktete API | Keychain verlässt die Box nie |
5. Empfohlene Stacks
Stack A — noch nicht upgraden (die meisten Teams) Default gpt-5.6 (Sol) oder Terra → Luna / günstigeres Modell für Klassifikation → Token an einer Produktionsaufgabe messen, nicht an „Hallo“ Stack B — gezieltes Upgrade (empfohlen) Routing: harter Terminal / Computer Use / lange Cross-Tool-Jobs → gpt-6-astra → Tägliche PRs, Completions, kurze Funktionen → Sol behalten → Cache-Reads an; Batch-Evals nicht auf Standard → Fast nur, wenn ein Mensch wartet Stack C — Codex / Claude Dual-Brain Astra auf hartem Terminal und Desktop → Claude Code bleibt für lange Refactor-Sitzungen (Skills nicht migriert) → Worktrees isolieren Stack D — Apple-Auslieferung Das Modell inferiert nur → MCP / xcodebuild / Signing auf Cloud Mac → Deckel-zu-Retries treffen die Token-Kosten direkt
6. Fallstricke
- Fallstrick 1: Vom 2.5×-Schild „lohnt sich nicht“ erklären. Offizielle Kosten pro Aufgabe können auf harten Agenten niedriger liegen. Messen Sie Erfolg und Token-Effizienz.
- Fallstrick 2: Alles umlegen, weil Terminal-Bench rund 20 Punkte sprang. DeepSWE liegt bei 1,4 Punkten. Tägliche Patches sind eine Intelligenzsteuer.
- Fallstrick 3: ChatGPT-Zugang als kostenloses API-Upgrade behandeln. Abos haben Kontingente; die API rechnet pro Million Token; Fast verdoppelt noch einmal.
- Fallstrick 4: Annehmen, Enterprise-Workspaces schalten Astra ein. Offizieller Default ist aus.
- Fallstrick 5: Computer Use auf einem Laptop mit zuklappendem Deckel oder geteiltem VDI. Eine tote Sitzung kauft den teuersten Output noch einmal — genau deshalb Mac mini mieten und die Sitzung auf einem Cloud Mac lassen.
- Fallstrick 6: Den Monat von „Hallo“ oder einer 20-Zeilen-Funktion schätzen. Nutzen Sie den Produktionsprompt und die echte Tool-Liste. Loggen Sie Input / Output / Cache-Treffer.
- Fallstrick 7: Alignment als Grünes Licht für offensive Sicherheit lesen. Das ausgelieferte Modell lehnt fortgeschrittene Exploit-Anfragen ab. Defensive Reviews sind im Rahmen; die autorisierte Grenze zu überschreiten ist es nicht.
7. Sieben Schritte
- Wählen Sie drei echte Produktionsaufgaben: einen täglichen Patch, einen harten Terminal-/Migrationsjob, einen Computer-Use-Job falls vorhanden. Keine Spielzeuge.
- Dasselbe Harness, derselbe Effort:
gpt-5.6-solundgpt-6-astraje einmal fahren. Pass/Fail, Wanduhr, Input, Output, Cache, menschliche Übernahmen loggen. - Bepreisen Sie Dollar pro erfolgreichem Job zu offiziellen Sätzen. Fehlgeschlagene Jobs zählen als „bereits ausgegeben + noch einmal fahren“.
- Nur wenn Astra bei Dollar pro Erfolg gewinnt oder Wanduhr/Übernahmen klar senkt, legen Sie diese Klasse um. Kein seitenweiter Default-Tausch.
- Deckel Sie Tool-Schritte und tägliche USD. Bei 429 oder Timeout auf Sol zurückfallen — Fast nicht hämmern.
- Verschieben Sie MCP, Browser-Sitzungen und Xcode auf einen Host, der den Deckel nicht schließt. Siehe MCP und Cloud Mac — praktisch: Mac mini mieten, statt die teuerste Output-Runde nachzukaufen.
- Schreiben Sie eine interne Preisliste: Default-Modell, Upgrade-Modell, Fast-Denylist. Diffen Sie monatlich die Rechnung, nicht die Keynote.
8. FAQ
Worin unterscheiden sich GPT-6 Astra und GPT-5.6 auf dem Papier?
Das Fenster ist fast dasselbe (rund 1.05M Kontext, 128k Output). Die Lücke liegt in der Stabilität langer Jobs, Computer Use, Alignment und den Token-Kosten: Astra Standard $10/$50, Sol $4/$20. Der Knowledge-Cutoff ist ebenfalls gewandert; selten ist das der Grund zum Wechsel.
Wenn wir nur Code schreiben, sollen wir upgraden?
Nur wenn der Code wie ein harter Terminal aussieht. Abhängigkeiten installieren, ein System ändern, über Repos migrieren — Astras Vorsprung von rund 20 Punkten auf Terminal-Bench 4.0 ist einen Test wert. Eine Funktion, Tests ergänzen, täglicher PR — DeepSWE ist ein Unentschieden. Behalten Sie Sol.
Ist Computer Use ein Feature nur für Astra?
Wenn Sie Desktop- und Browser-Automatisierung bereits über die Responses API fahren, sind die offiziellen Lücken bei OSWorld und AutomationBench groß genug, Astra zuerst zu testen. Wenn Sie im Chat nur gelegentlich eine Seite öffnen, zahlen Sie dafür nicht 2.5× als Default.
Kann der Cache die Lücke bei den Token-Kosten löschen?
Cache-Reads liegen bei etwa 10% des Inputs (Astra $1 / Sol $0.40). Cachen Sie Systemprompt und Tool-Schema. Das senkt den Input. Agenten geben weiter Output aus. Cache macht aus einem 2.5×-Output-Preis keinen 1×-Preis.
Warum den Agenten auf einen Cloud Mac legen?
Das Modell verkauft Inference. Sterben MCP, Browser-Sitzung, Xcode oder Keychain auf einem zugeklappten Laptop, kauft die bezahlte Stufe Output-Token nach. Ein immer wacher Cloud Mac — die praktische Form, Mac mini mieten zu lassen — senkt verschwendete Token-Kosten, nicht den Posterpreis von OpenAI.
9. Fazit
Die richtige Antwort auf GPT-6 Astra vs. GPT-5.6 ist nicht „upgraden“ oder „nicht“. Sie lautet nach Aufgabenform teilen. Astra gewinnt bei harten Coding-Agenten, Computer Use und der Chance, einmal fertig zu werden. Sol gewinnt bei Volumen, kurzen Jobs und einem Default, dem Sie schon vertrauen. Das 2.5×-Schild ist echt. Offizielle Kosten pro Aufgabe können auf hartem Terminal trotzdem niedriger liegen — wenn Sie weniger scheitern, weniger retrien und Sitzungen nicht auf einem Laptop mit zuklappendem Deckel aufbauen.
Arbeitsreihenfolge: drei echte Aufgaben → A/B im selben Harness → Dollar pro Erfolg → nur die gewinnende Klasse umlegen → Cache und Schritt-Breaker → den Host wach halten. Modelle werden wieder erscheinen. Aufgabenform × einmal fertig × ein Host, der wach bleibt sollte nicht wöchentlich neu geschrieben werden.
Token für einmal fertig werden ausgeben, nicht für Deckel-zu-Retries
Astras Token-Kosten stehen bereits pro Million. Was Sie nicht steuern, ist eine Computer-Use-Sitzung, die auf dem Laptop stirbt, MCP, das abbricht, und xcodebuild, das getötet wird — dann läuft der Output noch einmal. Ein dedizierter Cloud Mac hält Host, Repo und Desktop-Sitzung auf einem immer wachen Pfad. Stabiles SSH, kein Deckel. Mac mini mieten Sie zuerst tageweise zur Abnahme, dann binden Sie den Monat — damit jede Million Output-Token einen echten Schritt trifft, nicht „das Modell hatte es schon, die Maschine ist eingeschlafen“.