先に結論
- GPT-6 Astra は GPT-5.6 Sol の汎用置き換えではない。長時間の Agent / Computer Use 向けのピンポイントアップグレードだ。短い会話、分類、高トラフィック抽出は Sol / Terra / Luna のままの方が安い。
- 公式 Standard 料金では Astra がちょうど Sol の 2.5 倍(100万トークンあたり $10 / $50 vs $4 / $20)。値打ちは貼紙ではなく、一回で仕上げる確率と再試行税で決まる。
- Coding:公式 Terminal-Bench 4.0 は Astra 57.9%、Sol 37.3%。DeepSWE は 1.4 点差。日常パッチを「新モデル」のために全量切り替えないこと。
- Computer Use:OSWorld 2.0 公式は 72.6% vs 65.7%、ウォールクロック約 40 分 vs 75 分(約 47% 短い)。ブラウザ/デスクトップの長時間タスクが Astra の主戦場だ。
- トークンコストの分水嶺はモデル名ではない。タスク形態 × 出力比率 × 実行ホストが蓋閉じ再試行するかどうかだ。Agent を常時稼働の Cloud Mac に置く方が、先に既定モデルを替えるより請求を抑えやすい。
モデル世代が分水嶺ではない。タスク形態と、一回で仕上げる確率が分水嶺だ。
0. 先に結論
2026-09-10 時点で、OpenAI の公式紹介は GPT-6 Astra(API:gpt-6-astra)を「新世代の知能とアライメント」の旗艦と位置づけ、明示的に GPT-5.6 Sol と並べている。双方のコンテキストは約 105 万、最大出力は 12.8 万で、紙の仕様はほぼ同卓だ。差は窓の大きさではない。長い連鎖がレールから外れるか、デスクトップ操作がタイムアウトするか、再試行が請求を貫通するかだ。
今日決めなければならない人への一文:主経路がターミナル Agent、横断ツールのリファクタ、ブラウザ/デスクトップ Computer Use なら、Astra を最初の A/B バッチに入れよ。主経路が Cursor での日常補完、分類抽出、高 QPS ルーティングなら、GPT-5.6 を残す方が買いだ。 これは「どちらが賢いか」の投票ではない。「どちらが二度払いを減らすか」だ。
7 月に書いた GPT-5.6 でコードを書くとき Sol / Terra / Luna か、Claude・Gemini か は、「5.6 ファミリー内部+他社との配分」を解く記事だった。本稿が答えるのは一つ新しい問いだけだ。Astra が出た今、5.6 を既定のままにしてよいか。
1. 問題が残る理由:「アップすべきか」が単価に引きずられる理由
古い手順は退屈な形で失敗する。チームは Astra の発表を見て、Cursor、Codex、自前 Agent の既定モデルを gpt-5.6(別名は Sol)から gpt-6-astra に切り替え、「入力単価 × 見積トークン」で予算を組む。結果は三通りに分かれる。
- 短い会話、JSON 抽出、チケット分類:トークン量はほとんど動かず、請求はいきなり ×2.5、品質の体感はほぼ横ばい。
- 長いリファクタ、データベース移行、ターミナルで依存関係を入れてテストまで走らせる仕事:Astra は寄り道と再試行が少ない。ウォールクロックが落ち、完了一件あたりの費用が並ぶ、あるいは勝つことがある。
- Computer Use のフォーム入力、CRM、フロントエンド QA:Sol はしばしば 1 時間超えても人の介入が要る。公式の遅延シミュレーションでは Astra はおよそ半分の時間——ただしデスクトップセッションがノート PC の蓋閉じで死なないことが前提だ。
だから「アップグレードは得か」が「Astra は高いか」として検索されるのは、問いを取り違えている。2.5 倍という貼紙はきれいだ。公式 Standard は 100万入力/出力あたり $10 / $50、Sol は $4 / $20。ポスターから推測できないのは、同じ一件で双方が同じ量の出力トークンを出すか、失敗してもう一周を買い直すかだ。
Artificial Analysis の独立評価は、これを二本の曲線に分ける。Coding Agent Index では、max effort の Astra は Sol のトークンをおよそ三分の一まで削り、一件あたりの費用は Sol と並びつつ点数は二点高い。Intelligence Index ではトークンは約 10% しか減らず、2.5 倍の貼紙が勝ち、Astra はおよそ 75% 高い。独立指数はあなたのリポジトリではない。それでも「全部アップする」と「何もアップしない」が両方愚かである理由は説明できる。
料金表に出てこない第三のコストがある。MCP タイムアウト、蓋閉じスリープ、キーチェーンのダイアログ、殺された xcodebuild。どれもモデルに同じ思考をもう一度書かせる。ツールと Schema を安定させる方法は 2026 年の AI Agent スタック。ホストをノートから出すべきか、つまり Macレンタル や常時稼働の クラウドMac に移すべきかは MCP を Cloud Mac / VPS / ローカルのどこに置くか。
2. 先に分類する:「GPT-6」と「GPT-5.6」は二つのボタンではない
2.1 トラック A:GPT-6 Astra Standard
旗艦推論+ツールループ+Computer Use。OpenAI はターミナルエンジニアリング、ブラウズ、専門成果物、科学ソフトウェア内のデスクトップ作業を強調する。ChatGPT Plus / Pro / Business / Enterprise は数日かけて展開され、API / Azure / Bedrock は並行して出る。Enterprise ワークスペースは既定でオフで、管理者が有効化するまで開かない。難しい、長い、画面に触る仕事向けであり、サイト全体の Completions 既定にはしない。
2.2 トラック B:GPT-5.6 Sol(gpt-5.6 別名)
2026 年 7 月以降、大半のチームの本番既定だ。窓は Astra と同じで、トークン単価はおよそ 60% 安い。日常の Agent コーディング、セキュリティ研究、長い推論はまだ戦える。公式 Terminal-Bench 4.0 は明確に遅れているが、DeepSWE や BrowseComp 系の「リポを読む/検索する」差は小さい。安定したパイプラインは、置き換える前に回帰せよ。
2.3 トラック C:GPT-5.6 Terra / Luna
Terra は中程度のペアプロ、Luna は高トラフィックの下書きと分類を担う。Astra の発表は、この二段を廃番にはしていない。Luna のトラフィックを Astra に回すのが、いちばんよくある金の燃やし方だ。
2.4 トラック D:Astra Fast
公式:最高およそ 2 倍速、Standard の 2 倍価格(短いコンテキスト帯でおよそ $20 / $100)。人が待っている対話にだけ使う。夜バッチには使わない。Batch / Flex はおよそ半額で、オフライン評価向け。
2.5 トラック E:隠れた実行ホスト
Responses API の Computer Use には生きたデスクトップセッションが要る。 公式 Computer Use ガイド を見よ。モデルが売るのは判断だ。クリック、ブラウザ、テストを走らせるのは機械だ。蓋を閉じる=セッション死=トークンを買い直す。長時間タスクのメモリをどう層分けするかは AI Agent Memory の本番アーキテクチャ。夜通しデスクトップループを回すなら、先に Astra を全社既定にするより、蓋の閉じない クラウドMac を検討せよ。
3. 同じ五列ヘッダーで比較する
「モデルを替える」と「ホストを替える」を同じ表に入れ、IQ ポスターだけを比べない。
| 選択肢 | 入口 | 実行能力 | コンテキスト | コスト | 権限境界 |
|---|---|---|---|---|---|
| GPT-6 Astra Standard | API gpt-6-astra / Codex / ChatGPT | 長い Agent、ターミナル、デスクトップ、ブラウズ。公式アライメントが強い | 1.05M。Codex は窓をまたいでメモを残せる(実験) | $10 / $50。キャッシュ読 $1。Fast でさらに ×2 | Enterprise は既定オフ。Computer Use は確認ポリシーが必要 |
| GPT-5.6 Sol | API gpt-5.6-sol / 別名 gpt-5.6 | コーディング旗艦としてはまだ使える。硬いターミナルとデスクトップは一段弱い | 1.05M、compaction 要約 | $4 / $20。同じ形でより安い | すでに本番既定。残す回帰コストは低い |
| GPT-5.6 Terra / Luna | ルートでフォールバック | 中程度のペアプロ / 高トラフィック抽出 | 短いコンテキストで足りる | Sol を大きく下回る | これらを Astra に上げない |
| Astra Fast | 同じモデルの速度レーン | 人が待っているとき | 同じ窓 | Standard ×2 | 既定にしてはいけない |
| 実行ホスト(隠れ) | ノート / VPS / Cloud Mac | MCP、ブラウザ、xcodebuild を走らせる。推論はしない | リポ、証明書、常時デスクトップ | 日貸しマシン + 再試行で無駄になるトークン | プロセスユーザーと送信出口 |
非対称な一文を引用してよい。新しい旗艦に替えても「蓋閉じのあと、同じ Computer Use ターンを買い直す」問題は直らない。安い Sol を残しても「ターミナル成功率が 20 点悪い」問題は直らない。 単価は軌道上の目盛りにすぎない。
3.1 公式ボードと独立ボード:Coding / Agent / Computer Use
数字は OpenAI 2026-09 の発表 と Artificial Analysis から取る。対照のベースラインであり、あなたの受け入れ点ではない。実験室の請求書は捏造しない。同じタスク、同じ harness、同じ effort で A/B せよ。
| 軸 | GPT-6 Astra | GPT-5.6 Sol | 読み方 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 硬いターミナル / 環境構築 / データ分析。Astra の主戦場 |
| DeepSWE v1.1 | 74.1% | 72.7% | 日常のリポ修正は近い。1.4 点のために全切しない |
| FrontierCode 1.1 Main | 53.3% | 47.5% | 難しいコーディングは動く。言語スタックは自分で確認 |
| AA Coding Agent Index | 67.0 | 65.1 | 点は近い。Astra はトークンが少なく、一件費用は並びうる |
| OSWorld 2.0 | 72.6% ≈40 min | 65.7% ≈75 min | Computer Use:高得点 + 約 47% 短い時間 |
| Agents' Last Exam | 59.3% | 53.6% | 実在の専門ソフトでの長いワークフロー |
| AutomationBench | 41.4% | 18.1% | アプリ横断自動化。いちばん広い差 |
| ScreenSpot-Pro | 92.7% | 76.9% | 画面のどこをクリックするか。デスクトップ Agent の必須 |
| AA Intelligence Index | 61.2 | 60.9 | 汎用知能はほぼ引き分け。Astra は約 75% 高い |
3.2 トークンコストの実地:再現できる算術であり、偽の請求書ではない
ここでの「実地」は二点だ。① 公式単価で同じタスク形態の算術をすること。② AA が公表したトークン効率をストレステストとして使い、自分の請求書としては使わないこと。税、キャッシュヒット、Fast 枠はドルを変える。比率の方が安定する。
| タスク形態 | 仮定使用量(入力/出力) | Sol 費用 | Astra 費用 | 判断 |
|---|---|---|---|---|
| 短い分類 / JSON 抽出 | 双方 100k / 20k | $0.80 | $2.00 | Astra は 2.5×。見送り |
| 日常パッチ(使用量が近い) | 200k / 80k | $2.40 | $6.00 | まず成功率を A/B。既定は Sol |
| 硬い Agent コーディング(AA:Astra token ≈⅓) | Sol 300k/150k;Astra 100k/50k | $4.20 | $3.50 | 一回で仕上げれば Astra の方が安くなりうる |
| Computer Use 一件 | 75 vs 40 分。Sol は再試行しやすい | 貼紙は安い + 再試行税が高い | 貼紙は高い + 一周少ない | 成功一件あたりでは Astra が勝つことが多い |
| 蓋閉じ再試行いちど | 直前の出力をもう一度買う | さらに +$3.00(例) | さらに +$2.50(例) | モデルではなくホストを替える |
OpenAI 自身も書いている。Terminal-Bench 4.0 一件あたりの推定 API コストは、Astra の方が Sol よりおよそ 9% 低い——2.5 倍の貼紙にもかかわらず。それは失敗が少なく、無駄な出力が少ないときにだけ成立する。受け入れ基準は 成功一件あたりのドル + ウォールクロック + 人の接管回数 であり、100万トークンあたりのポスター単価ではない。
4. シナリオの選び方
| 選択肢 | 入口 | 実行能力 | コンテキスト | コスト | 権限境界 |
|---|---|---|---|---|---|
| 個人の API 学習 / デモ作成 | ChatGPT または Sol | 高 effort を切り、歩数を制限 | 単一ファイル | 目標はほぼ $0 | テストキーのみ |
| 週次プロダクト、DAU 低 | 既定は Sol / Terra | Astra は「難件」だけルート | 短いコンテキスト + system をキャッシュ | 出力を入力の 3〜8× で予算 | バックエンド代理。ブラウザに Key を出さない |
| 硬いターミナル Agent / 大規模リファクタ | Astra Standard | max/xhigh。失敗で遮断 | リポ要約。ツリー全体をプロンプトに詰めない | 成功一件で値段を付ける。貼紙で自分を脅かさない | MCP を常駐させ、再試行でトークンを買わない |
| ブラウザ / デスクトップ Computer Use | Astra + Responses API | 確認ポリシーをオン | 本物の GUI セッション | ウォールクロックの方が単価より高い | 蓋の閉じるノートでは走らせない |
| 高 QPS 分類 / 抽出 | Luna またはより安いモデル | Astra 禁止 | 短い窓 | 単価に敏感 | レート制限 + 日次 cap |
| iOS / Xcode 同居 Agent | Cloud Mac 上の Host | モデルは推論だけ | 証明書と DerivedData は Mac に残す | マシン日貸し + API 従量 | キーチェーンは箱から出さない |
5. 推奨スタック
スタック A|まだアップしない(大半のチーム) 既定 gpt-5.6(Sol)または Terra → Luna / より安いモデルで分類 → 本番タスクでトークンを測る。「こんにちは」では測らない スタック B|ピンポイントアップ(推奨) ルート:硬いターミナル / Computer Use / 横断ツールの長時間 → gpt-6-astra → 日常 PR、補完、短い関数 → Sol のまま → キャッシュ読をオン。Batch できる評価を Standard に置かない → Fast は人が待っている対話だけ スタック C|Codex / Claude の双脳 Astra が硬いターミナルとデスクトップを担当 → Claude Code は長セッションのリファクタ用に残す(Skills 未移行) → 双方の worktree を隔離。サイト内の双 Agent 記事を参照 スタック D|Apple 納品 モデルは推論だけ → MCP / xcodebuild / 署名は Cloud Mac → 蓋閉じ再試行はトークンコストに直撃する
6. よくある落とし穴
- 落とし穴 1:2.5 倍の単価を見て「得ではない」と宣言する。硬い Agent では公式の一件コストの方が低くなりうる。成功率とトークン効率を測れ。
- 落とし穴 2:Terminal-Bench が約 20 点跳ねたから全量切替える。DeepSWE は 1.4 点。日常パッチの全切は知能税だ。
- 落とし穴 3:ChatGPT サブスクで「Astra が使える」ことを API の無料アップとみなす。サブスクには用量プールがある。API は 100万トークンで別課金、Fast はさらに倍だ。
- 落とし穴 4:Enterprise ワークスペースが自動で開くと思う。公式の既定はオフだ。
- 落とし穴 5:Computer Use を蓋の閉じるノートや共有 VDI で走らせる。死んだセッションは、いちばん高い出力をもう一度買う。
- 落とし穴 6:「こんにちは」や 20 行関数で月額を見積もる。本番 Prompt と本物のツール一覧で一周し、input / output / キャッシュヒットを記録せよ。
- 落とし穴 7:Astra の安全アライメントを「攻撃的セキュリティを手放しでやってよい」と読む。出荷モデルは高度なエクスプロイト系の依頼を拒む。防御的レビューは範囲内、権限を越える任務は拒否せよ。
7. 実装手順(7 ステップ)
- 本物の本番タスクを三つ選べ。日常パッチ一件、硬いターミナル/移行一件、Computer Use 一件(あるなら)。おもちゃ問題は使わない。
- 同じ harness、同じ effort で
gpt-5.6-solとgpt-6-astraを各一回走らせる。成功/失敗、ウォールクロック、input、output、キャッシュ、人の接管回数を記録する。 - 公式単価で「成功一件あたりのドル」を出す。失敗件は「すでに使った分 + もう一度走らせる」として数え、捨てない。
- Astra の成功一件が安いか、時計/接管が明らかに落ちたときだけ、そのクラスのルートを切替える。サイト全体の既定置き換えは禁止。
- Agent に最大 tool 歩数と日次ドル cap を置く。429 やタイムアウトでは Sol に落とす。Fast を叩き続けない。
- MCP、ブラウザセッション、Xcode を蓋の閉じないマシンへ移す。配置の判断は MCP と Cloud Mac。
- 社内料金表を書く。既定モデル、アップモデル、Fast 禁止リスト。毎月請求を diff し、基調講演ポスターとは照合しない。
8. FAQ
GPT-6 Astra と GPT-5.6 の紙の仕様差は何か?
窓はほぼ同じ(約 1.05M コンテキスト、128k 出力)。差は長時間ジョブの安定性、Computer Use、アライメント、そして トークンコストだ。Astra Standard は $10/$50、Sol は $4/$20。知識カットオフも一段新しいが、切り替える主因になることは稀だ。
コードだけ書くなら、アップすべきか?
そのコードが「硬いターミナル」に見えるかどうかだ。依存関係の導入、システムの変更、リポ横断の移行——Astra の Terminal-Bench 4.0 での約 20 点リードは測る価値がある。関数一つ、テスト追加、日常 PR——DeepSWE はほぼ引き分け。Sol を残せ。
Computer Use は Astra 必須か?
すでに Responses API でデスクトップ/ブラウザ自動化を回しているなら、公式 OSWorld と AutomationBench の差は十分大きく、Astra を第一陣のテストに入れよ。チャットでたまにページを開くだけなら、その機能のために 2.5 倍の既定価格を払うな。
トークンコストはキャッシュで消せるか?
キャッシュ読は入力のおよそ 10%(Astra $1 / Sol $0.40)。繰り返しの system prompt とツール Schema はキャッシュせよ。削れるのは入力だ。Agent の大半は依然として出力だ。キャッシュは 2.5 倍の出力単価を 1 倍にはしない。
なぜ Agent をクラウドMac に置くのか?
モデルが売るのは推論だけだ。MCP、ブラウザセッション、Xcode、キーチェーンが蓋閉じノートで落ちれば、有料層は再試行のたびに出力トークンを再請求する。常時稼働の Cloud Mac——つまり Macレンタル/クラウドMac——が削るのは 無駄なトークンコストであり、OpenAI のポスター単価ではない。
9. まとめ
GPT-6 Astra vs GPT-5.6 の正しい答えは「アップする/しない」ではない。タスク形態で分流することだ。Astra が勝つのは硬い Coding Agent、Computer Use、一回で仕上げる確率。Sol が勝つのは高トラフィック、短い仕事、すでに信頼している本番既定。2.5 倍の貼紙は本当だ。硬いターミナルでは公式の一件コストが低くなることも本当だ——失敗を減らし、再試行を減らし、蓋の閉じるノートの上にセッションを建てないことが前提だ。
実装の順は固定だ。三つの本物タスク → 同じ harness の A/B → 成功一件のドル → 勝ったクラスだけ切替 → キャッシュと歩数遮断 → 実行ホスト常駐。モデルはまた出荷される。タスク形態 × 一回で仕上げる × 起きているホストを毎週書き直してはならない。
トークンを一回で仕上げることに使い、蓋閉じ再試行に使わない
Astra の トークンコストはすでに 100万単位で印刷されている。制御できないのは、Computer Use セッションがノートで死ぬこと、MCP が落ちること、xcodebuild が殺されたあと出力がもう一周走ることだ。専用の クラウドMac は Host、リポ、デスクトップセッションを一本の常時経路に載せる。SSH は固定、蓋は閉じない。日貸しで受け入れ、月額で固定する——100万出力トークンのすべてが実ステップに当たり、「モデルはすでに正解していた、機械が先に眠った」には当たらないようにする。