Сначала вывод
- GPT-6 Astra — не универсальная замена GPT-5.6 Sol. Это точечный апгрейд под длинные задачи агентов и computer use. Короткий чат, классификацию и массовое извлечение оставляйте на Sol / Terra / Luna.
- Официальный Standard делает Astra ровно в 2.5× дороже Sol ($10 / $50 против $4 / $20 за миллион токенов). Смысл не в ценнике — в вероятности закончить с первого раза и в налоге на ретраи.
- Кодинг: официальный Terminal-Bench 4.0 — Astra 57,9% против Sol 37,3%; DeepSWE расходится на 1,4 пункта. Не переключайте каждый дневной патч ради нового имени.
- Computer use: OSWorld 2.0 — 72,6% против 65,7%, по часам примерно 40 против 75 минут (примерно на 47% меньше). Браузерные и десктопные марафоны — домашнее поле Astra.
- Водораздел стоимости токенов — форма задачи × доля вывода × закрывается ли крышка хоста. Поставить агента на всегда включённый облачный Mac часто режет счёт сильнее, чем смена модели по умолчанию. Если вам нужна аренда Mac mini, хост и сессия рабочего стола должны жить на одной машине, которая не засыпает.
Поколение модели — не водораздел. Водораздел — форма задачи и шанс закончить с первого раза.
0. Сначала вывод
На 2026-09-10 анонс OpenAI ставит GPT-6 Astra (API: gpt-6-astra) флагманом интеллекта и выравнивания и прямо сравнивает его с GPT-5.6 Sol. У обеих сторон около 1.05M контекста и максимум 128k вывода. Разрыв не в окне. Разрыв в том, не сойдёт ли длинная цепочка с рельсов, не истечёт ли управление рабочим столом и не пробьют ли ретраи счёт.
Одно предложение тем, кто решает сегодня: если основной путь — терминальный агент, межинструментальный рефакторинг или computer use в браузере и на рабочем столе, поставьте Astra в первую партию A/B; если основной путь — ежедневные дополнения в Cursor, классификация или маршрутизация с высоким QPS, дешевле оставить GPT-5.6. Это не голосование «кто умнее». Это вопрос, кто реже заставляет платить дважды.
В июле мы писали, какой ярус GPT-5.6 брать против Claude и Gemini. Тот текст закрывал семейство 5.6 плюс маршрутизацию между вендорами. Этот отвечает на более свежий вопрос: Astra вышла — оставлять ли 5.6 дефолтом?
1. Почему вопрос апгрейда уводит цена за миллион
Старый плейбук ломается скучно. Команда видит Astra, переключает Cursor, Codex и самописного агента с gpt-5.6 (алиас на Sol) на gpt-6-astra и считает бюджет как «цена входа × угаданные токены». Появляются три исхода:
- Короткий чат, извлечение JSON, классификация тикетов: расход токенов почти не двигается, счёт ×2.5, качество ощущается плоским.
- Длинные рефакторинги, миграции БД, поставить зависимости и прогнать тесты в терминале: Astra меньше блуждает и меньше ретраит. Настенные часы падают. Стоимость законченной задачи может сравняться или выиграть.
- Формы computer use, CRM, фронтенд-QA: Sol часто сжигает больше часа и всё равно зовёт человека. Официальные симуляции задержки ставят Astra примерно на половину времени — если сессия рабочего стола не умрёт, когда закроют крышку ноутбука.
Поэтому искать «стоит ли апгрейд» как «дорогая ли Astra» — не тот вопрос. Ценник 2.5× чистый: официальный Standard — $10 / $50 за миллион входа/выхода; Sol — $4 / $20. Чего не угадаешь по постеру: выдадут ли обе модели столько же выходных токенов на одной работе и не купит ли сбой цикл ещё раз.
Artificial Analysis раскладывает это на две кривые. На Coding Agent Index Astra при max effort тратит примерно треть токенов Sol, поэтому стоимость задачи может сравняться с Sol и при этом быть на два пункта выше. На Intelligence Index токены падают лишь примерно на 10%, ценник 2.5× побеждает, Astra примерно на 75% дороже. Независимый индекс — не ваш репозиторий. Он объясняет, почему «апгрейдить всё» и «не апгрейдить ничего» одинаково глупо.
Третья статья расходов никогда не появляется в прайсе: таймауты MCP, сон от крышки, диалоги Keychain, убитый xcodebuild. Каждое заставляет модель заново написать то же рассуждение. Как держать инструменты и схемы стабильными — в стеке AI-агента 2026. Должен ли хост покинуть ноутбук — в MCP на облачном Mac против VPS против локальной машины. Именно это выбирают команды, когда берут аренду Mac mini вместо того, чтобы на ночь захлопывать крышку.
2. Сначала классификация: «GPT-6» и «GPT-5.6» — не две кнопки
2.1 Дорожка A: GPT-6 Astra Standard
Флагманское рассуждение плюс циклы инструментов плюс computer use. OpenAI делает акцент на терминальной инженерии, браузинге, профессиональных артефактах и работе на рабочем столе внутри научного ПО. ChatGPT Plus / Pro / Business / Enterprise раскатываются несколько дней; API, Azure и Bedrock идут параллельно. Корпоративные воркспейсы по умолчанию выключены, пока админ их не откроет. Берите для трудной, длинной, экранной работы — не как общесайтовый дефолт Completions.
2.2 Дорожка B: GPT-5.6 Sol (алиас gpt-5.6)
Производственный дефолт большинства команд с июля 2026. То же окно, что у Astra, примерно на 60% дешевле за токен. Ежедневный агентский кодинг всё ещё работает. Официальный Terminal-Bench 4.0 теперь заметно отстаёт; разрывы DeepSWE и BrowseComp в духе «прочитать репозиторий / достать» малы. Стабильные пайплайны должны прогнать регрессию до замены.
2.3 Дорожка C: GPT-5.6 Terra / Luna
Terra закрывает среднее парное программирование. Luna — массовые черновики и классификацию. Astra их не снимает с производства. Гнать трафик Luna на Astra — самый частый способ сжечь деньги.
2.4 Дорожка D: Astra Fast
Официально: до примерно 2× скорости при 2× Standard (около $20 / $100 в полосе короткого контекста). Только когда человек ждёт. Batch / Flex — примерно половина цены, для офлайн-оценок.
2.5 Дорожка E: скрытый хост
Computer use на Responses API нужна живая сессия рабочего стола — см. официальное руководство по computer use. Модель продаёт суждение. Клики, браузеры и тесты крутятся на машине. Крышка закрыта = сессия мертва = токены покупаются снова. Как слоить память длинных задач — в архитектуре памяти AI-агента. Облачный Mac, то есть практическая аренда Mac mini без захлопывания крышки, как раз держит эту сессию живой.
3. Сравнение под одной пятиколоночной шапкой
Положите «сменить модель» и «сменить хост» в одну таблицу, чтобы не сравнивать постеры IQ.
| Вариант | Вход | Исполнение | Контекст | Стоимость | Граница прав |
|---|---|---|---|---|---|
| GPT-6 Astra Standard | API gpt-6-astra / Codex / ChatGPT | Длинные агенты, терминал, рабочий стол, браузер; сильнее официальное выравнивание | 1.05M; Codex может вести заметки между окнами (эксперимент) | $10 / $50; чтение кэша $1; Fast ещё ×2 | Enterprise по умолчанию выкл.; computer use нужна политика подтверждения |
| GPT-5.6 Sol | API gpt-5.6-sol / алиас gpt-5.6 | По-прежнему флагман кодинга; слабее на жёстком терминале и рабочем столе | 1.05M, саммари через compaction | $4 / $20; та же форма, дешевле | Уже производственный дефолт; дёшево оставить |
| GPT-5.6 Terra / Luna | Маршрутизируемый запасной путь | Среднее парное программирование / массовое извлечение | Короткого контекста достаточно | Заметно ниже Sol | Не апгрейдите их до Astra |
| Astra Fast | Та же модель, полоса скорости | Когда человек ждёт | То же окно | Standard ×2 | Никогда не дефолт |
| Хост исполнения (скрытый) | Ноутбук / VPS / Cloud Mac | Крутит MCP, браузер, xcodebuild — не инференс | Репозиторий, сертификаты, всегда живой рабочий стол | Суточная аренда машины + токены, сожжённые ретраями | Пользователь процесса и исходящий трафик |
Цитируйте так: новый флагман не чинит «закрытая крышка повторно покупает тот же ход computer use»; более дешёвый Sol не чинит «успех в терминале на двадцать пунктов хуже». Цена за миллион — лишь риска на дорожке.
3.1 Официальные и независимые доски: кодинг / агент / computer use
Цифры из заметки OpenAI за сентябрь 2026 и Artificial Analysis. Базовая линия, не ваш приёмочный балл. Мы не выдумываем лабораторные счета. Гоняйте ту же задачу, тот же harness, тот же effort.
| Ось | GPT-6 Astra | GPT-5.6 Sol | Как читать |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | Жёсткий терминал / окружение / данные — поле Astra |
| DeepSWE v1.1 | 74.1% | 72.7% | Ежедневные правки репозитория близки; не переключайте ради 1,4 пункта |
| FrontierCode 1.1 Main | 53.3% | 47.5% | Более жёсткий кодинг двигается; всё равно проверьте свой языковой стек |
| AA Coding Agent Index | 67.0 | 65.1 | Баллы близки; Astra тратит меньше токенов, стоимость/задача может сравняться |
| OSWorld 2.0 | 72.6% ≈40 min | 65.7% ≈75 min | Computer use: выше балл + примерно на 47% меньше времени |
| Agents' Last Exam | 59.3% | 53.6% | Длинные воркфлоу в настоящем профессиональном ПО |
| AutomationBench | 41.4% | 18.1% | Автоматизация между приложениями — самый широкий разрыв |
| ScreenSpot-Pro | 92.7% | 76.9% | Куда кликать на экране |
| AA Intelligence Index | 61.2 | 60.9 | Общий интеллект — ничья; Astra примерно на 75% дороже |
3.2 Полевой тест стоимости токенов: воспроизводимая арифметика, без фальшивых счетов
«Полевой тест» здесь означает две вещи: (1) официальные тарифы на той же форме задачи; (2) опубликованную AA эффективность токенов как стресс-тест, а не как ваш счёт. Налоги, попадания в кэш и Fast меняют доллары. Отношения устойчивее.
| Форма | Допущение (in/out) | Sol | Astra | Вывод |
|---|---|---|---|---|
| Короткая классификация / JSON | $0.80 | $2.00 | Astra 2.5× — пропускать | |
| Ежедневный патч (похожий расход) | 200k / 80k | $2.40 | $6.00 | Сначала A/B успеха; дефолт Sol |
| Жёсткий агентский кодинг (AA: токены Astra ≈⅓) | Sol 300k/150k; Astra 100k/50k | $4.20 | $3.50 | Astra может быть дешевле, если заканчивает с первого раза |
| Одна задача computer use | 75 против 40 мин; Sol чаще ретраит | Дешёвый ценник + налог на ретраи | Дорогой ценник + на цикл меньше | За успешную задачу Astra часто выигрывает |
| Один ретрай из-за крышки | Купить последний вывод ещё раз | +$3.00 (пример) | +$2.50 (пример) | Менять хост, не модель |
Сама OpenAI пишет, что оценочная стоимость API на задачу Terminal-Bench 4.0 у Astra примерно на 9% ниже, чем у Sol — несмотря на ценник 2.5×. Это держится только если вы реже проигрываете и меньше пишете воды. Приёмка должна быть доллары за успешную задачу + настенные часы + человеческие перехваты, а не постерная цена за миллион токенов.
4. Как выбирать
| Вариант | Вход | Исполнение | Контекст | Стоимость | Граница прав |
|---|---|---|---|---|---|
| Учить API / демо | ChatGPT или Sol | Низкий effort, потолок шагов | Один файл | Цель около $0 | Только тестовые ключи |
| Еженедельный продукт, низкий DAU | Дефолт Sol / Terra | На Astra только трудные задачи | Короткий контекст + кэшированный system | Бюджет вывода 3–8× входа | Бэкенд-прокси; никаких ключей в браузере |
| Жёсткий терминал / большой рефакторинг | Astra Standard | max/xhigh; сработать предохранитель | Дайджест репозитория, не всё дерево | Ценить успешную задачу, не ценник | Держать MCP живым, чтобы не докупать токены |
| Computer use в браузере / на рабочем столе | Astra + Responses API | Политика подтверждения включена | Настоящая GUI-сессия | Настенные часы — дорогая строка | Не гонять это на ноутбуке с закрывающейся крышкой |
| Классификация / извлечение с высоким QPS | Luna или дешевле | Запретить Astra | Короткое окно | Чувствительно к цене за миллион | Лимит частоты + дневной cap |
| iOS / Xcode на той же машине | Хост на Cloud Mac | Модель только считает | Сертификаты и DerivedData остаются на Mac | Суточная аренда + API по факту | Keychain никогда не покидает машину |
5. Рекомендуемые стеки
Стек A — пока не апгрейдить (большинство команд) Дефолт gpt-5.6 (Sol) или Terra → Luna / более дешёвая модель для классификации → Мерить токены на производственной задаче, не на «привет» Стек B — точечный апгрейд (рекомендуется) Маршрут: жёсткий терминал / computer use / длинные межинструментальные задачи → gpt-6-astra → Ежедневные PR, дополнения, короткие функции → оставить Sol → Чтения кэша включены; Batch-оценки не на Standard → Fast только когда человек ждёт Стек C — двойной мозг Codex / Claude Astra на жёстком терминале и рабочем столе → Claude Code остаётся для длинных рефакторингов (Skills не мигрированы) → Изолировать worktree Стек D — поставка Apple Модель только считает → MCP / xcodebuild / подпись на Cloud Mac → Ретраи из-за крышки бьют прямо по стоимости токенов
6. Типичные ошибки
- Ошибка 1: Объявить «не стоит» по ценнику 2.5×. Официальная стоимость задачи на жёстких агентах может быть ниже. Мерите успех и эффективность токенов.
- Ошибка 2: Переключить всё, потому что Terminal-Bench прыгнул примерно на 20 пунктов. DeepSWE — 1,4 пункта. Ежедневные патчи — налог на интеллект.
- Ошибка 3: Считать доступ в ChatGPT бесплатным апгрейдом API. У подписок есть пулы; API считает за миллион токенов; Fast удваивает ещё раз.
- Ошибка 4: Предполагать, что корпоративные воркспейсы сами включат Astra. Официальный дефолт — выкл.
- Ошибка 5: Computer use на ноутбуке с закрывающейся крышкой или на общем VDI. Мёртвая сессия повторно покупает самый дорогой вывод — поэтому аренда Mac mini и сессия на облачном Mac.
- Ошибка 6: Оценивать месяц по «привет» или функции на 20 строк. Берите производственный промпт и настоящий список инструментов. Логируйте вход / выход / попадания в кэш.
- Ошибка 7: Читать выравнивание как зелёный свет для наступательной безопасности. Поставляемая модель отказывает в продвинутых exploit-запросах. Защитный разбор — в рамках; пересекать авторизованную границу — нет.
7. Семь шагов
- Выберите три настоящие производственные задачи: один ежедневный патч, одну жёсткую терминальную/миграционную, одну задачу computer use если она есть. Без игрушек.
- Тот же harness, тот же effort: прогоните
gpt-5.6-solиgpt-6-astraпо одному разу. Логируйте успех/провал, часы, вход, выход, кэш, человеческие перехваты. - Посчитайте доллары за успешную задачу по официальным тарифам. Провалы считаются как «уже потрачено + прогнать снова».
- Только если Astra выигрывает в долларах за успех или явно режет часы/перехваты, переключайте этот класс. Никакой общесайтовой замены дефолта.
- Ограничьте шаги инструментов и дневные USD. На 429 или таймауте откатывайтесь на Sol — не долбите Fast.
- Перенесите MCP, браузерные сессии и Xcode на хост, который не закрывает крышку. См. MCP и облачный Mac — на практике это аренда Mac mini, а не повторная покупка самого дорогого вывода.
- Напишите внутренний прайс: модель по умолчанию, модель апгрейда, запретный список Fast. Сверяйте счёт ежемесячно, не кейноут.
8. FAQ
Чем GPT-6 Astra и GPT-5.6 отличаются на бумаге?
Окно почти то же (около 1.05M контекста, 128k вывода). Разрыв — в стабильности длинных задач, computer use, выравнивании и стоимости токенов: Astra Standard $10/$50, Sol $4/$20. Дата отсечения знаний тоже сдвинулась; редко именно она причина смены.
Если мы только пишем код, стоит ли апгрейдиться?
Только если код похож на жёсткий терминал. Ставить зависимости, менять систему, мигрировать между репозиториями — отрыв Astra примерно в 20 пунктов на Terminal-Bench 4.0 стоит теста. Одна функция, добавить тесты, ежедневный PR — DeepSWE ничья. Оставляйте Sol.
Computer use — это только про Astra?
Если вы уже гоняете автоматизацию рабочего стола и браузера на Responses API, официальные разрывы OSWorld и AutomationBench достаточно велики, чтобы тестировать Astra первой. Если вы лишь изредка открываете страницу в чате, не платите 2.5× как дефолт ради этого.
Может ли кэш стереть разрыв в стоимости токенов?
Чтения кэша — около 10% входа (Astra $1 / Sol $0.40). Кэшируйте системный промпт и схему инструментов. Это режет вход. Агенты по-прежнему тратят на вывод. Кэш не превращает цену вывода 2.5× в 1×.
Зачем ставить агента на облачный Mac?
Модель продаёт инференс. Если MCP, браузерная сессия, Xcode или Keychain умирают на закрытом ноутбуке, платный ярус повторно снимает выходные токены. Всегда включённый облачный Mac — практическая аренда Mac mini — режет напрасную стоимость токенов, а не постерный тариф OpenAI.
9. Итог
Правильный ответ на GPT-6 Astra vs GPT-5.6 — не «апгрейдить» или «нет». Это разделить по форме задачи. Astra выигрывает на жёстких кодирующих агентах, computer use и шансе закончить с первого раза. Sol выигрывает на объёме, коротких задачах и дефолте, которому вы уже доверяете. Ценник 2.5× настоящий. Официальная стоимость задачи на жёстком терминале всё равно может быть ниже — если вы реже проигрываете, меньше ретраите и перестаёте строить сессии на ноутбуке с закрывающейся крышкой.
Порядок работы: три настоящие задачи → A/B на том же harness → доллары за успех → переключить только выигравший класс → кэш и предохранители шагов → держать хост живым. Модели выйдут снова. Форма задачи × закончить с первого раза × хост, который не засыпает не стоит переписывать каждую неделю.
Тратить токены на то, чтобы закончить с первого раза, а не на ретраи из-за крышки
Стоимость токенов Astra уже напечатана за миллион. Чем вы не управляете — сессия computer use, которая умирает на ноутбуке, MCP, который отваливается, и xcodebuild, которого убивают, — после чего вывод идёт снова. Выделенный облачный Mac держит хост, репозиторий и сессию рабочего стола на одном всегда живом пути. Стабильный SSH, без крышки. Сначала аренда Mac mini на сутки для приёмки, затем месяц — чтобы каждый миллион выходных токенов попадал в настоящий шаг, а не в «модель уже поняла, машина уснула».