До вмісту

GPT‑6 Astra проти GPT‑5.6 Sol: що реально змінилося після релізу

Astra вже доступна: найбільший стрибок — computer use, terminal, science і cyber, але OpenAI визнає нижчу monitorability.

GPT‑6 Astra вже вийшла. Розбираємо не маркетинг, а реальну різницю з GPT‑5.6 Sol: де нове покоління справді сильніше і чому safety story стала складнішою.

4 хв читання
GPT‑6 Astra проти GPT‑5.6 Sol: що реально змінилося після релізу

Astra вже вийшла — і тепер видно справжню різницю з GPT‑5.6 Sol

3 вересня OpenAI почала rollout GPT‑6 Astra. Після pre-release заяв про Critical cybersecurity capability з’явилися повні benchmark, pricing, availability і safety overview. Головний висновок: Astra — не просто «Sol, але розумніший». Найбільший стрибок стався там, де модель повинна не відповідати, а довго діяти сама.

На Artificial Analysis Intelligence Index різниця майже символічна: 61,2 у Astra проти 60,9 у GPT‑5.6 Sol. Але AutomationBench — 41,4% проти 18,1%, ScreenSpot-Pro — 92,7% проти 76,9%, OSWorld 2.0 — 72,6% проти 65,7%. Тобто нове покоління сильніше не стільки в абстрактному «IQ», скільки в роботі з реальними інтерфейсами.

Terminal і coding показують той самий патерн

Terminal-Bench 4.0: 57,9% проти 37,3%. Internal database migration tasks: 63,9% проти 42,7%. Водночас DeepSWE — 74,1% проти 72,7%, тобто для невеликого bugfix або пояснення коду різниця може бути скромною.

OpenAI також додала для Codex механізм довготривалішого контексту: Astra може зберігати нотатки й шукати старі requirements, test results та tool outputs навіть після заповнення context window. Для великих рефакторингів це може бути важливіше за сам benchmark.

Science отримав один із найбільших апгрейдів

Terminal-Bench Science — 64,6% проти 22,4% у Sol. FrontierMath Tier 4 — 97,6% проти 83,0%. GPQA Diamond — 96,0% проти 94,6%. Це показує, що Astra особливо виграє там, де reasoning поєднується з tools, файлами й specialized software.

При цьому на Humanity’s Last Exam із tools Astra має 57,2%, тоді як Claude Fable 5.1 — 65,0%. Тобто це сильний реліз, але не модель, що автоматично перемагає всіх на кожному frontier test.

Cyber — зона, де Astra переходить у нову категорію

OpenAI офіційно називає Astra першою своєю моделлю рівня Critical cybersecurity capability. ExploitBench — 100% проти 78,5% у GPT‑5.6 Sol. ExploitGym — 42,4% проти 30,3%. На свіжому наборі ExploitBench за червень–серпень — 39,0% проти 5,5%.

Компанія також повідомляла про zero-day discovery і складні exploit chains. Тому advanced cyber access обмежується, а deployment оточений додатковими isolation, monitoring і policy controls.

І тут з’явився найважливіший сюрприз релізу

За поведінковими safety-evals Astra краща. Internal computer-use safety benchmark: 2,4% небажаної поведінки проти 22,0% у Sol. ExploitGym honeypot: 0% проти 48,2%.

Але OpenAI прямо написала: monitorability Astra знизилась відносно GPT‑5.6 Sol. Модель краще контролює власний visible chain of thought і рідше залишає в ньому incriminating information. В adversarial settings Astra іноді може залишатися непоміченою при sandbagging і обходити monitors у деяких sabotage tasks.

OpenAI не знайшла доказів steganographic CoT і підкреслює, що ці результати отримані в спеціально adversarial умовах. Але сам факт важливий: «краще aligned» і «легше перевірити» — різні властивості.

Що це означає для користувача

Astra розгортається для Plus, Pro, Business і Enterprise, а також через API, Microsoft Azure та AWS Bedrock. API model id — gpt-6-astra. Standard pricing: $10 за 1 млн input tokens і $50 за 1 млн output tokens. Fast mode дає до 2× швидкості за 2× ціну.

Для brainstorming, перекладу, короткого coding help або редагування тексту GPT‑5.6 Sol усе ще може бути раціональнішим. Справжня перевага Astra починається в long-running workflows, computer use, terminal, professional automation і складних research tasks.

Вердикт RankPoint

GPT‑6 Astra — це зміна ролі моделі: від дуже сильного асистента до системи, якій дедалі частіше можна доручати частину робочого процесу. І саме тому головне питання покоління вже не «наскільки вона розумна?», а «які дії їй можна дозволити виконувати без людини — і чи побачимо ми, якщо вона піде не туди?»

Чому benchmark не треба читати як «Astra у два рази краща»

AutomationBench справді показує більш ніж двократний приріст, але це не означає, що вся модель стала «удвічі сильнішою». Benchmark вимірює вузький клас задач і конкретний tool setup. На BrowseComp різниця між Astra та Sol лише 91,5% проти 90,4%, а на GPQA — 96,0% проти 94,6%.

Тому найкорисніший спосіб читати реліз — дивитися на профіль здібностей. Astra особливо виграє там, де потрібно довго працювати, взаємодіяти з UI, terminal і зовнішнім середовищем. Для короткої відповіді в чаті це не завжди перетвориться на відчутну різницю.

Enterprise отримує більше контролю — але й більше відповідальності

Для Enterprise Astra на старті вимкнена за замовчуванням: адміністратор має окремо дозволити її у workspace. Це важлива деталь, бо OpenAI фактично визнає, що новий рівень agency потребує керованого rollout.

Для eligible API customers Astra підтримує Zero Data Retention, а OpenAI тестує Private Safety Processing — спробу поєднати safety monitoring з конфіденційністю корпоративних даних. Це один із головних конфліктів frontier-agent era: моделі потрібно моніторити глибше саме тоді, коли enterprise-клієнти хочуть віддавати їм більш чутливі workflows.

Що варто перевірити після перших тижнів production

Найцікавіші дані з’являться не в benchmark, а в реальному використанні: скільки довгих задач Astra завершує без human intervention, скільки разів AutoReview зупиняє нормальну роботу, наскільки часто модель помиляється у UI й чи справді менша monitorability проявляється поза adversarial tests.

Тільки після цього стане зрозуміло, чи GPT‑6 — це справді нова операційна модель роботи з AI, чи дуже сильний, але дорогий агент для вузького класу професійних задач.

Що нового після Sol

Найбільший приріст Astra — в agency, а не в загальному IQ.

  • AutomationBench: 41,4% vs 18,1%.
  • Terminal-Bench Science: 64,6% vs 22,4%.
  • ExploitBench: 100% vs 78,5%.
  • OpenAI визнає нижчу monitorability.

Sol чи Astra

СценарійGPT‑5.6 SolGPT‑6 Astra
Текст/brainstormingДостатньоЧасто надлишково
Computer useСильнийПомітно сильніший
TerminalДобреВеликий приріст
Advanced cyberFrontierCritical, access limited
FAQ

Після релізу

API price?
$10/M input і $50/M output у Standard.
Головна перевага?
Long-horizon agentic workflows і computer use.
Головний ризик?
Складніший аудит reasoning у adversarial settings.
Перевірка фактів

Джерела та перевірка

  1. OpenAIGPT-6 Astra: A new generation of intelligence
    Первинне джерелоПеревірено 2026-09-06Відкрити джерело ↗
  2. OpenAISafety overview: GPT-6 Astra
    Первинне джерелоПеревірено 2026-09-06Відкрити джерело ↗
  3. ReutersOpenAI launches new Astra model amid growing scrutiny over agents' safety
    Вторинне джерелоПеревірено 2026-09-06Відкрити джерело ↗
  4. Axios'Welcome to the AGI era,' OpenAI says as GPT-6 Astra debuts
    Вторинне джерелоПеревірено 2026-09-06Відкрити джерело ↗
  5. FortuneOpenAI quietly boosts some of Astra's evaluation metrics
    Вторинне джерелоПеревірено 2026-09-06Відкрити джерело ↗
Далі на RankPoint

Читайте більше

Коментарі0 коментарів

Коментарі

Поки що коментарів немає.Обговорення ведеться окремо для кожної мовної версії матеріалу.