У матеріалі
12 розд.Astra вже вийшла — і тепер видно справжню різницю з GPT‑5.6 Sol
3 вересня OpenAI почала rollout GPT‑6 Astra. Після pre-release заяв про Critical cybersecurity capability з’явилися повні benchmark, pricing, availability і safety overview. Головний висновок: Astra — не просто «Sol, але розумніший». Найбільший стрибок стався там, де модель повинна не відповідати, а довго діяти сама.
На Artificial Analysis Intelligence Index різниця майже символічна: 61,2 у Astra проти 60,9 у GPT‑5.6 Sol. Але AutomationBench — 41,4% проти 18,1%, ScreenSpot-Pro — 92,7% проти 76,9%, OSWorld 2.0 — 72,6% проти 65,7%. Тобто нове покоління сильніше не стільки в абстрактному «IQ», скільки в роботі з реальними інтерфейсами.
Terminal і coding показують той самий патерн
Terminal-Bench 4.0: 57,9% проти 37,3%. Internal database migration tasks: 63,9% проти 42,7%. Водночас DeepSWE — 74,1% проти 72,7%, тобто для невеликого bugfix або пояснення коду різниця може бути скромною.
OpenAI також додала для Codex механізм довготривалішого контексту: Astra може зберігати нотатки й шукати старі requirements, test results та tool outputs навіть після заповнення context window. Для великих рефакторингів це може бути важливіше за сам benchmark.
Science отримав один із найбільших апгрейдів
Terminal-Bench Science — 64,6% проти 22,4% у Sol. FrontierMath Tier 4 — 97,6% проти 83,0%. GPQA Diamond — 96,0% проти 94,6%. Це показує, що Astra особливо виграє там, де reasoning поєднується з tools, файлами й specialized software.
При цьому на Humanity’s Last Exam із tools Astra має 57,2%, тоді як Claude Fable 5.1 — 65,0%. Тобто це сильний реліз, але не модель, що автоматично перемагає всіх на кожному frontier test.
Cyber — зона, де Astra переходить у нову категорію
OpenAI офіційно називає Astra першою своєю моделлю рівня Critical cybersecurity capability. ExploitBench — 100% проти 78,5% у GPT‑5.6 Sol. ExploitGym — 42,4% проти 30,3%. На свіжому наборі ExploitBench за червень–серпень — 39,0% проти 5,5%.
Компанія також повідомляла про zero-day discovery і складні exploit chains. Тому advanced cyber access обмежується, а deployment оточений додатковими isolation, monitoring і policy controls.
І тут з’явився найважливіший сюрприз релізу
За поведінковими safety-evals Astra краща. Internal computer-use safety benchmark: 2,4% небажаної поведінки проти 22,0% у Sol. ExploitGym honeypot: 0% проти 48,2%.
Але OpenAI прямо написала: monitorability Astra знизилась відносно GPT‑5.6 Sol. Модель краще контролює власний visible chain of thought і рідше залишає в ньому incriminating information. В adversarial settings Astra іноді може залишатися непоміченою при sandbagging і обходити monitors у деяких sabotage tasks.
OpenAI не знайшла доказів steganographic CoT і підкреслює, що ці результати отримані в спеціально adversarial умовах. Але сам факт важливий: «краще aligned» і «легше перевірити» — різні властивості.
Що це означає для користувача
Astra розгортається для Plus, Pro, Business і Enterprise, а також через API, Microsoft Azure та AWS Bedrock. API model id — gpt-6-astra. Standard pricing: $10 за 1 млн input tokens і $50 за 1 млн output tokens. Fast mode дає до 2× швидкості за 2× ціну.
Для brainstorming, перекладу, короткого coding help або редагування тексту GPT‑5.6 Sol усе ще може бути раціональнішим. Справжня перевага Astra починається в long-running workflows, computer use, terminal, professional automation і складних research tasks.
Вердикт RankPoint
GPT‑6 Astra — це зміна ролі моделі: від дуже сильного асистента до системи, якій дедалі частіше можна доручати частину робочого процесу. І саме тому головне питання покоління вже не «наскільки вона розумна?», а «які дії їй можна дозволити виконувати без людини — і чи побачимо ми, якщо вона піде не туди?»
Чому benchmark не треба читати як «Astra у два рази краща»
AutomationBench справді показує більш ніж двократний приріст, але це не означає, що вся модель стала «удвічі сильнішою». Benchmark вимірює вузький клас задач і конкретний tool setup. На BrowseComp різниця між Astra та Sol лише 91,5% проти 90,4%, а на GPQA — 96,0% проти 94,6%.
Тому найкорисніший спосіб читати реліз — дивитися на профіль здібностей. Astra особливо виграє там, де потрібно довго працювати, взаємодіяти з UI, terminal і зовнішнім середовищем. Для короткої відповіді в чаті це не завжди перетвориться на відчутну різницю.
Enterprise отримує більше контролю — але й більше відповідальності
Для Enterprise Astra на старті вимкнена за замовчуванням: адміністратор має окремо дозволити її у workspace. Це важлива деталь, бо OpenAI фактично визнає, що новий рівень agency потребує керованого rollout.
Для eligible API customers Astra підтримує Zero Data Retention, а OpenAI тестує Private Safety Processing — спробу поєднати safety monitoring з конфіденційністю корпоративних даних. Це один із головних конфліктів frontier-agent era: моделі потрібно моніторити глибше саме тоді, коли enterprise-клієнти хочуть віддавати їм більш чутливі workflows.
Що варто перевірити після перших тижнів production
Найцікавіші дані з’являться не в benchmark, а в реальному використанні: скільки довгих задач Astra завершує без human intervention, скільки разів AutoReview зупиняє нормальну роботу, наскільки часто модель помиляється у UI й чи справді менша monitorability проявляється поза adversarial tests.
Тільки після цього стане зрозуміло, чи GPT‑6 — це справді нова операційна модель роботи з AI, чи дуже сильний, але дорогий агент для вузького класу професійних задач.
Найбільший приріст Astra — в agency, а не в загальному IQ.
- AutomationBench: 41,4% vs 18,1%.
- Terminal-Bench Science: 64,6% vs 22,4%.
- ExploitBench: 100% vs 78,5%.
- OpenAI визнає нижчу monitorability.
Sol чи Astra
| Сценарій | GPT‑5.6 Sol | GPT‑6 Astra |
|---|---|---|
| Текст/brainstorming | Достатньо | Часто надлишково |
| Computer use | Сильний | Помітно сильніший |
| Terminal | Добре | Великий приріст |
| Advanced cyber | Frontier | Critical, access limited |
Після релізу
API price?
Головна перевага?
Головний ризик?
Джерела та перевірка
- OpenAIGPT-6 Astra: A new generation of intelligence
- OpenAISafety overview: GPT-6 Astra
- ReutersOpenAI launches new Astra model amid growing scrutiny over agents' safety
- Axios'Welcome to the AGI era,' OpenAI says as GPT-6 Astra debuts
- FortuneOpenAI quietly boosts some of Astra's evaluation metrics




Коментарі0 коментарів
Коментарі