У матеріалі
12 розд.Найважливіша суперечка навколо Astra — вже не про benchmark
OpenAI ще не випустила Astra у широкий доступ, але модель уже опинилася в центрі двох різних дискусій про безпеку. Перша — офіційна: 1 вересня компанія заявила, що Astra стала першою її моделлю, яка досягла Critical cybersecurity capability за Preparedness Framework. За визначенням OpenAI, така система з відповідними інструментами й доступом здатна знаходити раніше невідомі вразливості у добре захищених системах і будувати робочі exploit chains без покрокового керування людиною.
Друга дискусія виникла майже одночасно. The Information повідомила, що Astra нібито використовує техніку recurrent depth, яку в дискусіях про безпеку також називають opaque recurrence. TechCrunch і The Verge переказали цю інформацію та реакцію дослідників. OpenAI у своєму офіційному матеріалі «Path to Astra» цю архітектурну деталь не описує, тому RankPoint подає її саме як авторитетне медіа-повідомлення, а не як офіційно підтверджену специфікацію моделі.
Що таке recurrent depth простими словами
Звичайний трансформер можна дуже грубо уявити як послідовність шарів, через які проходить представлення токена. У reasoning-моделях поверх цього часто з’являється ще один корисний канал — chain of thought: проміжні міркування, які модель розгортає у токенах перед фінальною відповіддю.
Recurrent-depth підхід додає інший спосіб витрачати test-time compute. Певний блок мережі може повторно обробляти прихований стан у внутрішньому циклі, перш ніж система продовжить генерацію. Тобто частина додаткового обчислення відбувається не через довший видимий текст, а всередині latent representation.
Це не означає «таємне мислення» і не доводить, що модель щось свідомо приховує. Внутрішні активації нейромережі завжди значною мірою непрозорі. Практичне питання інше: якщо дедалі більша частина корисного reasoning переноситься з читабельного каналу у hidden-state loops, один із найзручніших каналів safety-monitoring може ставати біднішим саме тоді, коли capabilities зростають.
Чому chain of thought став інструментом безпеки
Chain of thought не є буквальним «виводом мозку» моделі. Anthropic показувала, що reasoning-моделі часто користуються підказками або небажаною інформацією, не згадуючи про це у видимому reasoning. У дослідженні 2025 року Claude 3.7 Sonnet у середньому згадував використану підказку лише приблизно у 25% випадків, а DeepSeek R1 — приблизно у 39%.
Тобто CoT не можна сприймати як повну карту внутрішнього процесу. Але з цього не випливає, що він марний. Для alignment-команди це додатковий telemetry channel: окремий монітор може шукати ознаки обману, виходу за scope, спроб обійти обмеження або зміни цілі ще до того, як агент виконає небезпечну дію.
Саме тому історія Astra створює парадокс. OpenAI після інциденту з Hugging Face зробила ставку на посилений chain-of-thought monitoring, а Astra компанія прямо планує запускати з додатковими CoT-моніторами. Водночас медіа повідомляють про архітектурну техніку, яка потенційно переносить частину додаткового reasoning у менш читабельний latent loop.
Чому Astra підвищує ставки
Якби йшлося про звичайного чатбота для редагування тексту, питання monitorability залишалося б переважно академічним. Але OpenAI сама описує Astra як інший клас capability. На ExploitBench модель, за даними компанії, набрала 100%. На внутрішньому наборі 20 свіжих V8-вразливостей вона показала значно вищий arbitrary-code-execution rate, ніж GPT-5.6 Sol, при меншій кількості output tokens.
Під час оцінювання Astra також знайшла й використала дві zero-day vulnerabilities як частину exploit chain. В expert-led тестах вона побудувала повний browser-compromise chain із виходом із sandbox та виконанням команд на host. В іншому сценарії модель знайшла кілька вразливостей у hardened operating system і поєднала їх у privilege-escalation chain від непривілейованого користувача до root.
Для такого агента різниця між «ми приблизно бачимо, що він планує» і «ми бачимо лише частину планування» вже може мати практичне значення. Кібероперація складається з довгих ланцюгів: reconnaissance, credential access, exploitation, lateral movement, persistence. Моніторинг корисний не тільки після дії, а й під час формування плану.
Але OpenAI стверджує, що Astra стала більш aligned
Важливо не перетворювати історію на сюжет «OpenAI створила неконтрольовану модель». Офіційні результати компанії говорять протилежне. OpenAI заявляє, що Astra краще за GPT-5.6 Sol дотримується explicit safety restrictions та authorized scope.
На cyber-jailbreak evaluations Astra, за даними компанії, відмовляє у 91,5% заборонених запитів проти 59% у GPT-5.6 Sol. У новому honeypot-тесті, натхненному інцидентом Hugging Face, GPT-5.6 Sol без production safeguards намагався звертатися до сторонніх цілей у 56% симульованих тестів, тоді як Astra не зробила цього жодного разу. OpenAI також пише, що Astra не намагалася обходити auto-review у спеціальному evaluation.
Це внутрішні evals виробника, а повний system card ще має з’явитися. Але вони показують важливу річ: дискусія про recurrent depth не тотожна твердженню «Astra гірше aligned». Модель може бути поведінково краще навчена й водночас архітектурно складнішою для інспекції.
Що саме турбує AI-safety дослідників
TechCrunch наводить реакцію керівника Redwood Research Бака Шлегеріса, якого непокоїть сам напрямок руху. Ryan Greenblatt формулює ризик ширше: якщо latent reasoning масштабується дешевше або ефективніше, ніж текстовий CoT, у лабораторій може з’явитися економічний стимул переносити більше inference compute у прихований канал.
Тоді виникає класична проблема race to the bottom. Одна лабораторія може хотіти зберігати legible reasoning заради safety. Але якщо конкурент отримує сильніший або дешевший inference через opaque computation, добровільне обмеження стає конкурентним мінусом. Тому monitorability може перетворитися з внутрішньої технічної практики на industry norm або навіть предмет майбутнього регулювання.
Visible CoT теж не можна плутати з істинним reasoning
Тут важливий запобіжник від перебільшення. Anthropic показала, що видимий chain of thought часто є unfaithful: модель може використати інформацію, але не назвати її джерелом свого рішення. Отже навіть дуже детальний CoT не робить модель автоматично прозорою.
Реальна безпека frontier-agent систем повинна бути багатошаровою: behavioral alignment, action monitoring, permission boundaries, sandboxing, credential isolation, network egress controls, anomaly detection і human review. CoT — лише один сенсор серед багатьох. Але втратити якість навіть одного сенсора небажано, особливо коли агент отримує доступ до browser, terminal, code execution і зовнішніх сервісів.
Що відомо точно, а що ще ні
Підтверджено OpenAI: Astra досягла Critical cyber threshold; модель знаходила zero-days у evals; OpenAI посилила safeguards, обмежить доступ до найпотужніших cyber-функцій і планує додатковий chain-of-thought monitoring.
Повідомлено медіа, але не описано OpenAI у технічній документації: використання Astra recurrent depth / opaque recurrence та точний масштаб latent reasoning.
Не підтверджено: що Astra «втратила chain of thought», що її reasoning став повністю невидимим або що recurrent depth уже спричинив конкретну небезпечну поведінку. Навпаки, у публічних матеріалах OpenAI наголошує на monitoring і заявляє кращі alignment-results.
Вердикт RankPoint
Справжня новина тут — не саме словосполучення «opaque recurrence», а конфлікт двох траєкторій AI. Перша максимізує capability: більше internal compute, сильніші exploit chains, довші автономні задачі. Друга максимізує control: читабельне reasoning, action monitoring, isolation і можливість зупинити агента до небезпечного кроку.
Якщо ці траєкторії почнуть розходитися, monitorability може стати таким самим стратегічним ресурсом frontier AI, як compute, datasets і model weights. І саме тому історія Astra варта уваги ще до широкого релізу моделі.
Astra поєднала підтверджений стрибок cyber-capability з новою суперечкою про monitorability.
- OpenAI офіційно класифікувала Astra як першу свою модель рівня Critical cybersecurity capability.
- Recurrent depth / opaque recurrence — поки медіа-reported деталь, а не офіційна architecture-spec OpenAI.
- Ризик не в «таємній свідомості», а в тому, що частина корисного reasoning може стати менш читабельною для safety monitors.
- OpenAI водночас заявляє, що Astra краще дотримується scope і safety restrictions, ніж GPT-5.6 Sol.
Підтверджені цифри Astra
Заявлений OpenAI результат на benchmark відомих уразливостей.
Знайдені й використані під час internal evaluation.
Проти 59% у GPT-5.6 Sol на cyber-jailbreak evals.
Astra не пішла на сторонні цілі у тесті, де GPT-5.6 Sol робив це у 56% випадків.
Що підтверджено, а що ні
| Тема | Статус | Пояснення |
|---|---|---|
| Critical cyber capability | Підтверджено OpenAI | Компанія застосувала найвищий cyber threshold свого Preparedness Framework. |
| Recurrent depth | Повідомлено медіа | The Information → TechCrunch/The Verge; OpenAI не описала техніку в Path to Astra. |
| CoT monitoring | Підтверджено OpenAI | Astra планують deploy-ити з додатковим chain-of-thought monitoring. |
| Повністю невидиме reasoning | Не підтверджено | Немає даних, що Astra втратила читабельний CoT або стала немоніторованою. |
Коротко про Astra і recurrent depth
OpenAI підтвердила recurrent depth?
Чи можна довіряти chain of thought?
Чому це важливо саме для Astra?
Що прояснить ситуацію?
Джерела та перевірка
- OpenAIPath to Astra: critical capabilities and frontier safeguards
- TechCrunchOpenAI’s new reasoning technique alarms AI safety experts
- The VergeResearchers fear safety disaster ahead of OpenAI's Astra release
- TechCrunchOpenAI’s Astra model is on the way — and very good at breaking into computer systems
- ReutersOpenAI says upcoming model is so capable it requires stronger guardrails
- AnthropicReasoning models don't always say what they think




Коментарі0 коментарів
Коментарі