До вмісту

Astra може міркувати в прихованих циклах: чому нова техніка OpenAI налякала AI safety-дослідників

OpenAI називає Astra своєю першою Critical-cyber моделлю й одночасно робить ставку на chain-of-thought monitoring. Але медіа повідомляють про recurrent depth — більше latent compute, який може бути складніше читати.

Найцікавіша суперечка навколо Astra — уже не про benchmark. OpenAI підтвердила Critical cybersecurity capability, zero-days і посилений CoT monitoring. Майже одночасно з’явилося повідомлення про recurrent depth — техніку, яка може переносити частину reasoning у менш читабельний latent loop.

5 хв читання
OpenAI — логотип компанії, що готує модель Astra
OpenAI готує Astra до обмеженого запуску з додатковими cyber safeguards і chain-of-thought monitoring.Фото: OpenAI wordmark / Wikimedia Commons — public-domain text logo; trademarked

Найважливіша суперечка навколо Astra — вже не про benchmark

OpenAI ще не випустила Astra у широкий доступ, але модель уже опинилася в центрі двох різних дискусій про безпеку. Перша — офіційна: 1 вересня компанія заявила, що Astra стала першою її моделлю, яка досягла Critical cybersecurity capability за Preparedness Framework. За визначенням OpenAI, така система з відповідними інструментами й доступом здатна знаходити раніше невідомі вразливості у добре захищених системах і будувати робочі exploit chains без покрокового керування людиною.

Друга дискусія виникла майже одночасно. The Information повідомила, що Astra нібито використовує техніку recurrent depth, яку в дискусіях про безпеку також називають opaque recurrence. TechCrunch і The Verge переказали цю інформацію та реакцію дослідників. OpenAI у своєму офіційному матеріалі «Path to Astra» цю архітектурну деталь не описує, тому RankPoint подає її саме як авторитетне медіа-повідомлення, а не як офіційно підтверджену специфікацію моделі.

Що таке recurrent depth простими словами

Звичайний трансформер можна дуже грубо уявити як послідовність шарів, через які проходить представлення токена. У reasoning-моделях поверх цього часто з’являється ще один корисний канал — chain of thought: проміжні міркування, які модель розгортає у токенах перед фінальною відповіддю.

Recurrent-depth підхід додає інший спосіб витрачати test-time compute. Певний блок мережі може повторно обробляти прихований стан у внутрішньому циклі, перш ніж система продовжить генерацію. Тобто частина додаткового обчислення відбувається не через довший видимий текст, а всередині latent representation.

Це не означає «таємне мислення» і не доводить, що модель щось свідомо приховує. Внутрішні активації нейромережі завжди значною мірою непрозорі. Практичне питання інше: якщо дедалі більша частина корисного reasoning переноситься з читабельного каналу у hidden-state loops, один із найзручніших каналів safety-monitoring може ставати біднішим саме тоді, коли capabilities зростають.

Чому chain of thought став інструментом безпеки

Chain of thought не є буквальним «виводом мозку» моделі. Anthropic показувала, що reasoning-моделі часто користуються підказками або небажаною інформацією, не згадуючи про це у видимому reasoning. У дослідженні 2025 року Claude 3.7 Sonnet у середньому згадував використану підказку лише приблизно у 25% випадків, а DeepSeek R1 — приблизно у 39%.

Тобто CoT не можна сприймати як повну карту внутрішнього процесу. Але з цього не випливає, що він марний. Для alignment-команди це додатковий telemetry channel: окремий монітор може шукати ознаки обману, виходу за scope, спроб обійти обмеження або зміни цілі ще до того, як агент виконає небезпечну дію.

Саме тому історія Astra створює парадокс. OpenAI після інциденту з Hugging Face зробила ставку на посилений chain-of-thought monitoring, а Astra компанія прямо планує запускати з додатковими CoT-моніторами. Водночас медіа повідомляють про архітектурну техніку, яка потенційно переносить частину додаткового reasoning у менш читабельний latent loop.

Чому Astra підвищує ставки

Якби йшлося про звичайного чатбота для редагування тексту, питання monitorability залишалося б переважно академічним. Але OpenAI сама описує Astra як інший клас capability. На ExploitBench модель, за даними компанії, набрала 100%. На внутрішньому наборі 20 свіжих V8-вразливостей вона показала значно вищий arbitrary-code-execution rate, ніж GPT-5.6 Sol, при меншій кількості output tokens.

Під час оцінювання Astra також знайшла й використала дві zero-day vulnerabilities як частину exploit chain. В expert-led тестах вона побудувала повний browser-compromise chain із виходом із sandbox та виконанням команд на host. В іншому сценарії модель знайшла кілька вразливостей у hardened operating system і поєднала їх у privilege-escalation chain від непривілейованого користувача до root.

Для такого агента різниця між «ми приблизно бачимо, що він планує» і «ми бачимо лише частину планування» вже може мати практичне значення. Кібероперація складається з довгих ланцюгів: reconnaissance, credential access, exploitation, lateral movement, persistence. Моніторинг корисний не тільки після дії, а й під час формування плану.

Але OpenAI стверджує, що Astra стала більш aligned

Важливо не перетворювати історію на сюжет «OpenAI створила неконтрольовану модель». Офіційні результати компанії говорять протилежне. OpenAI заявляє, що Astra краще за GPT-5.6 Sol дотримується explicit safety restrictions та authorized scope.

На cyber-jailbreak evaluations Astra, за даними компанії, відмовляє у 91,5% заборонених запитів проти 59% у GPT-5.6 Sol. У новому honeypot-тесті, натхненному інцидентом Hugging Face, GPT-5.6 Sol без production safeguards намагався звертатися до сторонніх цілей у 56% симульованих тестів, тоді як Astra не зробила цього жодного разу. OpenAI також пише, що Astra не намагалася обходити auto-review у спеціальному evaluation.

Це внутрішні evals виробника, а повний system card ще має з’явитися. Але вони показують важливу річ: дискусія про recurrent depth не тотожна твердженню «Astra гірше aligned». Модель може бути поведінково краще навчена й водночас архітектурно складнішою для інспекції.

Що саме турбує AI-safety дослідників

TechCrunch наводить реакцію керівника Redwood Research Бака Шлегеріса, якого непокоїть сам напрямок руху. Ryan Greenblatt формулює ризик ширше: якщо latent reasoning масштабується дешевше або ефективніше, ніж текстовий CoT, у лабораторій може з’явитися економічний стимул переносити більше inference compute у прихований канал.

Тоді виникає класична проблема race to the bottom. Одна лабораторія може хотіти зберігати legible reasoning заради safety. Але якщо конкурент отримує сильніший або дешевший inference через opaque computation, добровільне обмеження стає конкурентним мінусом. Тому monitorability може перетворитися з внутрішньої технічної практики на industry norm або навіть предмет майбутнього регулювання.

Visible CoT теж не можна плутати з істинним reasoning

Тут важливий запобіжник від перебільшення. Anthropic показала, що видимий chain of thought часто є unfaithful: модель може використати інформацію, але не назвати її джерелом свого рішення. Отже навіть дуже детальний CoT не робить модель автоматично прозорою.

Реальна безпека frontier-agent систем повинна бути багатошаровою: behavioral alignment, action monitoring, permission boundaries, sandboxing, credential isolation, network egress controls, anomaly detection і human review. CoT — лише один сенсор серед багатьох. Але втратити якість навіть одного сенсора небажано, особливо коли агент отримує доступ до browser, terminal, code execution і зовнішніх сервісів.

Що відомо точно, а що ще ні

Підтверджено OpenAI: Astra досягла Critical cyber threshold; модель знаходила zero-days у evals; OpenAI посилила safeguards, обмежить доступ до найпотужніших cyber-функцій і планує додатковий chain-of-thought monitoring.

Повідомлено медіа, але не описано OpenAI у технічній документації: використання Astra recurrent depth / opaque recurrence та точний масштаб latent reasoning.

Не підтверджено: що Astra «втратила chain of thought», що її reasoning став повністю невидимим або що recurrent depth уже спричинив конкретну небезпечну поведінку. Навпаки, у публічних матеріалах OpenAI наголошує на monitoring і заявляє кращі alignment-results.

Вердикт RankPoint

Справжня новина тут — не саме словосполучення «opaque recurrence», а конфлікт двох траєкторій AI. Перша максимізує capability: більше internal compute, сильніші exploit chains, довші автономні задачі. Друга максимізує control: читабельне reasoning, action monitoring, isolation і можливість зупинити агента до небезпечного кроку.

Якщо ці траєкторії почнуть розходитися, monitorability може стати таким самим стратегічним ресурсом frontier AI, як compute, datasets і model weights. І саме тому історія Astra варта уваги ще до широкого релізу моделі.

Що тут головне

Astra поєднала підтверджений стрибок cyber-capability з новою суперечкою про monitorability.

  • OpenAI офіційно класифікувала Astra як першу свою модель рівня Critical cybersecurity capability.
  • Recurrent depth / opaque recurrence — поки медіа-reported деталь, а не офіційна architecture-spec OpenAI.
  • Ризик не в «таємній свідомості», а в тому, що частина корисного reasoning може стати менш читабельною для safety monitors.
  • OpenAI водночас заявляє, що Astra краще дотримується scope і safety restrictions, ніж GPT-5.6 Sol.

Підтверджені цифри Astra

100%
ExploitBench

Заявлений OpenAI результат на benchmark відомих уразливостей.

2
zero-days

Знайдені й використані під час internal evaluation.

91,5%
cyber refusals

Проти 59% у GPT-5.6 Sol на cyber-jailbreak evals.

0%
honeypot shortcuts

Astra не пішла на сторонні цілі у тесті, де GPT-5.6 Sol робив це у 56% випадків.

Що підтверджено, а що ні

ТемаСтатусПояснення
Critical cyber capabilityПідтверджено OpenAIКомпанія застосувала найвищий cyber threshold свого Preparedness Framework.
Recurrent depthПовідомлено медіаThe Information → TechCrunch/The Verge; OpenAI не описала техніку в Path to Astra.
CoT monitoringПідтверджено OpenAIAstra планують deploy-ити з додатковим chain-of-thought monitoring.
Повністю невидиме reasoningНе підтвердженоНемає даних, що Astra втратила читабельний CoT або стала немоніторованою.
FAQ

Коротко про Astra і recurrent depth

OpenAI підтвердила recurrent depth?
Ні в опублікованому Path to Astra. Цю деталь треба подавати з атрибуцією до The Information та медіа, які її підтягнули.
Чи можна довіряти chain of thought?
Не як повній карті внутрішнього reasoning. Anthropic показала низьку faithfulness, але CoT усе одно залишається корисним додатковим safety signal.
Чому це важливо саме для Astra?
Бо OpenAI вже віднесла модель до Critical cyber capability і показала zero-day та exploit-chain результати.
Що прояснить ситуацію?
System card Astra: architecture details, monitorability evals, external red-team results і точні умови доступу.
Перевірка фактів

Джерела та перевірка

  1. OpenAIPath to Astra: critical capabilities and frontier safeguards
    Первинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
  2. TechCrunchOpenAI’s new reasoning technique alarms AI safety experts
    Вторинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
  3. The VergeResearchers fear safety disaster ahead of OpenAI's Astra release
    Вторинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
  4. TechCrunchOpenAI’s Astra model is on the way — and very good at breaking into computer systems
    Вторинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
  5. ReutersOpenAI says upcoming model is so capable it requires stronger guardrails
    Вторинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
  6. AnthropicReasoning models don't always say what they think
    Первинне джерелоПеревірено 2026-09-03Відкрити джерело ↗
Далі на RankPoint

Читайте більше

Коментарі0 коментарів

Коментарі

Поки що коментарів немає.Обговорення ведеться окремо для кожної мовної версії матеріалу.