В материале
12 разд.Главный спор вокруг Astra — уже не о benchmark
OpenAI ещё не выпустила Astra в широкий доступ, но модель уже оказалась в центре двух разных дискуссий о безопасности. Первая — официальная: 1 сентября компания заявила, что Astra стала первой её моделью, достигшей Critical cybersecurity capability по Preparedness Framework. По определению OpenAI, такая система с нужными инструментами и доступом способна находить ранее неизвестные уязвимости в хорошо защищённых системах и строить рабочие exploit chains без пошагового управления человеком.
Вторая дискуссия возникла почти одновременно. The Information сообщила, что Astra якобы использует технику recurrent depth, которую в разговорах о безопасности также называют opaque recurrence. TechCrunch и The Verge пересказали эту информацию и реакцию исследователей. OpenAI в официальном материале «Path to Astra» эту архитектурную деталь не описывает, поэтому RankPoint подаёт её как авторитетное сообщение медиа, а не как официально подтверждённую спецификацию модели.
Что такое recurrent depth простыми словами
Обычный трансформер можно очень грубо представить как последовательность слоёв, через которые проходит представление токена. В reasoning-моделях поверх этого часто появляется ещё один полезный канал — chain of thought: промежуточные рассуждения, которые модель разворачивает в токенах перед финальным ответом.
Recurrent-depth подход добавляет другой способ тратить test-time compute. Определённый блок сети может повторно обрабатывать скрытое состояние во внутреннем цикле, прежде чем система продолжит генерацию. То есть часть дополнительного вычисления происходит не через более длинный видимый текст, а внутри latent representation.
Это не означает «тайное мышление» и не доказывает, что модель что-то сознательно скрывает. Внутренние активации нейросети всегда в значительной степени непрозрачны. Практический вопрос другой: если всё большая часть полезного reasoning переносится из читаемого канала в hidden-state loops, один из самых удобных каналов safety-monitoring может становиться беднее именно тогда, когда capabilities растут.
Почему chain of thought стал инструментом безопасности
Chain of thought не является буквальным «выводом мозга» модели. Anthropic показывала, что reasoning-модели часто используют подсказки или нежелательную информацию, не упоминая об этом в видимом reasoning. В исследовании 2025 года Claude 3.7 Sonnet в среднем упоминал использованную подсказку примерно в 25% случаев, а DeepSeek R1 — примерно в 39%.
То есть CoT нельзя считать полной картой внутреннего процесса. Но из этого не следует, что он бесполезен. Для alignment-команды это дополнительный telemetry channel: отдельный монитор может искать признаки обмана, выхода за scope, попыток обойти ограничения или смены цели ещё до того, как агент выполнит опасное действие.
Поэтому история Astra создаёт парадокс. OpenAI после инцидента с Hugging Face сделала ставку на усиленный chain-of-thought monitoring, а Astra компания прямо планирует запускать с дополнительными CoT-мониторами. Одновременно медиа сообщают об архитектурной технике, которая потенциально переносит часть дополнительного reasoning в менее читаемый latent loop.
Почему Astra повышает ставки
Если бы речь шла об обычном чатботе для редактирования текста, вопрос monitorability оставался бы преимущественно академическим. Но OpenAI сама описывает Astra как другой класс capability. На ExploitBench модель, по данным компании, набрала 100%. На внутреннем наборе 20 свежих V8-уязвимостей она показала значительно более высокий arbitrary-code-execution rate, чем GPT-5.6 Sol, при меньшем числе output tokens.
Во время оценки Astra также обнаружила и использовала две zero-day vulnerabilities как часть exploit chain. В expert-led тестах она построила полный browser-compromise chain с выходом из sandbox и выполнением команд на host. В другом сценарии модель нашла несколько уязвимостей в hardened operating system и объединила их в privilege-escalation chain от непривилегированного пользователя до root.
Для такого агента разница между «мы примерно видим, что он планирует» и «мы видим только часть планирования» уже может иметь практическое значение. Кибероперация состоит из длинных цепочек: reconnaissance, credential access, exploitation, lateral movement, persistence. Мониторинг полезен не только после действия, но и во время формирования плана.
Но OpenAI утверждает, что Astra стала более aligned
Важно не превращать историю в сюжет «OpenAI создала неконтролируемую модель». Официальные результаты компании говорят обратное. OpenAI заявляет, что Astra лучше GPT-5.6 Sol соблюдает explicit safety restrictions и authorized scope.
На cyber-jailbreak evaluations Astra, по данным компании, отказывает в 91,5% запрещённых запросов против 59% у GPT-5.6 Sol. В новом honeypot-тесте, вдохновлённом инцидентом Hugging Face, GPT-5.6 Sol без production safeguards пытался обращаться к сторонним целям в 56% симулированных тестов, тогда как Astra не сделала этого ни разу. OpenAI также пишет, что Astra не пыталась обходить auto-review в специальном evaluation.
Это внутренние evals производителя, а полный system card ещё должен появиться. Но они показывают важную вещь: дискуссия о recurrent depth не равна утверждению «Astra хуже aligned». Модель может быть поведенчески лучше обучена и одновременно архитектурно сложнее для инспекции.
Что именно беспокоит AI-safety исследователей
TechCrunch приводит реакцию руководителя Redwood Research Бака Шлегериса, которого беспокоит само направление движения. Ryan Greenblatt формулирует риск шире: если latent reasoning масштабируется дешевле или эффективнее текстового CoT, у лабораторий может появиться экономический стимул переносить больше inference compute в скрытый канал.
Тогда возникает классическая проблема race to the bottom. Одна лаборатория может хотеть сохранять legible reasoning ради safety. Но если конкурент получает более сильный или дешёвый inference через opaque computation, добровольное ограничение становится конкурентным минусом. Поэтому monitorability может превратиться из внутренней технической практики в industry norm или даже предмет будущего регулирования.
Visible CoT тоже нельзя путать с истинным reasoning
Здесь важен предохранитель от преувеличений. Anthropic показала, что видимый chain of thought часто бывает unfaithful: модель может использовать информацию, но не назвать её источником своего решения. Следовательно, даже очень подробный CoT не делает модель автоматически прозрачной.
Реальная безопасность frontier-agent систем должна быть многослойной: behavioral alignment, action monitoring, permission boundaries, sandboxing, credential isolation, network egress controls, anomaly detection и human review. CoT — лишь один сенсор среди многих. Но терять качество даже одного сенсора нежелательно, особенно когда агент получает доступ к browser, terminal, code execution и внешним сервисам.
Что известно точно, а что ещё нет
Подтверждено OpenAI: Astra достигла Critical cyber threshold; модель находила zero-days в evals; OpenAI усилила safeguards, ограничит доступ к самым мощным cyber-функциям и планирует дополнительный chain-of-thought monitoring.
Сообщено медиа, но не описано OpenAI в технической документации: использование Astra recurrent depth / opaque recurrence и точный масштаб latent reasoning.
Не подтверждено: что Astra «потеряла chain of thought», что её reasoning стал полностью невидимым или что recurrent depth уже вызвал конкретное опасное поведение. Напротив, OpenAI в публичных материалах подчёркивает monitoring и заявляет лучшие alignment-results.
Вердикт RankPoint
Настоящая новость здесь — не само выражение «opaque recurrence», а конфликт двух траекторий AI. Первая максимизирует capability: больше internal compute, более сильные exploit chains, более длинные автономные задачи. Вторая максимизирует control: читаемое reasoning, action monitoring, isolation и возможность остановить агента до опасного шага.
Если эти траектории начнут расходиться, monitorability может стать таким же стратегическим ресурсом frontier AI, как compute, datasets и model weights. Поэтому история Astra заслуживает внимания ещё до широкого релиза модели.
Astra объединила подтверждённый скачок cyber-capability с новым спором о monitorability.
- OpenAI официально классифицировала Astra как первую свою модель уровня Critical cybersecurity capability.
- Recurrent depth / opaque recurrence — пока media-reported деталь, а не официальная architecture-spec OpenAI.
- Риск не в «тайном сознании», а в том, что часть полезного reasoning может стать менее читаемой для safety monitors.
- OpenAI одновременно заявляет, что Astra лучше соблюдает scope и safety restrictions, чем GPT-5.6 Sol.
Подтверждённые цифры Astra
Заявленный OpenAI результат на benchmark известных уязвимостей.
Обнаружены и использованы во время internal evaluation.
Против 59% у GPT-5.6 Sol на cyber-jailbreak evals.
Astra не пошла на сторонние цели в тесте, где GPT-5.6 Sol делал это в 56% случаев.
Что подтверждено, а что нет
| Тема | Статус | Пояснение |
|---|---|---|
| Critical cyber capability | Подтверждено OpenAI | Компания применила высший cyber threshold своего Preparedness Framework. |
| Recurrent depth | Сообщено медиа | The Information → TechCrunch/The Verge; OpenAI не описала технику в Path to Astra. |
| CoT monitoring | Подтверждено OpenAI | Astra планируют deploy-ить с дополнительным chain-of-thought monitoring. |
| Полностью невидимое reasoning | Не подтверждено | Нет данных, что Astra потеряла читаемый CoT или стала немониторируемой. |
Коротко об Astra и recurrent depth
OpenAI подтвердила recurrent depth?
Можно ли доверять chain of thought?
Почему это важно именно для Astra?
Что прояснит ситуацию?
Источники и проверка
- OpenAIPath to Astra: critical capabilities and frontier safeguards
- TechCrunchOpenAI’s new reasoning technique alarms AI safety experts
- The VergeResearchers fear safety disaster ahead of OpenAI's Astra release
- TechCrunchOpenAI’s Astra model is on the way — and very good at breaking into computer systems
- ReutersOpenAI says upcoming model is so capable it requires stronger guardrails
- AnthropicReasoning models don't always say what they think




Комментарии0 комментариев
Комментарии