Почему эксперты тревожатся из-за новой техники рассуждений OpenAI Astra?
Contents
OpenAI представила модель Astra, которая использует метод рассуждения «повторяющаяся глубина», позволяющий ей выходить за рамки последовательного мышления, характерного для большинства подобных систем. Этот подход, также известный как «непрозрачный рецидив», затрудняет отслеживание цепочки мышления модели, что вызвало тревогу у экспертов по безопасности ИИ.
Почему эксперты обеспокоены технологией Astra?

Хотя использование технологии Astra, как сообщается, ограничено, ее появление все еще вызывает значительные опасения среди экспертов по безопасности ИИ.
«Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачный рецидив, — написал генеральный директор Redwood Бак Шлегерис в посте после выхода новостей. — Я не знаю, является ли Astra гораздо менее контролируемой CoT, чем предыдущие модели». Но если OpenAI продвинет эту технику дальше, у них будет возможность значительно увеличить рецидив и полностью уничтожить отслеживаемость CoT».
Давний защитник безопасности ИИ Цви Моусховиц также взвесил и написал, что могут потребоваться законы, чтобы предотвратить «гонку на дно» среди лабораторий ИИ.
«Техника играет с огнем, рискуя табу, с которым боролись OpenAI и Anthropic, чтобы установить, что мы упорно работаем над тем, чтобы поддерживать верность и контролируемость Цепи Мысли как можно дольше, — написал Моушовиц. — Более интенсивное использование таких методов, вероятно, повредит отслеживаемости».
Как работает обычная цепь мысли?
При нормальных обстоятельствах цепь мышления модели рассуждения обеспечивает последовательные шаги, предпринятые моделью, когда она пытается решить проблему. Хотя представление является несовершенным, оно по-прежнему служит ценным инструментом для мониторинга неправильного поведения или смещения. В случае недавней деятельности агента-изгоя OpenAI записи о цепочке мыслей были важным инструментом в выяснении того, почему агенты вели себя так, как они это делали.
В непрозрачном повторении модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Результат оставляет меньше видимых следов, эффективно обходя традиционную цепочку мысли.
Ограничено ли использование технологии Astra?
Важно отметить, что использование техники Астра, по-видимому, ограничено. Ожидается, что цепочка мышления модели по-прежнему будет разборчивой, и компания отвергла любые предположения о том, что она перейдет на «нейральскую». OpenAI уже объявила о планах по созданию обширных систем мониторинга цепочки мысли в рамках своих перспективных планов безопасности.
В посте на X главный ученый OpenAI Якуб Пачоки подчеркнул приверженность лаборатории разборчивым цепочкам мышления. «OpenAI работал над сохранением и использованием мониторинга цепочки мысли с момента наших самых первых моделей рассуждений».
Все модели ИИ выполняют некоторое количество непрозрачных рассуждений, и лишь немногие исследователи принимают журналы цепочек мыслей как прямое представление рассуждений модели. Тем не менее, эти предостережения не рассеивают опасения, что непрозрачные рецидивы могут затруднить мониторинг рассуждений ИИ, особенно по мере их использования в различных моделях. В отчете The Information сообщается, что и Anthropic, и Google DeepMind уже обсуждали эту технику.
Главный научный сотрудник Redwood Research Райан Гринблатт сказал, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем обычные логические рассуждения, эффективно удаляя все рассуждения из видимых каналов.
«Моя самая большая проблема заключается в том, что естественный прогресс отсюда будет включать в себя расширение непрозрачных рассуждений до такой степени, что модель полностью или почти полностью обоснована в скрытом пространстве, — написал Гринблатт. — Я надеюсь, что еще не слишком поздно избежать наиболее важных архитектур, и что OpenAI остановится здесь».
Вопросы и ответы
Почему эксперты обеспокоены технологией Astra?
Эксперты по безопасности ИИ, включая генерального директора Redwood Бака Шлегериса и защитника Цви Моушовица, обеспокоены тем, что непрозрачный рецидив затрудняет отслеживание цепочки мышления модели. Они опасаются, что это может привести к снижению контролируемости и верности рассуждений ИИ, а также вызвать «гонку на дно» среди лабораторий.
Как работает обычная цепь мысли?
Обычная цепь мысли предоставляет последовательные шаги, которые модель предпринимает при решении проблемы. Это помогает мониторить неправильное поведение или смещение, как это было в случае с агентом-изгоем OpenAI. В отличие от этого, непрозрачное повторение обрабатывает запрос несколько раз в цикле, оставляя меньше видимых следов.
Ограничено ли использование технологии Astra?
Да, использование технологии Astra ограничено. Ожидается, что цепочка мышления модели останется разборчивой, и OpenAI отвергла предположения о переходе на «нейральскую» технологию. Компания планирует создать обширные системы мониторинга цепочки мысли, а главный ученый Якуб Пачоки подтвердил приверженность разборчивым цепочкам мышления.






