alphapc.ru

Новости в Мире Hi-Tech

Почему эксперты обеспокоены новой моделью OpenAI Astra?

OpenAI представила модель Astra с непрозрачным методом рассуждений

OpenAI представила новую модель Astra, которая использует метод рассуждения «повторяющаяся глубина», позволяющий ей выходить за рамки последовательного мышления, свойственного большинству подобных систем. Этот подход, также известный как «непрозрачный рецидив», затруднит отслеживание цепочки мышления модели, что вызвало тревогу у экспертов по безопасности ИИ.

Хотя использование технологии Astra, как сообщается, ограничено, ее появление все еще вызывает значительные опасения среди экспертов по безопасности ИИ.

«Я крайне обеспокоен сообщениями о том, что Astra использует непрозрачный рецидив, — написал генеральный директор Redwood Бак Шлегерис в посте после выхода новостей. — Я не знаю, является ли Astra гораздо менее контролируемой CoT, чем предыдущие модели». Но если OpenAI продвинет эту технику дальше, у них будет возможность значительно увеличить рецидив и полностью уничтожить отслеживаемость CoT».

Давний защитник безопасности ИИ Цви Моусховиц также взвесил и написал, что могут потребоваться законы, чтобы предотвратить «гонку на дно» среди лабораторий ИИ.

«Техника играет с огнем, рискуя табу, с которым боролись OpenAI и Anthropic, чтобы установить, что мы упорно работаем над тем, чтобы поддерживать верность и контролируемость Цепи Мысли как можно дольше, — написал Моушовиц. — Более интенсивное использование таких методов, вероятно, повредит отслеживаемости».

Что такое цепь мысли?

OpenAI представила модель Astra с непрозрачным методом рассуждений - изображение номер один
OpenAI представила модель Astra с непрозрачным методом рассуждений — изображение номер один — фото из freepik.com

При нормальных обстоятельствах цепь мышления модели рассуждения обеспечивает последовательные шаги, предпринятые моделью, когда она пытается решить проблему. Хотя представление является несовершенным, оно по-прежнему служит ценным инструментом для мониторинга неправильного поведения или смещения. В случае недавней деятельности агента-изгоя OpenAI записи о цепочке мыслей были важным инструментом в выяснении того, почему агенты вели себя так, как они это делали.

В непрозрачном повторении модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. Результат оставляет меньше видимых следов, эффективно обходя традиционную цепочку мысли.

Почему эксперты беспокоятся?

Важно отметить, что использование техники Астра, по-видимому, ограничено. Ожидается, что цепочка мышления модели по-прежнему будет разборчивой, и компания отвергла любые предположения о том, что она перейдет на «нейральскую». OpenAI уже объявила о планах по созданию обширных систем мониторинга цепочки мысли в рамках своих перспективных планов безопасности.

В посте на X главный ученый OpenAI Якуб Пачоки подчеркнул приверженность лаборатории разборчивым цепочкам мышления. «OpenAI работал над сохранением и использованием мониторинга цепочки мысли с момента наших самых первых моделей рассуждений».

Все модели ИИ выполняют некоторое количество непрозрачных рассуждений, и лишь немногие исследователи принимают журналы цепочек мыслей как прямое представление рассуждений модели. Тем не менее, эти предостережения не рассеивают опасения, что непрозрачные рецидивы могут затруднить мониторинг рассуждений ИИ, особенно по мере их использования в различных моделях. В отчете The Information сообщается, что и Anthropic, и Google DeepMind уже обсуждали эту технику.

Главный научный сотрудник Redwood Research Райан Гринблатт сказал, что непрозрачные рассуждения могут легко масштабироваться быстрее, чем обычные логические рассуждения, эффективно удаляя все рассуждения из видимых каналов.

«Моя самая большая проблема заключается в том, что естественный прогресс отсюда будет включать в себя расширение непрозрачных рассуждений до такой степени, что модель полностью или почти полностью обоснована в скрытом пространстве, — написал Гринблатт. — Я надеюсь, что еще не слишком поздно избежать наиболее важных архитектур, и что OpenAI остановится здесь».

Вопросы и ответы

Что такое непрозрачный рецидив в модели Astra?

Непрозрачный рецидив — это метод рассуждения, который использует Astra. Вместо последовательных шагов модель обрабатывает запрос несколько раз в цикле, оставляя меньше видимых следов. Это обходит традиционную цепочку мысли и затрудняет отслеживание рассуждений модели.

Почему эксперты по безопасности ИИ обеспокоены использованием Astra?

Эксперты, такие как Бак Шлегерис и Цви Моушовиц, обеспокоены тем, что непрозрачный рецидив может затруднить мониторинг рассуждений ИИ. Они опасаются, что это может привести к гонке на дно среди лабораторий и повредить отслеживаемости, что важно для выявления неправильного поведения.

Планирует ли OpenAI использовать непрозрачный рецидив в будущих моделях?

OpenAI заявляет, что использование техники в Astra ограничено, и цепочка мысли останется разборчивой. Главный ученый Якуб Пачоки подчеркнул приверженность разборчивым цепочкам мышления. Однако эксперты, такие как Райан Гринблатт, опасаются, что масштабирование непрозрачных рассуждений может стать естественным прогрессом.