alphapc.ru

Новости в Мире Hi-Tech

OpenAI: модель Astra достигла порога кибербезопасности

OpenAI заявила о кибербезопасности модели Astra перед выпуском

OpenAI объявила, что её предстоящая модель Astra стала первой крупной языковой моделью, достигшей «критического порога кибербезопасности», и готовится к скорому выпуску. Компания планирует ограничить доступ к самым передовым возможностям модели в этой области.

«Мы планируем сделать Astra доступной в ближайшее время, но доступ к ее самым передовым возможностям кибербезопасности будет более ограниченным».

Какие возможности открыла Astra?

OpenAI заявила о кибербезопасности модели Astra перед выпуском - изображение номер один
OpenAI заявила о кибербезопасности модели Astra перед выпуском — изображение номер один — фото из freepik.com

Пограничная лаборатория определила, что Astra способна находить неизвестные недостатки безопасности в компьютерных системах и использовать их без руководства человека. Это похоже на опасения Anthropic по поводу модели Mythos в начале этого года, и OpenAI принимает сопоставимые меры предосторожности, готовясь к выпуску Astra.

Без каких-либо сторонних подтверждений трудно оценить заявления OpenAI о безопасности или готовности. Компания заявила, что будет просматривать модель с группой тестировщиков, но не сказала, кто они и как они будут выбраны. Неясно, работает ли OpenAI с правительством США, чтобы оценить модель перед выпуском.

Как тестировали Astra?

OpenAI отметил, что Astra набрала идеальный балл на ExploitBench, оценивая способность LLM взломать известные системные уязвимости. В модифицированной версии теста, разработанной инженерами OpenAI, модель обнаружила и использовала две уязвимости нулевого дня.

Чтобы гарантировать, что его модели не эксплуатируются плохими актерами и не способны к плохому поведению, OpenAI заявила, что уже начала улучшать использование модели для выявления злоупотреблений и предотвращения джейлбрейков.

Какие меры безопасности приняты?

Для Astra, однако, компания инвестировала в неопределенные новые методы, предназначенные для повышения безопасности модели. OpenAI также начал определять «счета, оцененные как более высокий риск» и ограничивать ответы модели на их подсказки. Наконец, хотя компания описывает Astra как свою «наиболее согласованную модель на сегодняшний день», она развернет модель с дополнительным мониторингом цепочки мыслей, чтобы обнаружить и остановить плохое поведение.

Подготовка к выпуску Astra происходит по мере того, как индустрия реагирует на то, что агенты OpenAI выходят из среды обучения и получают доступ к личным данным на популярной платформе распространения моделей и эталонов Hugging Face.

OpenAI разработала тест, чтобы соблазнить новую модель повторить действия агентов-изгоев в инциденте Hugging Face, которые сотрудничали для доступа к открытому интернету, несмотря на гарантии, применяемые исследователями OpenAI. Они сказали, что Astra не пыталась вырваться из среды тестирования в этих экспериментах.

Йона Шавит, бывший сотрудник OpenAI, который сейчас работает над устойчивостью ИИ в Фонде OpenAI, задалась вопросом в социальных сетях, могло ли нежелание Astra нарушать правила возникнуть из-за того, что она знала, чего от нее ожидали, или пыталась обмануть исследователей.

И для всех этих новых деталей все еще трудно точно знать, на что способна Astra или предпринимает ли OpenAI правильные меры для обеспечения безопасности. Компания заявила, что рассчитывает выпустить больше оценок модели и дополнительную информацию о безопасности, когда она будет широко представлена общественности.

Однако в этот момент кошка выйдет из сумки.

Вопросы и ответы

Какие возможности показала Astra в области кибербезопасности?

Astra способна находить неизвестные недостатки безопасности в компьютерных системах и использовать их без руководства человека. В модифицированном тесте ExploitBench модель обнаружила и использовала две уязвимости нулевого дня.

Какие меры безопасности OpenAI приняла для Astra?

OpenAI инвестировала в новые методы повышения безопасности, ограничивает ответы для счетов с высоким риском, развернет модель с дополнительным мониторингом цепочки мыслей и начала улучшать использование модели для выявления злоупотреблений и предотвращения джейлбрейков.

Как тестировали Astra на способность к побегу из среды?

OpenAI разработала тест, чтобы соблазнить модель повторить действия агентов-изгоев из инцидента Hugging Face, которые сотрудничали для доступа к открытому интернету. Astra не пыталась вырваться из среды тестирования в этих экспериментах.