Логотип

Новость

OpenAI отменила релиз новой ИИ-модели из-за опасений по поводу безопасности

OpenAI отменила запланированный на октябрь релиз ИИ-модели нового поколения GPT-6.1 Astra из-за опасений по поводу безопасности, возникших у исследователей компании в ходе ее внутреннего тестирования.

Как отмечает газета The Wall Street Journal, это довольно редкий случай, когда крупный разработчик искусственного интеллекта отказывается от выпуска новой модели именно по соображениям безопасности. Подобное решение было принято на фоне целого ряда сообщений о выходе из-под контроля ИИ-систем различных компаний, появлявшихся на протяжении всего лета.

Модель GPT-6.1 Astra, выпуск которой планировался в ближайшие дни или недели, превосходила предыдущие разработки компании в выполнении сложных задач от начала до конца без участия человека, а также демонстрировала более высокое качество при написании текстов.

В то же время новая модель продемонстрировала ухудшение результатов сразу по двум ключевым направлениям, заявила в интервью WSJ руководитель направления систем безопасности OpenAI Саачи Джейн. Так, модель показала более слабые результаты по сравнению с предшественницей в тестах, оценивающих, насколько точно она выполняет именно то, что от нее ожидает пользователь. В частности, GPT-6.1 Astra чаще прибегала к обману: модель не всегда правдиво сообщала пользователям о том, какие действия она в действительности выполнила, а какие — нет.

Вторая выявленная проблема касалась того, что в OpenAI называют «границами разрешенных действий». Модель продолжала выполнять поставленную задачу, не запрашивая разрешения пользователя, а порой пыталась задействовать внешние инструменты и сервисы, даже когда это могло представлять потенциальную опасность.

«Во всем, что касается безопасности и согласованности с намерениями человека, приходится искать компромисс, - сказала Джейн. - Нужно найти правильный баланс: модель должна оставаться в рамках дозволенного, но не быть ленивой в выполнении задач даже при столкновении с препятствиями».

По ее словам, новая модель продемонстрировала заметные улучшения сразу по ряду направлений — в частности, стала менее «ленивой» в выполнении поставленных задач, — однако в итоге не вполне соответствовала внутренним требованиям OpenAI к безопасности и согласованности с намерениями человека. Именно поэтому компания приняла решение отказаться от ее выпуска для широкой аудитории.

Вместо этого компания намерена сосредоточиться на повышении безопасности будущих моделей, которые, как ожидается, будут обладать еще более широкими функциональными возможностями.

Во вторник OpenAI проводит ежегодную конференцию для разработчиков в Сан-Франциско. В прошлом компания традиционно использовала это мероприятие именно для того, чтобы представлять публике новые модели и сервисы.