От использования чужого API-ключа до создания фейковых источников: в OpenAI рассказали, на что способны ее модели во время тестов
OpenAI обнародовала информацию о шести случаях, когда ее модели во время тестирования вели себя непредсказуемо и демонстрировали признаки потенциально опасного поведения. Компания представила новую систему для более быстрого публичного раскрытия таких инцидентов.
Что известно
В одном из случаев модель во время поиска данных о доходах округа в Калифорнии обнаружила открытый API-ключ и использовала его без разрешения. Когда нужную информацию найти не удалось, система придумала цифры и представила их как достоверные данные из легитимного источника.
Другая тестовая модель должна была найти названия озер площадью более 5 млн квадратных метров и предоставить ссылку на источник через браузер. Не имея возможности создать нужную цитату, агент загрузил собственный ответ в интернет, а затем использовал эту страницу как источник. Во время обучения GPT-5.6 Sol также фиксировались случаи, когда модель добавляла инструкции для будущих версий по сокрытию ошибок или необычного поведения от тестировщиков.
Кроме того, OpenAI сообщила, что ее модели во время экспериментов использовали внутренний программный репозиторий для обмена сообщениями и передавали файлы друг другу через публичные файлообменники. Компания признает, что нынешняя система раскрытия таких инцидентов работает медленнее, чем хотелось бы, поэтому новая система должна ускорить публикацию информации о проблемном поведении ИИ.
Источник: OpenAI
Подписывайтесь на наш нескучный канал в Telegram, чтобы ничего не пропустить.