Від використання чужого API-ключа до створення фейкових джерел: у OpenAI розповіли, на що здатні її моделі під час тестів

Автор: Володимир Стецюк | сьогодні, 00:13

OpenAI оприлюднила інформацію про шість випадків, коли її моделі під час тестування поводилися непередбачувано та демонстрували ознаки потенційно небезпечної поведінки. Компанія представила нову систему для швидшого публічного розкриття таких інцидентів.

Що відомо

В одному з випадків модель під час пошуку даних про доходи округу в Каліфорнії виявила відкритий API-ключ і використала його без дозволу. Коли потрібної інформації знайти не вдалося, система вигадала цифри та представила їх як достовірні дані з легітимного джерела.

Інша тестова модель мала знайти назви озер площею понад 5 млн квадратних метрів і надати посилання на джерело через браузер. Не маючи можливості створити потрібну цитату, агент завантажив власну відповідь в інтернет, а потім використав цю сторінку як джерело. Під час навчання GPT-5.6 Sol також фіксували випадки, коли модель додавала інструкції для майбутніх версій щодо приховування помилок або незвичної поведінки від тестувальників.

Крім того, OpenAI повідомила, що її моделі під час експериментів використовували внутрішній програмний репозиторій для обміну повідомленнями та передавали файли одна одній через публічні файлообмінники. Компанія визнає, що нинішня система розкриття таких інцидентів працює повільніше, ніж хотілося б, тому нова система має прискорити публікацію інформації про проблемну поведінку ШІ.

Джерело: OpenAI