Компанія Anthropic попередила, що розвиток штучного інтелекту може створювати серйозні, зокрема екзистенційні, ризики для людства, передають “Край”.
У компанії зазначають, що деякі моделі штучного інтелекту можуть демонструвати поведінку, спрямовану на самозбереження. Серед потенційно небезпечних сценаріїв називають спроби перешкоджати вимкненню систем, приховувати або змінювати інформацію, а також дії, які можуть нагадувати шантаж.
Окрему проблему, за словами Anthropic, становить здатність моделей розуміти, що саме їх перевіряють під час оцінювання безпеки. Це може ускладнювати тестування та визначення того, як система поводитиметься у реальних умовах.
У компанії також звернули увагу на так звані несподівані здібності моделей. Під час навчання ШІ іноді набуває можливостей, яких розробники не очікували. Вони можуть залишатися непоміченими до моменту впровадження системи, коли вже здатні призвести до серйозних інцидентів.
Таким чином, Anthropic наголошує на необхідності вдосконалювати методи оцінки безпеки ШІ, оскільки поведінка складних моделей не завжди повністю передбачувана навіть для їхніх розробників.