Фахівці виявили недоліки у численних тестах, які використовуються для оцінки безпеки та ефективності нових систем штучного інтелекту, що ставить під сумнів їхню надійність.
Результати дослідження
Про це повідомляє Укрінформ, посилаючись на дослідження, проведене експертами з Інституту безпеки штучного інтелекту Великої Британії та визнаними науковцями Стенфорда, Берклі та Оксфорда. У рамках цього аналізу було досліджено понад 440 тестів, які покликані оцінити системи безпеки ШІ.
Дослідники виявили, що численні тести мають істотні недоліки, які, за їхніми словами, «підривають правдивість отриманих результатів». Важливим є той факт, що майже всі досліджувані тести продемонстрували слабкі місця щонайменше в одній з категорій, внаслідок чого отримані оцінки можуть бути «не релевантними або навіть оманливими».
Ці тести активно використовуються великими технологічними компаніями для оцінки новітніх моделей ШІ. Дослідник Оксфордського інституту інтернету Ендрю Бін підкреслив, що загальна відсутність єдиного регулювання у Великій Британії та США у сфері ШІ створює умови, коли ці тестування стають основою для перевірки безпеки нових систем та їх відповідності інтересам користувачів.
«Тести, які проводяться, лежать в основі багатьох заяв про досягнення в області штучного інтелекту. Проте без єдиних стандартів і достовірних методик вимірювання важко зрозуміти, чи дійсно нові моделі демонструють прогрес або це лише ілюзія», – зазначив Бін.
У дослідженні було проаналізовано лише загальнодоступні тести, тоді як компанії, що працюють у сфері ШІ, мають власні внутрішні тести, які залишилися поза його межами. Дослідник також звернув увагу на те, що лише 16% тестів використовували оцінки невизначеності або статистичні методи для підтвердження точності критеріїв. Це вказує на велику невизначеність у визначеннях характеристик, таких як «нешкідливість» ШІ, що суттєво знижує їхню користь.
У результатах дослідження підкреслена критична потреба у створенні спільних стандартів і найкращих практик у сфері штучного інтелекту, що стане запорукою підвищення ефективності тестування та забезпечення безпеки нових технологій.
Важливо зазначити, що, згідно з даними OpenAI, вже понад мільйон користувачів ChatGPT щотижня обговорюють з чатботом різноманітні теми, включаючи питання, що містять «явні ознаки потенційних суїцидальних намірів». Це ще раз підкреслює важливість належної перевірки та тестування систем безпеки у сфері штучного інтелекту.