Учени разкриха провала на всички бенчмаркове за изкуствен интелект

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Изследователи от Обединеното кралство и САЩ са открили сериозни недостатъци в няколкостотин теста, използвани за проверка на сигурността и оценка на показателите за ефективност на нови AI модели, които се пускат на пазара.

Компютърни учени от Института за сигурност на изкуствения интелект към правителството на Обединеното кралство, подкрепени от колеги от Оксфордския и Станфордския университет и Калифорнийския университет в Бъркли провериха повече от 440 теста, предназначени за оценка на сигурността на системите за изкуствен интелект.

Експертите откриха недостатъци, които „подкопават валидността на получените твърдения“, тъй като „почти всички имат недостатъци в поне една област“ – а крайните резултати се оказват „неуместни или дори подвеждащи“.

При липсата на единен стандарт тези тестове се използват от разработчиците, включително от големите технологични компании, за да се оцени тяхната релевантност към човешките интереси и да се гарантират декларираните им способности в областта на разсъжденията, решаването на математически проблеми и задачите за писане на софтуерен код.

Миналия уикенд Google беше принудена да изтегли своя AI модел с отворен код Gemma, след като обвини действащ американски сенатор в деликатно престъпление срещу полицейски служител, пише The Guardian. Google заяви, че AI моделите Gemma не са били предназначени за потребители, а за разработчици и изследователи, но компанията все пак ги изтегли от публикуване в своята платформа AI Studio, понеже започнаха да се появяват „съобщения за опити за използването им от лица, които не са разработчици“.

Учени разкриха провала на всички бенчмаркове за изкуствен интелект

„Халюцинациите“, при които AI моделите просто си измислят отговори и „подмазването“, при което AI моделите казват на потребителите на това, което те искат да чуят, представляват огромни проблеми за цялата индустрия.

Учените са изследвали публично достъпни тестове за AI системите, но лидерите в индустрията имат свои собствени критерии, които експертната общност тепърва ще проучва. Те посочиха, че е необходимо да се разработи общ стандарт за определяне на ефективността и безопасността на AI моделите. „Шокиращ“ за учените се оказа фактът, че само 16% от тестовете използват статистически методи за оценка на грешката, за да установят вероятността за точност на резултатите. В някои случаи, когато трябва да се определи конкретна характеристика на даден AI модел, например неговата „безвредност“, тази характеристика не е ясно дефинирана, което намалява стойността на целия тест.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини