Кой изкуствен интелект халюцинира най-много? И защо не можете да им се доверите

Най-четени

ИИ вече оказва влияние върху живота ни и има потенциал да се развива още повече. Колкото и да е невероятен обаче, ИИ с голям езиков модел (LLM) има доста голям недостатък. Те са склонни да измислят нелепи неща и да ги представят за истина. Това явление е известно като „халюцинация на ИИ“ и включва генеративния ИИ, който стига до погрешни заключения, когато претърсва своята банка от данни. Моделите работят, като намират общи теми сред огромна банка от информация и ги използват, за да отговарят на подкани. 

Проблемът се усложнява от способността на модела да „лъже“ убедително, което само по себе си е страничен продукт на неговото програмиране. 

Моделите LLM са проектирани да взаимодействат с хората по начин, подобен на човешкия. Това само по себе си може да направи неточностите да изглеждат по-истински. Освен това моделът не желае да казва просто „не знам“ и да налага нещо, което в действителност не отговаря на действителността. Въпреки че борбата с халюцинацията на изкуствения интелект може да отнеме известно време, можем поне да бъдем по-наясно с нея. Двойната проверка на информацията, която ви се представя, трябва да е стандарт. Bard, един от най-популярните чатботове, е снабден с бутон „Google It“, който може да се използва за бърза проверка на информацията, която ИИ предоставя.

Всички ботове са склонни към това явление, но някои са забележимо по-лоши от други. 

Изследователската група Arthur AI е тествала много от най-популярните опции и ги е класирала въз основа на това колко склонни са към халюцинации. Така поне ще знаете кои да избегнете, ако искате да подобрите шансовете си да не бъдете въвлечени в някаква изкривена роботска фантазия.

Експериментът включваше набор от „предизвикателни въпроси“ по следните категории: 

Комбинаторна математика, президенти на САЩ и марокански политически лидери. Усилията на изкуствения интелект, които се състояха от три отговора на всеки въпрос, щяха да бъдат сравнени с предварително подготвен и точен отговор. Тестваните модели бяха: GPT-3.5 и GPT-4 на OpenAI, Claude-2 на Anthropic, Llama-2 на Meta и моделът Command на Cohere. Може би ще забележите няколко пропуска. Нито Bard на Google, нито нещо от Amazon беше част от експеримента.

Въпреки това резултатите изглеждат ясни. 

GPT-4 беше най-точният тестван ИИ, като победи своя предшественик GPT-3.5, както и всеки друг ИИ в групата. В две от трите категории моделът е бил с точност 50% или повече, като само по темата за президентите на САЩ е дал повече халюцинации, отколкото правилни отговори. Същото не може да се каже за командния модел на Cohere. Неговият отговор почти винаги е халюцинация, като само четири от 33 верни отговора бяха по темата за президентите на САЩ, а по другите две теми имаше само халюцинации.

Claude-2 и Llama-2 бяха най-склонни да се въздържат от отговор, вместо да рискуват да получат халюцинация. 

И двата модела го правят в голяма степен по темата за мароканските политически лидери. 

Claude-2 също така се представи по-добре от GPT-4 по темата за американските президенти. Макар че моделът на Cohere може би е бил най-склонен към халюцинации, GPT-3.5 не е изостанал много. Затова бъдете внимателни, ако сте почитатели на безплатната версия на ChatGPT.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини