Google: Чатботовете дават точна информация в 69% от случаите. И това е най-доброто

Най-четени

Методи Дамянов
Методи Дамянов
В "Калдата" от 2012г. насам. С интереси в сферата на информационната и интернет сигурност, дисруптивните технологии (IoT, AI, облак), видеоигрите с душа и послание и интернет свободата. Фен на Кен Ливайн, Ричард Столман и Джон Пери Барлоу.

Ново проучване на Google посочва, че едва един от три отговора на чатботовете днес са коректни. И това е в най-добрия случай.

Наскоро компанията е провела тест за надеждността на подаваната от програмите информация. FACTS Benchmark Suite (pdf), както е името на серията от тестове, показало, че в най-добрия случай чатботовете дават коректна информация в 69% от случаите. Те поставили на изпитание основните системи, които имаме днес, като Gemini, Claude, Grok и ChatGPT. Най-добре се справил чатботът на Google Gemini (въпросните 69% правилни отговори). Защо въпросното откритие е важно?

Google: Чатботовете дават точна информация в 69% от случаите. И това е най-доброто

Десетки хиляди по цял свят общуват с тези програми ежедневно. Нивото на доверие в чатботовете от страна на много от хората е необяснимо високо. Но не става дума за обикновените потребители само. Тези системи се използват активно във финансите и бизнеса. Където една погрешно поставена десетична запетая може да коства десетки хиляди долари загуби. Но и планове за интеграцията на GenAI инструменти има също в здравеопазването и в управлението на критична инфраструктура. А там грешката може да е фатална.

Разработеният, съвместно с Kaggle тест изпитва фактологичната точност на отговори на въпроси от практически характер. Един от тестовете тук се отнасял до параметричното знание. Тоест даване на отговори на въпроси, на които предварително е бил обучен моделът. Друг от тестовете проверявал способността му да извлече вярна информация от Интернет чрез уеб инструменти. Предпоследният проверява способността му да извлича и предава информация от документ без да предоставя фалшива информация. Четвъртият изпитвал мултимодалното разбиране. Тоест, способността му да разчита диаграми, графики и изображения коректно. Именно на последния тест, никой от моделите не успял да достигне даже 50% успеваемост. И отново, грешка при една бизнес диаграма би изпразнила портфейла на някоя фирма при грешка. Но какво ще се случи, ако бъдат разчетени грешно данните при анализ на резултатите от рентгеново изследване, кардиограма или ЯМР? Или тези, идващи от една атомна централа?

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини