Това не се очакваше: DeepMind представи AI, който превъзхожда хората в проверката на фактите

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Ново проучване на подразделението DeepMind на Google показва, че изкуственият интелект може да надмине хората в проверката на факти. Това са фактите генерирани от езикови модели като GPT и Gemini. Системата, наречена SAFE, разделя генерирания текст на части и многократно ги съпоставя с резултатите от търсачката на Google, за да оцени точността на твърденията. SAFE съвпада с човешките оценки в 72% от случаите. А при разногласие решението на изкуствения интелект е правилно в 76% от случаите.

Експертите обаче обръщат внимание на непрозрачността на проучването. Не става ясно например дали участниците, с които е сравняван изкуственият интелект, са били квалифицирани в областта на проверката на конкретните факти. А резултатите от експеримента пряко зависят от това.

В научната работа е представен метода Search-Augmented Factuality Evaluator (SAFE). SAFE използва голям езиков модел за разбиване на генерирания текст на отделни факти. След това определя точността на всяко твърдение, като го сравнява с резултатите от търсачката на Google.

Това не се очакваше: DeepMind представи AI, който превъзхожда хората в проверката на фактите
Изследователите сравняват SAFE с хората при проверка на набор от данни, съдържащ приблизително 16 000 факта. Оценките на SAFE съвпадат с тези на хората в 72% от случаите. Още по-забележително е, че при извадка от 100 разногласия между SAFE и оценителите, преценката на изкуствения интелект е била правилна в 76% от случаите.

Едно от очевидните предимства на SAFE е цената. Използването на тази ИИ система е около 20 пъти по-евтино от проверката на същите факти от хора. Тъй като обемът на информацията, генерирана от езиковите модели, продължава да нараства бързо, наличието на рентабилен и мащабируем начин за проверка на твърденията ще става все по-важно.

Екипът на DeepMind използва SAFE, за да оцени фактическата точност на 13 основни езикови модела от четири семейства (Gemini, GPT, Claude и PaLM-2) в теста LongFact. Резултатите показват, че по-големите модели са склонни да произвеждат по-малко фактологични грешки. Но дори най-добре представящите се модели генерират доста неверни твърдения. Това подчертава рисковете от прекомерното разчитане на езиковите модели, които могат да дадат неточна информация. Инструментите за автоматична проверка на фактите, като SAFE, намаляват тези рискове.

Това не се очакваше: DeepMind представи AI, който превъзхожда хората в проверката на фактите

Въпреки че в статията се твърди, че „агентите на LLM могат да постигнат свръхчовешки рейтинги“, някои експерти поставят под въпрос какво всъщност означава „свръхчовешки“ тук. Според изследователя на изкуствения интелект Гари Маркъс вероятно тук се има предвид, че SAFE вероятно е по-добър от средния човек „от тълпата“. Човек без необходимата квалификация. Но за да демонстрира наистина свръхчовешки способности, SAFE трябва да бъде сравнен с експерти по проверка на фактите. А не само с работници от тълпата. Конкретните данни за оценителите – квалификация, възнаграждение и процес на проверка на фактите – са от решаващо значение за правилното контекстуализиране на резултатите. Строгите и прозрачни сравнения с човешки оценители ще позволят да се измери истинският напредък на изкуствения интелект.

Кодът на SAFE и наборът от данни на LongFact са публикувани с отворен код в GitHub. Това дава възможност и на други изследователи да изучават и развиват тази интересна работата.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

2 Коментара
стари
нови оценка

Нови ревюта

Подобни новини