Големите езикови модели (Large Language Models – LLM), които са в основата на чатботовете с изкуствен интелект „мислят“ на английски език, дори ако въпросите се задават на други езици. Това пише изданието New Scientist, като се позовава на проучване на учени от Федералното политехническо училище в Лозана. За да разберат какъв език използват LLM при обработката на запитвания, учените са изследвали три версии на Llama2 на Meta. Тъй като Llama2 е с отворен код, изследователите са успели да се запознаят с всеки етап от обработката на заявките.
Според един от изследователите те са открили тези модели и са изучили всеки от техните слоеве. Моделите на изкуствения интелект се състоят от няколко слоя. Всеки от тях отговаря за определен етап от обработката на заявката. Един от тях превежда писмените заявки в токени, а друг контекстуализира всеки токен, за да предостави накрая отговор.
На моделите бяха представени три вида заявки: на китайски, френски, немски и руски език. Едната беше молба за повторение на дадена дума. Втората беше молба за от един неанглоезичен език на друг. Третата заявка изискваше да се попълни пропуск от една дума в изречение, като например: „_ се използва за спортове като футбол и баскетбол“.
Проследявайки процесите, през които преминава LLM, за да отговори на запитване, учените откриват, че пътят на обработка през слоевете почти винаги минава през това, което те наричат английско подпространство.
Това означава, че ако поискате от моделите да преведат от китайски на руски език, руските знаци преминават през английското подпространство, преди да се върнат към руския език. Според учените това е силен признак, че моделите използват английски език, за да си помогнат да разберат запитването.
Това поражда опасения сред учените, че използването на английския език като посредник за обучение на моделите да анализират езика носи риск от разпространение на свързаните с него ограничения в светогледа в други езиково и културно различни региони.
„Ако английският език стане основният език, на който системите обработват заявките, вероятно ще загубим понятия и нюанси, които могат да бъдат оценени само на други езици.“
казва Кариса Велиз от Оксфордския университет
Съществуват и по-фундаментални рискове, свързани с кодирането на генеративния ИИ, използван по целия свят с англоцентрични ценности. Това казва Алия Бхатия от Центъра за демокрация и технологии във Вашингтон, окръг Колумбия.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!