AI чатботовете „затъпяват“, когато си взаимодействат с хора за дълъг период от време, показва мащабно проучване на Microsoft

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Microsoft Research и Salesforce анализираха повече от 200 000 диалога с усъвършенствани AI модели, включително GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, OpenAI o3, DeepSeek R1 и Llama 4. Резултатите показаха, че всички те често се „губят в разговора“, ако той бъде разбит на естествени многопосочни диалози с разменени реплики. За събеседника на чатботовете това изглежда като постепенно „оглупяване“ на AI модела, придружено от халюцинации и откровено грешни отговори.

Учените твърдят, че AI моделите като GPT-4.1 и Gemini 2.5 Pro постигат 90% точни отговори при обработката на индивидуални запитвания. При по-дълги диалози, включващи обмен на множество реплики обаче ефективността им спада до около 65%. Освен това AI моделите са склонни да използват първоначалния си отговор като основа за отговори на следващи въпроси, дори ако той е бил неправилен.

Изследователите откриват и друго любопитно явление – раздуване на отговорите. Отговорите и реакциите на AI моделите стават с 20-300% по-дълги при участието им в многопосочни диалози. По-дългите отговори водели до повече предположения и илюзии, които след това били използвани от AI моделите като постоянен контекст в разговора.

Въпреки че AI модели като o3 на OpenAI и DeepSeek R1 имат допълнителни „токени за размишление“, те не успяха да излязат от тази странна ситуация. Изследователите подчертават, че надеждността им е спаднала със 112%. Това се дължи на склонността на AI моделите да генерират преждевременно – те се опитват да предложат отговор на запитването, без да го прочетат докрай.

Става ясно, че изкуственият интелект все още не е достигнал своя връх, сблъсквайки се с критични проблеми като ниската надеждност при участие в многопосочни диалози. Въпреки това отношението на потребителите към услугите с AI бързо се променя, особено с появата на инструменти като AI Reviews на Google. Трябва да се отбележи, че изоставянето на традиционните търсачки в полза на инструменти, базирани на AI е голям риск, тъй като генерираната информация може да не е надеждна.

Преди известно време Microsoft обвини потребителите в злоупотреба с AI, като заяви, че при разработването на подсказките има ниско ниво на инженерни умения. Може би именно глупавите въпроси и лошите подсказки пречат на моделите на AI да се покажат в пълния си блясък?

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини