AI-модели полагат „изпит“ за решаване на пъзели: Проучване разкрива изненадващи резултати

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Всяка неделя водещият на NPR Уил Шорц, гуруто на кръстословицата на New York Times, задава въпроси на хиляди слушатели в дългогодишен сегмент, наречен  „Неделен пъзел“ . Въпреки че пъзелите са предназначени да се решават, без да се разчита твърде много на знания, те обикновено са предизвикателство дори за опитните участници.

Ето защо някои експерти смятат, че това е обещаващ начин за тестване на границите на възможностите на AI за решаване на проблеми.

В  скорошно проучване екип от изследователи от колежа Уелсли, колежа Оберлин, Тексаския университет в Остин, Североизточния университет, Карлския университет и стартъпа Cursor създадоха AI-тест, използвайки пъзели от епизоди на “Неделен пъзел“. Екипът казва, че техният тест разкрива неочаквани открития, като например, че моделите на разсъждение — включително o1 на OpenAI — понякога се „отказват“ и дават отговори, които знаят, че са грешни.

Искахме да разработим бенчмарк със задачи, които хората могат да разберат, дори и само с основни познания“ — казва пред TechCrunch Арджун Гуха, професор по компютърни науки в Североизточния университет и един от съавторите на изследването.

В момента AI-индустрията е в трудна ситуация, когато става въпрос за тестване. Повечето от тестовете, които обикновено се използват за оценка на AI модели, изпробват умения като докторска степен по математика и природни науки, които не са подходящи за средния потребител. В същото време много тестове — дори и такива, публикувани сравнително наскоро — бързо се доближават до точката на насищане.

Предимствата на общественото радио предаване с викторина като “Неделен Пъзел“ са, че не изисква задълбочени познания и въпросите са проектирани по такъв начин, че моделите да не могат да използват „памет наизуст“, за да ги решават, обяснява Гуха.

Мисля, че трудността на тези проблеми е, че е много трудно да постигнеш смислен напредък по даден проблем, докато не го разрешиш и тогава всичко си идва на мястото“ — казва Гуха. „Това изисква комбинация от прозрение и процес на елиминиране.“

Разбира се, нито един тест не е перфектен. “Неделен Пъзел“ е фокусиран върху САЩ и се предлага само на английски език. И тъй като тестовете са публично достъпни, обучените на тях модели могат в известен смисъл да „изневеряват“, въпреки че Гуха казва, че не е видял доказателства за това.

Всяка седмица има нови въпроси и можем да очакваме най-новите въпроси да бъдат наистина уникални“ — добавя той. „Възнамеряваме да актуализираме теста и да наблюдаваме как производителността на модела се променя с времето.“

В тест, проектиран от изследователите, който включва около 600 пъзела от Sunday Puzzle, моделите на логическо мислене като o1 и R1 на DeepSeek значително надминават останалите. Моделите на логическото мислене внимателно проверяват фактите, преди да дадат резултати, което им помага да избегнат някои от грешките, които обикновено причиняват неуспех сред AI-моделите. Недостатъкът е, че на моделите за логическо мислене им отнема малко повече време, за да намерят решения — обикновено от няколко секунди до няколко минути.

Поне модела R1 на DeepSeek за някои въпроси от “Неделния Пъзел“ предлага решения, за които знае, че са грешни. R1 буквално казва: „Отказвам се“ и след това дава неправилен отговор, който изглежда случаен — поведение, с което човекът със сигурност може да се идентифицира.

Моделите правят и други странни избори, като дават грешен отговор и след това незабавно го изоставят, опитвайки се да намерят по-добър отговор и отново се провалят. Те също „мислят“ безкрайно и дават безсмислени обяснения за отговорите или веднага измислят правилния отговор, но след това преминават към разглеждане на алтернативи без видима причина.

Когато решава трудни проблеми, R1 буквално казва, че е „разочарован“ — казва Гуха. „Беше смешно да гледам как моделът имитира това, което човек може да каже. Все още не е ясно как „разочарованието“ в разсъжденията може да повлияе върху качеството на резултатите от модела.

AI-модели полагат „изпит“ за решаване на пъзели: Проучване разкрива изненадващи резултати

Понастоящем най-добрият модел в този бенчмарк е o1 с резултат от 59%, следван от наскоро пуснатия  o3-mini с висок резултат от „усилие за разсъждение“ ( 47% ). (R1 отбелязва 35% ). Като следваща стъпка изследователите планират да разширят тестовете до допълнителни модели на разсъждения, които се надяват да помогнат за идентифицирането на областите, в които моделите могат да бъдат подобрени.

AI-модели полагат „изпит“ за решаване на пъзели: Проучване разкрива изненадващи резултати

Резултати от тестване на моделите, които екипът използва като еталон.

Нямате нужда от докторска степен, за да разсъждавате добре, така че можете да разработите тестове за оценка на разсъжденията, които не изискват това ниво на знания“ — казва Гуха. „Тест с по-голяма достъпност позволява на повече изследователи да разбират и анализират резултатите, което от своя страна може да доведе до по-добри решения в бъдеще. Освен това, тъй като модерните модели се използват все повече в области, които засягат всички, ние вярваме, че всеки трябва да разбере какво могат и какво не могат да направят тези модели.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини