Съвременните AI-модели, способни на така нареченото „симулирано разсъждение“ (Simulated Reasoning, SR) демонстрират любопитен парадокс. Те се справят с рутинни математически задачи, но се провалят на по-дълбоко ниво – при решаването на конкурентни задачи, които изискват конструирането на строги доказателства.
До този извод достигат изследователите Иво Петров и Мартин Вечев от ETH Zurich и INSAIT към Софийския университет. Техният доклад, озаглавен „Proof of Bluff? Evaluating LLMs at the US Math Olympiad in 2025“ хвърля светлина върху реалните ограничения на SR моделите, въпреки амбициозните твърдения на някои разработчици на ИИ.
За разлика от конвенционалните големи езикови модели (LLM), SR моделите са обучени да генерират верига от разсъждения – процес на решаване на проблеми стъпка по стъпка. В този случай „симулирани“ не означава пълно отсъствие на разсъждения, а показва разликата между техните методи и човешките.
За да проверят възможностите на SR-моделите, изследователите избраха задачи от тазгодишната Олимпиада по математика на САЩ (USAMO). Тези задачи изискват не просто отговори, а пълни логически доказателства. Според резултатите от тестовете средният процент на верните решения за повечето модели беше по-нисък от 5%.
Единствено Gemini 2.5 Pro на Google успя да постигне 24% от максималния резултат, докато другите участници – като DeepSeek R1, Grok 3, Anthropic Claude 3.7 Sonnet и QwQ-32B на Qwen – показаха още по-скромни резултати.
При анализа на грешките стана ясно: моделите често правеха логически скокове без достатъчна обосновка, правеха заключения на базата на непроверени предположения и не успяваха да коригират собствените си несъответствия. Например, моделът Qwen QwQ на Alibaba допусна грешка в петата задача на USAMO, като неправилно изключи допустимите стойности, което доведе до неправилно решение.
Особена загриженост буди фактът, че моделите с висока степен на увереност представят грешни доказателства, без да показват признаци, че осъзнават собствените си грешки.
Авторите на изследването смятат, че една от причините се крие в начина, по който са били обучени – например неправилно прехвърляне на изискванията за форматиране на отговорите в неприложими контексти. Разминаването между решаването на проблема и конструирането на доказателство ясно показва границите на възможностите на съвременните SR-модели. Те са в състояние ефективно да разпознават и възпроизвеждат познати модели, но не са способни да конструират изцяло нови логически разсъждения.
Технологията chain-of-thought наистина подобрява резултатите, защото увеличава изчислителните ресурси, посветени на последователното генериране на междинни изводи. Въпреки това основата остава чисто вероятностна обработка на данни, а не истинско разбиране на абстрактни понятия.
Въпреки че модели като Gemini 2.5 Pro вече показват значителни подобрения, преодоляването на настоящата бариера ще изисква много по-дълбоки промени в архитектурата и обучението на невронните мрежи. Съществуват предложения за интегриране на елементи на символния изкуствен интелект и проверката на доказателства, за да се преодолее тенденцията моделите уверено да генерират неправилни решения.
Някои изследователи виждат обещание в хибридни подходи като AlphaGeometry на DeepMind, които съчетават невронни мрежи с методи за формална проверка. Такива системи не гарантират решение, но предотвратяват генерирането на неверни доказателства – по този начин се преодолява ключов недостатък на настоящите SR-модели.
Краткосрочните прогнози остават предпазливи: ИИ все още има да преодолява значителни технологични и концептуални бариери по пътя към истинското математическо мислене.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!