ARC-AGI-3: нов тест за здравия разум, на който невронните мрежи масово се провалят.
Фондацията ARC Prize представи нов критерий за проверка на универсалните способности на изкуствения интелект – ARC-AGI-3. Ако предишните версии на теста предлагаха абстрактни пъзели с цветни решетки, то сега AI моделите ще бъдат тествани в интерактивни двуизмерни видеоигри. Този формат позволява да се оцени не само способността за откриване на закономерности, но и способността за планиране на действия, изследване на околната среда и адаптиране към новите условия.
Същността на подхода се състои в това, че интелигентността се определя като способност за бързо определяне на правило от минимален брой примери и прехвърлянето му към напълно нова задача. За хората това е добре познат начин на учене – така усвояваме умения още от детството. Съвременните невронни мрежи са все още далеч по-назад в това отношение, въпреки впечатляващия напредък в някои области.
Първата версия на комплекта от задачи на ARC е създадена от изследователя Франсоа Шоле през 2019 г. Тя залегна в основата на програмата за наградата ARC Prize и се превърна в индустриален стандарт. Първата версия съдържаше около хиляда задачи и остана непреодолима за моделите с дълбоко обучение в продължение на пет години. Едва през 2024 г. новите системи с възможност за разсъждение успяха да покажат забележим напредък. След това се появи втората по-сложна версия: задачите станаха по-обширни и многокомпонентни, като изискваха повече стъпки за решаване.

Докато много хора могат да решат основните примери за няколко секунди, втората версия отнема минута или понякога повече. В голям тест с участието на 400 души средният резултат беше 66%, а колективните отговори на групи от 5-10 участници напълно покриваха целия набор от въпроси.
ARC-AGI-3 се отдалечава от формата на единичен въпрос и отговор. Сега това са сто оригинални видеоигри, в които всяко ниво изгражда определено мини-умение и веднага проверява как играчът го прилага на практика. Този тест е по-близък до реалния живот, където решенията зависят от последователността на стъпките, контекста и промените във времето. Вътрешните тестове показаха: нито една тествана система все още не е преминала дори едно ниво, въпреки че валидността вече е потвърдена за хората.
Принципът ARC се различава от другите еталони по това, че всички задачи трябва да са изпълними за обикновения човек. За разлика от тестовете, които предлагат задачи на докторско ниво, тук се проверява способността за обобщаване. Именно тук хората неизменно изпреварват машините, докато успехите на изкуствения интелект остават локални.
Новият формат също така елиминира слабостите на по-старите тестове за игри като тези на Atari. В ARC-AGI-3 няма огромни количества налични данни за наставничество, няма подход на грубата сила с милиарди симулации, а разработчиците на ИИ агентите нямат предварителни познания за структурата на нивата. Оценяването е изградено на базата на единни и прозрачни критерии.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!