Всички съвременни ИИ се провалиха на нов сложен тест за обща интелигентност – хората също не се справиха добре с него

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Arc Prize Foundation, организация с нестопанска цел, основана от известния изследовател на изкуствения интелект Франсоа Шоле обяви в блога си създаването на нов, по-усъвършенстван тест за измерване на цялостната интелигентност на водещите ИИ-модели.

Новият тест, наречен ARC-AGI-2 постави в затруднение повечето съвременни големи езикови модели. Според класацията ИИ-моделите, способни да разсъждават като o1-pro на OpenAI и R1 на DeepSeek са постигнали между 1 и 1,3%. Моделите, неспособни на разсъждения, включително GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash са постигнали по-малко от 1%.

ARC-AGI-2 представлява поредица от пъзели, в които изкуственият интелект трябва да разпознава визуални модели чрез анализ на многоцветни квадрати и въз основа на това да конструира правилното продължение на модела. Тестът е специално разработен така, че моделите да не могат да разчитат на предишен опит и да се адаптират към нови задачи.

Arc Prize Foundation също така е провела тестове с над 400 души. Средно тестовите групи са отговорили правилно на 60% от задачите. Това далеч надминава резултатите на всички тествани ИИ, като същевременно подчертава разликата между настоящите възможности на ИИ и човешкия интелект при решаването на задачи, които изискват адаптиране и разбиране на нови концепции.

Шоле заяви, че ARC-AGI-2 е по-точен показател за реалната интелигентност на ИИ-моделите в сравнение с предишната версия на теста ARC-AGI-1. Освен това ARC-AGI-2 елиминира възможността за решаване на проблеми „с груба сила“, т.е. чрез използване на огромна изчислителна мощ за търсене на всички възможни варианти, което се срещаше в теста ARC-AGI-1 и беше признато за сериозен недостатък.

За да се отстранят грешките от първия тест, ARC-AGI-2 въведе показател за ефективност, който принуждава изкуствения интелект да интерпретира моделите в движение, а не да разчита на запомняне. Съоснователят на Arc Prize Foundation Грег Камрадт отбеляза, че „интелигентността се определя не само от способността да се решават проблеми или да се постига висока производителност, но и от ефективността, с която тези способности се придобиват и използват“.

ARC-AGI-1 остана водеща метрика за около 5 години, докато OpenAI не пусна своя усъвършенстван ИИ-модел o3 през декември 2024 година. Той надмина всички други ИИ-модели и дори се изравни с човешките резултати в тестовете на ARC-AGI-1. Както беше отбелязано обаче, тези постижения бяха свързани със значителни изчислителни разходи.

Разработването на новия тест съвпадна с нарастващата загриженост в индустрията относно липсата на обективни критерии за оценка на изкуствения интелект. Вследствие на това Arc Prize Foundation обяви началото на конкурса Arc Prize 2025, в който от разработчиците се изисква да постигнат 85% точност на ARC-AGI-2 с изчислителни разходи не повече от 0,42 долара на задача.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини