ASI-ARCH е експериментална демонстрация на изкуствен суперинтелект за изследвания в областта на ИИ, който е способен на напълно автономна научна работа за откриване на нови архитектури на невронни мрежи.
Системата самостоятелно излага хипотези, имплементира ги като изпълним код, обучава ги и ги тества на практика. Резултатът от тази работа са 1773 автономни експеримента, които отнемат над 20 000 GPU-часа и довеждат до откриването на 106 нови SOTA-архитектури с линеен механизъм за внимание.
Целият процес е разделен на 2 етапа: търсене на хипотези и тяхното тестване
На първия етап системата работи с малки модели с около 20 милиона параметъра, като ги обучава върху 1 милиард токена. На този етап са проведени 1773 експеримента, които са отнели около 10 000 GPU-часа. Общо на този етап са избрани 1350 обещаващи кандидати — всички те надминават базовата архитектура DeltaNet както по показатели за загуби, така и по бенчмарк.
Вторият етап е верификация. Кандидатите от първия етап са мащабирани до 340 милиона параметъра, за да съответстват на конфигурацията на DeltaNet. След филтриране на архитектурите с прекомерна сложност или брой параметри, са останали около 400 модела. Тяхното обучение върху 1 милиард токена е изисквало още 10 000 GPU-часа. В крайна сметка именно от тази група са избрани 106 архитектури, достигнали SOTA-ниво.

За окончателната валидация, изследователите са избрали 5-те най-добри модела, обучили са ги върху 15 милиарда токена и са ги сравнили с Mamba2, Gated DeltaNet и DeltaNet.
Анализът на предпочитанията на системата разкри интересни модели
ASI-ARCH очевидно предпочита да работи с изпитани във времето компоненти: гейтинг и конволюция. Но най-важното — разпределението на компонентите в 106 от най-добрите модела има значително по-слабо изразено разпределение на long-tail distribution в сравнение с останалите 1667 генерирани архитектури.
Това означава, че системата постига успех не чрез произволно изпробване на екзотични идеи, а чрез итеративно усъвършенстване на набора от доказани техники. По същество това е много подобно на методологията на човешките учени.
Резултатите
Една от най-добрите открити AI-архитектури, PathGateFusionNet, постигна среден резултат от 48,51 във всички бенчмаркове. За сравнение, Mamba2 е отбелязал 47,84, а проектираната от човек Gated DeltaNet — 47,32. Друга генерация е ContentSharpRouter, която е постигнала 48,34.
Разглеждайки отделните тестове, PathGateFusionNet постигна резултат от 60,58 на BoolQ, докато Gated DeltaNet постигна резултат от 60,12. AdaptiveEntropyRouter във версията с 340 милиона параметъра постигна резултат от 44,31 на тестовете, което е с 2,21 точки по-високо от Gated DeltaNet (42,10).
И така е в почти всичко; подобрения се наблюдават в целия спектър от задачи.
И най-интересното —- от къде системата черпи идеите си? Има само 3 източника:
- Cognition — знания, извлечени от научна литература;
- Analysis — заключения, направени от вашите собствени минали експерименти;
- Originality — напълно нови идеи.
За всичките 1773 генерирани архитектури, разпределението на изходния код е:
- 51,7% от идеите са дошли от човешка литература;
- 38,2% —- от собствения анализ; 10,1% са били оригинални.

Но ако погледнем само резултатите от 106-те SOTA, картината се променя. Делът на идеите, базирани на анализ, се увеличава от 38,2% на 44,8%, докато делът на Cognition спада леко до 48,6%.
Следователно, за да постигне осезаеми резултати, изкуственият интелект не може просто да копира и комбинира човешки разработки. Той трябва да анализира собствения си опит, да се учи от собствените си успехи и неуспехи и да синтезира по-съвършените решения.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!