Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Изкуственият интелект днес е навсякъде – от препоръките в смартфоните до сложните научни открития. В основата на повечето от тези системи са дълбоки невронни мрежи, които, подобно на човешкия мозък, се учат от огромни количества данни. Но ето го и парадоксът: ние сме създали тези системи, но често не разбираме напълно какво точно се случва в техните цифрови „недра“. Дълго време процесът на учене на изкуствения интелект беше „черна кутия“ – виждаме резултата, но вътрешната логика остава неясна.

Какво би било, ако ключът към разгадаването на тази мистерия не се крие в още по-сложни алгоритми, а в проста механика, позната ни още от гимназията? Наскоро група учени от Швейцария и Китай предложиха поразително елегантна идея: да се симулира работата на сложна невронна мрежа с помощта на… обикновена верига от блокчета и пружинки. Това не ви ли звучи странно? Може би. Но именно в тази простота се крие гениалността, която може да промени подхода ни към създаването и персонализирането на изкуствения интелект.

Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи

От закачалките до земетресенията: как се раждат научните аналогии

Историята на това откритие сама по себе си прилича на увлекателна детективска история. Всичко започва с наблюдението на така наречения „закон за разделяне на данните“. Учените забелязали, че добре обучената невронна мрежа обработва информацията слой по слой и на всеки „етаж“ от тази структура данните стават все по-организирани. Така например, ако мрежата се научи да различава котките от кучетата, то на всеки нов слой изображенията на тези животни стават все по-ясно разделени в математическото пространство. И всеки слой допринася приблизително еднакво за това разделяне.

Но тази красива закономерност невинаги работи. Веднага щом се променяха параметрите на обучението – скоростта или нивото на „шума“ – хармонията се нарушаваше. Именно тази загадка накарала изследователите да потърсят по-фундаментално обяснение. И тук, както често се случва в науката, помогнаха случайността и интердисциплинарният опит.

Един от авторите на изследването също е работил в областта на геофизиката, където блоковите и пружинните модели се използват за моделиране на земетресенията и движението на тектоничните плочи. Неочаквано той видял поразителна прилика. Раждането на аналогията било толкова креативно, че учените си разменяли снимки на предмети от ежедневието по време на отпуските си – сгъваеми линийки, плъзгащи се закачалки, горещи чинии – опитвайки се да намерят идеалния физически прототип на невронната мрежа. Тази забавна история отлично илюстрира, че великите открития понякога се раждат не от суховатите формули, а от изострената интуиция и способността да се виждат взаимовръзки там, където никой не ги е търсил.

Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи
Фазовите диаграми на кривите на натоварване по време на обучението на GNS (показани в червено) за съотношението на нелинейността към (а) шума на данните, (b) скоростта на обучение, (c) отпадането и (d) размера на партидата

Физиката на обучението: какво е общото между невронната мрежа и веригата от пружини?

Нека разгледаме тази аналогия. Представете си няколко дървени блокчета, които лежат на масата и са свързани с пружини. Нека сега да издърпаме най-външното блокче. Какво се случва?

  • Слоевете на една невронна мрежа са блокове. Всеки блок в нашата схема е един слой от невронната мрежа.
  • Процесът на разделяне на данните е разтягането на пружините. Доколкото невронната мрежа „разпределя“ данните на единия слой, пружината между двата блока се разтяга.
  • Сложността на проблема (нелинейността) е триенето. Ако данните са много сложни и трудни за разделяне, блоковете сякаш се плъзгат по грапава, лепкава повърхност. Силата на триене им пречи да се движат лесно.
  • Шумът в обучението е вибрацията. В реалното обучение с изкуствен интелект винаги има елемент на случайност или „шум“. В нашия модел това е еквивалентно на момента, в който започнем леко да разклащаме масата. Блоковете подскачат, отскачайки за момент от повърхността, и триенето намалява. Това позволява на пружините да преразпределят напрежението и да се подредят.
Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи
Илюстрация на аналогията между верига от блокове и пружини и дълбока невронна мрежа

Именно последната точка се оказа ключова. Когато при обучението на невронните мрежи има оптимално ниво на „шум“, той, подобно на вибрациите, помага на всички слоеве да работят координирано и всеки от тях допринася еднакво за разделянето на данните. Ако няма шум и задачата е трудна (високо триене), тогава цялото натоварване пада върху последните, „дълбоки“ слоеве, докато първите почти не работят. Те се „заклещват“, неспособни да преодолеят триенето.

Карта за черната кутия: фазовата диаграма на ученето

Най-ценното в този подход е неговата прогностична сила. Въз основа на своя модел учените са успели да построят своеобразна карта или фазова диаграма, подобна на тези, които описват състоянията на материята (лед, вода, пара) във физиката. Тази диаграма ясно показва как ще се държи невронната мрежа в зависимост от два ключови параметъра: нивото на нелинейност (триенето) и шума (вибрациите).

Като погледне тази диаграма, разработчикът може веднага да разбере в какъв „режим“ работи неговият модел. Дали е в „замразено“ състояние, при което ранните слоеве са неактивни? Или може би в него има твърде много „шум“ и обучението е хаотично? Или пък се намира в онази „златна среда“, в която всички слоеве работят съгласувано като добре смазана машина? Това превръща абстрактното регулиране на милиардите параметри в разбираем физически процес.

Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи
Криви на натоварването при сходимост (а) и траектории (b)-(d) за MLP със седем скрити слоя и функция ReLU върху набора от данни MNIST (_1) в сравнение с блока и пружината на модела (_2)

Практическият смисъл: защо на инженера по изкуствен интелект му е необходимо да знае за пружините?

Това изследване не е просто хубаво теоретично упражнение. То разкрива съвсем конкретни практически възможности.

  • Диагностика и оптимизация. Представете си, че невронната мрежа е мост. Използвайки този модел, можете да създадете „карта на напрежението“ за ИИ, която показва кои слоеве са „претоварени“ (което може да доведе до преобучение и грешки) и кои слоеве са „неактивни“ (което показва архитектурно излишество). Това ще позволи прецизна настройка дори на гигантски модели като големите езикови модели (LLM).
  • Ускорено обучение. Като се разбере как шумът и сложността влияят на процеса, можете целенасочено да „разклащате“ невронната мрежа на правилните етапи, за да ускорите сходимостта ѝ към правилното решение. Това може да спести огромни изчислителни ресурси и време.
  • Нов начин за разработване на изкуствен интелект. Доминиращият подход днес е подходът на „законите за мащабиране“: за да направим ИИ по-интелигентен, просто увеличаваме неговия размер и количеството данни. Новият метод предлага по-елегантен начин – не да увеличаваме безсмислено мощността, а да настройваме фино вътрешната динамика на системата, въз основа на разбираеми физически принципи.
Физиката на машинния разум: как геометрията ни помага да разберем логиката на невронните мрежи
Динамика на кривите на натоварване за дълбоки CNN. (а) Точност на тестовите данни като функция на загубите при обучението. (b) Съответните криви на натоварване по време на обучението. В експериментите въвеждаме 5% отпадане в модела 20 x 200 и 30% отпадане в модела 40 x 200

От интуицията към инструмента: нов поглед към машинния интелект

Тази научна работа е нагледен пример за това как фундаменталната наука може да даде мощен тласък на приложните технологии. Тя връща човешката интуиция в света на големите данни и сложните алгоритми. Много по-лесно е интуитивно да се разбере как се държат пружините и кубчетата, отколкото да се оперира с милиарди математически параметри.

Това изследване превръща една „черна кутия“ в прозрачен механизъм, който може не само да се наблюдава, но и целенасочено да се проектира. Може би в бъдеще инженерите по изкуствен интелект ще говорят не за „скорост на учене“, а за „коефициент на триене“, и не за „регулация“, а за „сила на вибрация“. И този нов език, заимстван от физиката, ще ни помогне да създадем по-ефективен, надежден и, най-важното, разбираем изкуствен интелект.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини