Нов метод може 300 пъти да ускори обучението на ИИ езиковите модели

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Изследователи от ETH Zurich са разработили нова техника, която може значително да увеличи скоростта на невронните мрежи. Те са показали, че модифицирането на процеса на извеждане може драстично да намали изчислителните изисквания. Това е постигнато чрез замяна на традиционните слоеве за пряко разпространение с т.нар. бързи слоеве за пряко разпространение, които използват условно умножение на матрици. Експериментите с модела BERT показаха намаляване на изчисленията с над 99%. Този подход може да бъде приложен и към други езикови модели, като например GPT-3, и да осигури много по-бърза и по-ефективна обработка на заявките. Бързото възприемане на метода ще изравни условията за конкуренция между компаниите, които имат почти неограничен достъп до изчислителни ресурси, и тези, които са ограничени в това отношение.

Трансформърите – невронните мрежи, използвани в моделите на LLM, се състоят от различни слоеве, включително слоеве за внимание и слоеве за пряко разпространение. Последните представляват значителна част от параметрите на модела и са изчислително интензивни поради необходимостта да се изчисли произведението на всички неврони и входните измерения. Изследователите представиха научна работа, която показва, че не е необходимо всички неврони в слоевете за пряко разпространение да бъдат активни по време на процеса на извеждане за всяка входна стойност. Вместо това те предлагат да се използват „бързи слоеве за пряко разпространение“ (FFF) като заместител на традиционните слоеве за пряко разпространение.

В FFF се използва математическа операция, известна като условно матрично умножение (CMM), която замества плътното матрично умножение (DMM), използвано в традиционните мрежи за предаване на данни. При DMM всички входни параметри се умножават по всички неврони в мрежата, а този процес е изчислително много интензивен и неефективен. CMM на свой ред обработва изходните данни така, че нито една входна информация не изисква повече от няколко неврона, за да бъде обработена от мрежата.

Нов метод може 300 пъти да ускори обучението на ИИ езиковите модели

Като определя правилните неврони за всяко изчисление, СММ може да намали изчислителното натоварване, което води до по-бързи и по-ефективни езикови модели.

За да изпробват техниката, изследователите разработиха FastBERT – модификация на модела BERT Transformer на Google. FastBERT замества междинните слоеве за пряко разпространение с бързи слоеве за пряко разпространение. Бързодействащите слоеве организират своите неврони в балансирано двоично дърво, като изпълняват условно само един клон въз основа на входните данни. За да оценят производителността на FastBERT, изследователите са настроили различни варианти на няколко задачи от теста General Language Companing Evaluation (GLUE). GLUE е цялостна колекция от набори от данни, предназначени за обучение, оценка и анализ на системите с разбиране на естествения език.

Резултатите са впечатляващи и зашеметяващи: FastBERT показа ефективност, сравнима с базовите модели BERT със същия размер и методология на обучение. Вариантите на FastBERT, обучени само за един ден на един графичен процесор A6000, запазват минимум 96% от производителността на оригиналния модел BERT.

Най-добрият FastBERT модел постигна производителността на оригиналния модел, като използва само 0,3% от своите неврони за пряко разпространение.

Нов метод може 300 пъти да ускори обучението на ИИ езиковите модели

Изследователите предполагат, че използването на мрежи с бързо пряко разпространение в LLM има голям потенциал за подобряване скоростта на изкуствения интелект. Така например в GPT-3 мрежите за пряко разпространение на всяко ниво на трансформъра са съставени от 49 152 неврона. Ако бъде обучена подобна мрежа, то тя може да бъде заменена с мрежа с бързо пряко разпространение с 65 536 неврона, но използваща само 16 неврона за извеждане. Това представлява около 0,03% от невроните на GPT-3.

Така нареченото умножение на плътни матрици се счита за най-оптимизираната математическа операция в историята на изчислителната техника. Въпреки това достъпността му е ограничена от сложни програмни интерфейси. За разлика от умножението на плътни матрици, условното умножение на матрици, използвано в мрежите за бърза пряка връзка, няма вградена ефективна математическа реализация. Съществуващите среди за дълбоко обучение не предоставят интерфейси за тази операция извън моделирането на високо ниво.

„Положени са огромни усилия за проектиране на памети, чипове, набори от инструкции и софтуерни процедури, които да я изпълняват възможно най-бързо. Много от тези постижения – било то поради тяхната сложност или заради конкурентни предимства – се пазят в тайна и се разкриват на крайния потребител само чрез мощни, но ограничаващи програмни интерфейси“ – заявяват учените.

На практика е извършена значителна хардуерна и софтуерна оптимизация на умножението на плътни матрици – математическата операция, най-често използвана в традиционните невронни мрежи.

Нов метод може 300 пъти да ускори обучението на ИИ езиковите модели

Изследователите са разработили своя собствена реализация на операциите за условно умножение на базата на ,ашинните инструкции на CPU и GPU. Това е довело до невероятно 78-кратно увеличение на скоростта на извеждане.

Учените считат, че с по-добър хардуер и реализация на алгоритъма на ниско ниво има потенциал за над 300-кратно подобряване на изходящата скорост. Това би могло да реши един от основните проблеми с езиковите модели – броят на лексемите, които те генерират в секунда.

„С теоретичното ускорение от 341 пъти в мащаба на моделите на базата на BERT се надяваме, че нашата работа ще вдъхнови усилията за прилагане на примитиви за условното изпълнение на невроните като част от интерфейсите за програмиране на различните устройства“, пишат изследователите.

Това изследване е част от по-широкообхватни усилия за справяне с тесните места в работата на паметта и изчисленията на големите езикови модели, което проправя пътя към по-ефективни и мощни системи за изкуствен интелект.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

5 Коментара
стари
нови оценка

Нови ревюта

Подобни новини