DeepSeek измисли нов метод за пестене на ресурси при обучението на изкуствен интелект

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Китайската компания DeepSeek публикува документ, в който предлага да се преосмисли основната архитектура, използвана при обучението на основни AI модели. Един от авторите на документа е ръководителят на компанията Лианг Уенфън.

DeepSeek предлага метод, наречен „хипервръзки с огранчение на многообразието“ (Manifold-Constrained Hyper-Connections, mHC).

Този метод спомага за подобряване на икономическата ефективност на AI моделите и им дава възможност да не изостават от конкурентните американски решения, чиито разработчици имат достъп до значителни изчислителни ресурси. Публикуваните изследвания на DeepSeek отразяват отворената и съвместна култура на разработчиците на изкуствен интелект в Китай, които публикуват значителна част от своите изследвания в публичното пространство. Статиите на DeepSeek могат да насочат и към инженерните решения, които компанията използва в предстоящите си разработки.

Група от 19 изследователи от компанията отбеляза, че методът mHC е тестван върху AI модели с 3, 9 и 27 милиарда параметри и използването му не е увеличило значително изчислителното натоварване в сравнение с традиционния метод на хипервръзките (Hyper-Connections — HC). Основният метод Hyper-Connections е предложен от изследователите на ByteDance през септември 2024 гoдина като модификация на ResNet (Residual Networks), доминиращата архитектура за дълбоко обучение, която беше представена от учени от Microsoft Research Asia още през 2015 година.

ResNet позволява дълбоките невронни мрежи да се обучават по такъв начин, че ключовата информация (остатъчните данни) да се запазва с увеличаването на броя на слоевете. Тази архитектура се използва за обучение на AI моделите GPT на OpenAI и AlphaFold на Google DeepMind и има важно ограничение: при преминаването си през слоевете на невронната мрежа сигналът за обучение може да се превърне в универсално представяне, което е еднакво за всички слоеве, т.е. има риск да бъде неинформативен. Хипервръзките успешно решават този проблем, като разширяват потока от остатъчни данни и увеличават сложността на невронната мрежа „без да променят изчислителното натоварване на отделните блокове“, но в същото време се увеличава натоварването на паметта и това пречи на тази архитектура да се мащабира при обучението на големи AI модели, посочват от DeepSeek.

За да се справи с този проблем, DeepSeek предлага метода mHC, който „ще помогне за преодоляване на съществуващите ограничения и потенциално ще открие нови пътища за развитието на фундаментални архитектури от следващо поколение“. Изследователските статии, публикувани от компанията често посочват техническата насока зад последващите AI модели, казват експертите. Очаква се DeepSeek да успее да представи нов основен AI модел в средата на февруари.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини