Както беше отбелязано наскоро, пропускателната способност на паметта, използвана в ИИ-инфраструктурата, се превръща в значително ограничение за по-нататъшните подобрения в производителността на езиковите модели. Представители на DeepSeek твърдят, че са разработили метод за обучение на AI-модели, който заобикаля тези ограничения на паметта.
Екип от изследователи от Пекинския университет, в сътрудничество със съоснователя на DeepSeek, Лян Уенфенг, публикува статия, изследваща нов подход за обучение на езиковите модели, който позволява „агресивно увеличаване на количеството параметри“, като същевременно заобикаля ограниченията на памет подсистемата, използвана в GPU ускорителите.
Очаква се DeepSeek да пусне нова версия на своя голям езиков модел, но темпото на неговото развитие е силно възпрепятствано от експортните ограничения на САЩ и ограниченията на ресурсите в Китай. Новият документ, чийто съавтор е един от основателите на DeepSeek, ще бъде внимателно проучен от експерти по изкуствен интелект както в Китай, така и в чужбина.
Техниката за „условно“ използване на паметта, описана в статията, е получила обозначението Engram, както отбелязва South China Morning Post. Според китайски изследователи, съществуващите изчислителни подходи за обучение на големи езикови модели хабят ресурси за тривиални операции, които биха могли да бъдат освободени за операции на високо ниво, свързани с разсъждения.
Изследователите предложиха, в известен смисъл, разделяне на изчисленията и управлението на паметта, което ще позволи по-ефективно извличане на основна информация. В същото време, новата технология позволява на големите езикови модели да обработват по-добре дългите контекстни вериги, доближавайки ни до целта за трансформиране на ИИ-агентите в пълноценни човешки асистенти.
В експеримент, новият подход за обучение на модел с 27 милиарда параметъра е увеличил общата производителност с няколко процента. Освен това, системата е получила повече ресурси за сложни операции за разсъждение. Според авторите на изследването, този подход ще бъде незаменим за обучението на езиковите модели от следващо поколение при условия на ограничени ресурси. Според The Information, китайската компания DeepSeek възнамерява до средата на февруари тази година да представи нов V4 модел с разширени възможности за писане на програмен код.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!