Новият ИИ-модел на DeepSeek ще направи работата с дълъг контекст два пъти по-евтина и бърза

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Инженерите на DeepSeek представиха нов експериментален модел, V3.2-exp, който осигурява наполовина по-ниска цена на инференса и значително ускорение за сценариите с дълъг контекст.

Като междинна стъпка към архитектурата от следващо поколение, V3.2-Exp допълва V3.1-Terminus, като въвежда DeepSeek Sparse Attention — механизъм за разредено внимание, предназначен да изследва и валидира оптимизациите за ефективност на обучението и извода в сценариите с дълъг контекст“ — обяви компанията в публикация на платформата Hugging Face, отбелязвайки в пост в социалните медии, че цените на API са намалени с повече от 50%.

Използвайки механизма DeepSeek Sparse Attention (DSA), който действа като интелигентен филтър, моделът избира най-важните фрагменти от контекста, от които използва система за точен избор на токените, за да избере специфичните моменти, които да зареди в ограничения прозорец за внимание на модула.

Методът комбинира едрозърнеста компресия на токените с финозърнеста селекция, като гарантира, че моделът не губи по-широк контекст. DeepSeek твърди, че новият механизъм се различава от представената по-рано тази година технология Native Sparse Attention и може да бъде модифициран за предварително обучените модели.

В бенчмарк тестовете, V3.2-Exp е наравно с предишната версия на AI-модела. В тестовете за разсъждения, кодиране и използване на инструменти, разликите са незначителни — често в рамките на една или две точки — докато подобренията в производителността са значителни, според techstartups.com. Моделът се е представил 2-3 пъти по-бързо при дългосрочен контекстен извод, намалил е консумацията на памет с 30-40% и е удвоил ефективността на обучението. За разработчиците това означава по-бързо време за реакция, намалени разходи за инфраструктура и по-плавен път на внедряване.

TechCrunch отбелязва, че предимствата на системата са доста значителни за дългосрочни контекстни операции. Необходими са допълнителни тестове, за да се оцени по-надеждно моделът, но тъй като той е с отворен код и е свободно достъпен на платформата Hugging Face, потребителите могат да оценят ефективността на новата разработка на DeepSeek чрез бенчмаркове.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини