Китайският разработчик на изкуствен интелект DeepSeek разкри разходите за обучение на своя модел R1. Според статия в списание Nature обучението на системата е струвало на компанията само 294 хил. долара – много по-малко от американските ѝ конкуренти. Моделът R1 е бил обучен с помощта на 512 графични процесора Nvidia H800, създадени специално за китайския пазар, и е отнел около 80 часа.
Изявленията на компанията са в ярък контраст с думите на ръководителя на OpenAI Сам Алтман, който твърди, че обучението на базовите модели струва „доста над 100 млн. долара“. В същото време някои американски експерти изразиха съмнения относно това каква точно технология е използвала китайската фирма.
По-конкретно, САЩ твърдят, че DeepSeek е могла да получи достъп до мощните чипове H100 на Nvidia, въпреки ограниченията, наложени през 2022 г. върху износа им за Китай. Самата Nvidia обаче заяви пред Ройтерс, че компанията е използвала законно придобити H800, специално предназначени за китайския пазар. Статията на DeepSeek е първият случай, в който DeepSeek признава, че разполага с чипове A100, но те са били използвани само в ранните етапи на експериментите. Въпреки това Ройтерс вече отбеляза, че именно достъпът до суперкомпютърния клъстер A100 е направил компанията една от малкото в Китай, които са успели да привлекат най-добрите таланти.

DeepSeek също така за първи път отговори, макар и косвено, на изявленията, направени през януари от съветник на Белия дом и редица представители на американската индустрия за изкуствен интелект, че уж умишлено е „адаптирала“ моделите на OpenAI, за да разработи свои собствени.
В публикацията компанията описва един метод на „дестилация“ – подход, при който нов модел се обучава на базата на вече съществуващ модел. Според DeepSeek именно чрез този метод се постига висока ефективност при по-ниски разходи.
През януари компанията заяви, че е използвала модела с отворен код Llama AI на Meta, за да създаде някои подобрени версии на собствените си системи. DeepSeek признава, че нейните модели може косвено да са наследили знания от OpenAI, тъй като част от данните за обучение са събрани от уеб страници, които съдържат отговори, генерирани от ChatGPT. Но това е станало неволно, а не в резултат на целенасочено използване.
През януари пускането на модела DeepSeek R1 предизвика огромна суматоха: акциите на водещите световни технологични компании се понижиха поради опасения, че евтините китайски аналози могат да разклатят позициите на американските лидери в индустрията, включително Nvidia.
Въпреки огромния интерес, самата компания DeepSeek и нейният основател Лианг Уенфън остават изключително затворени. От януари насам компанията само от време на време публикува актуализации за новите си продукти. Тази статия в Nature предлага задкулисен поглед към детайлите на разработването на модела на DeepSeek.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!