DeepSeek е само началото: Qwen 2.5 Max разбива монопола на САЩ върху съвременния изкуствен интелект

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Alibaba не изостава от конкурентите и съюзниците си.

Китайската компания Alibaba представи новия езиков модел Qwen 2.5 Max, който според разработчиците превъзхожда водещите американски системи за изкуствен интелект. На фона на неотдавнашния успех на китайския стартъп DeepSeek това събитие предизвика нова вълна от дискусии за лидерството на САЩ в областта на изкуствения интелект.

Според тестовете в популярните системи за оценка Arena-Hard, MMLU-Pro, GPQA-Diamond, LiveCodeBench и LiveBench Qwen 2.5 Max се представя по-добре от GPT-4o на OpenAI, Claude 3.5 Sonnet на Anthropic и Llama 3.1 405B на Meta. Моделът може да обработва текст, видео и изображения, както и да търси в интернет.

Разработчиците от Alibaba подчертават, че са сравнили своя модел с DeepSeek V3, а не с широко обсъждания R1. С това се обяснява и изборът на GPT-4o като точка за сравнение вместо на водещите модели o1 от OpenAI. Независимо от това постиженията на китайските компании поставят под въпрос ефективността на западните опити да задържат развитието на изкуствения интелект в Китай.

Техническите характеристики на новия модел все още са тайна. Известно е само, че Qwen 2.5 Max е изграден на базата на архитектурата MoE (mixture of experts) и е обучен върху набор от данни от 20 трилиона токена. След основното обучение моделът е преминал през етапи на фино настройване под наблюдение и RLHF (обучение с подсилване на базата на човешка обратна връзка).

DeepSeek е само началото: Qwen 2.5 Max разбива монопола на САЩ върху съвременния изкуствен интелект

Архитектурата MoE, която се използва и от Mistral и DeepSeek, позволява създаването на специализирани „експертни“ модули за решаване на конкретни задачи, като програмиране или математически изчисления. Основното предимство на този подход е възможността за увеличаване на общия брой параметри без намаляване на производителността, тъй като за всяка заявка се активират само съответните дялове на невронната мрежа.

Точният брой на параметрите на Qwen 2.5 Max не се разкрива, въпреки че е известно, че предишната версия на Max е съдържала около 100 милиарда параметъра. Забележително е, че дори вграденият чатбот на модела не може да отговори на въпроса за неговите технически характеристики.

За разлика от предишните версии на Qwen, новият модел няма да се разпространява в публичното пространство. В уеб сайта на Alibaba Cloud той е отбелязан като патентован, което обяснява оскъдната техническа информация. Този подход е характерен за много разработчици – компанията вече направи същото с моделите Qwen Turbo и Qwen Plus.

Цената за използване на Qwen 2.5 Max чрез API е $10 на милион входни токени и $30 на милион генерирани токени. За сравнение, GPT-4o на OpenAI таксува 2,50 долара на милион входни токени и 10 долара на милион генерирани токени. В същото време флагманът o1 на OpenAI е по-скъп – съответно 15 и 60 долара.

Qwen 2.5 Max е само най-новото попълнение в семейството на моделите на Alibaba, чието разработване започна през 2023 г. От септември насам компанията пусна серията модели с отворен код Qwen 2.5 с брой на параметрите между 0,5 млрд. и 72 млрд. Според твърденията на разработчиците най-големите от тях не отстъпват на Llama на Meta с 405 млрд. параметъра.

DeepSeek е само началото: Qwen 2.5 Max разбива монопола на САЩ върху съвременния изкуствен интелект

Успоредно с това Alibaba разработва специализирани модели за математически изчисления и програмиране, а през декември представи QwQ – „мислещ“ модел, подобен по функционалност на o1. Тази седмица компанията пусна и три модела с отворен код за манипулиране на изображения (VLM), за които се твърди, че са толкова добри, колкото Gemini 2 на Google, GPT-4o и Sonnet 3.5 на Claude.

Освен това Alibaba подобри своите модели Qwen 2.5 до 7 и 14 милиарда параметри, разширявайки техния контекстен прозорец до един милион токена. Това разширяване е особено полезно за RAG-системите, като им позволява да обработват големи количества документация, без да губят контекста.

Успехът на китайските разработчици обаче поражда загриженост относно поверителността на данните и цензурата. Както и при DeepSeek, данните на потребителите на Qwen Chat се съхраняват на сървъри в Китай и Сингапур. Стив Хайдел, разработчик на API за OpenAI, иронично отбеляза в социалната мрежа X:

„Американците толкова обичат да дават данните си на Китайската комунистическа партия в замяна на безплатни услуги“.

Не по-малко сериозни са опасенията за цензура на спорни теми, които биха могли да хвърлят сянка върху режима в Пекин. Подобно на други китайски модели, DeepSeek и Alibaba избягват да обсъждат теми като събитията на площад Тянанмън или политическия статут на Тайван, или прекъсват генерирането на отговори на такива въпроси.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

2 Коментара
стари
нови оценка

Нови ревюта

Подобни новини