Microsoft пуска двойка ефективни AI-модели Phi-4 — единият дообучен по нов метод

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Microsoft разшири линията си от големи езикови модели за изкуствен интелект Phi-4 с два нови проекта с относително скромни системни изисквания. Единият от тях е мултимодален, т.е. работи с няколко формата на данни.

Моделът Microsoft Phi-4-mini работи само с текст, докато Phi-4-multimodal — представлява подобрена версия, която може да обработва и визуални и аудио заявки. И двата модела, твърди разработчикът, значително превъзхождат алтернативите със сравними размери при изпълнение на определени задачи.

Microsoft Phi-4-mini има 3,8 милиарда параметри, което означава, че е достатъчно компактен, за да работи на мобилни устройства. Моделът е базиран на специална версия на архитектурата Transformer. В стандартната версия моделите-трансформъри анализират текста преди и след всяка дума, за да разберат значението; При разработването на Phi-4-mini, Microsoft е използвал версията Decoder-Only Transformer, която анализира само предшестващата дума в текста, намалявайки натоварването върху изчислителните ресурси и увеличавайки скоростта за обработка на данните.

За допълнителна оптимизация е използвана технологията Grouped Query Attention — този механизъм помага на модела да определи кои фрагменти от данните са най-подходящи при обработката на текущата задача. Phi-4-mini може да генерира текст, да превежда документи и да управлява външни приложения; Моделът, според неговите разработчици, се е отличил при решаването на математически проблеми и писането на компютърен код, дори когато са били необходими „сложни разсъждения“ . Точността при отговорите на Phi-4-mini, според самия Microsoft, е „значително“ по-добра от резултатите, предоставени от няколко други модела с подобен размер.

Microsoft пуска двойка ефективни AI-модели Phi-4 — единият дообучен по нов метод

Phi-4-multimodal е разширена версия на Phi-4-mini с 5,6 милиарда параметъра; Той приема не само текст, но и изображения, аудио и видео като заявки. За да обучи допълнително модела, Microsoft е използвал нов метод, наречен Mixture of LoRAs. Обикновено адаптирането на AI към нова задача изисква промяна на неговите тегла — конфигурационни параметри, които определят как обработва данните. За да се улесни тази задача, се използва методът LoRA (Low-Rank Adaptation) — малък брой оптимизирани за тази задача нови тегла се добавят към модела за изпълнение на непозната задача. Методът Mixture of LoRAs адаптира този механизъм към мултимодалната обработка на данни: при разработването на Phi-4-multimodal, оригиналният Phi-4-mini е допълнен с тегла, оптимизирани за работа с аудио и видео. В резултат на това, казва Microsoft, е възможно да се смекчат някои от компромисите, свързани с други подходи за изграждане на мултимодални модели.

В тестовете, включващи визуална обработка, Phi-4-multimodal отбелязва 72 точки — малко зад флагманските модели на OpenAI и Google. При едновременна обработка на видео и аудио, той „с голяма разлика“ надминава Google Gemini-2.0 Flash, както и отворения код InternOmni. Phi-4-mini и Phi-4-multimodal се предлагат на платформата Hugging Face под лиценза на MIT, което позволява комерсиалната им употреба.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини