Най-новият малък езиков модел на Microsoft превъзхожда ChatGPT

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Изненадващо Microsoft представи най-новия си езиков модел Phi-1, който съдържа 1,3 милиарда параметъра. Противно на общоприетото схващане, че по-големите модели работят по-добре, Microsoft се фокусира върху качеството на данните за обучение. Phi-1, обучен на внимателно подбран набор от данни на ниво учебник, превъзхожда GPT-3.5 със 100 милиарда параметъра.

Езиковият модел Microsoft Phi-1, изграден на архитектурата Transformer, привлече вниманието с впечатляващата си производителност. Екипът за разработка на Phi-1 се фокусира върху качеството на данните за обучение, отдалечавайки се от преобладаващата тенденция за увеличаване размера на стека от модели. Използвайки висококачествен набор от данни, състоящ се от съдържание по “учебник“, получено от Интернет, екипът на Microsoft обработи информацията с помощта на GPT-3.5 и 8 графични процесора Nvidia A100, което позволи процесът по обучението да бъде завършен само за четири дни.

Според представители на Microsoft, акцентът към подобряване на качеството на данните за обучението, вместо увеличаването на броя на параметрите, е показало обещаващи резултати. В сравнителните тестове, Phi-1 е постигнал 50,6% точност, побеждавайки GPT-3,5 с 47% по удивителните 175 милиарда параметъра.

Microsoft планира да открие Phi-1 с отворен код на HuggingFace, което допълнително ще увеличи достъпността и потенциала за сътрудничество на този езиков модел. Това не е първият път, когато Microsoft разработва по-малък езиков модел; преди това беше представен Orca — модел с 13 милиарда параметъра, обучен върху синтетични данни, използвайки GPT-4. Дори Orca се оказа по-добра от ChatGPT. Изследователската статия за Phi-1 бе публикувана в arXiv и описва подробно неговата архитектура и методология за обучение. За тези, които искат да научат повече за техническите аспекти, статията предоставя изчерпателно ревю на разработката Phi-1.

Езиковият модел Phi-1 на Microsoft подкрепя идеята, че увеличаването на размера на стека е необходимо за подобряване на производителността. Като се фокусира върху висококачествените данни за обучение, Phi-1 демонстрира забележителна точност, превъзхождайки дори по-големите модели. Phi-1 с отворен код още веднъж демонстрира ангажимента на Microsoft към усъвършенстване обработката на естествения език.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини