Лабораторията за изкуствен интелект на Microsoft представи Orca 2 – двойка малки езикови модели, които са толкова добри и дори по-добри от езиковите модели, които са 5-10 пъти по-големи от тях. Моделите се предлагат в два типа – 7 и 13 милиарда параметри, и използват за основа оригиналния 13B Orca, който вече демонстрира превъзходни мисловни способности.
„Използвайки Orca 2 като пример, ние продължаваме да показваме, че подобрените обучителни методи могат да помогнат на по-малките модели да постигнат способности за мислене от по-висок порядък, които обикновено присъстват само в по-големите езикови модели“, пишат разработчиците в публикация в своя блог.
Microsoft отвори достъп до двата модела, за да анализира и проучи допълнително възможностите на малките езикови модели, които според разработчиците могат да покажат не по-малко високи резултати от големите. За предприятията с ограничени ресурси подобни системи могат да бъдат най-доброто решение, пише Venture Beat.
За да научат един малък модел да мисли също толкова добре, колкото един голям, разработчиците решават да персонализират основния Llama 2, като използват специално събран набор от данни. Вместо да го научат да възпроизвежда поведението на по-способните модели чрез метода на имитацията, изследователите са го накарали да избере други стратегии за решаване на проблемите. Например, за да отговори на сложен въпрос, за един малък езиков модел е по-удобно първо да го разбие на съставните му части, вместо да отговори директно, както прави GPT-4.
При изпитанията на 15 контролни теста, обхващащи разбиране на езика, здрав разум, многостъпкови разсъждения, решаване на математически задачи, четене с разбиране, обобщаване и истинност, и двата модела Orca 2 се представиха отлично – също толкова добре или по-добре от моделите, които са 5-10 пъти по-големи.
Средно за всички тестове Orca 2 се представи по-добре от Llama-2-Chat с 13 и 70 милиарда параметри и WizardLM с 13 и 70 милиарда параметри. Само при задачите по математика WizardLM със 70 милиарда параметри е значително по-добър.
Според разработчиците методът, който са използвали за обучението на Llama-2, може да се използва и за подобряване на други базови модели.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!