На годишното събитие Meta Connect в Калифорния, Meta Platforms представи няколко нови AI-функции за своите популярни приложения Facebook, Instagram и WhatsApp, но най-впечатляващото нововъведение от технологичния гигант може да е останало незабелязано от мнозинството. Става дума за модела AI Llama 2 Long. Какво представлява той и колко дълги могат да са запитванията към него? Колко ефективен е и как се обучава?
Екип от изследователи в Meta някак тихомълком публикува статия, в която представиха нов модел с изкуствен интелект — Llama 2 Long, способен да генерира последователни и подходящи отговори на дълги потребителски запитвания. Най-много, казват те, че той превъзхожда някои от най-добрите конкуренти в индустрията.
Какво представлява Llama 2 Long?
Llama 2 Long е разширение на Llama 2, който е AI модел с отворен код, пуснат от Meta през лятото. Той може да се учи от различни източници на данни и да изпълнява много задачи като кодиране, математика, разбиране на език и др. Въпреки това, Llama 2 Long беше обучен на повече данни, съдържащи по-дълги текстове, и този алгоритъм беше модифициран, за да обработва по-дълги поредици от информация. Това му позволява да надмине GPT-3.5 Turbo и Claude 2 на OpenAI, които имат ограничения относно количеството контекст, който могат да използват при генериране на отговори.
Изследователите на Meta са използвали различни версии на Llama 2 — от 7 милиарда до 70 милиарда параметъра, тоест стойности, които AI моделът може да промени, като се учи от данните. Те са добавили и още 400 милиарда токена (текстови единици) данни, които съдържат по-дълги текстове от оригиналния набор от данни на модела. Леко са променили архитектурата на AI-модела, използвайки техниката Rotary Positional Embedding (RoPE), така че моделът да генерира точни и полезни отговори, използвайки по-малко информация и памет в сравнение с останалите методи.
Екипът използва обучение с човешка обратна връзка (reinforcement learning from human feedback) (RLHF) — метод, при който AI моделът се възнаграждава за правилните отговори и се коригира от човешки оценители, а синтетичните данни се генерират от самия чат Llama 2, за да подобри представянето си при различните задачи.
Документът твърди, че моделът може да генерира висококачествени отговори на потребителски заявки с дължина до 200 000 знака, което е еквивалент на около 40 страници текст. Изследователите казват, че Llama 2 Long е стъпка към създаването на по-общи и гъвкави AI-модели, които могат да отговорят на сложните и разнообразни нужди на потребителите. Те също така признават потенциалните етични и социални последици от такива модели и призовават за по-нататъшни изследвания и диалог относно това, как да се използват отговорно и ползотворно.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!
