Учени от Масачузетския технологичен институт (MIT) са решили елегантно един от основните проблеми на изкуствения интелект: ограниченията на контекстния прозорец. LLM обикновено работи със стотици или хиляди токени, което му пречи да обработва пълноценно многотомни архиви. Новият рекурсивен модел преодолява този недостатък, като използва контекстно-базирана навигационна система вместо памет.
Новият подход е реализиран в архитектурата “рекурсивен езиков модел“ (Recursive Language Model (RLM). Традиционните големи езикови модели запазват цялата релевантна информация в рамките на така наречения контекстен прозорец с доста твърд и ограничен брой токени и бързо губят точността на своите изводи, когато обемът на входните данни надвиши този лимит. RLM моделът предлага различен подход: той не се опитва да запомни оригиналните изходни данни в тяхната цялост, а по-скоро ги разглежда като външно пространство, по което може да се навигира и от което могат да се извличат съответните релевантни фрагменти, когато е необходимо. Навигацията замества паметта.
Ключовата разлика между RLM и LLM е, че механизмът за извличане на информацията става динамичен и рекурсивен (с влагане, както в случая на дървовидната структура от папки на файловата система). Моделът анализира заявката, генерира действие за търсене, получава необходимите сегменти от данни и повтаря процеса, докато се постигне зададената дълбочина на разбиране. В резултат на това архитектурата е способна да работи с масиви от данни десетки или стотици пъти по-големи от традиционния капацитет на контекстния прозорец, без прекомерно увеличаване на изчислителните ресурси.
Предложената технология отваря нови възможности за области, изискващи обработка на големи документи или сложни структурирани данни. Например, в правната практика, изкуственият интелект ще може да анализира цели досиета по делата, а не само отделни фрагменти; в програмирането, той ще може да обработва големи обеми от код; а в аналитиката, ще може да комбинира и сравнява множество научни публикации без предварителна обработка. Способността на модела да работи с големи набори от данни намалява риска от фактически изкривявания и грешки, свързани със „загубата“ на контекст, поради липсата на достатъчно памет на модела в съответния момент.
Специалистите от MIT са предоставили както пълноценна библиотека, имплементираща принципите на RLM, така и минимален референтен код, което ще опрости въвеждането на технологията за всички заинтересовани страни и ще ускори нейното приемане. Някои компании вече са започнали да адаптират архитектурата за своите продукти, което допълнително потвърждава приложимостта на RLM извън лабораторните условия. По този начин, рекурсивните езикови модели (Recursive Language Models) биха могли да се превърнат в значителна стъпка в еволюцията на невронните мрежови архитектури, тъй като те предлагат не увеличаване на капацитета на паметта на моделите, а фундаментално нов начин за работа с големите масиви от данни.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!