Apple работи по създаването на агент с изкуствен интелект, който ще разбира интерфейсите на приложенията и ще може да взаимодейства с тях от името на потребителя, като работи локално в устройството.
Става дума за алгоритъма Ferret-UI Lite с 3 милиарда параметъра, който при тестовете съответства или надхвърля показателите на AI модели, които са до 24 пъти по-големи.
През декември 2023 година екип от девет изследователи публикува статия, озаглавена „FERRET: Refer and Ground Anything Anywhere at Any Granularity“. В него те описват мултимодален езиков модел, който може да бъде обучаван върху различни видове данни и може да разбира препратки на естествен език към конкретни части от изображение. Оттогава насам Apple публикува поредица от документи, в които разширява фамилията AI модели Ferret, като включва алгоритмите Ferretv2, Ferret-UI и Ferret-UI 2.
Така моделите Ferret-UI до голяма степен разшириха възможностите на оригиналния FERRET и бяха обучени за това, което изследователите обикновено посочват като недостатък на мултимодалните големи езикови модели (MLLM).

„Неотдавнашният напредък в областта на MLLM е забележителен, но тези MLLM с общо предназначение често не са в състояние ефективно да разпознават и взаимодействат с потребителски интерфейси (UI). В тази статия представяме Ferret-UI, нов MLLM, предназначен да подобри разпознаването на мобилни потребителски интерфейси, снабдена с възможности за абстрахиране, хрумване и разсъждение. „Като се има предвид, че мобилните потребителски интерфейси обикновено имат по-издължено съотношение на страните и съдържат по-дребни елементи (напр. икони и текст) от естествените изображения, ние добавихме „произволна резолюция“ към Ferret, за да увеличим детайлността и да използваме подобрени визуални сигнали.“
се казва в статията на Apple

Преди няколко дни Apple разшири фамилията от AI модели Ferret-UI и публикува резултатите от проучването „Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents“. Ferret-UI е изграден на базата на LLM с 13 милиарда параметъра, който се фокусира върху разбирането на мобилни интерфейси и скрийншотове с фиксирана резолюция. Ferret-UI 2 разшири системата, за да поддържа множество платформи и възприемане с по-висока резолюция. От друга страна Ferret-UI Lite е много по-лек модел, предназначен за работа на локално устройство. Въпреки това той остава конкурентен на много по-големи агенти с графичен интерфейс (GUI).
В публикацията на изследователите се посочва, че „повечето съществуващи методи за изграждане на агенти с графичен потребителски интерфейс се фокусират върху големи фундаментални модели“. Това е така, защото „мощните способности за разсъждаване и планиране на големите сървърни модели позволяват на такива агентни системи да постигат впечатляващи резултати в различни задачи за навигация в GUI“.

Отбелязва се, че е постигнат голям напредък както в многокомпонентните, така и в цялостните системи с графични потребителски интерфейси, които използват различни подходи за оптимизиране на множество задачи, свързани с базираното на агенти взаимодействие с графични потребителски интерфейси (свързване на ниско ниво с елементи на графичния потребителски интерфейс, разбиране на случващото се на екрана, многоетапно планиране и самоанализ). Всички те обаче са твърде големи и изчислително сложни, за да работят ефективно на локално устройство.
За да се справят с този проблем, изследователите разработват Ferret-UI Lite, който представлява версия на Ferret-UI с 3 милиарда параметъра, създадена с „използването на няколко ключови компонента“ и прилагането на прозрения от обучението на малки LLM.

Ferret-UI Lite използва реални и синтетични данни за обучение от множество области на графичния потребителски интерфейс, техники за динамично рамкиране и оптимизация, за да подобри качеството на разбиране на конкретни сегменти на графичния потребителски интерфейс. Използвани са също така техники за прецизна настройка и обучение с подсилване. Резултатът е модел на изкуствен интелект, който почти съвпада или дори превъзхожда конкурентни модели на GUI агенти, като го превъзхожда до 24 пъти.
Редица нововъведения, включително фактът, че моделът сам генерира данни за обучението си, изглеждат любопитни. Изследователите са създали многоагентна система, която взаимодейства директно с реални графични интерфейси, за да генерира масово синтетични примери за своето обучение. Участва генератор на задачи на обучителна програма, който задава цели с нарастваща трудност, а агентът за планиране разделя процеса на постигането им на етапи. Агентът за свързване изпълнява последователно всички етапи на екрана, а агентът за оценяване извършва валидиране на резултатите.

Този конвейер позволява на обучаващата система да улови несигурността на взаимодействието в реалния свят, включително грешки и неочаквани състояния. Това би било по-трудно да се направи, ако моделът се обучава само върху реални, ръчно маркирани данни. Интересно е, че Ferret-UI и Ferret-UI 2 са обучени върху изображения на интерфейси на iOS и други платформи на Apple, докато Ferret-UI Lite е обучен върху изображения на интерфейси на Android, уеб приложения и графични интерфейси за настолни компютри.
Тестовете показаха, че Ferret-UI Lite се справя добре с краткосрочни задачи на ниско ниво, но не е толкова успешен при по-сложни многостъпкови задачи. Това е очакван компромис, като се имат предвид ограниченията на сравнително малкия размер на модела, който може да се изпълнява локално на устройството. От друга страна, Ferret-UI Lite може да осигури високо ниво на поверителност на данните, тъй като алгоритъмът работи локално и не прехвърля данни към сървърите на Apple.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!