През последните две години базираните на изкуствен интелект генератори на изображения станаха почти ежедневие и на пръв поглед не се различават толкова един от друг по своята работа. Но Meta твърди, че новият модел CM3Leon, разработен от инженерите на компанията, е пробив.
Разликата между модела Meta CM3Leon, според разработчиците, е високата производителност при преобразуването на текста в изображение. Същевременно, това е един от първите модели, които осигуряват обратната операция — създаване на описания на изображенията. Повечето съвременни генератори на изображения, включително и OpenAI DALL-E, Google Imagen и Stable Diffusion, при създаването на изображенията използват дифузия — процесът на постепенно премахване на шума от първоначалното изображение, докато се приближава към целта. Резултатът е убедителен, но този алгоритъм изисква значителни изчислителни ресурси, което прави работата на такива системи скъпа, а самите модели бавни и просто не могат да функционират в реално време.
Редактиране на оригиналното изображение: момичето е сменено с брадат мъж, добавени са очила, увеличена е възрастта, лицето е нарисувано
Моделът CM3Leon функционира по принципно различен начин — той е базиран на алгоритъм-трансформър, предоставящ оценка на релевантността на изходните данни, било то текст или изображение. Трябва да се отбележи, че OpenAI първоначално създаваше генератори на изображения, базирани на модел-трансформър, но Image GPT беше заменен от дифузионни алгоритми. При обучението на CM3Leon са използвани 2 милиона, лицензирани от Shutterstock, изображения — най-мощната версия на модела има 7 милиарда параметъра — два пъти повече от OpenAI DALL-E 2. И накрая, тук е използван механизмът за дообучение SFT (Supervised Fine-Tuning), който е свойствен генератор на текст. В резултат на това, производителността на модела се е увеличила при генериране на изображения и съставяне на описания към готовите изображения, а системата е получила възможността да редактира картинките с помощта на текстови команди, като например „промени цвета на небето в ярко синьо“.
Генериране на интериор с обекти, за които са посочени точни координати
В резултат на това Meta CM3Leon възприема в качеството на изходни данни много специфични команди — като това, в кои области от изображението в пиксели трябва да се намира един или друг предмет. За сравнение, DALL-E пренебрегва такива нюанси и често дори отказва да постави в изображението обектите, които са посочени в инструкциите.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!