Meta анонсира производителния ИИ-генератор на изображения CM3Leon с поддръжка на точни команди за редактиране

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

През последните две години базираните на изкуствен интелект генератори на изображения станаха почти ежедневие и на пръв поглед не се различават толкова един от друг по своята работа. Но Meta твърди, че новият модел CM3Leon, разработен от инженерите на компанията, е пробив.

Разликата между модела Meta CM3Leon, според разработчиците, е високата производителност при преобразуването на текста в изображение. Същевременно, това е един от първите модели, които осигуряват обратната операция — създаване на описания на изображенията. Повечето съвременни генератори на изображения, включително и OpenAI DALL-E, Google Imagen и Stable Diffusion, при създаването на изображенията използват дифузия — процесът на постепенно премахване на шума от първоначалното изображение, докато се приближава към целта. Резултатът е убедителен, но този алгоритъм изисква значителни изчислителни ресурси, което прави работата на такива системи скъпа, а самите модели бавни и просто не могат да функционират в реално време.

Meta анонсира производителния ИИ-генератор на изображения CM3Leon с поддръжка на точни команди за редактиранеРедактиране на оригиналното изображение: момичето е сменено с брадат мъж, добавени са очила, увеличена е възрастта, лицето е нарисувано

Моделът CM3Leon функционира по принципно различен начин — той е базиран на алгоритъм-трансформър, предоставящ оценка на релевантността на изходните данни, било то текст или изображение. Трябва да се отбележи, че OpenAI първоначално създаваше генератори на изображения, базирани на модел-трансформър, но Image GPT беше заменен от дифузионни алгоритми. При обучението на CM3Leon са използвани 2 милиона, лицензирани от Shutterstock, изображения — най-мощната версия на модела има 7 милиарда параметъра — два пъти повече от OpenAI DALL-E 2. И накрая, тук е използван механизмът за дообучение SFT (Supervised Fine-Tuning), който е свойствен генератор на текст. В резултат на това, производителността на модела се е увеличила при генериране на изображения и съставяне на описания към готовите изображения, а системата е получила възможността да редактира картинките с помощта на текстови команди, като например „промени цвета на небето в ярко синьо“.

Meta анонсира производителния ИИ-генератор на изображения CM3Leon с поддръжка на точни команди за редактиранеГенериране на интериор с обекти, за които са посочени точни координати

В резултат на това Meta CM3Leon възприема в качеството на изходни данни много специфични команди — като това, в кои области от изображението в пиксели трябва да се намира един или друг предмет. За сравнение, DALL-E пренебрегва такива нюанси и често дори отказва да постави в изображението обектите, които са посочени в инструкциите.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини