OpenAI представи ChatGPT Images 2.0 – модел за генериране на изображения, който за първи път сред масовите изкуствени интелекти правилно изобразява текстове в изображенията. Докато преди две години дифузионните модели на ИИ не можеха да създадат меню на мексикански ресторант без измислени думи като „enchuita“ и „burrto“, новият модел създава изображения с използваеми надписи без редакции.
Още през 2024 г. дифузните модели на изкуствения интелект систематично изкривяваха надписите. Според Асмелаш Тека Хадгу, основател и главен изпълнителен директор на Lesan AI, моделите реконструират изображението от шум и усвояват шаблони, които покриват по-голямата част от пикселите, като текстът заема малка част от площта.

Оттогава изследователите опитват алтернативни подходи – по-конкретно авторегресионни модели, които прогнозират съдържанието на изображенията и работят по начин, подобен на големите езикови модели (LLM).
OpenAI не разкрива каква архитектура стои в основата на Images 2.0. От компанията обясниха само, че новостта е способна да „разсъждава“ – да търси информация в интернет, да генерира няколко изображения по една заявка и да проверява резултатите. Благодарение на това Images 2.0 създава маркетингови материали в различни размери и дори комикси. AI моделът има и подобрена работа с нелатински шрифтове – японски, корейски, хинди и бенгалски. Въпреки това знанията на Images 2.0 са ограничени до декември 2025 г., което може да повлияе на точността на генериране при заявки за скорошни събития.
„Images 2.0 издига детайлността и точността на генерирането до безпрецедентно ниво. Моделът е способен да обмисли сложна композиция и да я вдъхне живот: да следва инструкции, да запазва определени детайли и да визуализира елементи, в които генераторите обикновено се препъват – малък текст, икони, елементи на интерфейса, богати композиции и фини стилистични ограничения – всичко това при резолюции до 2K“,
се казва в прессъобщение на компанията.
Генерирането на това отнема повече време, отколкото типичната текстова заявка към ChatGPT, но дори и един многопанелен комикс отнема няколко минути.
Images 2.0 ще бъде достъпна за всички потребители на ChatGPT и Codex. Платените абонати ще могат да генерират по-сложни изображения. OpenAI ще отвори и програмния интерфейс (API) gpt-image-2 – цената ще зависи от качеството и резолюцията на изходните изображения.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!