От OpenAI, създатели на ChatGPT и Dall-E, съвсем наскоро представиха Sora – нов модел на изкуствен интелект (ИИ) за генериране на видеа чрез текстови подкани. Последваха интересни коментари в цялото интернет пространство относно инструмента, който със сигурност ще стане известен като text-to-video (T2V).
Sora (което на японски означава „небе“) не е първият подобен ИИ-генератор. Той обаче изглежда доста по-комплексен спрямо други такива инструменти като Make-a-Video AI на Meta. Sora може да превърне кратко текстово описание в подробен видеоклип с висока резолюция и с продължителност около минута. Например, подканата „Котка буди собственика си, искайки закуска. Той се опитва да я игнорира, но животното предприема нови тактики и накрая човекът изважда лакомство изпод възглавницата си, за да залъже котката за малко“, възпроизвежда без проблем видеоклип, който би станал популярен във всяка социална мрежа.
Сладко, нали? Е, до определена степен. От OpenAI обаче демонстрираха необичайна откровеност относно ограниченията на генератора. Той може, например, „да изпитва затруднение с точното симулиране на физическите характеристики на определена сложна обстановка“.
Едно от разпространените видеа илюстрира слабостите на модела. Въпросната симулация е по командата „Фотореалистичен близък план на два пиратски кораба, започнали битка помежду си, плаващи в чаша кафе“. На пръв поглед видеото изглежда впечатляващо. Но след това се забелязва, че един от корабите се движи бързо по необясним начин. Така става ясно, че докато Sora може много добре да пресъздава отразяването на светлина в течности, генераторът изглежда не е съвсем запознат с физичните закони.
Други ограничения
Sora може невинаги да пресъздава с точност причинно-следствени връзки. Например, подканата „човек отхапва бисквитка“, може да не бъде добре разбрана от инструмента на OpenAI, поради което бисквитката впоследствие би изглеждала недокосната. Генераторът също така може „да се обърка кое е ляво и кое е дясно“.
Все пак това е само начало и със сигурност Sora ще стане по-добър инструмент с добавянето на допълнителна изчислителна мощ. И въпреки че собствениците на холивудски студия засега могат да продължат да спят спокойно, генераторът скоро ще бъде достатъчно добър, за да се използва за създаването на някои видове видеоклипове. По подобен начин Midjourney и Dall-E постепенно изместват платформи за фотографии и изображения като Shutterstock.
Въпреки признанията за слабостите на Sora обаче, от OpenAI заявяват, че генераторът може да „послужи като основа за ИИ-модели, които ще могат да разбират и симулират реалния свят“. Това ще бъде „важна стъпка“ към създаването на изкуствен интелект с общи способности (AGI). Така изглежда ще се потвърди схващането, че машинното обучение някой ден ще създаде свръхинтелигентни системи.
На помощ идват бебетата
Алисън Гопник е известна със своите изследвания относно това как децата започват да разбират и изучават света. Нейното участие в TED Talk на тема „Какво мислят бебетата?“ би било полезно за експертите, които вярват, че технологията е отговорът на въпроса за надхвърлянето на лимита на човешката интелигентност. Десетилетията изучаване на сложното събиране на информация и вземане на решения, което децата правят докато играят, са довели Гопник до заключението, че „бебетата и малките деца са нещо като „отдел за изследователска и развойна дейност“ на човешкия вид“.
Ако експертите от OpenAI наистина са заинтересовани от създаването на AGI, може би трябва да се поучат от бебетата, за да разберат как те започват да осъзнава причинно-следствените връзки.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!