В последния ден на акцията Shipmas, в рамките на която беше обещано в продължение на 12 дни да се показва, анонсира и говори за новите ИИ-функции, OpenAI разкри два големи езикови модела от следващо поколение o3 и o3-mini, които имат способността да разсъждават.
OpenAI отбелязва, че днес не става сума за пускане на нови езикови модели. Компанията обясни, че обучението на тези невронни мрежи все още не е завършено и крайният резултат може да се различава от показания до момента. В същото време OpenAI приема предложения от изследователската общност за тестване на тези модели, преди да ги пусне за общодостъпно ползване. Компанията все още не е решила кога ще стане това.
През септември тази година OpenAI пусна мислещия AI-модел o1 (с кодово име Strawberry). Решението новите модели да се наричат o3 се дължи на факта, че по този начин компанията е решила да избегне объркване (или конфликти на търговски марки) с британската телекомуникационна компания O2.
Терминът „разсъждаващ AI модел“ напоследък стана много модерен в развитието на технологиите за изкуствен интелект и машинното обучение. Но по същество това означава само, че за да реши даден въпрос, машината разбива инструкциите на по-малки задачи. Това в крайна сметка ви позволява да постигнете по-точни резултати. „Разсъждаващите“ AI модели често показват целия процес на вземане на решения и как AI е стигнал до определен отговор, вместо просто да дават окончателен отговор без обяснение.
OpenAI твърди, че неговият нов модел o3 надхвърля предишните рекорди за производителност навсякъде. В теста ARC-AGI, който е специално проектиран за сравняване на възможностите на изкуствения интелект с човешкия интелект, моделът o3 превъзхожда o1 с повече от три пъти, демонстрирайки резултат от 88%.

Новият модел също така е с 22,8% по-бърз от своя предшественик в писането на код (тест SWE-Bench Verified) и дори надмина водещия учен на OpenAI в спортното програмиране.

Моделът o3 почти се справя с един от най-трудните математически тестове — AIME 2024, пропускайки само един въпрос, а също така отбеляза 87,7% в бенчмарка GPQA Diamond — значително по-висок от всеки резултат на човешки експерт.

В най-трудните математически и логически тестове, които обикновено спъват всеки друг AI, o3 решава 25,2 процента от задачите — резултатите на други модели не надвишават два процента.

Значително предимство на o3, подобно на o1, е способността на моделите да „разсъждават“ и ефективно да проверяват собствените си факти, за да избегнат различни видове грешки и халюцинации. Въпреки това разработчиците от OpenAI заявиха, че процесът на проверка на фактите преди издаване на отговор води до леко забавяне — от няколко секунди до няколко минути (в зависимост от сложността на въпроса). Освен това забавянето се дължи на модела, определящ дали заявката на потребителя отговаря на политиката за сигурност на OpenAI. Компанията твърди, че при тестване на новия алгоритъм за сигурност на o1, той е следвал правилата за безопасност много по-добре от предишните модели, включително и GPT-4.
И все пак, както отбелязват журналистите от TechCrunch, основният недостатък на „разсъждаващите“ модели е, че изискват много повече изчислителна мощност за работата си, така че в крайна сметка използването им е много по-скъпо от „обичайните“ решения.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!