MATHVISTA: изкуственият интелект, който може да спаси света от сложните математически проблеми

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Изследователи от Калифорнийския университет в Лос Анджелис, Вашингтонския университет и Microsoft представиха нов инструмент за оценка на способностите на изкуствения интелект (AI) за математическо мислене във визуален контекст. Това е MATHVISTA . Инструментариумът съчетава задания от различни математически и визуални задачи. Включва 6141 примера от 28 мултимодални бази данни, свързани с математиката, както и три нови бази данни. Това са IQTest, FunctionQA и PaperQA. Главната особеност на MATHVISTA е способността ѝ да оценява не само логическото мислене, но и визуалното възприятие.

За да проверят ефективността на различните модели за изкуствен интелект, изследователите са тествали 12 водещи масови модела. Включитено включително трите големи езикови модела (LLM). Това са ChatGPT, GPT-4, Claude-2. Плюс двата големи мултимодални модела (LMM) – GPT4V и Bard, както и седем отворени LMM. Тези модели са оценени чрез MATHVISTA, като са използвани стратегии за запитване с верига от мисли (CoT) и с програма за мисли (PoT) при условия на нулево и ограничено обучение.

Резултатите показват, че CoT GPT-4, най-добрият модел, базиран на текст без визуални подобрения, е постигнал обща точност от 29,2%. За сравнение, най-добрият мултимодален модел на Bard постигна 34,8%, което е 58% от човешките резултати (34,8% срещу 60,3%). Междувременно, когато PoT GPT-4 е допълнен със сигнатури и OCR текст от Bard, той достига 33,9%, което почти съвпада с резултатите на мултимодалния модел на Bard.

Анализът обаче посочва недостатъците на модела на Bard. Това са предимно неправилни изчисления и халюцинации, причинени от визуалното възприятие и текстовите разсъждения. Забележително е, че GPT-4V, най-новата мултимодална версия на GPT-4, постига точност от 49,9%, което е с 15,1% повече от мултимодалния модел Bard. Това е първата цялостна оценка с помощта на MATHVISTA и предоставя ценни практически идеи за по-нататъшното подобряване на математическото мислене в мултимодалните системи за изкуствен интелект.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини