AI моделите на Google, OpenAI, Anthropic и xAI загубиха виртуални пари, залагайки на футболни мачове през сезона на Английската Висша лига в рамките на експеримент, проведен от стартъпа General Reasoning. Резултатите от експеримента показват, че дори най-модерните AI системи изпитват затруднения при анализа на събития от реалния свят в дългосрочна перспектива, пише Financial Times.
General Reasoning публикува резултатите от проекта KellyBench – според компанията заключенията потвърждават, че AI може успешно да решава задачи като писане на програмен код, но не е в състояние да се ориентира в много други аспекти на реалния човешки живот. В рамките на експеримента компанията тества осемте най-добри AI системи във виртуална реконструкция на сезона на Английската Висша лига 2023–2024 година, като им предостави подробна статистика за всеки отбор и предишните мачове. На AI беше възложено да създаде модели, с помощта на които да се извлича максимална печалба и да се управляват рисковете.
Виртуалните AI агенти залагаха на резултатите от мачовете и броя на отбелязаните голове, за да се провери дали са способни да се адаптират към нови събития и към актуализиращите се с напредването на сезона данни за играчите. В рамките на експеримента AI моделите нямаха достъп до интернет, като всеки от тях разполагаше с по три опита да спечели. Най-добре се представи Claude Opus 4.6 на Anthropic със средна загуба от 11% и почти без загуба в един от опитите. Чатботът Grok 4.20 на xAI веднага загуби и не успя да завърши останалите два опита, а Gemini 3.1 Pro на Google реализира печалба от 34% при първия опит и загуби при втория.
В крайна сметка всеки от водещите AI модели загуби пари през сезона, а много от тях направо фалираха, отбелязват изследователите. В тази задача AI се представи явно по-зле от хората.
| AI модел | Средна възвръщаемост | Най-добър резултат | Най-лош резултат | Средна крайна сума |
|---|---|---|---|---|
| Anthropic Claude Opus 4.6 | −11.0% | −0.2% | −18.8% | £89,035 |
| OpenAI GPT-5.4 | −13.6% | −4.1% | −31.6% | £86,365 |
| Google Gemini 3.1 Pro | −43.3% | +33.7% | −100% | £56,715 |
| Google Gemini Flash 3.1 LP | −58.4% | +24.7% | −100% | £41,605 |
| Z.AI GLM-5 | −58.8% | −14.3% | −100% | £41,221 |
| Moonshot Kimi K2.5 | −68.3% | −27.0% | −100% | £7,420 |
| xAI Grok 4.20 | −100% | −100% | −100% | £0 |
| Arcee Trinity | −100% | −100% | −100% | £0 |
Резултатите от експеримента сочат, че опасенията на обществеността относно изместването на човека от АI засега са неоснователни, а в дългосрочна перспектива AI все още е несъстоятелен, подчертават от General Reasoning. Много от бенчмарковете, в които се оценяват АI моделите описват „много статични условия“, които нямат много общо с хаоса и сложността на реалния свят. И ако АI се справя добре с писането на програмен код, то в много други видове човешка дейност той все още е безполезен.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!