Anthropic актуализира своя голям езиков модел от средно ниво Sonnet. Разработчиците на компанията са наблегнали на подобренията в генерирането на програмен код, разсъжденията с дълги контексти, изпълнението на инструкции и работата с компютри. Новият продукт ще се превърне в стандартен AI модел за чатбота на Cloude както за безплатните потребители, така и за абонатите на абонамента Pro.
Sonnet 4.6 предлага контекстуален прозорец от 1 милион токена, което е два пъти повече от предишната версия.
Anthropic описва новия контекстен прозорец като „достатъчно голям, за да съхранява цели бази данни, дълги договори или десетки научни статии в една заявка“. Компанията подчертава, че AI моделът не само съхранява големи количества информация, но и я обработва ефективно при изграждането на логически вериги.
Според Anthropic разработчиците, които са тествали Sonnet 4.6 в рамките на ранния достъп са го предпочели пред Sonnet 4.5 в 70% от случаите. Потребителите съобщават за по-чиста работа с контекста на кода, по-малко дублиране на логиката и по-последователно изпълнение на инструкциите. Разработчиците съобщават и за намаляване на броя на „халюцинациите“ и фалшивите твърдения за успешно изпълнение на задачите.

Специално внимание е отделено на работата с компютър без специализирани API. AI моделът взаимодейства със софтуера по същия начин, по който го прави човек – чрез виртуални кликвания на мишката и въвеждане на данни от клавиатурата.
В бенчмарка OSWorld, който симулира задачи в Chrome, LibreOffice и VS Code, Sonnet 4.6 демонстрира забележим напредък в сравнение с предишните версии. Според компанията в редица сценарии (като работа със сложни електронни таблици или многостъпкови уеб формуляри), AI моделът се доближава до производителността на човека. Въпреки това Anthropic признава, че AI все още отстъпва на най-опитните потребители и че реалната работа със софтуера е по-трудна от лабораторните тестове.
Anthropic отбелязва, че Sonnet 4.6 предоставя значително подобрени умения за програмиране в сравнение с предишната версия. В съответните сравнителни тестове новият продукт се е представил по-добре от Gemini 3 Pro, а също така почти се е изравнил с Opus 4.5. Според бета тестерите на AI модела, особено забележими са подобренията при задачите за front-end разработка и финансов анализ. Отбелязва се също така, че Sonnet 4.6 е успял да постигне ниво на производителност при редица задачи, които преди това са изисквали AI модели от клас Opus, включително реални офис задачи.

Anthropic също така показа резултати от теста ARC-AGI-2 – един от най-трудните критерии, който оценява способността на AI модела да разсъждава абстрактно и да обобщава (умения, характерни за човешката интелигентност). Sonnet 4.6 постигна 60,4% с високо ниво на „мисловни усилия“. Този резултат поставя Sonnet 4.6 над повечето сравними модели, въпреки че изостава от решения като Opus 4.6, Gemini 3 Deep Think и една от подобрените версии на GPT 5.2.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!