Изследователи от Samsung Electronic представиха нов AI езиков модел, опровергаващ приетата в индустрия максима, че „по-голямото е по-добро“. LLM моделът Tiny Recursive Model или TRM е съставен от едва 7 000 000 параметра, но побеждава в един компонент и най-големите модели. Той побеждава в „разсъждаващи“ задачи големи LLM модели, като Gemini 2.5 Pro, в сложни изпитания, като решаването на „Судоку“.
От компанията са публикували и пълен доклад относно TRM в ArXiv. Той показва как интелигентният дизайн може да е по-ефективен от просто повишаване броя на параметрите в моделите. Моделът използва процес, наречен „рекурсивно разсъждение“. Той позволява „мисленето“ над даден проблем в цикли, минавайки отново и отново през него за подобряване на отговорите. Изследването и моделът са дело на Samsung Advanced Institute of Technology AI Lab в Монреал.
Изследването се спира над дизайна на TRM, който е създаден с цел решаването на логически загадки и умствени предизвикателства. За разлика от големите си LLM събратя, TRM не може да генерира изображения, говори с хора или пише истории. Но той се справя по-добре в решаването на наистина трудни проблеми с по-голяма точност от тях. Така например, той постига ниво на точност от 87% на Sudoku-Extreme. Платформата предизвиква AI моделите в решаването на множество „Судоку“ загадки. Той постига също така резултат от 85% на Maze-Hard – предизвикателство, в което моделът трябва да намери възможно най-бързо изхода в сложни лабиринти. На тестовете ARC-AGI-1 и ARC-AGI-2, той постига съответно 45% и 8%.
Във всички тестове, TRM побеждава големите LLM модели. Така например, на ARC-AGI-2, Gemini 2.5 Pro постига резултат от 4.9%, а o3-mini-high на OpenAI – едва 3%. R1 на DeepSeek и Claude 3.7 на Anthropic PBC постигат съответно 1.3% и 0.7%. А TRM постига тези резултати с по-малко от 0.01% от броя на параметрите на големите езикови модели.
В отделна публикация, Алексия Жолико-Мартино – един от създателите на изследването, обяснява значимостта на постигнатото. Тя коментира, че с TRM тя и колегите ѝ демонстрират, че малките, таргетирани модели могат да постигат отлични резултати по специализирани, структурирани мисловни задачи. Това може да е ценно откритие за по-голямата AI индустрия. По този начин, мощните AI системи могат да станат и по-достъпни. Моделите с милиарди или трилиони параметри изискват използването на огромни клъстери от специализирани и скъпи графични единици. Те също така могат да консумират огромни количества енергия. Което на свой ред означава, че само шепа много богати компании могат да експериментират с тях. А малки модели, като TRM могат да бъдат стартирани на стандартен хардуер и изискват значително по-малко енергия.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!