Apple научи малки ИИ-модели да описват изображенията по-добре от аналозите на големите конкуренти

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Учени от Apple разработиха технологията RubiCap — способ за обучение на ИИ-моделите да описват изображенията по-подробно и ефективно, отколкото по-големите модели.

Когато подготвя подробно описание на изображението, един ИИ-модел трябва да идентифицира множество обекти и региони в кадъра, за да ги опише с висока степен на детайлност. Това помага да се разбере композицията по-задълбочено, отколкото при общо описание. На практика това умение може да бъде полезно за обучение на производните на ИИ-модели, създаване на генератори на изображения въз основа на текстови описания и разработване на функции за достъпност. Създаването на системи за подробно описание на изображения се оказва непосилно скъпо и ресурсоемко, както в началния етап на обучението, така и по-късно по време на обучението с подсилване.

За да се справят с тези проблеми, инженерите на Apple избраха на случаен принцип 50 000 изображения от обучителните комплекти PixMoCap и DenseFusion-4V-100K. За всяко от тези изображения са генерирани надписи от съществуващи модели за компютърно зрение, включително Google Gemini 2.5 Pro, OpenAI GPT-5, Alibaba Qwen2.5-VL-72B-Instruct, Google Gemma-3-27B-IT и Alibaba Qwen3-VL-30B-A3B-Instruct; обучените в момента модели на Apple също са генерирали свои собствени описания към изображенията. Gemini 2.5 Pro, действайки като експерт, след това анализирал отново изображенията с варианти на надписи и изхода на обучения модел, определяйки къде участващите системи са съгласни и какви детайли са пропуснали или изкривили; и разработи ясни критерии за оценка на описанията. Действайки като съдия, Qwen2.5-7B-Instruct е оценил описанията според всеки от предложените критерии и е генерирал сигнал за награда на обучения модел.

В резултат на това обученият модел е получил прецизна и висококачествена обратна връзка за това какво е необходимо да се коригира и е започнал да генерира по-точни описания, без да разчита само на един „верен“ отговор. Инженерите на Apple в крайна сметка обучили три собствени AI-модела: RubiCap-2B, RubiCap-3B и RubiCap-7B, съответно с 2, 3 и 7 милиарда параметъра. В задачите за описание на изображения те се представили по-добре от подобните модели, създадени от други разработчици с 32 милиарда и дори 72 милиарда параметъра. Забележителното тук е това, че RubiCap-3B в някои случаи демонстрира по-добри резултати от RubiCap-7B, потвърждавайки, че размерът на модела не винаги определя неговата работа.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Абонирай се
Извести ме за
guest

0 Коментара
стари
нови оценка

Нови ревюта

Подобни новини