Чатботовете и големите езикови модели зад тях са в публичното пространство вече повече от две години. И те имат вече проблем, който е нужно да бъде решен спешно. Незнайно как, но трупаното с хилядолетия човешко познание и впоследствие дигитализирано, свършва за LLM моделите. И нуждата те да бъдат обучавани вече на основата на синтетични данни – т.е. такива, които не са генерирани от човек – се увеличава. А може би те вече се обучават на такива синтетични данни?
CopyLeaks провеждат изследване, което посочва, че различните AI услуги, като DeepSeek, ChatGPT, Claude и др. имат свой специфичен „отпечатък“, който може да се открие. Така, както може да откроите написаното от вашия любим писател и текст на друг автор. Проучването на изданието например установява, че резултатите, които дава DeepSeek- R1 са подозрително сходни с тези, които произвежда ChatGPT.
Decrypt, от своя страна, привеждат, че синтетичните данни не са нищо ново. Те се използват за практически цели още от 60-те години на миналия век в области, като статистиката. Тези синтетични данни създават набор от изкуствени информационни блокове, които имитират информацията, идваща от реалния свят. Но специалисти предупреждават, че използването им носи със себе си рискове.
В края на миналата година за свършването на реалните данни, на които се обучават моделите заговори и директорът на Google Сундар Пичай.
„В настоящето състояние на моделите, компаниите, които са на върха се броят на пръсти. Но мисля, че всички ние вече работим над следващата ни версия. И този прогрес ще е труден“, заявява през декември за New York Times Пичай. И не толкова наличието на достъпни данни е проблема, колкото достъпността им.
„Ти или търсиш още или изфабрикуваш такива с това, което имаш“, споделя за Decrypt професор Мюриъл Медард от MIT. Именно ограничения достъп е причината за нуждата от синтетични данни. Ник Санчес от Druid AI допълва за изданието, че с настоящите политики за използване на съдържанието и други ограничения, синтетичните данни вече са необходимост. Те не само улесняват работата на специалистите, но и предпазват от всякакви възможни юридически главоболия.
„Това не е перфектното решение, тъй като може да представя пристрастни гледни точки. Както в информацията, идваща от истинския свят. Но потенциалните проблеми със запазени права, конфиденциалността и съгласието за използване ще се трупат с времето“, убеден е Санчес. А рисковете тук може да са големи. Особено, когато става въпрос за използването на синтетични данни за критично важни приложения. Санчес дава за пример системи за засичане на измама. Моделите могат да бъдат умишлено подведени при обучението, за да се пренебрегнат определени измамни практики.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!