Базираният в Пало Алто стартъп Inception, основан от професора от Станфорд Стефано Хермон, получи 50 милиона долара за разработване на дифузионни езикови модели Mercury – алтернатива на класическите авторегресионни LLM. Компанията обещава многократно увеличаване скоростта на генериране на текст – до 5-10 пъти спрямо „front-end“ моделите – без загуба на качество, което прави възможни сценарии в реално време като гласови асистенти, интерактивни интерфейси и генериране на код „на живо“.
Концепцията на Inception залага на пренасянето в текста на това, което вече е доказало своята ефективност при изображенията и видеото: процесът на дифузия, при който отговорът не се появява последователно, а се формира „цялостно“ чрез поредица от паралелни усъвършенствания. За разлика от авторегресията, която по своята същност е последователна и се затруднява от латентността на декодирането, дифузията отключва паралелизма на съвременните графични процесори и премахва тясното място на заключенията.
„Когато изкуственият интелект се разгръща в голям мащаб, именно неефективното извеждане се превръща в основна бариера и фактор за разходите“,
казва Хермон, наричайки дифузията „пътят към практическата производителност в голям мащаб“.
Ключовият нов продукт е Mercury: първият комерсиално достъпен дифузионен LLM, за който компанията твърди, че е сравним по точност с флагманите OpenAI, Anthropic и Google, но е 5-10 пъти по-бърз. На Nvidia H100 Mercury демонстрира над 1000 токена в секунда – показател, който доскоро се свързваше с екзотичните ускорители Groq или Cerebras.

Техническата публикация в arXiv отчита производителността чрез измервания на трети страни от 1109 токена/сек за Mercury Coder Mini и 737 токена/сек за Mercury Coder Small; а моделите поддържат качеството на профилните еталони за програмиране.
Mercury вече е разширил дейността си извън лабораторията: моделите са достъпни чрез собствения му API, а също така са интегрирани в екосистемите Bedrock Marketplace и SageMaker JumpStart на Amazon. Това означава, че корпоративните екипи могат да включват dLLM от познатата инфраструктура на AWS, сравнявайки латентността и разходите за притежание „в реални условия“ със съществуващите авторегресионни аналози. Освен това Inception предлага достъп чрез OpenRouter и Poe, позиционирайки Mercury като „drop-in“ заместител на AR моделите в настоящите Pipelines.
Скоростта е само първият слой. Според изчисленията на Inception по-ниските изчислителни изисквания позволяват или да се запази същата латентност при по- големите модели, или да се обслужват повече потребители на една и съща инфраструктура. Дифузната архитектура, твърди компанията, отваря и функционални допълнения: вградена корекция на грешките (намаляване на халюцинациите), унифицирана мултимодалност (език+изображения+код) и прецизно структуриране на изхода – от извикване на функции до генериране на формализирани данни.

За пазара това означава промяна в икономиката на заключенията: тежките за декодиране задачи (асистенти за код, „агентно-базирани“ конвейери с дълги вериги от разсъждения, диалогови интерфейси) стават забележимо по-евтини и по-бързи, без да се прави компромис с качеството.
На фона на надпреварата на „големите“ и все по-скъпи LLM, приложението Inception изглежда като опит за преместване на центъра на тежестта от мащабирането на параметрите към оптимизиране на пътя на генериране. В интервю за TechCrunch Хермон подчертава, че дифузията дава възможност да се заобиколи фундаменталната авторегресионна последователност:
„Получихме пропускателна способност от над 1000 токена в секунда – това е непостижимо със съществуващите AR технологии, тъй като нашият стек по своята същност е паралелен.“
В публикацията се отбелязва и интеграцията на Mercury с инструменти за разработчици и фокусът върху намаляването на латентността и разходите – два показателя, които са критични за производителността.
И накрая, Inception има мощен научен опит: екипът включва професори от Станфорд, Калифорнийския университет в Лос Анджелис и Корнел; сред техническите „градивни елементи“, с които се занимават основателите, са дифузия, flash-attentio, decision transformers и DPO. Това е важен сигнал за консервативните интегратори: залага се не на „трик с ускорението“, а на самостоятелен клон от развитието на генеративния AI, където тезата „по-бързо и по-евтино“ не противоречи на изискванията към качеството и контролируемостта. Ако заявената производителност на Mercury се потвърди от широкомащабни реализации, пазарът може да получи рядък компромис: високо качество при ниска латентност и TCO, съвместими с реалните изисквания за бизнес ефективност.
Кръгът на финансиране на Inception беше ръководен от Menlo Ventures; участниците включват Mayfield, Innovation Endeavors, NVentures (подразделение за рисков капитал на Nvidia), M12 (фонд на Microsoft), Snowflake Ventures и Databricks Investment; бизнес ангелите Андрю Юн и Андрий Карпатий също се присъединиха към сделката.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!