Ещё летом 2017 года исследователи Google опубликовали статью под названием «Внимание — это всё, что вам нужно», представив трансформер — нейронную сеть, которая оказалась потрясающе хороша в обработке длинных последовательностей текста. Девять лет спустя трансформеры являются движком внутри каждой крупной языковой модели (LLM). «Вся индустрия ИИ построена на трансформерах», — говорит Джастин Данджел, генеральный директор ИИ-стартапа Subquadratic, называя их одним из самых важных нововведений в истории компьютерных наук. Но даже самые великие хиты со временем начинают приедаться.

Трансформеры показывают свой возраст. Недавние достижения в области LLM — такие как модели рассуждений, которые делают заметки для себя и обрабатывают огромные объёмы входных данных, — не являются аккуратными расширениями основной технологии; это заплатки из скотча на фундаментальные недостатки. Поэтому растущая группа учёных и инженеров задаётся вопросом: что дальше? LLM никуда не денутся, но то, как они устроены, остаётся открытым вопросом. MIT Technology Review назвал это будущее поколение «LLM+», и волна стартапов устремляется вперёд, надеясь раздвинуть границы этой бурно развивающейся технологии. Некоторые потерпят неудачу, но им есть что поставить на карту и гораздо меньше терять, чем сегодняшним лидерам.

Во-первых, проблема. Трансформеры полагаются на плотное внимание, которое сравнивает каждое слово (или токен) с каждым другим словом с помощью умножения. Это блестяще улавливает смысл, но вычислительная сложность растёт ужасно: документ из 10 000 слов может потребовать 50 миллионов умножений. Вот почему LLM потребляют так много энергии. Президент OpenAI Грег Брокман говорит, что компания потратит 50 миллиардов долларов на вычисления в этом году, а Международное энергетическое агентство прогнозирует, что потребление электроэнергии центрами обработки данных удвоится к 2030 году. Трансформеры также с трудом справляются с большими контекстными окнами — отслеживанием библиотеки, кодовой базы или выходных данных агентов — а модели рассуждений добавляют больше данных для обработки. По мере роста LLM трансформеры становятся узким местом.

Вот четыре безумные идеи, как это исправить.

**Идея 1: Разреженное внимание в стиле Subquadratic**

Базирующийся в Майами Subquadratic утверждает, что взломал разреженное внимание — вычисление только некоторых пар слов вместо всех — без потери смысла. Его модель SubQ якобы конкурирует с ведущими LLM в задачах поиска и написания кода. Скептики остаются, но тысячи уже записались в лист ожидания. Компания заявляет, что на лету определяет, какие слова важны, и планирует вскоре выпустить широкую версию.

**Идея 2: Удержание мощности от Manifest AI**

Сан-францисский Manifest AI отказывается от внимания в пользу «удержания мощности», которое хранит только самую релевантную информацию и предоставляет скользящую сводку контекстного окна, отбрасывая менее важные фрагменты по мере поступления новых данных. Концепции уже десять лет, но Manifest утверждает, что наконец-то стал конкурентоспособен с трансформерами. Он превратил открытую языковую модель для кода StarCoder в PowerCoder и выпустил Brumby, который, по его словам, соперничает с Qwen от Alibaba. Соучредитель Карлес Гелада видит применение от анализа многочасовых видео до агентов, которые остаются на задаче в течение недель.

**Идея 3: Жидкие нейронные сети от Liquid AI**

Спин-офф MIT Liquid AI сочетает трансформеры с жидкими нейронными сетями — вдохновлёнными мозгами червей — для создания «жидких фундаментальных моделей» (LFM). Они гораздо меньше и энергоэффективнее, работая на Raspberry Pi за 50 долларов. Они бесплатны для организаций с годовым доходом менее 10 миллионов долларов и набрали почти 34 миллиона загрузок, говорит генеральный директор Рамин Хасани. Модели соответствуют конкурентам в четыре раза больше, включая версии Qwen и Gemma от Google. Секретный соус: ИИ, который проектирует модели, останавливаясь на гибриде из 20% трансформеров и 80% жидких сетей. Хасани поражается, что мозг работает на 20 ваттах: «Мы можем стать гораздо более инновационными».

**Идея 4: Диффузия от Inception**

Inception, базирующийся в Пало-Альто, генерирует целые предложения сразу, используя диффузию — технологию, стоящую за моделями изображений и видео. Диффузионные LLM, такие как Mercury 2, утверждают, что соответствуют производительности GPT-4, но в 10 раз быстрее. Соучредитель Стефано Эрмон, исследователь из Стэнфорда, разобрался в математике, чтобы заставить диффузию работать с текстом в