2017年の夏、Googleの研究者たちは「Attention Is All You Need」という論文を発表し、トランスフォーマーを導入しました。これは、長いテキストのシーケンスを処理するのに驚くほど優れたニューラルネットワークです。9年後、トランスフォーマーはすべての主要な大規模言語モデル(LLM)のエンジンとなっています。「AI業界全体がトランスフォーマーに基づいています」と、AIスタートアップSubquadraticのCEO、Justin Dangel氏は言い、コンピュータサイエンス史上最も重要な革新の1つと呼んでいます。しかし、どんな大ヒット曲も、しばらくすると飽きられてしまいます。

トランスフォーマーは時代遅れになりつつあります。最近のLLMの進歩(自分自身にメモを書き、巨大な入力を処理する推論モデルなど)は、中核技術のきれいな拡張ではなく、根本的な欠陥に対するガムテープの修正です。そこで、科学者やエンジニアのグループが「次は何か?」と問いかけています。LLMはなくなりませんが、その構築方法は変わる可能性があります。MITテクノロジーレビューはこの次世代を「LLM+」と呼び、スタートアップの波がこのブームの技術の限界を押し広げようと突入しています。失敗する企業もあるでしょうが、彼らにはプレイするすべてのものがあり、現在のフロントランナーよりも失うものがはるかに少ないのです。

まず、問題があります。トランスフォーマーは、すべての単語(またはトークン)を乗算で他のすべての単語と比較する高密度アテンションに依存しています。これは意味を巧みに捉えますが、計算量はひどくスケールします。1万語の文書には5000万回の乗算が必要かもしれません。それがLLMがこれほど電力を消費する理由です。OpenAIの社長Greg Brockman氏は、同社が今年コンピューティングに500億ドルを費やすと述べており、国際エネルギー機関はデータセンターの電力使用量が2030年までに2倍になると予測しています。トランスフォーマーはまた、大きなコンテキストウィンドウ(ライブラリ、コードベース、エージェント出力の追跡)にも苦労し、推論モデルは扱うデータを増やします。LLMが成長するにつれて、トランスフォーマーはボトルネックになります。

それを修正するための4つの大胆なアイデアを紹介します。

**アイデア1: スパースアテンション、サブクアドラティックスタイル**

マイアミに拠点を置くSubquadraticは、意味を失わずにすべての単語ペアの代わりに一部のみを計算するスパースアテンションを解明したと主張しています。同社のモデルSubQは、検索やコーディングタスクでトップLLMに匹敵するとされています。懐疑的な見方もありますが、数千人がウェイトリストに登録しています。同社は、どの単語が重要かをその場で判断し、まもなく広くリリースする予定です。

**アイデア2: Manifest AIのパワーリテンション**

サンフランシスコのManifest AIは、アテンションを捨てて「パワーリテンション」を採用しています。これは、最も関連性の高い情報のみを保存し、新しいデータが到着するにつれて関連性の低いビットをドロップしながら、コンテキストウィンドウのローリングサマリーを提供します。この概念は10年前からありますが、Manifestはついにトランスフォーマーと競争力を持つようになったと主張しています。同社はオープンソースのコーディングLLM StarCoderをPowerCoderに変え、AlibabaのQwenに匹敵すると言われるBrumbyをリリースしました。共同創業者のCarles Gelada氏は、数時間のビデオ分析から数週間タスクを継続するエージェントまで、応用の可能性を見ています。

**アイデア3: Liquid AIのリキッドニューラルネットワーク**

MITスピンオフのLiquid AIは、トランスフォーマーとリキッドニューラルネットワーク(線虫の脳に触発された)を組み合わせて「リキッドファンデーションモデル」(LFM)を作成しています。これらははるかに小さく、エネルギー効率が高く、50ドルのRaspberry Piで動作します。年間売上高が1000万ドル未満の組織には無料で、CEOのRamin Hasani氏によると、ほぼ3400万ダウンロードを記録しています。これらのモデルは、QwenやGoogleのGemmaのバージョンを含む、4倍の大きさのライバルに匹敵します。秘密のソースは、モデルを設計するAIで、トランスフォーマー20%とリキッドネットワーク80%のハイブリッドに落ち着きました。Hasani氏は、脳が20ワットで動作することに驚嘆しています。「私たちはもっと革新的になることができます。」

**アイデア4: Inceptionの拡散**

パロアルトに拠点を置くInceptionは、画像やビデオモデルの背後にある技術である拡散を使用して、文全体を一度に生成します。Mercury 2などの拡散LLMは、GPT-4のパフォーマンスに匹敵しながら10倍高速であると主張しています。共同創業者でスタンフォード大学の研究者であるStefano Ermon氏は、テキストで拡散を機能させるための数学を解明しました。