早在2017年夏天,谷歌研究人员发表了一篇名为《Attention Is All You Need》的论文,引入了Transformer——一种神经网络,事实证明它在处理长文本序列方面表现出色。九年后,Transformer已成为每个大型语言模型(LLM)内部的引擎。AI初创公司Subquadratic的首席执行官Justin Dangel表示:“整个AI行业都建立在Transformer之上”,称其为计算机科学史上最重要的创新之一。但即使是伟大的作品,时间久了也会让人感到厌倦。

Transformer正在显现出老态。最近的LLM进展——比如能给自己写笔记并处理海量输入的推理模型——并不是核心技术的巧妙扩展;它们只是对根本缺陷的权宜之计。因此,越来越多的科学家和工程师开始问:接下来是什么?LLM不会消失,但它们的构建方式有待商榷。《麻省理工科技评论》将这一代未来模型称为“LLM+”,一波初创公司正涌入其中,希望推动这项热门技术的发展。有些会失败,但它们有得是机会,而且比当今的领跑者输得起。

首先,问题所在。Transformer依赖于密集注意力,它通过乘法将每个词(或标记)与其他每个词进行比较。这能出色地捕捉语义,但计算量却呈爆炸式增长:一份一万字的文档可能需要5000万次乘法。这就是LLM消耗大量电力的原因。OpenAI总裁Greg Brockman表示,公司今年将在计算上花费500亿美元,而国际能源署预测,到2030年,数据中心的用电量将翻一番。Transformer在处理大型上下文窗口(如跟踪图书馆、代码库或智能体输出)方面也存在困难,而推理模型又增加了需要处理的数据量。随着LLM的增长,Transformer成为瓶颈。

以下是四个疯狂的想法来解决这个问题。

**想法一:稀疏注意力,Subquadratic风格**

总部位于迈阿密的Subquadratic声称已经破解了稀疏注意力——只计算部分词对,而不是全部——且不丢失语义。其模型SubQ据称在搜索和编码任务上能与顶级LLM相媲美。怀疑者依然存在,但已有数千人加入了等待名单。该公司表示,它会实时判断哪些词重要,并计划很快全面发布。

**想法二:Manifest AI的功率保持**

旧金山的Manifest AI放弃了注意力机制,转而采用“功率保持”,即只存储最相关的信息,并提供上下文窗口的滚动摘要,随着新数据的到来而丢弃不太相关的部分。这个概念已有十年历史,但Manifest声称它终于能与Transformer竞争了。它将开源编码LLM StarCoder变成了PowerCoder,并发布了Brumby,称其能与阿里巴巴的Qwen相媲美。联合创始人Carles Gelada看到了从分析数小时视频到让智能体连续工作数周的应用场景。

**想法三:Liquid AI的液态神经网络**

麻省理工学院的衍生公司Liquid AI将Transformer与液态神经网络(灵感来自蠕虫大脑)相结合,创建了“液态基础模型”(LFM)。这些模型体积小得多,能效更高,可以在50美元的树莓派上运行。它们对年收入低于1000万美元的组织免费,首席执行官Ramin Hasani表示,下载量已接近3400万次。这些模型能与四倍于其规模的竞争对手相匹敌,包括Qwen和谷歌Gemma的某些版本。秘诀在于:一个AI来设计模型,最终采用20%的Transformer和80%的液态网络的混合体。Hasani惊叹于大脑仅靠20瓦功率运行:“我们可以更具创新性。”

**想法四:Inception的扩散模型**

总部位于帕洛阿尔托的Inception利用扩散技术(图像和视频模型背后的技术)一次性生成整个句子。扩散LLM,如Mercury 2,声称能达到GPT-4的性能,但速度快10倍。联合创始人Stefano Ermon是斯坦福大学的研究员,他找到了让扩散技术适用于文本的数学方法。