2017년 여름, 구글 연구진은 "Attention Is All You Need"라는 논문을 발표하며 트랜스포머를 소개했습니다. 이는 긴 텍스트 시퀀스를 처리하는 데 매우 뛰어난 신경망으로, 9년 후 모든 주요 대규모 언어 모델(LLM)의 엔진이 되었습니다. "AI 산업 전체가 트랜스포머 위에 세워져 있습니다,"라고 AI 스타트업 Subquadratic의 CEO 저스틴 댄젤은 말하며, 이를 컴퓨터 과학 역사상 가장 중요한 혁신 중 하나라고 부릅니다. 하지만 아무리 훌륭한 히트곡도 시간이 지나면 식상해지기 마련입니다.
트랜스포머는 나이를 먹고 있습니다. 최근 LLM의 발전(예: 스스로 메모를 작성하고 대규모 입력을 처리하는 추론 모델)은 핵심 기술의 깔끔한 확장이 아니라 근본적인 결함에 대한 임시방편입니다. 그래서 점점 더 많은 과학자와 엔지니어들이 묻고 있습니다: 다음은 무엇인가? LLM은 사라지지 않지만, 그것이 어떻게 구축되는지는 아직 미정입니다. MIT 테크놀로지 리뷰는 이 미래 세대를 "LLM+"이라고 명명했으며, 이 붐타운 기술의 경계를 넓히려는 스타트업 물결이 밀려오고 있습니다. 일부는 실패하겠지만, 그들은 모든 것을 걸고 있으며 오늘날의 선두주자보다 잃을 것이 훨씬 적습니다.
먼저, 문제부터 살펴봅시다. 트랜스포머는 모든 단어(또는 토큰)를 다른 모든 단어와 곱셈으로 비교하는 밀집 어텐션에 의존합니다. 이는 의미를 훌륭하게 포착하지만, 계산량이 엄청나게 증가합니다: 10,000단어 문서는 5천만 번의 곱셈이 필요할 수 있습니다. 이것이 LLM이 그렇게 많은 전력을 소비하는 이유입니다. OpenAI의 사장 그렉 브록만은 올해 컴퓨팅에 500억 달러를 지출할 것이라고 말하며, 국제에너지기구는 데이터 센터 전력 사용량이 2030년까지 두 배가 될 것으로 예측합니다. 트랜스포머는 또한 대규모 컨텍스트 창(라이브러리, 코드베이스 또는 에이전트 출력 추적)에 어려움을 겪으며, 추론 모델은 처리해야 할 데이터를 더 추가합니다. LLM이 성장함에 따라 트랜스포머는 병목 현상이 됩니다.
이를 해결하기 위한 네 가지 대담한 아이디어가 있습니다.
**아이디어 1: 서브쿼드라틱 스타일의 희소 어텐션**
마이애미에 본사를 둔 Subquadratic은 의미를 잃지 않고 모든 단어 쌍 대신 일부만 계산하는 희소 어텐션을 해결했다고 주장합니다. 그들의 모델 SubQ는 검색 및 코딩 작업에서 최고의 LLM과 견줄 만하다고 합니다. 회의론자들은 여전히 존재하지만, 수천 명이 대기자 명단에 올랐습니다. 회사는 어떤 단어가 중요한지 즉석에서 파악하며 곧 광범위한 출시를 계획하고 있습니다.
**아이디어 2: 매니페스트 AI의 전력 유지**
샌프란시스코의 Manifest AI는 어텐션을 버리고 "전력 유지"를 사용합니다. 이는 가장 관련성 높은 정보만 저장하고 컨텍스트 창의 롤링 요약을 제공하며, 새 데이터가 도착하면 덜 관련된 부분을 버립니다. 이 개념은 10년 전에 나왔지만, Manifest는 마침내 트랜스포머와 경쟁할 수 있다고 주장합니다. 그들은 오픈소스 코딩 LLM인 StarCoder를 PowerCoder로 변환하고, 알리바바의 Qwen과 견줄 만한 Brumby를 출시했습니다. 공동 창업자 카를레스 젤라다는 몇 시간 분량의 비디오 분석부터 몇 주 동안 작업을 유지하는 에이전트까지 다양한 응용 분야를 보고 있습니다.
**아이디어 3: 리퀴드 AI의 액체 신경망**
MIT에서 분사한 Liquid AI는 트랜스포머와 액체 신경망(벌레 뇌에서 영감을 얻음)을 결합하여 "액체 기반 모델"(LFM)을 만듭니다. 이들은 훨씬 작고 에너지 효율적이며, 50달러짜리 라즈베리 파이에서 실행됩니다. 연간 수익이 1천만 달러 미만인 조직에는 무료로 제공되며, CEO 라민 하사니에 따르면 거의 3,400만 건의 다운로드를 기록했습니다. 이 모델은 Qwen 및 구글의 Gemma 버전을 포함하여 4배 더 큰 경쟁 모델과 견줍니다. 비결은 모델을 설계하는 AI로, 트랜스포머 20%와 액체 네트워크 80%의 하이브리드로 결정합니다. 하사니는 뇌가 20와트로 작동한다는 사실에 감탄하며 "우리는 훨씬 더 혁신적일 수 있습니다."라고 말합니다.
**아이디어 4: 인셉션의 확산**
팔로알토에 기반을 둔 Inception은 이미지 및 비디오 모델 뒤에 있는 기술인 확산을 사용하여 한 번에 전체 문장을 생성합니다. Mercury 2와 같은 확산 LLM은 GPT-4 성능과 맞먹지만 10배 빠르다고 주장합니다. 공동 창업자이자 스탠포드 연구원인 스테파노 에르몬은 텍스트에 확산을 적용할 수 있는 수학을 알아냈습니다.
The Good Times
받은 편지함에 뉴스를.
비꼬는 뉴스 요약을 일정에 맞게 배달합니다. 무료. 언제든지 취소하세요.
이미 구독했는데도 저희가 안 보이나요? 스팸함을 확인하고 '스팸 아님'(또는 '스팸에서 제거')을 눌러 주세요. 정크메일 연옥에서 저희를 꺼내 주고 덤으로 모두에게도 도움이 됩니다.
한 달 동안 저희 이메일을 하나도 열지 않으면 메일링 리스트에서 자동으로 삭제됩니다.
Rewrite Article
Select parts to regenerate with a fresh AI pass. Translations will be updated automatically.
Generate AI Image
Creates a sardonic version of the article image using OpenAI.