Definition:
FreeTokenとは、PCやローカルデバイス(エッジ環境)上で、巨大なMoE(Mixture of Experts)アーキテクチャを持つAIモデルを効率的に動作させるために開発された、エッジネイティブな推論(サービング)システム。
従来のエンジンがローカルマシンを単なる「メモリの小さなGPU」として扱っていたのに対し、FreeTokenはGPU、CPU、ホストメモリ(DRAM)、そしてそれらをつなぐPCIeインターコネクトを1つの弾力的(エラスティック)な統合推論プラットフォームとして捉え、ハードウェアリソースを極限まで使い切るように設計されている。
カリフォルニア大学バークレー校(UC Berkeley)やテキサス大学オースティン校(UT Austin)の研究者により2026年8月に発表。
DeepSeek-V4-FlashやGLM-5.2など、データセンター向けに設計されたオープンウェイトモデルは、商用の独占的モデル(プロプライエタリモデル)に匹敵する性能に達した。しかし、これらを実用的に稼働させるには数百万ドル規模のデータセンター級GPUクラスタが必要であり、API経由で利用するにしても、頻繁に推論を行うAIエージェントシステムではコストが非常に重いものになっていた。つまり、モデルの重み自体は公開されても、実際に「誰もが自由にスケールして動かせる(アクセスできる)」状態にはなっていなかったことが開発の背景。
MoEモデルは、各トークン処理に全体の数%のエキスパート(計算回路)しか呼び出さないため、処理に必要なメモリはコンシューマ向けGPU(RTX 5090など)に収まるほど軽量。しかし、使われないエキスパートも含めた「モデル全体の重み(数百GB)」は、VRAM容量を遥かに超える。結果として、膨大なエキスパートをホストメモリ(DRAM)に置き、推論のたびにPCIe経由でGPUへ転送する「通信の壁(ボトルネック)」に直面。特に自律型AIエージェント(コーディングやツール利用)のワークロードでは、文脈(コンテキスト)が長く、さらにツール呼び出しの結果に応じて過去の「思考プロセス」を頻繁に削除・書き換える。既存のローカル推論エンジン(llama.cppなど)は、こうした動的な文脈の変更があるたびに、過去のキャッシュデータを破棄して巨大なMoEモデルの「再プリフィル(再計算)」を強いることになり、これが数分に及ぶ極端な遅延(TTFTの増大)やタイムアウトを引き起こしていた。
専用のデータセンターとは異なり、個人のPC環境ではユーザーが同時にゲームやブラウザを動かすため、AIサービングに利用できるVRAMなどのハードウェア資源は常に激しく変動する。さらに、デバイスごとにGPU、CPU、PCIe帯域、メインメモリのバランスが千差万別であるため、静的な配置(固定のオフロード設計)ではマシンの性能を引き出せなかった。
Mathematics is the language with which God has written the universe.