2026年7月、独立開発者Andrey MikhaylovがGitHubでTurboFieldfareをオープンソース化しました。このプロジェクトはカスタムSwift + Metalランタイムを使用し、GoogleのGemma 4 26B-A4B命令微調整モデルをApple Silicon Mac上で動作させ、RAM使用量は約2GBです。8GBメモリのM2 MacBook Airユーザーにとって、このプロジェクトはローカルLLM推論のハードルを大幅に下げるものです。
TurboFieldfareは単なるMLXやllama.cppのラッパーではなく、完全に独立したSwift + Metal推論エンジンです。プロジェクトの核心的なアイデアは、mixture-of-expertsアーキテクチャとSSDストリーミングを用いることです:常駐共有部分は約1.35GBのRAMを占め、必要なルーティングされたエキスパートのみがSSDからメモリにストリーミングされます。この設計により、完全なモデルの14.3GBの重さが約2GBのRAM使用量に圧縮され、約7倍の削減が実現されます。
TurboFieldfare技術仕様
TurboFieldfareはApple Silicon向けに設計されており、macOS 26、Metal 4、Swift 6.2以上が必要です。モデルはGemma 4 26B-A4B ITバージョンを採用し、合計260億のパラメータを持っていますが、各トークンでは約38.8億のアクティブパラメータのみが起動します。重みの量子化にはMLXアフィン4ビット、グループ64、ルーターには8ビット、共有およびルーティングされたエキスパートは4ビットを使用しています。
- モデル:Gemma 4 26B-A4B IT、合計26Bパラメータ、各トークン約3.88Bアクティブ
- 重み:MLXアフィン4ビット、グループ64;8ビットルーター;4ビット共有およびルーティングされたエキスパート
- メモリ使用量:~2GB重み + 4K KVキャッシュ
- ストレージ:テキストモデル約14.3GB、オプションのビジョンパックで1.1GB追加
- ハードウェア要件:Apple Silicon Mac、最低8GB RAM
- システム要件:macOS 26、Metal 4、Swift 6.2以上
3つのハードウェアの実際のデコード速度
プロジェクトはREADMEで複数のApple Siliconデバイスのテスト結果を詳細に示しており、速度はハードウェアの強さに比例しています。SSDストリーミングメカニズムを通じて、8GBのエントリーレベルのMacBook Airでも5-6トークン/秒に近い速度を出すことができ、一般的な対話やテキスト生成のニーズに十分対応できます。
| ハードウェアモデル | RAM | デコード速度 (トークン/秒) | 備考 |
|---|---|---|---|
| M2 MacBook Air | 8 GB | 5.1 – 6.3 | プロジェクトが検証した最低構成 |
| M5 Pro | 24 GB | 31 – 35 | 最高速度 |
| M3 Max | 未明 | おそらく23(元のクリップのデモ数字、プロジェクトレベルで独立検証されていない可能性あり) | 元の短編数字 |
M5 Proの31-35トークン/秒の速度はプロジェクトレベルで検証されており、M3 Maxの23トークン/秒は元の短編からのもので、READMEではこの数字が独立して検証されていません。実際の速度はプロンプトの長さ、生成の長さ、ページキャッシュの状態に影響され、単純にハードウェアのレベルに線形に対応するものではありません。
二層アーキテクチャ:RAM内1.35GB + SSD 12.9GB
TurboFieldfareはmixture-of-expertsアーキテクチャを採用し、Gemma 4モデルの重みを2つのパイルに分割します。常駐部分の1.35GBには共有コアとFP16 KVキャッシュが含まれ、この部分はRAMにキャッシュされてGPUが直接アクセスします。残りの約12.9GBのルーティングされたエキスパートはSSDに置かれ、各トークンを生成する際に必要なエキスパートのブロックのみがストリーミングされます。
この設計は従来の考え方に直接挑戦します:もともと26Bモデルは52GBのVRAM + RAMが必要だと思われていましたが、TurboFieldfareはmixture-of-expertsのスパースアクティベーション特性を理解することで、RAM使用量を1.35GBに圧縮できることを証明しました。各トークンがSSDからエキスパートの重みを取得する必要がありますが、LFUエキスパートキャッシュとチャンクプリフィルの設計を通じて、実際の性能は依然として利用可能です。
6つの製品インターフェース
TurboFieldfareは単一のCLIだけでなく、異なる使用シナリオに応じた6つの独立した製品を提供しており、すべて同じ.gturboモデルディレクトリを共有していますが、同時に1つのmodel-owning製品のみを実行するべきです。
- TurboFieldfare:ランタイムとMetalカーネルを含むSwiftライブラリ
- TurboFieldfareMac:ネイティブMacアプリ、インストールと生成インターフェースを提供
- TurboFieldfareDecodeService:Macアプリのデコードサービスコンポーネント
- TurboFieldfareCLI:コマンドラインツール、インストラクションチャットとローカルコンプリーションをサポート
- TurboFieldfareServer:ループバックOpenAI互換サーバー、127.0.0.1:8080/v1をリッスン
- TurboFieldfareRepack:ストリーミングモデルインストーラーとインストール検証ツール
Hugging Faceストリーミングからモデルをインストール
初回実行時、Swift Package Managerはトークナイザーに必要なSwiftパッケージをダウンロードしてコンパイルします。Macアプリのダウンロードプロセスはストリーミングインストーラー設計を使用し、必要なバイト範囲のみを取得し、直接.gturbo形式に再パックします。これにより、完全なチェックポイントを先に保存してから処理する二重ストレージコストを回避します。インストールプロセスには約15GBのトラフィックがHugging Faceの範囲リクエストを通じて必要で、完了後、.gturboディレクトリは約14.3GBのディスクスペースを占有します。
ストリーミング設計のもう一つの利点はメモリの境界です:8GB RAMのマシンでも、インストールプロセスは全体のチェックポイントをRAMに読み込まず、範囲ごとにダウンロードしてマニフェストとファイルハッシュを検証します。Macアプリの画像サポートはビジョンタワーに属するオプションのコンパニオンパックで、インストール後に1.1GB追加され、M2またはそれ以降のApple Silicon Macが必要です。
ローカルOpenAI互換APIサーバー
TurboFieldfareにはOpenAI互換のサーバーが内蔵されており、127.0.0.1:8080/v1をリッスンし、Chat Completions、ストリーミング、ファンクションツール、シングルプレフィックスプロンプト再利用をサポートしています。クライアントは各ツールコールを自分で認証し実行する必要があります。サーバーはモデルのツールコールを生成するだけで、実際の実行はクライアントの責任です。ドキュメントは明確に警告しています:keep the server on loopback; it has no remote authentication or TLS、つまりサーバーにはリモート認証や暗号化がなく、ループバックでのみ使用すべきです。
llama.cpp / MLXとの違い
- TurboFieldfareはMLXやllama.cppのラッパーではなく、完全に独立したSwift + Metalランタイムです。
- Gemma 4 26B-A4Bという特定のモデルに特化しており、汎用フレームワークではありません。
- SSDストリーミングは.gturbo形式を介して、直接MetalカーネルがSSDデータを読み取ります。
- cb1/io/cb2の三段階パイプラインがディスク読み取りを共有エキスパートの計算の後に隠します。
- 16スロットLFUエキスパートキャッシュがキャッシュミスを処理し、連続ミスにはバウンデッドパラレルプリードを使用します。
- チャンクプリフィルは一度に最大128トークンを処理し、同じフェッチされたエキスパートが複数の行にサービスを提供できます。
使用上の注意事項
- プロジェクトは依然として独立した研究プロジェクトであり、著者はGoogleとは提携していない、スポンサーされていない、または支持されていないことを明確に述べています。
- モデルの重みはリポジトリに含まれておらず、Hugging Faceからダウンロードする必要があり、重みはGemmaの元のライセンス条項に従います。
- パッケージはarm64のみをサポートし、古いmacOSおよびMetalバージョンはサポートされていません。
- 推論を実行する前に、他のRAMを消費するアプリを閉じ、memory_pressure -Qで状態を確認するべきです。
- 同時に1つのTurboFieldfareアプリ、デコードサービス、CLI、サーバー、テスト、または他のローカルモデルプロセスのみを実行するべきです。
- テキスト出力のデフォルトの温度は0.2、Top-Kは64、Top-Pは0.95で、温度を0に設定すると決定論的なグリーディ出力が得られます。
観察と影響:ローカルLLMユーザーの視点
TurboFieldfareは、mixture-of-expertsアーキテクチャのスパースアクティベーション特性をうまく活用することで、大規模モデルのRAM要件を大幅に削減できることを証明しました。これにより、8GBのMacBook Airユーザーでも26BレベルのローカルLLMを利用できるようになりました。プロジェクトは依然として独立した研究的性質を持っていますが、オンデバイスAIコミュニティにとって技術的なデモンストレーションの価値が非常に高く、特に著者がMetalを使用して直接カーネルを記述し、MLXやllama.cppに依存しないアプローチは、MetalおよびSwiftエンジニアにとって参考になるでしょう。
プライバシー、低遅延、ゼロAPIコストを追求するローカルAIユーザーにとって、TurboFieldfareは2026年下半期の実用的な選択肢ですが、プロジェクトは依然として単一の開発者によって維持されていることに注意が必要です。プロジェクトはApache License 2.0でオープンソース化されており、将来的にTurboFieldfareが停滞しても、Gemma 4の.gturbo形式の考え方は他のローカル推論プロジェクトの参考になるでしょう。

