家庭用PCで125B MoEを秒速90トークンで回す怪物的推論エンジン『Strata』完全解読——クラウドGPU課金地獄を終わらせるエッジ推論の全貌

AI INFERENCE & HARDWARE TCO
「100B超のフロンティアモデルを実用速度で動かすには、月数十万円のクラウドAPI代を払うか、数百万円のサーバーを組むしかない」——この常識は完全に崩壊しました。1250億パラメータのMoEモデルを、実売8万円台のRTX 5070と自作PCで秒速90トークンで疾走させる推論エンジン「Strata」の登場は、AIインフラの投資採算性を根本から塗り替えます。
90.3 tok/s
RTX 5070 実測生成速度
Q2_0 短文チャット対話
1,844 tok/s
プロンプト処理(32K)
非同期PCIe先行フェッチ
約 1/10
年間TCO削減倍率
クラウドAPI課金比較
1. 125B MoEが自作PCで実用動作する構造的パラダイムシフト
⚡
総パラメータ125B(アクティブ約6B)のQwen3.8-Flash-Nextを、RTX 5070(12GB)やRTX 3090、32〜64GB RAM環境で毎秒90トークンで生成。人間が黙読する速度(秒速15〜20トークン)の約5倍で返答が流れます。
2. 51B N-gramオンディスク分離とKVストリーミングの数理
💾
行列積を行わないN-gramテーブル(約29GB)をNVMe SSDからmmap直接参照し、全24,576個のExpertから活性化頻度上位をVRAMへピン留め。128K〜262K長文時もKVキャッシュをメインRAMに退避してVRAMを死守します。
3. 投資回収期間はわずか2〜3ヶ月:API従量課金地獄の脱出
📉
Claude 3.5 SonnetやGPT-4oをコーディングや自律エージェントで酷使すると月額10万〜30万円が溶けます。PC本体投資約25万円+電気代月2,500円で262Kコンテキストを無制限に回せる経済的優位性は圧倒的です。

クラウドAPI課金 vs 自作PC×Strata:1年間の総保有コスト(TCO)比較

AIエージェントやコーディングアシスタントを本格的に業務・投資分析に組み込んでいる開発者にとって、最大の頭痛の種は「トークン従量課金の青天井」です。
128K〜200Kトークンの巨大なコンテキストを日次で数十回往復させれば、月間のAPI請求書はあっという間に数十万円に膨れ上がります。

ここで、月間5,000万トークン(プロンプト+生成合算)を日常的に消化する中規模開発チーム/アクティブ開発者を想定し、クラウドAPIとStrataローカル推論の1年間実質TCOを試算してみましょう。

評価項目 ① クラウドAPI(Sonnet/4o級) ② クラウドA100インスタンス ③ 自作PC × Strata(125B MoE)
初期ハードウェア投資 0 円 0 円 約 22万〜28万円(PC一式)
月額ランニングコスト 約 15万〜25万円(従量課金) 約 20万〜35万円(時間課金) 約 2,500円(家庭用電気代)
1年間の累積総コスト 約 180万〜300万円 約 240万〜420万円 約 25万〜31万円(本体込)
投資回収期間(損益分岐点) 回収不能(永久支払い) 回収不能(永久支払い) わずか 1.5〜2ヶ月で黒字化
レートリミット / 帯域制限 あり(TPM/RPM制限で停止) なし(GPU専有) 完全無制限(24時間連続稼働)
データプライバシー / 機密性 クラウド送信(規約順守必須) VPC内隔離 完全ローカル隔離(機密流出ゼロ)
💡 ハードウェアは「消費財」ではなく「キャッシュを生む生産資本」へ
これまでPCパーツへの支出は単なる「趣味のコスト」と見なされがちでした。しかし、Strataのような特化型推論エンジンによって125Bモデルがローカル完結した瞬間、RTX 5070や64GB DDR5メモリは「毎月20万円のAPI課金を相殺し、2ヶ月で原価償却を終える高利回りの設備投資」へと性質を変えます。

なぜStrataは動くのか? メモリの物理限界を突破した3つのアーキテクチャ

「125B MoEモデルは普通なら100GB以上のVRAMが必要なはずだ。なぜ12GBのグラボと64GBのメモリで秒速90トークンも出るのか?」
この疑問に対する答えは、ソフトウェア工学によるハードウェア階層の徹底的な使い分けにあります。

1. 51B N-gramテーブルの「SSDオンディスク直接参照」

Qwen3.8-Flash-Nextの最大の特徴は、先行トークンから次の単語を高速予測するための巨大な「N-gramルックアップテーブル」を内蔵していることです。このテーブルだけで約510億パラメータ(圧縮後でも約29GB)を占めます。
通常の推論フレームワーク(llama.cppやvLLM)は全重みをメモリにロードしようとするため、このテーブルだけでメインメモリが埋没します。

しかしStrataは、「N-gramテーブルは行列積を行わず、単なるインデックス検索(キー引き)しか発生しない」という計算特性に着目しました。
モデルファイルを2つに分割し、Transformer層(Shard 1)だけをメモリに配置。N-gramテーブル(Shard 2)はNVMe SSDに置いたまま、OSのmmapで数マイクロ秒で直接アクセスさせます。これにより、物理メモリ消費をまるごと29GB削減しました。

2. 全24,576個のExpert頻度順ピン留め(72% GPU完結)

MoE(Mixture-of-Experts)は、トークンごとに一部のExpert(本モデルでは512個中10個)しか活性化しません。しかし、どのExpertが呼ばれるか分からないため、通常は全ExpertをVRAMに載せるか、メインメモリからPCIe経由で都度転送してバスがパンクします。

Strataは、膨大な対話・コード・推論データセットを通過させた事前統計プロファイル(expert-profile.bin)を標準搭載しています。全24,576個のExpertの起動頻度を厳密に順位付けし、VRAMの空き容量1GBあたり約700個の最頻出ExpertをGPU上に常駐(ピン留め)させます。
RTX 5070(12GB)の場合でも、実際のExpertアクセスの約72%がGPU内でノーウェイトヒットします。残りの稀にしか呼ばれないExpertだけをメインメモリ上でCPU(AVX2/AVX-512最適化MMQカーネル)に計算させるか、PCIe先行ストリーミングで流し込みます。

3. 262K超長文でもVRAMを食いつぶさない「KVストリーミング」

128Kや262Kという超巨大なコンテキストを扱う際、最大の障壁となるのがKVキャッシュによるVRAMの占有です。数万〜数十万トークンの履歴を保持すると、KVキャッシュだけで十数GBのVRAMが消滅し、Expertを置く場所がなくなって速度が急落します。

Strataは、KVキャッシュ全体をメインRAM(トークンあたり約13.7KB)に逃がし、現在のアテンション演算で直接参照されるアクティブウィンドウ(--kv-resident 32768)だけをGPU VRAM上で循環管理する「KVストリーミング」を実装しました。
アテンション計算の精度はビット単位で完全一致させつつ、解放されたVRAMに大量のExpertを詰め込むことで、262Kトークンの極限長文でも生成速度60.3 tok/sを維持することに成功しています。

推奨ハードウェア構成と投資予算ガイド

Strataを実際に導入し、125B MoEを自作PCで回すための具体的なハードウェア要件と予算配分です。

PC構成ランク 主要パーツ(GPU / RAM / SSD) 導入予算目安 動作モデルと実測速度
① 最安エントリー
32GB PC既存流用
RTX 3060 12GB(中古3.5万)
32GB DDR4/DDR5
1TB NVMe SSD(Gen4)
約 12万〜15万円
(既存PCならGPU増設のみ)
Coder版 (IQ1_M)
生成: 45〜50 tok/s
SWE-bench 91.3%維持
② 最強コスパ推奨
新規自作の黄金構成
RTX 5070 12GB(実売約9万)
64GB DDR5-5200(約2.5万)
Ryzen 5 7600 + 2TB Gen4 SSD
約 22万〜25万円
(一式新規組立て)
IQ2_XS / Q2_0 全機能
生成: 74〜90 tok/s
プロンプト: 1,844 tok/s
③ ハイエンド・フラッグシップ
24GB VRAMで全Expert常駐
RTX 3090 24GB(中古10万)または
RTX 5080/5090
64GB〜128GB DDR5
約 30万〜45万円 IQ3_S / IQ3_XXS
生成: 100〜140 tok/s
完全未量子化同等の推論精度

エディタ即連携:Cursor / Clineからローカル125Bを叩く設定

Strataは起動すると自動的にポート8080でOpenAI互換・Anthropic互換のHTTPエンドポイントを公開します。
CursorやVS Code拡張のCline、Continueなど、普段お使いの開発環境からAPIキーの残高を気にせず即座に連携可能です。

# Cursor / Cline の設定画面で入力するパラメータ

Provider: OpenAI Compatible
Base URL: http://127.0.0.1:8080/v1
API Key: strata (ローカル検証のため任意の英数字でOK)
Model Name: qwen3.8-flash-next

# Anthropicプロトコルで接続する場合
Base URL: http://127.0.0.1:8080/v1
Model Name: claude-3-5-sonnet-20241022 (Strata内部でマッピング処理)

これにより、プライベートリポジトリのソースコードや企業の社外秘資料をクラウドサーバーに1文字も送信することなく、完全ローカルの閉域網でAI自律エージェントを24時間体制で稼働させることができます。

総括:半導体・AIインフラ市場への投資的インプリケーション

Strataが実証した「125B MoEのデスクトップ高速推論」は、単なるギークの自作PCネタにとどまらず、今後のAIハードウェア投資市場に3つの重大な地殻変動を示唆しています。

  1. ミドルレンジGPU(RTX 5070/5080)の実質的AIインフラ化
    ゲーミング市場向けと位置付けられていた12GB〜16GB VRAMカードが、ソフトウェアのメモリ最適化によって「エンタープライズ級推論アクセラレータ」へと昇格しました。中古市場におけるRTX 3090(24GB)の価格高止まりや、RTX 5070への需要シフトが加速します。
  2. DDR5メモリ大容量化と高速PCIe Gen4/Gen5 SSDの需要急伸
    GPUだけでなく、64GB/128GBのメインメモリと7,000MB/s超の高速NVMe SSDが推論パイプラインの不可欠なコンポーネントとなったことで、メモリ・ストレージ半導体メーカー(SKハイニックス、Micron、Samsung)のエッジ向け実需を押し上げます。
  3. クラウドハイパースケーラーの推論課金プレミアムの縮小
    「API従量課金」で暴利を得ていたクラウド事業者に対し、オンプレミス・ローカル推論のTCO優位性が劇的に拡大しました。機密データを抱えるエンタープライズや自律型AIエージェントの開発拠点は、確実にクラウド一極集中からローカル分散ハイブリッドへと回帰していきます。

「AIを動かすには莫大なクラウド課金が必要だ」という固定観念を捨て、手元のハードウェア資産を最大限に活用できる者だけが、2026年以降のAI激変期において圧倒的なコスト競争力を握ることになります。