「巨大なAIモデルを、普通のゲーミングPCで動かせる」
そんな触れ込みで気になったのが Strata です。
今回、RTX 5070 Ti 16GBとRAM 48GBのPCで、Qwen3.8-Flash-Next IQ2_XSを実際に導入し、短文生成から64K Context、Thinking、コードレビュー、技術記事作成まで試してみました。
結論から言うと、
本当に動きました。しかも64K ContextやThinkingまで、十分現実的な速度で利用できます。
ここだけを見るとかなり驚きです。
ただし、実際にコードレビューや技術記事作成まで試してみると、
巨大モデルだから27B級より必ず賢い、という結果にはなりませんでした。
むしろ今回の検証では、以前から試していたQwen3.8-27Bの完成度の高さもかなり目立つ結果になりました。
この記事では、
- Qwen3.8-Flash-Nextはどの程度大きなモデルなのか
- 導入に必要だったストレージ容量
- RTX 5070 Ti 16GB + RAM 48GBで本当に動くのか
- 実際の生成速度
- 32K / 64K Context
- Thinking Off / Low / Medium
- 長文コードレビュー
- 大量情報を使った技術記事作成
- Qwen3.8-27B / Bonsai 2との比較
まで、実測をベースにまとめます。
- 今回使ったQwen3.8-Flash-Nextは125B級の巨大モデル
- 検証環境
- モデル本体だけで約63GB。ストレージ容量にも注意
- RTX 5070 Ti 16GB + RAM 48GBで本当に起動できた
- 短文生成:起動直後は42.2 tok/s
- Expert cacheが温まると速度が上昇
- 100 tok/sも出た。ただし通常性能として扱うのは不適切
- 新規チャット5本では平均約62.2 tok/s
- 長文コードレビューも70 tok/s前後
- Medium Thinkingは32Kで24,000 tokensを使い切った
- 64K Contextへ変更
- 64K / Mediumは自然終了した
- Low Thinkingはかなり実用的だった
- コード課題ではQwen3.8-27Bの方が高評価
- コード以外なら大型モデルが有利なのか?
- 大量情報の記事化では3モデルとも非常に高品質
- 記事作成時の実測速度
- 大規模モデルの圧勝にはならなかった
- なぜ125B級なのに27Bへ勝てない?
- IQ3_Sは今回は試さない
- GPUよりRAMの方が厳しい
- ではStrataは実用的なのか?
- 用途別の印象
- 今回一番印象が変わった点
- まとめ
今回使ったQwen3.8-Flash-Nextは125B級の巨大モデル
今回使用したQwen3.8-Flash-Nextは、メインモデル全体では125B、つまり約1,250億パラメータを持つ非常に大きなモデルです。
ただし、125Bすべてを1トークン生成するたびに動かすわけではありません。
処理する内容に応じて必要な部分だけを選んで使う仕組みになっており、1トークンあたり実際に使われるのは約6Bパラメータです。
さらに51Bのn-gram embeddingと4BのMTPを持つ構成になっています。
つまり、単純な「125B全部を毎回GPUで計算するモデル」とはかなり性格が違います。
今回Strataで使用したのは、このQwen3.8-Flash-Nextをかなり強く圧縮したIQ2_XS量子化版です。
検証環境
| 項目 | 環境 |
|---|---|
| OS | Windows 11 Pro |
| CPU | Intel Core i5-12600K |
| CPU構成 | 10コア / 16スレッド |
| GPU | NVIDIA GeForce RTX 5070 Ti |
| VRAM | 16,303 MiB |
| RAM | 48GB |
| RAM実動作 | DDR4-2667 |
| モデル保存先 | F: SATA SSD |
| Strata | 0.1.38 |
| モデル | Qwen3.8-Flash-Next IQ2_XS |
RAMは少し特殊で、
- 8GB DDR4-2666
- 16GB DDR4-3600
- 8GB DDR4-2666
- 16GB DDR4-3600
の合計48GB。
混在しているため、実際には全DIMMが2667で動作しています。
これがStrataの速度へどの程度影響しているかは、RAM速度だけを変更した比較を行っていないため分かりません。
モデル本体だけで約63GB。ストレージ容量にも注意
今回使用したIQ2_XSは2分割GGUFでした。
| ファイル | サイズ |
|---|---|
| 00001-of-00002 | 36.532GB |
| 00002-of-00002 | 26.822GB |
| 合計 | 約63.35GB |
最初、モデルを保存するF:ドライブの空き容量は約66GBしかありませんでした。
そのままではかなり危険なので、使わなくなったローカルLLMをHDDへ移動し、ゲームやゴミ箱も整理。
モデル導入前に約145GBまで空きを増やしました。
Strataを試す場合は、VRAMやRAMだけでなく、モデル本体だけで60GB以上必要になる点にも注意が必要です。
RTX 5070 Ti 16GB + RAM 48GBで本当に起動できた
StrataのPCチェックでは、IQ2_XSはRAM約48GBを要求する判定でした。
実際に起動すると、かなりギリギリまでメモリを使います。
32K Context時
| 項目 | 実測 |
|---|---|
| VRAM | 約15.6~15.7GB |
| Experts cached | 6,833 |
| Expert cache | 約9.2GB |
| System RAM | 約42~43.5GB / 48GB |
64K Context時
| 項目 | 実測 |
|---|---|
| VRAM | 約15.5GB |
| Experts cached | 6,334 |
| Expert cache | 約8.5GB |
| System RAM | 約42.6~45GB / 48GB |
Expert cache 8.5GB=総VRAM 8.5GBではない
ここは非常に誤解しやすいところです。
64K時には、
Expert cache:約8.5GB
と表示されます。
しかし、これは、
「StrataはVRAM 8.5GBで動く」
という意味ではありません。
実際の総VRAM使用量は約15.5GB / 16GBです。
Expert cacheはVRAM使用量の一部分なので、必要VRAMを考える際には総使用量を見る必要があります。
短文生成:起動直後は42.2 tok/s
まずThinking Offで、簡単な日本語説明を生成しました。
| 項目 | 結果 |
|---|---|
| Prompt | 34 tokens |
| Output | 75 tokens |
| Decode | 42.2 tok/s |
| Prefill | 43 tok/s |
| Expert hit rate | 75.3% |
| Duration | 2.6秒 |
これだけでも普通に会話できる速度です。
ただし、この時点ではモデル起動直後に近い状態でした。
Expert cacheが温まると速度が上昇
同じ質問や近い質問を何回か実行すると、速度がかなり変化しました。
| Decode | Expert hit rate |
|---|---|
| 51.7 tok/s | 86.8% |
| 71.0 tok/s | 93.2% |
| 77.6 tok/s | 95.1% |
| 85.7 tok/s | 96.0% |
Expert cacheのHit rateが上がるにつれて、生成速度も上昇しました。
100 tok/sも出た。ただし通常性能として扱うのは不適切
同一チャット内で同じ質問を行ったケースでは、
- Prompt:140
- Reused:104
- Output:73
- Decode:100.4 tok/s
- Duration:1.3秒
まで出ました。
一見すると、
Strataは100 tok/s出る
と書きたくなります。
しかし、この結果にはPrompt reuseが含まれています。
新規チャットと条件が違うため、通常性能として扱うのは適切ではありません。
新規チャット5本では平均約62.2 tok/s
より現実的な性能を見るため、
- 毎回New Chat
- 内容の異なる質問
- Prompt reuse 0
という条件で5回測定しました。
| 回 | Decode |
|---|---|
| 1 | 59.6 tok/s |
| 2 | 62.7 tok/s |
| 3 | 64.3 tok/s |
| 4 | 61.0 tok/s |
| 5 | 63.5 tok/s |
平均は、
約62.2 tok/s
でした。
今回の環境では、ウォームアップ後の新規チャットなら、60~65 tok/s前後が一つの目安になりそうです。
もちろん、Prompt内容によって速度は変化します。
長文コードレビューも70 tok/s前後
次はWPF / C#の長めのコードレビューを行いました。
32K Context / Thinking Off
| 項目 | 結果 |
|---|---|
| Prompt | 1,201 tokens |
| Output | 3,500 tokens |
| Decode | 71.6 tok/s |
| Prefill | 792 tok/s |
| Hit rate | 84.7% |
| Duration | 50.4秒 |
| Status | Max tokens |
3,500 tokensのコードレビューを約50秒で生成しているので、速度自体はかなり速いです。
ただしMax tokensへ到達し、回答は途中で終了しました。
内容にも、
- コンパイル不能になり得るコード
- Dispatcher周辺のテスト設計ミス
- CancellationTokenSourceの競合
- 不完全なテスト
などが残りました。
Medium Thinkingは32Kで24,000 tokensを使い切った
ThinkingをMediumにし、より複雑なWPF設計課題を与えました。
| 項目 | 結果 |
|---|---|
| Context | 32,768 |
| Thinking | Medium |
| Prompt | 3,172 tokens |
| Max output | 24,000 |
| Output | 24,000 tokens |
| Decode | 69.7 tok/s |
| Prefill | 1,340 tok/s |
| Duration | 346.7秒 |
| Context fill | 約27K / 32K |
| Status | Max tokens |
約5分47秒生成し続けましたが、最終回答へ到達する前に24,000 tokensを使い切りました。
Thinking内容を見ると、
- Commandにガードを置くか
- ViewModelに置くか
- 両方にするか
- テスト設計を変更するか
- やはり戻すか
などを何度も再検討しています。
この時点では、Medium Thinkingは実務では重すぎるのではないかと感じました。
64K Contextへ変更
そこでContextを、
32,768 → 65,536
へ変更しました。
ただし、ここで重要なのは、32K時の停止理由がContext上限ではなかったことです。
Context fillは約27K / 32Kで、直接の停止理由はMax output 24,000への到達です。
さらに64K時にはMax outputも40,000へ変更しています。
そのため、
64Kにしたから問題が解決した
と断定することはできません。
64K / Mediumは自然終了した
Medium 1回目
| 項目 | 結果 |
|---|---|
| Prompt | 3,172 |
| Reused | 0 |
| Output | 13,976 |
| Decode | 61.2 tok/s |
| Prefill | 1,127 tok/s |
| Duration | 約3分51秒 |
| Context fill | 約17K / 64K |
| Status | Done |
今度は最終回答まで自然終了しました。
しかし回答内容には、
- CanExecuteを迂回できる経路
- CancellationTokenSource周辺の問題
- デッドロックするテスト
- 自己レビューでの見逃し
などが残りました。
同じ設定でも2回目は約7分28秒
同じPrompt、同じSeedで再実行しました。
| 項目 | 結果 |
|---|---|
| Prompt | 3,172 |
| Reused | 3,167 |
| Output | 24,196 |
| Decode | 54.0 tok/s |
| Duration | 約7分28秒 |
| Status | Done |
1回目より約10,000 tokens多く生成しました。
一部のミスは改善されたものの、新しい問題も残りました。
つまり今回の結果からは、
長く考えれば必ず正確になるわけではない
ことも分かりました。
Low Thinkingはかなり実用的だった
次にThinkingをLowへ変更しました。
| 項目 | 結果 |
|---|---|
| Prompt | 3,202 |
| Output | 9,750 |
| Decode | 64.3 tok/s |
| Prefill | 1,569 tok/s |
| Duration | 約2分34秒 |
| Status | Done |
Mediumよりかなり短時間で完了しました。
主要な問題である、
- enum保存互換
- System.Text.Json
- async void
- 多重実行
- Cancellation
- CanExecuteChanged
- MVVM境界
などは認識できています。
一方、
- Review以外からResult生成可能
- 保存禁止とコードが一致しない
- Task.Delay(10)依存テスト
- KeyDown / PreviewKeyDown
- 不完全なデフォルト実装
- 自己レビューの甘さ
などが残りました。
コード課題ではQwen3.8-27Bの方が高評価
以前検証したWPF設計課題と近い基準で評価すると、暫定的には以下の結果です。
| モデル | 独自評価 |
|---|---|
| Qwen3.8-27B | 約8.2 / 10 |
| Strata Medium | 約7.3 / 10 |
| Strata Low | 約6.9 / 10 |
| Bonsai 2 27B | 約6.2 / 10 |
| Qwen3-14B | 約3.0 / 10 |
これは一般的なAIベンチマークではありません。
あくまで今回使用したWPF課題に対する独自評価です。
それでも、
巨大モデルなら27Bより当然高性能
とはならなかったのが興味深いところです。
コード以外なら大型モデルが有利なのか?
そこで、大規模モデルが有利になりそうな、
大量の検証ログ・古いメモ・訂正情報・比較条件を整理して技術記事を書く
というテストも行いました。
これは普段ブログ記事を作成するときの作業にかなり近い内容です。
資料には意図的に、
- 100.4 tok/sという特殊条件の結果
- Expert cache 8.5GB
- 32K / 64K
- Prompt reuseあり / なし
- 古い暫定評価
- 後から訂正した内容
- Qwen / Bonsaiとの条件違い
などを混在させました。
大量情報の記事化では3モデルとも非常に高品質
100点満点で採点した結果、
| モデル | 評価 |
|---|---|
| Qwen3.8-27B | 96 / 100 |
| Strata Medium | 95 / 100 |
| Strata Low | 94 / 100 |
となりました。
コード課題ではQwen3.8-27Bとの差がありましたが、大量情報を整理して記事へ変換する課題ではほぼ互角です。
Strata Lowでも、
- 100.4 tok/sを通常値として扱わない
- 8.5GBを総VRAMと誤認しない
- 32K停止をContext不足と断定しない
- Qwen / Bonsaiとの速度を同条件扱いしない
- DDR4-2667を速度低下の原因と断定しない
- 独自評価点を一般ベンチ扱いしない
といった判断はかなり正確でした。
記事作成時の実測速度
| 設定 | Prompt | Prefill | Output | Decode | Request total |
|---|---|---|---|---|---|
| Strata Low | 4,108 | 207 tok/s | 5,313 | 47.2 tok/s | 132.5秒 |
| Strata Medium | 4,078 | 1,338 tok/s | 5,573 | 53.3 tok/s | 107.6秒 |
| Qwen3.8-27B | - | - | 6,762 | 約49.16 tok/s | 約2分17秒 |
今回の記事作成では、Mediumの方がLowより短時間で終了しました。
ただし、これは、
Mediumの方がLowより高速
という意味ではありません。
StrataのMonitorに表示されるDurationは、モデルをRAMやVRAMへ読み込む起動時間を含まず、基本的にPrompt処理(Prefill)+回答生成(Decode)のRequest時間です。
実際にLowを計算すると、
Prompt 4,108 ÷ 207 tok/s
≒ 19.8秒
Output 5,313 ÷ 47.2 tok/s
≒ 112.6秒
合計
≒ 132.4秒
Monitor上の132.5秒とほぼ一致します。
Mediumも、
Prompt 4,078 ÷ 1,338 tok/s
≒ 3.0秒
Output 5,573 ÷ 53.3 tok/s
≒ 104.6秒
合計
≒ 107.6秒
となります。
つまりLowとMediumの約25秒の差のうち、かなりの部分はPrefill速度の差です。
Lowでは207 tok/sだったのに対し、Lowの直後に実行したMediumでは1,338 tok/sまで上昇しています。
Prompt reuseは両方0なので、少なくともPrompt reuseによる差ではありません。
Lowを先に実行したことで、OSキャッシュやStrata内部の何らかの状態が温まった可能性はありますが、今回その原因までは切り分けていません。
したがって、
LowとMediumの速度優劣を、この2回のRequest totalだけから判断することはできません。
というのが正確です。
大規模モデルの圧勝にはならなかった
今回、大規模モデル向けと思われる情報統合課題まで行いました。
結果は、
- Qwen3.8-27B:96
- Strata Medium:95
- Strata Low:94
です。
Strataは非常に良かったものの、27Bを明確には上回りませんでした。
今回の検証範囲では、
一般的な用途なら、高品質な27B級でも十分なのでは?
という印象がかなり強くなりました。
なぜ125B級なのに27Bへ勝てない?
ここは単純にモデルサイズだけでは説明できません。
今回のStrataでは、
IQ2_XS
というかなり強い量子化版を使用しています。
一方、Qwen3.8-27Bは、
UD-IQ3_S
です。
そのため今回の比較は、単純な、
125B vs 27B
ではありません。
実際には、
125B級の巨大モデルをかなり強く圧縮したIQ2_XS
vs
27Bモデルを比較的高い精度で保持したIQ3_S
という側面もあります。
さらに、
- モデル自体の学習特性
- Instruction tuning
- Thinkingの癖
- 処理ごとに使う部分を選ぶモデル構造
- 量子化耐性
- 使用runtime
なども影響します。
今回だけで、
IQ2_XSだから27Bに負けた
と断定することはできません。
ただ、
大きいモデルであっても、強い量子化やモデル特性によって、実用性能が27B級を明確に上回るとは限らない
ことは今回の実測から感じました。
IQ3_Sは今回は試さない
StrataにはIQ2_XSより高品質な量子化版もあります。
IQ3_Sも興味はありますが、今回の48GB RAM環境ではさらに要求が厳しくなるため、追加検証は行わないことにしました。
そのため、
より高品質なStrata量子化なら結果が変わる可能性
は残っています。
この記事の評価対象は、あくまで今回実機で検証したQwen3.8-Flash-Next IQ2_XSです。
GPUよりRAMの方が厳しい
Strataを試していて強く感じたのがここです。
GPUは16GBでも動きました。
しかしSystem RAMは、
42~45GB / 48GB
程度まで使用します。
かなりギリギリです。
そのため、
48GBなら余裕
とは到底言えません。
ローカル巨大モデルを試す場合、GPUだけでなく、System RAM容量も非常に重要です。
ではStrataは実用的なのか?
今回の結論としては、
技術的にはかなり実用的です。
RTX 5070 Ti 16GBで、
- 約63GBのIQ2_XSモデル
- 64K Context
- Low / Medium Thinking
- 50~60 tok/s級の生成
- 数千~2万tokens以上の長文生成
まで実際に動きました。
これはかなり面白いです。
しかし、
普段使いで27Bから乗り換えるべきか?
となると、今のところ私はそうは感じませんでした。
用途別の印象
| 用途 | 現時点の印象 |
|---|---|
| 普通のチャット | 27Bで十分 |
| C# / WPFコードレビュー | Qwen3.8-27Bが優勢 |
| 設計相談 | 27Bでもかなり強い |
| 技術記事作成 | 27B / Strataほぼ互角 |
| 大量ログ整理 | Strataはかなり強い |
| 非常に長いContext | Strataを試す意味あり |
| 巨大モデルを16GB GPUで動かしたい | Strataは非常に面白い |
今回一番印象が変わった点
検証前は、
巨大モデルが16GB GPUで動くなら、27Bよりかなり強いのでは?
と思っていました。
しかし実際に試してみると、
27Bクラスが想像以上に強い
という方が強く印象に残りました。
Qwen3.8-27Bは、
- コード品質が高い
- 情報整理も非常に強い
- 約49 tok/s出る
- VRAM約14.4GB
- 65K Contextも使える
というバランスの良さがあります。
一方Strataは、
125B級の巨大モデルを普通のゲーミングPCで現実的な速度で動かす技術
として非常に面白い存在でした。
まとめ
今回、RTX 5070 Ti 16GB + RAM 48GB環境でStrataを検証しました。
主な結果は、
- Qwen3.8-Flash-Nextはメインモデル125B、1トークンあたり約6Bを使用する構造
- IQ2_XSのGGUFは約63.35GB
- 32K / 64K Contextとも動作
- VRAM約15.5GB
- System RAM約42~45GB
- 新規短文平均約62 tok/s
- 64K Low Thinking:約2分34秒
- 64K Medium:約3分51秒~7分28秒
- 長文記事作成も約2分前後
- 技術記事作成では非常に高品質
- コード品質ではQwen3.8-27Bに届かなかった
- 大量情報整理では27Bとの差がほぼ無くなった
という結果になりました。
「巨大モデルをゲーミングPCで動かせる」という点は、本当に確認できました。
しかし同時に、
モデルサイズがそのまま実用性能にはならない
ことも確認できました。
今回のIQ2_XSでは、普段使いならQwen3.8-27Bの方が扱いやすく、性能面でも十分強いという印象です。
それでも、
16GB VRAMのGPUで125B級のモデルを64K Context + Thinkingまで実用速度で動かせた
というStrataの技術的な面白さはかなり大きいです。
より高品質な量子化を使える環境なら結果が変わる可能性もありますが、今回の48GB RAM環境ではここまでとします。
少なくとも、
「巨大モデルを動かすには数十GBのVRAMが必須」という感覚は、かなり変わりつつある
と感じる検証でした。
そして普段使いという観点では、
良く調整された27B級は、まだかなり強い。
これが今回、一番大きな発見でした。


コメント