Strataで巨大LLMをRTX 5070 Ti 16GBで動かす|64K Context・Thinking・27Bモデル比較まで実機検証

「巨大なAIモデルを、普通のゲーミングPCで動かせる」

そんな触れ込みで気になったのが Strata です。

今回、RTX 5070 Ti 16GBとRAM 48GBのPCで、Qwen3.8-Flash-Next IQ2_XSを実際に導入し、短文生成から64K Context、Thinking、コードレビュー、技術記事作成まで試してみました。

結論から言うと、

本当に動きました。しかも64K ContextやThinkingまで、十分現実的な速度で利用できます。

ここだけを見るとかなり驚きです。

ただし、実際にコードレビューや技術記事作成まで試してみると、

巨大モデルだから27B級より必ず賢い、という結果にはなりませんでした。

むしろ今回の検証では、以前から試していたQwen3.8-27Bの完成度の高さもかなり目立つ結果になりました。

この記事では、

  • Qwen3.8-Flash-Nextはどの程度大きなモデルなのか
  • 導入に必要だったストレージ容量
  • RTX 5070 Ti 16GB + RAM 48GBで本当に動くのか
  • 実際の生成速度
  • 32K / 64K Context
  • Thinking Off / Low / Medium
  • 長文コードレビュー
  • 大量情報を使った技術記事作成
  • Qwen3.8-27B / Bonsai 2との比較

まで、実測をベースにまとめます。

スポンサーリンク

今回使ったQwen3.8-Flash-Nextは125B級の巨大モデル

今回使用したQwen3.8-Flash-Nextは、メインモデル全体では125B、つまり約1,250億パラメータを持つ非常に大きなモデルです。

ただし、125Bすべてを1トークン生成するたびに動かすわけではありません。

処理する内容に応じて必要な部分だけを選んで使う仕組みになっており、1トークンあたり実際に使われるのは約6Bパラメータです。

さらに51Bのn-gram embeddingと4BのMTPを持つ構成になっています。

つまり、単純な「125B全部を毎回GPUで計算するモデル」とはかなり性格が違います。

今回Strataで使用したのは、このQwen3.8-Flash-Nextをかなり強く圧縮したIQ2_XS量子化版です。

スポンサーリンク

検証環境

項目 環境
OS Windows 11 Pro
CPU Intel Core i5-12600K
CPU構成 10コア / 16スレッド
GPU NVIDIA GeForce RTX 5070 Ti
VRAM 16,303 MiB
RAM 48GB
RAM実動作 DDR4-2667
モデル保存先 F: SATA SSD
Strata 0.1.38
モデル Qwen3.8-Flash-Next IQ2_XS

RAMは少し特殊で、

  • 8GB DDR4-2666
  • 16GB DDR4-3600
  • 8GB DDR4-2666
  • 16GB DDR4-3600

の合計48GB。

混在しているため、実際には全DIMMが2667で動作しています。

これがStrataの速度へどの程度影響しているかは、RAM速度だけを変更した比較を行っていないため分かりません。

スポンサーリンク

モデル本体だけで約63GB。ストレージ容量にも注意

今回使用したIQ2_XSは2分割GGUFでした。

ファイル サイズ
00001-of-00002 36.532GB
00002-of-00002 26.822GB
合計 約63.35GB

最初、モデルを保存するF:ドライブの空き容量は約66GBしかありませんでした。

そのままではかなり危険なので、使わなくなったローカルLLMをHDDへ移動し、ゲームやゴミ箱も整理。

モデル導入前に約145GBまで空きを増やしました。

Strataを試す場合は、VRAMやRAMだけでなく、モデル本体だけで60GB以上必要になる点にも注意が必要です。

スポンサーリンク

RTX 5070 Ti 16GB + RAM 48GBで本当に起動できた

StrataのPCチェックでは、IQ2_XSはRAM約48GBを要求する判定でした。

実際に起動すると、かなりギリギリまでメモリを使います。

32K Context時

項目 実測
VRAM 約15.6~15.7GB
Experts cached 6,833
Expert cache 約9.2GB
System RAM 約42~43.5GB / 48GB

64K Context時

項目 実測
VRAM 約15.5GB
Experts cached 6,334
Expert cache 約8.5GB
System RAM 約42.6~45GB / 48GB

Expert cache 8.5GB=総VRAM 8.5GBではない

ここは非常に誤解しやすいところです。

64K時には、

Expert cache:約8.5GB

と表示されます。

しかし、これは、

「StrataはVRAM 8.5GBで動く」

という意味ではありません。

実際の総VRAM使用量は約15.5GB / 16GBです。

Expert cacheはVRAM使用量の一部分なので、必要VRAMを考える際には総使用量を見る必要があります。

スポンサーリンク

短文生成:起動直後は42.2 tok/s

まずThinking Offで、簡単な日本語説明を生成しました。

項目 結果
Prompt 34 tokens
Output 75 tokens
Decode 42.2 tok/s
Prefill 43 tok/s
Expert hit rate 75.3%
Duration 2.6秒

これだけでも普通に会話できる速度です。

ただし、この時点ではモデル起動直後に近い状態でした。

スポンサーリンク

Expert cacheが温まると速度が上昇

同じ質問や近い質問を何回か実行すると、速度がかなり変化しました。

Decode Expert hit rate
51.7 tok/s 86.8%
71.0 tok/s 93.2%
77.6 tok/s 95.1%
85.7 tok/s 96.0%

Expert cacheのHit rateが上がるにつれて、生成速度も上昇しました。

スポンサーリンク

100 tok/sも出た。ただし通常性能として扱うのは不適切

同一チャット内で同じ質問を行ったケースでは、

  • Prompt:140
  • Reused:104
  • Output:73
  • Decode:100.4 tok/s
  • Duration:1.3秒

まで出ました。

一見すると、

Strataは100 tok/s出る

と書きたくなります。

しかし、この結果にはPrompt reuseが含まれています。

新規チャットと条件が違うため、通常性能として扱うのは適切ではありません。

スポンサーリンク

新規チャット5本では平均約62.2 tok/s

より現実的な性能を見るため、

  • 毎回New Chat
  • 内容の異なる質問
  • Prompt reuse 0

という条件で5回測定しました。

回 Decode
1 59.6 tok/s
2 62.7 tok/s
3 64.3 tok/s
4 61.0 tok/s
5 63.5 tok/s

平均は、

約62.2 tok/s

でした。

今回の環境では、ウォームアップ後の新規チャットなら、60~65 tok/s前後が一つの目安になりそうです。

もちろん、Prompt内容によって速度は変化します。

スポンサーリンク

長文コードレビューも70 tok/s前後

次はWPF / C#の長めのコードレビューを行いました。

32K Context / Thinking Off

項目 結果
Prompt 1,201 tokens
Output 3,500 tokens
Decode 71.6 tok/s
Prefill 792 tok/s
Hit rate 84.7%
Duration 50.4秒
Status Max tokens

3,500 tokensのコードレビューを約50秒で生成しているので、速度自体はかなり速いです。

ただしMax tokensへ到達し、回答は途中で終了しました。

内容にも、

  • コンパイル不能になり得るコード
  • Dispatcher周辺のテスト設計ミス
  • CancellationTokenSourceの競合
  • 不完全なテスト

などが残りました。

スポンサーリンク

Medium Thinkingは32Kで24,000 tokensを使い切った

ThinkingをMediumにし、より複雑なWPF設計課題を与えました。

項目 結果
Context 32,768
Thinking Medium
Prompt 3,172 tokens
Max output 24,000
Output 24,000 tokens
Decode 69.7 tok/s
Prefill 1,340 tok/s
Duration 346.7秒
Context fill 約27K / 32K
Status Max tokens

約5分47秒生成し続けましたが、最終回答へ到達する前に24,000 tokensを使い切りました。

Thinking内容を見ると、

  • Commandにガードを置くか
  • ViewModelに置くか
  • 両方にするか
  • テスト設計を変更するか
  • やはり戻すか

などを何度も再検討しています。

この時点では、Medium Thinkingは実務では重すぎるのではないかと感じました。

スポンサーリンク

64K Contextへ変更

そこでContextを、

32,768 → 65,536

へ変更しました。

ただし、ここで重要なのは、32K時の停止理由がContext上限ではなかったことです。

Context fillは約27K / 32Kで、直接の停止理由はMax output 24,000への到達です。

さらに64K時にはMax outputも40,000へ変更しています。

そのため、

64Kにしたから問題が解決した

と断定することはできません。

スポンサーリンク

64K / Mediumは自然終了した

Medium 1回目

項目 結果
Prompt 3,172
Reused 0
Output 13,976
Decode 61.2 tok/s
Prefill 1,127 tok/s
Duration 約3分51秒
Context fill 約17K / 64K
Status Done

今度は最終回答まで自然終了しました。

しかし回答内容には、

  • CanExecuteを迂回できる経路
  • CancellationTokenSource周辺の問題
  • デッドロックするテスト
  • 自己レビューでの見逃し

などが残りました。

同じ設定でも2回目は約7分28秒

同じPrompt、同じSeedで再実行しました。

項目 結果
Prompt 3,172
Reused 3,167
Output 24,196
Decode 54.0 tok/s
Duration 約7分28秒
Status Done

1回目より約10,000 tokens多く生成しました。

一部のミスは改善されたものの、新しい問題も残りました。

つまり今回の結果からは、

長く考えれば必ず正確になるわけではない

ことも分かりました。

スポンサーリンク

Low Thinkingはかなり実用的だった

次にThinkingをLowへ変更しました。

項目 結果
Prompt 3,202
Output 9,750
Decode 64.3 tok/s
Prefill 1,569 tok/s
Duration 約2分34秒
Status Done

Mediumよりかなり短時間で完了しました。

主要な問題である、

  • enum保存互換
  • System.Text.Json
  • async void
  • 多重実行
  • Cancellation
  • CanExecuteChanged
  • MVVM境界

などは認識できています。

一方、

  • Review以外からResult生成可能
  • 保存禁止とコードが一致しない
  • Task.Delay(10)依存テスト
  • KeyDown / PreviewKeyDown
  • 不完全なデフォルト実装
  • 自己レビューの甘さ

などが残りました。

スポンサーリンク

コード課題ではQwen3.8-27Bの方が高評価

以前検証したWPF設計課題と近い基準で評価すると、暫定的には以下の結果です。

モデル 独自評価
Qwen3.8-27B 約8.2 / 10
Strata Medium 約7.3 / 10
Strata Low 約6.9 / 10
Bonsai 2 27B 約6.2 / 10
Qwen3-14B 約3.0 / 10

これは一般的なAIベンチマークではありません。

あくまで今回使用したWPF課題に対する独自評価です。

それでも、

巨大モデルなら27Bより当然高性能

とはならなかったのが興味深いところです。

スポンサーリンク

コード以外なら大型モデルが有利なのか?

そこで、大規模モデルが有利になりそうな、

大量の検証ログ・古いメモ・訂正情報・比較条件を整理して技術記事を書く

というテストも行いました。

これは普段ブログ記事を作成するときの作業にかなり近い内容です。

資料には意図的に、

  • 100.4 tok/sという特殊条件の結果
  • Expert cache 8.5GB
  • 32K / 64K
  • Prompt reuseあり / なし
  • 古い暫定評価
  • 後から訂正した内容
  • Qwen / Bonsaiとの条件違い

などを混在させました。

スポンサーリンク

大量情報の記事化では3モデルとも非常に高品質

100点満点で採点した結果、

モデル 評価
Qwen3.8-27B 96 / 100
Strata Medium 95 / 100
Strata Low 94 / 100

となりました。

コード課題ではQwen3.8-27Bとの差がありましたが、大量情報を整理して記事へ変換する課題ではほぼ互角です。

Strata Lowでも、

  • 100.4 tok/sを通常値として扱わない
  • 8.5GBを総VRAMと誤認しない
  • 32K停止をContext不足と断定しない
  • Qwen / Bonsaiとの速度を同条件扱いしない
  • DDR4-2667を速度低下の原因と断定しない
  • 独自評価点を一般ベンチ扱いしない

といった判断はかなり正確でした。

スポンサーリンク

記事作成時の実測速度

設定 Prompt Prefill Output Decode Request total
Strata Low 4,108 207 tok/s 5,313 47.2 tok/s 132.5秒
Strata Medium 4,078 1,338 tok/s 5,573 53.3 tok/s 107.6秒
Qwen3.8-27B - - 6,762 約49.16 tok/s 約2分17秒

今回の記事作成では、Mediumの方がLowより短時間で終了しました。

ただし、これは、

Mediumの方がLowより高速

という意味ではありません。

StrataのMonitorに表示されるDurationは、モデルをRAMやVRAMへ読み込む起動時間を含まず、基本的にPrompt処理(Prefill)+回答生成(Decode)のRequest時間です。

実際にLowを計算すると、

Prompt 4,108 ÷ 207 tok/s
≒ 19.8秒

Output 5,313 ÷ 47.2 tok/s
≒ 112.6秒

合計
≒ 132.4秒

Monitor上の132.5秒とほぼ一致します。

Mediumも、

Prompt 4,078 ÷ 1,338 tok/s
≒ 3.0秒

Output 5,573 ÷ 53.3 tok/s
≒ 104.6秒

合計
≒ 107.6秒

となります。

つまりLowとMediumの約25秒の差のうち、かなりの部分はPrefill速度の差です。

Lowでは207 tok/sだったのに対し、Lowの直後に実行したMediumでは1,338 tok/sまで上昇しています。

Prompt reuseは両方0なので、少なくともPrompt reuseによる差ではありません。

Lowを先に実行したことで、OSキャッシュやStrata内部の何らかの状態が温まった可能性はありますが、今回その原因までは切り分けていません。

したがって、

LowとMediumの速度優劣を、この2回のRequest totalだけから判断することはできません。

というのが正確です。

スポンサーリンク

大規模モデルの圧勝にはならなかった

今回、大規模モデル向けと思われる情報統合課題まで行いました。

結果は、

  • Qwen3.8-27B:96
  • Strata Medium:95
  • Strata Low:94

です。

Strataは非常に良かったものの、27Bを明確には上回りませんでした。

今回の検証範囲では、

一般的な用途なら、高品質な27B級でも十分なのでは?

という印象がかなり強くなりました。

スポンサーリンク

なぜ125B級なのに27Bへ勝てない?

ここは単純にモデルサイズだけでは説明できません。

今回のStrataでは、

IQ2_XS

というかなり強い量子化版を使用しています。

一方、Qwen3.8-27Bは、

UD-IQ3_S

です。

そのため今回の比較は、単純な、

125B vs 27B

ではありません。

実際には、

125B級の巨大モデルをかなり強く圧縮したIQ2_XS
vs
27Bモデルを比較的高い精度で保持したIQ3_S

という側面もあります。

さらに、

  • モデル自体の学習特性
  • Instruction tuning
  • Thinkingの癖
  • 処理ごとに使う部分を選ぶモデル構造
  • 量子化耐性
  • 使用runtime

なども影響します。

今回だけで、

IQ2_XSだから27Bに負けた

と断定することはできません。

ただ、

大きいモデルであっても、強い量子化やモデル特性によって、実用性能が27B級を明確に上回るとは限らない

ことは今回の実測から感じました。

スポンサーリンク

IQ3_Sは今回は試さない

StrataにはIQ2_XSより高品質な量子化版もあります。

IQ3_Sも興味はありますが、今回の48GB RAM環境ではさらに要求が厳しくなるため、追加検証は行わないことにしました。

そのため、

より高品質なStrata量子化なら結果が変わる可能性

は残っています。

この記事の評価対象は、あくまで今回実機で検証したQwen3.8-Flash-Next IQ2_XSです。

スポンサーリンク

GPUよりRAMの方が厳しい

Strataを試していて強く感じたのがここです。

GPUは16GBでも動きました。

しかしSystem RAMは、

42~45GB / 48GB

程度まで使用します。

かなりギリギリです。

そのため、

48GBなら余裕

とは到底言えません。

ローカル巨大モデルを試す場合、GPUだけでなく、System RAM容量も非常に重要です。

スポンサーリンク

ではStrataは実用的なのか?

今回の結論としては、

技術的にはかなり実用的です。

RTX 5070 Ti 16GBで、

  • 約63GBのIQ2_XSモデル
  • 64K Context
  • Low / Medium Thinking
  • 50~60 tok/s級の生成
  • 数千~2万tokens以上の長文生成

まで実際に動きました。

これはかなり面白いです。

しかし、

普段使いで27Bから乗り換えるべきか?

となると、今のところ私はそうは感じませんでした。

スポンサーリンク

用途別の印象

用途 現時点の印象
普通のチャット 27Bで十分
C# / WPFコードレビュー Qwen3.8-27Bが優勢
設計相談 27Bでもかなり強い
技術記事作成 27B / Strataほぼ互角
大量ログ整理 Strataはかなり強い
非常に長いContext Strataを試す意味あり
巨大モデルを16GB GPUで動かしたい Strataは非常に面白い
スポンサーリンク

今回一番印象が変わった点

検証前は、

巨大モデルが16GB GPUで動くなら、27Bよりかなり強いのでは?

と思っていました。

しかし実際に試してみると、

27Bクラスが想像以上に強い

という方が強く印象に残りました。

Qwen3.8-27Bは、

  • コード品質が高い
  • 情報整理も非常に強い
  • 約49 tok/s出る
  • VRAM約14.4GB
  • 65K Contextも使える

というバランスの良さがあります。

一方Strataは、

125B級の巨大モデルを普通のゲーミングPCで現実的な速度で動かす技術

として非常に面白い存在でした。

スポンサーリンク

まとめ

今回、RTX 5070 Ti 16GB + RAM 48GB環境でStrataを検証しました。

主な結果は、

  • Qwen3.8-Flash-Nextはメインモデル125B、1トークンあたり約6Bを使用する構造
  • IQ2_XSのGGUFは約63.35GB
  • 32K / 64K Contextとも動作
  • VRAM約15.5GB
  • System RAM約42~45GB
  • 新規短文平均約62 tok/s
  • 64K Low Thinking:約2分34秒
  • 64K Medium:約3分51秒~7分28秒
  • 長文記事作成も約2分前後
  • 技術記事作成では非常に高品質
  • コード品質ではQwen3.8-27Bに届かなかった
  • 大量情報整理では27Bとの差がほぼ無くなった

という結果になりました。

「巨大モデルをゲーミングPCで動かせる」という点は、本当に確認できました。

しかし同時に、

モデルサイズがそのまま実用性能にはならない

ことも確認できました。

今回のIQ2_XSでは、普段使いならQwen3.8-27Bの方が扱いやすく、性能面でも十分強いという印象です。

それでも、

16GB VRAMのGPUで125B級のモデルを64K Context + Thinkingまで実用速度で動かせた

というStrataの技術的な面白さはかなり大きいです。

より高品質な量子化を使える環境なら結果が変わる可能性もありますが、今回の48GB RAM環境ではここまでとします。

少なくとも、

「巨大モデルを動かすには数十GBのVRAMが必須」という感覚は、かなり変わりつつある

と感じる検証でした。

そして普段使いという観点では、

良く調整された27B級は、まだかなり強い。

これが今回、一番大きな発見でした。

コメント