制作実績に戻る
研究公開研究2026

Qwen3.8-27B · RTX 5090 · DFlash2 200k

1台のRTX 5090でQwen3.8-27Bをローカル推論します。現在の開発環境はNInfer、DFlash2、最大200kのコンテキストを使います。以前のランタイム測定も、測定条件とともに公開しています。

研究の問い

1台のRTX 5090で、大規模言語モデルを使うローカル開発をどう支えられるか。Qwen3.8-27Bを使い、推論速度、長いコンテキスト、コーディング工程を調べています。

環境

32 GBのVRAMを持つRTX 5090を1台使用します。現在の開発環境はNInferでNVFP4の重み、FP8 KVキャッシュ、DFlash2を使用し、コンテキストを200,000トークンに設定しています。ローカルで同時に動く生成ランタイムは1つです。

ランタイムの方式

現在は開発でDFlash2と最大200kのコンテキストを使います。以前のllama.cpp Q5_K_M + MTP3とSGLang NVFP4の結果は、比較資料として残しています。9月26日の簡易テストではDFlash2構成の画像入力も確認しました。

以前のランタイム振り分け図です。現在のDFlash2 / 200k利用は更新した本文で説明しています。

測定結果

測定値はランタイム、成果物、コンテキスト、負荷条件に対応します。SGLang NVFP4は短いコンテキストで約69.3 tok/s、80K+で約60.8 tok/s(43サンプルの中央値)でした。llama.cpp Q5_K_M + MTP3は短い → 32K → 80K → 113.9Kの順に151.72 / 120.29 / 98.59 / 94.66 tok/sでした。実際の100K+自律コーディング(CourseBench長期タスク、2026-08-19再認定)では、Q5_K_M + MTP3の平均は109.51 tok/s、観測した最大コンテキストは106,829トークン、投機的生成の受理率は89.61%、最大VRAMは28.63 GBでした。

解釈

以前のデコード数値は、当時の構成と負荷を示したものです。現在のDFlash2 200k構成の性能測定ではありません。日々の開発では、応答時間、コンテキストの扱い、完成した成果物の品質を合わせて考えています。

未解決の課題

200kのコンテキスト設定と日常利用だけで、長さ全域のベンチマークを示すことはできません。現在の構成で比較可能な長文精度テストと、コーディング全体の測定は今後の課題です。

再現する

公開レシピのリポジトリとHugging Faceの紹介ページに、以前の構成と測定条件を載せています。開発環境の変更に応じて公開資料を更新しています。リポジトリではレシピを配布し、モデルの重みは配布しません。