Qwen3.8-27B · RTX 5090 · DFlash2 200k
單張RTX 5090執行本機Qwen3.8-27B推論。目前開發環境使用NInfer、DFlash2及最高200k上下文;舊執行環境基準及測量條件仍可查看。
研究問題
單張RTX 5090如何支援大型語言模型的本機開發?我們用Qwen3.8-27B研究推論速度、長上下文及程式開發流程。
環境
單張RTX 5090,32 GB VRAM。目前NInfer使用NVFP4權重、FP8 KV快取、DFlash2及200,000-token上下文設定。同時間只在本機執行一個生成環境。
執行環境方式
目前開發使用DFlash2及最高200k上下文。先前llama.cpp Q5_K_M + MTP3與SGLang NVFP4結果保留為比較點。9月26日簡測也檢查DFlash2設定的影像輸入。
測量結果
數據限定於執行環境、成品、上下文及負載。SGLang NVFP4短上下文約69.3 tok/s,80K+約60.8 tok/s(43樣本中位數)。llama.cpp Q5_K_M + MTP3於短 → 32K → 80K → 113.9K分別為151.72 / 120.29 / 98.59 / 94.66 tok/s。實際100K+自律程式開發(CourseBench長任務,2026-08-19重新認證),Q5_K_M + MTP3平均109.51 tok/s,最大觀察上下文106,829 tokens、推測接受率89.61%、峰值VRAM 28.63 GB。
解讀
先前解碼數據描述當時的設定與工作負載,並非目前DFlash2 200k設定的效能測量。日常開發會一併考慮回應時間、上下文處理及成品品質。
尚未解決
200k上下文設定與日常使用不等於完整深度的基準測試。目前設定的可比較長上下文準確性與端到端程式開發測量仍待完成。
重現
公開配方儲存庫與Hugging Face展示含舊設定及基準條件。我們隨開發設定更新公開資料;儲存庫提供配方,不提供模型權重。

