Qwen3.8-27B · RTX 5090 · DFlash2 200k
Inferensi Qwen3.8-27B lokal pada satu RTX 5090. Pengaturan pengembangan saat ini memakai NInfer dengan DFlash2 dan konteks hingga 200k; benchmark runtime sebelumnya tetap tersedia bersama kondisi pengukurannya.
Pertanyaan riset
Bagaimana satu RTX 5090 mendukung pengembangan lokal dengan model bahasa besar? Kami mempelajari kecepatan inferensi, konteks panjang, dan alur pemrograman menggunakan Qwen3.8-27B.
Lingkungan
Satu RTX 5090 dengan VRAM 32 GB. Pengaturan pengembangan saat ini menjalankan NInfer dengan bobot NVFP4, cache KV FP8, serta DFlash2, dengan konteks 200,000 token. Satu runtime generasi berjalan pada satu waktu, secara lokal.
Pendekatan runtime
Kami kini memakai DFlash2 dengan konteks hingga 200k dalam pengembangan. Hasil llama.cpp Q5_K_M + MTP3 serta SGLang NVFP4 sebelumnya masih menjadi acuan perbandingan. Uji awal 26 September juga memeriksa masukan gambar pada konfigurasi DFlash2.
Hasil pengukuran
Nilai terukur terkait runtime, artefak, konteks, dan beban kerja. SGLang NVFP4 mencatat ~69.3 tok/s pada konteks pendek dan ~60.8 tok/s pada 80K+ (median 43 sampel). llama.cpp Q5_K_M + MTP3 mencatat 151.72 / 120.29 / 98.59 / 94.66 tok/s pada konteks pendek → 32K → 80K → 113.9K. Pada alur pemrograman otonom nyata 100K+ (tugas panjang CourseBench, kualifikasi ulang 2026-08-19), Q5_K_M + MTP3 rata-rata 109.51 tok/s dengan konteks maksimum teramati 106,829 token, penerimaan spekulatif 89.61%, dan VRAM puncak 28.63 GB.
Interpretasi
Angka decode sebelumnya menggambarkan konfigurasi dan beban kerja saat itu. Angka tersebut bukan pengukuran kinerja pengaturan DFlash2 200k saat ini. Dalam pengembangan harian, kami menilai waktu respons, penanganan konteks, dan kualitas hasil akhir bersama-sama.
Yang belum terselesaikan
Pengaturan konteks 200k dan penggunaan harian tidak membuktikan benchmark mendalam. Pengujian ketepatan konteks panjang yang sebanding dan pengukuran pemrograman menyeluruh untuk konfigurasi saat ini masih perlu diselesaikan.
Reproduksi
Repositori resep publik dan showcase Hugging Face memuat konfigurasi serta kondisi benchmark sebelumnya. Kami memperbarui materi publik ketika pengaturan pengembangan berubah. Repositori membagikan resep, bukan bobot model.

