กลับไปที่ผลงาน
งานวิจัยงานวิจัยสาธารณะ2026

Qwen3.8-27B · RTX 5090 · DFlash2 200k

รัน Qwen3.8-27B ในเครื่องบน RTX 5090 ตัวเดียว การตั้งค่าพัฒนาปัจจุบันใช้ NInfer กับ DFlash2 และบริบทสูงสุด 200k ผลทดสอบรันไทม์ก่อนหน้ายังเผยแพร่พร้อมเงื่อนไขการวัด

คำถามวิจัย

RTX 5090 เพียงตัวเดียวรองรับการพัฒนาในเครื่องด้วยโมเดลภาษาขนาดใหญ่ได้อย่างไร เราศึกษาความเร็วรัน บริบทยาว และขั้นตอนเขียนโค้ดด้วย Qwen3.8-27B

สภาพแวดล้อม

RTX 5090 ตัวเดียวพร้อม VRAM 32 GB การตั้งค่าปัจจุบันรัน NInfer ด้วยน้ำหนัก NVFP4 แคช KV FP8 และ DFlash2 ตั้งบริบท 200,000 โทเค็น รันไทม์สร้างข้อความทำงานในเครื่องทีละตัว

แนวทางรันไทม์

ตอนนี้ใช้ DFlash2 กับบริบทสูงสุด 200k ในการพัฒนา ผล llama.cpp Q5_K_M + MTP3 และ SGLang NVFP4 ก่อนหน้ายังเป็นจุดเปรียบเทียบที่มีประโยชน์ การทดสอบเบื้องต้นวันที่ 26 กันยายนตรวจอินพุตภาพใน DFlash2 ด้วย

แผนภาพส่งงานรันไทม์ก่อนหน้า การใช้ DFlash2 / 200k ปัจจุบันอยู่ในข้อความอัปเดต

ผลการวัด

ค่าที่วัดผูกกับรันไทม์ ชิ้นงาน บริบท และภาระงาน SGLang NVFP4 ได้ ~69.3 tok/s ในบริบทสั้นและ ~60.8 tok/s ที่ 80K+ (มัธยฐาน 43 ตัวอย่าง) llama.cpp Q5_K_M + MTP3 ได้ 151.72 / 120.29 / 98.59 / 94.66 tok/s ตามบริบทสั้น → 32K → 80K → 113.9K ในเส้นทางเขียนโค้ดอัตโนมัติจริง 100K+ (งานยาว CourseBench ทดสอบคุณสมบัติซ้ำ 2026-08-19) Q5_K_M + MTP3 เฉลี่ย 109.51 tok/s บริบทสูงสุดที่พบ 106,829 โทเค็น อัตรายอมรับ speculative 89.61% และ VRAM สูงสุด 28.63 GB

การตีความ

ตัวเลข decode ก่อนหน้านี้อธิบายการตั้งค่าและงานที่ใช้ในเวลานั้น ไม่ใช่ผลวัดของ DFlash2 200k ปัจจุบัน ในการพัฒนาประจำวันเราพิจารณาเวลาตอบสนอง การจัดการบริบท และคุณภาพงานที่เสร็จร่วมกัน

สิ่งที่ยังไม่แก้

การตั้งค่าบริบท 200k และการใช้ประจำวันไม่ใช่การทดสอบเต็มเชิงลึก ยังต้องทำการทดสอบความถูกต้องบริบทยาวที่เปรียบเทียบกันได้ และวัดงานเขียนโค้ดตั้งแต่ต้นจนจบสำหรับการตั้งค่าปัจจุบัน

ทำซ้ำ

รีโพสูตรสาธารณะและหน้า Hugging Face มีการตั้งค่าก่อนหน้าและเงื่อนไขทดสอบ เรากำลังอัปเดตข้อมูลที่เผยแพร่เมื่อการตั้งค่าพัฒนาเปลี่ยน รีโพแจกสูตร ไม่ใช่น้ำหนักโมเดล