Volver a los trabajos
InvestigaciónInvestigación pública2026

Qwen3.8-27B · RTX 5090 · DFlash2 200k

Inferencia local de Qwen3.8-27B en una RTX 5090. Nuestra configuración actual de desarrollo usa NInfer con DFlash2 y un contexto de hasta 200k; las evaluaciones anteriores de ejecución siguen disponibles con sus condiciones de medición.

La pregunta de investigación

¿Cómo puede una sola RTX 5090 apoyar el desarrollo local con un modelo de lenguaje grande? Estudiamos la velocidad de inferencia, el contexto largo y los flujos de programación con Qwen3.8-27B.

Entorno

Una RTX 5090 con 32 GB de VRAM. La configuración actual de desarrollo ejecuta NInfer con pesos NVFP4, caché KV FP8 y DFlash2, con un contexto de 200,000 tokens. Solo se ejecuta un entorno de generación a la vez, de forma local.

Enfoques de ejecución

Ahora usamos DFlash2 con un contexto de hasta 200k en el desarrollo. Los resultados anteriores de llama.cpp Q5_K_M + MTP3 y SGLang NVFP4 siguen siendo puntos de comparación útiles. La prueba básica del 26 de septiembre también comprobó la entrada de imágenes en la configuración DFlash2.

Diagrama anterior de enrutamiento de ejecución. El uso actual de DFlash2 / 200k se describe en el texto actualizado.

Resultados medidos

Los valores medidos están ligados al entorno de ejecución, el artefacto, el contexto y la carga de trabajo. SGLang NVFP4 registra ~69.3 tok/s con contexto corto y ~60.8 tok/s con 80K+ (mediana de 43 muestras). llama.cpp Q5_K_M + MTP3 registra 151.72 / 120.29 / 98.59 / 94.66 tok/s en contextos corto → 32K → 80K → 113.9K. En una trayectoria real de programación autónoma de 100K+ (tarea larga de CourseBench, recalificación de 2026-08-19), Q5_K_M + MTP3 promedió 109.51 tok/s con un contexto máximo observado de 106,829 tokens, aceptación especulativa de 89.61% y un pico de VRAM de 28.63 GB.

Interpretación

Las cifras anteriores de decodificación describen las configuraciones y cargas de trabajo usadas entonces. No son mediciones del rendimiento de la configuración actual de DFlash2 200k. En el desarrollo diario consideramos juntos el tiempo de respuesta, el manejo del contexto y la calidad del trabajo terminado.

Qué sigue pendiente

Una configuración de contexto de 200k y el uso cotidiano no constituyen una evaluación de profundidad completa. Aún faltan pruebas comparables de precisión con contexto largo y mediciones de programación de principio a fin para la configuración actual.

Reproducir

El repositorio público de recetas y la muestra de Hugging Face contienen las configuraciones anteriores y las condiciones de las evaluaciones. Actualizamos el material publicado a medida que cambia la configuración de desarrollo. El repositorio distribuye recetas, no pesos de modelos.