Qwen3.8-27B · RTX 5090 · DFlash2 200k
Inferência local Qwen3.8-27B em uma RTX 5090. Nossa configuração atual de desenvolvimento usa NInfer com DFlash2 e contexto de até 200k; os benchmarks anteriores de runtime continuam disponíveis com suas condições de medição.
A pergunta de pesquisa
Como uma única RTX 5090 pode apoiar o desenvolvimento local com um grande modelo de linguagem? Estudamos velocidade de inferência, contexto longo e fluxos de programação com Qwen3.8-27B.
Ambiente
Uma RTX 5090 com 32 GB de VRAM. A configuração atual de desenvolvimento executa NInfer com pesos NVFP4, cache KV FP8 e DFlash2, com contexto de 200,000 tokens. Apenas um runtime de geração é executado por vez, localmente.
Abordagens de execução
Agora usamos DFlash2 com contexto de até 200k no desenvolvimento. Os resultados anteriores de llama.cpp Q5_K_M + MTP3 e SGLang NVFP4 continuam úteis para comparação. O teste básico de 26 de setembro também verificou entrada de imagens na configuração DFlash2.
Resultados medidos
Os valores medidos estão ligados ao runtime, ao artefato, ao contexto e à carga de trabalho. SGLang NVFP4 registra ~69.3 tok/s em contexto curto e ~60.8 tok/s em 80K+ (mediana de 43 amostras). llama.cpp Q5_K_M + MTP3 registra 151.72 / 120.29 / 98.59 / 94.66 tok/s entre contextos curto → 32K → 80K → 113.9K. Em uma trajetória real de programação autônoma de 100K+ (tarefa longa CourseBench, requalificação de 2026-08-19), Q5_K_M + MTP3 teve média de 109.51 tok/s com contexto máximo observado de 106,829 tokens, aceitação especulativa de 89.61% e pico de VRAM de 28.63 GB.
Interpretação
Os números anteriores de decodificação descrevem as configurações e cargas de trabalho usadas na época. Não são medições de desempenho da configuração atual DFlash2 200k. No desenvolvimento diário, consideramos juntos o tempo de resposta, o tratamento do contexto e a qualidade do trabalho concluído.
O que ainda não foi resolvido
Uma configuração de contexto 200k e o uso diário não comprovam um benchmark de profundidade total. Ainda faltam testes comparáveis de precisão em contexto longo e medições de programação de ponta a ponta para a configuração atual.
Reproduzir
O repositório público de receitas e a vitrine Hugging Face contêm as configurações anteriores e as condições dos benchmarks. Atualizamos o material publicado conforme a configuração de desenvolvimento muda. O repositório distribui receitas, não pesos de modelos.

