Redditr/LocalLLaMALocalLLaMA
Qwen3.8-27B (Q5_K_XL) on Strix Halo at 31 t/s decode: DFlash2 + Vulkan, the optimal setup
2026년 8월 19일 오후 07:17Error 추천0 댓글
#Speculative_Decoding#Agent#LLM_Optimization#AI#Strix_Halo
요약
Strix Halo 하드웨어에서 Qwen 27B 모델을 DFlash2와 Vulkan 환경으로 구동하여 초당 31.4 토큰의 높은 디코딩 속도를 달성한 기술 분석 결과입니다. 기존 MTP 방식보다 효율적인 추론이 가능하며, 양자화 설정에 따른 성능 역전 현상을 발견했습니다.
주요 내용
- DFlash2 드래프터는 기존 모델 내장 MTP 방식보다 디코딩 속도를 약 40% 향상시키며, 거부 샘플링을 통해 출력 품질을 유지합니다.
- 양자화 전략의 변화로 Q5_K_XL 모델이 Q4보다 더 높은 초당 토큰 수를 기록했는데, 이는 높은 초안 수락률이 대역폭 비용을 상쇄하기 때문입니다.
- 80W 전력 설정 시 31.4 t/s의 디코딩 속도와 3k 프롬프트 기준 약 300 t/s의 프리필 속도를 기록하며 최적의 성능을 보여줍니다.