PyoSignal Logo
PyoSignal
← 커뮤니티로 돌아가기
Redditr/LocalLLaMALocalLLaMA

Achievable 253 t/s - unsloth/Muse Glimmer 30B UD-Q5_K_M on a 5090

2026년 8월 10일 오후 07:37Error 추천0 댓글
#Benchmark#Agent#LLM Benchmarking#Speculative Decoding#RTX 5090

요약

RTX 5090 환경에서 Muse Glimmer 30B 모델을 사용하여 최대 253 t/s의 높은 추론 속도를 달성한 벤치마크 결과입니다. 특정 PR(Pull Request)을 적용하여 CPU 병목 현상을 해결함으로써 성능을 극대화했습니다.

주요 내용

  • DFlash draft argmax를 CPU에서 GPU로 이동시키는 PR #26842를 적용하여 병목 현상을 해결하고 성능을 대폭 향상시켰습니다.
  • 코드 생성 작업에서 Meta가 발표한 233 t/s 수준의 성능을 재현할 수 있게 되었으며, 작업 유형에 따라 52~253 t/s 사이의 속도를 기록했습니다.
  • 262k의 대규모 컨텍스트를 사용하기 위해 --override-kv 플래그를 활용했으며, 추론 예산 설정 시 max_tokens 여유 공간 확보가 필요함을 확인했습니다.