Redditr/LocalLLaMALocalLLaMA
Ninfer for RTX 4090 and Qwen 3.8 27B
2026년 8월 15일 오후 07:12Error 추천0 댓글
#LLM#AI#RTX4090#NInfer
요약
RTX 4090 환경에서 구동 가능한 ninfer Windows 포트 버전이 공개되었습니다. Qwen 3.8 27B 모델을 사용하여 초당 60-100 토큰의 속도를 기록하며 효율적인 추론 성능을 보여줍니다.
주요 내용
- ninfer-3090을 기반으로 제작된 Windows용 포트 버전으로 RTX 4090에서 원활하게 작동합니다.
- Qwen 3.8 27B 모델 테스트 결과 초당 60-100 t/s의 속도와 최대 100-150K 토큰의 컨텍스트 길이를 지원합니다.
- GitHub와 Hugging Face를 통해 관련 소스 코드와 모델 가중치가 제공됩니다.