The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction
SSD 오프로딩 환경에서 예측 라우팅을 통해 35B급 MoE 모델을 저사양 하드웨어에서 고속으로 추론하는 엔진 개발
논문이 다루는 내용
소비자용 하드웨어에서 35B급 MoE 모델을 구동할 때, 모델 크기로 인한 메모리 부족과 연산량 대비 높은 데이터 전송량(Memory Wall)이 병목 현상을 일으킵니다. 기존의 SSD 오프로딩 방식은 다음 레이어의 전문가(Expert)를 미리 알 수 없어 연산과 데이터 로딩을 중첩시키기 어렵다는 문제가 있습니다. 이를 해결하기 위해 Edge0는 다음 레이어의 라우팅을 미리 예측하는 '프리라우터(prerouter)' 기술을 도입하여 데이터 로딩과 연산을 동시에 수행합니다. 또한, 양자화 및 예측 오차로 인한 품질 저하를 방식을 보완하기 위해 학습된 LoRA 어댑터를 사용합니다. 그 결과, 24GB 메모리 환경에서 35B MoE 모델을 20tok/s의 속도로 구동하며 높은 성능을 유지합니다.
핵심 결과
-
프리라우터(Prerouter): 다음 레이어의 전문가를 미리 예측하여 SSD 로딩과 연산을 중첩(Overlap)시킴
-
Edge0 엔진: 예측된 라우팅 정보를 실제 라우팅으로 사용하여 데이터 손실 없이 스트리밍 추론 구현
-
LoRA 복구: 4-bit 양자화 및 예측 오차로 인한 성능 저하를 unmerged recovery LoRA로 보완
실무에서 볼 만한 점
고가의 H100/A100 없이도 소비자용 GPU와 SSD만으로 대규모 MoE 모델을 효율적으로 서빙할 수 있는 실질적인 방법론을 제시합니다.
읽을 때 확인할 점
-
제시된 Edge0 프레임워크의 오픈소스 코드를 활용하여 로컬 SSD 환경에서의 추론 속도 테스트
-
다양한 양자화 비트(int4 vs fp8 등)에 따른 LoRA 복구 성능 차이 검증
-
SSD 읽기 속도(NVMe vs SATA) 변화가 전체 추론 처리량(throughput)에 미치는 영향 분석