LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay
KV 캐시를 넘어 모델 간 재귀적 상태(Recurrent State)를 직접 전송하여 컨텍스트 재입력 없이 모델 크기를 확장하는 기술
논문이 다루는 내용
기존에는 모델 간 컨텍스트를 전달할 때 수신 모델이 이전 텍스트를 다시 읽는 과정이 필요했습니다. 본 연구는 서로 다른 크기의 하이브리드 언어 모델(4B ↔ 9B) 간에 재귀적 메모리 상태를 직접 전달하는 'LatentPort' 방식을 제안합니다. 단순히 KV 캐시만 전달하는 대신 Gated DeltaNet(GDN) 기반의 지속적 상태 패키지를 결합하여 전송 효율을 높였습니다. 실험 결과, 타겟 모델이 이전 접두사(Prefix)를 다시 읽지 않고도 높은 정확도로 문맥을 복구하며 기존 방식보다 낮은 NLL을 달성했습니다. 이는 모델 크기를 확장할 때 발생하는 연산 비용을 획기적으로 줄일 수 있는 가능성을 보여줍니다.
핵심 결과
-
KV 캐시 외에 재귀적 상태(Recurrent State)를 포함한 하이브리드 메모리 전송 기술 제안
-
타겟 모델의 Prefix Replay(컨텍스트 재입력) 없이 모델 간 상태 전송 성공
-
Gated DeltaNet(GDN)을 활용하여 서로 다른 크기의 모델 간 상태 호환성 확보
실무에서 볼 만한 점
모델 크기를 키우거나 교체할 때 발생하는 막대한 컨텍스트 재처리 비용을 줄여, 효율적인 모델 스케일링 및 실시간 추론 환경을 구축할 수 있습니다.
읽을 때 확인할 점
-
하이브리드 구조(Attention + RNN/Linear)를 가진 모델 간의 상태 전송 실험
-
모델 크기 차이가 큰 경우(예: 1B to 70B)의 상태 정렬(Alignment) 성능 테스트
-
KV 캐시 전송과 재귀적 상태 전송의 연산 비용 대비 성능 효율 비교