RK182X 멀티카드 캐스케이드 추론
Decoder 레이어 단위 분할로 2장 또는 4장의 AI 카드에 분산 — 호스트 한 대에서 온디바이스 LLM 용량과 긴 입력 Prefill 확장
RK182X AI 카드 한 장에는 명확한 용량 한계가 있습니다. 모델이 카드의 로컬 메모리에 들어가야 하고, 모든 토큰이 같은 칩을 통과합니다. 캐스케이드 구조는 이 천장을 열어젖힙니다. Transformer를 연속된 Decoder 레이어 세그먼트로 분할하고, 각 세그먼트를 독립된 카드에 배치하며, 호스트가 체인 전체를 총괄합니다. 용량은 카드 수에 따라 늘어나고, 카드 사이를 오가는 것은 중간 특징(Hidden States)뿐입니다. 모델 가중치는 각 카드에 그대로 남습니다.