RK182X 多卡級聯推理方案
依 Decoder 層分段部署到 2 張或 4 張算力卡,在一台 Host 上擴充端側大模型容量與長輸入 Prefill 吞吐
單張 RK182X 算力卡有明確的容量上限:模型必須放進本卡記憶體,而且每個 Token 都得經過同一顆晶片。級聯架構把這道天花板打開 —— 將 Transformer 依 Decoder 層連續切分成若干段(Segment),每段落在獨立的一張卡上,由 Host 統一調度整條鏈。容量隨卡數成長;卡與卡之間只傳 中間特徵(Hidden States),模型權重始終留在各自的卡上。