RK182X 多卡级联推理方案
按 Decoder 层分段部署到 2 张或 4 张算力卡,在一台 Host 上扩展端侧大模型容量与长输入 Prefill 吞吐
单张 RK182X 算力卡有明确的容量上限:模型必须装进本卡内存,且每个 Token 都要经过同一颗芯片。级联架构把这道天花板打开 —— 把 Transformer 按 Decoder 层连续切分成若干段(Segment),每段落在独立的一张卡上,由 Host 统一调度整条链。容量随卡数增长;卡与卡之间只传 中间特征(Hidden States),模型权重始终留在各自的卡上。