Source Understanding / arXiv:2604.22782v1
01 / 09
论文主张:KV cache 的内存压力来自每层都保存 K/V;训练时随机让层读取前层 KV,可让同一个模型在部署时按硬件预算选择不同深度共享策略。

Figure 4. 首页锚定核心机制:训练随机路由,推理固定层组共享。
Transformer decoder serving 中的 KV cache,尤其是长上下文、高 batch、深模型。
训练阶段随机路由到自身或前层 KV;推理阶段固定层组共享。
结论来自 QA fine-tuning 与模拟效率实验;训练更慢,部署收益依赖验证。
Problem Scale
02 / 09
论文把瓶颈定义为:推理要缓存每个 token 在每层的 K/V 表示,缓存规模随 batch、序列长度和模型深度线性增长。

Figure 1. 原图展示模型权重与 book-context KV cache 的内存对比,并标注 100,000x expansion。
Route Choice
03 / 09
| 路线 | 它压缩什么 | 论文指出的限制 | R-CLA 的切入点 |
|---|---|---|---|
| Temporal token eviction / compression | 沿时间轴删除、压缩或保留部分 token cache。 | token 重要性随 query 变化;丢错 token 可能要重算或带来 hallucination 风险。 | 不先决定“哪个 token 不重要”,而是复用前层 K/V 表示。 |
| Architecture GQA / MQA | 减少同一层内的 KV heads 或共享方式。 | 能降低单层 cache,但没有处理每层都存一份 K/V 的深度冗余。 | 把共享范围从“层内”推进到“层间”。 |
| Depth prior CLA / layer cache sharing | 跨层共享或近似缓存。 | 可能增加 encoder / prefill 开销,或只适配固定共享策略。 | 训练时随机化源层,让部署时的固定共享策略更可换。 |
这不是说 temporal eviction 无效;论文的判断是 depth-wise sharing 与 temporal compression 正交,且对长上下文 peak memory 更直接。
Mechanism
04 / 09

Figure 4. 左侧:每个 batch 可观测不同 cross-layer routing;右侧:推理时同组层共享固定 KV。
层 l 以概率 p 使用自身 K/V;以概率 1-p 读取某个前层 l' 的 K/V,且 l' < l。
层不再只依赖自己的特征空间,而要从早期层语义表示中抽取可用信息。
同一个模型可按硬件约束选择 100%、50%、33% 或 25% retention,而不是重训多个模型。
Performance / Retention
05 / 09

Figure 2. 三个模型在 full / 50% / 33% retention 下,R-CLA 曲线覆盖或高于 baseline;本页放大原图以保留雷达刻度与图例可读性。
R-CLA 并非只在压缩时有效;Figure 2 和 Table 2 显示 full retention 下也经常持平或提升。
50% retention 下,多个 QA 数据集的 F1 提升显著,体现训练时随机路由的容错迁移。
25%-33% retention 是最能暴露差异的场景;baseline 更易崩,R-CLA 仍保持任务信号。
Performance / Cache Size
06 / 09

Figure 3. 横轴为 KB/token,纵轴为 F1;绿色区域标注 target efficiency zone。
Cache size per token,是部署成本相关的近似口径。
F1 score,是 QA 任务下的质量代理指标。
右上不是唯一目标;左上区域才是论文希望打开的效率前沿。
QA Evaluation
07 / 09

Table 2. R-CLA p=0.6;比较 baseline standard self-attention;评估 retention 为 100%、50%、25%。
Serving Efficiency
08 / 09

Table 4. 单 80GB GPU,Qwen3-8B-like 架构;g=4 比 g=1 cache 更小,并在长输入下降低 TTFT。

Table 5. 8,192-token context;batch 16 时 g=1 OOM,g=4 仍能完成。
g=4 通过跨 4 层共享 KV,把 KV memory 从 20.97 GB 降到 5.24 GB。
长输入下 TTFT 改善更明显;短输入时还要看 prefill 与实现开销。
在 batch 扩大时,压缩 cache 主要价值是避免 OOM,从而允许更大 batch。
Evidence Boundary / Approval Gate
09 / 09
R-CLA 训练让模型适应多种 depth-wise cache sharing;QA 表中多数任务、模型和 retention 下优于 baseline。
“正则化效应”来自训练曲线与数据受限观察,论文用 suggestive / frequently preserving or improving,而非普适定律。
不能写成替代所有 KV compression;不能忽略训练更慢、具体部署需复测和任务差异。
| 方法 | 训练适配 | 跨 retention 结论 |
|---|---|---|
| R-CLA | 每次训练随机选择前层 K/V 来源 | 从一次训练覆盖 100%、50%、25% retention,整体最稳。 |
| CLA@2 / CLA@4 | 固定层距的 deterministic sharing | 在对应 retention 可竞争,但离开训练层距后退化更明显。 |
| RD-CLA@2 / RD-CLA@4 | 随机应用固定层距 | 缓解单一策略,但不如 R-CLA 的随机源层泛化。 |
Source: Appendix C + Figure 8. 原图过宽过矮,此处重建为审阅可读的对照表。