Source Understanding / arXiv:2604.22782v1

01 / 09

R-CLA 把 KV cache 优化从“丢 token”改成“跨层共用”。

论文主张:KV cache 的内存压力来自每层都保存 K/V;训练时随机让层读取前层 KV,可让同一个模型在部署时按硬件预算选择不同深度共享策略。

100,000x
原始 token 到 KV cache 的量级扩张,来自 Figure 1。
50-75%
R-CLA 目标场景:只保留部分层的 cache。
p=0.6
主要 fine-tuning 设置:随机 cross-layer attention。
g=4
效率实验:每 4 层共享一个 KV cache。
Figure 4 R-CLA mechanism thumbnail

Figure 4. 首页锚定核心机制:训练随机路由,推理固定层组共享。

对象

Transformer decoder serving 中的 KV cache,尤其是长上下文、高 batch、深模型。

机制

训练阶段随机路由到自身或前层 KV;推理阶段固定层组共享。

边界

结论来自 QA fine-tuning 与模拟效率实验;训练更慢,部署收益依赖验证。

Problem Scale

02 / 09

KV cache 是服务成本问题,不只是模型结构细节。

论文把瓶颈定义为:推理要缓存每个 token 在每层的 K/V 表示,缓存规模随 batch、序列长度和模型深度线性增长。

证据口径

  • Figure 1:一本文本的 raw token 约 0.0002 GB,但 KV cache 可到 GB 级。
  • Llama-2-7B:模型权重 14.0 GB,同一 book-context 的 KV cache 19.5 GB。
  • Llama-3.1-8B:权重 16.0 GB,KV cache 4.9 GB,仍远大于原始 token。
Figure 1 KV cache memory footprint

Figure 1. 原图展示模型权重与 book-context KV cache 的内存对比,并标注 100,000x expansion。

Route Choice

03 / 09

R-CLA 选择深度维度,是为了避开 query-dependent token eviction。

路线 它压缩什么 论文指出的限制 R-CLA 的切入点
Temporal token eviction / compression 沿时间轴删除、压缩或保留部分 token cache。 token 重要性随 query 变化;丢错 token 可能要重算或带来 hallucination 风险。 不先决定“哪个 token 不重要”,而是复用前层 K/V 表示。
Architecture GQA / MQA 减少同一层内的 KV heads 或共享方式。 能降低单层 cache,但没有处理每层都存一份 K/V 的深度冗余。 把共享范围从“层内”推进到“层间”。
Depth prior CLA / layer cache sharing 跨层共享或近似缓存。 可能增加 encoder / prefill 开销,或只适配固定共享策略。 训练时随机化源层,让部署时的固定共享策略更可换。

判断边界

这不是说 temporal eviction 无效;论文的判断是 depth-wise sharing 与 temporal compression 正交,且对长上下文 peak memory 更直接。

Mechanism

04 / 09

训练时制造随机“cache fault”,推理时变成确定性层组共享。

Figure 4 R-CLA training and inference behavior

Figure 4. 左侧:每个 batch 可观测不同 cross-layer routing;右侧:推理时同组层共享固定 KV。

1. 随机源层

层 l 以概率 p 使用自身 K/V;以概率 1-p 读取某个前层 l' 的 K/V,且 l' < l。

2. 学会容错

层不再只依赖自己的特征空间,而要从早期层语义表示中抽取可用信息。

3. 部署可调

同一个模型可按硬件约束选择 100%、50%、33% 或 25% retention,而不是重训多个模型。

Performance / Retention

05 / 09

R-CLA 的核心证据是“cache 留少了,F1 掉得更慢”。

Figure 2 F1 under cache retention

Figure 2. 三个模型在 full / 50% / 33% retention 下,R-CLA 曲线覆盖或高于 baseline;本页放大原图以保留雷达刻度与图例可读性。

满缓存

R-CLA 并非只在压缩时有效;Figure 2 和 Table 2 显示 full retention 下也经常持平或提升。

半缓存

50% retention 下,多个 QA 数据集的 F1 提升显著,体现训练时随机路由的容错迁移。

低缓存

25%-33% retention 是最能暴露差异的场景;baseline 更易崩,R-CLA 仍保持任务信号。

Performance / Cache Size

06 / 09

Figure 3 把 R-CLA 的目标区画成“高 F1 + 低 cache”。

Figure 3 cache size and F1 tradeoff

Figure 3. 横轴为 KB/token,纵轴为 F1;绿色区域标注 target efficiency zone。

这张图支撑的判断

  • 不是只压内存:目标不是最低 cache,而是在小 cache 下保持较高 F1。
  • 模型有差异:形状区分 Llama、Qwen 8B、Qwen 1.7B,说明收益不能直接外推到所有模型。
  • 训练方法有差异:蓝色 R-CLA 在较低 cache 区间更接近目标区,红色 baseline 更常退化。

横轴

Cache size per token,是部署成本相关的近似口径。

纵轴

F1 score,是 QA 任务下的质量代理指标。

读法

右上不是唯一目标;左上区域才是论文希望打开的效率前沿。

QA Evaluation

07 / 09

Table 2 把收益范围扩到 5 个 QA 数据集与 3 个模型家族。

Table 2 R-CLA F1 across QA tasks

Table 2. R-CLA p=0.6;比较 baseline standard self-attention;评估 retention 为 100%、50%、25%。

读表方式

  • 跨数据集:HotpotQA、MSMarco、RepLiQA、SQuAD v2、TriviaQA 覆盖不同 QA 口径。
  • 跨模型:Llama-3.1-8B、Mistral-7B、Qwen3-8B 都有提升样例。
  • 压缩越强:25% retention 下相对提升常常最大,因为 baseline 退化更快。
  • 不是全赢:RepLiQA full retention 在 Llama/Mistral 上有轻微负值,说明不能把 R-CLA 写成无条件优越。

Serving Efficiency

08 / 09

效率收益来自更小 cache;但 TTFT 和 batch 结果要按场景读。

Table 4 inference efficiency

Table 4. 单 80GB GPU,Qwen3-8B-like 架构;g=4 比 g=1 cache 更小,并在长输入下降低 TTFT。

Table 5 batch scaling

Table 5. 8,192-token context;batch 16 时 g=1 OOM,g=4 仍能完成。

内存

g=4 通过跨 4 层共享 KV,把 KV memory 从 20.97 GB 降到 5.24 GB。

延迟

长输入下 TTFT 改善更明显;短输入时还要看 prefill 与实现开销。

吞吐

在 batch 扩大时,压缩 cache 主要价值是避免 OOM,从而允许更大 batch。

Evidence Boundary / Approval Gate

09 / 09

可以批准的基线:R-CLA 是“训练适配深度共享”的 KV cache 路线。

可强表达

R-CLA 训练让模型适应多种 depth-wise cache sharing;QA 表中多数任务、模型和 retention 下优于 baseline。

需弱表达

“正则化效应”来自训练曲线与数据受限观察,论文用 suggestive / frequently preserving or improving,而非普适定律。

不能越界

不能写成替代所有 KV compression;不能忽略训练更慢、具体部署需复测和任务差异。

Figure 8 消融的可读重建

方法训练适配跨 retention 结论
R-CLA每次训练随机选择前层 K/V 来源从一次训练覆盖 100%、50%、25% retention,整体最稳。
CLA@2 / CLA@4固定层距的 deterministic sharing在对应 retention 可竞争,但离开训练层距后退化更明显。
RD-CLA@2 / RD-CLA@4随机应用固定层距缓解单一策略,但不如 R-CLA 的随机源层泛化。

Source: Appendix C + Figure 8. 原图过宽过矮,此处重建为审阅可读的对照表。

审批后进入 brief 的表达方向

  • 先讲 KV cache 为什么贵,再讲为什么深度共享比 token eviction 更稳。
  • 把 R-CLA 画成训练随机、推理确定的两阶段机制。
  • 收益用 retention / F1 / TTFT / OOM 边界表达,不写成营销式“全面降本”。