上下文与记忆

跨模型 KV Cache 迁移与可升级长期记忆

跨模型、跨代际缓存翻译的研究进展:共享潜在空间、小模型转换器、压缩记忆保真、MLA/NSA/DSA 架构差异,以及新模型能力与升级收益的评测路线。

2026-09-10 KV Cache Long Context Memory MLA Model Transfer

研究日期:2026-09-10。英文检索优先,依据原始论文、作者仓库及发布资料。本文是文献研究与方案分析,未独立复现论文指标。

1. 直接回答与研究范围

已经有人直接研究“把模型 A 的 KV Cache 翻译成模型 B 可以使用的 KV Cache”。小型适配器、线性映射、共享潜在空间都有先例。但尚未找到足够证据证明:任意旧模型留下的已压缩 KV,可以通过通用小转换器迁移到任意新模型、任意注意力架构,长期反复升级,并同时保留完整历史细节和新模型原生性能。

最接近目标的三条主线是:

  1. 运行时 KV 翻译与 prefill 复用:Cross-Model KV Cache Transfer、CacheBridge、Mixture-of-Translators。
  2. 可扩展的跨模型记忆接口:Latent Space Communication via K-V Cache Alignment,以及面向通信的 C2C、LCF、XKV。
  3. 小模型生成、压缩可供大模型使用的记忆:KV Prediction、ICAE、500xCompressor、Cartridges。

这些路线分别解决目标的一部分,不能把不同论文中最好的指标拼成一个已经实现的系统。相关原始证据见后文逐项链接。

研究简报

维度 本次定义
目标 判断旧 KV 能否跨模型升级复用,并定位可发表、可验证的研究缺口
使用场景 长期 Agent/对话历史在模型升级后继续工作,降低重新处理历史的成本
读者 熟悉模型、注意力与 KV Cache 的研究和工程人员
必须回答 有无直接先例;小转换器是否足够;压缩状态能否迁移;新模型能力能否保留;MLA/NSA/DSA 是否已有覆盖
性能基准 新模型读取同一份完整原始历史的表现,而非仅超过旧模型或文本摘要
视力 同时考虑原文细节检索能力与字面上的视觉、多模态细节能力
排除 同模型跨 GPU 搬运、普通缓存格式互转、仅讨论参数迁移却不迁移已有运行状态
开放维度 源/目标模型、训练预算、可接受损失、压缩率、部署硬件、是否能访问原始历史
时间与版本 检索截至研究日期;具体指标使用链接所标版本,预印本不视为复现结论

2. 首先把“无限上下文”拆开

你的目标实际包含五项可以分别测量的要求:

KV 持久化、KV 压缩、上下文扩展和模型迁移并不互相蕴含。 保存 KV 可以省去重算,但没有自动解决注意力读取量、位置范围、检索准确率和跨版本语义对齐。

对标准全注意力实现,未压缩缓存随历史 token 数增长;对固定窗口或固定容量压缩记忆,可以限制工作集,但需要评估被移除的信息。MLA 主要减少每个 token 的状态宽度;稀疏注意力主要改变每次读取哪些历史位置。二者都不能单独证明“有限存储保存无限历史且任意细节无损”。MLA 与 NSA 的原始定义分别见 DeepSeek-V2NSA

还需要区分两个成本:保存原始记录的成本让新模型重新理解记录的成本。文本字节常常远小于对应的多层浮点 KV;保留文本的主要负担不一定是磁盘,而可能是后续 prefill 的计算。因此,“保留原文以便纠错,同时复用可迁移 KV 以节省计算”是值得纳入比较的方案。

3. 数学上到底要迁移什么

设历史为 H,源模型为 A,目标模型为 B:

\[ C_A(H)=\operatorname{Prefill}_A(H),\qquad C_B(H)=\operatorname{Prefill}_B(H). \]

若旧状态已经经过压缩 Q_A,可见对象为:

\[ Z_A(H)=Q_A(C_A(H)). \]

你希望学习一个相对廉价的转换器:

\[ \widehat C_B(H)=T_{A\to B}(Z_A(H)), \]

使目标模型在未来问题 q 上满足:

\[ p_B(y\mid q,\widehat C_B(H))\approx p_B(y\mid q,C_B(H)). \]

如果输出仍是压缩目标记忆,也可以改成 \(\widehat Z_B\),但此时必须明确目标模型如何读取它,以及读取接口是否需要训练。

为什么同形状 KV 也不能直接复制

一般注意力层的键和值由该模型自己的隐藏状态和投影生成:

\[ K_A^\ell=\operatorname{Pos}_A(h_A^\ell W_{K,A}^\ell),\quad V_A^\ell=h_A^\ell W_{V,A}^\ell. \]

从第二层起,隐藏状态还依赖此前各层的注意力和前馈计算。因此,转换器需要处理的不只是 head 数和维度,还包括层语义、坐标系、位置编码、归一化、token 划分及整个前缀的计算结果。这是对模型计算结构的分析,并不意味着跨模型转换必然失败。

一个真正不可绕过的边界

以下是条件性的信息论分析,而非对某个模型 KV 不可逆性的实测结论。

如果存在两份不同历史 H1、H2,使旧压缩器输出完全相同的 Z,而新模型在某个问题上本应区分二者,那么任何只看 Z 的转换器都无法同时恢复两份历史的正确差异。随机转换器也不能凭空确定自己面对的是哪一个历史。

固定有限比特状态承载任意长度、任意内容历史时,这种碰撞不可避免。但针对受限任务分布,紧凑状态可能保留足够的相关信息,获得近乎相同的任务成绩。研究应明确追求的是后一种可测量目标。

小模型不必与新模型同样聪明才能做好迁移。 如果它只是把充分保留的事实转换到新模型可读的表示,新模型仍可完成更强推理。困难在于:旧压缩器是否保留了新能力未来会需要、却在当时没有被认为重要的细节。

4. 最直接的论文:运行状态翻译

4.1 Cross-Model KV Cache Transfer in LLM Families,2026-08

该工作用校准数据拟合闭式 ridge 映射,从多个源层预测目标层 KV;对键先移除 RoPE,映射后施加目标 RoPE。测试覆盖 Qwen3、Llama 3.1、Ministral 3 的六个同家族模型对,KV head 数与每头维度匹配。它是“旧模型 prefill 后,新模型跳过前缀重读”的直接先例。

模型对 五项任务平均保留率 GSM8K 保留率
Qwen3 14B → 32B 97.6% 95.6%
Llama 3.1 8B → 70B 72.8% 18.2%
Ministral 3 8B → 14B 41.6% 1.6%

保留率是迁移成绩除以目标原生成绩。原文映射器可达 1.01–3.36B 参数、4–12GB,故“线性”不代表体积很小。论文报告映射比重新 prefill 快,但同形状兼容不保证推理保真。论文 v1,实验与附录

4.2 CacheBridge,2026-09-01

CacheBridge 使用 head-local 支持、注意力敏感度校准及高效拟合。Qwen3 14B → 32B 的四项选择题平均目标保留率为 99.83%,映射器存储比 full-head 基线小 8 倍。

边界非常明确:只测同家族、匹配 head 数的 GQA→GQA;未验证稀疏、滑窗、线性、混合注意力,也未验证开放式多轮交接生成。其应用延迟不含源 prefill、传输、加载与解码。99.83% 是有限评测的平均值,不能解释为整体智能只损失 0.17%。 论文 v1,§4、§6

4.3 Mixture-of-Translators(MoT),2026-07-31

MoT 用多个翻译模块和 Context Correction Loss 缓解跨层注入误差,模型池包含 Qwen2.5、GPT-2、OPT。其长上下文 CAG 案例报告平均 F1:Native 0.2125、MoT 0.2047,对应 96.3% 保留率。

这是不同缓存空间之间翻译的重要证据,但该比率的绝对 F1 较低,不能据此推断强推理、视觉和长期 Agent 已保真;“涵盖异构模型池”也不等于所有架构组合均已验证。比较中的部分基线由作者重实现,需留意具体实现和评测协议。论文 v1,§4、附录 H

5. 最贴近长期升级的路线:共享潜在空间

5.1 Latent Space Communication via K-V Cache Alignment,2026-01

Google DeepMind 作者提出共享 KV 空间 Σ:模型通过各自的输入/输出适配器接入,基础参数保持不变。实验包含不同检查点、微调分布、随机种子和模型规模;文中有 100M/400M 的规模比较。

尤其相关的是“新增模型”实验:冻结已有三个模型的适配器,只训练第四个模型接入,并测试未直接训练的转换路径。这是可扩展记忆接口的直接先例,但新模型仍须训练适配器,不能理解为未来模型完全零训练兼容。 尚非 MLA/NSA/DSA 通用协议,也不是任意压缩状态的终身保真证明。论文 v1,§4–§6

对你的项目,这条路线的启示是:如果有 N 个模型,逐对适配可能需要约 N(N−1) 条方向;共享接口在模块数量上可以降到每个模型一组读写器。不过,训练数据覆盖、计算成本和兼容性验证并不会自动变成同样简单。

5.2 Cache-to-Cache(C2C),2025-10

C2C 学习把源模型 KV 投影并融合到目标模型 KV,使用门控选择受益层。它证明异构模型可通过连续状态传递有用信息。作者提供 C2C 代码。但原始范式包含目标自身状态及融合过程,不能直接等同于“仅凭旧缓存,完全省掉目标历史 prefill”。论文 v1

5.3 Latent Cache Flow(LCF / LCF-X),2026-05

LCF 以共享低维通道和层剪枝缩小转换模块;论文报告 13MB 适配器可超过 956MB 的 C2C 对照。共享上下文实验仅用 Qwen2.5-0.5B-Instruct → Qwen3-0.6B;跨上下文实验用两个 Qwen3-0.6B 实例。LCF-X 对源 KV 汇聚后传递摘要。

它支持“小模块可传递有效语义”的可行性,但没有证明该体积足以承担大模型跨家族升级。这里的压缩通信也不应直接等同于已经封存多年、面对未知新任务的记忆。论文 v1,§5

5.4 Dual-Cache Latent Space Communication / XKV,2026-08

XKV 在 Qwen3-0.6B、Gemma-3-1B、Llama-3.2-3B 的 3×3 有向组合上评测,覆盖不同 tokenizer、层数与注意力几何。模型分别看到部分证据,经汇聚、翻译和目标位置解码融合信息。实验的问题对双方可见。

因此它是跨家族、跨 tokenizer 通信的相关证据,但主要回答“给定问题后怎样传递证据”,不直接回答“今天存的无问题记忆,未来任意新模型能否完整读取”。论文 v1,Experimental Setup

6. 小模型与压缩记忆方面的邻近工作

工作 与目标的关系 不能直接推导出的结论
KV Prediction,2024-10 小辅助模型处理原始 prompt,预测器生成冻结大模型的近似 KV;之后由大模型继续生成 小模型通常针对目标训练,不等于可转换任意旧模型遗留状态
DroidSpeak,2024 起 同一基础模型的不同微调变体之间选择性复用、重算中间状态 不等于任意独立架构间转换
ICAE,2023 起 将上下文编码为少量 memory slots,目标解码器读取压缩记忆 memory slots 并非天然跨模型通用
500xCompressor,2024 起 以很少附加参数学习高压缩率的 KV 记忆 高压缩率与完全保真不同;论文也报告明显能力损失
Cartridges,2025-06 离线训练文档专属紧凑 KV,将成本摊销到未来查询 学习到的 cartridge 不自动适用于另一个解码器
Cartridges at Scale,2026-06 面向大文档集合训练可组合模块,结合检索选择 cartridges 组合、检索、跨模型迁移仍是不同问题

对应原始来源:KV PredictionDroidSpeakICAE500xCompressorCartridgesCartridges at Scale

KV Prediction 是你“小模型完成转换、大模型保留推理”的早期近邻:它冻结大模型,训练辅助网络和 KV 预测器,包含直接使用小模型及剪除大模型部分层两种辅助网络设计。它证明可优化效率—质量曲线,不是无损性的证明。作者实现位于 Apple CoreNet

Cartridges 原文在特定基准上报告 38.6 倍内存下降、26.4 倍吞吐提升。后续 Cartridges at Scale 则指出,大集合中直接拼接独立训练的 cartridges 会出现严重退化,需要联合的干扰项混合训练。两者实验范围不同,不能把前者的组合性结论不加条件地扩大到任意集合,更不能进一步扩大到任意模型。CartridgesCartridges at Scale

为什么“已经压缩的 KV”比原生 KV 更难

以下是工程推断,应通过消融验证:

压缩方式 对迁移的额外影响 合理起点
量化 坐标语义尚在,但多了量化噪声 保留量化元数据,在同压缩分布上校准转换器
token 驱逐 删除位置可能恰好是目标模型需要的信息 保留原位置与原文引用;测目标相关 token 召回率
低秩表示 源保留子空间未必覆盖目标的重要方向 预测目标注意力响应,并比较不同 rank
学习型 memory slots / cartridge 槽位可能已无一一对应的原文 token 语义 采用集合/跨注意力编码器和序列级任务蒸馏
文本摘要 易跨模型读取,但摘要可能丢失数字、限定条件、图像细节 结构化事实、原文锚点、选择性重读

不能假设“在原生 KV 上拟合的 T”可以直接消费任意 Q(KV)。压缩与迁移通常不满足交换律,必须比较“先压后迁”与“先迁后压”。

7. MLA、NSA、DSA:迁移对象不在同一个层面

本文按 MLA = Multi-head Latent Attention、NSA = Native Sparse Attention、DSA = DeepSeek Sparse Attention 理解这些简称。

架构事实与迁移推断

架构 原论文中的核心机制 对迁移工具的推断
MHA / GQA 按层缓存键和值,GQA 由多个 query head 共享 KV head 处理层/head 对应、位置、归一化及目标查询空间
MLA 缓存低维 KV latent 与解耦的位置键;可通过权重吸收避免显式展开全部头 应预测目标 latent 与位置分量,而非只适配传统 K/V 张量形状
NSA 粗粒度压缩、细粒度选择及滑窗等分支共同参与注意力 按目标实现恢复分支缓存、块边界和所需元数据;不能只翻译被源查询选中的位置
DSA 在 MLA 路线上引入 lightning indexer 和细粒度 token 选择 除目标主缓存,还需生成/恢复目标索引器所需历史状态

架构依据:DeepSeek-V2NSADeepSeek-V3.2。右栏是本文推断,具体缓存字段取决于实现。

MLA 与 DSA 不是必须二选一的同层分类。 一个模型可以使用 MLA 的紧凑表示,并同时用 DSA 决定读取哪些 token。NSA 和 DSA 也不能作为同一个稀疏算法的别名。

对 DSA,旧模型的 Top-k token 不一定是新模型未来查询的 Top-k。一次迁移应该转移可供未来选择的历史状态,而不是冻结过去某次问题的选择结果。若源缓存已把其他 token 永久删除,目标索引器无法让其重新出现。

“模型架构迁移”与“已有缓存迁移”要分开

MHA2MLATransMLA 研究将已有模型变换、训练为 MLA 架构,提供很有价值的受控实验对象;前者还有 作者代码。这与“给定两个独立训练好的模型,转换一份已产生的历史缓存”不同。

可先用原模型及其 MLA 转换版研究架构差异,再扩展到独立训练的新模型。第一步成功不能证明第二步,但有助于定位误差来自哪里。

是否已有能用的通用工具

检索发现发布者自述支持跨模型转换的 aither-kvcachekv-translator。前者文档还包含 MLA 支持说明。它们应作为实现线索进一步审计,本次没有安装、运行或验证其跨架构准确率;提供类、接口或支持某种张量布局,不足以证明不同代际间语义迁移接近无损。

类似地,LMCache 的布局标准化讨论 解决逻辑布局、物理布局和多种缓存形状的问题。字节能够被另一个引擎加载,与另一个模型能正确理解这些字节,是两个独立验收项。

8. 你要求的“不损害智力、视力”,需要怎样定义

8.1 冻结参数不代表保持有效能力

可以把目标参数完全冻结,但输入了失真的历史状态后,回答仍然下降。所以“没有微调新模型”“KV cosine 很高”“PPL 变化很小”都只是部分证据。

最有意义的参照是同一个目标 B:

这三组必须使用相同问题、提示模板、采样设置和生成预算。源 A 的回答只能作为辅助基准,不能代替目标 B 的原生表现。

8.2 测量“升级收益保留”

除了常规性能保留率,可定义实验指标:

\[ R_{upgrade}=\frac{S(B_{migrated})-S(A)}{S(B_{native})-S(A)}. \]

这不是已有标准,而是本文建议。当 B 比 A 强时,它衡量迁移保留了多少升级收益。例如 A=70、B 原生=90、B 迁移=80,普通保留率约 88.9%,但升级收益只保留 50%。

如果分母接近零或为负,就不应使用该比率;应报告绝对差值与置信区间。多个任务应分别评测,防止一项超出基线掩盖另一项崩溃。

8.3 视觉比文本摘要更容易出现永久信息损失

设旧模型看图后只留下“白板上有公式”。新模型可能原本能读出下标、细小数字或推导错误,但这些信息不一定进入旧摘要或压缩 KV。如果只保留此状态,不能保证新模型以后获得“重新看原图”的全部收益。

这里并不是断言旧视觉 KV 必然只含旧模型能口头说出的信息;内部表示可能保留未显式表达的细节。到底保留多少,应以新模型原生看图为对照实测。 当前所核实的核心 KV 迁移实验主要围绕文本任务,不能外推成多模态无损性证明。

视觉评测应包含小字号 OCR、表格单元格对应、图表细节、空间定位、跨页关联和视频时间顺序;同时测试“升级后的模型在旧图像上能否获得新增能力”。

8.4 已知问题通信与未知未来记忆

已有通信设置可能在压缩时就知道问题 q。对该问题保留相关证据,比在尚不知道未来问题时保存历史更容易。

实验必须设置一组严格的“历史先封存、未来问题后产生”的流程;训练时不让压缩器看到测试查询,并增加罕见事实、随机标识符、数字精确匹配和事后才确定的新任务。

9. 建议的系统结构:稳定记忆加目标读写器

以下是研究提案,并非现成已验证方案。

flowchart LR
    H[原始文本 图像 工具记录] --> A[旧模型 A]
    A --> KA[旧运行状态]
    KA --> EA[源编码适配器]
    EA --> M[带版本的共享记忆 M]
    M --> DB[目标 B 读写适配器]
    M --> DC[未来 C 读写适配器]
    DB --> KB[B 原生缓存或外部记忆接口]
    DC --> KC[C 原生缓存或外部记忆接口]
    H --> R[原始证据存储与检索]
    R --> V[校验与选择性重读]
    V --> KB
    V --> KC

共享记忆至少应区分事实、时间/空间位置、来源锚点、已有推断及压缩版本。目标读写器负责适配模型自己的注意力语义;存储格式可以统一,但这不会自动赋予统一语义。

可以比较两种目标接入方式:

  1. 直接生成目标原生 KV/MLA/索引状态:尽量不改目标推理结构,难点是精确适配和输出状态量。
  2. 通过独立 memory cross-attention 或受控 memory tokens 读取:接口可能更统一,但需要验证额外模块、训练对原模型能力的影响,不能再宣称完全无侵入。

要保留新模型未来重新理解历史的机会,可把原文、图像和工具原始结果放在低成本存储中,把共享潜在记忆用作快速路径。关键证据按需重读;重读比例必须进入性能账单,避免把计算偷偷转移后仍宣称省掉全部 prefill。

建议避免长期只保存 A→B→C→D 每次转换后的唯一副本。可以保留稳定记忆版本或周期性锚点,比较直接 A→D 与连续迁移的差异。循环一致性可帮助约束,但两个互逆映射仍可能共同丢失任务信息,所以不能以循环恢复成功作为语义保真的充分证明。

成本边界

若目标要求显式输出 T 个位置、L 层、每位置 d 个数,则输出写入本身就至少随 TLd 增长。小转换器参数少,不代表无限长历史迁移接近常数时间。

因此应同时优化:适配器大小、每次需要恢复的记忆量、读取延迟、原始材料重读率。只比较转换器的浮点运算而忽略磁盘读、网络传输、解量化、目标缓存写入,会高估实用收益。

10. 可执行的研究与消融计划

阶段一:先把有限模型对做扎实

选择开放权重、可导出内部状态的模型对,冻结源和目标,仅训练转换器。首轮用同 tokenizer、同类注意力隔离语义对齐问题,再逐步改变一个因素。

阶段 变化因素 主要问题
A 同家族不同规模 线性映射/小 MLP 能保留多少升级收益?
B 跨代、相同 tokenizer 权重和表征变化引入多少额外误差?
C 跨家族、不同 tokenizer 逐位置映射是否需要改为 span/集合映射?
D 同源全注意力 → MLA 转换版 单独的缓存结构变化能否处理?
E 独立模型 GQA ↔ MLA 结构变化与表示变化叠加后是否可行?
F MLA ↔ DSA / NSA 主缓存之外的选择和索引状态能否恢复?
G 视觉语言模型跨代 升级后能否继续读取旧图像细节?

模型选择是实验建议,不声称上述每一组已有公开、规模匹配的现成检查点。实际选型时再核验权重、tokenizer、架构与可运行的缓存接口。

阶段二:把压缩加入同一个问题

核心实验网格:

必须包括以下基线:目标原生全历史;目标直接读取文档摘要;检索后原文重读;小模型重读原文后预测目标 KV;无训练形状匹配;同模型压缩。它们分别分离迁移误差、压缩误差和原始信息是否可访问的影响。

阶段三:训练目标不能只拟合 KV

可研究以下组合损失,权重需经独立验证集选择:

\[ \mathcal L = \lambda_{kv}\mathcal L_{state} +\lambda_{attn}\mathcal L_{attention} +\lambda_{kl}D_{KL}(p_B^{native}\Vert p_B^{translated}) +\lambda_{task}\mathcal L_{task} +\lambda_{chain}\mathcal L_{multihop}. \]

输出行为蒸馏最好覆盖多个未来问题和长生成轨迹,而不只是相同前缀下一个 token。教师强制评估有助于控制变量,但还需自由生成,暴露迁移误差造成的分布漂移。

阶段四:评测不只看一个平均分

能力 评测建议 必须观察
长上下文细节 RULER、随机键值、否定条件、缺失答案 位置/长度/稀有度分组的准确率
推理与升级收益 数学、代码及基于历史材料的组合推理 原生 B 与迁移 B 的逐任务差值
长期记忆 LongMemEval / LongMemEval-V2,时间更新与冲突 新旧事实更新、弃答、跨会话关联
视觉 OCR、图表、表格、定位、跨页/视频时序 旧材料上新模型能力增益保留
生成稳定性 长答案、工具调用、反复交接 自由生成错误累积、任务完成率
系统成本 冷加载、热转换、读写、解量化、重读 端到端延迟、显存、存储、摊销成本

RULER 将检索扩展到多跳追踪与聚合,可作为可控压力测试;LongMemEval 官方仓库LongMemEval-V2 官方仓库 提供长期记忆评测入口。使用这些基准不等于它们已经原生评测跨模型 KV 迁移,需要新增模型切换协议。

可把“关键任务绝对下降不超过约 1 个百分点”“连续多次迁移仍保留大部分升级收益”等作为首轮候选目标,但这些阈值是研究设计建议,必须结合基准方差、样本量和实际用途确定,并非行业标准或既有结果。

训练、超参选择、测试应按文档或来源严格分割。除平均分之外报告 paired bootstrap 等置信区间、失败样例、最差任务,以及是否在问题已知时生成记忆。

11. 值得争取的研究贡献

单纯提出“用一个 MLP 把 A 的 KV 转成 B 的 KV”已有明显先例。更有区分度的研究问题是:

  1. Compressed-state migration:源历史已压缩,原文不可用于迁移,能保留多少未来任务能力?
  2. Future-model onboarding:旧记忆写入完成后,新模型才出现;冻结旧表示和旧适配器,仅训练新读写器。
  3. Architecture-aware state translation:覆盖 GQA、MLA 与稀疏索引所需状态,而非仅改变 tensor shape。
  4. Upgrade-gain preservation:以新模型原生能力和升级收益为核心指标,加入强推理与视觉任务。
  5. Repeated migration without drift:反复升级与压缩,比较链式状态、稳定锚点和有限原文重读。
  6. Query-independent memory:封存时不知道未来问题,避免把已知问题通信成果当作通用长期记忆。

这是本次检索后形成的研究空间判断,不构成“这些方向绝无其他工作”的优先权保证。正式论文立项仍需继续跟踪新增论文与相关引用链。

12. 阅读顺序、证据限制与下一步

建议按这个顺序阅读:

  1. 共享空间与新模型接入:K-V Cache Alignment。
  2. 真正跳过目标 prefill:Cross-Model KV Cache Transfer、CacheBridge。
  3. 更异构的状态翻译:MoT。
  4. 小适配器与跨上下文通信:LCF、XKV。
  5. 压缩长期记忆:Cartridges 及其规模化后续。
  6. 小模型辅助与受控架构迁移:KV Prediction、MHA2MLA、TransMLA。

本次结论的局限:近期论文多为预印本;不同论文评测任务、规模、问题可见性和时间口径不同;没有复现训练、检查全部代码或验证发布包;“未发现通用近无损方案”仅描述本次原始来源检索的结果。9 月初的新论文尤其需要后续复现。

最有价值的下一步,是先建立一个小而严格的实验:历史先封存,源目标参数冻结,比较原生 KV 与已压缩 KV 的 A→B 迁移,并同时测细节保留与升级收益。 随后加入新的接收模型,测试旧记忆和旧适配器完全不变时能否兼容。只有这些成立,再扩展到 MLA/DSA 和视觉,才能判断系统是在传递可长期使用的信息,还是只在有限问题上模仿接收者的输出。