Research Hub·← 返回索引Quiet Ink UI
目录 · 16 节1. 定义、范围与证据标准2. 方法地图:状态放在哪里,计算发生在哪里3. 从语言 token 到连续状态4. Soft Thinking:概率混合与真正搜索的距离5. 循环深度与并行工作区6. 小型递归求解器与冻结大模型7. 优化、强化学习与多模态世界状态8. 理论:什么能够证明,什么还不能9. 实验结果:在相同口径里比较10. 因果验证与可解释性11. 工程账本:token、FLOPs、延迟与显存12. 代码:把机制转成可检查的计算13. 可复现实验设计14. 研究机会与优先顺序15. 结论与未决问题16. 参考文献与官方实现

Latent Space Reasoning 深度调研

潜在空间推理正在把模型的内部计算从“生成一串解释文字”,扩展为“迭代更新可供答案读取的状态”。这个方向的价值不在于隐藏思维链,而在于重新分配计算:哪些步骤需要语言、哪些信息值得长期保留、何时继续计算、何时把控制权交还给工具或环境。

本文的判断是:潜在推理已经形成可验证的方法族,但尚不存在一个在通用能力、实际延迟、可解释性和分布外泛化上全面胜出的统一方案。 连续反馈适合研究表示与学习,蒸馏适合压缩已有能力,循环深度适合研究计算扩展,冻结解码器适合模块化试验;世界模型则必须在真实环境闭环中评价。以下按计算机制建立地图,逐项审查证据,再给出工程实现与可证伪的研究路线。

1. 定义、范围与证据标准

1.1 一个能够指导实验的定义

本报告将 Latent Space Reasoning 定义为:在最终输出之前或输出之间,通过非自然语言的内部状态承载中间问题求解过程,并对这些状态进行有目的的变换、迭代、搜索或优化。 单纯存在 hidden state 不足以构成一种新的推理方法;必须指出状态如何更新、增加了什么计算,以及这种改变如何影响结果。

需要区分三个经常被混用的“latent”。统计学上的潜变量可以是一整段离散文字;神经网络中的潜在表示可以是普通前向传播的激活;连续潜在推理则明确让向量成为下一步计算的输入。例如 LaTRO 把推理视为潜变量建模,并不因此等同于 Coconut 的连续向量反馈。R1 R2

一个实用的描述元组是:

=(𝒵,Fθ,Dθ,,πstop,𝒞).

其中,状态空间 𝒵 决定存什么;更新算子 Fθ 决定如何想;解码器 Dθ 决定如何读出答案;训练目标 决定哪些状态受到奖励;停止策略 πstop 决定想多久;成本账本 𝒞 决定这种方案是否值得采用。这个元组是本文的分析框架,不是某篇论文的标准命名。

1.2 阅读路线与边界

希望先把握方法差异,可读第 2—7 节;希望判断实验结论是否可靠,可读第 8—11 节;准备复现或选题,可读第 12—15 节。核心对象是 LLM 内部推理,同时纳入视觉与世界模型,以解释“语言推理的隐状态”与“环境状态的预测”之间的关联和差异。

证据核查截至 2026-09-10(美国太平洋时间)。采用原论文、作者代码与基准组织者分析;新近预印本按具体版本讨论,不把预印本自动视为已被独立验证。表格中的数字均为论文作者或明确标识的外部分析自报,本文没有重新训练大型模型。

证据层级 可以支持什么 不能单独支持什么
构造性理论 在指定架构、宽度、编码与任务条件下存在一个解 常规预训练一定学得该算法
受控实验 某个改动在固定实验条件下改善结果 跨模型、跨任务、跨硬件都有效
因果干预 某段状态在特定干预下影响预测 一个 probe 可读出的概念就是模型唯一推理机制
系统实测 指定硬件、批量与实现的耗时或吞吐 token 节省与其他硬件加速等比例
研究建议 值得通过实验检验的假设 已实现、已复现或已证明的结论

2. 方法地图:状态放在哪里,计算发生在哪里

图 1 · 潜在推理的三个设计轴先判断状态载体,再判断更新方式,最后核对监督与成本。它们可以组合,不是互斥产品分类。状态载体向量 / 分布 / 工作区更新方式反馈 / 迭代 / 优化训练与评价监督 / 探索 / 预算单位置连续状态Coconut / Soft Thinking共享深度与并行 slotHuginn / Ouro / LOTUS教师或奖励引导CODI / HRPO / LTF草稿与辅助状态TRM / SoftCoT / LRT未来环境与动作Dreamer / V-JEPA公平评价质量 × 成本 × 因果共同问题:状态存了什么?多算了多少?哪部分真正改变了答案?
图 1 · 潜在推理的三个设计轴。先判断状态载体,再判断更新方式,最后核对监督与成本。它们可以组合,不是互斥产品分类。
路线 中间表示与更新 通常训练什么 推理成本的主要变化 代表工作
思维链内化 把显式步骤能力迁入层间计算 学生或同一模型 减少输出位置,但能力可能被压缩 Implicit CoT、Stepwise Internalization R3 R4
连续自回归反馈 末层状态作为下个位置的 embedding 主模型及可选投影 每个潜在位置仍要一次依赖前步的计算 Coconut R2
概率混合 词表分布加权输入嵌入 可不训练,也可训练随机策略 保留词表头与混合计算 Soft Thinking、Stochastic Soft Thinking R5 R6
蒸馏与辅助提案 把教师信息映射到少量连续状态 主模型或小型模块 训练开销换取推理压缩 CODI、SoftCoT R7 R8
循环深度 共享层反复更新同一组位置 循环主干与停止策略 增加深度,不一定增加序列长度 Huginn、Ouro、LoopFormer R9 R10 R11
并行潜在工作区 多个 latent slot 同时迭代并接受步骤监督 改造后的主干 用空间并行换取较短串行路径 LOTUS R12
小模型递归求解 交替更新草稿与潜在状态 任务求解器 小参数量、多轮计算 HRM、TRM R13 R14
状态优化 对连续状态做能量下降或学习的修正 能量函数或修正器 需要优化迭代,有时需要反向传播 EBM-CoT、LRT R15 R16
潜在世界模型 预测动作后的环境表示,再选择动作 编码、动力学、价值或策略 规划成本与真实交互成本交换 DreamerV3、V-JEPA 2 R17 R18

“推理位置数”“循环次数”“搜索分支数”是三种不同资源。一个方法可以只用 8 个 latent slot,却循环 16 次;另一个方法可以用 128 个位置、一次并行处理;第三个方法可以对 8 个候选轨迹分别推理。仅比较“用了几个 token”会丢掉大部分计算结构。

分析推论: 更合理的分类不是“有没有 CoT”,而是“信息如何保存、串行依赖如何组织、额外计算是否能转换成质量”。同一系统也可以同时使用多条路线:先用小型提案器产生状态,再循环修正,最后生成一段简短的可验证证明。

3. 从语言 token 到连续状态

3.1 标准自回归的两个接口

EV×d 为输入嵌入矩阵,WV×d 为输出头,htd 为最后位置的隐状态。普通解码过程可写成:

pt=softmax(Wht),xt+1~pt,et+1=E[xt+1].

这里发生两次不同的转换:先把状态映射为词表概率,再选择一个离散符号并查表。连续方法可以绕过其中一部分,但“去掉采样”与“去掉语言头”并不是同一个操作。

3.2 Coconut:把最后状态反馈为下一位置

Coconut 在潜在阶段使用 et+1=ht,通过阶段式课程逐步把前几个显式推理步骤换成连续位置,再在剩余文本与答案上训练。原论文的目标是学习有利于后续预测的状态,而不是要求每个向量逐字复原被删除的文本。R2,§3

图 2 · 三种反馈接口三条路径都依赖先前计算,但只有直接状态反馈绕过潜在阶段的词表概率头;历史缓存仍可能持续增长。隐状态 h词表概率 p采样 token输入嵌入 E[token]隐状态 h词表概率 p概率加权混合连续输入 Eᵀp隐状态 h直接反馈 / 已训练投影下一位置输入 h显式 CoTSoft ThinkingCoconut 式连续反馈
图 2 · 三种反馈接口。三条路径都依赖先前计算,但只有直接状态反馈绕过潜在阶段的词表概率头;历史缓存仍可能持续增长。

这带来两个实现后果。第一,连续位置依赖前一位置,不能把“所有 latent 输入”预先当作已知文本一次性计算完。第二,潜在位置通常仍写入注意力缓存,未来位置读取的是整段历史的 K/V 与当前输入;实际递归状态远不止一个 d 维向量。

工程推论: 若框架宣称只保存最后一个向量即可完全恢复 Coconut 的推理,需要验证它是否也保存了注意力缓存、位置编号与边界标记。忽略这些状态,得到的通常是另一种模型。

3.3 课程学习压缩的是学习难度

以一条含三个文字步骤的训练样本为例,逐步替换课程可以表示为:

图 3 · 逐步替换的训练课程这是 c=1 的简化示意。显式步骤的文本长度不固定,一个步骤不等于一个语言 token。阶段 0文字步骤 1文字步骤 2文字步骤 3答案阶段 1latent 1文字步骤 2文字步骤 3答案阶段 3latent 1latent 2latent 3答案每个阶段都要重新学习如何利用当前可见信息完成后续预测。
图 3 · 逐步替换的训练课程。这是 c=1 的简化示意。显式步骤的文本长度不固定,一个步骤不等于一个语言 token。

早期阶段提供可学习的中间结构;后期阶段迫使模型在没有这些可见步骤时仍输出正确答案。Stepwise Internalization 通过逐步删除文字步骤训练隐式能力;CODI 则联合显式与隐式任务,并对特定位置的隐状态进行自蒸馏。二者都说明,训练时使用解释与推理时输出解释是可以分离的。R4 R7

下面是用于理解多目标训练的统一写法,不是所有方法共同采用的原始损失

=answer+λtextteacher+λalignPzsg(hteacher)1.

其中 sg 表示停止梯度,P 表示可选投影。答案损失约束任务可用性,教师损失维护显式能力,对齐项约束两种计算路径的信息接口。真实复现必须核对原实现的损失尺度、对齐位置、是否共享参数与梯度路径,不能用这个示意公式直接替代论文配方。

分析推论: 压缩潜在状态不是普通文件压缩。教师推理往往包含冗余解释,也可能包含错误;学生的目标是保留足够的任务信息。压缩过强可能把可组合算法退化为分布内捷径,因此验证不能止于同分布准确率。

3.4 2026 年的理论进展:可学会内化,也可能损失外推

Log-ICoT 在特定 parity 学习设置中,使用分块删除的课程,将步骤吸收到多层 Transformer,给出多项式样本复杂度的保证;结论依赖指定任务与训练条件。R19 Learning through Internalization 同时研究半自动机任务中的内化与分布外性能退化,并对简化 parity 设置给出可学习性分析。R20

两者合起来更适合支持一个有限结论:中间过程可以成为学习脚手架,推理时未必需要原样保留;但删除脚手架后是否仍可扩展到更长、更难的任务,需要单独测量。 不应由 parity 构造直接推出任意数学证明、程序合成或工具规划都能被固定深度无损吸收。

4. Soft Thinking:概率混合与真正搜索的距离

4.1 数学形式与表示边界

Soft Thinking 用词表概率构造连续输入:

et+1=v=1Vpt(v)E[v]=Ept.

原方法提出无需额外训练的连续概念 token,并在数学、代码任务报告收益;其官方实现使用专门的推理路径。R5 C2 与直接 hidden-state 反馈不同,该表示受输入嵌入凸包限制,而且需要计算词表概率。

数学推论: 这个混合向量可以同时含有不同候选的信息,但不等于分别执行了每条候选路径。对于非线性更新函数 f,一般有:

f(ipiei)ipif(ei).

左边只计算一次混合输入,右边需要逐个计算分支再汇总。除非额外证明网络实现了相应的组合运算,否则不能把一次混合前向传播说成“免费遍历了多个完整推理树”。

4.2 为什么 soft 也可能变得贪心

Wu 等人的诊断发现,所测大推理模型常主要跟随 soft 输入中概率最高的 token,形成 greedy feedback;加入 Gumbel 或 Dirichlet 随机性能够改善这一现象。R6 这与概率混合存在更多表示可能性并不矛盾:可表示的东西多,不代表训练后的网络会充分使用它。

Gumbel-Softmax 的示意形式为:

p~i=exp((i+gi)/τ)jexp((j+gj)/τ),gi=log(logui),ui~U(0,1).

温度 τ 控制平滑程度,噪声提供探索。低温下更接近离散选择,高温下混合更强,但可能离开模型熟悉的输入分布。随机性是否有益,应与相同采样预算的离散 CoT 对照,而不是只与 greedy decoding 比较。

4.3 两类证据必须一起看

问题 必要对照 应观察什么
收益来自连续输入吗 同温度、同 top-k/top-p 的离散采样 质量—计算曲线是否仍改善
是否使用非最大概率候选 保持 top-1 不变、改变其余概率质量 后续状态与答案是否出现可预测变化
是否同时保留多个推理分支 分支可独立验证的合成任务 从状态恢复候选,并做分支选择干预
是否只是减少冗余文字 更短 CoT、同长度 latent、同计算 CoT 在匹配预算后是否仍有收益
随机性是否只是增加试次 同 seed 数与候选数的 sampling baseline pass@1、pass@k 与 verifier 开销分开

研究概率混合最值得保留的观点是“输入接口可以是分布”;最需要避免的推断是“分布接口天然意味着并行推理”。

5. 循环深度与并行工作区

5.1 从 Universal Transformer 到大规模循环预训练

Universal Transformer 已将共享变换与逐位置动态停止结合;ACT 更早研究如何学习输入与输出之间的计算步数。R21 R22 近年的关键变化是将这些想法扩展到语言模型的预训练规模与推理计算预算。

一个通用循环表达式是:

z(r+1)=Fθ(z(r),u),p(yx)=Dθ(z(R)),

其中 u 是输入编码,r 是内部迭代深度,不是文字序列位置。共享参数可节省模型权重,但每次迭代的矩阵计算仍然存在。

Huginn 工作报告训练 3.5B 参数模型、使用 800B token,并通过增加 recurrent depth 改善多种任务;这是将潜在迭代作为推理时计算轴的实证。R9 Ouro 则把循环预训练、深度分配与更大数据规模结合,公开 1.4B 与 2.6B 模型;论文 v5 配方跨多个训练阶段,不能将其收益单独归因于“循环”两个字。R10

图 4 · 序列长度与循环深度左侧不断追加位置,右侧复用更新算子处理同一组位置。权重复用减少参数,不消除每轮计算。增加序列位置增加内部深度xz₁z₂状态 Z⁽⁰⁾共享算子 Fθ历史位置通常进入 K/V 缓存串行依赖:z₁ → z₂ → …循环 r=1…R;缓存策略单独核对
图 4 · 序列长度与循环深度。左侧不断追加位置,右侧复用更新算子处理同一组位置。权重复用减少参数,不消除每轮计算。

5.2 参数效率、计算效率、内存效率各指什么

设前处理、共享核心、读出层的参数量分别为 Ppre,Pcore,Pout,每轮计算成本为 Ccore。一个粗略模型是:

P=Ppre+Pcore+Pout,C(R)=Cpre+RCcore+Cout.

因此,复用 8 次的 1B 核心仍只有约 1B 核心权重,却不是只做了 1B 模型的一次工作。所谓等效展开参数量可以描述计算规模,但不意味着它拥有同样数量的独立可学习参数。

注意力缓存取决于架构。若每轮都保留独立 K/V,缓存可能随循环次数增加;若共享、压缩或覆盖缓存,则改变了可读取的历史状态。是否在 KV 上节省内存必须通过具体实现说明,不能从“序列长度未增加”直接推出。

5.3 LoopFormer:训练不同预算下的轨迹

LoopFormer 用时间与步长条件以及 shortcut-consistency 训练,让不同迭代长度产生协调的状态轨迹。R11 其论文表 1 也显示,弹性深度不等于在每个预算下都胜过专门训练的同计算基线:在最低预算设置,固定深度基线仍可能更好。

分析推论: 任意加大循环次数不是安全的部署按钮。训练时只看到短循环的网络,推理时更长的轨迹可能停滞、震荡或偏离有效区域。需要同时画出准确率、状态变化、答案稳定率与耗时随深度变化的曲线,而不是只报告最好的一轮。

5.4 LOTUS:为潜在位置提供更直接的监督

LOTUS 让多个 latent block 并行迭代,在位置上提供与 CoT 步骤 token 对齐的交叉熵监督。其关键区别是同时改变计算拓扑与监督密度,而不只是把文本换成向量。R12

一种说明监督角色的写法是:

Lstep=k,jlogpθ(sk,jzk,j(R)),L=Lanswer+λLstep.

这仅表示步骤监督与答案监督的关系,具体位置布局与掩码依照论文。并行监督意味着训练能够同时约束多个中间位置;不意味着推理时所有步骤相互独立,也不意味着把训练时的正确步骤输入了测试问题。

分析推论: 对这类方法,最重要的复现检查是 teacher forcing 与 inference 的分界。若训练时 latent slot 能看到其要预测的 gold token,却在测试时失去这一信息,漂亮的训练损失可能来自泄漏。应明确列出每一类位置在每轮能够读取哪些 K/V。

6. 小型递归求解器与冻结大模型

6.1 HRM 和 TRM:用草稿与工作状态反复求解

HRM 使用高、低层级两个循环模块;TRM 简化结构,以小网络反复更新潜在状态与当前答案,并研究深监督、梯度与模型容量的影响。R13 R14 这些结果主要来自 Sudoku、迷宫、ARC 等结构化任务,任务接口与通用语言模型不同。

可以用如下概念式理解两种状态的作用:

zr+1=fθ(x,yr,zr),yr+1=gθ(yr,zr+1).
yr

是当前候选答案, zr

是帮助修订的内部工作状态。它们允许模型修正整份结构化输出,而不是只能在已生成文本尾部继续追加。

参数少并不等于没有大量训练计算。ARC 的数据增强、测试期适配、投票与候选选择都可能贡献收益;ARC Prize 的分析强调了 HRM 比较中应控制这些因素。R23 所以,某个数百万参数专用求解器在 ARC 上强于一个语言模型,不足以说明它在通用知识、语言、代码或工具操作上全面更强。

6.2 SoftCoT:学习向冻结模型提供连续提示

SoftCoT 使用固定辅助模型生成实例相关的 soft thought,再训练投影把它映射到主 LLM 的输入空间,避免更新主模型权重。R8 这种设计把“生成工作状态”与“利用已有语言能力读出答案”分开,降低参数训练范围。

但冻结主模型并不意味着训练不需要经过主模型的梯度计算。若训练损失位于主模型输出,梯度通常仍需穿过它到达输入投影;可以不保存权重梯度,却不能随意切断输入梯度。推理时也要把辅助模型成本算进去。

6.3 LRT:提案后再循环修正

2026 年 9 月的 LRT 用任务专用 proposer 提供初始 latent,再用小型 recurrent reasoner 做有界残差修正,最后由冻结 Qwen3-8B 解码。论文受控对照中,HumanEval pass@1 为 37.8%,SoftCoT 为 20.7%,non-thinking-mode CoT 为 15.9%;另一张非计算匹配参考表中,thinking mode 为 92.1%。R16,表 1—2

这些数字支持“小模块在某个冻结解码器设置下有增益”,不支持“已超过完整 thinking 模型”。模块按任务族训练;它不是一个不训练即可通吃全部任务的统一模型。

分析推论: 这条路线值得工程试验的原因,是它允许在不重训整个主干的前提下研究迭代机制。真正应补的基线包括同参数量的深前馈 proposer、同算力的更宽 proposer、LoRA、普通 soft prompt 与更长离散采样;这样才能知道收益究竟来自递归、容量还是监督。

6.4 BDH-CQ:把上下文学习与循环记忆结合

BDH-CQ 把示例写入循环记忆,再对查询进行潜在迭代。论文报告 150M 配置在 public ARC-AGI-1 evaluation 达到 29.5% pass@2,估算成本为每任务 0.0007 美元。R24

此处 pass@2、公开评测集合和估算成本都是结论不可省略的组成部分。它不是 pass@1,也不能与隐藏集合、其他价格假设或不同测试期训练协议直接排行。该工作作为近期预印本更适合被视为“值得独立复核的成本工作点”。

7. 优化、强化学习与多模态世界状态

7.1 把推理写成状态优化

能量式方法把“好状态”建模为较低能量,然后在推理时更新状态。例如 EBM-CoT 学习校准潜在思维的能量函数,用于提升轨迹一致性。R15 一个通用优化模板为:

zr+1=zrηzEϕ(zr,x)+σϵr.

这里优化的是输入状态,不一定是模型参数;σ=0 是确定性下降,非零噪声允许随机探索。这个表达式描述一个方法族,不表示所有 EBM 都采用相同采样器。

分析推论: 能量下降只证明优化了学到的目标。若目标与正确性脱节,优化可能让模型越来越自信地答错。需要用未用于训练能量函数的题型、独立 verifier、状态扰动和分布外任务检查能量是否仍可作为进度信号。

推理期反向传播也会改变部署条件。普通生成服务器通常只为前向推理优化;能量迭代可能需要保留计算图、不同内存管理和额外 kernel。因而“冻结权重”“没有 fine-tuning”“training-free inference”这几个表述,都不等于推理成本很低。

7.2 连续策略的 RL:随机性必须有明确来源

HRPO 使用可学习门控混合 sampled token embedding 与先前隐状态,通过离散采样保留随机性,并逐步扩大连续状态的贡献。R25 一个说明其接口的示意式为:

et=(1gt)E[xt]+gtPht1,0gt1.

若采用真正的连续随机策略,可以定义:

zt+1~qϕ(·zt,x),J(ϕ)=E[R(y)λC(z)].

实现推论: PPO/GRPO 的概率比需要来自实际采样分布。不能把确定性向量的变化当作 token log-prob;必须明确是优化离散采样、连续密度、停止决策,还是利用可微 reward 做路径导数。这四种方法有不同的梯度估计与探索性质。

Latent Thought Flow 使用连续 GFlowNet 建模变长潜在轨迹,使采样分布兼顾答案质量与计算成本;这把“只找到一个高回报终点”扩展为“为多个可行轨迹分配概率”。R26 其潜力在于多样性与预算的统一建模,难点则是稀疏回报、连续密度与训练稳定性。

7.3 学会停止也是推理能力的一部分

Adaptive Latent Reasoning 在 Llama 3.2 1B、GSM8K-Aug 设置中,通过 SFT 后 RL 压缩潜在推理长度;论文报告总推理长度减少 52%,同时保持准确率。R27 这是长度控制的证据,并不自动等价于 52% 的端到端延迟下降。

一种预算优化目标是:

maxπ E[Q(y)]s.t.E[C]B.

实际使用中还要关注尾部:平均预算合格可能掩盖少数请求极慢。停止策略至少应比较固定深度、随机深度、置信度阈值、状态收敛阈值和学习式停止。若模型在某些题上越想越差,“输出稳定”也未必表示“答案正确”。

7.4 视觉 latent:监督目标本身需要学习

Scaffolding Minds 在视觉潜在推理中学习专用 scaffolding encoder,并让 RL sampler 学习均值与方差。论文表 1 中,FrozenLake 平均准确率由 VaLR 的 65.5% 提升到 75.0%;32×32 设置为 36.0% 对 55.0%,差值分别是 9.5 与 19.0 个百分点R28

分析推论: 在视觉推理里,潜在状态不仅需要压缩语言步骤,还要保留空间关系、对象身份和任务相关约束。如果教师图像编码器丢掉了细粒度关系,学生再强也只能学习一个不充分目标。因此,编码器质量、视觉辅助信息是否在推理时可用、空间泛化划分都应单独做消融。

7.5 世界模型:优化对象从答案变成未来行动

DreamerV3 学习环境模型,并通过想象轨迹改进行为;MuZero 学习与规划相关的奖励、策略与价值量,再结合搜索。R17 R29 V-JEPA 2 将视频表征学习与动作条件世界模型连接,用潜在预测支持机器人图像目标规划。R18

图 5 · 潜在规划的环境闭环模型中的预测必须通过实际动作和新观测接受检验。内部迭代深度与环境时间步是不同维度。真实观测图像 / 状态编码器潜在状态 z预测与规划候选动作轨迹执行首个动作接收反馈目标、代价与终点距离
图 5 · 潜在规划的环境闭环。模型中的预测必须通过实际动作和新观测接受检验。内部迭代深度与环境时间步是不同维度。

一个概念性规划目标可以写为:

z^t+1=Fθ(z^t,at),a0:H1*=\argmina0:H1[t=0H1c(z^t,at)+d(z^H,zgoal)].

如果规划变量是动作,这与直接优化 LLM 的 hidden state 不同;如果模型内部还有循环深度,那么环境时间 t 与内部迭代 r 又是不同维度。Looped World Models 将共享迭代引入环境潜在状态的预测,是两条路线结合的近期技术报告。R30

分析推论: 预测 latent 很准仍不充分。真正的评价对象是执行计划后能否达到目标、面对新观测是否修正、模型误差是否被规划器利用。只在离线 latent 距离上得分好,不能直接宣称具有可靠物理规划能力。

8. 理论:什么能够证明,什么还不能

8.1 连续表示可以存集合,但容量不是无限的

Reasoning by Superposition 给出了特定双层 Transformer 的图可达性构造,以与图直径相关的连续步骤推进多前沿搜索;其宽度随相关词表规模增长。论文与离散 CoT 的已知构造作比较,不应改写为所有离散算法都必须使用二次步骤的普遍下界。R31

把节点集合编码成向量是一种直观方式。对邻接矩阵 A 和已访问指示向量 bt,可构造:

bt+1=1[bt+Abt>0].

每轮扩展所有当前可达节点;这说明“一个向量表示多个候选”在某类任务上是有操作意义的。但这个示意运算使用了显式图结构与专用阈值,并不意味着一个普通 LLM 的 soft embedding 自动实现了它。

数学分析: 有限精度下,d 维、每维 b bit 的向量最多承载约 db bit 的离散编码容量;可稳健读取的有效容量通常还受噪声与几何分离限制。若维度、精度或缓存随问题规模增长,复杂度账本必须一起增长。把所有信息藏进“一个实数”不能作为现实硬件的免费计算论证。

8.2 表达能力、可学习性、优化可达性是三层问题

“存在一组参数可解”是表达能力;“给定训练分布能用合理样本学到”是可学习性;“常见优化器在实际资源下找到该参数”是优化可达性。三者不能互相替代。

例如,多路径状态有合适的理论构造,却可能在实际训练中收敛到单路径捷径;一个可读出的算术中间量,也可能只是与答案相关的副产物。理论的最佳用途是提出精确的任务族和反例,指导测量,而不是替代测量。

8.3 内部循环的稳定性与计算深度

对局部扰动有近似关系:

δzr+1JF(zr)δzr,zRz0=r=0R1JF(zr).

Jacobian 的连乘解释了为什么反复迭代容易遇到梯度消失、放大或状态漂移。在固定点附近,谱半径小于 1 是常见的局部收敛条件;非线性全局稳定性需要更强假设。

分析推论: 过度强调收敛也可能损伤计算。如果所有状态过快收缩到同一区域,网络可能在还没有完成多步推理时就丢掉分支信息。一个好的潜在求解器需要“可持续变换的中间过程”和“可校准的终止”,而不只是越快接近固定点越好。

8.4 Pause token 提醒我们:收益可能来自训练过程

早期 Pause Tokens 通过插入可学习暂停位置给模型更多处理机会。R32 2026 年 9 月的 Mode Retention 研究则提出,边界暂停及损失掩码会改变微调的保留—适应关系,收益不一定只来自推理时计算量。R33

同月的 Almost Free State Prediction Separation(早期标题为 Free Pause Tokens)分离 state 与 prediction stream,报告一个不增加序列位置的设计。R34 它主要提供 next-token prediction 与训练效率证据,不能仅凭“pause”命名当作复杂推理能力已经提升的结论。

综合判断: 当改动了训练课程、掩码、损失或目标位置后,即使部署时减少 latent 步骤仍保留收益,也可能是训练形成了更好的普通表征。这个发现有工程价值,但不应包装成“推理时潜在搜索”机制已获验证。

9. 实验结果:在相同口径里比较

9.1 Coconut 的收益明显依赖任务

以下取 Coconut v3 表 1 的均值,仅比较同篇论文同组设置;准确率单位为百分比。表中模型为该节 GPT-2 实验,训练与分析设置应参照原文 §5;这些不是不同年份最新方法的跨论文排行榜。R2

方法 GSM8K ProntoQA ProsQA
显式 CoT 42.9 98.8 77.5
Coconut 34.1 99.8 97.0
Coconut 无 thought 变体 21.6 99.9 95.5
GPT-2 同组实验中,Coconut 在 GSM8K 低于 CoT,在 ProsQA 高于 CoT;无 thought 变体在逻辑任务仍较强。
图 6 · 同一方法在不同任务上的收益方向不同。数据:Coconut v3 表 1;柱高是均值,原表有跨实验波动,本图不绘制误差条。

GSM8K 上低于 CoT,ProsQA 上高于 CoT,是同一种方法的两面。无 thought 变体在部分逻辑任务仍很强,也提示训练或数据结构可能解释相当一部分收益。不能从一个强项推出一般推理优势,更不能只挑相对改进最大的任务进行展示。

9.2 LOTUS 的准确率与延迟需要一起读

下面使用同一篇 LOTUS v2 的表 1—2,骨干为 Llama-3.2-3B-Instruct,训练集为 GSM8K-Aug;耗时为该论文 GSM8K 测试设置的平均 ms/example。它们不是本报告测得的硬件结果。R12

方法 GSM8K 准确率 思考阶段 ms 端到端合计 ms
显式 CoT 71.5 338.8 384.2
CODI 60.8 88.2 135.1
LOTUS 70.0 ± 0.9 133.0 181.2
CoT 总耗时 384.2 毫秒,LOTUS 181.2 毫秒,CODI 135.1 毫秒。准确率需要同时参照上表。
图 7 · 分阶段耗时。数据:LOTUS 表 2,Llama-3.2-3B-Instruct / GSM8K;这些是作者报告的平均值,不是本站实测。

由表内数值计算:思考阶段加速为 338.8/133.02.55;合计加速为 384.2/181.22.12。CODI 在这组数据中更快,但准确率较低;因此不存在把“最快”和“最准”同时颁给同一方法的依据。论文另有自然语言 CoT 设置,不能把那里的最大加速倍数搬来描述这个表。

9.3 Soft Thinking 的采样基线会改变结论

以下取 Wu 等人 v4 表 1—2 的 DeepSeek-R1-Distill-Qwen-32B、MATH500 列,指标为 pass@1(%);论文对部分小规模竞赛基准另外使用 Average@32,因此此处不混合那些列。R6

解码方式 MATH500 pass@1
离散 greedy 92.20
离散 sampling 94.50
Vanilla Soft Thinking 91.60
Gumbel Soft Thinking 96.00

原 Soft Thinking 论文 v1 表 1 的同名 DeepSeek-R1-Distill-Qwen-32B / MATH500 配置,报告离散 CoT 94.50%、Soft Thinking 95.00%;后续诊断表里的 Vanilla Soft 为 91.60%。这不是一组可以直接合并的重复测量:两篇论文的实现版本、采样与运行细节必须逐项对齐,才能判断差异来源。本文保留这一分歧,不据此认定任一结果错误。R5 R6

这组诊断结果支持随机化 soft 方案值得探索,同时反驳“任何 soft mixture 都会优于 token sampling”。它也说明 baseline 不是表格里的次要注脚:把随机 soft 方法只与 greedy 比较,可能高估机制贡献。

9.4 为什么本报告不做一个统一总榜

各方法分别使用 GPT-2、Llama、Qwen 或从零训练网络;监督数据、训练 token、测试采样次数、测试期适配、答案提取与成本估算也不同。把准确率、pass@2、平均多次采样结果和机器人成功率放在同一个柱状排名中,视觉上简单,却没有可靠含义。

应当维护“实验单元”:每一行绑定论文版本、checkpoint、任务划分、训练预算、推理策略、指标、设备与计时边界。缺少字段时标为未报告;不要用估算值补成看似完整的排行榜。

10. 因果验证与可解释性

10.1 解码得出内容,并不证明模型使用了它

一个 probe 能从 latent 读出“答案是 42”,可能因为该信息已经由其他路径确定;它不证明这个 latent 导致了答案。要证明机制,需要比较具有明确语义的状态干预前后,后续计算是否按预测变化。

Dilgren 与 Wiegreffe 在 Coconut、CODI 和多个骨干上的研究发现,逻辑任务的 latent token 经常可省略;在确有作用的正确样本上,又能恢复相当比例的 gold reasoning traces。R35 这同时提醒我们:“不可读”与“全新算法”之间没有必然联系,“可读”与“忠实”之间也没有自动保证。

10.2 一个逐级加强的检查流程

图 8 · 从相关性走向因果证据每一级需要更强的控制。既要检查当前向量,也要检查缓存与其他读取路径。读出信息probe / 解释解码检查必要性删除 / 提前停止语义干预配对事实替换独立验证器路径 / 算术 / 测试结构外推更宽 / 更深 / 新组合缓存与路径定位K/V / 输入 / 读出可读 ≠ 忠实;不可读 ≠ 新算法;不敏感 ≠ 一定没有作用。
图 8 · 从相关性走向因果证据。每一级需要更强的控制。既要检查当前向量,也要检查缓存与其他读取路径。
  1. 必要性检查。 提前停止、删除部分 latent、限制缓存可见性,测准确率与答案变化。删掉 latent 时要控制计算预算,否则可能把少算几步误当成表示失效。
  2. 语义替换。 用只改变一个中间事实的配对样本替换状态,预先规定答案应如何变化。单纯加高斯噪声容易只测出分布外脆弱性。
  3. 路径定位。 区分当前 latent、历史 K/V、输入编码和读出头;仅改最后向量可能遗漏真正承载信息的缓存。
  4. 充分性检查。 在其他捷径受控后,检查该状态是否仍能支撑正确答案。
  5. 泛化检查。 增加图宽度、推理深度、数值范围或对象数量,判断机制是否在训练分布之外继续工作。

Do Latent Tokens Think? 对特定 COCONUT 设置做 steering 与数据捷径分析,提出潜在位置可能未承载忠实推理。R36 这一结论应限定到其模型、任务与干预,不可一刀切地否定所有连续推理架构;“某种干预没效果”也可能意味着干预未命中有效子空间。

10.3 解释应当能够接受反事实检验

SELR 用同一个模型联合优化答案与 latent-to-text CoT 解码,试图让潜在状态既有任务效用又可解释。R37 它改善了解释接口,但解释正确是否意味着忠实,仍需要状态干预与解释—答案联动检验。

研究建议: 给解释增加一个可验证层。例如算术步骤必须可执行、图搜索给出实际边、代码推理给出可运行测试。再修改一个中间事实,检查解释和最终答案是否一致变化。这样得到的不是“读起来像思考”,而是一个有外部约束的说明接口。

11. 工程账本:token、FLOPs、延迟与显存

11.1 先明确串行关键路径

总耗时可分为:

T=Tprefill+Tlatent+Tanswer+Tverify+Truntime.

连续反馈主要缩短文字生成路径,但可能仍需逐个 latent 位置解码;循环模型可能增加每个位置的深度;并行 latent block 可以缩短串行步骤,却扩大每步的工作量。实际速度取决于算力利用率、带宽、kernel 调度与批处理。

对于同层数、同实现的连续反馈模型,可用下面的粗略近似分析 KV 存储:

MKV2BLeffNHKVdhb.
B

为批大小, Leff

是实际保存缓存的层/轮组合数, N

为总位置数, HKV

为 KV head 数, dh

为 head 维度, b

为每元素字节数。前面的 2 表示 key 与 value。该公式不包含权重、激活和 allocator 开销;共享缓存的循环模型应按实际结构重新计数。

11.2 训练成本经常比推理演示更难

连续位置的展开会延长反向传播路径;主模型冻结仍可能需要输入梯度;全量 hidden-state 对齐增加激活保存。梯度检查点、截断反传、停止梯度或近似梯度可以缓解,但也会改变优化目标或梯度估计。

工程建议: 把峰值显存拆成权重、优化器、激活和 KV;记录每个 update 的有效样本数与 token 数。只报告“可训练参数占比 1%”不能说明训练成本为全量微调的 1%。同时记录验证频率,避免把大量模型选择开销排除在预算之外。

11.3 动态停止与吞吐的冲突

单个请求可以在第 4 轮退出,但同批另一个请求要 16 轮。如果运行时不会把已完成样本移出批次,墙钟时间仍接近最长样本。能否重新组批、不同循环深度是否造成同步、缓存如何迁移,会决定算法上的节省是否实现为系统收益。

因此应至少报告 batch=1 的延迟和固定服务负载下的吞吐。更进一步,用 p50/p95 延迟、峰值显存和每秒正确回答数展示实际收益。不同服务目标可能选择不同最优方法:交互产品在乎延迟尾部,离线批处理更在乎单位资源吞吐。

11.4 预算计算器:先学会分清比较口径

下方工具仅进行代数计算,不是模型性能预测器。默认值使用第 9.2 节的 LOTUS 表 2;可以修改前处理、思考和答案耗时,观察局部加速怎样被其他阶段稀释。

各阶段耗时(毫秒)
方案输入思考答案
基线
新方案
基线 384.2 ms → 新方案 181.2 ms;总加速 2.12×,思考阶段 2.55×。

11.5 一个值得记录的最小结果协议

{
  "paper_version": "exact-version",
  "model_revision": "immutable-checkpoint-or-commit",
  "dataset_split_hash": "content-hash",
  "training": {"examples": 0, "updates": 0, "compute": "measured"},
  "inference": {"latent_steps": 0, "loops": 0, "samples": 1},
  "metric": "pass@1",
  "hardware": {"device": "record-actual-device", "batch_size": 1},
  "latency_ms": {"prefill": 0, "latent": 0, "answer": 0, "verify": 0},
  "peak_memory_bytes": 0,
  "seed": 0
}

这是用于实验设计的字段示例,零值是占位值,不能当作已有实验结果。对生产评估再加入并发数、请求分布、调度方式和冷启动情况。

12. 代码:把机制转成可检查的计算

以下三个 Python 示例使用标准库,可独立运行。它们用于检验数学机制与成本口径,不是大型语言模型的复现结果。随后给出面向真实模型的算法伪代码,明确训练与缓存需要接入的位置。

12.1 为什么混合输入不等于并行求解

from math import isclose


def nonlinear(x: float) -> float:
    return x * x


weights = [0.5, 0.5]
embeddings = [-1.0, 1.0]
mixed_input = sum(p * e for p, e in zip(weights, embeddings))
one_forward = nonlinear(mixed_input)
branch_average = sum(
    p * nonlinear(e) for p, e in zip(weights, embeddings)
)

assert isclose(one_forward, 0.0)
assert isclose(branch_average, 1.0)
print(one_forward, branch_average)  # 0.0 1.0

两条分支分别含有非零信息,却在均值里相互抵消。这不是对所有 soft embedding 的反例,而是对“任何非线性网络都能把一次均值前向传播当成分支枚举”的反例。实际研究需要测网络是否学习了能够避免相关信息冲突的表示与更新规则。

12.2 一个向量同时推进多个可达节点


def reachable_layers(
    edges: list[tuple[int, int]], n: int, start: int, rounds: int
) -> list[list[int]]:
    seen = [0] * n
    seen[start] = 1
    trace = [seen.copy()]
    for _ in range(rounds):
        next_seen = seen.copy()
        for source, target in edges:
            if seen[source]:
                next_seen[target] = 1
        seen = next_seen
        trace.append(seen.copy())
    return trace


edges = [(0, 1), (0, 2), (1, 3), (2, 4), (4, 5)]
trace = reachable_layers(edges, n=6, start=0, rounds=3)
assert trace[1] == [1, 1, 1, 0, 0, 0]
assert trace[2] == [1, 1, 1, 1, 1, 0]
assert trace[3] == [1, 1, 1, 1, 1, 1]
for state in trace:
    print(state)

这里每轮只使用上一轮的状态,而不是在同一轮内连续修改并读取,这样轮数才对应路径长度扩展。代码使用 O(n) 状态与每轮 O(|E|) 边遍历;它明确支付了宽度与图读取成本,并没有把并行前沿称作常数成本。

12.3 局部加速与总耗时加速

from math import isclose


def speedup(before: list[float], after: list[float]) -> float:
    if sum(after) <= 0:
        raise ValueError("Total latency must be positive")
    return sum(before) / sum(after)


cot = [15.9, 338.8, 29.5]
lotus = [16.7, 133.0, 31.5]
assert isclose(sum(cot), 384.2)
assert isclose(sum(lotus), 181.2)
assert 2.12 < speedup(cot, lotus) < 2.13
print(f"thought: {cot[1] / lotus[1]:.3f}x")
print(f"total: {speedup(cot, lotus):.3f}x")

代码把前处理、思考和答案三个阶段相加;若还存在检索、工具调用或 verifier,应继续纳入向量,而不是把那些阶段悄悄移出计时范围。

12.4 连续反馈的真实模型接口:算法伪代码

输入:已完成连续反馈训练的模型 M、问题 tokens、潜在步数 K

1. 对 [问题 tokens, 潜在开始标记] 做 prefill
   得到末位置状态 h、缓存 cache、下一个位置 pos

2. 重复 K 次:
   e ← h                         # 或经过已训练的投影
   h, cache ← M.step(
       inputs_embeds=e,
       past_key_values=cache,
       position=pos,
       attention_mask=完整可见历史
   )
   pos ← pos + 1

3. 输入训练时使用的潜在结束标记,更新 cache 与 pos
4. 使用正常语言解码生成答案
5. 记录 prefill / latent / answer 三阶段耗时与缓存长度

这段伪代码不是可以直接贴给任意 Hugging Face 模型的通用脚本。边界 token、归一化、投影、位置编号和模型 forward 返回值必须与训练一致。直接把未经训练的普通模型最后一层状态循环喂回去,不能被称为 Coconut 复现。

官方 Coconut 实现可核查到 inputs_embeds 替换、缓存复用、hidden-state offset 与多次前向传播;这些细节影响连续反馈是否对齐正确位置。C1 若复现训练,不能在每轮随意 detach;若只是推理,则应禁用梯度以节省内存。

12.5 小型循环模块的训练伪代码

冻结 decoder 参数,但保留其对输入 latent 的可微计算

对每批问题 x 与答案 y:
    z0 ← proposer(x)
    z  ← z0
    R  ← 从预定义训练预算中采样
    重复 R 次:
        dz ← bounded_update(refiner(x, z))
        z  ← z + dz
    logits ← frozen_decoder(x, latent=z, answer_prefix=y[:-1])
    loss ← answer_cross_entropy(logits, y)
    loss.backward()
    只更新 proposer / refiner 的参数

验证:固定每个预算 R,单独报告质量、耗时和显存

这是一个独立的教学模板,不声称与 LRT 官方超参数或全部损失相同。bounded_update 可能是归一化、门控或显式幅度限制,但它只限制单步变化;重复多步后仍可能积累漂移,不能当作全局稳定性证明。

13. 可复现实验设计

13.1 首先写出可被推翻的主张

一个合格主张应当同时指定对象、资源和评价,例如:“在同一 checkpoint、同一训练样本与相近训练 FLOPs 下,连续反馈在图宽度外推任务中,比同推理计算的显式 CoT 获得更高准确率。”

它的反例很明确:若匹配计算后优势消失,或者仅增加普通前馈容量就能达到相同效果,则“连续表示本身是关键原因”没有得到支持。先写主张有助于避免跑完实验后只挑对自己有利的比较。

13.2 最小基线矩阵

模型/策略 为何必须加入 控制什么
No-CoT 判断训练数据本身可直接解决多少问题 无需中间过程的能力
显式 CoT greedy 基础可解释推理对照 固定单路径
显式 CoT sampling 防止把探索收益算给连续表示 随机性与候选数量
更短 CoT 判断是否只是删除冗余文字 语言长度
Pause/filler 判断是否只是多了计算位置 额外前向计算
连续反馈 核心方法 状态反馈接口
同参数前馈模块 递归小网络的容量对照 模块参数量
同计算更宽模块 判断递归是否有特殊归纳偏置 FLOPs 与容量分配
软提示/LoRA 冻结模块路线的工程对照 训练适配能力
latent 提前终止/置换 检查推理时状态是否必要 因果依赖

不要求一次跑完所有模型规模。先在小规模上完成矩阵,再决定扩大哪条路线;如果小规模控制实验已否定核心机制,就应改变假设,而不是只扩大模型掩盖问题。

13.3 数据与分布外划分

图任务应分别控制节点数、分支宽度、最短路径长度、干扰边数量;算术应分别控制数值范围、运算组合和表达形式;代码应同时测试功能正确性、题目近重复与执行环境;视觉应测试对象数量、位置、分辨率和遮挡。

随机划分不能替代结构外推。若训练与测试都来自相同模板,只是换了表面词汇,模型可能复用局部模式而没有学会算法。建议提前生成按难度轴划分的测试集合,冻结划分后再训练,并为每个样本保存生成规则与正确性检查器。

13.4 训练预算与推理预算分别匹配

训练预算至少记录样本暴露次数、优化步数、序列长度、有效 batch、教师生成成本与 FLOPs 或墙钟时间。不同方法同样训练一个 epoch,可能因为需要多次前向传播而消耗截然不同的资源。

推理预算至少同时提供两种比较:相同质量下的实际成本,以及相同成本下的质量。对随机方法,要保存每次采样是否成功,再计算 pass@1 与 pass@k;不得把“多次里面任意一次成功”与“平均每次成功率”混淆。

若共采样 n 次,其中 c 次成功,常见 pass@k 估计为:

pass@k^=1(nck)(nk),nk.

nc<k 时分子为 0。解释时仍应说明候选是否独立、是否去重、是否使用 verifier,以及最终系统能否真的挑到那个正确候选。

13.5 统计与计时协议

使用配对样本比较答案结果,对每题的成功率差值做 bootstrap 区间;多随机种子反映训练波动,重复计时反映运行时波动。GPU 计时需要处理异步执行与预热,同时报告是否包括 tokenizer、数据搬运和生成后的答案解析。

不要把训练 seed 的标准差当成延迟测量误差,也不要把 ±0.5 个百分点直接说成显著提高。小测试集上的几个题目差异,可能足以改变排名。报告结果时同时提供绝对数、分母与置信区间比孤立的百分比更有解释力。

14. 研究机会与优先顺序

14.1 首要问题:状态是否真的承载可组合信息

研究假设: 让 latent 显式保持中间事实之间的可组合关系,比单纯重建教师文本更能改善结构外推。可以在图任务里控制分支数与深度,在算术里控制中间运算的重用。

比较答案监督、逐步文本监督、结构关系监督和三者混合;用语义替换与 cache 干预验证哪些状态对答案必要。成功标准不是 probe 分数提高,而是在新结构上仍正确,并且干预产生预期反事实。

14.2 固定计算下,空间与深度如何分配

研究假设: 多 latent slot 更利于同时保存候选,更多循环更利于迭代组合;两者应随任务宽度和深度变化。固定近似计算预算,扫描 slot 数、共享层数和循环次数,观察任务难度轴上的相变。

这种实验可把“容量不足”和“计算步数不足”分开。如果只增加 slot 数就能达到加深循环的效果,说明该任务的主要瓶颈可能是存储与并行表示,而不是串行思考。

14.3 学习停止时优化真实服务代价

研究假设: 将 batch 内动态调度成本与尾延迟纳入停止策略,会比只惩罚 latent 个数更贴近实际服务最优点。可以先离线学习不同停止预算的质量曲线,再在服务模拟器中验证分组策略。

成功标准应是相同 p95 延迟约束下更高正确率,或相同质量下更高吞吐;不是只减少平均步数。若停止策略把难题过早终止,平均耗时下降而质量集中损失在重要长尾,则需要重新定义 reward。

14.4 可解释状态与最小验证证书

研究假设: 模型可以主要在 latent 中计算,但输出一个短小、可外部检查的证书。算术提供关键等式,图任务提供有效路径,代码提供测试或局部不变量。

比较自由语言解释、受约束证书、只输出答案三种方式。记录证书正确性、答案正确性与二者一致性,避免一个强解码器在事后编造合理解释。若错误答案也能生成“可读但不可验证”的步骤,说明解释目标还没有绑定实际机制。

14.5 小型推理模块的跨任务迁移

研究假设: 不同任务共享某些状态更新算子,但不共享同样的输入提案。可以固定 refiner、更换 proposer,再反过来固定 proposer、更换 refiner,研究哪一部分真正具备迁移能力。

必须避免把每个任务都训练一套模块的结果说成单一通用推理器。更严格的测试是完全未见的任务族、同一模块、固定预算;迁移失败也有信息价值,可以定位输入映射还是状态更新限制了泛化。

14.6 视觉与工具交互的混合接口

研究假设: 潜在状态适合内部整合,外部工具调用则保留结构化离散接口。一个 agent 可以在 latent 里形成计划,但提交给工具的动作必须是确定的参数,并接收执行结果更新状态。

验证应包含环境变化与工具失败:计划遇到新信息是否改动,旧 latent 是否导致持续重复错误。可用视觉环境或可执行代码任务进行闭环试验;只测静态问答不能证明这个能力。

14.7 一个务实的实施顺序

阶段 交付物 进入下一阶段的条件
机制验证 小规模基线矩阵、语义干预、结构外推 核心增益不被简单基线解释
中等模型复现 固定 checkpoint 与数据的质量—成本曲线 至少在目标任务形成可信 Pareto 改善
系统实现 缓存、批处理、停止策略与延迟测量 实际耗时收益与算法预期一致
跨任务验证 新任务族与独立 verifier 收益不依赖单一模板或捷径
应用试点 真实请求分布下的失败分析 质量与成本目标同时达标

以上是研究建议,不是已完成的训练计划或性能承诺。现有证据更支持从严格受控的小实验开始,再扩大到模型和服务;尤其不应先改造整套训练集群,再回头查连续状态是否起作用。

15. 结论与未决问题

Latent Space Reasoning 最有说服力的进展,是把“中间表示”“计算深度”和“输出语言”从一个固定过程拆开,允许各自设计。Coconut 提供连续反馈接口,CODI 与内化研究提供学习路径,Huginn 与 Ouro 提供循环扩展实例,LOTUS 强化了并行工作区与中间监督,近期冻结模块与视觉方法继续扩大可试验空间。

但当前公开证据并没有统一回答以下问题:在强通用模型与高质量训练数据上,哪一种状态最适合长程推理;更多循环如何在训练范围之外可靠工作;连续表示能否稳健保留多路径;解释能否忠实反映因果过程;系统优化后是否仍优于更简单的短 CoT 或更多离散采样。

因此,评价一个新方法时最值得追问的不是“它有没有用 latent”,而是:它存下了什么、执行了多少工作、哪些状态真正影响答案、在哪里失效,以及在相同资源下多解决了哪些问题。 能清楚回答这些问题的研究,即使没有最漂亮的单点成绩,也更可能形成可积累的知识。

16. 参考文献与官方实现

以下条目提供原始标题、作者、年份与采用的版本/核查范围。标注“摘要”的条目仅用于方法定位或近期动态,不承担超出摘要的数值结论;关键数据表来自正文核查。预印本版本不同可能改变标题、实验表与结论。所有链接核查日期为 2026-09-10;不以搜索结果的相对时间替代论文元数据。

原始研究与诊断

  1. R1 · Chen 等. Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding. 2024. LaTRO;摘要与作者项目页,用于“统计潜变量不一定是连续隐状态”的边界。
  2. R2 · Shibo Hao 等. Training Large Language Models to Reason in a Continuous Latent Space. 2024 首发;采用 v3,2025-11-03。正文 §3、§5、表 1 与课程设计;Coconut。
  3. R3 · Yuntian Deng 等. Implicit Chain of Thought Reasoning via Knowledge Distillation. 2023,v1。摘要;将显式步骤能力蒸馏到层间隐状态。
  4. R4 · Yuntian Deng、Yejin Choi、Stuart Shieber. From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step. 2024 首发。摘要;逐步内化课程。
  5. R5 · Zhen Zhang 等. Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space. 2025,NeurIPS 2025。会议正文;概率加权嵌入方法;另核查 arXiv v1 正文表 1。本文不将摘要中的最大收益数字写成统一性能。
  6. R6 · Junhong Wu 等. LLMs are Single-threaded Reasoners: Demystifying the Working Mechanism of Soft Thinking. 2025,采用 v4,2025-10-16。正文、表 1—2、采样协议;早期标题与当前标题不同。
  7. R7 · Zhenyi Shen 等. CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation. 2025,v3,2025-09-23。正文及消融表;CODI 原文与 LOTUS 内重现结果分开使用。
  8. R8 · Yige Xu 等. SoftCoT: Soft Chain-of-Thought for Efficient Reasoning with LLMs. 2025,v2,2025-05-27,ACL 2025。摘要与官方仓库;固定辅助模型与可训练投影。
  9. R9 · Jonas Geiping 等. Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach. 2025,NeurIPS 2025。会议正文;循环深度、预训练规模与缓存讨论。
  10. R10 · Rui-Jie Zhu 等. Scaling Latent Reasoning via Looped Language Models. 2025 首发;v5,2026-07-01。正文、训练配方与架构表;Ouro。
  11. R11 · Ahmadreza Jeddi、Marco Ciccone、Babak Taati. LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation. 2026,ICLR 2026。正文表 1—2与官方项目页;不同预算的轨迹训练。
  12. R12 · Ying Fan、Anej Svete、Kangwook Lee. Bridging the Gap Between Latent and Explicit Reasoning with Looped Transformers. 2026-06-30 首发;v2,2026-07-13,预印本。正文、表 1—2;LOTUS 准确率与分阶段延迟。
  13. R13 · Guan Wang 等. Hierarchical Reasoning Model. 2025,v3,2025-08-04。摘要;高低层级递归与结构化任务。
  14. R14 · Alexia Jolicoeur-Martineau. Less is More: Recursive Reasoning with Tiny Networks. 2025 首发。正文表 1—2与递归机制;TRM,不将单一参数配置概括到所有任务。
  15. R15 · Zhikang Chen 等. Think Consistently, Reason Efficiently: Energy-Based Calibration for Implicit Chain-of-Thought. 2025-11-10,v1。摘要;EBM-CoT 的能量校准思想。
  16. R16 · Zhaoliang Chen、Jie Fu. Latent Recurrent Thoughts: Recurrent Refinement of Proposed Latents for Reasoning with Frozen LLMs. 2026-09-01,v1,预印本。正文 §2—4、表 1—2与基线限制;LRT。
  17. R17 · Danijar Hafner 等. Mastering Diverse Domains through World Models. 2023 首发;v2,2024-04-17。摘要;DreamerV3 的想象学习。
  18. R18 · Mido Assran 等. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. 2025-06-11。摘要与官方项目页;动作条件世界模型与图像目标规划。
  19. R19 · Yixiao Huang 等. Transformers Provably Learn to Internalize Chain-of-Thought. 2026-05-27,v1,预印本。摘要中的 parity 理论与 Log-ICoT,不外推到一般任务。
  20. R20 · Nikolaos Tsilivis 等. Learning through Internalization. 2026-06-18,v1,预印本。摘要;半自动机内化与分布外退化。
  21. R21 · Mostafa Dehghani 等. Universal Transformers. 2018 首发;v3,2019-03-05。摘要;共享递归与逐位置停止。
  22. R22 · Alex Graves. Adaptive Computation Time for Recurrent Neural Networks. 2016 首发;v6,2017-02-21。摘要;学习计算步数。
  23. R23 · ARC Prize. The Hidden Drivers of HRM’s Performance on ARC-AGI. 2025。基准组织者的实验分析;比较协议、增强与测试期机制。
  24. R24 · Björn Engdahl 等. BDH-CQ: In-Context Learning with Recurrent Latent Reasoning. 2026-08-10,v1,预印本。摘要自报 public ARC-AGI-1 的 pass@2 与估算成本,尚未在本文复算。
  25. R25 · Zhenrui Yue 等. Hybrid Latent Reasoning via Reinforcement Learning. 2025-05-24 首发。摘要;HRPO 的门控与随机 token 路径。
  26. R26 · Xiandong Zou 等. Latent Thought Flow: Efficient Latent Reasoning in Large Language Models. 2026-06-15,v1,预印本。摘要;连续 GFlowNet、变长轨迹与成本。
  27. R27 · Alex Ning、Yen-Ling Kuo、Gabe Gomes. Learning When to Stop: Adaptive Latent Reasoning via Reinforcement Learning. 2025-11-26 首发。摘要自报长度压缩,非端到端延迟结论。
  28. R28 · Haoqiang Kang 等. Scaffolding Minds: Optimizing Latent Visual Target Representations for Multimodal Reasoning. 2026-08-20,v1,预印本。正文表 1—2;视觉监督目标与 RL 探索。
  29. R29 · Julian Schrittwieser 等. Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model. 2019 首发;v2,2020-02-21。摘要;MuZero 的学习模型与搜索。
  30. R30 · Hongyuan Adam Lu 等. Looped World Models. 2026-06-16,v1,技术报告。摘要;环境潜在预测与共享迭代,本文不采用其最大参数效率数字。
  31. R31 · Hanlin Zhu 等. Reasoning by Superposition: A Theoretical Perspective on Chain of Continuous Thought. 2025 首发。正文 §4、Theorem 1;图可达性构造、宽度和比较边界。
  32. R32 · Sachin Goyal 等. Think before you speak: Training Language Models With Pause Tokens. 2023 首发,ICLR 2024。摘要与会议论文;暂停位置。
  33. R33 · Jaehyeon Kim 等. Towards Understanding Pause Token Fine-Tuning Dynamics: A Mode Retention Perspective. 2026-09-03,v1,预印本。摘要;Masked Boundary Pause 的训练动力学解释。
  34. R34 · John Langford 等. Almost Free State Prediction Separation. 2026-09-03 首发;v3,2026-09-08,预印本。当前摘要与版本元数据;早期检索标题为 Free Pause Tokens。
  35. R35 · Connor Dilgren、Sarah Wiegreffe. Are Latent Reasoning Models Easily Interpretable?. 2026-04-06 首发;v2,2026-08-10。正文 §4—6、表 1—2;必要性与解码分析。
  36. R36 · Yuyi Zhang 等. Do Latent Tokens Think? A Causal and Adversarial Analysis of Chain-of-Continuous-Thought. 2025-12-25,v1。正文与 steering 实验;结论限定于论文设置。
  37. R37 · Dayuan Zhao 等. Think in Latent, Explain in Language: Self-Explainable Latent Reasoning. 2026,v1。摘要;SELR 的联合答案与解释目标。页面提交日期为 2026-07-01,而编号属于 2608,故不以编号推断首发日。

官方代码与复现入口

图表与代码说明

流程图为本文根据机制绘制的原创示意,箭头表示数据依赖,不表示真实测得的注意力强度。Coconut 与 LOTUS 图的数据分别取 R2 表 1、R12 表 2;图中显示均值,相关不确定性与实验条件参见正文和原表。Python 示例只验证数学与计时口径,不产生任何模型 benchmark。

下载图表数据(CSV) · 示例 1:非线性混合 · 示例 2:图可达性 · 示例 3:耗时计算