把上下文编译进权重:拆解剑桥「无限参数 LLM」,以及它尚未回答的四个问题

文章来源声明: 原文作者:米小虾; 来源站点:掘金; 原文链接:https://juejin.cn/post/7688212417864974363; 本文基于上述来源整理/加工,觅优补充点评,仅供技术学习交流。版权归原作者所有。
觅优短评

价值不在性能替代RAG,而在把交互变成训练信号;适合研究记忆层者借鉴其等算力评估与记忆化/泛化关注点,生产环境暂不迁移。

> 你跟一个模型聊了一小时,纠正了它八次。关掉窗口,重新打开,它还是原来那个样子。 > > 这不是记性问题,是权重在训练结束那一刻就冻住了。你之后说的每一句话,只能临时塞进上下文窗口,每次请求重读一遍,请求结束就丢掉。行业为此写了整整一套 RAG 管道、记忆层、上下文压缩策略——全部都是在"临时"这两个字上做工程。 > > 9 月 16 日,剑桥的 Jinli Hu、Ross M. Clarke、Yichuan Zhang 与 José Miguel Hernández-Lobato 在 arXiv 挂了一篇预印本(`arXiv:2609.18842`),标题起得很猛:*Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data*。它的主张可以一句话说清:能不能别把运行时收到的信息塞进提示词,而是直接编译进权重。 > > 这篇东西的结构很有意思——机制讲得很清楚,但摘要里一个 benchmark 数字都没有。这篇文章既要拆开它的三层机制,也要如实说清它还没回答什么。

fig1-记忆位置.png

一、旧范式的原罪:上下文是「租」来的,不是「买」下的

先把问题定义精确。一个部署后的模型面对的处境是:最值钱的信息往往不在训练集里,而在它正在处理的这轮交互里——用户随口给的一个事实,或者对他某次错误的纠正。

传统模型的权重在训练后冻结,这些信息进不去。于是只剩一条路:放进 prompt(提示词/上下文窗口),靠检索或指令注入。这条路有两个结构性代价。

**第一是重复计算。**同一批背景事实,在第 1 轮被读一遍,第 10 轮还要再读一遍,第 100 轮还是。模型每次请求都要为同一份证据付一次 prefill 的钱。论文里把它称作「读一次、用完即弃」。

第二是容量挤兑。上下文窗口是有限的。证据越多,留给推理的空间越少;上下文一满,前面的内容就被挤出去。这不是工程疏忽,是把长时记忆寄存在工作内存里必然的结果。

社区对这一点早就不满了。Hacker News 上一条评论把愿望讲得很直白:如果模型能动态整合每个人的微小进展——包括失败的尝试——就会形成一个集中式的概念与结果库,避免全世界重复试错。这条评论拿到不少赞同,因为它指向的正是当前范式的短板:交互产生的一切,除了一份聊天记录,什么都没留下。

论文想动的是这件事发生的位置。

二、原理:把 MoE 的「选专家」换成「生成专家」

论文的架构判断很克制:**注意力层完全不动,只替换选定层的 FFN 子层。**每个「生成层」(generative layer)由三部分组成。

组件作用是否可训练
共享基座 FFN `W₀`始终生效,从强 dense 模型初始化冻结
紧凑生成器 `G_φ`把低维隐码 `z` 映射为基座的结构化低秩调制冻结(复用 SHINE 检查点)
隐码上的信念 `P_t(z)`决定「此刻该用哪份补丁」,在线更新**本文新增**

低秩调制:只贴补丁,不重写全表

补丁的形式是标准的 LoRA 型分解:

<span>W</span>(z) = W₀ + Δ<span>W</span>(z),   Δ<span>W</span>(z) = <span>B</span>(z) · <span>A</span>(z)ᵀ
其中  <span>A</span>(z) ∈ R^(d×r),<span>B</span>(z) ∈ R^(h×r),r ≪ d

论文给出的具体数值是 秩 r = 8,隐码维度 d_z = 128,被调制的投影是 {W_gate, W_up, W_down}

关键在于它从不把 ΔW 实体化,而是按因子形式直接算:

y_delta = <span>B</span>(z) · (<span>A</span>(z)ᵀ · x)

于是每个 token 的应用成本是 O(r(d+h)),对比基座 FFN 的 O(hd)——r 只有 8,这份开销相对基座可以忽略。这是"无限参数"这个名字能立住的计算基础:参数空间可以极大,但每一刻的算力开销不跟着涨。

编码路径:可学习的 memory token 当探针

隐码 z 是从哪来的?论文的路径是这样的:

输入序列
  │
  ├─ 追加 M 个可学习 memory tokens(与输入无关的固定 probe,训练一次全局共享)
  │
  ▼
冻结的 decoder-only 基座(Qwen3-<span>8</span>B)
  │
  ├─ 收集每层 memory token 的隐状态 → memory <span>grid</span>  m ∈ R^(L×M×d)
  │
  ▼
memory-<span>to</span>-parameter 网络(M2P)混合该网格
  │
  ▼
扁平隐码 z ∈ R^<span>P</span>  ── 平凡投影 ──▶ 每层的 LoRA 因子

一句话点破它和已知事物的关系:**它把 MoE 的"从固定专家库里选一个"换成了"现场生成一个专家",再在生成器前面挂一层贝叶斯滤波。**MoE 的专家库是静态预训练的产物,这篇的"专家"由当前会话数据编译出来。

真正的增量:不是"生成",是"在线更新的信念"

论文自己把和前人工作的分界线画得很清楚。

早期的权重生成器(Text-to-LoRA、SHINE 等)是**"读一遍上下文,然后冻结"——点估计。这篇改的是这一点:它在生成器的隐码上维护一个信念,随会话在线更新。所以生效的权重不是读一次就定死,而是随你越说越多,被一遍遍重新推导出来**。

具体实现上,论文采用的是一种类别信念(categorical belief):P_t(z) = Cat(π_t),一个 code pool {m₁ … m_K},递推式是

π_t,k  ∝  π<span>_</span>(t-<span>1</span>),k · <span>p</span>(obs_t | z = m_k)

打分后每层 top-1 选择(不是 top-k 混合)。

至于更强的那种形式——连续高斯信念,加零锚定偏移 ψ ~ N(0, Σ₀),后验精度门控可塑性——论文明确说留作 future work,本次没有评估。

fig2-三层机制.png

三、它明确换来的三样东西

论文对收益的表述是四句话,我给它们配上了因果:

声称的收益机制上为什么成立前提条件
**计算摊销**证据编译进权重是"写一次、多轮复用",而不是每轮重读单轮编译成本 < 被替代掉的重复 prefill 成本
**释放上下文窗口**证据不再占 token,窗口留给推理本身同一份证据真的会跨轮复用
**跨轮持久**不依赖会话外部的存储层会话内有效;会话结束后基座权重不变
**可能泛化更好**信息以参数形式参与计算,而非作为被 attend 的文本未被本次实验证明

第三行要特别强调,因为它是这类文章最常见的误读:"跨轮持久"不等于"永久记住"。权重的变化是会话级的,基座是冻结的。会话结束,这份补丁的寿命也就到了。

论文作者对名字的夸张程度反而很诚实,几句自限值得原样引用:

  • "infinite" 指的是可达的权重配置空间,不是存储的知识量:"'infinite' here never means a larger knowledge store."
  • 知识仍受常驻参数约束:"knowledge remains bounded by the resident parameters."
  • 会话内适配是有界、低维、可逆的,不废除容量定律、也不替代预训练。
  • 谈存储开销时:本文真正新增的可训练参数只有 selector 的 key map 与 query 对齐,规模远低于基座的百分之一。(生成器本身来自 SHINE,文中引用的开销数字是约 17%,那是被复用组件的账,不是本文的账。)

四、理想丰满:四处「尚未验证」

到这一节,这篇预印本的真实成熟度就露出来了。以下四条不是我的猜测,是论文自己承认的,或者是同行公开指出的。

死结 1:记忆化 vs 泛化,是权重生成器的一等失败模式

论文在相关工作里写得很直白:"A documented failure mode across weight generators is memorisation rather than generalisation — which we treat as a first-class evaluation concern."

翻译一下:把数据编译进权重这条路,历史上反复出现的是把答案背下来,而不是学会怎么用。如果落在这个失败模式上,那这套机制相对"直接把证据放在 prompt 里"就没有任何优势——甚至还多了编译器本身的开销。

论文把它列为一等评估关注,说明作者清楚这是决定性问题。但结论要看实验,而实验数字我没有拿到。

死结 2:「摊销」是成本挪了位置,不是证明成本更小

这是目前对该工作最有力的一条外部质疑。有评论者的表述很到位:"amortized" 是关于成本移动到哪里的主张,不是成本更小的证明。

算一下这笔账的缺口:

  • 编译一次的成本(生成器前向 + selector 打分)需要实测延迟,论文没给。
  • 生成器本身消耗多少算力,论文没给。
  • 摊销的成立条件是 单次编译成本 < 被省下的重复 prefill 成本,右边取决于这份证据会被复用多少轮——短会话里右边极小。

也就是说,在同一算力预算下和"好好调过的检索系统"比一次总成本,这个实验是决定性的,而摘要层面看不到它。任何想拿它做记忆层或个人化的人,现阶段应该把它当方向看,而不是当技术采用。

死结 3:类别信念的表达力被 code pool 卡住

论文承认了这一点:类别信念是在整码之间做选择,而不是在码空间里移动——如果出现一个 code pool 里本来没有的"偏移",只能靠物化一个新的 atom 来应对"a shift the pool does not already contain can be met only by materialising a new atom")。

后果是可预期的:K 个码就是 K 个离散的行为模式,粗糙、有台阶。这正是它把连续高斯信念留作 future work 的原因。

死结 4:「Bayesian」是经验主张,也是可审计性的代价

论文对"贝叶斯"这个词的态度相当严谨,值得抄录:

"the posterior's spread ... is exactly the fragile part under amortization, so 'Bayesian' here is an empirical claim about a calibrated posterior, not a free consequence of emitting a distribution."

大意:后验的分散程度在摊销下恰恰是最脆弱的部分,所以"贝叶斯"是一个关于后验是否校准好的经验主张,不是你输出了一个分布就自动获得的性质。

另有一个操作层的现实约束:精确似然需要 test-time 反向传播,部署时不可行,所以论文里的精确递归信念 P 只作为离线的蒸馏教师和比较基线,而不是在线方案。

再往外一层,是社区在 Hacker News 上提出的、论文没有回答的问题:

  • 偏见传播:如果某个编排器在自己的系统提示里注入"当话题与 X 相关时推荐产品 Y"这类倾向,而这种倾向能通过权重更新传播出去,它会污染那些从未使用该编排器的用户。这在 prompt 时代是不可能的失效模式。
  • 稳定性:持续更新的模型如何保证行为稳定?当前模型已经够难预测了。
  • 可复现性:权重随交互改写,意味着同一个模型对同一个问题的回答不可复现、难以审计

这三点不是学术挑剔。它们直接决定这条路线能不能进生产——能通过审计、能复现、能回滚,和"更强"一样是硬需求。

五、论文自己设计的判据:怎么比才算公平

值得一提的是,这篇论文虽然没有结果数字,但给出了一套相当讲究的评估协议。协议本身就有信息量,因为它暴露了作者认为公平比较需要哪些条件。

三个研究问题:

  1. 权重能否承载数据:把一轮证据编译进生成权重后,在证据不进入 prompt 的前提下,能否据此作答?
  2. 单步信念:数据写入码池后,模型能否推断出当前 query 需要哪一个码?
  3. 信念累积:信念能否跨交互累积,使对话变长时路由变得更好

基线是分层的,这比"跟谁比"的单一答案有用得多:

层级基线定位
**头号基线**in-context learning、retrieval主流方案,必须正面超越
适配基线Text-to-LoRA、SHINE、点估计式 test-time training证明"在线信念更新"比"读一次冻结"强
匹配预算基线把等量算力花在对 verifier 做搜索/采样防止拿"更多算力"冒充"更好机制"
参考点stored-bank MoE(μMoE、∞-MoE 等)声明为参考,不做逐项对打
离线参照精确递归信念 `P`蒸馏教师与上界

**"匹配预算基线"这一行是最见功力的一笔。**它把"我用了更多算力所以更好"这条最容易蒙混的路先堵上了——任何声称"把上下文编译进权重更划算"的工作,如果不做等算力对比,结论都没有意义。

六、选型决策树

你要解决的问题是「模型记不住上一轮给它的信息」?
│
├─ 否 → 别碰这条路。
│
└─ 是 → 先问:这份信息会被复用几次?
<span>    │
    ├─ 1~2 次(一次性问答、单轮 RAG)
    │   └─ 老实放 prompt。编译一次的开销大概率收不回来。
    │
    ├─ 每轮都要重读的同一批事实(长会话、固定人设、稳定知识库)
    │   ├─ 信息量小、干净、窗口放得下
    │   │   └─ 先优化检索与提示缓存(prefix cache / 上下文压缩),收益确定、零风险
    │   └─ 信息量大、脏、需要多跳
    │       └─ 这条路的目标场景。但今天先别上生产:
    │          等「等算力预算下 vs 检索」的实测结果
    │
    └─ 需要跨会话永久记住 / 需要可审计、可回滚
        └─ 用外部存储 + 检索。这条路线现阶段给不了你要的
           (权重随交互改写 → 不可复现、难审计、难回滚)
</span>

三条实践建议:

  1. 把它当研究信号,不当技术选型。 预印本、未见结果数字、未见训练细节(论文原文:"Full training details are outside the scope of this paper.")。今天没有任何生产理由迁移。
  2. 如果你在做记忆层,先抄它的评估协议,不要抄它的架构。 尤其"等算力预算基线"和"记忆化 vs 泛化"这两个关注点,直接可以搬进你自己的评测集——它们能帮你发现自己的方案是不是在背答案。
  3. 盯"会话级可塑性"这个新指标。 传统 API 的假设是权重固定、行为可复现。一旦权重开始随会话漂移,"同一输入的方差"就变成一个需要单独监控的量。

七、我的判断:不是替代,是记忆的第三条路

把这件事放到"记忆放在哪"的地图上,会看得更清楚。

<span>              持久性 ─────────────────────────────▶
  短                                                    长
  │
  │   ① 上下文窗口                 ③ 外部存储 / RAG
  │      成本:每轮重读             成本:检索往返 + 拼接
  │      容量:受窗口限制           容量:大,但语义稀
  │      可审计:高                 可审计:高
  │
  │                  ② 权重(本文)
  │                     成本:一次编译 + 每轮极小的因子化增量
  │                     容量:受常驻参数限制
  │                     可审计:低 ← 这是它的入场券问题
  └──────────────────────────────────────────
</span>

我的判断是三层:

**第一,它不替代 RAG,它挤的是中间的缝。**上下文窗口和外部存储服务的是两类不同的需求(工作内存 vs 知识库)。权重编译服务的是第三类:会话内稳定、反复使用、且不希望它出现在上下文里的那批内容——比如一个长会话里逐渐明确的口味、约束、术语约定。这批内容今天确实无家可归,要么占窗口,要么每次重新检索。

**第二,它最大的价值可能不在性能,而在把"交互"重新定义成了训练信号。**过去几年,行业把实时交互当成一次性的填充物:用提示词装进去,用完丢。这篇论文的框架说交互本身可以是一个信号,模型在对话进行中现场改写自己。这个重新框定,比它当前的具体机制更值得记住——如果这条路线有任何一条分支能走通,RAG 与上下文工程要解决的问题清单都会被重写。

第三,最值得盯的信号不是它以后发不发结果,而是三个更硬的问题有没有答案。

  • 有没有等算力预算下对检索/ICL 的实测优势?
  • 长会话里贝叶斯信念漂不漂移?补丁和冻结基座打不打架
  • 有没有人给出审计与回滚方案?没有这个,它连内测都进不去。

往更远处看,这条路线和另一个同时在发生的趋势是同一个方向:基座冻结、生成器冻结、信念动态——三层各司其职,冻的保证一致性与安全,动的提供适应性。参数不再需要一次性把所有智慧焊死在巨大权重里。

代价也要说清:**权重会因为你而改,就意味着它更难复现、更难审计。**一条被恶意纠正的对话,可能悄悄改掉它此后对所有人的行为。可解释性和安全,会是这条路绕不开的下一关——而且是入场券级别的那一关。


参考

  • Hu J, Clarke R M, Zhang Y, Hernández-Lobato J M. Infinite-Parameter LLMs: Generating and Adapting Weights from Live Data. arXiv:2609.18842, submitted 2026-09-16. arxiv.org/abs/2609.18…
  • 论文 HTML 全文(v1): arxiv.org/html/2609.1…
  • Hacker News 讨论(2026-09-17 登上首页;社区关于偏见传播、稳定性、可解释性的争议)

数据说明:本文引用的架构细节(秩 r=8、隐码 d_z=128、Qwen3-8B 基座、调制投影集合、类别信念递推式、评估协议分层)均取自论文 v1 原文。论文 §4.2–§4.4 的实验数值不在本文可见范围内,因此文中未出现任何该论文的 benchmark 数字。文中引用的 17% 参数开销属于被复用的 SHINE 组件,非本篇论文自身开销。第三方评论观点已在正文明确标注来源类型。本文为技术分析,不构成任何选型建议。