# 项目概念:用共享世界能量实现无配对多模态对齐 ## 一句话目标 我们想验证并最终做成这样一个系统: > 两个强大的单模态模型如果分别从视觉和语言中学到了足够充分、甚至 > 过充分的同一世界表征,那么多模态能力未必需要通过图文对比学习或 > 一个学习 image-to-text correspondence 的 MLP bridge 获得;我们可以 > 定义一个高层次的共享世界能量,通过迭代能量下降直接找到两种表征 > 对同一世界状态的一致解释,并用这个状态驱动冻结的大语言模型。 最终目标不是证明一个 toy 数据集上的几何命题,而是让真实图像通过 这种推断过程获得可验证的冻结多模态大模型能力,例如描述、问答、 计数、空间关系和组合推理。 暂时可以把项目概括为: **A Shared World Is Enough: Energy-Based Multimodal Alignment without Paired Data** 范式层面的野心(2026-07-30 定调):GPT 范式的巧妙在于把无标签文本 变成海量自监督;本项目要做的是把**无配对的多模态数据**变成海量 自对齐——multimodal learning from massive unlabeled data。方法的 可学习部分永远是单模态自监督(塔内的预测/重建),跨模态的桥永远是 被搜索出来的耦合变量,不是被配对数据训练出来的权重——这是与 CLIP(用配对买对应)和跨模态 JEPA(把桥学进网络)的本质分界。 暂名 world matching,命名不急。 定位与先例(2026-07-30 核查):这个象限没有成功先例。邻居分四类, 各差一个要素——(1) 配对派(CLIP/LiT/视听共现/I-JEPA+text projection): 桥总在某处用配对训练,视听共现的"同段视频"也是天然配对;(2) 无监督 词翻译派(MUSE、vec2vec):真零配对但同模态,成功前提是近等距,跨 模态不满足(我们测得 ρ≈0.2–0.3);(3) 走私派(无监督图像描述):靠 监督检测器的类别标签充当桥;(4) 测量派(Platonic Representation Hypothesis):测到跨模态表征随规模收敛并猜想可对齐,但只有测量没有 方法。完整命题——独立自监督双塔、零配对、桥由世界结构一致性搜索 恢复、驱动冻结生成模型——无人做成;本项目的证伪链(共享子空间 天花板、搜索硬相、目标决定表征)是对"此象限为何空置"的第一份 定量地图。 ## 动机 强语言模型从文本中学到的不只是词之间的搭配。为了预测语言,它必须 压缩大量关于对象、属性、关系、事件和世界规律的信息。强视觉模型为了 预测或表征图像,也必须恢复其中一部分世界结构。 视觉表征和语言表征的坐标系当然不同,但如果它们都足够好地描述同一个 世界,那么它们不应该是两个任意、毫无关系的系统。我们的核心直觉是: \[ \text{good vision representation} \quad\text{and}\quad \text{good language representation} \] 可能是同一个潜在世界模型的不同坐标表达。多模态学习需要解决的主要 问题可能不是重新学习世界知识,而是确定这两个表达之间未定的 gauge。 Kimi MoonViT 接冻结 GLM 一类实验说明,一个很小的 connector 有可能 让强视觉塔调用强语言模型中已有的知识与推理能力。但 connector 仍然 使用了图文监督来学习坐标变换。我们要追问的是更强的问题: > 如果两个模态已经充分学会了同一个世界,能否不用图文配对监督, > 只利用它们必须共同满足的世界规律找到这个 gauge? ## “充分”还不够:为什么需要过充分 这里的“充分”不是说单个 embedding 含有足够多的类别信息,也不是说 每个样本都能被一个 probe 正确分类。 为了在没有配对的情况下识别两个表示系统,只知道每个世界状态本身的 信息是不够的。还需要足够丰富的上下文、变化和相互约束,使错误的整体 重排无法同时保持所有世界规律。 因此我们实际需要的是某种关系意义上的过充分观察,例如: - 同一场景的多个独立语言描述; - 同一对象或场景的多个视角、crop 和尺度; - 可见属性、数量和空间关系的问答; - 对象移除、属性改变、遮挡或移动前后的状态; - 模型在不同上下文和干预下的预测响应; - 局部状态如何组合成更大场景的规律。 “graph”只能作为理解这种约束密度的类比。项目不假设模型内部真的存在 离散语义 node,也不准备把问题简化成构造 kNN 图后做节点匹配。真正要 匹配的是连续表示所编码的高阶世界规律。 如果观察不够丰富,潜在世界会保留很大的自同构群:大量错误映射都能 保持相似的局部距离或总体分布。过充分观察的作用是逐步破坏这些错误 对称性,使正确 gauge 变得可识别。 ## 为什么任意自然语言语料不是一个闭合集合 普通百科和互联网文本包含大量不能从给定图片中识别的变量: - 历史、制度、作者意图和抽象理论; - 不可见的因果背景; - 地理、时间和人物身份知识; - 对未来、反事实和规范性内容的陈述; - 语言特有的篇章、修辞和交际变量。 因此“所有自然图像”与“所有自然语言”并不是两个边界一致的世界投影。 硬匹配它们的总体 marginal 会迫使视觉去解释语言中不可见的自由度, 或者让语言先验吞掉真正的视觉条件。 早期数据必须尽量形成一个**视觉可识别、支持多种观察、边界相对闭合的 共享子世界**。这不意味着退回人工 toy world,而是从真实数据中控制 可比较的部分,例如: - 多描述真实场景; - 只涉及可见内容的 region description; - 可见对象、属性、数量与空间关系; - 对同一真实场景构造的受控视觉干预; - 明确过滤依赖外部知识或不可见意图的问题。 随着方法成立,再逐步放宽闭合性,并显式处理两个模态不共享的自由度。 ## 我们要做的不是一个 bridge 目标系统不是: ```text image -> vision encoder -> trained MLP -> frozen LLM ``` 这种系统即使 bridge 很小,仍然可以在 bridge 参数中直接学习图文 correspondence。 我们的目标更接近: ```text unpaired visual observations -> frozen vision world states --\ > shared-world energy unpaired language observations -> frozen language states -----/ new image -> frozen vision state -> iterative energy descent / constrained inference -> an LLM-interpretable world state -> frozen LLM -> image-conditioned description, answer, or reasoning ``` 能量下降中的优化变量可以是连续状态、多个状态构成的 population、 coupling 或其他受约束的隐变量,但不能暗中退化成一个使用配对数据训练 的前馈 cross-modal map。 ## 什么样的能量才算正确 设世界状态为 \(w\),视觉和语言观察分别为 \(x_V,x_T\),冻结模型给出 \(h_V,h_T\)。我们寻找的不是一个只让两个 embedding 分布相似的 loss, 而是一个共享世界能量: \[ E(\mathcal H_V,\mathcal H_T; Z), \] 其中 \(Z\) 表示待推断的一致状态或对应结构。 正确能量至少需要满足四个条件: 1. **可识别性**:真实配置的能量稳定低于 permutation、错误语义和其他 强负例。 2. **抗伪造性**:不能通过制造不对应任何真实语言状态的连续向量,复制 一些视觉关系统计就获得低能量。 3. **功能性**:低能状态不只是几何相似或语言流畅;它必须对世界中的 可验证问题和干预给出一致预测。 4. **可调用性**:推断出的状态必须真的能驱动冻结 LLM 产生图像条件化 的输出,而不是只提高 embedding retrieval。 静态距离、总体 marginal、局部邻域和语言 fluency 都可以是辅助项,但 实验已经说明它们的组合不足以保证以上条件。 ## 证据阶梯 为了避免把弱信号包装成多模态能力,项目按以下层级推进: 1. **共享结构存在** 正确配置在某些诊断上优于随机或置换。 2. **能量排序正确** 在真实 held-out 数据上,正确配置的能量显著低于一大族错误配置。 3. **无配对下降可恢复** 不使用 hidden pairs,能量下降从未知初始化恢复正确语义状态。 4. **输出确实由图像条件化** 冻结 LLM 的描述或回答显著优于 prior-only、shuffled-image 和其他 必要控制。 5. **能够外推到新图像** 方法不是只对一个固定 population 做 transductive matching。 6. **大模型和自然数据上扩展** 在更强视觉塔、LLM、OCR、计数和组合推理任务上仍然成立。 前一级失败时,不应通过扩大下游模型或只报告另一个指标跳过它。 ## MVP 的原则 早期实验可以缩小样本和模型,但必须保留最终问题的关键困难: - 使用真实图像和真实语言,而不是只在合成世界结束; - 冻结独立预训练的视觉与语言模型; - 训练目标不访问图文配对; - 不学习 image-to-language MLP; - 最终经过真实冻结 LLM 评估; - paired data 只作为隐藏诊断和上界; - 必须包含 prior-only、shuffled vision、错误配置和优化收敛控制。 toy 或理论模型可以用于定位机制,但它只能是过程中的工具,不能成为 项目最终的新意或结论。 ## 当前实验告诉了我们什么 截至 2026-07-29: - 冻结 DINO 与冻结 Qwen 的关系结构存在显著非随机共同信号; - 五描述 observation orbit 比单描述更容易区分正确和 shuffled 配置, 支持“关系过充分有帮助”; - 静态 GW/SWD 和学习 bridge 不能识别正确 gauge; - 不学习 bridge、直接优化语言 latent 的能量下降也出现过短暂 retrieval 提升; - 但继续降低当前能量会使 retrieval 回到随机; - 更致命的是,真实配对状态的能量高于优化得到的错误状态。 所以当前结果没有否定共享世界假设,但明确否定了现有的静态能量: \[ E_{\text{current}}(\text{correct}) > E_{\text{current}}(\text{counterfeit}). \] 这意味着当前瓶颈不是优化步数、学习率或模型规模,而是能量缺少能够 排除 counterfeit state 的高层世界约束。 流形限制实验(同日)进一步定位了缺失约束的位置。把配置空间限制为 真实文本状态的置换后,连续伪造通道被构造性封死,但证伪结论不变: 正确指派在全局上优于全部随机置换(z 最高 18.7),却在任何条件下都 不是局部最优——7–33% 的单对换能降低能量,精确 2-swap 下降会离开 真值,随机起点总能找到能量更低的错误指派。谱审计把原因定位在状态 本身:pooled 状态的跨模态共享信号集中在约 16 个种群主方向上(top-16 截断 Spearman 0.367 高于全空间 0.306,白化则把信号降到 0.03),而 个体识别所需的细粒度结构是模态私有的。约 16 维的粗主题坐标不可能 钉住数百个个体指派,因此**任何**定义在这些 pooled 状态上的能量都 无法通过局部排序闸门——要换的不是匹配器,是状态的数据结构。 同时得到一个建设性结果:在 Visual Genome 节点内部,两模态观察同一 批 16 个区域,视图级的关系场跨模态对齐显著(5,000 节点上 z = 46.6), 以节点级粗对齐为参照系时,区域视图可以 2.3 倍于随机地被盲匹配。 节点级 pooling 丢掉的组合结构,在下一层真实存在。 随后的两个表示电池(见 `STRUCTURE_DESIGN.md` 与 `BATTERY_RESULTS.md`) 把天花板抬了起来:场景内视图噪声白化(无配对拟合)使 VG 跨模态关系 相关近乎三倍至 0.61,违规对换率崩至 0.2%;联合上下文编码表明模型层 的共享信号在语境混合后的状态里(ρ 0.216 对孤立编码 0.128),而不在 attention 权重里。在新状态上,盆地审计首次通过:九个 VG 条件(两种 状态族 × 三个子集种子 × 每次十次随机重启)中,所有下降轨迹都停在 真配置能量之上 5–19%。Flickr 仍以不到 1% 之差未过——单视觉视图无 噪声可白化——因此**双侧多视图观察是数据协议要求**。已通过的闸门 授权进入无配对软耦合恢复阶段;它不等于可用的多模态能力,真配置也 尚未成为严格局部最优(仍有 0.2% 的违规对换,精确下降保持 52–59%)。 ## 匹配是验证,分布对齐才是机制(2026-07-31 定位修正) 合成世界的端到端结果容易被误读成"我们把藏起来的配对找回来了"。准确 的说法是:**建立跨模态对应的那一步从未使用任何双射假设**——派生词典 用的是 6000 个纯文本场景与 6000 个**完全不相交**的纯视觉场景,两侧没 有任何共享实例,靠的只是各自语料的边缘频率。实例级的 95.3% 匹配与 93.0% 外推是对"因子坐标是否对准"的**验证**,不是机制本身。 这个区分决定了真实数据上的形态:不需要找置换,而是各模态独立发现 因子、因子取值靠分布统计跨模态对齐、图像直接编码进共享因子坐标再 解码成文本。真实数据没有真值可算匹配率,评价改为留出集生成质量加 打乱图像对照。 留下的条件比"需要配对"弱得多,但不是没有:两个语料需反映相近的 世界分布;报告偏差会移动文本边缘分布(实测为优雅退化);共现结构 比边缘频率更抗偏差,是真实数据上的主力信号。未解的仍是视觉侧的 因子发现。 ## 下一步的硬门槛 排序闸门保持不变,但下移一层。候选能量必须定义在结构化状态上—— 节点是带内部关系场的区域视图集合,或干预下的响应算子,而不是单个 pooled 向量;并且必须在视图层级通过同样的排序测试: \[ E(\text{true configuration}) \ll E(\text{permuted / semantically wrong configurations}), \] 包括单对换扰动下的局部排序。测试中的配对与重放的视图真值只用于 评价,不能进入能量的定义或调参选择。pooled 节点状态被排除为唯一 载体:其共享子空间约 16 维,已被证明穷尽。 优先寻找的信号不是另一种静态 embedding similarity,而是外部可验证 的预测结构:当对象被移除、属性改变、数量变化、区域被遮挡或空间关系 改变时,两侧世界状态的响应规律是否能够在没有实例配对的情况下形成 唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号: 以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。 ## 合作者应避免的误解 - 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被 视觉信号调用的概念与推理结构。 - 这不是声称所有优秀模型的 embedding 会自然逐点重合。 - 这不是另一个无监督 graph matching 或 OT benchmark。 - 这不是用更复杂的正则化偷偷训练一个 bridge。 - 这不是以 toy theorem 为终点。 - 小幅 retrieval 提升不等于多模态能力;只有通过生成、问答和严格控制 证明输出依赖正确图像,才能提出这一主张。 项目真正想回答的是: > 当两个强单模态系统已经充分描述同一个世界时,能否用一个可计算的 > 世界一致性能量固定它们之间的 gauge,并在没有图文配对学习的情况下 > 释放冻结大语言模型中的多模态推理能力?