diff options
Diffstat (limited to 'PROJECT_CONCEPT.md')
| -rw-r--r-- | PROJECT_CONCEPT.md | 316 |
1 files changed, 316 insertions, 0 deletions
diff --git a/PROJECT_CONCEPT.md b/PROJECT_CONCEPT.md new file mode 100644 index 0000000..d5c0265 --- /dev/null +++ b/PROJECT_CONCEPT.md @@ -0,0 +1,316 @@ +# 项目概念:用共享世界能量实现无配对多模态对齐 + +## 一句话目标 + +我们想验证并最终做成这样一个系统: + +> 两个强大的单模态模型如果分别从视觉和语言中学到了足够充分、甚至 +> 过充分的同一世界表征,那么多模态能力未必需要通过图文对比学习或 +> 一个学习 image-to-text correspondence 的 MLP bridge 获得;我们可以 +> 定义一个高层次的共享世界能量,通过迭代能量下降直接找到两种表征 +> 对同一世界状态的一致解释,并用这个状态驱动冻结的大语言模型。 + +最终目标不是证明一个 toy 数据集上的几何命题,而是让真实图像通过 +这种推断过程获得可验证的冻结多模态大模型能力,例如描述、问答、 +计数、空间关系和组合推理。 + +暂时可以把项目概括为: + +**A Shared World Is Enough: Energy-Based Multimodal Alignment without Paired +Data** + +范式层面的野心(2026-07-30 定调):GPT 范式的巧妙在于把无标签文本 +变成海量自监督;本项目要做的是把**无配对的多模态数据**变成海量 +自对齐——multimodal learning from massive unlabeled data。方法的 +可学习部分永远是单模态自监督(塔内的预测/重建),跨模态的桥永远是 +被搜索出来的耦合变量,不是被配对数据训练出来的权重——这是与 +CLIP(用配对买对应)和跨模态 JEPA(把桥学进网络)的本质分界。 +暂名 world matching,命名不急。 + +定位与先例(2026-07-30 核查):这个象限没有成功先例。邻居分四类, +各差一个要素——(1) 配对派(CLIP/LiT/视听共现/I-JEPA+text projection): +桥总在某处用配对训练,视听共现的"同段视频"也是天然配对;(2) 无监督 +词翻译派(MUSE、vec2vec):真零配对但同模态,成功前提是近等距,跨 +模态不满足(我们测得 ρ≈0.2–0.3);(3) 走私派(无监督图像描述):靠 +监督检测器的类别标签充当桥;(4) 测量派(Platonic Representation +Hypothesis):测到跨模态表征随规模收敛并猜想可对齐,但只有测量没有 +方法。完整命题——独立自监督双塔、零配对、桥由世界结构一致性搜索 +恢复、驱动冻结生成模型——无人做成;本项目的证伪链(共享子空间 +天花板、搜索硬相、目标决定表征)是对"此象限为何空置"的第一份 +定量地图。 + +## 动机 + +强语言模型从文本中学到的不只是词之间的搭配。为了预测语言,它必须 +压缩大量关于对象、属性、关系、事件和世界规律的信息。强视觉模型为了 +预测或表征图像,也必须恢复其中一部分世界结构。 + +视觉表征和语言表征的坐标系当然不同,但如果它们都足够好地描述同一个 +世界,那么它们不应该是两个任意、毫无关系的系统。我们的核心直觉是: + +\[ +\text{good vision representation} +\quad\text{and}\quad +\text{good language representation} +\] + +可能是同一个潜在世界模型的不同坐标表达。多模态学习需要解决的主要 +问题可能不是重新学习世界知识,而是确定这两个表达之间未定的 gauge。 + +Kimi MoonViT 接冻结 GLM 一类实验说明,一个很小的 connector 有可能 +让强视觉塔调用强语言模型中已有的知识与推理能力。但 connector 仍然 +使用了图文监督来学习坐标变换。我们要追问的是更强的问题: + +> 如果两个模态已经充分学会了同一个世界,能否不用图文配对监督, +> 只利用它们必须共同满足的世界规律找到这个 gauge? + +## “充分”还不够:为什么需要过充分 + +这里的“充分”不是说单个 embedding 含有足够多的类别信息,也不是说 +每个样本都能被一个 probe 正确分类。 + +为了在没有配对的情况下识别两个表示系统,只知道每个世界状态本身的 +信息是不够的。还需要足够丰富的上下文、变化和相互约束,使错误的整体 +重排无法同时保持所有世界规律。 + +因此我们实际需要的是某种关系意义上的过充分观察,例如: + +- 同一场景的多个独立语言描述; +- 同一对象或场景的多个视角、crop 和尺度; +- 可见属性、数量和空间关系的问答; +- 对象移除、属性改变、遮挡或移动前后的状态; +- 模型在不同上下文和干预下的预测响应; +- 局部状态如何组合成更大场景的规律。 + +“graph”只能作为理解这种约束密度的类比。项目不假设模型内部真的存在 +离散语义 node,也不准备把问题简化成构造 kNN 图后做节点匹配。真正要 +匹配的是连续表示所编码的高阶世界规律。 + +如果观察不够丰富,潜在世界会保留很大的自同构群:大量错误映射都能 +保持相似的局部距离或总体分布。过充分观察的作用是逐步破坏这些错误 +对称性,使正确 gauge 变得可识别。 + +## 为什么任意自然语言语料不是一个闭合集合 + +普通百科和互联网文本包含大量不能从给定图片中识别的变量: + +- 历史、制度、作者意图和抽象理论; +- 不可见的因果背景; +- 地理、时间和人物身份知识; +- 对未来、反事实和规范性内容的陈述; +- 语言特有的篇章、修辞和交际变量。 + +因此“所有自然图像”与“所有自然语言”并不是两个边界一致的世界投影。 +硬匹配它们的总体 marginal 会迫使视觉去解释语言中不可见的自由度, +或者让语言先验吞掉真正的视觉条件。 + +早期数据必须尽量形成一个**视觉可识别、支持多种观察、边界相对闭合的 +共享子世界**。这不意味着退回人工 toy world,而是从真实数据中控制 +可比较的部分,例如: + +- 多描述真实场景; +- 只涉及可见内容的 region description; +- 可见对象、属性、数量与空间关系; +- 对同一真实场景构造的受控视觉干预; +- 明确过滤依赖外部知识或不可见意图的问题。 + +随着方法成立,再逐步放宽闭合性,并显式处理两个模态不共享的自由度。 + +## 我们要做的不是一个 bridge + +目标系统不是: + +```text +image -> vision encoder -> trained MLP -> frozen LLM +``` + +这种系统即使 bridge 很小,仍然可以在 bridge 参数中直接学习图文 +correspondence。 + +我们的目标更接近: + +```text +unpaired visual observations -> frozen vision world states --\ + > shared-world energy +unpaired language observations -> frozen language states -----/ + +new image -> frozen vision state + -> iterative energy descent / constrained inference + -> an LLM-interpretable world state + -> frozen LLM + -> image-conditioned description, answer, or reasoning +``` + +能量下降中的优化变量可以是连续状态、多个状态构成的 population、 +coupling 或其他受约束的隐变量,但不能暗中退化成一个使用配对数据训练 +的前馈 cross-modal map。 + +## 什么样的能量才算正确 + +设世界状态为 \(w\),视觉和语言观察分别为 \(x_V,x_T\),冻结模型给出 +\(h_V,h_T\)。我们寻找的不是一个只让两个 embedding 分布相似的 loss, +而是一个共享世界能量: + +\[ +E(\mathcal H_V,\mathcal H_T; Z), +\] + +其中 \(Z\) 表示待推断的一致状态或对应结构。 + +正确能量至少需要满足四个条件: + +1. **可识别性**:真实配置的能量稳定低于 permutation、错误语义和其他 + 强负例。 +2. **抗伪造性**:不能通过制造不对应任何真实语言状态的连续向量,复制 + 一些视觉关系统计就获得低能量。 +3. **功能性**:低能状态不只是几何相似或语言流畅;它必须对世界中的 + 可验证问题和干预给出一致预测。 +4. **可调用性**:推断出的状态必须真的能驱动冻结 LLM 产生图像条件化 + 的输出,而不是只提高 embedding retrieval。 + +静态距离、总体 marginal、局部邻域和语言 fluency 都可以是辅助项,但 +实验已经说明它们的组合不足以保证以上条件。 + +## 证据阶梯 + +为了避免把弱信号包装成多模态能力,项目按以下层级推进: + +1. **共享结构存在** + 正确配置在某些诊断上优于随机或置换。 +2. **能量排序正确** + 在真实 held-out 数据上,正确配置的能量显著低于一大族错误配置。 +3. **无配对下降可恢复** + 不使用 hidden pairs,能量下降从未知初始化恢复正确语义状态。 +4. **输出确实由图像条件化** + 冻结 LLM 的描述或回答显著优于 prior-only、shuffled-image 和其他 + 必要控制。 +5. **能够外推到新图像** + 方法不是只对一个固定 population 做 transductive matching。 +6. **大模型和自然数据上扩展** + 在更强视觉塔、LLM、OCR、计数和组合推理任务上仍然成立。 + +前一级失败时,不应通过扩大下游模型或只报告另一个指标跳过它。 + +## MVP 的原则 + +早期实验可以缩小样本和模型,但必须保留最终问题的关键困难: + +- 使用真实图像和真实语言,而不是只在合成世界结束; +- 冻结独立预训练的视觉与语言模型; +- 训练目标不访问图文配对; +- 不学习 image-to-language MLP; +- 最终经过真实冻结 LLM 评估; +- paired data 只作为隐藏诊断和上界; +- 必须包含 prior-only、shuffled vision、错误配置和优化收敛控制。 + +toy 或理论模型可以用于定位机制,但它只能是过程中的工具,不能成为 +项目最终的新意或结论。 + +## 当前实验告诉了我们什么 + +截至 2026-07-29: + +- 冻结 DINO 与冻结 Qwen 的关系结构存在显著非随机共同信号; +- 五描述 observation orbit 比单描述更容易区分正确和 shuffled 配置, + 支持“关系过充分有帮助”; +- 静态 GW/SWD 和学习 bridge 不能识别正确 gauge; +- 不学习 bridge、直接优化语言 latent 的能量下降也出现过短暂 retrieval + 提升; +- 但继续降低当前能量会使 retrieval 回到随机; +- 更致命的是,真实配对状态的能量高于优化得到的错误状态。 + +所以当前结果没有否定共享世界假设,但明确否定了现有的静态能量: + +\[ +E_{\text{current}}(\text{correct}) +> +E_{\text{current}}(\text{counterfeit}). +\] + +这意味着当前瓶颈不是优化步数、学习率或模型规模,而是能量缺少能够 +排除 counterfeit state 的高层世界约束。 + +流形限制实验(同日)进一步定位了缺失约束的位置。把配置空间限制为 +真实文本状态的置换后,连续伪造通道被构造性封死,但证伪结论不变: +正确指派在全局上优于全部随机置换(z 最高 18.7),却在任何条件下都 +不是局部最优——7–33% 的单对换能降低能量,精确 2-swap 下降会离开 +真值,随机起点总能找到能量更低的错误指派。谱审计把原因定位在状态 +本身:pooled 状态的跨模态共享信号集中在约 16 个种群主方向上(top-16 +截断 Spearman 0.367 高于全空间 0.306,白化则把信号降到 0.03),而 +个体识别所需的细粒度结构是模态私有的。约 16 维的粗主题坐标不可能 +钉住数百个个体指派,因此**任何**定义在这些 pooled 状态上的能量都 +无法通过局部排序闸门——要换的不是匹配器,是状态的数据结构。 + +同时得到一个建设性结果:在 Visual Genome 节点内部,两模态观察同一 +批 16 个区域,视图级的关系场跨模态对齐显著(5,000 节点上 z = 46.6), +以节点级粗对齐为参照系时,区域视图可以 2.3 倍于随机地被盲匹配。 +节点级 pooling 丢掉的组合结构,在下一层真实存在。 + +随后的两个表示电池(见 `STRUCTURE_DESIGN.md` 与 `BATTERY_RESULTS.md`) +把天花板抬了起来:场景内视图噪声白化(无配对拟合)使 VG 跨模态关系 +相关近乎三倍至 0.61,违规对换率崩至 0.2%;联合上下文编码表明模型层 +的共享信号在语境混合后的状态里(ρ 0.216 对孤立编码 0.128),而不在 +attention 权重里。在新状态上,盆地审计首次通过:九个 VG 条件(两种 +状态族 × 三个子集种子 × 每次十次随机重启)中,所有下降轨迹都停在 +真配置能量之上 5–19%。Flickr 仍以不到 1% 之差未过——单视觉视图无 +噪声可白化——因此**双侧多视图观察是数据协议要求**。已通过的闸门 +授权进入无配对软耦合恢复阶段;它不等于可用的多模态能力,真配置也 +尚未成为严格局部最优(仍有 0.2% 的违规对换,精确下降保持 52–59%)。 + +## 匹配是验证,分布对齐才是机制(2026-07-31 定位修正) + +合成世界的端到端结果容易被误读成"我们把藏起来的配对找回来了"。准确 +的说法是:**建立跨模态对应的那一步从未使用任何双射假设**——派生词典 +用的是 6000 个纯文本场景与 6000 个**完全不相交**的纯视觉场景,两侧没 +有任何共享实例,靠的只是各自语料的边缘频率。实例级的 95.3% 匹配与 +93.0% 外推是对"因子坐标是否对准"的**验证**,不是机制本身。 + +这个区分决定了真实数据上的形态:不需要找置换,而是各模态独立发现 +因子、因子取值靠分布统计跨模态对齐、图像直接编码进共享因子坐标再 +解码成文本。真实数据没有真值可算匹配率,评价改为留出集生成质量加 +打乱图像对照。 + +留下的条件比"需要配对"弱得多,但不是没有:两个语料需反映相近的 +世界分布;报告偏差会移动文本边缘分布(实测为优雅退化);共现结构 +比边缘频率更抗偏差,是真实数据上的主力信号。未解的仍是视觉侧的 +因子发现。 + +## 下一步的硬门槛 + +排序闸门保持不变,但下移一层。候选能量必须定义在结构化状态上—— +节点是带内部关系场的区域视图集合,或干预下的响应算子,而不是单个 +pooled 向量;并且必须在视图层级通过同样的排序测试: + +\[ +E(\text{true configuration}) +\ll +E(\text{permuted / semantically wrong configurations}), +\] + +包括单对换扰动下的局部排序。测试中的配对与重放的视图真值只用于 +评价,不能进入能量的定义或调参选择。pooled 节点状态被排除为唯一 +载体:其共享子空间约 16 维,已被证明穷尽。 + +优先寻找的信号不是另一种静态 embedding similarity,而是外部可验证 +的预测结构:当对象被移除、属性改变、数量变化、区域被遮挡或空间关系 +改变时,两侧世界状态的响应规律是否能够在没有实例配对的情况下形成 +唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号: +以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。 + +## 合作者应避免的误解 + +- 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被 + 视觉信号调用的概念与推理结构。 +- 这不是声称所有优秀模型的 embedding 会自然逐点重合。 +- 这不是另一个无监督 graph matching 或 OT benchmark。 +- 这不是用更复杂的正则化偷偷训练一个 bridge。 +- 这不是以 toy theorem 为终点。 +- 小幅 retrieval 提升不等于多模态能力;只有通过生成、问答和严格控制 + 证明输出依赖正确图像,才能提出这一主张。 + +项目真正想回答的是: + +> 当两个强单模态系统已经充分描述同一个世界时,能否用一个可计算的 +> 世界一致性能量固定它们之间的 gauge,并在没有图文配对学习的情况下 +> 释放冻结大语言模型中的多模态推理能力? + |
