summaryrefslogtreecommitdiff
path: root/PROJECT_CONCEPT.md
diff options
context:
space:
mode:
authorYuren Hao <blackhao0426@gmail.com>2026-08-01 14:10:03 -0500
committerYuren Hao <blackhao0426@gmail.com>2026-08-01 14:10:03 -0500
commita62cf4d2a99b4a7985c61b2a7feb92a82a8218b7 (patch)
treeee2248078db7edf3812a07f195afa3d9bd6f10c6 /PROJECT_CONCEPT.md
World Alignment: unpaired cross-modal correspondence by relational identifiability
Method: scene states are sets of part states; relation fields are built within each modality and are invariant to how each side labels its own features; the cross-modal bridge is a coupling searched under an energy that is a closed-form functional of one matrix; solving is spectral initialisation followed by exact local refinement. Evidence: in a procedurally generated closed world, blind recovery of a hidden image-caption correspondence reaches 95.3% at 256 scenes against 0.39% chance, and the recovered pairs transfer to 200 held-out scenes at 93.0% exact retrieval with random-pair and shuffled-image controls at or near chance. Cross-modal value correspondence is derived from disjoint corpora rather than declared. On Visual Genome the field correlation reaches 0.656 against the 0.9 that polynomial recovery needs, with the deficit attributed away from segmentation and discretisation. Protocol: no image-text pair enters any objective, optimiser, initialisation, or model selection; hidden pairs score orderings only. Co-Authored-By: Claude <noreply@anthropic.com>
Diffstat (limited to 'PROJECT_CONCEPT.md')
-rw-r--r--PROJECT_CONCEPT.md316
1 files changed, 316 insertions, 0 deletions
diff --git a/PROJECT_CONCEPT.md b/PROJECT_CONCEPT.md
new file mode 100644
index 0000000..d5c0265
--- /dev/null
+++ b/PROJECT_CONCEPT.md
@@ -0,0 +1,316 @@
+# 项目概念:用共享世界能量实现无配对多模态对齐
+
+## 一句话目标
+
+我们想验证并最终做成这样一个系统:
+
+> 两个强大的单模态模型如果分别从视觉和语言中学到了足够充分、甚至
+> 过充分的同一世界表征,那么多模态能力未必需要通过图文对比学习或
+> 一个学习 image-to-text correspondence 的 MLP bridge 获得;我们可以
+> 定义一个高层次的共享世界能量,通过迭代能量下降直接找到两种表征
+> 对同一世界状态的一致解释,并用这个状态驱动冻结的大语言模型。
+
+最终目标不是证明一个 toy 数据集上的几何命题,而是让真实图像通过
+这种推断过程获得可验证的冻结多模态大模型能力,例如描述、问答、
+计数、空间关系和组合推理。
+
+暂时可以把项目概括为:
+
+**A Shared World Is Enough: Energy-Based Multimodal Alignment without Paired
+Data**
+
+范式层面的野心(2026-07-30 定调):GPT 范式的巧妙在于把无标签文本
+变成海量自监督;本项目要做的是把**无配对的多模态数据**变成海量
+自对齐——multimodal learning from massive unlabeled data。方法的
+可学习部分永远是单模态自监督(塔内的预测/重建),跨模态的桥永远是
+被搜索出来的耦合变量,不是被配对数据训练出来的权重——这是与
+CLIP(用配对买对应)和跨模态 JEPA(把桥学进网络)的本质分界。
+暂名 world matching,命名不急。
+
+定位与先例(2026-07-30 核查):这个象限没有成功先例。邻居分四类,
+各差一个要素——(1) 配对派(CLIP/LiT/视听共现/I-JEPA+text projection):
+桥总在某处用配对训练,视听共现的"同段视频"也是天然配对;(2) 无监督
+词翻译派(MUSE、vec2vec):真零配对但同模态,成功前提是近等距,跨
+模态不满足(我们测得 ρ≈0.2–0.3);(3) 走私派(无监督图像描述):靠
+监督检测器的类别标签充当桥;(4) 测量派(Platonic Representation
+Hypothesis):测到跨模态表征随规模收敛并猜想可对齐,但只有测量没有
+方法。完整命题——独立自监督双塔、零配对、桥由世界结构一致性搜索
+恢复、驱动冻结生成模型——无人做成;本项目的证伪链(共享子空间
+天花板、搜索硬相、目标决定表征)是对"此象限为何空置"的第一份
+定量地图。
+
+## 动机
+
+强语言模型从文本中学到的不只是词之间的搭配。为了预测语言,它必须
+压缩大量关于对象、属性、关系、事件和世界规律的信息。强视觉模型为了
+预测或表征图像,也必须恢复其中一部分世界结构。
+
+视觉表征和语言表征的坐标系当然不同,但如果它们都足够好地描述同一个
+世界,那么它们不应该是两个任意、毫无关系的系统。我们的核心直觉是:
+
+\[
+\text{good vision representation}
+\quad\text{and}\quad
+\text{good language representation}
+\]
+
+可能是同一个潜在世界模型的不同坐标表达。多模态学习需要解决的主要
+问题可能不是重新学习世界知识,而是确定这两个表达之间未定的 gauge。
+
+Kimi MoonViT 接冻结 GLM 一类实验说明,一个很小的 connector 有可能
+让强视觉塔调用强语言模型中已有的知识与推理能力。但 connector 仍然
+使用了图文监督来学习坐标变换。我们要追问的是更强的问题:
+
+> 如果两个模态已经充分学会了同一个世界,能否不用图文配对监督,
+> 只利用它们必须共同满足的世界规律找到这个 gauge?
+
+## “充分”还不够:为什么需要过充分
+
+这里的“充分”不是说单个 embedding 含有足够多的类别信息,也不是说
+每个样本都能被一个 probe 正确分类。
+
+为了在没有配对的情况下识别两个表示系统,只知道每个世界状态本身的
+信息是不够的。还需要足够丰富的上下文、变化和相互约束,使错误的整体
+重排无法同时保持所有世界规律。
+
+因此我们实际需要的是某种关系意义上的过充分观察,例如:
+
+- 同一场景的多个独立语言描述;
+- 同一对象或场景的多个视角、crop 和尺度;
+- 可见属性、数量和空间关系的问答;
+- 对象移除、属性改变、遮挡或移动前后的状态;
+- 模型在不同上下文和干预下的预测响应;
+- 局部状态如何组合成更大场景的规律。
+
+“graph”只能作为理解这种约束密度的类比。项目不假设模型内部真的存在
+离散语义 node,也不准备把问题简化成构造 kNN 图后做节点匹配。真正要
+匹配的是连续表示所编码的高阶世界规律。
+
+如果观察不够丰富,潜在世界会保留很大的自同构群:大量错误映射都能
+保持相似的局部距离或总体分布。过充分观察的作用是逐步破坏这些错误
+对称性,使正确 gauge 变得可识别。
+
+## 为什么任意自然语言语料不是一个闭合集合
+
+普通百科和互联网文本包含大量不能从给定图片中识别的变量:
+
+- 历史、制度、作者意图和抽象理论;
+- 不可见的因果背景;
+- 地理、时间和人物身份知识;
+- 对未来、反事实和规范性内容的陈述;
+- 语言特有的篇章、修辞和交际变量。
+
+因此“所有自然图像”与“所有自然语言”并不是两个边界一致的世界投影。
+硬匹配它们的总体 marginal 会迫使视觉去解释语言中不可见的自由度,
+或者让语言先验吞掉真正的视觉条件。
+
+早期数据必须尽量形成一个**视觉可识别、支持多种观察、边界相对闭合的
+共享子世界**。这不意味着退回人工 toy world,而是从真实数据中控制
+可比较的部分,例如:
+
+- 多描述真实场景;
+- 只涉及可见内容的 region description;
+- 可见对象、属性、数量与空间关系;
+- 对同一真实场景构造的受控视觉干预;
+- 明确过滤依赖外部知识或不可见意图的问题。
+
+随着方法成立,再逐步放宽闭合性,并显式处理两个模态不共享的自由度。
+
+## 我们要做的不是一个 bridge
+
+目标系统不是:
+
+```text
+image -> vision encoder -> trained MLP -> frozen LLM
+```
+
+这种系统即使 bridge 很小,仍然可以在 bridge 参数中直接学习图文
+correspondence。
+
+我们的目标更接近:
+
+```text
+unpaired visual observations -> frozen vision world states --\
+ > shared-world energy
+unpaired language observations -> frozen language states -----/
+
+new image -> frozen vision state
+ -> iterative energy descent / constrained inference
+ -> an LLM-interpretable world state
+ -> frozen LLM
+ -> image-conditioned description, answer, or reasoning
+```
+
+能量下降中的优化变量可以是连续状态、多个状态构成的 population、
+coupling 或其他受约束的隐变量,但不能暗中退化成一个使用配对数据训练
+的前馈 cross-modal map。
+
+## 什么样的能量才算正确
+
+设世界状态为 \(w\),视觉和语言观察分别为 \(x_V,x_T\),冻结模型给出
+\(h_V,h_T\)。我们寻找的不是一个只让两个 embedding 分布相似的 loss,
+而是一个共享世界能量:
+
+\[
+E(\mathcal H_V,\mathcal H_T; Z),
+\]
+
+其中 \(Z\) 表示待推断的一致状态或对应结构。
+
+正确能量至少需要满足四个条件:
+
+1. **可识别性**:真实配置的能量稳定低于 permutation、错误语义和其他
+ 强负例。
+2. **抗伪造性**:不能通过制造不对应任何真实语言状态的连续向量,复制
+ 一些视觉关系统计就获得低能量。
+3. **功能性**:低能状态不只是几何相似或语言流畅;它必须对世界中的
+ 可验证问题和干预给出一致预测。
+4. **可调用性**:推断出的状态必须真的能驱动冻结 LLM 产生图像条件化
+ 的输出,而不是只提高 embedding retrieval。
+
+静态距离、总体 marginal、局部邻域和语言 fluency 都可以是辅助项,但
+实验已经说明它们的组合不足以保证以上条件。
+
+## 证据阶梯
+
+为了避免把弱信号包装成多模态能力,项目按以下层级推进:
+
+1. **共享结构存在**
+ 正确配置在某些诊断上优于随机或置换。
+2. **能量排序正确**
+ 在真实 held-out 数据上,正确配置的能量显著低于一大族错误配置。
+3. **无配对下降可恢复**
+ 不使用 hidden pairs,能量下降从未知初始化恢复正确语义状态。
+4. **输出确实由图像条件化**
+ 冻结 LLM 的描述或回答显著优于 prior-only、shuffled-image 和其他
+ 必要控制。
+5. **能够外推到新图像**
+ 方法不是只对一个固定 population 做 transductive matching。
+6. **大模型和自然数据上扩展**
+ 在更强视觉塔、LLM、OCR、计数和组合推理任务上仍然成立。
+
+前一级失败时,不应通过扩大下游模型或只报告另一个指标跳过它。
+
+## MVP 的原则
+
+早期实验可以缩小样本和模型,但必须保留最终问题的关键困难:
+
+- 使用真实图像和真实语言,而不是只在合成世界结束;
+- 冻结独立预训练的视觉与语言模型;
+- 训练目标不访问图文配对;
+- 不学习 image-to-language MLP;
+- 最终经过真实冻结 LLM 评估;
+- paired data 只作为隐藏诊断和上界;
+- 必须包含 prior-only、shuffled vision、错误配置和优化收敛控制。
+
+toy 或理论模型可以用于定位机制,但它只能是过程中的工具,不能成为
+项目最终的新意或结论。
+
+## 当前实验告诉了我们什么
+
+截至 2026-07-29:
+
+- 冻结 DINO 与冻结 Qwen 的关系结构存在显著非随机共同信号;
+- 五描述 observation orbit 比单描述更容易区分正确和 shuffled 配置,
+ 支持“关系过充分有帮助”;
+- 静态 GW/SWD 和学习 bridge 不能识别正确 gauge;
+- 不学习 bridge、直接优化语言 latent 的能量下降也出现过短暂 retrieval
+ 提升;
+- 但继续降低当前能量会使 retrieval 回到随机;
+- 更致命的是,真实配对状态的能量高于优化得到的错误状态。
+
+所以当前结果没有否定共享世界假设,但明确否定了现有的静态能量:
+
+\[
+E_{\text{current}}(\text{correct})
+>
+E_{\text{current}}(\text{counterfeit}).
+\]
+
+这意味着当前瓶颈不是优化步数、学习率或模型规模,而是能量缺少能够
+排除 counterfeit state 的高层世界约束。
+
+流形限制实验(同日)进一步定位了缺失约束的位置。把配置空间限制为
+真实文本状态的置换后,连续伪造通道被构造性封死,但证伪结论不变:
+正确指派在全局上优于全部随机置换(z 最高 18.7),却在任何条件下都
+不是局部最优——7–33% 的单对换能降低能量,精确 2-swap 下降会离开
+真值,随机起点总能找到能量更低的错误指派。谱审计把原因定位在状态
+本身:pooled 状态的跨模态共享信号集中在约 16 个种群主方向上(top-16
+截断 Spearman 0.367 高于全空间 0.306,白化则把信号降到 0.03),而
+个体识别所需的细粒度结构是模态私有的。约 16 维的粗主题坐标不可能
+钉住数百个个体指派,因此**任何**定义在这些 pooled 状态上的能量都
+无法通过局部排序闸门——要换的不是匹配器,是状态的数据结构。
+
+同时得到一个建设性结果:在 Visual Genome 节点内部,两模态观察同一
+批 16 个区域,视图级的关系场跨模态对齐显著(5,000 节点上 z = 46.6),
+以节点级粗对齐为参照系时,区域视图可以 2.3 倍于随机地被盲匹配。
+节点级 pooling 丢掉的组合结构,在下一层真实存在。
+
+随后的两个表示电池(见 `STRUCTURE_DESIGN.md` 与 `BATTERY_RESULTS.md`)
+把天花板抬了起来:场景内视图噪声白化(无配对拟合)使 VG 跨模态关系
+相关近乎三倍至 0.61,违规对换率崩至 0.2%;联合上下文编码表明模型层
+的共享信号在语境混合后的状态里(ρ 0.216 对孤立编码 0.128),而不在
+attention 权重里。在新状态上,盆地审计首次通过:九个 VG 条件(两种
+状态族 × 三个子集种子 × 每次十次随机重启)中,所有下降轨迹都停在
+真配置能量之上 5–19%。Flickr 仍以不到 1% 之差未过——单视觉视图无
+噪声可白化——因此**双侧多视图观察是数据协议要求**。已通过的闸门
+授权进入无配对软耦合恢复阶段;它不等于可用的多模态能力,真配置也
+尚未成为严格局部最优(仍有 0.2% 的违规对换,精确下降保持 52–59%)。
+
+## 匹配是验证,分布对齐才是机制(2026-07-31 定位修正)
+
+合成世界的端到端结果容易被误读成"我们把藏起来的配对找回来了"。准确
+的说法是:**建立跨模态对应的那一步从未使用任何双射假设**——派生词典
+用的是 6000 个纯文本场景与 6000 个**完全不相交**的纯视觉场景,两侧没
+有任何共享实例,靠的只是各自语料的边缘频率。实例级的 95.3% 匹配与
+93.0% 外推是对"因子坐标是否对准"的**验证**,不是机制本身。
+
+这个区分决定了真实数据上的形态:不需要找置换,而是各模态独立发现
+因子、因子取值靠分布统计跨模态对齐、图像直接编码进共享因子坐标再
+解码成文本。真实数据没有真值可算匹配率,评价改为留出集生成质量加
+打乱图像对照。
+
+留下的条件比"需要配对"弱得多,但不是没有:两个语料需反映相近的
+世界分布;报告偏差会移动文本边缘分布(实测为优雅退化);共现结构
+比边缘频率更抗偏差,是真实数据上的主力信号。未解的仍是视觉侧的
+因子发现。
+
+## 下一步的硬门槛
+
+排序闸门保持不变,但下移一层。候选能量必须定义在结构化状态上——
+节点是带内部关系场的区域视图集合,或干预下的响应算子,而不是单个
+pooled 向量;并且必须在视图层级通过同样的排序测试:
+
+\[
+E(\text{true configuration})
+\ll
+E(\text{permuted / semantically wrong configurations}),
+\]
+
+包括单对换扰动下的局部排序。测试中的配对与重放的视图真值只用于
+评价,不能进入能量的定义或调参选择。pooled 节点状态被排除为唯一
+载体:其共享子空间约 16 维,已被证明穷尽。
+
+优先寻找的信号不是另一种静态 embedding similarity,而是外部可验证
+的预测结构:当对象被移除、属性改变、数量变化、区域被遮挡或空间关系
+改变时,两侧世界状态的响应规律是否能够在没有实例配对的情况下形成
+唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号:
+以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。
+
+## 合作者应避免的误解
+
+- 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被
+ 视觉信号调用的概念与推理结构。
+- 这不是声称所有优秀模型的 embedding 会自然逐点重合。
+- 这不是另一个无监督 graph matching 或 OT benchmark。
+- 这不是用更复杂的正则化偷偷训练一个 bridge。
+- 这不是以 toy theorem 为终点。
+- 小幅 retrieval 提升不等于多模态能力;只有通过生成、问答和严格控制
+ 证明输出依赖正确图像,才能提出这一主张。
+
+项目真正想回答的是:
+
+> 当两个强单模态系统已经充分描述同一个世界时,能否用一个可计算的
+> 世界一致性能量固定它们之间的 gauge,并在没有图文配对学习的情况下
+> 释放冻结大语言模型中的多模态推理能力?
+