summaryrefslogtreecommitdiff
path: root/PROJECT_CONCEPT.md
diff options
context:
space:
mode:
Diffstat (limited to 'PROJECT_CONCEPT.md')
-rw-r--r--PROJECT_CONCEPT.md316
1 files changed, 316 insertions, 0 deletions
diff --git a/PROJECT_CONCEPT.md b/PROJECT_CONCEPT.md
new file mode 100644
index 0000000..d5c0265
--- /dev/null
+++ b/PROJECT_CONCEPT.md
@@ -0,0 +1,316 @@
+# 项目概念:用共享世界能量实现无配对多模态对齐
+
+## 一句话目标
+
+我们想验证并最终做成这样一个系统:
+
+> 两个强大的单模态模型如果分别从视觉和语言中学到了足够充分、甚至
+> 过充分的同一世界表征,那么多模态能力未必需要通过图文对比学习或
+> 一个学习 image-to-text correspondence 的 MLP bridge 获得;我们可以
+> 定义一个高层次的共享世界能量,通过迭代能量下降直接找到两种表征
+> 对同一世界状态的一致解释,并用这个状态驱动冻结的大语言模型。
+
+最终目标不是证明一个 toy 数据集上的几何命题,而是让真实图像通过
+这种推断过程获得可验证的冻结多模态大模型能力,例如描述、问答、
+计数、空间关系和组合推理。
+
+暂时可以把项目概括为:
+
+**A Shared World Is Enough: Energy-Based Multimodal Alignment without Paired
+Data**
+
+范式层面的野心(2026-07-30 定调):GPT 范式的巧妙在于把无标签文本
+变成海量自监督;本项目要做的是把**无配对的多模态数据**变成海量
+自对齐——multimodal learning from massive unlabeled data。方法的
+可学习部分永远是单模态自监督(塔内的预测/重建),跨模态的桥永远是
+被搜索出来的耦合变量,不是被配对数据训练出来的权重——这是与
+CLIP(用配对买对应)和跨模态 JEPA(把桥学进网络)的本质分界。
+暂名 world matching,命名不急。
+
+定位与先例(2026-07-30 核查):这个象限没有成功先例。邻居分四类,
+各差一个要素——(1) 配对派(CLIP/LiT/视听共现/I-JEPA+text projection):
+桥总在某处用配对训练,视听共现的"同段视频"也是天然配对;(2) 无监督
+词翻译派(MUSE、vec2vec):真零配对但同模态,成功前提是近等距,跨
+模态不满足(我们测得 ρ≈0.2–0.3);(3) 走私派(无监督图像描述):靠
+监督检测器的类别标签充当桥;(4) 测量派(Platonic Representation
+Hypothesis):测到跨模态表征随规模收敛并猜想可对齐,但只有测量没有
+方法。完整命题——独立自监督双塔、零配对、桥由世界结构一致性搜索
+恢复、驱动冻结生成模型——无人做成;本项目的证伪链(共享子空间
+天花板、搜索硬相、目标决定表征)是对"此象限为何空置"的第一份
+定量地图。
+
+## 动机
+
+强语言模型从文本中学到的不只是词之间的搭配。为了预测语言,它必须
+压缩大量关于对象、属性、关系、事件和世界规律的信息。强视觉模型为了
+预测或表征图像,也必须恢复其中一部分世界结构。
+
+视觉表征和语言表征的坐标系当然不同,但如果它们都足够好地描述同一个
+世界,那么它们不应该是两个任意、毫无关系的系统。我们的核心直觉是:
+
+\[
+\text{good vision representation}
+\quad\text{and}\quad
+\text{good language representation}
+\]
+
+可能是同一个潜在世界模型的不同坐标表达。多模态学习需要解决的主要
+问题可能不是重新学习世界知识,而是确定这两个表达之间未定的 gauge。
+
+Kimi MoonViT 接冻结 GLM 一类实验说明,一个很小的 connector 有可能
+让强视觉塔调用强语言模型中已有的知识与推理能力。但 connector 仍然
+使用了图文监督来学习坐标变换。我们要追问的是更强的问题:
+
+> 如果两个模态已经充分学会了同一个世界,能否不用图文配对监督,
+> 只利用它们必须共同满足的世界规律找到这个 gauge?
+
+## “充分”还不够:为什么需要过充分
+
+这里的“充分”不是说单个 embedding 含有足够多的类别信息,也不是说
+每个样本都能被一个 probe 正确分类。
+
+为了在没有配对的情况下识别两个表示系统,只知道每个世界状态本身的
+信息是不够的。还需要足够丰富的上下文、变化和相互约束,使错误的整体
+重排无法同时保持所有世界规律。
+
+因此我们实际需要的是某种关系意义上的过充分观察,例如:
+
+- 同一场景的多个独立语言描述;
+- 同一对象或场景的多个视角、crop 和尺度;
+- 可见属性、数量和空间关系的问答;
+- 对象移除、属性改变、遮挡或移动前后的状态;
+- 模型在不同上下文和干预下的预测响应;
+- 局部状态如何组合成更大场景的规律。
+
+“graph”只能作为理解这种约束密度的类比。项目不假设模型内部真的存在
+离散语义 node,也不准备把问题简化成构造 kNN 图后做节点匹配。真正要
+匹配的是连续表示所编码的高阶世界规律。
+
+如果观察不够丰富,潜在世界会保留很大的自同构群:大量错误映射都能
+保持相似的局部距离或总体分布。过充分观察的作用是逐步破坏这些错误
+对称性,使正确 gauge 变得可识别。
+
+## 为什么任意自然语言语料不是一个闭合集合
+
+普通百科和互联网文本包含大量不能从给定图片中识别的变量:
+
+- 历史、制度、作者意图和抽象理论;
+- 不可见的因果背景;
+- 地理、时间和人物身份知识;
+- 对未来、反事实和规范性内容的陈述;
+- 语言特有的篇章、修辞和交际变量。
+
+因此“所有自然图像”与“所有自然语言”并不是两个边界一致的世界投影。
+硬匹配它们的总体 marginal 会迫使视觉去解释语言中不可见的自由度,
+或者让语言先验吞掉真正的视觉条件。
+
+早期数据必须尽量形成一个**视觉可识别、支持多种观察、边界相对闭合的
+共享子世界**。这不意味着退回人工 toy world,而是从真实数据中控制
+可比较的部分,例如:
+
+- 多描述真实场景;
+- 只涉及可见内容的 region description;
+- 可见对象、属性、数量与空间关系;
+- 对同一真实场景构造的受控视觉干预;
+- 明确过滤依赖外部知识或不可见意图的问题。
+
+随着方法成立,再逐步放宽闭合性,并显式处理两个模态不共享的自由度。
+
+## 我们要做的不是一个 bridge
+
+目标系统不是:
+
+```text
+image -> vision encoder -> trained MLP -> frozen LLM
+```
+
+这种系统即使 bridge 很小,仍然可以在 bridge 参数中直接学习图文
+correspondence。
+
+我们的目标更接近:
+
+```text
+unpaired visual observations -> frozen vision world states --\
+ > shared-world energy
+unpaired language observations -> frozen language states -----/
+
+new image -> frozen vision state
+ -> iterative energy descent / constrained inference
+ -> an LLM-interpretable world state
+ -> frozen LLM
+ -> image-conditioned description, answer, or reasoning
+```
+
+能量下降中的优化变量可以是连续状态、多个状态构成的 population、
+coupling 或其他受约束的隐变量,但不能暗中退化成一个使用配对数据训练
+的前馈 cross-modal map。
+
+## 什么样的能量才算正确
+
+设世界状态为 \(w\),视觉和语言观察分别为 \(x_V,x_T\),冻结模型给出
+\(h_V,h_T\)。我们寻找的不是一个只让两个 embedding 分布相似的 loss,
+而是一个共享世界能量:
+
+\[
+E(\mathcal H_V,\mathcal H_T; Z),
+\]
+
+其中 \(Z\) 表示待推断的一致状态或对应结构。
+
+正确能量至少需要满足四个条件:
+
+1. **可识别性**:真实配置的能量稳定低于 permutation、错误语义和其他
+ 强负例。
+2. **抗伪造性**:不能通过制造不对应任何真实语言状态的连续向量,复制
+ 一些视觉关系统计就获得低能量。
+3. **功能性**:低能状态不只是几何相似或语言流畅;它必须对世界中的
+ 可验证问题和干预给出一致预测。
+4. **可调用性**:推断出的状态必须真的能驱动冻结 LLM 产生图像条件化
+ 的输出,而不是只提高 embedding retrieval。
+
+静态距离、总体 marginal、局部邻域和语言 fluency 都可以是辅助项,但
+实验已经说明它们的组合不足以保证以上条件。
+
+## 证据阶梯
+
+为了避免把弱信号包装成多模态能力,项目按以下层级推进:
+
+1. **共享结构存在**
+ 正确配置在某些诊断上优于随机或置换。
+2. **能量排序正确**
+ 在真实 held-out 数据上,正确配置的能量显著低于一大族错误配置。
+3. **无配对下降可恢复**
+ 不使用 hidden pairs,能量下降从未知初始化恢复正确语义状态。
+4. **输出确实由图像条件化**
+ 冻结 LLM 的描述或回答显著优于 prior-only、shuffled-image 和其他
+ 必要控制。
+5. **能够外推到新图像**
+ 方法不是只对一个固定 population 做 transductive matching。
+6. **大模型和自然数据上扩展**
+ 在更强视觉塔、LLM、OCR、计数和组合推理任务上仍然成立。
+
+前一级失败时,不应通过扩大下游模型或只报告另一个指标跳过它。
+
+## MVP 的原则
+
+早期实验可以缩小样本和模型,但必须保留最终问题的关键困难:
+
+- 使用真实图像和真实语言,而不是只在合成世界结束;
+- 冻结独立预训练的视觉与语言模型;
+- 训练目标不访问图文配对;
+- 不学习 image-to-language MLP;
+- 最终经过真实冻结 LLM 评估;
+- paired data 只作为隐藏诊断和上界;
+- 必须包含 prior-only、shuffled vision、错误配置和优化收敛控制。
+
+toy 或理论模型可以用于定位机制,但它只能是过程中的工具,不能成为
+项目最终的新意或结论。
+
+## 当前实验告诉了我们什么
+
+截至 2026-07-29:
+
+- 冻结 DINO 与冻结 Qwen 的关系结构存在显著非随机共同信号;
+- 五描述 observation orbit 比单描述更容易区分正确和 shuffled 配置,
+ 支持“关系过充分有帮助”;
+- 静态 GW/SWD 和学习 bridge 不能识别正确 gauge;
+- 不学习 bridge、直接优化语言 latent 的能量下降也出现过短暂 retrieval
+ 提升;
+- 但继续降低当前能量会使 retrieval 回到随机;
+- 更致命的是,真实配对状态的能量高于优化得到的错误状态。
+
+所以当前结果没有否定共享世界假设,但明确否定了现有的静态能量:
+
+\[
+E_{\text{current}}(\text{correct})
+>
+E_{\text{current}}(\text{counterfeit}).
+\]
+
+这意味着当前瓶颈不是优化步数、学习率或模型规模,而是能量缺少能够
+排除 counterfeit state 的高层世界约束。
+
+流形限制实验(同日)进一步定位了缺失约束的位置。把配置空间限制为
+真实文本状态的置换后,连续伪造通道被构造性封死,但证伪结论不变:
+正确指派在全局上优于全部随机置换(z 最高 18.7),却在任何条件下都
+不是局部最优——7–33% 的单对换能降低能量,精确 2-swap 下降会离开
+真值,随机起点总能找到能量更低的错误指派。谱审计把原因定位在状态
+本身:pooled 状态的跨模态共享信号集中在约 16 个种群主方向上(top-16
+截断 Spearman 0.367 高于全空间 0.306,白化则把信号降到 0.03),而
+个体识别所需的细粒度结构是模态私有的。约 16 维的粗主题坐标不可能
+钉住数百个个体指派,因此**任何**定义在这些 pooled 状态上的能量都
+无法通过局部排序闸门——要换的不是匹配器,是状态的数据结构。
+
+同时得到一个建设性结果:在 Visual Genome 节点内部,两模态观察同一
+批 16 个区域,视图级的关系场跨模态对齐显著(5,000 节点上 z = 46.6),
+以节点级粗对齐为参照系时,区域视图可以 2.3 倍于随机地被盲匹配。
+节点级 pooling 丢掉的组合结构,在下一层真实存在。
+
+随后的两个表示电池(见 `STRUCTURE_DESIGN.md` 与 `BATTERY_RESULTS.md`)
+把天花板抬了起来:场景内视图噪声白化(无配对拟合)使 VG 跨模态关系
+相关近乎三倍至 0.61,违规对换率崩至 0.2%;联合上下文编码表明模型层
+的共享信号在语境混合后的状态里(ρ 0.216 对孤立编码 0.128),而不在
+attention 权重里。在新状态上,盆地审计首次通过:九个 VG 条件(两种
+状态族 × 三个子集种子 × 每次十次随机重启)中,所有下降轨迹都停在
+真配置能量之上 5–19%。Flickr 仍以不到 1% 之差未过——单视觉视图无
+噪声可白化——因此**双侧多视图观察是数据协议要求**。已通过的闸门
+授权进入无配对软耦合恢复阶段;它不等于可用的多模态能力,真配置也
+尚未成为严格局部最优(仍有 0.2% 的违规对换,精确下降保持 52–59%)。
+
+## 匹配是验证,分布对齐才是机制(2026-07-31 定位修正)
+
+合成世界的端到端结果容易被误读成"我们把藏起来的配对找回来了"。准确
+的说法是:**建立跨模态对应的那一步从未使用任何双射假设**——派生词典
+用的是 6000 个纯文本场景与 6000 个**完全不相交**的纯视觉场景,两侧没
+有任何共享实例,靠的只是各自语料的边缘频率。实例级的 95.3% 匹配与
+93.0% 外推是对"因子坐标是否对准"的**验证**,不是机制本身。
+
+这个区分决定了真实数据上的形态:不需要找置换,而是各模态独立发现
+因子、因子取值靠分布统计跨模态对齐、图像直接编码进共享因子坐标再
+解码成文本。真实数据没有真值可算匹配率,评价改为留出集生成质量加
+打乱图像对照。
+
+留下的条件比"需要配对"弱得多,但不是没有:两个语料需反映相近的
+世界分布;报告偏差会移动文本边缘分布(实测为优雅退化);共现结构
+比边缘频率更抗偏差,是真实数据上的主力信号。未解的仍是视觉侧的
+因子发现。
+
+## 下一步的硬门槛
+
+排序闸门保持不变,但下移一层。候选能量必须定义在结构化状态上——
+节点是带内部关系场的区域视图集合,或干预下的响应算子,而不是单个
+pooled 向量;并且必须在视图层级通过同样的排序测试:
+
+\[
+E(\text{true configuration})
+\ll
+E(\text{permuted / semantically wrong configurations}),
+\]
+
+包括单对换扰动下的局部排序。测试中的配对与重放的视图真值只用于
+评价,不能进入能量的定义或调参选择。pooled 节点状态被排除为唯一
+载体:其共享子空间约 16 维,已被证明穷尽。
+
+优先寻找的信号不是另一种静态 embedding similarity,而是外部可验证
+的预测结构:当对象被移除、属性改变、数量变化、区域被遮挡或空间关系
+改变时,两侧世界状态的响应规律是否能够在没有实例配对的情况下形成
+唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号:
+以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。
+
+## 合作者应避免的误解
+
+- 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被
+ 视觉信号调用的概念与推理结构。
+- 这不是声称所有优秀模型的 embedding 会自然逐点重合。
+- 这不是另一个无监督 graph matching 或 OT benchmark。
+- 这不是用更复杂的正则化偷偷训练一个 bridge。
+- 这不是以 toy theorem 为终点。
+- 小幅 retrieval 提升不等于多模态能力;只有通过生成、问答和严格控制
+ 证明输出依赖正确图像,才能提出这一主张。
+
+项目真正想回答的是:
+
+> 当两个强单模态系统已经充分描述同一个世界时,能否用一个可计算的
+> 世界一致性能量固定它们之间的 gauge,并在没有图文配对学习的情况下
+> 释放冻结大语言模型中的多模态推理能力?
+