blob: 6ade2f15256edb7e6c8c9828926a57e322fca7b5 (
plain)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
|
# 表示结构与对齐过程的需求拆解
日期:2026-07-29。背景:流形闸门实验(`MANIFOLD_RESULTS.md`)证明失败根源
在状态的数据结构,不在能量形式或搜索方法。本文把问题拆成两个阶段——
**先定表示结构,再定对齐过程**——并把每条需求接到已有实验证据上,给出
可测判据。原则不变:任何候选先过排序闸门,再谈优化。
## 拆解的逻辑
之前的路径是"固定表示(pooled 向量)→ 设计能量 → 下降",三轮证伪说明
第一步就错了。正确顺序:
1. 列出表示结构必须满足的需求,逐条给出用隐藏配对可测的判据;
2. 用需求筛候选结构,用闸门给候选定价;
3. 表示定了之后,对齐过程的需求才有意义(保信息、软对应、递归等);
4. 最后才是优化器。
## 阶段一:表示结构的需求
每条需求给出:内容、支持证据、可测判据。
**R1 共享内容充分性。** 结构必须承载对方模态也能观察到的世界信息,
且容量远超 ~16 维。证据:pooled 状态的跨模态共享子空间约 16 维
(top-16 截断 ρ=0.367 > 全空间 0.306,白化毁灭信号),16 维粗坐标
钉不住 512 个实例。判据:跨模态关系 Spearman 与其谱分布——共享信号
必须扩展到更多独立方向,而不是在原 16 维内去噪。
**R2 实例级分辨率。** 主题簇内部必须可分。证据:最差违规对换全是
"文本近平行、视觉无关"对(t=0.90/v≈0);错排曲线显示能量只罚粗重排。
判据:局部闸门——真配置下能降能量的单对换比例;按文本相似度分层的
簇内检索。
**R3 关系的显式承载(模型层读出)。** 关系主要活在模型的计算里
(attention、层间相互作用),不在输出 embedding 的几何里——embedding
余弦场只回收到 ρ≈0.13–0.31 的共享关系信号。结构必须从模型内部抽取
关系:文本侧把一个场景的 16 条短语放进**同一个上下文**联合编码,取
短语间 attention 与 token 交互作为关系场;视觉侧取 DINO patch attention
在区域对上的池化。判据:真视图对齐下,attention 关系场的跨模态对齐
z 是否显著超过 embedding 余弦场的基线 z=46.6(每节点 ρ=0.128)。
**R4 不假设单元一一对应。** 两侧的单元集合天然不同构(patch vs token、
区域 vs 短语、数量不等)。结构必须支持软对应:带权测度、耦合、函数
空间之间的映射,而不是双射。证据:无参照系的 16 视图硬匹配(min-σ
字段拟合)在全容量谱上都是随机甚至反信号(z≈−2.7~−3.1)。判据:候选
结构上软耦合的质量集中度与校准种子精度。
**R5 组合性与层级。** 结构要有显式的多尺度组织(种群 → 场景 → 区域
→ 属性),因为细粒度信号只有通过粗参照系才跨模态可比。证据:视图级
匹配有参照系 2.3 倍随机、无参照系死亡;这是递归对齐的结构前提。
判据:逐层条件化后的下一层对齐增益。
**R6 闭合性通道分离。** 结构应把"共享可观察内容"与"模态私有自由度"
分开存放。证据:QA 文本降低可识别性而 visible_relations 提升;风格/
频率方向主导 pooled 余弦。候选操作:轨道内跨视图可预测子空间投影
(5 描述轨道/16 视图共享的成分 = 内容,视图间不可预测的 = 风格)——
完全无配对合法。判据:投影后共享 ρ 与违规对换比例的变化。
**R7 冻结模型可计算、无配对可构造。** 两侧结构各自独立构造,程序
相同、超参相同,任何步骤不触碰配对。这是硬约束,全部候选必须给出
抽取协议。
**R8 干预响应为一等公民。** 结构应把"受控输入编辑下的状态变化"作为
显式成分(响应向量/算子),因为干预响应是按构造共享细粒度世界变量的
唯一已知来源。注意:缓存特征上的线性 drop-one 是恒等替身,必须真实
重编码(删短语过 Qwen、遮挡区域过 DINO)。判据:真对应下响应场的
跨模态对齐 z 对比静态场基线。
**R9 闸门可测性。** 候选结构必须能直接进现有闸门机制(定义关系通道
与指派空间即可):全局排序 z、单对换违规率、下降盆地。这让每个候选
在任何训练之前就有价格。
**R10 LLM 接口兼容。** 文本侧结构必须保留回到冻结 LLM 可解码状态的
路径(真实文本或 prefix 适配器可接受的激活),否则最终系统的可调用性
断裂。
## 候选结构与需求匹配
| 候选 | 核心对象 | 强项 | 已知弱点/风险 | 闸门成本 |
|---|---|---|---|---|
| C1 视图集+内部关系场 | 每场景 16 视图与其标准化关系场 | R5、R9(已实现) | 静态场共享 ρ 仅 0.13;视图级闸门已证伪:真参照系下 5,000 节点无一严格局部最优(违规 25.5–32.0%),无参照系匹配为零信号 | 已测毕 |
| C2 模型层关系读出 | 联合上下文的短语间 attention;DINO patch attention 区域池化 | R3(直接)、R2 潜力 | 需一轮重抽取;两侧 attention 语义是否同构未知 | 低(一次前向) |
| C3 响应算子 | 删除/遮挡/替换下的重编码响应集 | R8、R2(按构造共享) | 抽取成本最高;响应噪声未知 | 中(数万次前向) |
| C4 谱-函数式种群结构 | 种群扩散算子特征基 + 样本的函数轮廓 | R4、R5 的框架层 | 谱=粗信号,只能当参照系不能当分辨器(已实证:Ricci 流使全局 z 翻倍以上、局部违规率仍 9–14%、伪造解 4/4 存在) | 已测毕 |
| C5 探针坐标+离散不变量 | 对固定探针电池的响应坐标;计数/空间谓词锚点 | R2(计数是 gauge 无关的)、R6 | 视觉侧无监督计数难;覆盖率有限 | 中 |
| C6 分层复合 | C4 作粗框架 + C2/C3 作细层 + C5 作锚点 | 满足全表 | 复杂度;逐层闸门必须分别通过 | 分阶段 |
证据指向 C6 的分层复合,但按闸门纪律,C2 与 C3 必须先单独定价——
它们是"细层信号是否存在于模型内部"的两个独立赌注。
## 阶段二:对齐过程的需求
表示定型后才展开,先立清单:
**P1 保信息。** 对齐变换在共享通道上必须近可逆(有下界的谱、双
Lipschitz 或耦合熵约束)。教训:白化与几何流都毁灭了信号——平滑
不可作为对齐的一部分。判据:对齐后 held-out 结构的重构/检索保持率。
**P2 多尺度递归。** 粗框架先固定 gauge,细层在条件化后对齐,细层
结果回馈锐化框架。每层进出都过隐藏配对评测,防止 EM 式漂移。
**P3 软对应优先。** 耦合/函数映射为默认;离散承诺只通过校准种子
逐步兑现。教训:VG 的高置信匹配精度为零——置信度必须实测校准,
不可假设。
**P4 种子纪律。** 只有经隐藏配对验证的高精度种子可以播种下一层;
种子精度是过程的核心 KPI,不是检索均值。
**P5 排序闸门先行。** 不变的站规。
**P6 不得退化为配对学习。** 过程的任何模块不得暗中学习 image-to-text
映射;配对与视图真值仅评价。
**P7 规模可行性。** 过程复杂度对节点数近线性或 N log N;10⁴–10⁵
节点是短期规模。
**P8 递归收敛性。** 逐轮框架质量(隐藏评测)必须单调不减,否则停。
## 形式化承诺:图变换仅作比喻(2026-07-29 定调)
"图之间的变换"是理解本问题的好比喻,但**不作为字面形式化**。三个
理由,各有实证锚点:
1. **不引入异质离散格式。** 节点/边的多类型数据结构会把表示碎片化。
实证:我们所有有效的关系载体(余弦场、attention 池化、响应场)
都是连续核/场,离散化没有带来任何增益。
2. **谱方法承载不了边上的关系信息。** 把关系图谱化为嵌入只保留粗
骨架。实证:Ricci 流让全局 z 翻倍以上而局部违规率不变(框架与
分辨器解耦);Gram 谱/热核签名是已知不完备不变量;bundle 高阶
矩通道无共享信号。谱机制被指派为框架层专用。
3. **没有一一对应,字面图变换不适定。** 实证:无参照系的 16 视图
硬匹配在全容量谱上为零信号;VG 高置信种子精度为零。硬对应只能
作为校准后逐步兑现的产物,不能作为基本操作。
字面形式化改为统一的连续对象,每个尺度同一格式:
- **状态 = 带权连续视图集(测度)**:场景是视图状态上的加权点集,
无离散身份;
- **关系 = 按需求值的核/算子**:attention 本身就是 token 测度上的
算子,池化场只是它在评测时的投影,不是存储格式;
- **种群框架 = 算子谱**:扩散/流几何只用于粗参照系;
- **对齐 = 测度间耦合 + 算子共轭**:不是节点映射;框架层用小维
函数映射(k×k),细层用软耦合,硬种子须经隐藏配对校准兑现。
数学归属是度量测度空间对齐与函数映射,不是图同构。
## 立即执行的需求验证电池(按成本排序)
1. **R6 测试——已执行,当日最大正向结果。** 场景内视图噪声白化
(广义特征问题:最大化场景间/场景内方差比,纯单模态拟合):
Flickr 轨道 ρ 0.298→0.358、违规对换 7.8%→0.5%(k=32);单描述
ρ 0.189→0.326,超过五描述基线;VG 双侧投影 ρ 0.213→0.614
(k=8)、违规 23.5%→0.25%(k=128)。完整闸门(`content_gate.py`):
k=128 时 VG 下降保持率 53.9%,且**三次随机淬火首次全部停在真值
能量之上**;Flickr 保持率 55.7%、伪造解差距缩到 0.9%。10 重启
×3 种子×k∈{128,256} 确认套件运行中。种群白化毁灭信号而场景内
白化接近通过闸门——两者的差异就是 R6 的全部内容:分母换成
视图噪声协方差。
2. **R3 测试——已执行,假设以精炼形式成立。** 共享的不是 attention
权重(attn×attn 仅 ρ≈0.03–0.08,两侧注意力模式高度模态特化),
而是**语境混合后的状态**:联合编码的 in-context 状态余弦场
ρ=0.227 ≈ 孤立编码基线 0.126 的 1.8 倍(300 节点冒烟;5000 节点
全量与"语境态+R6 投影"复合闸门运行中)。
3. **R8 测试(重编码电池,待做)**:文本侧删短语重编码响应;视觉侧
遮挡重编码响应;真对应下响应场对齐 z。若复合状态已过闸门,R8
转为增量项而非必需项。
4. 通过者进入 C6 组装与阶段二设计。
## 阶段二的数学工具储备(2026-07-29 增补)
原则:每件工具挂在一个已测量的障碍上;标注"已实装/已设计/储备"。
ML 内已常规化的技术(entropic OT、谱聚类等)不列。
**障碍一:玻璃态指派景观**(测量:淬火卡在真值上方 5–19%、准确率
~3% 的错误极小;真值盆地更深但不可达)。
- *并行回火 / 副本交换*(无序系统统计物理;ML 内极少用于指派)——
**已实装**(`blind_recovery.py` 回火臂,精确闭式 ΔE 支持)。
- *对称群 S_n 上的傅里叶分析*(Diaconis–Kondor 表示论):指派能量
按不可约表示分解,低阶不可约 = 一/二阶边缘,带限优化 = 有原理的
粗到细。谱带限同伦臂是它的谱代理版——**代理已实装,正版储备**。
- *空腔法/消息传递(QAP 的 BP/TAP 方程)*(自旋玻璃理论)——储备,
若回火不足再上。
**障碍二:无一一对应的对应本体**(测量:无参照系硬匹配零信号)。
- *Gromov 度量测度空间理论*:observable distance、concentration
function 等 mm-空间不变量是完全 gauge 无关的一元锚点,ML 实践中
基本未用——储备,候选作 C5 锚点族。
- *非平衡/熵正则 Gromov 型耦合的对偶结构*——部分已入 ML;我们只在
软耦合默认对象这一点上使用(P3,已实装)。
**障碍三:关系即算子**(测量:attention 权重模态特化 ρ≈0.03–0.08,
语境混合后状态共享 ρ=0.216——算子本身私有,算子的作用结果共享)。
- *算子代数视角(*-代数、GNS 构造、intertwiner)*:两个模态 = 同一
可观测量代数的两个表示;对齐 = 表示间的缠结算子;R8 的干预 = 代数
生成元,响应一致性 = 代数同态约束。ML 中未使用——**已设计**:这是
R8 电池的形式化框架,干预响应实验将按"求缠结算子"而非"求映射"
设计。
- *函数映射/谱对应*(几何处理领域成熟、多模态 ML 中缺席):框架层
的字面形式化——已设计(C4 的实现语言)。
**障碍四:层级递归的黏合**(测量:细信号只能通过粗参照系访问;
节点↔视图两层耦合必须相容)。
- *胞腔层论与层上同调(Hansen–Ghrist cellular sheaves)*:各局部
耦合 = 层的局部截面;全局对齐存在性 = 全局截面;伪造解/不相容 =
非零 H¹ 障碍;层 Laplacian 扩散 = 递归的同步器。规模化 ML 中
基本未用——**已设计**:视图级递归(P2)将以"层 Dirichlet 能量
最小化"实现,胶合条件就是 cocycle 条件。
**障碍五:可识别性何时成立**(测量:过充分观察有效、单视觉视图
即失败——Flickr 以 <1% 未过闸门)。
- *全局刚性理论(generic global rigidity,Connelly、
Gortler–Healy–Thurston)*:部分距离数据下嵌入唯一性的组合刻画。
"每节点需要多少视图/关系才能钉死 gauge"是一个刚性阈值问题,可对
VG 做视图数消融来验证预测——储备,项目理论篇的候选骨架。
- *测度集中(Gromov–Milman)*:解释"粗框架易、细结构难"的定量
版本——储备。
## 元素与关系的统一表示,与能量的三级阶梯(2026-07-30 增补)
**统一对象问题。**"什么能同时表示元素和关系"有一个证据锚点:R3 表明
显式关系载体(attention 权重)模态私有,而关系烘焙进元素的语境化
状态共享。因此统一对象的抽象形态是**核化测度 (μ, k)**——测度原子为
元素、Markov 核为关系,一个对象同时携带两者;语境化 token 集是它的
可计算实现(token≈原子、attention≈核),张量积表示(TPR)与向量
符号架构(VSA)是可显式解绑的变体。三者是同一对象的三个面。裁决
标准是工程性的,且只在合成世界可测:对每个候选结构测 (a) 模态内
元素/关系解码忠实度(场景真值探针,模态内合法),(b) 闸门下的跨
模态共享分数。这是合成世界的第二个实验(结构识别电池);当前 v0
链产出的 pooled 双塔是它要打败的基线。
**能量来源阶梯。**若定型结构上没有合适的手设计能量,不必退到从
配对学 EBM(协议禁止)。中间地带:各模态先学自己的世界规律模型
(masked-element 预测器——文本塔本就是,视觉塔加 masked-view 头),
**对齐能量 = 候选耦合下的跨模态预测迁移误差**。可学习部分(单模态
预测器)不触碰配对;对齐能量是它们的固定泛函。与已被证伪的
decode-reencode 循环一致性的本质区别:循环只要求自洽(伪造态可以
自洽),预测迁移要求对具体被遮蔽元素**预测正确**,错误 gauge 系统性
迁移失败。学习能量同样先过排序/局部/盆地闸门再进搜索——闸门机制
对能量来源无差别。
## 对三个直觉判断的证据对照
- "embedding 不保存关系"——大方向成立,需一个修正:embedding 几何
确实携带**弱**关系信号(节点内 z=46.6,但每节点 ρ 只有 0.128),
不是零;赌注在于模型层读出能把 ρ 提高一个量级。R3 电池直接判决。
- "最好不是直接离散的"——同意,且要区分两种离散:**离散对应承诺**
(硬匹配)应当推迟到种子校准之后;**离散取值特征**(计数、谓词)
反而是最好的锚点,因为它们 gauge 无关。
- "两边 embedding 可能不一一对应"——已入 R4/P3:测度与耦合为默认
对象,双射只是极限情形。
|