# 表示结构与对齐过程的需求拆解 日期:2026-07-29。背景:流形闸门实验(`MANIFOLD_RESULTS.md`)证明失败根源 在状态的数据结构,不在能量形式或搜索方法。本文把问题拆成两个阶段—— **先定表示结构,再定对齐过程**——并把每条需求接到已有实验证据上,给出 可测判据。原则不变:任何候选先过排序闸门,再谈优化。 ## 拆解的逻辑 之前的路径是"固定表示(pooled 向量)→ 设计能量 → 下降",三轮证伪说明 第一步就错了。正确顺序: 1. 列出表示结构必须满足的需求,逐条给出用隐藏配对可测的判据; 2. 用需求筛候选结构,用闸门给候选定价; 3. 表示定了之后,对齐过程的需求才有意义(保信息、软对应、递归等); 4. 最后才是优化器。 ## 阶段一:表示结构的需求 每条需求给出:内容、支持证据、可测判据。 **R1 共享内容充分性。** 结构必须承载对方模态也能观察到的世界信息, 且容量远超 ~16 维。证据:pooled 状态的跨模态共享子空间约 16 维 (top-16 截断 ρ=0.367 > 全空间 0.306,白化毁灭信号),16 维粗坐标 钉不住 512 个实例。判据:跨模态关系 Spearman 与其谱分布——共享信号 必须扩展到更多独立方向,而不是在原 16 维内去噪。 **R2 实例级分辨率。** 主题簇内部必须可分。证据:最差违规对换全是 "文本近平行、视觉无关"对(t=0.90/v≈0);错排曲线显示能量只罚粗重排。 判据:局部闸门——真配置下能降能量的单对换比例;按文本相似度分层的 簇内检索。 **R3 关系的显式承载(模型层读出)。** 关系主要活在模型的计算里 (attention、层间相互作用),不在输出 embedding 的几何里——embedding 余弦场只回收到 ρ≈0.13–0.31 的共享关系信号。结构必须从模型内部抽取 关系:文本侧把一个场景的 16 条短语放进**同一个上下文**联合编码,取 短语间 attention 与 token 交互作为关系场;视觉侧取 DINO patch attention 在区域对上的池化。判据:真视图对齐下,attention 关系场的跨模态对齐 z 是否显著超过 embedding 余弦场的基线 z=46.6(每节点 ρ=0.128)。 **R4 不假设单元一一对应。** 两侧的单元集合天然不同构(patch vs token、 区域 vs 短语、数量不等)。结构必须支持软对应:带权测度、耦合、函数 空间之间的映射,而不是双射。证据:无参照系的 16 视图硬匹配(min-σ 字段拟合)在全容量谱上都是随机甚至反信号(z≈−2.7~−3.1)。判据:候选 结构上软耦合的质量集中度与校准种子精度。 **R5 组合性与层级。** 结构要有显式的多尺度组织(种群 → 场景 → 区域 → 属性),因为细粒度信号只有通过粗参照系才跨模态可比。证据:视图级 匹配有参照系 2.3 倍随机、无参照系死亡;这是递归对齐的结构前提。 判据:逐层条件化后的下一层对齐增益。 **R6 闭合性通道分离。** 结构应把"共享可观察内容"与"模态私有自由度" 分开存放。证据:QA 文本降低可识别性而 visible_relations 提升;风格/ 频率方向主导 pooled 余弦。候选操作:轨道内跨视图可预测子空间投影 (5 描述轨道/16 视图共享的成分 = 内容,视图间不可预测的 = 风格)—— 完全无配对合法。判据:投影后共享 ρ 与违规对换比例的变化。 **R7 冻结模型可计算、无配对可构造。** 两侧结构各自独立构造,程序 相同、超参相同,任何步骤不触碰配对。这是硬约束,全部候选必须给出 抽取协议。 **R8 干预响应为一等公民。** 结构应把"受控输入编辑下的状态变化"作为 显式成分(响应向量/算子),因为干预响应是按构造共享细粒度世界变量的 唯一已知来源。注意:缓存特征上的线性 drop-one 是恒等替身,必须真实 重编码(删短语过 Qwen、遮挡区域过 DINO)。判据:真对应下响应场的 跨模态对齐 z 对比静态场基线。 **R9 闸门可测性。** 候选结构必须能直接进现有闸门机制(定义关系通道 与指派空间即可):全局排序 z、单对换违规率、下降盆地。这让每个候选 在任何训练之前就有价格。 **R10 LLM 接口兼容。** 文本侧结构必须保留回到冻结 LLM 可解码状态的 路径(真实文本或 prefix 适配器可接受的激活),否则最终系统的可调用性 断裂。 ## 候选结构与需求匹配 | 候选 | 核心对象 | 强项 | 已知弱点/风险 | 闸门成本 | |---|---|---|---|---| | C1 视图集+内部关系场 | 每场景 16 视图与其标准化关系场 | R5、R9(已实现) | 静态场共享 ρ 仅 0.13;视图级闸门已证伪:真参照系下 5,000 节点无一严格局部最优(违规 25.5–32.0%),无参照系匹配为零信号 | 已测毕 | | C2 模型层关系读出 | 联合上下文的短语间 attention;DINO patch attention 区域池化 | R3(直接)、R2 潜力 | 需一轮重抽取;两侧 attention 语义是否同构未知 | 低(一次前向) | | C3 响应算子 | 删除/遮挡/替换下的重编码响应集 | R8、R2(按构造共享) | 抽取成本最高;响应噪声未知 | 中(数万次前向) | | C4 谱-函数式种群结构 | 种群扩散算子特征基 + 样本的函数轮廓 | R4、R5 的框架层 | 谱=粗信号,只能当参照系不能当分辨器(已实证:Ricci 流使全局 z 翻倍以上、局部违规率仍 9–14%、伪造解 4/4 存在) | 已测毕 | | C5 探针坐标+离散不变量 | 对固定探针电池的响应坐标;计数/空间谓词锚点 | R2(计数是 gauge 无关的)、R6 | 视觉侧无监督计数难;覆盖率有限 | 中 | | C6 分层复合 | C4 作粗框架 + C2/C3 作细层 + C5 作锚点 | 满足全表 | 复杂度;逐层闸门必须分别通过 | 分阶段 | 证据指向 C6 的分层复合,但按闸门纪律,C2 与 C3 必须先单独定价—— 它们是"细层信号是否存在于模型内部"的两个独立赌注。 ## 阶段二:对齐过程的需求 表示定型后才展开,先立清单: **P1 保信息。** 对齐变换在共享通道上必须近可逆(有下界的谱、双 Lipschitz 或耦合熵约束)。教训:白化与几何流都毁灭了信号——平滑 不可作为对齐的一部分。判据:对齐后 held-out 结构的重构/检索保持率。 **P2 多尺度递归。** 粗框架先固定 gauge,细层在条件化后对齐,细层 结果回馈锐化框架。每层进出都过隐藏配对评测,防止 EM 式漂移。 **P3 软对应优先。** 耦合/函数映射为默认;离散承诺只通过校准种子 逐步兑现。教训:VG 的高置信匹配精度为零——置信度必须实测校准, 不可假设。 **P4 种子纪律。** 只有经隐藏配对验证的高精度种子可以播种下一层; 种子精度是过程的核心 KPI,不是检索均值。 **P5 排序闸门先行。** 不变的站规。 **P6 不得退化为配对学习。** 过程的任何模块不得暗中学习 image-to-text 映射;配对与视图真值仅评价。 **P7 规模可行性。** 过程复杂度对节点数近线性或 N log N;10⁴–10⁵ 节点是短期规模。 **P8 递归收敛性。** 逐轮框架质量(隐藏评测)必须单调不减,否则停。 ## 形式化承诺:图变换仅作比喻(2026-07-29 定调) "图之间的变换"是理解本问题的好比喻,但**不作为字面形式化**。三个 理由,各有实证锚点: 1. **不引入异质离散格式。** 节点/边的多类型数据结构会把表示碎片化。 实证:我们所有有效的关系载体(余弦场、attention 池化、响应场) 都是连续核/场,离散化没有带来任何增益。 2. **谱方法承载不了边上的关系信息。** 把关系图谱化为嵌入只保留粗 骨架。实证:Ricci 流让全局 z 翻倍以上而局部违规率不变(框架与 分辨器解耦);Gram 谱/热核签名是已知不完备不变量;bundle 高阶 矩通道无共享信号。谱机制被指派为框架层专用。 3. **没有一一对应,字面图变换不适定。** 实证:无参照系的 16 视图 硬匹配在全容量谱上为零信号;VG 高置信种子精度为零。硬对应只能 作为校准后逐步兑现的产物,不能作为基本操作。 字面形式化改为统一的连续对象,每个尺度同一格式: - **状态 = 带权连续视图集(测度)**:场景是视图状态上的加权点集, 无离散身份; - **关系 = 按需求值的核/算子**:attention 本身就是 token 测度上的 算子,池化场只是它在评测时的投影,不是存储格式; - **种群框架 = 算子谱**:扩散/流几何只用于粗参照系; - **对齐 = 测度间耦合 + 算子共轭**:不是节点映射;框架层用小维 函数映射(k×k),细层用软耦合,硬种子须经隐藏配对校准兑现。 数学归属是度量测度空间对齐与函数映射,不是图同构。 ## 立即执行的需求验证电池(按成本排序) 1. **R6 测试——已执行,当日最大正向结果。** 场景内视图噪声白化 (广义特征问题:最大化场景间/场景内方差比,纯单模态拟合): Flickr 轨道 ρ 0.298→0.358、违规对换 7.8%→0.5%(k=32);单描述 ρ 0.189→0.326,超过五描述基线;VG 双侧投影 ρ 0.213→0.614 (k=8)、违规 23.5%→0.25%(k=128)。完整闸门(`content_gate.py`): k=128 时 VG 下降保持率 53.9%,且**三次随机淬火首次全部停在真值 能量之上**;Flickr 保持率 55.7%、伪造解差距缩到 0.9%。10 重启 ×3 种子×k∈{128,256} 确认套件运行中。种群白化毁灭信号而场景内 白化接近通过闸门——两者的差异就是 R6 的全部内容:分母换成 视图噪声协方差。 2. **R3 测试——已执行,假设以精炼形式成立。** 共享的不是 attention 权重(attn×attn 仅 ρ≈0.03–0.08,两侧注意力模式高度模态特化), 而是**语境混合后的状态**:联合编码的 in-context 状态余弦场 ρ=0.227 ≈ 孤立编码基线 0.126 的 1.8 倍(300 节点冒烟;5000 节点 全量与"语境态+R6 投影"复合闸门运行中)。 3. **R8 测试(重编码电池,待做)**:文本侧删短语重编码响应;视觉侧 遮挡重编码响应;真对应下响应场对齐 z。若复合状态已过闸门,R8 转为增量项而非必需项。 4. 通过者进入 C6 组装与阶段二设计。 ## 阶段二的数学工具储备(2026-07-29 增补) 原则:每件工具挂在一个已测量的障碍上;标注"已实装/已设计/储备"。 ML 内已常规化的技术(entropic OT、谱聚类等)不列。 **障碍一:玻璃态指派景观**(测量:淬火卡在真值上方 5–19%、准确率 ~3% 的错误极小;真值盆地更深但不可达)。 - *并行回火 / 副本交换*(无序系统统计物理;ML 内极少用于指派)—— **已实装**(`blind_recovery.py` 回火臂,精确闭式 ΔE 支持)。 - *对称群 S_n 上的傅里叶分析*(Diaconis–Kondor 表示论):指派能量 按不可约表示分解,低阶不可约 = 一/二阶边缘,带限优化 = 有原理的 粗到细。谱带限同伦臂是它的谱代理版——**代理已实装,正版储备**。 - *空腔法/消息传递(QAP 的 BP/TAP 方程)*(自旋玻璃理论)——储备, 若回火不足再上。 **障碍二:无一一对应的对应本体**(测量:无参照系硬匹配零信号)。 - *Gromov 度量测度空间理论*:observable distance、concentration function 等 mm-空间不变量是完全 gauge 无关的一元锚点,ML 实践中 基本未用——储备,候选作 C5 锚点族。 - *非平衡/熵正则 Gromov 型耦合的对偶结构*——部分已入 ML;我们只在 软耦合默认对象这一点上使用(P3,已实装)。 **障碍三:关系即算子**(测量:attention 权重模态特化 ρ≈0.03–0.08, 语境混合后状态共享 ρ=0.216——算子本身私有,算子的作用结果共享)。 - *算子代数视角(*-代数、GNS 构造、intertwiner)*:两个模态 = 同一 可观测量代数的两个表示;对齐 = 表示间的缠结算子;R8 的干预 = 代数 生成元,响应一致性 = 代数同态约束。ML 中未使用——**已设计**:这是 R8 电池的形式化框架,干预响应实验将按"求缠结算子"而非"求映射" 设计。 - *函数映射/谱对应*(几何处理领域成熟、多模态 ML 中缺席):框架层 的字面形式化——已设计(C4 的实现语言)。 **障碍四:层级递归的黏合**(测量:细信号只能通过粗参照系访问; 节点↔视图两层耦合必须相容)。 - *胞腔层论与层上同调(Hansen–Ghrist cellular sheaves)*:各局部 耦合 = 层的局部截面;全局对齐存在性 = 全局截面;伪造解/不相容 = 非零 H¹ 障碍;层 Laplacian 扩散 = 递归的同步器。规模化 ML 中 基本未用——**已设计**:视图级递归(P2)将以"层 Dirichlet 能量 最小化"实现,胶合条件就是 cocycle 条件。 **障碍五:可识别性何时成立**(测量:过充分观察有效、单视觉视图 即失败——Flickr 以 <1% 未过闸门)。 - *全局刚性理论(generic global rigidity,Connelly、 Gortler–Healy–Thurston)*:部分距离数据下嵌入唯一性的组合刻画。 "每节点需要多少视图/关系才能钉死 gauge"是一个刚性阈值问题,可对 VG 做视图数消融来验证预测——储备,项目理论篇的候选骨架。 - *测度集中(Gromov–Milman)*:解释"粗框架易、细结构难"的定量 版本——储备。 ## 元素与关系的统一表示,与能量的三级阶梯(2026-07-30 增补) **统一对象问题。**"什么能同时表示元素和关系"有一个证据锚点:R3 表明 显式关系载体(attention 权重)模态私有,而关系烘焙进元素的语境化 状态共享。因此统一对象的抽象形态是**核化测度 (μ, k)**——测度原子为 元素、Markov 核为关系,一个对象同时携带两者;语境化 token 集是它的 可计算实现(token≈原子、attention≈核),张量积表示(TPR)与向量 符号架构(VSA)是可显式解绑的变体。三者是同一对象的三个面。裁决 标准是工程性的,且只在合成世界可测:对每个候选结构测 (a) 模态内 元素/关系解码忠实度(场景真值探针,模态内合法),(b) 闸门下的跨 模态共享分数。这是合成世界的第二个实验(结构识别电池);当前 v0 链产出的 pooled 双塔是它要打败的基线。 **能量来源阶梯。**若定型结构上没有合适的手设计能量,不必退到从 配对学 EBM(协议禁止)。中间地带:各模态先学自己的世界规律模型 (masked-element 预测器——文本塔本就是,视觉塔加 masked-view 头), **对齐能量 = 候选耦合下的跨模态预测迁移误差**。可学习部分(单模态 预测器)不触碰配对;对齐能量是它们的固定泛函。与已被证伪的 decode-reencode 循环一致性的本质区别:循环只要求自洽(伪造态可以 自洽),预测迁移要求对具体被遮蔽元素**预测正确**,错误 gauge 系统性 迁移失败。学习能量同样先过排序/局部/盆地闸门再进搜索——闸门机制 对能量来源无差别。 ## 对三个直觉判断的证据对照 - "embedding 不保存关系"——大方向成立,需一个修正:embedding 几何 确实携带**弱**关系信号(节点内 z=46.6,但每节点 ρ 只有 0.128), 不是零;赌注在于模型层读出能把 ρ 提高一个量级。R3 电池直接判决。 - "最好不是直接离散的"——同意,且要区分两种离散:**离散对应承诺** (硬匹配)应当推迟到种子校准之后;**离散取值特征**(计数、谓词) 反而是最好的锚点,因为它们 gauge 无关。 - "两边 embedding 可能不一一对应"——已入 R4/P3:测度与耦合为默认 对象,双射只是极限情形。