summaryrefslogtreecommitdiff
path: root/STRUCTURE_DESIGN.md
diff options
context:
space:
mode:
Diffstat (limited to 'STRUCTURE_DESIGN.md')
-rw-r--r--STRUCTURE_DESIGN.md254
1 files changed, 254 insertions, 0 deletions
diff --git a/STRUCTURE_DESIGN.md b/STRUCTURE_DESIGN.md
new file mode 100644
index 0000000..6ade2f1
--- /dev/null
+++ b/STRUCTURE_DESIGN.md
@@ -0,0 +1,254 @@
+# 表示结构与对齐过程的需求拆解
+
+日期:2026-07-29。背景:流形闸门实验(`MANIFOLD_RESULTS.md`)证明失败根源
+在状态的数据结构,不在能量形式或搜索方法。本文把问题拆成两个阶段——
+**先定表示结构,再定对齐过程**——并把每条需求接到已有实验证据上,给出
+可测判据。原则不变:任何候选先过排序闸门,再谈优化。
+
+## 拆解的逻辑
+
+之前的路径是"固定表示(pooled 向量)→ 设计能量 → 下降",三轮证伪说明
+第一步就错了。正确顺序:
+
+1. 列出表示结构必须满足的需求,逐条给出用隐藏配对可测的判据;
+2. 用需求筛候选结构,用闸门给候选定价;
+3. 表示定了之后,对齐过程的需求才有意义(保信息、软对应、递归等);
+4. 最后才是优化器。
+
+## 阶段一:表示结构的需求
+
+每条需求给出:内容、支持证据、可测判据。
+
+**R1 共享内容充分性。** 结构必须承载对方模态也能观察到的世界信息,
+且容量远超 ~16 维。证据:pooled 状态的跨模态共享子空间约 16 维
+(top-16 截断 ρ=0.367 > 全空间 0.306,白化毁灭信号),16 维粗坐标
+钉不住 512 个实例。判据:跨模态关系 Spearman 与其谱分布——共享信号
+必须扩展到更多独立方向,而不是在原 16 维内去噪。
+
+**R2 实例级分辨率。** 主题簇内部必须可分。证据:最差违规对换全是
+"文本近平行、视觉无关"对(t=0.90/v≈0);错排曲线显示能量只罚粗重排。
+判据:局部闸门——真配置下能降能量的单对换比例;按文本相似度分层的
+簇内检索。
+
+**R3 关系的显式承载(模型层读出)。** 关系主要活在模型的计算里
+(attention、层间相互作用),不在输出 embedding 的几何里——embedding
+余弦场只回收到 ρ≈0.13–0.31 的共享关系信号。结构必须从模型内部抽取
+关系:文本侧把一个场景的 16 条短语放进**同一个上下文**联合编码,取
+短语间 attention 与 token 交互作为关系场;视觉侧取 DINO patch attention
+在区域对上的池化。判据:真视图对齐下,attention 关系场的跨模态对齐
+z 是否显著超过 embedding 余弦场的基线 z=46.6(每节点 ρ=0.128)。
+
+**R4 不假设单元一一对应。** 两侧的单元集合天然不同构(patch vs token、
+区域 vs 短语、数量不等)。结构必须支持软对应:带权测度、耦合、函数
+空间之间的映射,而不是双射。证据:无参照系的 16 视图硬匹配(min-σ
+字段拟合)在全容量谱上都是随机甚至反信号(z≈−2.7~−3.1)。判据:候选
+结构上软耦合的质量集中度与校准种子精度。
+
+**R5 组合性与层级。** 结构要有显式的多尺度组织(种群 → 场景 → 区域
+→ 属性),因为细粒度信号只有通过粗参照系才跨模态可比。证据:视图级
+匹配有参照系 2.3 倍随机、无参照系死亡;这是递归对齐的结构前提。
+判据:逐层条件化后的下一层对齐增益。
+
+**R6 闭合性通道分离。** 结构应把"共享可观察内容"与"模态私有自由度"
+分开存放。证据:QA 文本降低可识别性而 visible_relations 提升;风格/
+频率方向主导 pooled 余弦。候选操作:轨道内跨视图可预测子空间投影
+(5 描述轨道/16 视图共享的成分 = 内容,视图间不可预测的 = 风格)——
+完全无配对合法。判据:投影后共享 ρ 与违规对换比例的变化。
+
+**R7 冻结模型可计算、无配对可构造。** 两侧结构各自独立构造,程序
+相同、超参相同,任何步骤不触碰配对。这是硬约束,全部候选必须给出
+抽取协议。
+
+**R8 干预响应为一等公民。** 结构应把"受控输入编辑下的状态变化"作为
+显式成分(响应向量/算子),因为干预响应是按构造共享细粒度世界变量的
+唯一已知来源。注意:缓存特征上的线性 drop-one 是恒等替身,必须真实
+重编码(删短语过 Qwen、遮挡区域过 DINO)。判据:真对应下响应场的
+跨模态对齐 z 对比静态场基线。
+
+**R9 闸门可测性。** 候选结构必须能直接进现有闸门机制(定义关系通道
+与指派空间即可):全局排序 z、单对换违规率、下降盆地。这让每个候选
+在任何训练之前就有价格。
+
+**R10 LLM 接口兼容。** 文本侧结构必须保留回到冻结 LLM 可解码状态的
+路径(真实文本或 prefix 适配器可接受的激活),否则最终系统的可调用性
+断裂。
+
+## 候选结构与需求匹配
+
+| 候选 | 核心对象 | 强项 | 已知弱点/风险 | 闸门成本 |
+|---|---|---|---|---|
+| C1 视图集+内部关系场 | 每场景 16 视图与其标准化关系场 | R5、R9(已实现) | 静态场共享 ρ 仅 0.13;视图级闸门已证伪:真参照系下 5,000 节点无一严格局部最优(违规 25.5–32.0%),无参照系匹配为零信号 | 已测毕 |
+| C2 模型层关系读出 | 联合上下文的短语间 attention;DINO patch attention 区域池化 | R3(直接)、R2 潜力 | 需一轮重抽取;两侧 attention 语义是否同构未知 | 低(一次前向) |
+| C3 响应算子 | 删除/遮挡/替换下的重编码响应集 | R8、R2(按构造共享) | 抽取成本最高;响应噪声未知 | 中(数万次前向) |
+| C4 谱-函数式种群结构 | 种群扩散算子特征基 + 样本的函数轮廓 | R4、R5 的框架层 | 谱=粗信号,只能当参照系不能当分辨器(已实证:Ricci 流使全局 z 翻倍以上、局部违规率仍 9–14%、伪造解 4/4 存在) | 已测毕 |
+| C5 探针坐标+离散不变量 | 对固定探针电池的响应坐标;计数/空间谓词锚点 | R2(计数是 gauge 无关的)、R6 | 视觉侧无监督计数难;覆盖率有限 | 中 |
+| C6 分层复合 | C4 作粗框架 + C2/C3 作细层 + C5 作锚点 | 满足全表 | 复杂度;逐层闸门必须分别通过 | 分阶段 |
+
+证据指向 C6 的分层复合,但按闸门纪律,C2 与 C3 必须先单独定价——
+它们是"细层信号是否存在于模型内部"的两个独立赌注。
+
+## 阶段二:对齐过程的需求
+
+表示定型后才展开,先立清单:
+
+**P1 保信息。** 对齐变换在共享通道上必须近可逆(有下界的谱、双
+Lipschitz 或耦合熵约束)。教训:白化与几何流都毁灭了信号——平滑
+不可作为对齐的一部分。判据:对齐后 held-out 结构的重构/检索保持率。
+
+**P2 多尺度递归。** 粗框架先固定 gauge,细层在条件化后对齐,细层
+结果回馈锐化框架。每层进出都过隐藏配对评测,防止 EM 式漂移。
+
+**P3 软对应优先。** 耦合/函数映射为默认;离散承诺只通过校准种子
+逐步兑现。教训:VG 的高置信匹配精度为零——置信度必须实测校准,
+不可假设。
+
+**P4 种子纪律。** 只有经隐藏配对验证的高精度种子可以播种下一层;
+种子精度是过程的核心 KPI,不是检索均值。
+
+**P5 排序闸门先行。** 不变的站规。
+
+**P6 不得退化为配对学习。** 过程的任何模块不得暗中学习 image-to-text
+映射;配对与视图真值仅评价。
+
+**P7 规模可行性。** 过程复杂度对节点数近线性或 N log N;10⁴–10⁵
+节点是短期规模。
+
+**P8 递归收敛性。** 逐轮框架质量(隐藏评测)必须单调不减,否则停。
+
+## 形式化承诺:图变换仅作比喻(2026-07-29 定调)
+
+"图之间的变换"是理解本问题的好比喻,但**不作为字面形式化**。三个
+理由,各有实证锚点:
+
+1. **不引入异质离散格式。** 节点/边的多类型数据结构会把表示碎片化。
+ 实证:我们所有有效的关系载体(余弦场、attention 池化、响应场)
+ 都是连续核/场,离散化没有带来任何增益。
+2. **谱方法承载不了边上的关系信息。** 把关系图谱化为嵌入只保留粗
+ 骨架。实证:Ricci 流让全局 z 翻倍以上而局部违规率不变(框架与
+ 分辨器解耦);Gram 谱/热核签名是已知不完备不变量;bundle 高阶
+ 矩通道无共享信号。谱机制被指派为框架层专用。
+3. **没有一一对应,字面图变换不适定。** 实证:无参照系的 16 视图
+ 硬匹配在全容量谱上为零信号;VG 高置信种子精度为零。硬对应只能
+ 作为校准后逐步兑现的产物,不能作为基本操作。
+
+字面形式化改为统一的连续对象,每个尺度同一格式:
+
+- **状态 = 带权连续视图集(测度)**:场景是视图状态上的加权点集,
+ 无离散身份;
+- **关系 = 按需求值的核/算子**:attention 本身就是 token 测度上的
+ 算子,池化场只是它在评测时的投影,不是存储格式;
+- **种群框架 = 算子谱**:扩散/流几何只用于粗参照系;
+- **对齐 = 测度间耦合 + 算子共轭**:不是节点映射;框架层用小维
+ 函数映射(k×k),细层用软耦合,硬种子须经隐藏配对校准兑现。
+
+数学归属是度量测度空间对齐与函数映射,不是图同构。
+
+## 立即执行的需求验证电池(按成本排序)
+
+1. **R6 测试——已执行,当日最大正向结果。** 场景内视图噪声白化
+ (广义特征问题:最大化场景间/场景内方差比,纯单模态拟合):
+ Flickr 轨道 ρ 0.298→0.358、违规对换 7.8%→0.5%(k=32);单描述
+ ρ 0.189→0.326,超过五描述基线;VG 双侧投影 ρ 0.213→0.614
+ (k=8)、违规 23.5%→0.25%(k=128)。完整闸门(`content_gate.py`):
+ k=128 时 VG 下降保持率 53.9%,且**三次随机淬火首次全部停在真值
+ 能量之上**;Flickr 保持率 55.7%、伪造解差距缩到 0.9%。10 重启
+ ×3 种子×k∈{128,256} 确认套件运行中。种群白化毁灭信号而场景内
+ 白化接近通过闸门——两者的差异就是 R6 的全部内容:分母换成
+ 视图噪声协方差。
+2. **R3 测试——已执行,假设以精炼形式成立。** 共享的不是 attention
+ 权重(attn×attn 仅 ρ≈0.03–0.08,两侧注意力模式高度模态特化),
+ 而是**语境混合后的状态**:联合编码的 in-context 状态余弦场
+ ρ=0.227 ≈ 孤立编码基线 0.126 的 1.8 倍(300 节点冒烟;5000 节点
+ 全量与"语境态+R6 投影"复合闸门运行中)。
+3. **R8 测试(重编码电池,待做)**:文本侧删短语重编码响应;视觉侧
+ 遮挡重编码响应;真对应下响应场对齐 z。若复合状态已过闸门,R8
+ 转为增量项而非必需项。
+4. 通过者进入 C6 组装与阶段二设计。
+
+## 阶段二的数学工具储备(2026-07-29 增补)
+
+原则:每件工具挂在一个已测量的障碍上;标注"已实装/已设计/储备"。
+ML 内已常规化的技术(entropic OT、谱聚类等)不列。
+
+**障碍一:玻璃态指派景观**(测量:淬火卡在真值上方 5–19%、准确率
+~3% 的错误极小;真值盆地更深但不可达)。
+
+- *并行回火 / 副本交换*(无序系统统计物理;ML 内极少用于指派)——
+ **已实装**(`blind_recovery.py` 回火臂,精确闭式 ΔE 支持)。
+- *对称群 S_n 上的傅里叶分析*(Diaconis–Kondor 表示论):指派能量
+ 按不可约表示分解,低阶不可约 = 一/二阶边缘,带限优化 = 有原理的
+ 粗到细。谱带限同伦臂是它的谱代理版——**代理已实装,正版储备**。
+- *空腔法/消息传递(QAP 的 BP/TAP 方程)*(自旋玻璃理论)——储备,
+ 若回火不足再上。
+
+**障碍二:无一一对应的对应本体**(测量:无参照系硬匹配零信号)。
+
+- *Gromov 度量测度空间理论*:observable distance、concentration
+ function 等 mm-空间不变量是完全 gauge 无关的一元锚点,ML 实践中
+ 基本未用——储备,候选作 C5 锚点族。
+- *非平衡/熵正则 Gromov 型耦合的对偶结构*——部分已入 ML;我们只在
+ 软耦合默认对象这一点上使用(P3,已实装)。
+
+**障碍三:关系即算子**(测量:attention 权重模态特化 ρ≈0.03–0.08,
+语境混合后状态共享 ρ=0.216——算子本身私有,算子的作用结果共享)。
+
+- *算子代数视角(*-代数、GNS 构造、intertwiner)*:两个模态 = 同一
+ 可观测量代数的两个表示;对齐 = 表示间的缠结算子;R8 的干预 = 代数
+ 生成元,响应一致性 = 代数同态约束。ML 中未使用——**已设计**:这是
+ R8 电池的形式化框架,干预响应实验将按"求缠结算子"而非"求映射"
+ 设计。
+- *函数映射/谱对应*(几何处理领域成熟、多模态 ML 中缺席):框架层
+ 的字面形式化——已设计(C4 的实现语言)。
+
+**障碍四:层级递归的黏合**(测量:细信号只能通过粗参照系访问;
+节点↔视图两层耦合必须相容)。
+
+- *胞腔层论与层上同调(Hansen–Ghrist cellular sheaves)*:各局部
+ 耦合 = 层的局部截面;全局对齐存在性 = 全局截面;伪造解/不相容 =
+ 非零 H¹ 障碍;层 Laplacian 扩散 = 递归的同步器。规模化 ML 中
+ 基本未用——**已设计**:视图级递归(P2)将以"层 Dirichlet 能量
+ 最小化"实现,胶合条件就是 cocycle 条件。
+
+**障碍五:可识别性何时成立**(测量:过充分观察有效、单视觉视图
+即失败——Flickr 以 <1% 未过闸门)。
+
+- *全局刚性理论(generic global rigidity,Connelly、
+ Gortler–Healy–Thurston)*:部分距离数据下嵌入唯一性的组合刻画。
+ "每节点需要多少视图/关系才能钉死 gauge"是一个刚性阈值问题,可对
+ VG 做视图数消融来验证预测——储备,项目理论篇的候选骨架。
+- *测度集中(Gromov–Milman)*:解释"粗框架易、细结构难"的定量
+ 版本——储备。
+
+## 元素与关系的统一表示,与能量的三级阶梯(2026-07-30 增补)
+
+**统一对象问题。**"什么能同时表示元素和关系"有一个证据锚点:R3 表明
+显式关系载体(attention 权重)模态私有,而关系烘焙进元素的语境化
+状态共享。因此统一对象的抽象形态是**核化测度 (μ, k)**——测度原子为
+元素、Markov 核为关系,一个对象同时携带两者;语境化 token 集是它的
+可计算实现(token≈原子、attention≈核),张量积表示(TPR)与向量
+符号架构(VSA)是可显式解绑的变体。三者是同一对象的三个面。裁决
+标准是工程性的,且只在合成世界可测:对每个候选结构测 (a) 模态内
+元素/关系解码忠实度(场景真值探针,模态内合法),(b) 闸门下的跨
+模态共享分数。这是合成世界的第二个实验(结构识别电池);当前 v0
+链产出的 pooled 双塔是它要打败的基线。
+
+**能量来源阶梯。**若定型结构上没有合适的手设计能量,不必退到从
+配对学 EBM(协议禁止)。中间地带:各模态先学自己的世界规律模型
+(masked-element 预测器——文本塔本就是,视觉塔加 masked-view 头),
+**对齐能量 = 候选耦合下的跨模态预测迁移误差**。可学习部分(单模态
+预测器)不触碰配对;对齐能量是它们的固定泛函。与已被证伪的
+decode-reencode 循环一致性的本质区别:循环只要求自洽(伪造态可以
+自洽),预测迁移要求对具体被遮蔽元素**预测正确**,错误 gauge 系统性
+迁移失败。学习能量同样先过排序/局部/盆地闸门再进搜索——闸门机制
+对能量来源无差别。
+
+## 对三个直觉判断的证据对照
+
+- "embedding 不保存关系"——大方向成立,需一个修正:embedding 几何
+ 确实携带**弱**关系信号(节点内 z=46.6,但每节点 ρ 只有 0.128),
+ 不是零;赌注在于模型层读出能把 ρ 提高一个量级。R3 电池直接判决。
+- "最好不是直接离散的"——同意,且要区分两种离散:**离散对应承诺**
+ (硬匹配)应当推迟到种子校准之后;**离散取值特征**(计数、谓词)
+ 反而是最好的锚点,因为它们 gauge 无关。
+- "两边 embedding 可能不一一对应"——已入 R4/P3:测度与耦合为默认
+ 对象,双射只是极限情形。