summaryrefslogtreecommitdiff
path: root/PROJECT_CONCEPT.md
diff options
context:
space:
mode:
Diffstat (limited to 'PROJECT_CONCEPT.md')
-rw-r--r--PROJECT_CONCEPT.md47
1 files changed, 47 insertions, 0 deletions
diff --git a/PROJECT_CONCEPT.md b/PROJECT_CONCEPT.md
index d5c0265..d9232e6 100644
--- a/PROJECT_CONCEPT.md
+++ b/PROJECT_CONCEPT.md
@@ -297,6 +297,53 @@ E(\text{permuted / semantically wrong configurations}),
唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号:
以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。
+## 2026-08-01 更正:我们一直在看错的那个统计量
+
+过去几个月的判据是「真配对处的场相关 ρ 要到 0.9」,低于就不值得跑
+搜索。**这条判据是错的**,而且是被我们自己的对照实验推翻的:把那个
+能恢复到 95.3% 的合成世界的场截断到秩 r,ρ 几乎不动(0.902 / 0.906
+/ 0.928),恢复率却横跨整个量程(6.2% / 12.9% / **95.6%**,秩 4 / 8
+/ 16)。一个 ρ=0.906、已经越过所谓门槛的场,只恢复 13%。
+
+理论其实早就说了,是我们读错了。相关匹配的门槛是为**满秩可交换噪声**
+推导的,那里 N²/2 个矩阵元每一个都独立约束配对;而秩 r 的共享成分只
+提供约 rN 个。256 个场景、r≈10 时,这是门槛公式所假设的八分之一。
+
+新的判据是**二元条件**:场相关,加上**共享谱宽度**——两侧关系场主
+特征子空间之间主角余弦大于 0.7 的方向数,以打乱场景顺序的 null 为
+基线(null=1.0)。两者缺一不可:18 个共享方向配 ρ=0.508 会失败,
+11 个配 ρ=0.902 也会失败。
+
+旧判据一撤,「自然数据不值得跑搜索」的理由也没了,于是跑了:
+**0.0000,chance 是 0.0039**。结论没变,但现在它是测量结果,而不是
+从一个并不支配它的统计量推出来的。
+
+诊断比「特征不够好」精确得多:照片上两个模态**各自都很丰富**(视觉
+有效秩 40,文本 48),但只在 15 个方向上一致——**各自丰富的东西不
+是同一批东西**。而且这个交集对视觉侧几乎一切可调项免疫:分割数 6→16
+掉 1 个方向,直接给标注框只买到 1 个,集合核加三阶矩把视觉自身的秩
+抬高 7 而共享只 +1。文本侧能推动但很快饱和(10→17)。场景数从 256
+加到 1024 反而从 23 降到 19。
+
+于是**语料选择变成一等变量**:合成世界能到 26 个共享方向,是因为它
+的 caption 恰好陈述了完整世界状态;VG 只有 15,是因为一句 region
+description 和一个 patch descriptor 大概就只在这么多个方面重叠。下一
+步要找的不是更好的特征,而是**天然重叠就宽的语料对**——稠密描述、
+带完整规格的商品图文、截图配可访问性树。
+
+顺带的免费收益:判别方向按自身特征值加权、保留更宽的基底,再把文本
+向量提到 128 维,把 ρ 从 0.656 推到 0.716,共享方向从 10 到 16;
+短语按中心词/修饰词分开编码再到 0.725。hubness 假设被证伪(度模型只
+占场方差 1–5%,去掉反而让 ρ 略升)。
+
+另外**「缩小 N」这条路彻底死了,而且方向是反的**:信息论门槛
+ρ_IT ≈ √(4 log N / N) 随 N 减小而**升高**(256 时 0.29,64 时 0.51,
+16 时 0.83)。闸门直接证实:N = 16 至 96 的每个尺寸上,强搜索器找到
+的最深状态都比真值更深,3/3 复现。真值都不是最优解时,算法类别就不
+重要了——这也顺带回答了「接受指数级代价」为什么没用。
+
+详见 `RANK_RESULTS.md`。
+
## 合作者应避免的误解
- 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被