diff options
| author | YurenHao0426 <Blackhao0426@gmail.com> | 2026-08-01 16:23:26 -0500 |
|---|---|---|
| committer | YurenHao0426 <Blackhao0426@gmail.com> | 2026-08-01 16:23:26 -0500 |
| commit | 66af02f1e5c50e041ced3e8b85659709a1c1f4f3 (patch) | |
| tree | 6dd0de68e644be5e7a5546123f44ea3c4a63646f /PROJECT_CONCEPT.md | |
| parent | 735f9c7fd202d0eaed9183094d84d365e0e5404d (diff) | |
Record the gate correction in the concept document
The user-facing statement still carried the retired correlation
threshold. Adds the correction, the joint condition that replaces it,
the width diagnosis, and the closure of the shrink-N route.
Co-Authored-By: Claude <noreply@anthropic.com>
Diffstat (limited to 'PROJECT_CONCEPT.md')
| -rw-r--r-- | PROJECT_CONCEPT.md | 47 |
1 files changed, 47 insertions, 0 deletions
diff --git a/PROJECT_CONCEPT.md b/PROJECT_CONCEPT.md index d5c0265..d9232e6 100644 --- a/PROJECT_CONCEPT.md +++ b/PROJECT_CONCEPT.md @@ -297,6 +297,53 @@ E(\text{permuted / semantically wrong configurations}), 唯一、低能的一致解释。视图级探针给出了这个方向的第一个正信号: 以粗对齐为参照系,细粒度状态在种群上下文中变得跨模态可比。 +## 2026-08-01 更正:我们一直在看错的那个统计量 + +过去几个月的判据是「真配对处的场相关 ρ 要到 0.9」,低于就不值得跑 +搜索。**这条判据是错的**,而且是被我们自己的对照实验推翻的:把那个 +能恢复到 95.3% 的合成世界的场截断到秩 r,ρ 几乎不动(0.902 / 0.906 +/ 0.928),恢复率却横跨整个量程(6.2% / 12.9% / **95.6%**,秩 4 / 8 +/ 16)。一个 ρ=0.906、已经越过所谓门槛的场,只恢复 13%。 + +理论其实早就说了,是我们读错了。相关匹配的门槛是为**满秩可交换噪声** +推导的,那里 N²/2 个矩阵元每一个都独立约束配对;而秩 r 的共享成分只 +提供约 rN 个。256 个场景、r≈10 时,这是门槛公式所假设的八分之一。 + +新的判据是**二元条件**:场相关,加上**共享谱宽度**——两侧关系场主 +特征子空间之间主角余弦大于 0.7 的方向数,以打乱场景顺序的 null 为 +基线(null=1.0)。两者缺一不可:18 个共享方向配 ρ=0.508 会失败, +11 个配 ρ=0.902 也会失败。 + +旧判据一撤,「自然数据不值得跑搜索」的理由也没了,于是跑了: +**0.0000,chance 是 0.0039**。结论没变,但现在它是测量结果,而不是 +从一个并不支配它的统计量推出来的。 + +诊断比「特征不够好」精确得多:照片上两个模态**各自都很丰富**(视觉 +有效秩 40,文本 48),但只在 15 个方向上一致——**各自丰富的东西不 +是同一批东西**。而且这个交集对视觉侧几乎一切可调项免疫:分割数 6→16 +掉 1 个方向,直接给标注框只买到 1 个,集合核加三阶矩把视觉自身的秩 +抬高 7 而共享只 +1。文本侧能推动但很快饱和(10→17)。场景数从 256 +加到 1024 反而从 23 降到 19。 + +于是**语料选择变成一等变量**:合成世界能到 26 个共享方向,是因为它 +的 caption 恰好陈述了完整世界状态;VG 只有 15,是因为一句 region +description 和一个 patch descriptor 大概就只在这么多个方面重叠。下一 +步要找的不是更好的特征,而是**天然重叠就宽的语料对**——稠密描述、 +带完整规格的商品图文、截图配可访问性树。 + +顺带的免费收益:判别方向按自身特征值加权、保留更宽的基底,再把文本 +向量提到 128 维,把 ρ 从 0.656 推到 0.716,共享方向从 10 到 16; +短语按中心词/修饰词分开编码再到 0.725。hubness 假设被证伪(度模型只 +占场方差 1–5%,去掉反而让 ρ 略升)。 + +另外**「缩小 N」这条路彻底死了,而且方向是反的**:信息论门槛 +ρ_IT ≈ √(4 log N / N) 随 N 减小而**升高**(256 时 0.29,64 时 0.51, +16 时 0.83)。闸门直接证实:N = 16 至 96 的每个尺寸上,强搜索器找到 +的最深状态都比真值更深,3/3 复现。真值都不是最优解时,算法类别就不 +重要了——这也顺带回答了「接受指数级代价」为什么没用。 + +详见 `RANK_RESULTS.md`。 + ## 合作者应避免的误解 - 这不是“LLM 通过文本已经获得了视觉知觉”。语言模型拥有的可能是可被 |
