summaryrefslogtreecommitdiff
path: root/docs/campaign/CASCADE_ABLATION_PLAN.md
diff options
context:
space:
mode:
Diffstat (limited to 'docs/campaign/CASCADE_ABLATION_PLAN.md')
-rw-r--r--docs/campaign/CASCADE_ABLATION_PLAN.md20
1 files changed, 20 insertions, 0 deletions
diff --git a/docs/campaign/CASCADE_ABLATION_PLAN.md b/docs/campaign/CASCADE_ABLATION_PLAN.md
index 5cdc19b..7315cb9 100644
--- a/docs/campaign/CASCADE_ABLATION_PLAN.md
+++ b/docs/campaign/CASCADE_ABLATION_PLAN.md
@@ -2080,3 +2080,23 @@ BP seed2 在跑(定散布尺度)。
- ✅ 七月 brief 的 "3.2× BP FLOPs" 一直是对的, 与本次解析 3.0× 一致。
- 与同类工作的对比不受影响: KHS(VGG10 ImageNet) 付 6.7×(单侧)–12×(对称) wall-clock,
我们 2.7× 仍是 EP 家族内 2.5–4.4× 的成本优势; 结构口径 1 相 × K=3 vs 2 相 × 10 迭代不变。
+
+## RESULT 86 (2026-08-03): K=1 的梯度余弦亦为 0.9999 — "equilibrium 在做什么工作"是真问题
+用户提问触发。固定 ckpt(fw135m_rlin_s80000) 上扫 K, gate_every=10 读 cos(EP, BP):
+**K=1 → cos 0.9999**(四点一致)。此前已记 K3 与 K8 四位小数相同(本文件 L80)。
+⟹ 三个点连成一条平线: **梯度保真度对 K 完全不敏感**。
+- **代码层解释(非猜测)**: `forces()` 的 `d[l] = vjp(outs[l+1], ins[l+1], d[l+1])` 就是逐层反传链,
+ 种子余切为 −β·NBT·∂CE/∂z; K=1 时读出 Σ_l d_lᵀ∂o_l/∂θ 在 β→0 极限逐项等于 BP 梯度。
+ 级联架构下**自由相按构造即精确不动点**(普通前向), 故唯一需迭代的只有 nudged 平衡, 而小 β 下
+ 该平衡的一阶解就是伴随解 ⟹ 迭代在我们这里天然廉价。
+- **诚实定位**: "cos≈1 与 BP 一致"本身不是丑闻(是 Scellier 原定理, 每篇 EP 论文都据此验证正确性);
+ 真正区分 EP 与 BP 的是**参数更新的局部性与基底需提供的操作**, 不是迭代次数。
+- **真正脆弱点 = J^T 而非 K**: 向下传输用局部雅可比转置; Stern/Liu 不可能性定理(2603.26969)证明
+ 非互易动力学无伴随系统即无精确物理梯度。K 取多少都不改变这一条 ⟹ 答案在硬件线(双向 crossbar /
+ CET 豁免 / 混合信号价目表), 不在算法线。
+- **成本含义(待 CE 裁决)**: FLOPs = F + K·2F + 2F。K=1→5F(**1.67× BP**), K=2→7F(2.33×), K=3→9F(3.0×)。
+ 若 CE 无差 ⟹ 我们的真实成本被高估了 1.6 倍, 且叙事更干净("一次传输+一次重估")。
+ 若 K=3 更优 ⟹ 该差值即"为什么不能更少"的定量答案。三臂配对仪器已发射(GPU3, 共用起点, ~4h)。
+- **对外口径调整(即刻生效)**: 不得再用"我们只做 3 次弛豫所以比同类的 20 次便宜"作为卖点;
+ 改为"级联架构使自由相按构造收敛, 仅 nudged 平衡需迭代, 且 K 的边际收益实测在 3 以内饱和",
+ 并**主动公布 K=1 的余弦**——审稿人自己会算, 先说优于被抓。