summaryrefslogtreecommitdiff
path: root/docs/campaign
diff options
context:
space:
mode:
Diffstat (limited to 'docs/campaign')
-rw-r--r--docs/campaign/CASCADE_ABLATION_PLAN.md22
1 files changed, 22 insertions, 0 deletions
diff --git a/docs/campaign/CASCADE_ABLATION_PLAN.md b/docs/campaign/CASCADE_ABLATION_PLAN.md
index 7d18ab4..5cdc19b 100644
--- a/docs/campaign/CASCADE_ABLATION_PLAN.md
+++ b/docs/campaign/CASCADE_ABLATION_PLAN.md
@@ -2058,3 +2058,25 @@ ckpt)在 GPU0 跑 — 预言每块位移比均在地板带之上、逐块泄漏
| BP twin s1 | 3.3999 | — |
两个独立窗口(99-105k: −0.0117; 144-150k: −0.0041)均显示修复版持平或略优, 旧读出稳定落后 0.20-0.23。
BP seed2 在跑(定散布尺度)。
+
+## RESULT 85 (2026-08-03): EP 成本定案 — wall-clock 2.7×, FLOPs ≈3× BP; 对外"2.0×"与"1.0-1.4×"作废
+**受控实测**(同一张 A6000, SIGSTOP 静音其余负载, 同模型 L12/C768/H12/T256, 同 B=24, 同 --amp,
+同 muon+cosine, EP 带 --read_lin --bsign_rand --gate_every 0, 各 400 步, 用两点累计速率反解稳态):
+| 臂 | 稳态 | 每步 |
+|---|---|---|
+| BP | 3.451 it/s | 289.7 ms |
+| EP | 1.279 it/s | 781.8 ms |
+**wall-clock = 2.70×**; 扣掉两臂等量的 eval 开销(11.6 ms/step) → **纯训练步 2.77×**。
+两个独立窗口复核一致(BP 3.430/3.451, EP 1.279/1.279)。
+
+**解析 FLOPs**(F = 一次前向): BP = F + 2F = **3F**。EP = 自由相 F + K=3 轮×(forces 的逐块 vjp
+≈F + rebuild 前向 F) + θ-读出反传 2F = **9F** ⟹ **3.0×**。实测 2.77 略低于解析 3.0(部分重建在
+无梯度路径、读出不穿 embedding),**解析与实测互证**。
+
+**口径清理(对外材料已出错,须改)**:
+- ❌ 项目页/call sheet/cheat sheet 的 "2.0× wall-clock" → 应为 **2.7×**
+- ❌ 给 Suhas 邮件里的 "measured step cost about 1.0 to 1.4 times that of BP" → **严重低估**;
+ 该数疑似把速度包对 EP 自身的加速比(holofast+sdpa 合计 ~1.5×)误当成了对 BP 的比值。
+- ✅ 七月 brief 的 "3.2× BP FLOPs" 一直是对的, 与本次解析 3.0× 一致。
+- 与同类工作的对比不受影响: KHS(VGG10 ImageNet) 付 6.7×(单侧)–12×(对称) wall-clock,
+ 我们 2.7× 仍是 EP 家族内 2.5–4.4× 的成本优势; 结构口径 1 相 × K=3 vs 2 相 × 10 迭代不变。