From aaf835380f29d1bfd6679c6da0d362cb78e7e2df Mon Sep 17 00:00:00 2001 From: Yuren Hao Date: Sat, 1 Aug 2026 14:42:52 -0500 Subject: =?UTF-8?q?RESULT=2083=E8=A1=A5=E8=AE=B0:=20135M=E5=90=9E=E5=90=90?= =?UTF-8?q?0.70=E2=86=922.05=20it/s(GPU3=E8=A2=AB=E4=BB=96=E9=A1=B9?= =?UTF-8?q?=E7=9B=AE=E5=8D=A0=E6=BB=A1;timan108=20CUDA-dead=E6=9C=AA?= =?UTF-8?q?=E5=85=88=E8=AF=BB=E6=96=87=E6=A1=A3=3D=E6=B5=81=E7=A8=8B?= =?UTF-8?q?=E5=A4=B1=E8=AF=AF);=20world=3D2=20B=3D12=E4=BF=9D=E6=8C=81eff?= =?UTF-8?q?=20batch=2024,=20ETA=2060h?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit Co-Authored-By: Claude Fable 5 Claude-Session: https://claude.ai/code/session_014FAPDWQ49M5Ye3NpTndTpn --- docs/campaign/CASCADE_ABLATION_PLAN.md | 8 ++++++++ 1 file changed, 8 insertions(+) diff --git a/docs/campaign/CASCADE_ABLATION_PLAN.md b/docs/campaign/CASCADE_ABLATION_PLAN.md index a2d73d8..3fac8eb 100644 --- a/docs/campaign/CASCADE_ABLATION_PLAN.md +++ b/docs/campaign/CASCADE_ABLATION_PLAN.md @@ -2026,3 +2026,11 @@ ckpt)在 GPU0 跑 — 预言每块位移比均在地板带之上、逐块泄漏 (3卡, 0.70 it/s, ~收敛需 ~7 天?? 见下), 为唯一未决点。 - ⚠️ 135M 速率异常: 0.70 it/s vs 旧 fw135m 的 ~5 it/s(3卡) → 440k 步需 ~175h。需查(共卡? GPU0 上 xuanhe4 服务 + 谱仪残留?); 若确为共卡拥塞, 待 GPU 空出后重启或降步数。 + +### RESULT 83 补记 (基础设施): 135M 修复版吞吐修正 0.70 → 2.05 it/s +- 慢因 = GPU3 被本用户另一项目(emm session)三个任务占满 100%; 三卡 DDP 被最慢 rank 拖住(非 read_lin 开销)。 +- timan108 迁移尝试失败: 三张 A5000 物理空闲但 CUDA-dead(残留 /dev/nvidia3 幽灵节点 → cuInit Error 101, + nvidia-smi 正常故监控看不出)。**FLEET_ACCESS.md 早有记载, 未先读文档 = 我方流程失误**; 需管理员删节点或重启。 +- 最终方案: 本地 GPU0+1(干净), world=2 B=12 → eff batch 24 与原配置逐字节一致(DDP 等价性由 ddp_grad_test + 验证); 数据流按 rank 独立播种, world 变化不影响统计等价。**2.045 it/s, 440k 步 ETA ~60h**(旧三卡 1.28)。 +- 教训入库: 启动前查的是"卡上有没有显存", 应查"卡上有没有 util"; 远程机群一律先读 FLEET_ACCESS.md。 -- cgit v1.2.3