diff options
| author | Yuren Hao <yurenh2@illinois.edu> | 2026-08-01 14:42:52 -0500 |
|---|---|---|
| committer | Yuren Hao <yurenh2@illinois.edu> | 2026-08-01 14:42:52 -0500 |
| commit | aaf835380f29d1bfd6679c6da0d362cb78e7e2df (patch) | |
| tree | 5d30f6cb34576666e16d92ed321828ab9240c235 /docs/campaign/CASCADE_ABLATION_PLAN.md | |
| parent | 36bc37b0e331a8013a5e7e24d5e3fb10edd68502 (diff) | |
RESULT 83补记: 135M吞吐0.70→2.05 it/s(GPU3被他项目占满;timan108 CUDA-dead未先读文档=流程失误); world=2 B=12保持eff batch 24, ETA 60h
Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_014FAPDWQ49M5Ye3NpTndTpn
Diffstat (limited to 'docs/campaign/CASCADE_ABLATION_PLAN.md')
| -rw-r--r-- | docs/campaign/CASCADE_ABLATION_PLAN.md | 8 |
1 files changed, 8 insertions, 0 deletions
diff --git a/docs/campaign/CASCADE_ABLATION_PLAN.md b/docs/campaign/CASCADE_ABLATION_PLAN.md index a2d73d8..3fac8eb 100644 --- a/docs/campaign/CASCADE_ABLATION_PLAN.md +++ b/docs/campaign/CASCADE_ABLATION_PLAN.md @@ -2026,3 +2026,11 @@ ckpt)在 GPU0 跑 — 预言每块位移比均在地板带之上、逐块泄漏 (3卡, 0.70 it/s, ~收敛需 ~7 天?? 见下), 为唯一未决点。 - ⚠️ 135M 速率异常: 0.70 it/s vs 旧 fw135m 的 ~5 it/s(3卡) → 440k 步需 ~175h。需查(共卡? GPU0 上 xuanhe4 服务 + 谱仪残留?); 若确为共卡拥塞, 待 GPU 空出后重启或降步数。 + +### RESULT 83 补记 (基础设施): 135M 修复版吞吐修正 0.70 → 2.05 it/s +- 慢因 = GPU3 被本用户另一项目(emm session)三个任务占满 100%; 三卡 DDP 被最慢 rank 拖住(非 read_lin 开销)。 +- timan108 迁移尝试失败: 三张 A5000 物理空闲但 CUDA-dead(残留 /dev/nvidia3 幽灵节点 → cuInit Error 101, + nvidia-smi 正常故监控看不出)。**FLEET_ACCESS.md 早有记载, 未先读文档 = 我方流程失误**; 需管理员删节点或重启。 +- 最终方案: 本地 GPU0+1(干净), world=2 B=12 → eff batch 24 与原配置逐字节一致(DDP 等价性由 ddp_grad_test + 验证); 数据流按 rank 独立播种, world 变化不影响统计等价。**2.045 it/s, 440k 步 ETA ~60h**(旧三卡 1.28)。 +- 教训入库: 启动前查的是"卡上有没有显存", 应查"卡上有没有 util"; 远程机群一律先读 FLEET_ACCESS.md。 |
