From 18bf25f34f6d352605086aa8fe63977baacc315b Mon Sep 17 00:00:00 2001 From: haoyuren <13851610112@163.com> Date: Tue, 28 Jul 2026 20:54:56 +0800 Subject: Track learning-rate and parameter-matched row-level outputs Pulled from the original experiment machine. These are the authoritative source rows behind the Appendix H tables (regime_summary matches the paper values; the depth-3 compensated gap rounds to 0.16262). Co-Authored-By: Claude Fable 5 --- outputs/learning_rate_compensation/summary.json | 275 ++++++++++++++++++++++++ 1 file changed, 275 insertions(+) create mode 100644 outputs/learning_rate_compensation/summary.json (limited to 'outputs/learning_rate_compensation/summary.json') diff --git a/outputs/learning_rate_compensation/summary.json b/outputs/learning_rate_compensation/summary.json new file mode 100644 index 0000000..63be9d0 --- /dev/null +++ b/outputs/learning_rate_compensation/summary.json @@ -0,0 +1,275 @@ +{ + "config": { + "depths": [ + 1, + 2, + 3, + 4, + 6 + ], + "width": 64, + "input_dim": 16, + "output_dim": 4, + "train_samples": 128, + "steps": 200, + "base_lr": 0.001, + "lr_grid": [ + 0.00025, + 0.0005, + 0.001, + 0.002, + 0.004, + 0.008, + 0.016, + 0.032, + 0.064, + 0.128, + 0.256 + ], + "tune_init_seeds": 4, + "tune_feedback_seeds": 4, + "eval_init_seeds": 6, + "eval_feedback_seeds": 8, + "data_seed": 4242, + "feedback_scale": "relu", + "stability_factor": 10.0, + "torch_threads": 16, + "outdir": "outputs/learning_rate_compensation" + }, + "selected_learning_rates": { + "1": { + "bp_lr": 0.128, + "fa_lr": 0.064 + }, + "2": { + "bp_lr": 0.128, + "fa_lr": 0.032 + }, + "3": { + "bp_lr": 0.064, + "fa_lr": 0.016 + }, + "4": { + "bp_lr": 0.064, + "fa_lr": 0.016 + }, + "6": { + "bp_lr": 0.064, + "fa_lr": 0.004 + } + }, + "rows": 720, + "regime_summary": [ + { + "depth": 1, + "regime": "same_lr", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.001, + "rho_mean": 0.9610069350407984, + "bp_loss_mean": 2.1666989888152424, + "fa_loss_mean": 2.2257618018338, + "gap_mean": 0.059062813018558, + "gap_std": 0.009435428579739853, + "gap_sem": 0.00385199758747267 + }, + { + "depth": 1, + "regime": "initial_compensation", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.0010407171219455268, + "rho_mean": 0.9610069350407984, + "bp_loss_mean": 2.1666989888152424, + "fa_loss_mean": 2.207225477295465, + "gap_mean": 0.04052648848022297, + "gap_std": 0.007618800905898918, + "gap_sem": 0.0031103624452177643 + }, + { + "depth": 1, + "regime": "independently_tuned", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.128, + "fa_lr_mean": 0.064, + "rho_mean": 0.9610069350407984, + "bp_loss_mean": 0.294261348016096, + "fa_loss_mean": 0.8636599107003535, + "gap_mean": 0.5693985626842576, + "gap_std": 0.025470956849676082, + "gap_sem": 0.010398474590359084 + }, + { + "depth": 2, + "regime": "same_lr", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.001, + "rho_mean": 0.7612398883286953, + "bp_loss_mean": 2.0219677440519996, + "fa_loss_mean": 2.2211329917145335, + "gap_mean": 0.199165247662534, + "gap_std": 0.03444824281209884, + "gap_sem": 0.014063436237523408 + }, + { + "depth": 2, + "regime": "initial_compensation", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.0013168083270719375, + "rho_mean": 0.7612398883286953, + "bp_loss_mean": 2.0219677440519996, + "fa_loss_mean": 2.119259691680273, + "gap_mean": 0.09729194762827353, + "gap_std": 0.02543136611942341, + "gap_sem": 0.010382311742415214 + }, + { + "depth": 2, + "regime": "independently_tuned", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.128, + "fa_lr_mean": 0.032, + "rho_mean": 0.7612398883286953, + "bp_loss_mean": 0.15235488385676207, + "fa_loss_mean": 0.7944569102207383, + "gap_mean": 0.6421020263639763, + "gap_std": 0.12610115797280932, + "gap_sem": 0.051480582167912944 + }, + { + "depth": 3, + "regime": "same_lr", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.001, + "rho_mean": 0.6295068544264688, + "bp_loss_mean": 1.847377871664352, + "fa_loss_mean": 2.1208343429545216, + "gap_mean": 0.2734564712901692, + "gap_std": 0.06428969293109411, + "gap_sem": 0.026246157233565874 + }, + { + "depth": 3, + "regime": "initial_compensation", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.0016066791854717785, + "rho_mean": 0.6295068544264688, + "bp_loss_mean": 1.847377871664352, + "fa_loss_mean": 2.0100027235277964, + "gap_mean": 0.1626248518634443, + "gap_std": 0.05875562787394225, + "gap_sem": 0.023986884634667825 + }, + { + "depth": 3, + "regime": "independently_tuned", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.064, + "fa_lr_mean": 0.016, + "rho_mean": 0.6295068544264688, + "bp_loss_mean": 0.0855589967594977, + "fa_loss_mean": 1.215578000751055, + "gap_mean": 1.1300190039915574, + "gap_std": 0.057596675687040334, + "gap_sem": 0.023513744385635763 + }, + { + "depth": 4, + "regime": "same_lr", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.001, + "rho_mean": 0.5314180794284439, + "bp_loss_mean": 1.7554493999414322, + "fa_loss_mean": 2.048847847137616, + "gap_mean": 0.2933984471961841, + "gap_std": 0.05201060249040933, + "gap_sem": 0.021233239552705147 + }, + { + "depth": 4, + "regime": "initial_compensation", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.0019168307305947902, + "rho_mean": 0.5314180794284439, + "bp_loss_mean": 1.7554493999414322, + "fa_loss_mean": 1.9398655534801694, + "gap_mean": 0.18441615353873775, + "gap_std": 0.04066007177452844, + "gap_sem": 0.016599404792089205 + }, + { + "depth": 4, + "regime": "independently_tuned", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.064, + "fa_lr_mean": 0.016, + "rho_mean": 0.5314180794284439, + "bp_loss_mean": 0.07042385696633152, + "fa_loss_mean": 1.3785391365213364, + "gap_mean": 1.3081152795550048, + "gap_std": 0.14724117672303647, + "gap_sem": 0.060110958683067185 + }, + { + "depth": 6, + "regime": "same_lr", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.001, + "rho_mean": 0.39886513049466427, + "bp_loss_mean": 1.6381389737072565, + "fa_loss_mean": 2.044780538842934, + "gap_mean": 0.40664156513567756, + "gap_std": 0.09378365477021289, + "gap_sem": 0.03828701673339253 + }, + { + "depth": 6, + "regime": "initial_compensation", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.001, + "fa_lr_mean": 0.002590508159488245, + "rho_mean": 0.39886513049466427, + "bp_loss_mean": 1.6381389737072565, + "fa_loss_mean": 1.9266386829320636, + "gap_mean": 0.28849970922480717, + "gap_std": 0.06681916348673785, + "gap_sem": 0.027278809263686105 + }, + { + "depth": 6, + "regime": "independently_tuned", + "rows": 48, + "stable_rows": 48, + "bp_lr": 0.064, + "fa_lr_mean": 0.004, + "rho_mean": 0.39886513049466427, + "bp_loss_mean": 0.08353873014787917, + "fa_loss_mean": 1.840925633337892, + "gap_mean": 1.757386903190013, + "gap_std": 0.06337128253452119, + "gap_sem": 0.02587121775922074 + } + ], + "uncertainty": "SEM and SD are computed across forward-initialization means." +} -- cgit v1.2.3