diff options
Diffstat (limited to 'outputs/teacher_test_gap_sgd_T8000/summary.json')
| -rw-r--r-- | outputs/teacher_test_gap_sgd_T8000/summary.json | 251 |
1 files changed, 251 insertions, 0 deletions
diff --git a/outputs/teacher_test_gap_sgd_T8000/summary.json b/outputs/teacher_test_gap_sgd_T8000/summary.json new file mode 100644 index 0000000..d9b9e7a --- /dev/null +++ b/outputs/teacher_test_gap_sgd_T8000/summary.json @@ -0,0 +1,251 @@ +{ + "config": { + "capacity_q": 0.01, + "data_seed": 7, + "device": "cpu", + "feedback_scale": "relu", + "feedback_seed_offset": 0, + "feedback_seeds": 8, + "init_seed_offset": 0, + "init_seeds": 3, + "input_dim": 16, + "jacobian_lambda_rel": 0.001, + "lr": 0.01, + "noise_std": 0.0, + "normalize_targets": true, + "optimizer": "sgd", + "outdir": "outputs/teacher_test_gap_sgd_T8000", + "output_dim": 4, + "plot": true, + "probe_samples": 32, + "skip_jacobian": true, + "steps": 8000, + "task": "mlp", + "teacher_hidden_layers": 2, + "teacher_rank": 4, + "teacher_width": 64, + "test_samples": 2048, + "torch_threads": 8, + "train_samples": 256, + "widths": [ + 8, + 12, + 16, + 24, + 32, + 48, + 64, + 96 + ] + }, + "width_summary": [ + { + "bp_capacity_margin": -800, + "bp_test_mean": 0.8547195125219496, + "bp_test_std": 0.09416632052520177, + "bp_train_mean": 0.48654225381273647, + "bp_train_std": 0.009430396910714468, + "d_eff_mean": 0.0, + "fa_burden_nats": 1.3936644807238818, + "fa_capacity_margin": -894, + "fa_constraint_rank": 94, + "fa_test_mean": 1.03173780938202, + "fa_test_std": 0.07195063786750613, + "fa_train_mean": 0.7360187817128564, + "fa_train_std": 0.08065577661619448, + "gap_mean": 0.1770182968600705, + "gap_std": 0.09915053419946865, + "hard_rank_mean": 0.0, + "parameter_count": 224, + "redundancy_score_mean": 222.6063355192761, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.24947652790011995, + "train_gap_std": 0.07918404890030231, + "width": 8 + }, + { + "bp_capacity_margin": -640, + "bp_test_mean": 0.8912211187592197, + "bp_test_std": 0.06296622353182581, + "bp_train_mean": 0.35139158815529714, + "bp_train_std": 0.004244751408287705, + "d_eff_mean": 0.0, + "fa_burden_nats": 2.1683902917154665, + "fa_capacity_margin": -830, + "fa_constraint_rank": 190, + "fa_test_mean": 0.9292951764049313, + "fa_test_std": 0.07525411172556047, + "fa_train_mean": 0.5094820739240674, + "fa_train_std": 0.0707313348013235, + "gap_mean": 0.03807405764571161, + "gap_std": 0.07715664669655001, + "hard_rank_mean": 0.0, + "parameter_count": 384, + "redundancy_score_mean": 381.83160970828453, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.15809048576877027, + "train_gap_std": 0.07029272672610735, + "width": 12 + }, + { + "bp_capacity_margin": -448, + "bp_test_mean": 0.9192548641208319, + "bp_test_std": 0.033740239256328644, + "bp_train_mean": 0.2520286029851933, + "bp_train_std": 0.007647223072501642, + "d_eff_mean": 0.0, + "fa_burden_nats": 3.058119959290285, + "fa_capacity_margin": -766, + "fa_constraint_rank": 318, + "fa_test_mean": 0.8812679121253054, + "fa_test_std": 0.07027921512298203, + "fa_train_mean": 0.3635437201887566, + "fa_train_std": 0.047364665684149765, + "gap_mean": -0.037986951995526305, + "gap_std": 0.07361982827194134, + "hard_rank_mean": 0.0, + "parameter_count": 576, + "redundancy_score_mean": 572.9418800407097, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.11151511720356323, + "train_gap_std": 0.04520548886437488, + "width": 16 + }, + { + "bp_capacity_margin": 32, + "bp_test_mean": 0.9293582800572858, + "bp_test_std": 0.07241895652383532, + "bp_train_mean": 0.1396784759530465, + "bp_train_std": 0.01665120505504232, + "d_eff_mean": 0.0, + "fa_burden_nats": 5.228037692481937, + "fa_capacity_margin": -638, + "fa_constraint_rank": 670, + "fa_test_mean": 0.8851293442398639, + "fa_test_std": 0.06255425075132401, + "fa_train_mean": 0.219954653180603, + "fa_train_std": 0.033287750843013345, + "gap_mean": -0.044228935817421745, + "gap_std": 0.09040086678358636, + "hard_rank_mean": 0.0, + "parameter_count": 1056, + "redundancy_score_mean": 1050.7719623075182, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.08027617722755646, + "train_gap_std": 0.034751538455168735, + "width": 24 + }, + { + "bp_capacity_margin": 640, + "bp_test_mean": 1.0541338661341875, + "bp_test_std": 0.018275526958484174, + "bp_train_mean": 0.0674924657026168, + "bp_train_std": 0.010299416214868514, + "d_eff_mean": 0.0, + "fa_burden_nats": 7.958568352977123, + "fa_capacity_margin": -510, + "fa_constraint_rank": 1150, + "fa_test_mean": 0.9339004211933818, + "fa_test_std": 0.06403389508198398, + "fa_train_mean": 0.1521629814467578, + "fa_train_std": 0.01750960740931603, + "gap_mean": -0.12023344494080564, + "gap_std": 0.06569708866945986, + "hard_rank_mean": 0.0, + "parameter_count": 1664, + "redundancy_score_mean": 1656.0414316470226, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.08467051574414101, + "train_gap_std": 0.015298364700276968, + "width": 32 + }, + { + "bp_capacity_margin": 2240, + "bp_test_mean": 0.9791622527841524, + "bp_test_std": 0.047110478662005864, + "bp_train_mean": 0.022625612139090635, + "bp_train_std": 0.004106878454242747, + "d_eff_mean": 0.0, + "fa_burden_nats": 15.199401552235027, + "fa_capacity_margin": -254, + "fa_constraint_rank": 2494, + "fa_test_mean": 0.9653186953239867, + "fa_test_std": 0.05187486017852229, + "fa_train_mean": 0.07109851792006452, + "fa_train_std": 0.007557098583336046, + "gap_mean": -0.013843557460165468, + "gap_std": 0.06974990528996139, + "hard_rank_mean": 0.0, + "parameter_count": 3264, + "redundancy_score_mean": 3248.8005984477654, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.048472905780973886, + "train_gap_std": 0.008244124666444821, + "width": 48 + }, + { + "bp_capacity_margin": 4352, + "bp_test_mean": 0.9653310456956622, + "bp_test_std": 0.03177320206769566, + "bp_train_mean": 0.006939575153079867, + "bp_train_std": 0.0012012935377682527, + "d_eff_mean": 0.0, + "fa_burden_nats": 24.89249668727425, + "fa_capacity_margin": 2, + "fa_constraint_rank": 4350, + "fa_test_mean": 0.9750088396534556, + "fa_test_std": 0.04179311994033258, + "fa_train_mean": 0.033249367604793946, + "fa_train_std": 0.004644998390740636, + "gap_mean": 0.009677793957793427, + "gap_std": 0.040482838262068055, + "hard_rank_mean": 0.0, + "parameter_count": 5376, + "redundancy_score_mean": 5351.107503312725, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.02630979245171408, + "train_gap_std": 0.004635709869038379, + "width": 64 + }, + { + "bp_capacity_margin": 10112, + "bp_test_mean": 0.9064751809116146, + "bp_test_std": 0.05494609929229648, + "bp_train_mean": 0.0010748642908555096, + "bp_train_std": 2.7736586821309024e-05, + "d_eff_mean": 0.0, + "fa_burden_nats": 51.802320004200304, + "fa_capacity_margin": 514, + "fa_constraint_rank": 9598, + "fa_test_mean": 0.9513155139710398, + "fa_test_std": 0.04816011708858036, + "fa_train_mean": 0.007945258532614088, + "fa_train_std": 0.001452885056156375, + "gap_mean": 0.044840333059425225, + "gap_std": 0.05220001570680324, + "hard_rank_mean": 0.0, + "parameter_count": 11136, + "redundancy_score_mean": 11084.1976799958, + "runs_bp": 3, + "runs_fa": 24, + "task_dimension": 1024, + "train_gap_mean": 0.006870394241758578, + "train_gap_std": 0.0014660396836900331, + "width": 96 + } + ] +} |
