{ "config": { "capacity_q": 0.01, "data_seed": 7, "device": "cpu", "feedback_scale": "relu", "feedback_seed_offset": 0, "feedback_seeds": 8, "init_seed_offset": 0, "init_seeds": 3, "input_dim": 16, "jacobian_lambda_rel": 0.001, "lr": 0.01, "noise_std": 0.0, "normalize_targets": true, "optimizer": "sgd", "outdir": "outputs/teacher_test_gap_sgd_T8000", "output_dim": 4, "plot": true, "probe_samples": 32, "skip_jacobian": true, "steps": 8000, "task": "mlp", "teacher_hidden_layers": 2, "teacher_rank": 4, "teacher_width": 64, "test_samples": 2048, "torch_threads": 8, "train_samples": 256, "widths": [ 8, 12, 16, 24, 32, 48, 64, 96 ] }, "width_summary": [ { "bp_capacity_margin": -800, "bp_test_mean": 0.8547195125219496, "bp_test_std": 0.09416632052520177, "bp_train_mean": 0.48654225381273647, "bp_train_std": 0.009430396910714468, "d_eff_mean": 0.0, "fa_burden_nats": 1.3936644807238818, "fa_capacity_margin": -894, "fa_constraint_rank": 94, "fa_test_mean": 1.03173780938202, "fa_test_std": 0.07195063786750613, "fa_train_mean": 0.7360187817128564, "fa_train_std": 0.08065577661619448, "gap_mean": 0.1770182968600705, "gap_std": 0.09915053419946865, "hard_rank_mean": 0.0, "parameter_count": 224, "redundancy_score_mean": 222.6063355192761, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.24947652790011995, "train_gap_std": 0.07918404890030231, "width": 8 }, { "bp_capacity_margin": -640, "bp_test_mean": 0.8912211187592197, "bp_test_std": 0.06296622353182581, "bp_train_mean": 0.35139158815529714, "bp_train_std": 0.004244751408287705, "d_eff_mean": 0.0, "fa_burden_nats": 2.1683902917154665, "fa_capacity_margin": -830, "fa_constraint_rank": 190, "fa_test_mean": 0.9292951764049313, "fa_test_std": 0.07525411172556047, "fa_train_mean": 0.5094820739240674, "fa_train_std": 0.0707313348013235, "gap_mean": 0.03807405764571161, "gap_std": 0.07715664669655001, "hard_rank_mean": 0.0, "parameter_count": 384, "redundancy_score_mean": 381.83160970828453, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.15809048576877027, "train_gap_std": 0.07029272672610735, "width": 12 }, { "bp_capacity_margin": -448, "bp_test_mean": 0.9192548641208319, "bp_test_std": 0.033740239256328644, "bp_train_mean": 0.2520286029851933, "bp_train_std": 0.007647223072501642, "d_eff_mean": 0.0, "fa_burden_nats": 3.058119959290285, "fa_capacity_margin": -766, "fa_constraint_rank": 318, "fa_test_mean": 0.8812679121253054, "fa_test_std": 0.07027921512298203, "fa_train_mean": 0.3635437201887566, "fa_train_std": 0.047364665684149765, "gap_mean": -0.037986951995526305, "gap_std": 0.07361982827194134, "hard_rank_mean": 0.0, "parameter_count": 576, "redundancy_score_mean": 572.9418800407097, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.11151511720356323, "train_gap_std": 0.04520548886437488, "width": 16 }, { "bp_capacity_margin": 32, "bp_test_mean": 0.9293582800572858, "bp_test_std": 0.07241895652383532, "bp_train_mean": 0.1396784759530465, "bp_train_std": 0.01665120505504232, "d_eff_mean": 0.0, "fa_burden_nats": 5.228037692481937, "fa_capacity_margin": -638, "fa_constraint_rank": 670, "fa_test_mean": 0.8851293442398639, "fa_test_std": 0.06255425075132401, "fa_train_mean": 0.219954653180603, "fa_train_std": 0.033287750843013345, "gap_mean": -0.044228935817421745, "gap_std": 0.09040086678358636, "hard_rank_mean": 0.0, "parameter_count": 1056, "redundancy_score_mean": 1050.7719623075182, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.08027617722755646, "train_gap_std": 0.034751538455168735, "width": 24 }, { "bp_capacity_margin": 640, "bp_test_mean": 1.0541338661341875, "bp_test_std": 0.018275526958484174, "bp_train_mean": 0.0674924657026168, "bp_train_std": 0.010299416214868514, "d_eff_mean": 0.0, "fa_burden_nats": 7.958568352977123, "fa_capacity_margin": -510, "fa_constraint_rank": 1150, "fa_test_mean": 0.9339004211933818, "fa_test_std": 0.06403389508198398, "fa_train_mean": 0.1521629814467578, "fa_train_std": 0.01750960740931603, "gap_mean": -0.12023344494080564, "gap_std": 0.06569708866945986, "hard_rank_mean": 0.0, "parameter_count": 1664, "redundancy_score_mean": 1656.0414316470226, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.08467051574414101, "train_gap_std": 0.015298364700276968, "width": 32 }, { "bp_capacity_margin": 2240, "bp_test_mean": 0.9791622527841524, "bp_test_std": 0.047110478662005864, "bp_train_mean": 0.022625612139090635, "bp_train_std": 0.004106878454242747, "d_eff_mean": 0.0, "fa_burden_nats": 15.199401552235027, "fa_capacity_margin": -254, "fa_constraint_rank": 2494, "fa_test_mean": 0.9653186953239867, "fa_test_std": 0.05187486017852229, "fa_train_mean": 0.07109851792006452, "fa_train_std": 0.007557098583336046, "gap_mean": -0.013843557460165468, "gap_std": 0.06974990528996139, "hard_rank_mean": 0.0, "parameter_count": 3264, "redundancy_score_mean": 3248.8005984477654, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.048472905780973886, "train_gap_std": 0.008244124666444821, "width": 48 }, { "bp_capacity_margin": 4352, "bp_test_mean": 0.9653310456956622, "bp_test_std": 0.03177320206769566, "bp_train_mean": 0.006939575153079867, "bp_train_std": 0.0012012935377682527, "d_eff_mean": 0.0, "fa_burden_nats": 24.89249668727425, "fa_capacity_margin": 2, "fa_constraint_rank": 4350, "fa_test_mean": 0.9750088396534556, "fa_test_std": 0.04179311994033258, "fa_train_mean": 0.033249367604793946, "fa_train_std": 0.004644998390740636, "gap_mean": 0.009677793957793427, "gap_std": 0.040482838262068055, "hard_rank_mean": 0.0, "parameter_count": 5376, "redundancy_score_mean": 5351.107503312725, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.02630979245171408, "train_gap_std": 0.004635709869038379, "width": 64 }, { "bp_capacity_margin": 10112, "bp_test_mean": 0.9064751809116146, "bp_test_std": 0.05494609929229648, "bp_train_mean": 0.0010748642908555096, "bp_train_std": 2.7736586821309024e-05, "d_eff_mean": 0.0, "fa_burden_nats": 51.802320004200304, "fa_capacity_margin": 514, "fa_constraint_rank": 9598, "fa_test_mean": 0.9513155139710398, "fa_test_std": 0.04816011708858036, "fa_train_mean": 0.007945258532614088, "fa_train_std": 0.001452885056156375, "gap_mean": 0.044840333059425225, "gap_std": 0.05220001570680324, "hard_rank_mean": 0.0, "parameter_count": 11136, "redundancy_score_mean": 11084.1976799958, "runs_bp": 3, "runs_fa": 24, "task_dimension": 1024, "train_gap_mean": 0.006870394241758578, "train_gap_std": 0.0014660396836900331, "width": 96 } ] }