From e60afe651eb1fbe60397413af4d0df43cf22f1d0 Mon Sep 17 00:00:00 2001 From: YurenHao0426 Date: Wed, 22 Jul 2026 02:00:18 -0500 Subject: results: record failed useful-depth BP screens --- results/depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0.json | 1 + results/depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d12_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d1_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d2_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d4_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d6_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w16_d8_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d12_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d1_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d2_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d4_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d6_t0_s0.json | 1 + results/depthtask_dev_v1_teacher_bp_w64_d8_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0.json | 1 + results/depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0.json | 1 + 30 files changed, 30 insertions(+) create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0.json create mode 100644 results/depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d12_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d1_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d2_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d4_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d6_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w16_d8_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d12_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d1_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d2_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d4_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d6_t0_s0.json create mode 100644 results/depthtask_dev_v1_teacher_bp_w64_d8_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0.json create mode 100644 results/depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0.json diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0.json new file mode 100644 index 0000000..b497760 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 12, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d12_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.582568407058716}, {"step": 200, "epoch": 0, "train_loss": 1.779198169708252}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.326, "eval_loss": 1.924127734375, "val_acc": 0.326, "val_loss": 1.924127734375}, {"step": 400, "epoch": 1, "train_loss": 1.7927218675613403}, {"step": 600, "epoch": 1, "train_loss": 1.7545812129974365}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3358, "eval_loss": 1.9051428466796876, "val_acc": 0.3358, "val_loss": 1.9051428466796876}, {"step": 800, "epoch": 2, "train_loss": 1.7563821077346802}, {"step": 1000, "epoch": 2, "train_loss": 1.849263072013855}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.337, "eval_loss": 1.8839279541015626, "val_acc": 0.337, "val_loss": 1.8839279541015626}, {"step": 1200, "epoch": 3, "train_loss": 1.6742051839828491}, {"step": 1400, "epoch": 3, "train_loss": 1.6528172492980957}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3476, "eval_loss": 1.8585701904296874, "val_acc": 0.3476, "val_loss": 1.8585701904296874}, {"step": 1600, "epoch": 4, "train_loss": 1.6684035062789917}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3682, "eval_loss": 1.8213005126953126, "val_acc": 0.3682, "val_loss": 1.8213005126953126}, {"step": 1800, "epoch": 5, "train_loss": 1.918573260307312}, {"step": 2000, "epoch": 5, "train_loss": 1.6686073541641235}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3652, "eval_loss": 1.8040160400390626, "val_acc": 0.3652, "val_loss": 1.8040160400390626}, {"step": 2200, "epoch": 6, "train_loss": 1.5829106569290161}, {"step": 2400, "epoch": 6, "train_loss": 1.672957420349121}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3664, "eval_loss": 1.800686328125, "val_acc": 0.3664, "val_loss": 1.800686328125}, {"step": 2600, "epoch": 7, "train_loss": 1.6874823570251465}, {"step": 2800, "epoch": 7, "train_loss": 1.7868740558624268}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3718, "eval_loss": 1.78406845703125, "val_acc": 0.3718, "val_loss": 1.78406845703125}, {"step": 3000, "epoch": 8, "train_loss": 1.629400610923767}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3708, "eval_loss": 1.779471875, "val_acc": 0.3708, "val_loss": 1.779471875}, {"step": 3200, "epoch": 9, "train_loss": 1.6815563440322876}, {"step": 3400, "epoch": 9, "train_loss": 1.5809072256088257}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3728, "eval_loss": 1.7811262451171874, "val_acc": 0.3728, "val_loss": 1.7811262451171874}, {"step": 3600, "epoch": 10, "train_loss": 1.6039706468582153}, {"step": 3800, "epoch": 10, "train_loss": 1.4702858924865723}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.377, "eval_loss": 1.777668994140625, "val_acc": 0.377, "val_loss": 1.777668994140625}, {"step": 4000, "epoch": 11, "train_loss": 1.631117343902588}, {"step": 4200, "epoch": 11, "train_loss": 1.6752244234085083}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3782, "eval_loss": 1.7660619140625, "val_acc": 0.3782, "val_loss": 1.7660619140625}, {"step": 4400, "epoch": 12, "train_loss": 1.7986152172088623}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3752, "eval_loss": 1.784043115234375, "val_acc": 0.3752, "val_loss": 1.784043115234375}, {"step": 4600, "epoch": 13, "train_loss": 1.529523253440857}, {"step": 4800, "epoch": 13, "train_loss": 1.677403211593628}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3686, "eval_loss": 1.7831521240234376, "val_acc": 0.3686, "val_loss": 1.7831521240234376}, {"step": 5000, "epoch": 14, "train_loss": 1.3653477430343628}, {"step": 5200, "epoch": 14, "train_loss": 1.5780153274536133}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3754, "eval_loss": 1.7836129150390625, "val_acc": 0.3754, "val_loss": 1.7836129150390625}, {"step": 5400, "epoch": 15, "train_loss": 1.7597254514694214}, {"step": 5600, "epoch": 15, "train_loss": 1.5191596746444702}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3788, "eval_loss": 1.7681939453125, "val_acc": 0.3788, "val_loss": 1.7681939453125}, {"step": 5800, "epoch": 16, "train_loss": 1.517289638519287}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3768, "eval_loss": 1.7822583251953126, "val_acc": 0.3768, "val_loss": 1.7822583251953126}, {"step": 6000, "epoch": 17, "train_loss": 1.5022385120391846}, {"step": 6200, "epoch": 17, "train_loss": 1.4912019968032837}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3724, "eval_loss": 1.7875509521484374, "val_acc": 0.3724, "val_loss": 1.7875509521484374}, {"step": 6400, "epoch": 18, "train_loss": 1.4263951778411865}, {"step": 6600, "epoch": 18, "train_loss": 1.5325927734375}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3876, "eval_loss": 1.772078955078125, "val_acc": 0.3876, "val_loss": 1.772078955078125}, {"step": 6800, "epoch": 19, "train_loss": 1.579502820968628}, {"step": 7000, "epoch": 19, "train_loss": 1.3733022212982178}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3842, "eval_loss": 1.756608349609375, "val_acc": 0.3842, "val_loss": 1.756608349609375}, {"step": 7200, "epoch": 20, "train_loss": 1.6390156745910645}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3814, "eval_loss": 1.7701624755859375, "val_acc": 0.3814, "val_loss": 1.7701624755859375}, {"step": 7400, "epoch": 21, "train_loss": 1.5420736074447632}, {"step": 7600, "epoch": 21, "train_loss": 1.5902906656265259}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3864, "eval_loss": 1.770354248046875, "val_acc": 0.3864, "val_loss": 1.770354248046875}, {"step": 7800, "epoch": 22, "train_loss": 1.6107194423675537}, {"step": 8000, "epoch": 22, "train_loss": 1.5532841682434082}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3852, "eval_loss": 1.7620365478515625, "val_acc": 0.3852, "val_loss": 1.7620365478515625}, {"step": 8200, "epoch": 23, "train_loss": 1.5031737089157104}, {"step": 8400, "epoch": 23, "train_loss": 1.6291133165359497}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3832, "eval_loss": 1.7563646728515625, "val_acc": 0.3832, "val_loss": 1.7563646728515625}, {"step": 8600, "epoch": 24, "train_loss": 1.5404670238494873}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3896, "eval_loss": 1.7488685791015626, "val_acc": 0.3896, "val_loss": 1.7488685791015626}], "final": {"eval_split": "validation", "eval_acc": 0.3896, "eval_loss": 1.7488685791015626, "wall_s": 59.528953313827515, "val_acc": 0.3896, "val_loss": 1.7488685791015626}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0.json new file mode 100644 index 0000000..00a511a --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 1, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d1_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.475914478302002}, {"step": 200, "epoch": 0, "train_loss": 1.7467397451400757}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.33, "eval_loss": 1.9074928955078125, "val_acc": 0.33, "val_loss": 1.9074928955078125}, {"step": 400, "epoch": 1, "train_loss": 1.8253108263015747}, {"step": 600, "epoch": 1, "train_loss": 1.7261707782745361}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3454, "eval_loss": 1.87873603515625, "val_acc": 0.3454, "val_loss": 1.87873603515625}, {"step": 800, "epoch": 2, "train_loss": 1.674320101737976}, {"step": 1000, "epoch": 2, "train_loss": 1.7929267883300781}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.355, "eval_loss": 1.850813330078125, "val_acc": 0.355, "val_loss": 1.850813330078125}, {"step": 1200, "epoch": 3, "train_loss": 1.5949172973632812}, {"step": 1400, "epoch": 3, "train_loss": 1.705915927886963}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.359, "eval_loss": 1.8394200439453126, "val_acc": 0.359, "val_loss": 1.8394200439453126}, {"step": 1600, "epoch": 4, "train_loss": 1.6426708698272705}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.8107114990234374, "val_acc": 0.373, "val_loss": 1.8107114990234374}, {"step": 1800, "epoch": 5, "train_loss": 1.849348783493042}, {"step": 2000, "epoch": 5, "train_loss": 1.6563369035720825}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3668, "eval_loss": 1.800864599609375, "val_acc": 0.3668, "val_loss": 1.800864599609375}, {"step": 2200, "epoch": 6, "train_loss": 1.6335431337356567}, {"step": 2400, "epoch": 6, "train_loss": 1.633534550666809}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.372, "eval_loss": 1.805021435546875, "val_acc": 0.372, "val_loss": 1.805021435546875}, {"step": 2600, "epoch": 7, "train_loss": 1.6962227821350098}, {"step": 2800, "epoch": 7, "train_loss": 1.7465953826904297}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3724, "eval_loss": 1.784698681640625, "val_acc": 0.3724, "val_loss": 1.784698681640625}, {"step": 3000, "epoch": 8, "train_loss": 1.6518275737762451}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3758, "eval_loss": 1.77872216796875, "val_acc": 0.3758, "val_loss": 1.77872216796875}, {"step": 3200, "epoch": 9, "train_loss": 1.69846510887146}, {"step": 3400, "epoch": 9, "train_loss": 1.5753906965255737}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3742, "eval_loss": 1.7770663330078125, "val_acc": 0.3742, "val_loss": 1.7770663330078125}, {"step": 3600, "epoch": 10, "train_loss": 1.5937199592590332}, {"step": 3800, "epoch": 10, "train_loss": 1.4980002641677856}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.378, "eval_loss": 1.780496044921875, "val_acc": 0.378, "val_loss": 1.780496044921875}, {"step": 4000, "epoch": 11, "train_loss": 1.6196931600570679}, {"step": 4200, "epoch": 11, "train_loss": 1.6821643114089966}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3776, "eval_loss": 1.7710059326171874, "val_acc": 0.3776, "val_loss": 1.7710059326171874}, {"step": 4400, "epoch": 12, "train_loss": 1.814131736755371}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3782, "eval_loss": 1.783114013671875, "val_acc": 0.3782, "val_loss": 1.783114013671875}, {"step": 4600, "epoch": 13, "train_loss": 1.5792200565338135}, {"step": 4800, "epoch": 13, "train_loss": 1.7093915939331055}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3766, "eval_loss": 1.7789003662109375, "val_acc": 0.3766, "val_loss": 1.7789003662109375}, {"step": 5000, "epoch": 14, "train_loss": 1.3969545364379883}, {"step": 5200, "epoch": 14, "train_loss": 1.6407215595245361}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3738, "eval_loss": 1.785031591796875, "val_acc": 0.3738, "val_loss": 1.785031591796875}, {"step": 5400, "epoch": 15, "train_loss": 1.820623755455017}, {"step": 5600, "epoch": 15, "train_loss": 1.5520126819610596}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.381, "eval_loss": 1.7722260009765625, "val_acc": 0.381, "val_loss": 1.7722260009765625}, {"step": 5800, "epoch": 16, "train_loss": 1.5525339841842651}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.38, "eval_loss": 1.7807119873046875, "val_acc": 0.38, "val_loss": 1.7807119873046875}, {"step": 6000, "epoch": 17, "train_loss": 1.5396584272384644}, {"step": 6200, "epoch": 17, "train_loss": 1.5190238952636719}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3772, "eval_loss": 1.7760913330078125, "val_acc": 0.3772, "val_loss": 1.7760913330078125}, {"step": 6400, "epoch": 18, "train_loss": 1.4686918258666992}, {"step": 6600, "epoch": 18, "train_loss": 1.5981621742248535}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.379, "eval_loss": 1.786067041015625, "val_acc": 0.379, "val_loss": 1.786067041015625}, {"step": 6800, "epoch": 19, "train_loss": 1.6483367681503296}, {"step": 7000, "epoch": 19, "train_loss": 1.4933700561523438}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3828, "eval_loss": 1.7674142333984375, "val_acc": 0.3828, "val_loss": 1.7674142333984375}, {"step": 7200, "epoch": 20, "train_loss": 1.6544252634048462}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3792, "eval_loss": 1.776386279296875, "val_acc": 0.3792, "val_loss": 1.776386279296875}, {"step": 7400, "epoch": 21, "train_loss": 1.572379231452942}, {"step": 7600, "epoch": 21, "train_loss": 1.5655951499938965}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.379, "eval_loss": 1.7804651611328124, "val_acc": 0.379, "val_loss": 1.7804651611328124}, {"step": 7800, "epoch": 22, "train_loss": 1.6244573593139648}, {"step": 8000, "epoch": 22, "train_loss": 1.6154931783676147}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.385, "eval_loss": 1.776894580078125, "val_acc": 0.385, "val_loss": 1.776894580078125}, {"step": 8200, "epoch": 23, "train_loss": 1.4491068124771118}, {"step": 8400, "epoch": 23, "train_loss": 1.7100651264190674}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3818, "eval_loss": 1.7643829345703126, "val_acc": 0.3818, "val_loss": 1.7643829345703126}, {"step": 8600, "epoch": 24, "train_loss": 1.5250614881515503}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3852, "eval_loss": 1.761310400390625, "val_acc": 0.3852, "val_loss": 1.761310400390625}], "final": {"eval_split": "validation", "eval_acc": 0.3852, "eval_loss": 1.761310400390625, "wall_s": 13.6634361743927, "val_acc": 0.3852, "val_loss": 1.761310400390625}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0.json new file mode 100644 index 0000000..e8bc1a8 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 2, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d2_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5838396549224854}, {"step": 200, "epoch": 0, "train_loss": 1.780808448791504}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3292, "eval_loss": 1.9055708740234376, "val_acc": 0.3292, "val_loss": 1.9055708740234376}, {"step": 400, "epoch": 1, "train_loss": 1.7676631212234497}, {"step": 600, "epoch": 1, "train_loss": 1.7367398738861084}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3436, "eval_loss": 1.8824305419921874, "val_acc": 0.3436, "val_loss": 1.8824305419921874}, {"step": 800, "epoch": 2, "train_loss": 1.6690762042999268}, {"step": 1000, "epoch": 2, "train_loss": 1.7731873989105225}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.355, "eval_loss": 1.84503623046875, "val_acc": 0.355, "val_loss": 1.84503623046875}, {"step": 1200, "epoch": 3, "train_loss": 1.6389950513839722}, {"step": 1400, "epoch": 3, "train_loss": 1.6875262260437012}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3622, "eval_loss": 1.8366450439453126, "val_acc": 0.3622, "val_loss": 1.8366450439453126}, {"step": 1600, "epoch": 4, "train_loss": 1.6472316980361938}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.371, "eval_loss": 1.81101865234375, "val_acc": 0.371, "val_loss": 1.81101865234375}, {"step": 1800, "epoch": 5, "train_loss": 1.855771541595459}, {"step": 2000, "epoch": 5, "train_loss": 1.6434890031814575}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3682, "eval_loss": 1.8016017333984375, "val_acc": 0.3682, "val_loss": 1.8016017333984375}, {"step": 2200, "epoch": 6, "train_loss": 1.614069938659668}, {"step": 2400, "epoch": 6, "train_loss": 1.6868332624435425}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.7997779541015626, "val_acc": 0.373, "val_loss": 1.7997779541015626}, {"step": 2600, "epoch": 7, "train_loss": 1.6740370988845825}, {"step": 2800, "epoch": 7, "train_loss": 1.7635605335235596}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3716, "eval_loss": 1.7907843994140624, "val_acc": 0.3716, "val_loss": 1.7907843994140624}, {"step": 3000, "epoch": 8, "train_loss": 1.6583243608474731}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3684, "eval_loss": 1.7946490478515624, "val_acc": 0.3684, "val_loss": 1.7946490478515624}, {"step": 3200, "epoch": 9, "train_loss": 1.6853324174880981}, {"step": 3400, "epoch": 9, "train_loss": 1.5609760284423828}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3708, "eval_loss": 1.7879376953125, "val_acc": 0.3708, "val_loss": 1.7879376953125}, {"step": 3600, "epoch": 10, "train_loss": 1.6333789825439453}, {"step": 3800, "epoch": 10, "train_loss": 1.544682264328003}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3702, "eval_loss": 1.7904752197265625, "val_acc": 0.3702, "val_loss": 1.7904752197265625}, {"step": 4000, "epoch": 11, "train_loss": 1.6339285373687744}, {"step": 4200, "epoch": 11, "train_loss": 1.6893727779388428}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3728, "eval_loss": 1.7810276123046875, "val_acc": 0.3728, "val_loss": 1.7810276123046875}, {"step": 4400, "epoch": 12, "train_loss": 1.833978295326233}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3664, "eval_loss": 1.8002841552734374, "val_acc": 0.3664, "val_loss": 1.8002841552734374}, {"step": 4600, "epoch": 13, "train_loss": 1.571160078048706}, {"step": 4800, "epoch": 13, "train_loss": 1.7381309270858765}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3666, "eval_loss": 1.792106591796875, "val_acc": 0.3666, "val_loss": 1.792106591796875}, {"step": 5000, "epoch": 14, "train_loss": 1.4158738851547241}, {"step": 5200, "epoch": 14, "train_loss": 1.663922905921936}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3628, "eval_loss": 1.8038263427734376, "val_acc": 0.3628, "val_loss": 1.8038263427734376}, {"step": 5400, "epoch": 15, "train_loss": 1.7760043144226074}, {"step": 5600, "epoch": 15, "train_loss": 1.5528504848480225}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3656, "eval_loss": 1.792407958984375, "val_acc": 0.3656, "val_loss": 1.792407958984375}, {"step": 5800, "epoch": 16, "train_loss": 1.5818465948104858}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.371, "eval_loss": 1.7979139404296876, "val_acc": 0.371, "val_loss": 1.7979139404296876}, {"step": 6000, "epoch": 17, "train_loss": 1.5356544256210327}, {"step": 6200, "epoch": 17, "train_loss": 1.4888254404067993}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3722, "eval_loss": 1.79617490234375, "val_acc": 0.3722, "val_loss": 1.79617490234375}, {"step": 6400, "epoch": 18, "train_loss": 1.423915982246399}, {"step": 6600, "epoch": 18, "train_loss": 1.594796061515808}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.79276591796875, "val_acc": 0.373, "val_loss": 1.79276591796875}, {"step": 6800, "epoch": 19, "train_loss": 1.6619716882705688}, {"step": 7000, "epoch": 19, "train_loss": 1.4323354959487915}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.375, "eval_loss": 1.776577978515625, "val_acc": 0.375, "val_loss": 1.776577978515625}, {"step": 7200, "epoch": 20, "train_loss": 1.6437153816223145}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3704, "eval_loss": 1.789465576171875, "val_acc": 0.3704, "val_loss": 1.789465576171875}, {"step": 7400, "epoch": 21, "train_loss": 1.5673000812530518}, {"step": 7600, "epoch": 21, "train_loss": 1.5698800086975098}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.7942180908203125, "val_acc": 0.373, "val_loss": 1.7942180908203125}, {"step": 7800, "epoch": 22, "train_loss": 1.5791683197021484}, {"step": 8000, "epoch": 22, "train_loss": 1.6318250894546509}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3756, "eval_loss": 1.790483203125, "val_acc": 0.3756, "val_loss": 1.790483203125}, {"step": 8200, "epoch": 23, "train_loss": 1.4760571718215942}, {"step": 8400, "epoch": 23, "train_loss": 1.6910078525543213}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3762, "eval_loss": 1.7710974609375, "val_acc": 0.3762, "val_loss": 1.7710974609375}, {"step": 8600, "epoch": 24, "train_loss": 1.5565590858459473}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.379, "eval_loss": 1.7692759521484376, "val_acc": 0.379, "val_loss": 1.7692759521484376}], "final": {"eval_split": "validation", "eval_acc": 0.379, "eval_loss": 1.7692759521484376, "wall_s": 17.724177837371826, "val_acc": 0.379, "val_loss": 1.7692759521484376}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0.json new file mode 100644 index 0000000..92ed46a --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 4, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d4_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.383604049682617}, {"step": 200, "epoch": 0, "train_loss": 1.7610948085784912}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3338, "eval_loss": 1.912164501953125, "val_acc": 0.3338, "val_loss": 1.912164501953125}, {"step": 400, "epoch": 1, "train_loss": 1.7126342058181763}, {"step": 600, "epoch": 1, "train_loss": 1.7328016757965088}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3556, "eval_loss": 1.8727889404296876, "val_acc": 0.3556, "val_loss": 1.8727889404296876}, {"step": 800, "epoch": 2, "train_loss": 1.6682446002960205}, {"step": 1000, "epoch": 2, "train_loss": 1.7850028276443481}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3548, "eval_loss": 1.8369991455078125, "val_acc": 0.3548, "val_loss": 1.8369991455078125}, {"step": 1200, "epoch": 3, "train_loss": 1.6067845821380615}, {"step": 1400, "epoch": 3, "train_loss": 1.6644831895828247}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3516, "eval_loss": 1.839272216796875, "val_acc": 0.3516, "val_loss": 1.839272216796875}, {"step": 1600, "epoch": 4, "train_loss": 1.671094536781311}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3612, "eval_loss": 1.8231252685546875, "val_acc": 0.3612, "val_loss": 1.8231252685546875}, {"step": 1800, "epoch": 5, "train_loss": 1.8178144693374634}, {"step": 2000, "epoch": 5, "train_loss": 1.6754566431045532}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3598, "eval_loss": 1.810904345703125, "val_acc": 0.3598, "val_loss": 1.810904345703125}, {"step": 2200, "epoch": 6, "train_loss": 1.610650897026062}, {"step": 2400, "epoch": 6, "train_loss": 1.6244782209396362}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3618, "eval_loss": 1.8133049072265626, "val_acc": 0.3618, "val_loss": 1.8133049072265626}, {"step": 2600, "epoch": 7, "train_loss": 1.6868948936462402}, {"step": 2800, "epoch": 7, "train_loss": 1.7593493461608887}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3684, "eval_loss": 1.7950828125, "val_acc": 0.3684, "val_loss": 1.7950828125}, {"step": 3000, "epoch": 8, "train_loss": 1.66415536403656}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3674, "eval_loss": 1.79699560546875, "val_acc": 0.3674, "val_loss": 1.79699560546875}, {"step": 3200, "epoch": 9, "train_loss": 1.7509492635726929}, {"step": 3400, "epoch": 9, "train_loss": 1.5698741674423218}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3674, "eval_loss": 1.79268994140625, "val_acc": 0.3674, "val_loss": 1.79268994140625}, {"step": 3600, "epoch": 10, "train_loss": 1.6385778188705444}, {"step": 3800, "epoch": 10, "train_loss": 1.5268993377685547}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3666, "eval_loss": 1.7868793701171874, "val_acc": 0.3666, "val_loss": 1.7868793701171874}, {"step": 4000, "epoch": 11, "train_loss": 1.5952410697937012}, {"step": 4200, "epoch": 11, "train_loss": 1.6397472620010376}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.377, "eval_loss": 1.7727826416015624, "val_acc": 0.377, "val_loss": 1.7727826416015624}, {"step": 4400, "epoch": 12, "train_loss": 1.8183878660202026}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3684, "eval_loss": 1.793745166015625, "val_acc": 0.3684, "val_loss": 1.793745166015625}, {"step": 4600, "epoch": 13, "train_loss": 1.5248687267303467}, {"step": 4800, "epoch": 13, "train_loss": 1.699881672859192}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3644, "eval_loss": 1.7913708740234375, "val_acc": 0.3644, "val_loss": 1.7913708740234375}, {"step": 5000, "epoch": 14, "train_loss": 1.397655963897705}, {"step": 5200, "epoch": 14, "train_loss": 1.6332428455352783}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3708, "eval_loss": 1.789706640625, "val_acc": 0.3708, "val_loss": 1.789706640625}, {"step": 5400, "epoch": 15, "train_loss": 1.8139365911483765}, {"step": 5600, "epoch": 15, "train_loss": 1.5195242166519165}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3718, "eval_loss": 1.770397412109375, "val_acc": 0.3718, "val_loss": 1.770397412109375}, {"step": 5800, "epoch": 16, "train_loss": 1.5627028942108154}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3706, "eval_loss": 1.784296728515625, "val_acc": 0.3706, "val_loss": 1.784296728515625}, {"step": 6000, "epoch": 17, "train_loss": 1.5166749954223633}, {"step": 6200, "epoch": 17, "train_loss": 1.5427132844924927}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3742, "eval_loss": 1.7833609619140625, "val_acc": 0.3742, "val_loss": 1.7833609619140625}, {"step": 6400, "epoch": 18, "train_loss": 1.4202320575714111}, {"step": 6600, "epoch": 18, "train_loss": 1.5325849056243896}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3778, "eval_loss": 1.7743547607421875, "val_acc": 0.3778, "val_loss": 1.7743547607421875}, {"step": 6800, "epoch": 19, "train_loss": 1.5907431840896606}, {"step": 7000, "epoch": 19, "train_loss": 1.464917778968811}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3822, "eval_loss": 1.760672021484375, "val_acc": 0.3822, "val_loss": 1.760672021484375}, {"step": 7200, "epoch": 20, "train_loss": 1.6378196477890015}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.378, "eval_loss": 1.7727245849609374, "val_acc": 0.378, "val_loss": 1.7727245849609374}, {"step": 7400, "epoch": 21, "train_loss": 1.5653473138809204}, {"step": 7600, "epoch": 21, "train_loss": 1.5427693128585815}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3744, "eval_loss": 1.7742513916015625, "val_acc": 0.3744, "val_loss": 1.7742513916015625}, {"step": 7800, "epoch": 22, "train_loss": 1.6414825916290283}, {"step": 8000, "epoch": 22, "train_loss": 1.6095434427261353}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3796, "eval_loss": 1.769055322265625, "val_acc": 0.3796, "val_loss": 1.769055322265625}, {"step": 8200, "epoch": 23, "train_loss": 1.444868564605713}, {"step": 8400, "epoch": 23, "train_loss": 1.65962553024292}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3826, "eval_loss": 1.7572109619140626, "val_acc": 0.3826, "val_loss": 1.7572109619140626}, {"step": 8600, "epoch": 24, "train_loss": 1.497135877609253}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3822, "eval_loss": 1.752923876953125, "val_acc": 0.3822, "val_loss": 1.752923876953125}], "final": {"eval_split": "validation", "eval_acc": 0.3822, "eval_loss": 1.752923876953125, "wall_s": 29.056323766708374, "val_acc": 0.3822, "val_loss": 1.752923876953125}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0.json new file mode 100644 index 0000000..9546c24 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 6, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d6_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6297314167022705}, {"step": 200, "epoch": 0, "train_loss": 1.7909108400344849}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3262, "eval_loss": 1.9040460205078125, "val_acc": 0.3262, "val_loss": 1.9040460205078125}, {"step": 400, "epoch": 1, "train_loss": 1.7910490036010742}, {"step": 600, "epoch": 1, "train_loss": 1.7194494009017944}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3518, "eval_loss": 1.86377822265625, "val_acc": 0.3518, "val_loss": 1.86377822265625}, {"step": 800, "epoch": 2, "train_loss": 1.70653235912323}, {"step": 1000, "epoch": 2, "train_loss": 1.7814356088638306}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.358, "eval_loss": 1.834432470703125, "val_acc": 0.358, "val_loss": 1.834432470703125}, {"step": 1200, "epoch": 3, "train_loss": 1.5530292987823486}, {"step": 1400, "epoch": 3, "train_loss": 1.6456412076950073}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3614, "eval_loss": 1.835983447265625, "val_acc": 0.3614, "val_loss": 1.835983447265625}, {"step": 1600, "epoch": 4, "train_loss": 1.676372766494751}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3686, "eval_loss": 1.8233727294921875, "val_acc": 0.3686, "val_loss": 1.8233727294921875}, {"step": 1800, "epoch": 5, "train_loss": 1.8964179754257202}, {"step": 2000, "epoch": 5, "train_loss": 1.6459848880767822}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3628, "eval_loss": 1.80917802734375, "val_acc": 0.3628, "val_loss": 1.80917802734375}, {"step": 2200, "epoch": 6, "train_loss": 1.6466037034988403}, {"step": 2400, "epoch": 6, "train_loss": 1.653733253479004}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3654, "eval_loss": 1.818825537109375, "val_acc": 0.3654, "val_loss": 1.818825537109375}, {"step": 2600, "epoch": 7, "train_loss": 1.6940566301345825}, {"step": 2800, "epoch": 7, "train_loss": 1.778384804725647}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3732, "eval_loss": 1.796735595703125, "val_acc": 0.3732, "val_loss": 1.796735595703125}, {"step": 3000, "epoch": 8, "train_loss": 1.6371135711669922}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3714, "eval_loss": 1.80244658203125, "val_acc": 0.3714, "val_loss": 1.80244658203125}, {"step": 3200, "epoch": 9, "train_loss": 1.6923823356628418}, {"step": 3400, "epoch": 9, "train_loss": 1.5949510335922241}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.376, "eval_loss": 1.791606640625, "val_acc": 0.376, "val_loss": 1.791606640625}, {"step": 3600, "epoch": 10, "train_loss": 1.5921745300292969}, {"step": 3800, "epoch": 10, "train_loss": 1.5253223180770874}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3764, "eval_loss": 1.7941333740234375, "val_acc": 0.3764, "val_loss": 1.7941333740234375}, {"step": 4000, "epoch": 11, "train_loss": 1.6548943519592285}, {"step": 4200, "epoch": 11, "train_loss": 1.6630606651306152}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3788, "eval_loss": 1.7755791748046874, "val_acc": 0.3788, "val_loss": 1.7755791748046874}, {"step": 4400, "epoch": 12, "train_loss": 1.7819236516952515}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3718, "eval_loss": 1.8013405029296874, "val_acc": 0.3718, "val_loss": 1.8013405029296874}, {"step": 4600, "epoch": 13, "train_loss": 1.4850767850875854}, {"step": 4800, "epoch": 13, "train_loss": 1.6239793300628662}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.377, "eval_loss": 1.7875544677734374, "val_acc": 0.377, "val_loss": 1.7875544677734374}, {"step": 5000, "epoch": 14, "train_loss": 1.3573062419891357}, {"step": 5200, "epoch": 14, "train_loss": 1.6061058044433594}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3732, "eval_loss": 1.795987060546875, "val_acc": 0.3732, "val_loss": 1.795987060546875}, {"step": 5400, "epoch": 15, "train_loss": 1.7622802257537842}, {"step": 5600, "epoch": 15, "train_loss": 1.4920891523361206}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3732, "eval_loss": 1.7809289306640625, "val_acc": 0.3732, "val_loss": 1.7809289306640625}, {"step": 5800, "epoch": 16, "train_loss": 1.5436149835586548}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3808, "eval_loss": 1.790147998046875, "val_acc": 0.3808, "val_loss": 1.790147998046875}, {"step": 6000, "epoch": 17, "train_loss": 1.525758981704712}, {"step": 6200, "epoch": 17, "train_loss": 1.4599571228027344}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.378, "eval_loss": 1.7829792236328126, "val_acc": 0.378, "val_loss": 1.7829792236328126}, {"step": 6400, "epoch": 18, "train_loss": 1.442229986190796}, {"step": 6600, "epoch": 18, "train_loss": 1.5601450204849243}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3798, "eval_loss": 1.79341337890625, "val_acc": 0.3798, "val_loss": 1.79341337890625}, {"step": 6800, "epoch": 19, "train_loss": 1.5725939273834229}, {"step": 7000, "epoch": 19, "train_loss": 1.4079320430755615}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3802, "eval_loss": 1.76940849609375, "val_acc": 0.3802, "val_loss": 1.76940849609375}, {"step": 7200, "epoch": 20, "train_loss": 1.653389573097229}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3762, "eval_loss": 1.78190068359375, "val_acc": 0.3762, "val_loss": 1.78190068359375}, {"step": 7400, "epoch": 21, "train_loss": 1.5843520164489746}, {"step": 7600, "epoch": 21, "train_loss": 1.599625825881958}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3796, "eval_loss": 1.7869532958984375, "val_acc": 0.3796, "val_loss": 1.7869532958984375}, {"step": 7800, "epoch": 22, "train_loss": 1.5850491523742676}, {"step": 8000, "epoch": 22, "train_loss": 1.6007497310638428}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3816, "eval_loss": 1.779801416015625, "val_acc": 0.3816, "val_loss": 1.779801416015625}, {"step": 8200, "epoch": 23, "train_loss": 1.5141990184783936}, {"step": 8400, "epoch": 23, "train_loss": 1.683617115020752}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3802, "eval_loss": 1.773928466796875, "val_acc": 0.3802, "val_loss": 1.773928466796875}, {"step": 8600, "epoch": 24, "train_loss": 1.4998162984848022}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.38, "eval_loss": 1.7654266357421875, "val_acc": 0.38, "val_loss": 1.7654266357421875}], "final": {"eval_split": "validation", "eval_acc": 0.38, "eval_loss": 1.7654266357421875, "wall_s": 33.10647225379944, "val_acc": 0.38, "val_loss": 1.7654266357421875}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0.json new file mode 100644 index 0000000..a3e1c1e --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 8, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w16_d8_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.485805034637451}, {"step": 200, "epoch": 0, "train_loss": 1.7921242713928223}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3256, "eval_loss": 1.9081274658203125, "val_acc": 0.3256, "val_loss": 1.9081274658203125}, {"step": 400, "epoch": 1, "train_loss": 1.7679376602172852}, {"step": 600, "epoch": 1, "train_loss": 1.7464025020599365}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3376, "eval_loss": 1.87998232421875, "val_acc": 0.3376, "val_loss": 1.87998232421875}, {"step": 800, "epoch": 2, "train_loss": 1.685981273651123}, {"step": 1000, "epoch": 2, "train_loss": 1.8076378107070923}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3488, "eval_loss": 1.8490821044921875, "val_acc": 0.3488, "val_loss": 1.8490821044921875}, {"step": 1200, "epoch": 3, "train_loss": 1.5900728702545166}, {"step": 1400, "epoch": 3, "train_loss": 1.6340383291244507}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3554, "eval_loss": 1.8328413330078126, "val_acc": 0.3554, "val_loss": 1.8328413330078126}, {"step": 1600, "epoch": 4, "train_loss": 1.62771475315094}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3726, "eval_loss": 1.809384033203125, "val_acc": 0.3726, "val_loss": 1.809384033203125}, {"step": 1800, "epoch": 5, "train_loss": 1.8734294176101685}, {"step": 2000, "epoch": 5, "train_loss": 1.6111594438552856}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3706, "eval_loss": 1.7925618408203126, "val_acc": 0.3706, "val_loss": 1.7925618408203126}, {"step": 2200, "epoch": 6, "train_loss": 1.6069446802139282}, {"step": 2400, "epoch": 6, "train_loss": 1.6950554847717285}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.377, "eval_loss": 1.7837630126953126, "val_acc": 0.377, "val_loss": 1.7837630126953126}, {"step": 2600, "epoch": 7, "train_loss": 1.6443514823913574}, {"step": 2800, "epoch": 7, "train_loss": 1.6822401285171509}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3752, "eval_loss": 1.7716834716796874, "val_acc": 0.3752, "val_loss": 1.7716834716796874}, {"step": 3000, "epoch": 8, "train_loss": 1.6433720588684082}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3742, "eval_loss": 1.7764485595703126, "val_acc": 0.3742, "val_loss": 1.7764485595703126}, {"step": 3200, "epoch": 9, "train_loss": 1.6560735702514648}, {"step": 3400, "epoch": 9, "train_loss": 1.5867209434509277}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3854, "eval_loss": 1.7663809326171875, "val_acc": 0.3854, "val_loss": 1.7663809326171875}, {"step": 3600, "epoch": 10, "train_loss": 1.5836684703826904}, {"step": 3800, "epoch": 10, "train_loss": 1.5297778844833374}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.383, "eval_loss": 1.764136328125, "val_acc": 0.383, "val_loss": 1.764136328125}, {"step": 4000, "epoch": 11, "train_loss": 1.6158984899520874}, {"step": 4200, "epoch": 11, "train_loss": 1.6285854578018188}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3874, "eval_loss": 1.7495160400390626, "val_acc": 0.3874, "val_loss": 1.7495160400390626}, {"step": 4400, "epoch": 12, "train_loss": 1.7406468391418457}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3754, "eval_loss": 1.7745019775390625, "val_acc": 0.3754, "val_loss": 1.7745019775390625}, {"step": 4600, "epoch": 13, "train_loss": 1.5345377922058105}, {"step": 4800, "epoch": 13, "train_loss": 1.6579797267913818}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3772, "eval_loss": 1.766105712890625, "val_acc": 0.3772, "val_loss": 1.766105712890625}, {"step": 5000, "epoch": 14, "train_loss": 1.3781059980392456}, {"step": 5200, "epoch": 14, "train_loss": 1.6215590238571167}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3758, "eval_loss": 1.768886669921875, "val_acc": 0.3758, "val_loss": 1.768886669921875}, {"step": 5400, "epoch": 15, "train_loss": 1.788153052330017}, {"step": 5600, "epoch": 15, "train_loss": 1.4719194173812866}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.379, "eval_loss": 1.7546478759765625, "val_acc": 0.379, "val_loss": 1.7546478759765625}, {"step": 5800, "epoch": 16, "train_loss": 1.490365982055664}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3806, "eval_loss": 1.772960888671875, "val_acc": 0.3806, "val_loss": 1.772960888671875}, {"step": 6000, "epoch": 17, "train_loss": 1.494633674621582}, {"step": 6200, "epoch": 17, "train_loss": 1.4664727449417114}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3838, "eval_loss": 1.76002763671875, "val_acc": 0.3838, "val_loss": 1.76002763671875}, {"step": 6400, "epoch": 18, "train_loss": 1.4253993034362793}, {"step": 6600, "epoch": 18, "train_loss": 1.581397294998169}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3832, "eval_loss": 1.7663487548828125, "val_acc": 0.3832, "val_loss": 1.7663487548828125}, {"step": 6800, "epoch": 19, "train_loss": 1.5670100450515747}, {"step": 7000, "epoch": 19, "train_loss": 1.392325520515442}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3876, "eval_loss": 1.746642041015625, "val_acc": 0.3876, "val_loss": 1.746642041015625}, {"step": 7200, "epoch": 20, "train_loss": 1.627132773399353}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3826, "eval_loss": 1.755614697265625, "val_acc": 0.3826, "val_loss": 1.755614697265625}, {"step": 7400, "epoch": 21, "train_loss": 1.5662859678268433}, {"step": 7600, "epoch": 21, "train_loss": 1.5469049215316772}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3868, "eval_loss": 1.76341796875, "val_acc": 0.3868, "val_loss": 1.76341796875}, {"step": 7800, "epoch": 22, "train_loss": 1.6311407089233398}, {"step": 8000, "epoch": 22, "train_loss": 1.5676263570785522}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3848, "eval_loss": 1.7579181884765624, "val_acc": 0.3848, "val_loss": 1.7579181884765624}, {"step": 8200, "epoch": 23, "train_loss": 1.4638445377349854}, {"step": 8400, "epoch": 23, "train_loss": 1.6865875720977783}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3832, "eval_loss": 1.7470204345703124, "val_acc": 0.3832, "val_loss": 1.7470204345703124}, {"step": 8600, "epoch": 24, "train_loss": 1.4909882545471191}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3822, "eval_loss": 1.7505083984375, "val_acc": 0.3822, "val_loss": 1.7505083984375}], "final": {"eval_split": "validation", "eval_acc": 0.3822, "eval_loss": 1.7505083984375, "wall_s": 39.662893295288086, "val_acc": 0.3822, "val_loss": 1.7505083984375}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0.json new file mode 100644 index 0000000..0613f53 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 12, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d12_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5225329399108887}, {"step": 200, "epoch": 0, "train_loss": 1.7906372547149658}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.332, "eval_loss": 1.904244287109375, "val_acc": 0.332, "val_loss": 1.904244287109375}, {"step": 400, "epoch": 1, "train_loss": 1.7433497905731201}, {"step": 600, "epoch": 1, "train_loss": 1.717389702796936}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3442, "eval_loss": 1.8789136962890625, "val_acc": 0.3442, "val_loss": 1.8789136962890625}, {"step": 800, "epoch": 2, "train_loss": 1.6778650283813477}, {"step": 1000, "epoch": 2, "train_loss": 1.7652276754379272}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3556, "eval_loss": 1.8470677001953124, "val_acc": 0.3556, "val_loss": 1.8470677001953124}, {"step": 1200, "epoch": 3, "train_loss": 1.523913860321045}, {"step": 1400, "epoch": 3, "train_loss": 1.5748168230056763}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3574, "eval_loss": 1.8402134033203126, "val_acc": 0.3574, "val_loss": 1.8402134033203126}, {"step": 1600, "epoch": 4, "train_loss": 1.5846136808395386}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.372, "eval_loss": 1.808778759765625, "val_acc": 0.372, "val_loss": 1.808778759765625}, {"step": 1800, "epoch": 5, "train_loss": 1.8003953695297241}, {"step": 2000, "epoch": 5, "train_loss": 1.5881260633468628}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.375, "eval_loss": 1.7751354248046876, "val_acc": 0.375, "val_loss": 1.7751354248046876}, {"step": 2200, "epoch": 6, "train_loss": 1.5656712055206299}, {"step": 2400, "epoch": 6, "train_loss": 1.550453782081604}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3904, "eval_loss": 1.771417041015625, "val_acc": 0.3904, "val_loss": 1.771417041015625}, {"step": 2600, "epoch": 7, "train_loss": 1.5640873908996582}, {"step": 2800, "epoch": 7, "train_loss": 1.6734482049942017}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3942, "eval_loss": 1.7509275146484375, "val_acc": 0.3942, "val_loss": 1.7509275146484375}, {"step": 3000, "epoch": 8, "train_loss": 1.5729361772537231}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3864, "eval_loss": 1.770663134765625, "val_acc": 0.3864, "val_loss": 1.770663134765625}, {"step": 3200, "epoch": 9, "train_loss": 1.5623794794082642}, {"step": 3400, "epoch": 9, "train_loss": 1.500632882118225}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3804, "eval_loss": 1.77856767578125, "val_acc": 0.3804, "val_loss": 1.77856767578125}, {"step": 3600, "epoch": 10, "train_loss": 1.486441969871521}, {"step": 3800, "epoch": 10, "train_loss": 1.365587592124939}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3812, "eval_loss": 1.7705543701171875, "val_acc": 0.3812, "val_loss": 1.7705543701171875}, {"step": 4000, "epoch": 11, "train_loss": 1.4871476888656616}, {"step": 4200, "epoch": 11, "train_loss": 1.5890864133834839}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.388, "eval_loss": 1.7552383056640626, "val_acc": 0.388, "val_loss": 1.7552383056640626}, {"step": 4400, "epoch": 12, "train_loss": 1.6518833637237549}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3834, "eval_loss": 1.778572607421875, "val_acc": 0.3834, "val_loss": 1.778572607421875}, {"step": 4600, "epoch": 13, "train_loss": 1.382397174835205}, {"step": 4800, "epoch": 13, "train_loss": 1.422805666923523}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3864, "eval_loss": 1.792176416015625, "val_acc": 0.3864, "val_loss": 1.792176416015625}, {"step": 5000, "epoch": 14, "train_loss": 1.1823656558990479}, {"step": 5200, "epoch": 14, "train_loss": 1.418053150177002}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3936, "eval_loss": 1.7863834716796876, "val_acc": 0.3936, "val_loss": 1.7863834716796876}, {"step": 5400, "epoch": 15, "train_loss": 1.6090099811553955}, {"step": 5600, "epoch": 15, "train_loss": 1.3677173852920532}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3938, "eval_loss": 1.771215478515625, "val_acc": 0.3938, "val_loss": 1.771215478515625}, {"step": 5800, "epoch": 16, "train_loss": 1.1730642318725586}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.391, "eval_loss": 1.77024072265625, "val_acc": 0.391, "val_loss": 1.77024072265625}, {"step": 6000, "epoch": 17, "train_loss": 1.1396112442016602}, {"step": 6200, "epoch": 17, "train_loss": 1.1576471328735352}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3838, "eval_loss": 1.826544287109375, "val_acc": 0.3838, "val_loss": 1.826544287109375}, {"step": 6400, "epoch": 18, "train_loss": 1.109771966934204}, {"step": 6600, "epoch": 18, "train_loss": 1.2505069971084595}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3872, "eval_loss": 1.8254947265625, "val_acc": 0.3872, "val_loss": 1.8254947265625}, {"step": 6800, "epoch": 19, "train_loss": 1.2415235042572021}, {"step": 7000, "epoch": 19, "train_loss": 1.1805624961853027}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3862, "eval_loss": 1.8145503173828126, "val_acc": 0.3862, "val_loss": 1.8145503173828126}, {"step": 7200, "epoch": 20, "train_loss": 1.3972448110580444}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3864, "eval_loss": 1.8674730712890626, "val_acc": 0.3864, "val_loss": 1.8674730712890626}, {"step": 7400, "epoch": 21, "train_loss": 1.1311677694320679}, {"step": 7600, "epoch": 21, "train_loss": 1.1309796571731567}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3832, "eval_loss": 1.8787137939453125, "val_acc": 0.3832, "val_loss": 1.8787137939453125}, {"step": 7800, "epoch": 22, "train_loss": 1.3694546222686768}, {"step": 8000, "epoch": 22, "train_loss": 1.1945430040359497}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3886, "eval_loss": 1.8810318603515626, "val_acc": 0.3886, "val_loss": 1.8810318603515626}, {"step": 8200, "epoch": 23, "train_loss": 1.033811330795288}, {"step": 8400, "epoch": 23, "train_loss": 1.1782039403915405}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3818, "eval_loss": 1.927628955078125, "val_acc": 0.3818, "val_loss": 1.927628955078125}, {"step": 8600, "epoch": 24, "train_loss": 1.1393238306045532}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.9600396728515626, "val_acc": 0.373, "val_loss": 1.9600396728515626}], "final": {"eval_split": "validation", "eval_acc": 0.373, "eval_loss": 1.9600396728515626, "wall_s": 61.94551920890808, "val_acc": 0.373, "val_loss": 1.9600396728515626}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0.json new file mode 100644 index 0000000..848c7b6 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 1, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4180097579956055}, {"step": 200, "epoch": 0, "train_loss": 1.7349522113800049}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3352, "eval_loss": 1.8947329833984374, "val_acc": 0.3352, "val_loss": 1.8947329833984374}, {"step": 400, "epoch": 1, "train_loss": 1.7823184728622437}, {"step": 600, "epoch": 1, "train_loss": 1.7122774124145508}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3418, "eval_loss": 1.8817173095703126, "val_acc": 0.3418, "val_loss": 1.8817173095703126}, {"step": 800, "epoch": 2, "train_loss": 1.6958614587783813}, {"step": 1000, "epoch": 2, "train_loss": 1.7972378730773926}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3496, "eval_loss": 1.862398828125, "val_acc": 0.3496, "val_loss": 1.862398828125}, {"step": 1200, "epoch": 3, "train_loss": 1.593858003616333}, {"step": 1400, "epoch": 3, "train_loss": 1.5995712280273438}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3586, "eval_loss": 1.846577880859375, "val_acc": 0.3586, "val_loss": 1.846577880859375}, {"step": 1600, "epoch": 4, "train_loss": 1.6386404037475586}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3694, "eval_loss": 1.81514814453125, "val_acc": 0.3694, "val_loss": 1.81514814453125}, {"step": 1800, "epoch": 5, "train_loss": 1.808537483215332}, {"step": 2000, "epoch": 5, "train_loss": 1.6063623428344727}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3666, "eval_loss": 1.7993331787109375, "val_acc": 0.3666, "val_loss": 1.7993331787109375}, {"step": 2200, "epoch": 6, "train_loss": 1.622808575630188}, {"step": 2400, "epoch": 6, "train_loss": 1.5499234199523926}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3756, "eval_loss": 1.7813814697265624, "val_acc": 0.3756, "val_loss": 1.7813814697265624}, {"step": 2600, "epoch": 7, "train_loss": 1.5938136577606201}, {"step": 2800, "epoch": 7, "train_loss": 1.7228647470474243}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3806, "eval_loss": 1.7557990966796875, "val_acc": 0.3806, "val_loss": 1.7557990966796875}, {"step": 3000, "epoch": 8, "train_loss": 1.5742205381393433}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3878, "eval_loss": 1.75081669921875, "val_acc": 0.3878, "val_loss": 1.75081669921875}, {"step": 3200, "epoch": 9, "train_loss": 1.5627541542053223}, {"step": 3400, "epoch": 9, "train_loss": 1.5008689165115356}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3828, "eval_loss": 1.74557509765625, "val_acc": 0.3828, "val_loss": 1.74557509765625}, {"step": 3600, "epoch": 10, "train_loss": 1.518060326576233}, {"step": 3800, "epoch": 10, "train_loss": 1.3843923807144165}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3936, "eval_loss": 1.7410957763671875, "val_acc": 0.3936, "val_loss": 1.7410957763671875}, {"step": 4000, "epoch": 11, "train_loss": 1.6026524305343628}, {"step": 4200, "epoch": 11, "train_loss": 1.6293758153915405}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.393, "eval_loss": 1.7204920166015625, "val_acc": 0.393, "val_loss": 1.7204920166015625}, {"step": 4400, "epoch": 12, "train_loss": 1.6586055755615234}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3854, "eval_loss": 1.7557451171875, "val_acc": 0.3854, "val_loss": 1.7557451171875}, {"step": 4600, "epoch": 13, "train_loss": 1.4167895317077637}, {"step": 4800, "epoch": 13, "train_loss": 1.5495729446411133}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3844, "eval_loss": 1.7392519775390625, "val_acc": 0.3844, "val_loss": 1.7392519775390625}, {"step": 5000, "epoch": 14, "train_loss": 1.2447478771209717}, {"step": 5200, "epoch": 14, "train_loss": 1.4339793920516968}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3948, "eval_loss": 1.7428477294921876, "val_acc": 0.3948, "val_loss": 1.7428477294921876}, {"step": 5400, "epoch": 15, "train_loss": 1.7283892631530762}, {"step": 5600, "epoch": 15, "train_loss": 1.3699817657470703}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4036, "eval_loss": 1.7237943603515624, "val_acc": 0.4036, "val_loss": 1.7237943603515624}, {"step": 5800, "epoch": 16, "train_loss": 1.3725944757461548}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3978, "eval_loss": 1.7360341064453124, "val_acc": 0.3978, "val_loss": 1.7360341064453124}, {"step": 6000, "epoch": 17, "train_loss": 1.3971965312957764}, {"step": 6200, "epoch": 17, "train_loss": 1.3876622915267944}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.4012, "eval_loss": 1.7350836669921874, "val_acc": 0.4012, "val_loss": 1.7350836669921874}, {"step": 6400, "epoch": 18, "train_loss": 1.267738938331604}, {"step": 6600, "epoch": 18, "train_loss": 1.4521484375}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.4072, "eval_loss": 1.7213315673828125, "val_acc": 0.4072, "val_loss": 1.7213315673828125}, {"step": 6800, "epoch": 19, "train_loss": 1.4703563451766968}, {"step": 7000, "epoch": 19, "train_loss": 1.2981882095336914}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4064, "eval_loss": 1.706935205078125, "val_acc": 0.4064, "val_loss": 1.706935205078125}, {"step": 7200, "epoch": 20, "train_loss": 1.5431913137435913}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.403, "eval_loss": 1.7214145751953125, "val_acc": 0.403, "val_loss": 1.7214145751953125}, {"step": 7400, "epoch": 21, "train_loss": 1.3633081912994385}, {"step": 7600, "epoch": 21, "train_loss": 1.3754812479019165}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.4022, "eval_loss": 1.711796533203125, "val_acc": 0.4022, "val_loss": 1.711796533203125}, {"step": 7800, "epoch": 22, "train_loss": 1.505449891090393}, {"step": 8000, "epoch": 22, "train_loss": 1.436380386352539}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4126, "eval_loss": 1.6952454345703125, "val_acc": 0.4126, "val_loss": 1.6952454345703125}, {"step": 8200, "epoch": 23, "train_loss": 1.330977201461792}, {"step": 8400, "epoch": 23, "train_loss": 1.526324987411499}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.409, "eval_loss": 1.6973236328125, "val_acc": 0.409, "val_loss": 1.6973236328125}, {"step": 8600, "epoch": 24, "train_loss": 1.3941482305526733}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.408, "eval_loss": 1.6856623291015624, "val_acc": 0.408, "val_loss": 1.6856623291015624}], "final": {"eval_split": "validation", "eval_acc": 0.408, "eval_loss": 1.6856623291015624, "wall_s": 14.246614694595337, "val_acc": 0.408, "val_loss": 1.6856623291015624}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0.json new file mode 100644 index 0000000..4923028 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 2, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d2_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6634795665740967}, {"step": 200, "epoch": 0, "train_loss": 1.7392361164093018}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3322, "eval_loss": 1.8970150634765626, "val_acc": 0.3322, "val_loss": 1.8970150634765626}, {"step": 400, "epoch": 1, "train_loss": 1.7551640272140503}, {"step": 600, "epoch": 1, "train_loss": 1.7312787771224976}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3508, "eval_loss": 1.87037197265625, "val_acc": 0.3508, "val_loss": 1.87037197265625}, {"step": 800, "epoch": 2, "train_loss": 1.6509016752243042}, {"step": 1000, "epoch": 2, "train_loss": 1.7625491619110107}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3604, "eval_loss": 1.8333597412109375, "val_acc": 0.3604, "val_loss": 1.8333597412109375}, {"step": 1200, "epoch": 3, "train_loss": 1.5264045000076294}, {"step": 1400, "epoch": 3, "train_loss": 1.5917079448699951}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3616, "eval_loss": 1.8280685302734374, "val_acc": 0.3616, "val_loss": 1.8280685302734374}, {"step": 1600, "epoch": 4, "train_loss": 1.6507923603057861}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3738, "eval_loss": 1.8006971435546875, "val_acc": 0.3738, "val_loss": 1.8006971435546875}, {"step": 1800, "epoch": 5, "train_loss": 1.8038511276245117}, {"step": 2000, "epoch": 5, "train_loss": 1.5552788972854614}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3748, "eval_loss": 1.7877079833984375, "val_acc": 0.3748, "val_loss": 1.7877079833984375}, {"step": 2200, "epoch": 6, "train_loss": 1.5938795804977417}, {"step": 2400, "epoch": 6, "train_loss": 1.5603779554367065}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3842, "eval_loss": 1.7843631103515625, "val_acc": 0.3842, "val_loss": 1.7843631103515625}, {"step": 2600, "epoch": 7, "train_loss": 1.6169517040252686}, {"step": 2800, "epoch": 7, "train_loss": 1.7346149682998657}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.384, "eval_loss": 1.768867138671875, "val_acc": 0.384, "val_loss": 1.768867138671875}, {"step": 3000, "epoch": 8, "train_loss": 1.515174388885498}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3788, "eval_loss": 1.767204150390625, "val_acc": 0.3788, "val_loss": 1.767204150390625}, {"step": 3200, "epoch": 9, "train_loss": 1.5812177658081055}, {"step": 3400, "epoch": 9, "train_loss": 1.5104117393493652}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3828, "eval_loss": 1.7606010986328124, "val_acc": 0.3828, "val_loss": 1.7606010986328124}, {"step": 3600, "epoch": 10, "train_loss": 1.5871082544326782}, {"step": 3800, "epoch": 10, "train_loss": 1.4036861658096313}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3834, "eval_loss": 1.7639999267578126, "val_acc": 0.3834, "val_loss": 1.7639999267578126}, {"step": 4000, "epoch": 11, "train_loss": 1.4818824529647827}, {"step": 4200, "epoch": 11, "train_loss": 1.6143189668655396}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3918, "eval_loss": 1.7417701904296874, "val_acc": 0.3918, "val_loss": 1.7417701904296874}, {"step": 4400, "epoch": 12, "train_loss": 1.7102020978927612}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.386, "eval_loss": 1.7647007080078125, "val_acc": 0.386, "val_loss": 1.7647007080078125}, {"step": 4600, "epoch": 13, "train_loss": 1.40860116481781}, {"step": 4800, "epoch": 13, "train_loss": 1.6281629800796509}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3888, "eval_loss": 1.758567529296875, "val_acc": 0.3888, "val_loss": 1.758567529296875}, {"step": 5000, "epoch": 14, "train_loss": 1.2127366065979004}, {"step": 5200, "epoch": 14, "train_loss": 1.4315799474716187}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3938, "eval_loss": 1.75312724609375, "val_acc": 0.3938, "val_loss": 1.75312724609375}, {"step": 5400, "epoch": 15, "train_loss": 1.6419495344161987}, {"step": 5600, "epoch": 15, "train_loss": 1.4594193696975708}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4016, "eval_loss": 1.729437646484375, "val_acc": 0.4016, "val_loss": 1.729437646484375}, {"step": 5800, "epoch": 16, "train_loss": 1.4091275930404663}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.4004, "eval_loss": 1.7404166259765625, "val_acc": 0.4004, "val_loss": 1.7404166259765625}, {"step": 6000, "epoch": 17, "train_loss": 1.320406198501587}, {"step": 6200, "epoch": 17, "train_loss": 1.3364851474761963}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.4044, "eval_loss": 1.743746240234375, "val_acc": 0.4044, "val_loss": 1.743746240234375}, {"step": 6400, "epoch": 18, "train_loss": 1.09772527217865}, {"step": 6600, "epoch": 18, "train_loss": 1.3545604944229126}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.4056, "eval_loss": 1.733443798828125, "val_acc": 0.4056, "val_loss": 1.733443798828125}, {"step": 6800, "epoch": 19, "train_loss": 1.2870097160339355}, {"step": 7000, "epoch": 19, "train_loss": 1.3358473777770996}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4078, "eval_loss": 1.70913203125, "val_acc": 0.4078, "val_loss": 1.70913203125}, {"step": 7200, "epoch": 20, "train_loss": 1.4319428205490112}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4054, "eval_loss": 1.7306862060546875, "val_acc": 0.4054, "val_loss": 1.7306862060546875}, {"step": 7400, "epoch": 21, "train_loss": 1.2578999996185303}, {"step": 7600, "epoch": 21, "train_loss": 1.2484898567199707}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.404, "eval_loss": 1.7344854736328126, "val_acc": 0.404, "val_loss": 1.7344854736328126}, {"step": 7800, "epoch": 22, "train_loss": 1.519671082496643}, {"step": 8000, "epoch": 22, "train_loss": 1.435581922531128}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4064, "eval_loss": 1.707657080078125, "val_acc": 0.4064, "val_loss": 1.707657080078125}, {"step": 8200, "epoch": 23, "train_loss": 1.2397700548171997}, {"step": 8400, "epoch": 23, "train_loss": 1.4470657110214233}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.4064, "eval_loss": 1.728324169921875, "val_acc": 0.4064, "val_loss": 1.728324169921875}, {"step": 8600, "epoch": 24, "train_loss": 1.305275321006775}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.4058, "eval_loss": 1.7158028076171874, "val_acc": 0.4058, "val_loss": 1.7158028076171874}], "final": {"eval_split": "validation", "eval_acc": 0.4058, "eval_loss": 1.7158028076171874, "wall_s": 17.861095905303955, "val_acc": 0.4058, "val_loss": 1.7158028076171874}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0.json new file mode 100644 index 0000000..180b7a8 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 4, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d4_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.494375228881836}, {"step": 200, "epoch": 0, "train_loss": 1.7668466567993164}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3264, "eval_loss": 1.9003558837890624, "val_acc": 0.3264, "val_loss": 1.9003558837890624}, {"step": 400, "epoch": 1, "train_loss": 1.739091396331787}, {"step": 600, "epoch": 1, "train_loss": 1.7146934270858765}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3452, "eval_loss": 1.8879978759765625, "val_acc": 0.3452, "val_loss": 1.8879978759765625}, {"step": 800, "epoch": 2, "train_loss": 1.6795015335083008}, {"step": 1000, "epoch": 2, "train_loss": 1.7471888065338135}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3564, "eval_loss": 1.84619541015625, "val_acc": 0.3564, "val_loss": 1.84619541015625}, {"step": 1200, "epoch": 3, "train_loss": 1.5223157405853271}, {"step": 1400, "epoch": 3, "train_loss": 1.6022671461105347}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3592, "eval_loss": 1.8341489013671874, "val_acc": 0.3592, "val_loss": 1.8341489013671874}, {"step": 1600, "epoch": 4, "train_loss": 1.653402328491211}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3732, "eval_loss": 1.80735146484375, "val_acc": 0.3732, "val_loss": 1.80735146484375}, {"step": 1800, "epoch": 5, "train_loss": 1.8385359048843384}, {"step": 2000, "epoch": 5, "train_loss": 1.563118577003479}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3716, "eval_loss": 1.781091552734375, "val_acc": 0.3716, "val_loss": 1.781091552734375}, {"step": 2200, "epoch": 6, "train_loss": 1.5558639764785767}, {"step": 2400, "epoch": 6, "train_loss": 1.5983037948608398}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3794, "eval_loss": 1.7652639404296875, "val_acc": 0.3794, "val_loss": 1.7652639404296875}, {"step": 2600, "epoch": 7, "train_loss": 1.5639969110488892}, {"step": 2800, "epoch": 7, "train_loss": 1.6544610261917114}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3876, "eval_loss": 1.742245166015625, "val_acc": 0.3876, "val_loss": 1.742245166015625}, {"step": 3000, "epoch": 8, "train_loss": 1.5272120237350464}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3952, "eval_loss": 1.7395301513671875, "val_acc": 0.3952, "val_loss": 1.7395301513671875}, {"step": 3200, "epoch": 9, "train_loss": 1.5225242376327515}, {"step": 3400, "epoch": 9, "train_loss": 1.4774686098098755}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.388, "eval_loss": 1.74919970703125, "val_acc": 0.388, "val_loss": 1.74919970703125}, {"step": 3600, "epoch": 10, "train_loss": 1.4476593732833862}, {"step": 3800, "epoch": 10, "train_loss": 1.3502999544143677}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3986, "eval_loss": 1.7331639892578126, "val_acc": 0.3986, "val_loss": 1.7331639892578126}, {"step": 4000, "epoch": 11, "train_loss": 1.52412748336792}, {"step": 4200, "epoch": 11, "train_loss": 1.6068642139434814}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3982, "eval_loss": 1.7193469970703126, "val_acc": 0.3982, "val_loss": 1.7193469970703126}, {"step": 4400, "epoch": 12, "train_loss": 1.6691029071807861}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.401, "eval_loss": 1.7348052734375, "val_acc": 0.401, "val_loss": 1.7348052734375}, {"step": 4600, "epoch": 13, "train_loss": 1.2623645067214966}, {"step": 4800, "epoch": 13, "train_loss": 1.5370402336120605}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3964, "eval_loss": 1.7474617919921875, "val_acc": 0.3964, "val_loss": 1.7474617919921875}, {"step": 5000, "epoch": 14, "train_loss": 1.1603879928588867}, {"step": 5200, "epoch": 14, "train_loss": 1.4278842210769653}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.4012, "eval_loss": 1.7398791015625, "val_acc": 0.4012, "val_loss": 1.7398791015625}, {"step": 5400, "epoch": 15, "train_loss": 1.6403396129608154}, {"step": 5600, "epoch": 15, "train_loss": 1.3499090671539307}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.405, "eval_loss": 1.71754091796875, "val_acc": 0.405, "val_loss": 1.71754091796875}, {"step": 5800, "epoch": 16, "train_loss": 1.3887730836868286}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.4018, "eval_loss": 1.7518520263671875, "val_acc": 0.4018, "val_loss": 1.7518520263671875}, {"step": 6000, "epoch": 17, "train_loss": 1.3639968633651733}, {"step": 6200, "epoch": 17, "train_loss": 1.3673912286758423}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.4054, "eval_loss": 1.771031689453125, "val_acc": 0.4054, "val_loss": 1.771031689453125}, {"step": 6400, "epoch": 18, "train_loss": 1.2472014427185059}, {"step": 6600, "epoch": 18, "train_loss": 1.231408953666687}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.4008, "eval_loss": 1.760891259765625, "val_acc": 0.4008, "val_loss": 1.760891259765625}, {"step": 6800, "epoch": 19, "train_loss": 1.3055731058120728}, {"step": 7000, "epoch": 19, "train_loss": 1.2214292287826538}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4112, "eval_loss": 1.7406487548828125, "val_acc": 0.4112, "val_loss": 1.7406487548828125}, {"step": 7200, "epoch": 20, "train_loss": 1.275927186012268}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4022, "eval_loss": 1.7747889404296875, "val_acc": 0.4022, "val_loss": 1.7747889404296875}, {"step": 7400, "epoch": 21, "train_loss": 1.202966570854187}, {"step": 7600, "epoch": 21, "train_loss": 1.2848490476608276}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3968, "eval_loss": 1.77179033203125, "val_acc": 0.3968, "val_loss": 1.77179033203125}, {"step": 7800, "epoch": 22, "train_loss": 1.3983107805252075}, {"step": 8000, "epoch": 22, "train_loss": 1.370850682258606}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4064, "eval_loss": 1.7622962890625, "val_acc": 0.4064, "val_loss": 1.7622962890625}, {"step": 8200, "epoch": 23, "train_loss": 1.1442334651947021}, {"step": 8400, "epoch": 23, "train_loss": 1.3749542236328125}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.4012, "eval_loss": 1.7840415283203126, "val_acc": 0.4012, "val_loss": 1.7840415283203126}, {"step": 8600, "epoch": 24, "train_loss": 1.2262749671936035}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.4006, "eval_loss": 1.775607666015625, "val_acc": 0.4006, "val_loss": 1.775607666015625}], "final": {"eval_split": "validation", "eval_acc": 0.4006, "eval_loss": 1.775607666015625, "wall_s": 25.604931116104126, "val_acc": 0.4006, "val_loss": 1.775607666015625}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0.json new file mode 100644 index 0000000..a408707 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 6, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d6_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.573746919631958}, {"step": 200, "epoch": 0, "train_loss": 1.7104246616363525}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3318, "eval_loss": 1.8961854248046874, "val_acc": 0.3318, "val_loss": 1.8961854248046874}, {"step": 400, "epoch": 1, "train_loss": 1.7290828227996826}, {"step": 600, "epoch": 1, "train_loss": 1.70455801486969}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3526, "eval_loss": 1.86725263671875, "val_acc": 0.3526, "val_loss": 1.86725263671875}, {"step": 800, "epoch": 2, "train_loss": 1.6812281608581543}, {"step": 1000, "epoch": 2, "train_loss": 1.768471121788025}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.361, "eval_loss": 1.8266659912109375, "val_acc": 0.361, "val_loss": 1.8266659912109375}, {"step": 1200, "epoch": 3, "train_loss": 1.5495350360870361}, {"step": 1400, "epoch": 3, "train_loss": 1.5867180824279785}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3622, "eval_loss": 1.821352001953125, "val_acc": 0.3622, "val_loss": 1.821352001953125}, {"step": 1600, "epoch": 4, "train_loss": 1.618988275527954}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3738, "eval_loss": 1.7969952880859374, "val_acc": 0.3738, "val_loss": 1.7969952880859374}, {"step": 1800, "epoch": 5, "train_loss": 1.7750898599624634}, {"step": 2000, "epoch": 5, "train_loss": 1.5564403533935547}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3806, "eval_loss": 1.7641541259765625, "val_acc": 0.3806, "val_loss": 1.7641541259765625}, {"step": 2200, "epoch": 6, "train_loss": 1.5268113613128662}, {"step": 2400, "epoch": 6, "train_loss": 1.5403099060058594}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3882, "eval_loss": 1.7595339111328125, "val_acc": 0.3882, "val_loss": 1.7595339111328125}, {"step": 2600, "epoch": 7, "train_loss": 1.541327714920044}, {"step": 2800, "epoch": 7, "train_loss": 1.6355960369110107}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.386, "eval_loss": 1.7467285888671875, "val_acc": 0.386, "val_loss": 1.7467285888671875}, {"step": 3000, "epoch": 8, "train_loss": 1.5069880485534668}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3858, "eval_loss": 1.753902001953125, "val_acc": 0.3858, "val_loss": 1.753902001953125}, {"step": 3200, "epoch": 9, "train_loss": 1.5253907442092896}, {"step": 3400, "epoch": 9, "train_loss": 1.5076396465301514}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3918, "eval_loss": 1.75735751953125, "val_acc": 0.3918, "val_loss": 1.75735751953125}, {"step": 3600, "epoch": 10, "train_loss": 1.4507845640182495}, {"step": 3800, "epoch": 10, "train_loss": 1.304982304573059}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3936, "eval_loss": 1.7436959228515625, "val_acc": 0.3936, "val_loss": 1.7436959228515625}, {"step": 4000, "epoch": 11, "train_loss": 1.3849855661392212}, {"step": 4200, "epoch": 11, "train_loss": 1.523558497428894}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3978, "eval_loss": 1.7391307373046876, "val_acc": 0.3978, "val_loss": 1.7391307373046876}, {"step": 4400, "epoch": 12, "train_loss": 1.6115436553955078}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.39, "eval_loss": 1.76820224609375, "val_acc": 0.39, "val_loss": 1.76820224609375}, {"step": 4600, "epoch": 13, "train_loss": 1.3322609663009644}, {"step": 4800, "epoch": 13, "train_loss": 1.4619946479797363}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.395, "eval_loss": 1.7727217529296875, "val_acc": 0.395, "val_loss": 1.7727217529296875}, {"step": 5000, "epoch": 14, "train_loss": 1.2391079664230347}, {"step": 5200, "epoch": 14, "train_loss": 1.359143853187561}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3922, "eval_loss": 1.7666169189453125, "val_acc": 0.3922, "val_loss": 1.7666169189453125}, {"step": 5400, "epoch": 15, "train_loss": 1.615647792816162}, {"step": 5600, "epoch": 15, "train_loss": 1.3558441400527954}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3928, "eval_loss": 1.76622841796875, "val_acc": 0.3928, "val_loss": 1.76622841796875}, {"step": 5800, "epoch": 16, "train_loss": 1.206676721572876}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3952, "eval_loss": 1.775632373046875, "val_acc": 0.3952, "val_loss": 1.775632373046875}, {"step": 6000, "epoch": 17, "train_loss": 1.1862266063690186}, {"step": 6200, "epoch": 17, "train_loss": 1.1934031248092651}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.392, "eval_loss": 1.8034113525390625, "val_acc": 0.392, "val_loss": 1.8034113525390625}, {"step": 6400, "epoch": 18, "train_loss": 1.1822999715805054}, {"step": 6600, "epoch": 18, "train_loss": 1.2095683813095093}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3952, "eval_loss": 1.8068008056640625, "val_acc": 0.3952, "val_loss": 1.8068008056640625}, {"step": 6800, "epoch": 19, "train_loss": 1.319027304649353}, {"step": 7000, "epoch": 19, "train_loss": 1.1257448196411133}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3884, "eval_loss": 1.7925139404296875, "val_acc": 0.3884, "val_loss": 1.7925139404296875}, {"step": 7200, "epoch": 20, "train_loss": 1.3518521785736084}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3874, "eval_loss": 1.8201495849609375, "val_acc": 0.3874, "val_loss": 1.8201495849609375}, {"step": 7400, "epoch": 21, "train_loss": 1.2303465604782104}, {"step": 7600, "epoch": 21, "train_loss": 1.2465145587921143}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3864, "eval_loss": 1.8330891845703126, "val_acc": 0.3864, "val_loss": 1.8330891845703126}, {"step": 7800, "epoch": 22, "train_loss": 1.385786771774292}, {"step": 8000, "epoch": 22, "train_loss": 1.2793265581130981}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3876, "eval_loss": 1.8138976806640625, "val_acc": 0.3876, "val_loss": 1.8138976806640625}, {"step": 8200, "epoch": 23, "train_loss": 1.1240808963775635}, {"step": 8400, "epoch": 23, "train_loss": 1.2807129621505737}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.392, "eval_loss": 1.8204913818359374, "val_acc": 0.392, "val_loss": 1.8204913818359374}, {"step": 8600, "epoch": 24, "train_loss": 1.1727039813995361}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3862, "eval_loss": 1.8511544189453124, "val_acc": 0.3862, "val_loss": 1.8511544189453124}], "final": {"eval_split": "validation", "eval_acc": 0.3862, "eval_loss": 1.8511544189453124, "wall_s": 37.33476114273071, "val_acc": 0.3862, "val_loss": 1.8511544189453124}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0.json b/results/depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0.json new file mode 100644 index 0000000..7549a76 --- /dev/null +++ b/results/depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 8, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d8_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.600351333618164}, {"step": 200, "epoch": 0, "train_loss": 1.7608060836791992}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.331, "eval_loss": 1.89740234375, "val_acc": 0.331, "val_loss": 1.89740234375}, {"step": 400, "epoch": 1, "train_loss": 1.7457090616226196}, {"step": 600, "epoch": 1, "train_loss": 1.7250763177871704}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3472, "eval_loss": 1.87708076171875, "val_acc": 0.3472, "val_loss": 1.87708076171875}, {"step": 800, "epoch": 2, "train_loss": 1.6624048948287964}, {"step": 1000, "epoch": 2, "train_loss": 1.7809312343597412}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3576, "eval_loss": 1.8494482177734375, "val_acc": 0.3576, "val_loss": 1.8494482177734375}, {"step": 1200, "epoch": 3, "train_loss": 1.5753974914550781}, {"step": 1400, "epoch": 3, "train_loss": 1.5667771100997925}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3568, "eval_loss": 1.8406751220703126, "val_acc": 0.3568, "val_loss": 1.8406751220703126}, {"step": 1600, "epoch": 4, "train_loss": 1.6137046813964844}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.372, "eval_loss": 1.8091213623046876, "val_acc": 0.372, "val_loss": 1.8091213623046876}, {"step": 1800, "epoch": 5, "train_loss": 1.7945579290390015}, {"step": 2000, "epoch": 5, "train_loss": 1.566240906715393}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3716, "eval_loss": 1.7866246337890626, "val_acc": 0.3716, "val_loss": 1.7866246337890626}, {"step": 2200, "epoch": 6, "train_loss": 1.534356951713562}, {"step": 2400, "epoch": 6, "train_loss": 1.512060523033142}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3768, "eval_loss": 1.784936767578125, "val_acc": 0.3768, "val_loss": 1.784936767578125}, {"step": 2600, "epoch": 7, "train_loss": 1.5933821201324463}, {"step": 2800, "epoch": 7, "train_loss": 1.6559200286865234}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3792, "eval_loss": 1.7693947998046875, "val_acc": 0.3792, "val_loss": 1.7693947998046875}, {"step": 3000, "epoch": 8, "train_loss": 1.5288678407669067}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3858, "eval_loss": 1.7760865234375, "val_acc": 0.3858, "val_loss": 1.7760865234375}, {"step": 3200, "epoch": 9, "train_loss": 1.5052134990692139}, {"step": 3400, "epoch": 9, "train_loss": 1.4993115663528442}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3836, "eval_loss": 1.7761372314453125, "val_acc": 0.3836, "val_loss": 1.7761372314453125}, {"step": 3600, "epoch": 10, "train_loss": 1.3986375331878662}, {"step": 3800, "epoch": 10, "train_loss": 1.369816780090332}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3814, "eval_loss": 1.7722346923828125, "val_acc": 0.3814, "val_loss": 1.7722346923828125}, {"step": 4000, "epoch": 11, "train_loss": 1.483936071395874}, {"step": 4200, "epoch": 11, "train_loss": 1.575093150138855}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.3954, "eval_loss": 1.7554138671875, "val_acc": 0.3954, "val_loss": 1.7554138671875}, {"step": 4400, "epoch": 12, "train_loss": 1.622323989868164}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.378, "eval_loss": 1.7892219970703125, "val_acc": 0.378, "val_loss": 1.7892219970703125}, {"step": 4600, "epoch": 13, "train_loss": 1.2166309356689453}, {"step": 4800, "epoch": 13, "train_loss": 1.4594851732254028}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3846, "eval_loss": 1.7835304443359374, "val_acc": 0.3846, "val_loss": 1.7835304443359374}, {"step": 5000, "epoch": 14, "train_loss": 1.175580382347107}, {"step": 5200, "epoch": 14, "train_loss": 1.457786202430725}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3844, "eval_loss": 1.78108515625, "val_acc": 0.3844, "val_loss": 1.78108515625}, {"step": 5400, "epoch": 15, "train_loss": 1.6417378187179565}, {"step": 5600, "epoch": 15, "train_loss": 1.3701038360595703}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.3908, "eval_loss": 1.76001337890625, "val_acc": 0.3908, "val_loss": 1.76001337890625}, {"step": 5800, "epoch": 16, "train_loss": 1.2742304801940918}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3888, "eval_loss": 1.7802591064453126, "val_acc": 0.3888, "val_loss": 1.7802591064453126}, {"step": 6000, "epoch": 17, "train_loss": 1.2584271430969238}, {"step": 6200, "epoch": 17, "train_loss": 1.3066821098327637}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.3816, "eval_loss": 1.814546533203125, "val_acc": 0.3816, "val_loss": 1.814546533203125}, {"step": 6400, "epoch": 18, "train_loss": 1.1564587354660034}, {"step": 6600, "epoch": 18, "train_loss": 1.29982590675354}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.3882, "eval_loss": 1.8060728515625, "val_acc": 0.3882, "val_loss": 1.8060728515625}, {"step": 6800, "epoch": 19, "train_loss": 1.2510889768600464}, {"step": 7000, "epoch": 19, "train_loss": 1.2118326425552368}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.3902, "eval_loss": 1.8025027587890625, "val_acc": 0.3902, "val_loss": 1.8025027587890625}, {"step": 7200, "epoch": 20, "train_loss": 1.2556395530700684}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.3806, "eval_loss": 1.83795029296875, "val_acc": 0.3806, "val_loss": 1.83795029296875}, {"step": 7400, "epoch": 21, "train_loss": 1.0644207000732422}, {"step": 7600, "epoch": 21, "train_loss": 1.1828950643539429}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.3828, "eval_loss": 1.8515244873046874, "val_acc": 0.3828, "val_loss": 1.8515244873046874}, {"step": 7800, "epoch": 22, "train_loss": 1.3489990234375}, {"step": 8000, "epoch": 22, "train_loss": 1.2202485799789429}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.3836, "eval_loss": 1.8432701171875, "val_acc": 0.3836, "val_loss": 1.8432701171875}, {"step": 8200, "epoch": 23, "train_loss": 1.0749735832214355}, {"step": 8400, "epoch": 23, "train_loss": 1.3119491338729858}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.3826, "eval_loss": 1.8644279052734376, "val_acc": 0.3826, "val_loss": 1.8644279052734376}, {"step": 8600, "epoch": 24, "train_loss": 1.2155643701553345}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.3792, "eval_loss": 1.8842864990234376, "val_acc": 0.3792, "val_loss": 1.8842864990234376}], "final": {"eval_split": "validation", "eval_acc": 0.3792, "eval_loss": 1.8842864990234376, "wall_s": 42.9035120010376, "val_acc": 0.3792, "val_loss": 1.8842864990234376}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d12_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d12_t0_s0.json new file mode 100644 index 0000000..5312dc8 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d12_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 12, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d12_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.517413854598999}, {"step": 200, "epoch": 0, "train_loss": 0.9769093990325928}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5692, "eval_loss": 1.1378795654296876, "val_acc": 0.5692, "val_loss": 1.1378795654296876}, {"step": 400, "epoch": 1, "train_loss": 0.9296771883964539}, {"step": 600, "epoch": 1, "train_loss": 0.8773318529129028}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.581, "eval_loss": 1.1087588134765625, "val_acc": 0.581, "val_loss": 1.1087588134765625}, {"step": 800, "epoch": 2, "train_loss": 0.8861347436904907}, {"step": 1000, "epoch": 2, "train_loss": 0.9042978882789612}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.582, "eval_loss": 1.11873134765625, "val_acc": 0.582, "val_loss": 1.11873134765625}, {"step": 1200, "epoch": 3, "train_loss": 0.9459412693977356}, {"step": 1400, "epoch": 3, "train_loss": 1.064085841178894}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5866, "eval_loss": 1.120823095703125, "val_acc": 0.5866, "val_loss": 1.120823095703125}, {"step": 1600, "epoch": 4, "train_loss": 0.9249476790428162}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5834, "eval_loss": 1.11244638671875, "val_acc": 0.5834, "val_loss": 1.11244638671875}, {"step": 1800, "epoch": 5, "train_loss": 1.039158821105957}, {"step": 2000, "epoch": 5, "train_loss": 0.8265764713287354}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5856, "eval_loss": 1.1243849853515624, "val_acc": 0.5856, "val_loss": 1.1243849853515624}, {"step": 2200, "epoch": 6, "train_loss": 1.0884428024291992}, {"step": 2400, "epoch": 6, "train_loss": 0.8787632584571838}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5984, "eval_loss": 1.0845456909179687, "val_acc": 0.5984, "val_loss": 1.0845456909179687}, {"step": 2600, "epoch": 7, "train_loss": 0.9358597993850708}, {"step": 2800, "epoch": 7, "train_loss": 1.064014196395874}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5812, "eval_loss": 1.1327805419921875, "val_acc": 0.5812, "val_loss": 1.1327805419921875}, {"step": 3000, "epoch": 8, "train_loss": 0.9705671072006226}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.594, "eval_loss": 1.0957290405273437, "val_acc": 0.594, "val_loss": 1.0957290405273437}, {"step": 3200, "epoch": 9, "train_loss": 0.8985673785209656}, {"step": 3400, "epoch": 9, "train_loss": 0.8335405588150024}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5878, "eval_loss": 1.1013695068359375, "val_acc": 0.5878, "val_loss": 1.1013695068359375}, {"step": 3600, "epoch": 10, "train_loss": 0.977665901184082}, {"step": 3800, "epoch": 10, "train_loss": 0.8490504622459412}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.599, "eval_loss": 1.080225537109375, "val_acc": 0.599, "val_loss": 1.080225537109375}, {"step": 4000, "epoch": 11, "train_loss": 0.9312368035316467}, {"step": 4200, "epoch": 11, "train_loss": 1.0891715288162231}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5842, "eval_loss": 1.1082308471679687, "val_acc": 0.5842, "val_loss": 1.1082308471679687}, {"step": 4400, "epoch": 12, "train_loss": 0.9681256413459778}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5916, "eval_loss": 1.100140380859375, "val_acc": 0.5916, "val_loss": 1.100140380859375}, {"step": 4600, "epoch": 13, "train_loss": 1.093500018119812}, {"step": 4800, "epoch": 13, "train_loss": 0.9157226085662842}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.579, "eval_loss": 1.1225397705078124, "val_acc": 0.579, "val_loss": 1.1225397705078124}, {"step": 5000, "epoch": 14, "train_loss": 0.9541612267494202}, {"step": 5200, "epoch": 14, "train_loss": 0.9279407262802124}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5928, "eval_loss": 1.1008900390625, "val_acc": 0.5928, "val_loss": 1.1008900390625}, {"step": 5400, "epoch": 15, "train_loss": 0.9405715465545654}, {"step": 5600, "epoch": 15, "train_loss": 0.9940947890281677}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5884, "eval_loss": 1.1134339721679687, "val_acc": 0.5884, "val_loss": 1.1134339721679687}, {"step": 5800, "epoch": 16, "train_loss": 0.8996315598487854}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5968, "eval_loss": 1.0805838745117187, "val_acc": 0.5968, "val_loss": 1.0805838745117187}, {"step": 6000, "epoch": 17, "train_loss": 0.8689146637916565}, {"step": 6200, "epoch": 17, "train_loss": 0.8290905356407166}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5896, "eval_loss": 1.1009724853515626, "val_acc": 0.5896, "val_loss": 1.1009724853515626}, {"step": 6400, "epoch": 18, "train_loss": 1.0169360637664795}, {"step": 6600, "epoch": 18, "train_loss": 0.9826826453208923}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5866, "eval_loss": 1.1058596435546875, "val_acc": 0.5866, "val_loss": 1.1058596435546875}, {"step": 6800, "epoch": 19, "train_loss": 1.1044045686721802}, {"step": 7000, "epoch": 19, "train_loss": 0.7680770754814148}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5974, "eval_loss": 1.1014206298828124, "val_acc": 0.5974, "val_loss": 1.1014206298828124}, {"step": 7200, "epoch": 20, "train_loss": 0.9752224087715149}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5942, "eval_loss": 1.0939255859375, "val_acc": 0.5942, "val_loss": 1.0939255859375}, {"step": 7400, "epoch": 21, "train_loss": 1.0379060506820679}, {"step": 7600, "epoch": 21, "train_loss": 0.9451590180397034}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5904, "eval_loss": 1.0944151123046875, "val_acc": 0.5904, "val_loss": 1.0944151123046875}, {"step": 7800, "epoch": 22, "train_loss": 0.9887235760688782}, {"step": 8000, "epoch": 22, "train_loss": 0.893457293510437}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5916, "eval_loss": 1.1057144287109375, "val_acc": 0.5916, "val_loss": 1.1057144287109375}, {"step": 8200, "epoch": 23, "train_loss": 0.9537519216537476}, {"step": 8400, "epoch": 23, "train_loss": 0.9157257676124573}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5894, "eval_loss": 1.1086910278320312, "val_acc": 0.5894, "val_loss": 1.1086910278320312}, {"step": 8600, "epoch": 24, "train_loss": 0.8472723364830017}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5884, "eval_loss": 1.107358544921875, "val_acc": 0.5884, "val_loss": 1.107358544921875}], "final": {"eval_split": "validation", "eval_acc": 0.5884, "eval_loss": 1.107358544921875, "wall_s": 58.53278994560242, "val_acc": 0.5884, "val_loss": 1.107358544921875}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d1_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d1_t0_s0.json new file mode 100644 index 0000000..e7ba9b2 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d1_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 1, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d1_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.393876552581787}, {"step": 200, "epoch": 0, "train_loss": 1.0103332996368408}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5818, "eval_loss": 1.1113587158203124, "val_acc": 0.5818, "val_loss": 1.1113587158203124}, {"step": 400, "epoch": 1, "train_loss": 0.8591128587722778}, {"step": 600, "epoch": 1, "train_loss": 0.90489661693573}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5902, "eval_loss": 1.09662138671875, "val_acc": 0.5902, "val_loss": 1.09662138671875}, {"step": 800, "epoch": 2, "train_loss": 0.8954740166664124}, {"step": 1000, "epoch": 2, "train_loss": 0.8610763549804688}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5886, "eval_loss": 1.1042962646484376, "val_acc": 0.5886, "val_loss": 1.1042962646484376}, {"step": 1200, "epoch": 3, "train_loss": 1.0534071922302246}, {"step": 1400, "epoch": 3, "train_loss": 1.0942528247833252}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5898, "eval_loss": 1.121703271484375, "val_acc": 0.5898, "val_loss": 1.121703271484375}, {"step": 1600, "epoch": 4, "train_loss": 0.8067715764045715}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5914, "eval_loss": 1.10259443359375, "val_acc": 0.5914, "val_loss": 1.10259443359375}, {"step": 1800, "epoch": 5, "train_loss": 1.033132553100586}, {"step": 2000, "epoch": 5, "train_loss": 0.803702712059021}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5864, "eval_loss": 1.117203564453125, "val_acc": 0.5864, "val_loss": 1.117203564453125}, {"step": 2200, "epoch": 6, "train_loss": 1.0454679727554321}, {"step": 2400, "epoch": 6, "train_loss": 0.865119993686676}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5908, "eval_loss": 1.096959912109375, "val_acc": 0.5908, "val_loss": 1.096959912109375}, {"step": 2600, "epoch": 7, "train_loss": 0.9102245569229126}, {"step": 2800, "epoch": 7, "train_loss": 0.9988207817077637}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5786, "eval_loss": 1.129971337890625, "val_acc": 0.5786, "val_loss": 1.129971337890625}, {"step": 3000, "epoch": 8, "train_loss": 0.9479234218597412}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5908, "eval_loss": 1.1039165283203125, "val_acc": 0.5908, "val_loss": 1.1039165283203125}, {"step": 3200, "epoch": 9, "train_loss": 0.8889789581298828}, {"step": 3400, "epoch": 9, "train_loss": 0.8190938234329224}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5846, "eval_loss": 1.108134228515625, "val_acc": 0.5846, "val_loss": 1.108134228515625}, {"step": 3600, "epoch": 10, "train_loss": 0.9284778833389282}, {"step": 3800, "epoch": 10, "train_loss": 0.9862697720527649}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5986, "eval_loss": 1.0914903686523438, "val_acc": 0.5986, "val_loss": 1.0914903686523438}, {"step": 4000, "epoch": 11, "train_loss": 1.0149346590042114}, {"step": 4200, "epoch": 11, "train_loss": 1.0448325872421265}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5942, "eval_loss": 1.102526171875, "val_acc": 0.5942, "val_loss": 1.102526171875}, {"step": 4400, "epoch": 12, "train_loss": 0.9033969044685364}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5926, "eval_loss": 1.097378271484375, "val_acc": 0.5926, "val_loss": 1.097378271484375}, {"step": 4600, "epoch": 13, "train_loss": 1.0780540704727173}, {"step": 4800, "epoch": 13, "train_loss": 0.9211264848709106}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5846, "eval_loss": 1.1193604248046876, "val_acc": 0.5846, "val_loss": 1.1193604248046876}, {"step": 5000, "epoch": 14, "train_loss": 0.9996097087860107}, {"step": 5200, "epoch": 14, "train_loss": 0.9626591801643372}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5884, "eval_loss": 1.099669091796875, "val_acc": 0.5884, "val_loss": 1.099669091796875}, {"step": 5400, "epoch": 15, "train_loss": 1.048741340637207}, {"step": 5600, "epoch": 15, "train_loss": 0.9683579802513123}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5924, "eval_loss": 1.10992041015625, "val_acc": 0.5924, "val_loss": 1.10992041015625}, {"step": 5800, "epoch": 16, "train_loss": 0.988154411315918}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5918, "eval_loss": 1.091592236328125, "val_acc": 0.5918, "val_loss": 1.091592236328125}, {"step": 6000, "epoch": 17, "train_loss": 0.9127556681632996}, {"step": 6200, "epoch": 17, "train_loss": 0.9000439643859863}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5818, "eval_loss": 1.1109916748046875, "val_acc": 0.5818, "val_loss": 1.1109916748046875}, {"step": 6400, "epoch": 18, "train_loss": 1.0868996381759644}, {"step": 6600, "epoch": 18, "train_loss": 0.9564498662948608}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5918, "eval_loss": 1.1101337646484375, "val_acc": 0.5918, "val_loss": 1.1101337646484375}, {"step": 6800, "epoch": 19, "train_loss": 1.1510719060897827}, {"step": 7000, "epoch": 19, "train_loss": 0.809857189655304}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5962, "eval_loss": 1.0926285400390625, "val_acc": 0.5962, "val_loss": 1.0926285400390625}, {"step": 7200, "epoch": 20, "train_loss": 0.8911164402961731}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5942, "eval_loss": 1.094940185546875, "val_acc": 0.5942, "val_loss": 1.094940185546875}, {"step": 7400, "epoch": 21, "train_loss": 1.1491795778274536}, {"step": 7600, "epoch": 21, "train_loss": 0.9027130603790283}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5924, "eval_loss": 1.1105342041015624, "val_acc": 0.5924, "val_loss": 1.1105342041015624}, {"step": 7800, "epoch": 22, "train_loss": 0.9469124674797058}, {"step": 8000, "epoch": 22, "train_loss": 0.9074727892875671}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5928, "eval_loss": 1.0956957763671875, "val_acc": 0.5928, "val_loss": 1.0956957763671875}, {"step": 8200, "epoch": 23, "train_loss": 0.8933815360069275}, {"step": 8400, "epoch": 23, "train_loss": 0.9923908710479736}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5894, "eval_loss": 1.1095331787109375, "val_acc": 0.5894, "val_loss": 1.1095331787109375}, {"step": 8600, "epoch": 24, "train_loss": 0.7992337942123413}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5918, "eval_loss": 1.10451015625, "val_acc": 0.5918, "val_loss": 1.10451015625}], "final": {"eval_split": "validation", "eval_acc": 0.5918, "eval_loss": 1.10451015625, "wall_s": 12.920711278915405, "val_acc": 0.5918, "val_loss": 1.10451015625}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d2_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d2_t0_s0.json new file mode 100644 index 0000000..4b939a4 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d2_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 2, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d2_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.3527565002441406}, {"step": 200, "epoch": 0, "train_loss": 0.9289120435714722}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5702, "eval_loss": 1.142773486328125, "val_acc": 0.5702, "val_loss": 1.142773486328125}, {"step": 400, "epoch": 1, "train_loss": 0.8508673906326294}, {"step": 600, "epoch": 1, "train_loss": 0.8245355486869812}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.586, "eval_loss": 1.106931298828125, "val_acc": 0.586, "val_loss": 1.106931298828125}, {"step": 800, "epoch": 2, "train_loss": 0.8913167119026184}, {"step": 1000, "epoch": 2, "train_loss": 0.8256174325942993}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5864, "eval_loss": 1.122022705078125, "val_acc": 0.5864, "val_loss": 1.122022705078125}, {"step": 1200, "epoch": 3, "train_loss": 0.9590059518814087}, {"step": 1400, "epoch": 3, "train_loss": 1.1054637432098389}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5782, "eval_loss": 1.13520244140625, "val_acc": 0.5782, "val_loss": 1.13520244140625}, {"step": 1600, "epoch": 4, "train_loss": 0.9183905720710754}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5904, "eval_loss": 1.1116853759765626, "val_acc": 0.5904, "val_loss": 1.1116853759765626}, {"step": 1800, "epoch": 5, "train_loss": 0.9968322515487671}, {"step": 2000, "epoch": 5, "train_loss": 0.8338309526443481}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5792, "eval_loss": 1.1295319091796876, "val_acc": 0.5792, "val_loss": 1.1295319091796876}, {"step": 2200, "epoch": 6, "train_loss": 1.0942028760910034}, {"step": 2400, "epoch": 6, "train_loss": 0.8760504126548767}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.599, "eval_loss": 1.0858934814453125, "val_acc": 0.599, "val_loss": 1.0858934814453125}, {"step": 2600, "epoch": 7, "train_loss": 0.962939441204071}, {"step": 2800, "epoch": 7, "train_loss": 0.9768973588943481}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.583, "eval_loss": 1.13339775390625, "val_acc": 0.583, "val_loss": 1.13339775390625}, {"step": 3000, "epoch": 8, "train_loss": 0.9216310977935791}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5938, "eval_loss": 1.1107552490234376, "val_acc": 0.5938, "val_loss": 1.1107552490234376}, {"step": 3200, "epoch": 9, "train_loss": 0.9256529808044434}, {"step": 3400, "epoch": 9, "train_loss": 0.834572970867157}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5906, "eval_loss": 1.11136337890625, "val_acc": 0.5906, "val_loss": 1.11136337890625}, {"step": 3600, "epoch": 10, "train_loss": 0.9862117767333984}, {"step": 3800, "epoch": 10, "train_loss": 0.9779149293899536}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.594, "eval_loss": 1.0945914794921876, "val_acc": 0.594, "val_loss": 1.0945914794921876}, {"step": 4000, "epoch": 11, "train_loss": 0.984391987323761}, {"step": 4200, "epoch": 11, "train_loss": 1.0463182926177979}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5858, "eval_loss": 1.11790849609375, "val_acc": 0.5858, "val_loss": 1.11790849609375}, {"step": 4400, "epoch": 12, "train_loss": 0.8927826881408691}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5882, "eval_loss": 1.111215966796875, "val_acc": 0.5882, "val_loss": 1.111215966796875}, {"step": 4600, "epoch": 13, "train_loss": 1.0913441181182861}, {"step": 4800, "epoch": 13, "train_loss": 0.8871700167655945}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5878, "eval_loss": 1.119411083984375, "val_acc": 0.5878, "val_loss": 1.119411083984375}, {"step": 5000, "epoch": 14, "train_loss": 1.0868006944656372}, {"step": 5200, "epoch": 14, "train_loss": 1.0118368864059448}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5918, "eval_loss": 1.09024091796875, "val_acc": 0.5918, "val_loss": 1.09024091796875}, {"step": 5400, "epoch": 15, "train_loss": 1.0145263671875}, {"step": 5600, "epoch": 15, "train_loss": 0.9607892632484436}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.589, "eval_loss": 1.103532421875, "val_acc": 0.589, "val_loss": 1.103532421875}, {"step": 5800, "epoch": 16, "train_loss": 0.986981213092804}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.6032, "eval_loss": 1.0763969482421876, "val_acc": 0.6032, "val_loss": 1.0763969482421876}, {"step": 6000, "epoch": 17, "train_loss": 1.0223749876022339}, {"step": 6200, "epoch": 17, "train_loss": 0.8838664293289185}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.59, "eval_loss": 1.1092682861328125, "val_acc": 0.59, "val_loss": 1.1092682861328125}, {"step": 6400, "epoch": 18, "train_loss": 1.1250075101852417}, {"step": 6600, "epoch": 18, "train_loss": 0.897415041923523}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.6006, "eval_loss": 1.099941552734375, "val_acc": 0.6006, "val_loss": 1.099941552734375}, {"step": 6800, "epoch": 19, "train_loss": 1.1121262311935425}, {"step": 7000, "epoch": 19, "train_loss": 0.7941070795059204}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.6014, "eval_loss": 1.09330634765625, "val_acc": 0.6014, "val_loss": 1.09330634765625}, {"step": 7200, "epoch": 20, "train_loss": 0.835390567779541}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5932, "eval_loss": 1.1007385009765625, "val_acc": 0.5932, "val_loss": 1.1007385009765625}, {"step": 7400, "epoch": 21, "train_loss": 1.0114003419876099}, {"step": 7600, "epoch": 21, "train_loss": 0.957643985748291}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5958, "eval_loss": 1.09158408203125, "val_acc": 0.5958, "val_loss": 1.09158408203125}, {"step": 7800, "epoch": 22, "train_loss": 1.0202916860580444}, {"step": 8000, "epoch": 22, "train_loss": 0.8028672337532043}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0905138671875, "val_acc": 0.5936, "val_loss": 1.0905138671875}, {"step": 8200, "epoch": 23, "train_loss": 0.8601924777030945}, {"step": 8400, "epoch": 23, "train_loss": 0.9645736813545227}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.589, "eval_loss": 1.1072741943359374, "val_acc": 0.589, "val_loss": 1.1072741943359374}, {"step": 8600, "epoch": 24, "train_loss": 0.854410707950592}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0944353759765626, "val_acc": 0.5936, "val_loss": 1.0944353759765626}], "final": {"eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0944353759765626, "wall_s": 18.031754732131958, "val_acc": 0.5936, "val_loss": 1.0944353759765626}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d4_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d4_t0_s0.json new file mode 100644 index 0000000..edda59b --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d4_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 4, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d4_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4966790676116943}, {"step": 200, "epoch": 0, "train_loss": 0.9647588133811951}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5676, "eval_loss": 1.14811044921875, "val_acc": 0.5676, "val_loss": 1.14811044921875}, {"step": 400, "epoch": 1, "train_loss": 0.9004788398742676}, {"step": 600, "epoch": 1, "train_loss": 0.858989953994751}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5852, "eval_loss": 1.1066900390625, "val_acc": 0.5852, "val_loss": 1.1066900390625}, {"step": 800, "epoch": 2, "train_loss": 0.9216505289077759}, {"step": 1000, "epoch": 2, "train_loss": 0.7750069499015808}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5792, "eval_loss": 1.1309549072265626, "val_acc": 0.5792, "val_loss": 1.1309549072265626}, {"step": 1200, "epoch": 3, "train_loss": 0.97446608543396}, {"step": 1400, "epoch": 3, "train_loss": 1.0129777193069458}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5812, "eval_loss": 1.1271224853515625, "val_acc": 0.5812, "val_loss": 1.1271224853515625}, {"step": 1600, "epoch": 4, "train_loss": 0.8938019871711731}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5804, "eval_loss": 1.1166867919921875, "val_acc": 0.5804, "val_loss": 1.1166867919921875}, {"step": 1800, "epoch": 5, "train_loss": 1.0304168462753296}, {"step": 2000, "epoch": 5, "train_loss": 0.884192705154419}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5798, "eval_loss": 1.1317115966796876, "val_acc": 0.5798, "val_loss": 1.1317115966796876}, {"step": 2200, "epoch": 6, "train_loss": 1.0397288799285889}, {"step": 2400, "epoch": 6, "train_loss": 0.8639501929283142}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.593, "eval_loss": 1.085141796875, "val_acc": 0.593, "val_loss": 1.085141796875}, {"step": 2600, "epoch": 7, "train_loss": 0.9758634567260742}, {"step": 2800, "epoch": 7, "train_loss": 1.0234332084655762}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5758, "eval_loss": 1.1223146240234374, "val_acc": 0.5758, "val_loss": 1.1223146240234374}, {"step": 3000, "epoch": 8, "train_loss": 0.9471226334571838}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5852, "eval_loss": 1.096402392578125, "val_acc": 0.5852, "val_loss": 1.096402392578125}, {"step": 3200, "epoch": 9, "train_loss": 0.858224630355835}, {"step": 3400, "epoch": 9, "train_loss": 0.8620807528495789}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.58, "eval_loss": 1.116325390625, "val_acc": 0.58, "val_loss": 1.116325390625}, {"step": 3600, "epoch": 10, "train_loss": 0.9411643743515015}, {"step": 3800, "epoch": 10, "train_loss": 1.002820372581482}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5904, "eval_loss": 1.0973555908203125, "val_acc": 0.5904, "val_loss": 1.0973555908203125}, {"step": 4000, "epoch": 11, "train_loss": 0.8986897468566895}, {"step": 4200, "epoch": 11, "train_loss": 0.9725231528282166}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5848, "eval_loss": 1.1082283935546875, "val_acc": 0.5848, "val_loss": 1.1082283935546875}, {"step": 4400, "epoch": 12, "train_loss": 0.8426617980003357}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5868, "eval_loss": 1.1015863525390626, "val_acc": 0.5868, "val_loss": 1.1015863525390626}, {"step": 4600, "epoch": 13, "train_loss": 1.1166877746582031}, {"step": 4800, "epoch": 13, "train_loss": 0.9234418869018555}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5838, "eval_loss": 1.1126053955078126, "val_acc": 0.5838, "val_loss": 1.1126053955078126}, {"step": 5000, "epoch": 14, "train_loss": 1.0969547033309937}, {"step": 5200, "epoch": 14, "train_loss": 0.9123508930206299}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5834, "eval_loss": 1.0911812133789063, "val_acc": 0.5834, "val_loss": 1.0911812133789063}, {"step": 5400, "epoch": 15, "train_loss": 1.0123803615570068}, {"step": 5600, "epoch": 15, "train_loss": 0.852265477180481}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5892, "eval_loss": 1.102031005859375, "val_acc": 0.5892, "val_loss": 1.102031005859375}, {"step": 5800, "epoch": 16, "train_loss": 0.8970330953598022}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.6008, "eval_loss": 1.0820575073242187, "val_acc": 0.6008, "val_loss": 1.0820575073242187}, {"step": 6000, "epoch": 17, "train_loss": 0.8559246063232422}, {"step": 6200, "epoch": 17, "train_loss": 0.8634406924247742}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.58, "eval_loss": 1.111931103515625, "val_acc": 0.58, "val_loss": 1.111931103515625}, {"step": 6400, "epoch": 18, "train_loss": 1.0019081830978394}, {"step": 6600, "epoch": 18, "train_loss": 0.9256800413131714}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5932, "eval_loss": 1.087797021484375, "val_acc": 0.5932, "val_loss": 1.087797021484375}, {"step": 6800, "epoch": 19, "train_loss": 1.118901252746582}, {"step": 7000, "epoch": 19, "train_loss": 0.7939027547836304}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5904, "eval_loss": 1.089816748046875, "val_acc": 0.5904, "val_loss": 1.089816748046875}, {"step": 7200, "epoch": 20, "train_loss": 0.9085933566093445}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5858, "eval_loss": 1.090731396484375, "val_acc": 0.5858, "val_loss": 1.090731396484375}, {"step": 7400, "epoch": 21, "train_loss": 1.145005702972412}, {"step": 7600, "epoch": 21, "train_loss": 0.973916232585907}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5916, "eval_loss": 1.0808295043945313, "val_acc": 0.5916, "val_loss": 1.0808295043945313}, {"step": 7800, "epoch": 22, "train_loss": 0.9709288477897644}, {"step": 8000, "epoch": 22, "train_loss": 0.8602243661880493}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.592, "eval_loss": 1.0842331298828125, "val_acc": 0.592, "val_loss": 1.0842331298828125}, {"step": 8200, "epoch": 23, "train_loss": 0.9825401902198792}, {"step": 8400, "epoch": 23, "train_loss": 0.9386957287788391}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.585, "eval_loss": 1.0979935546875, "val_acc": 0.585, "val_loss": 1.0979935546875}, {"step": 8600, "epoch": 24, "train_loss": 0.8032169342041016}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0907277465820313, "val_acc": 0.5936, "val_loss": 1.0907277465820313}], "final": {"eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0907277465820313, "wall_s": 26.082186222076416, "val_acc": 0.5936, "val_loss": 1.0907277465820313}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d6_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d6_t0_s0.json new file mode 100644 index 0000000..fff5b52 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d6_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 6, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d6_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.660649061203003}, {"step": 200, "epoch": 0, "train_loss": 0.996557891368866}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5742, "eval_loss": 1.1206134765625, "val_acc": 0.5742, "val_loss": 1.1206134765625}, {"step": 400, "epoch": 1, "train_loss": 0.8633809685707092}, {"step": 600, "epoch": 1, "train_loss": 0.853786826133728}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5862, "eval_loss": 1.09737041015625, "val_acc": 0.5862, "val_loss": 1.09737041015625}, {"step": 800, "epoch": 2, "train_loss": 0.8752877712249756}, {"step": 1000, "epoch": 2, "train_loss": 0.8614870309829712}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5826, "eval_loss": 1.1256653564453125, "val_acc": 0.5826, "val_loss": 1.1256653564453125}, {"step": 1200, "epoch": 3, "train_loss": 0.9537748694419861}, {"step": 1400, "epoch": 3, "train_loss": 1.0066492557525635}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5828, "eval_loss": 1.1298255126953125, "val_acc": 0.5828, "val_loss": 1.1298255126953125}, {"step": 1600, "epoch": 4, "train_loss": 0.8712270259857178}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5826, "eval_loss": 1.1128714599609375, "val_acc": 0.5826, "val_loss": 1.1128714599609375}, {"step": 1800, "epoch": 5, "train_loss": 1.0536023378372192}, {"step": 2000, "epoch": 5, "train_loss": 0.8444521427154541}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5782, "eval_loss": 1.1357642822265626, "val_acc": 0.5782, "val_loss": 1.1357642822265626}, {"step": 2200, "epoch": 6, "train_loss": 1.0200448036193848}, {"step": 2400, "epoch": 6, "train_loss": 0.8217188715934753}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.09222138671875, "val_acc": 0.5936, "val_loss": 1.09222138671875}, {"step": 2600, "epoch": 7, "train_loss": 0.8908798694610596}, {"step": 2800, "epoch": 7, "train_loss": 1.0150463581085205}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.579, "eval_loss": 1.136682080078125, "val_acc": 0.579, "val_loss": 1.136682080078125}, {"step": 3000, "epoch": 8, "train_loss": 0.9362335801124573}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5864, "eval_loss": 1.1225859130859375, "val_acc": 0.5864, "val_loss": 1.1225859130859375}, {"step": 3200, "epoch": 9, "train_loss": 0.8840282559394836}, {"step": 3400, "epoch": 9, "train_loss": 0.8676167726516724}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5856, "eval_loss": 1.109516064453125, "val_acc": 0.5856, "val_loss": 1.109516064453125}, {"step": 3600, "epoch": 10, "train_loss": 0.9329383969306946}, {"step": 3800, "epoch": 10, "train_loss": 0.9458080530166626}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5974, "eval_loss": 1.0999067749023437, "val_acc": 0.5974, "val_loss": 1.0999067749023437}, {"step": 4000, "epoch": 11, "train_loss": 0.9005988240242004}, {"step": 4200, "epoch": 11, "train_loss": 1.045232892036438}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5816, "eval_loss": 1.134672412109375, "val_acc": 0.5816, "val_loss": 1.134672412109375}, {"step": 4400, "epoch": 12, "train_loss": 0.9206005930900574}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5906, "eval_loss": 1.1100499755859374, "val_acc": 0.5906, "val_loss": 1.1100499755859374}, {"step": 4600, "epoch": 13, "train_loss": 1.116690754890442}, {"step": 4800, "epoch": 13, "train_loss": 0.8835233449935913}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.586, "eval_loss": 1.13546455078125, "val_acc": 0.586, "val_loss": 1.13546455078125}, {"step": 5000, "epoch": 14, "train_loss": 1.0082675218582153}, {"step": 5200, "epoch": 14, "train_loss": 0.8944704532623291}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5874, "eval_loss": 1.1310967041015625, "val_acc": 0.5874, "val_loss": 1.1310967041015625}, {"step": 5400, "epoch": 15, "train_loss": 0.9900583028793335}, {"step": 5600, "epoch": 15, "train_loss": 1.0172821283340454}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5854, "eval_loss": 1.13110517578125, "val_acc": 0.5854, "val_loss": 1.13110517578125}, {"step": 5800, "epoch": 16, "train_loss": 0.9112899303436279}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.6012, "eval_loss": 1.101458935546875, "val_acc": 0.6012, "val_loss": 1.101458935546875}, {"step": 6000, "epoch": 17, "train_loss": 0.8773520588874817}, {"step": 6200, "epoch": 17, "train_loss": 0.8771717548370361}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5892, "eval_loss": 1.1259810546875, "val_acc": 0.5892, "val_loss": 1.1259810546875}, {"step": 6400, "epoch": 18, "train_loss": 1.0280790328979492}, {"step": 6600, "epoch": 18, "train_loss": 0.8629776835441589}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5904, "eval_loss": 1.1227839599609375, "val_acc": 0.5904, "val_loss": 1.1227839599609375}, {"step": 6800, "epoch": 19, "train_loss": 1.1421175003051758}, {"step": 7000, "epoch": 19, "train_loss": 0.8250914812088013}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5898, "eval_loss": 1.116978271484375, "val_acc": 0.5898, "val_loss": 1.116978271484375}, {"step": 7200, "epoch": 20, "train_loss": 0.9006116986274719}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5898, "eval_loss": 1.1075101440429687, "val_acc": 0.5898, "val_loss": 1.1075101440429687}, {"step": 7400, "epoch": 21, "train_loss": 0.9425082802772522}, {"step": 7600, "epoch": 21, "train_loss": 1.0669807195663452}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5824, "eval_loss": 1.128408251953125, "val_acc": 0.5824, "val_loss": 1.128408251953125}, {"step": 7800, "epoch": 22, "train_loss": 0.9231097102165222}, {"step": 8000, "epoch": 22, "train_loss": 0.8883748054504395}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.588, "eval_loss": 1.127149560546875, "val_acc": 0.588, "val_loss": 1.127149560546875}, {"step": 8200, "epoch": 23, "train_loss": 0.9372089505195618}, {"step": 8400, "epoch": 23, "train_loss": 1.0033732652664185}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5848, "eval_loss": 1.130660205078125, "val_acc": 0.5848, "val_loss": 1.130660205078125}, {"step": 8600, "epoch": 24, "train_loss": 0.7973468899726868}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5832, "eval_loss": 1.1286564453125, "val_acc": 0.5832, "val_loss": 1.1286564453125}], "final": {"eval_split": "validation", "eval_acc": 0.5832, "eval_loss": 1.1286564453125, "wall_s": 35.32112979888916, "val_acc": 0.5832, "val_loss": 1.1286564453125}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w16_d8_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w16_d8_t0_s0.json new file mode 100644 index 0000000..b71ed75 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w16_d8_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 8, "width": 16, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w16_d8_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4545867443084717}, {"step": 200, "epoch": 0, "train_loss": 0.9655951261520386}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5674, "eval_loss": 1.1627013671875, "val_acc": 0.5674, "val_loss": 1.1627013671875}, {"step": 400, "epoch": 1, "train_loss": 0.921790599822998}, {"step": 600, "epoch": 1, "train_loss": 0.81261146068573}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5892, "eval_loss": 1.12190517578125, "val_acc": 0.5892, "val_loss": 1.12190517578125}, {"step": 800, "epoch": 2, "train_loss": 0.8968669176101685}, {"step": 1000, "epoch": 2, "train_loss": 0.8287943601608276}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5836, "eval_loss": 1.1352845703125, "val_acc": 0.5836, "val_loss": 1.1352845703125}, {"step": 1200, "epoch": 3, "train_loss": 1.045316457748413}, {"step": 1400, "epoch": 3, "train_loss": 0.9924063682556152}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5778, "eval_loss": 1.1459072265625, "val_acc": 0.5778, "val_loss": 1.1459072265625}, {"step": 1600, "epoch": 4, "train_loss": 0.87221759557724}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5846, "eval_loss": 1.11298935546875, "val_acc": 0.5846, "val_loss": 1.11298935546875}, {"step": 1800, "epoch": 5, "train_loss": 0.983815610408783}, {"step": 2000, "epoch": 5, "train_loss": 0.8368768692016602}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5886, "eval_loss": 1.1216568359375, "val_acc": 0.5886, "val_loss": 1.1216568359375}, {"step": 2200, "epoch": 6, "train_loss": 1.0421881675720215}, {"step": 2400, "epoch": 6, "train_loss": 0.9238089323043823}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5902, "eval_loss": 1.093966552734375, "val_acc": 0.5902, "val_loss": 1.093966552734375}, {"step": 2600, "epoch": 7, "train_loss": 0.9274234175682068}, {"step": 2800, "epoch": 7, "train_loss": 0.9723529815673828}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.59, "eval_loss": 1.1151231201171874, "val_acc": 0.59, "val_loss": 1.1151231201171874}, {"step": 3000, "epoch": 8, "train_loss": 0.9794726371765137}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5872, "eval_loss": 1.1117497314453124, "val_acc": 0.5872, "val_loss": 1.1117497314453124}, {"step": 3200, "epoch": 9, "train_loss": 0.7986926436424255}, {"step": 3400, "epoch": 9, "train_loss": 0.7764381766319275}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5902, "eval_loss": 1.1044780029296875, "val_acc": 0.5902, "val_loss": 1.1044780029296875}, {"step": 3600, "epoch": 10, "train_loss": 0.9259852766990662}, {"step": 3800, "epoch": 10, "train_loss": 0.939167320728302}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.586, "eval_loss": 1.1029083984375, "val_acc": 0.586, "val_loss": 1.1029083984375}, {"step": 4000, "epoch": 11, "train_loss": 0.9145900011062622}, {"step": 4200, "epoch": 11, "train_loss": 1.0672698020935059}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.581, "eval_loss": 1.123863525390625, "val_acc": 0.581, "val_loss": 1.123863525390625}, {"step": 4400, "epoch": 12, "train_loss": 0.8724120259284973}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.0961650390625, "val_acc": 0.5936, "val_loss": 1.0961650390625}, {"step": 4600, "epoch": 13, "train_loss": 0.9762986898422241}, {"step": 4800, "epoch": 13, "train_loss": 0.9933286905288696}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5746, "eval_loss": 1.128486279296875, "val_acc": 0.5746, "val_loss": 1.128486279296875}, {"step": 5000, "epoch": 14, "train_loss": 0.9770033955574036}, {"step": 5200, "epoch": 14, "train_loss": 0.7995492815971375}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.588, "eval_loss": 1.1073376220703126, "val_acc": 0.588, "val_loss": 1.1073376220703126}, {"step": 5400, "epoch": 15, "train_loss": 0.9432471394538879}, {"step": 5600, "epoch": 15, "train_loss": 0.9147461652755737}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5764, "eval_loss": 1.13014189453125, "val_acc": 0.5764, "val_loss": 1.13014189453125}, {"step": 5800, "epoch": 16, "train_loss": 0.9600958228111267}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5874, "eval_loss": 1.09278125, "val_acc": 0.5874, "val_loss": 1.09278125}, {"step": 6000, "epoch": 17, "train_loss": 0.9386426210403442}, {"step": 6200, "epoch": 17, "train_loss": 0.8959528803825378}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5846, "eval_loss": 1.1262297607421874, "val_acc": 0.5846, "val_loss": 1.1262297607421874}, {"step": 6400, "epoch": 18, "train_loss": 1.0170623064041138}, {"step": 6600, "epoch": 18, "train_loss": 0.9944022297859192}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.578, "eval_loss": 1.1140205810546875, "val_acc": 0.578, "val_loss": 1.1140205810546875}, {"step": 6800, "epoch": 19, "train_loss": 1.1006981134414673}, {"step": 7000, "epoch": 19, "train_loss": 0.8122886419296265}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5838, "eval_loss": 1.1186203857421875, "val_acc": 0.5838, "val_loss": 1.1186203857421875}, {"step": 7200, "epoch": 20, "train_loss": 0.7818880081176758}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5844, "eval_loss": 1.1130032958984375, "val_acc": 0.5844, "val_loss": 1.1130032958984375}, {"step": 7400, "epoch": 21, "train_loss": 1.0730682611465454}, {"step": 7600, "epoch": 21, "train_loss": 0.9104151725769043}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5846, "eval_loss": 1.11394580078125, "val_acc": 0.5846, "val_loss": 1.11394580078125}, {"step": 7800, "epoch": 22, "train_loss": 0.9913809299468994}, {"step": 8000, "epoch": 22, "train_loss": 0.7919666171073914}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5766, "eval_loss": 1.12707822265625, "val_acc": 0.5766, "val_loss": 1.12707822265625}, {"step": 8200, "epoch": 23, "train_loss": 0.9503212571144104}, {"step": 8400, "epoch": 23, "train_loss": 0.8721488118171692}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5784, "eval_loss": 1.129735498046875, "val_acc": 0.5784, "val_loss": 1.129735498046875}, {"step": 8600, "epoch": 24, "train_loss": 0.7976495027542114}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5818, "eval_loss": 1.1297189208984375, "val_acc": 0.5818, "val_loss": 1.1297189208984375}], "final": {"eval_split": "validation", "eval_acc": 0.5818, "eval_loss": 1.1297189208984375, "wall_s": 41.0548882484436, "val_acc": 0.5818, "val_loss": 1.1297189208984375}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d12_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d12_t0_s0.json new file mode 100644 index 0000000..c5a5a4a --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d12_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 12, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d12_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4617087841033936}, {"step": 200, "epoch": 0, "train_loss": 0.902694821357727}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.6118, "eval_loss": 1.03099111328125, "val_acc": 0.6118, "val_loss": 1.03099111328125}, {"step": 400, "epoch": 1, "train_loss": 0.7640933990478516}, {"step": 600, "epoch": 1, "train_loss": 0.7631095051765442}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.6158, "eval_loss": 1.0279851928710937, "val_acc": 0.6158, "val_loss": 1.0279851928710937}, {"step": 800, "epoch": 2, "train_loss": 0.6875019073486328}, {"step": 1000, "epoch": 2, "train_loss": 0.7486509680747986}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6082, "eval_loss": 1.0466720336914062, "val_acc": 0.6082, "val_loss": 1.0466720336914062}, {"step": 1200, "epoch": 3, "train_loss": 0.8495298624038696}, {"step": 1400, "epoch": 3, "train_loss": 0.9343891143798828}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6126, "eval_loss": 1.0547455078125, "val_acc": 0.6126, "val_loss": 1.0547455078125}, {"step": 1600, "epoch": 4, "train_loss": 0.7209277153015137}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6168, "eval_loss": 1.0449613891601564, "val_acc": 0.6168, "val_loss": 1.0449613891601564}, {"step": 1800, "epoch": 5, "train_loss": 0.7454065084457397}, {"step": 2000, "epoch": 5, "train_loss": 0.6858469843864441}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.608, "eval_loss": 1.076257861328125, "val_acc": 0.608, "val_loss": 1.076257861328125}, {"step": 2200, "epoch": 6, "train_loss": 0.8187124729156494}, {"step": 2400, "epoch": 6, "train_loss": 0.6559977531433105}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.624, "eval_loss": 1.0495591796875, "val_acc": 0.624, "val_loss": 1.0495591796875}, {"step": 2600, "epoch": 7, "train_loss": 0.7761538624763489}, {"step": 2800, "epoch": 7, "train_loss": 0.7890281081199646}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5998, "eval_loss": 1.1207243408203125, "val_acc": 0.5998, "val_loss": 1.1207243408203125}, {"step": 3000, "epoch": 8, "train_loss": 0.6752810478210449}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6138, "eval_loss": 1.09807646484375, "val_acc": 0.6138, "val_loss": 1.09807646484375}, {"step": 3200, "epoch": 9, "train_loss": 0.6439822316169739}, {"step": 3400, "epoch": 9, "train_loss": 0.6429063081741333}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.6086, "eval_loss": 1.1253881591796875, "val_acc": 0.6086, "val_loss": 1.1253881591796875}, {"step": 3600, "epoch": 10, "train_loss": 0.5866493582725525}, {"step": 3800, "epoch": 10, "train_loss": 0.6085690259933472}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.6132, "eval_loss": 1.1205505859375, "val_acc": 0.6132, "val_loss": 1.1205505859375}, {"step": 4000, "epoch": 11, "train_loss": 0.6126564145088196}, {"step": 4200, "epoch": 11, "train_loss": 0.8024030923843384}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.6018, "eval_loss": 1.17735126953125, "val_acc": 0.6018, "val_loss": 1.17735126953125}, {"step": 4400, "epoch": 12, "train_loss": 0.633552074432373}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.6066, "eval_loss": 1.1778637451171876, "val_acc": 0.6066, "val_loss": 1.1778637451171876}, {"step": 4600, "epoch": 13, "train_loss": 0.6782782077789307}, {"step": 4800, "epoch": 13, "train_loss": 0.61345374584198}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.6028, "eval_loss": 1.2229530029296876, "val_acc": 0.6028, "val_loss": 1.2229530029296876}, {"step": 5000, "epoch": 14, "train_loss": 0.5067461133003235}, {"step": 5200, "epoch": 14, "train_loss": 0.5135768055915833}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5984, "eval_loss": 1.246344970703125, "val_acc": 0.5984, "val_loss": 1.246344970703125}, {"step": 5400, "epoch": 15, "train_loss": 0.5423197150230408}, {"step": 5600, "epoch": 15, "train_loss": 0.5771681666374207}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.59, "eval_loss": 1.292396142578125, "val_acc": 0.59, "val_loss": 1.292396142578125}, {"step": 5800, "epoch": 16, "train_loss": 0.5234283804893494}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5934, "eval_loss": 1.297881494140625, "val_acc": 0.5934, "val_loss": 1.297881494140625}, {"step": 6000, "epoch": 17, "train_loss": 0.6049938797950745}, {"step": 6200, "epoch": 17, "train_loss": 0.5433491468429565}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.582, "eval_loss": 1.3660036865234375, "val_acc": 0.582, "val_loss": 1.3660036865234375}, {"step": 6400, "epoch": 18, "train_loss": 0.38602903485298157}, {"step": 6600, "epoch": 18, "train_loss": 0.4970954656600952}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5854, "eval_loss": 1.3779427978515626, "val_acc": 0.5854, "val_loss": 1.3779427978515626}, {"step": 6800, "epoch": 19, "train_loss": 0.5171346068382263}, {"step": 7000, "epoch": 19, "train_loss": 0.30657118558883667}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5748, "eval_loss": 1.439207568359375, "val_acc": 0.5748, "val_loss": 1.439207568359375}, {"step": 7200, "epoch": 20, "train_loss": 0.4765183925628662}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.583, "eval_loss": 1.4810153076171875, "val_acc": 0.583, "val_loss": 1.4810153076171875}, {"step": 7400, "epoch": 21, "train_loss": 0.5005311965942383}, {"step": 7600, "epoch": 21, "train_loss": 0.3740580976009369}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5828, "eval_loss": 1.5324156494140626, "val_acc": 0.5828, "val_loss": 1.5324156494140626}, {"step": 7800, "epoch": 22, "train_loss": 0.38728761672973633}, {"step": 8000, "epoch": 22, "train_loss": 0.3829094469547272}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5746, "eval_loss": 1.6113326904296874, "val_acc": 0.5746, "val_loss": 1.6113326904296874}, {"step": 8200, "epoch": 23, "train_loss": 0.2806970477104187}, {"step": 8400, "epoch": 23, "train_loss": 0.4131513237953186}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5686, "eval_loss": 1.6380853759765626, "val_acc": 0.5686, "val_loss": 1.6380853759765626}, {"step": 8600, "epoch": 24, "train_loss": 0.2939942479133606}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5702, "eval_loss": 1.6876431396484375, "val_acc": 0.5702, "val_loss": 1.6876431396484375}], "final": {"eval_split": "validation", "eval_acc": 0.5702, "eval_loss": 1.6876431396484375, "wall_s": 57.20587205886841, "val_acc": 0.5702, "val_loss": 1.6876431396484375}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d1_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d1_t0_s0.json new file mode 100644 index 0000000..3d1911e --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d1_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 1, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d1_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5311508178710938}, {"step": 200, "epoch": 0, "train_loss": 0.840945303440094}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.6182, "eval_loss": 0.9919363891601563, "val_acc": 0.6182, "val_loss": 0.9919363891601563}, {"step": 400, "epoch": 1, "train_loss": 0.733540415763855}, {"step": 600, "epoch": 1, "train_loss": 0.6970023512840271}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.6232, "eval_loss": 0.9807604614257812, "val_acc": 0.6232, "val_loss": 0.9807604614257812}, {"step": 800, "epoch": 2, "train_loss": 0.75431889295578}, {"step": 1000, "epoch": 2, "train_loss": 0.7388406991958618}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6266, "eval_loss": 0.98731865234375, "val_acc": 0.6266, "val_loss": 0.98731865234375}, {"step": 1200, "epoch": 3, "train_loss": 0.9076403379440308}, {"step": 1400, "epoch": 3, "train_loss": 0.903896152973175}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6198, "eval_loss": 1.0177142333984375, "val_acc": 0.6198, "val_loss": 1.0177142333984375}, {"step": 1600, "epoch": 4, "train_loss": 0.7635146975517273}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6228, "eval_loss": 1.001775341796875, "val_acc": 0.6228, "val_loss": 1.001775341796875}, {"step": 1800, "epoch": 5, "train_loss": 0.7955314517021179}, {"step": 2000, "epoch": 5, "train_loss": 0.6706668734550476}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.6208, "eval_loss": 1.0371079345703125, "val_acc": 0.6208, "val_loss": 1.0371079345703125}, {"step": 2200, "epoch": 6, "train_loss": 0.9078772664070129}, {"step": 2400, "epoch": 6, "train_loss": 0.6533659100532532}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.6208, "eval_loss": 1.0158447021484376, "val_acc": 0.6208, "val_loss": 1.0158447021484376}, {"step": 2600, "epoch": 7, "train_loss": 0.7211366891860962}, {"step": 2800, "epoch": 7, "train_loss": 0.9030142426490784}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.6134, "eval_loss": 1.0586219482421875, "val_acc": 0.6134, "val_loss": 1.0586219482421875}, {"step": 3000, "epoch": 8, "train_loss": 0.7051634788513184}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6198, "eval_loss": 1.05035625, "val_acc": 0.6198, "val_loss": 1.05035625}, {"step": 3200, "epoch": 9, "train_loss": 0.762702465057373}, {"step": 3400, "epoch": 9, "train_loss": 0.6346777081489563}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.6146, "eval_loss": 1.06519990234375, "val_acc": 0.6146, "val_loss": 1.06519990234375}, {"step": 3600, "epoch": 10, "train_loss": 0.6924629807472229}, {"step": 3800, "epoch": 10, "train_loss": 0.7348305583000183}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.6242, "eval_loss": 1.0611874755859374, "val_acc": 0.6242, "val_loss": 1.0611874755859374}, {"step": 4000, "epoch": 11, "train_loss": 0.7039048075675964}, {"step": 4200, "epoch": 11, "train_loss": 0.7568634748458862}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.6134, "eval_loss": 1.087744970703125, "val_acc": 0.6134, "val_loss": 1.087744970703125}, {"step": 4400, "epoch": 12, "train_loss": 0.6606151461601257}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.6156, "eval_loss": 1.0904285400390625, "val_acc": 0.6156, "val_loss": 1.0904285400390625}, {"step": 4600, "epoch": 13, "train_loss": 0.778768002986908}, {"step": 4800, "epoch": 13, "train_loss": 0.7155106067657471}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.6082, "eval_loss": 1.10935302734375, "val_acc": 0.6082, "val_loss": 1.10935302734375}, {"step": 5000, "epoch": 14, "train_loss": 0.7357832789421082}, {"step": 5200, "epoch": 14, "train_loss": 0.6756934523582458}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.6104, "eval_loss": 1.1120667236328126, "val_acc": 0.6104, "val_loss": 1.1120667236328126}, {"step": 5400, "epoch": 15, "train_loss": 0.7333395481109619}, {"step": 5600, "epoch": 15, "train_loss": 0.6376401782035828}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.6106, "eval_loss": 1.119081591796875, "val_acc": 0.6106, "val_loss": 1.119081591796875}, {"step": 5800, "epoch": 16, "train_loss": 0.6608338356018066}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.614, "eval_loss": 1.1165087646484375, "val_acc": 0.614, "val_loss": 1.1165087646484375}, {"step": 6000, "epoch": 17, "train_loss": 0.6254558563232422}, {"step": 6200, "epoch": 17, "train_loss": 0.6748548746109009}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.6048, "eval_loss": 1.14111865234375, "val_acc": 0.6048, "val_loss": 1.14111865234375}, {"step": 6400, "epoch": 18, "train_loss": 0.8265315294265747}, {"step": 6600, "epoch": 18, "train_loss": 0.6702396273612976}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.6044, "eval_loss": 1.1536258056640625, "val_acc": 0.6044, "val_loss": 1.1536258056640625}, {"step": 6800, "epoch": 19, "train_loss": 0.7251787781715393}, {"step": 7000, "epoch": 19, "train_loss": 0.5752092599868774}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.6072, "eval_loss": 1.14927880859375, "val_acc": 0.6072, "val_loss": 1.14927880859375}, {"step": 7200, "epoch": 20, "train_loss": 0.659776508808136}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.6094, "eval_loss": 1.1541574462890625, "val_acc": 0.6094, "val_loss": 1.1541574462890625}, {"step": 7400, "epoch": 21, "train_loss": 0.7678269743919373}, {"step": 7600, "epoch": 21, "train_loss": 0.6077974438667297}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.605, "eval_loss": 1.1698632568359375, "val_acc": 0.605, "val_loss": 1.1698632568359375}, {"step": 7800, "epoch": 22, "train_loss": 0.7145333290100098}, {"step": 8000, "epoch": 22, "train_loss": 0.4914296269416809}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.6026, "eval_loss": 1.1691294677734374, "val_acc": 0.6026, "val_loss": 1.1691294677734374}, {"step": 8200, "epoch": 23, "train_loss": 0.5936515927314758}, {"step": 8400, "epoch": 23, "train_loss": 0.6333053112030029}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.6008, "eval_loss": 1.1842491943359374, "val_acc": 0.6008, "val_loss": 1.1842491943359374}, {"step": 8600, "epoch": 24, "train_loss": 0.5887580513954163}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.6006, "eval_loss": 1.206232275390625, "val_acc": 0.6006, "val_loss": 1.206232275390625}], "final": {"eval_split": "validation", "eval_acc": 0.6006, "eval_loss": 1.206232275390625, "wall_s": 12.816138744354248, "val_acc": 0.6006, "val_loss": 1.206232275390625}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d2_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d2_t0_s0.json new file mode 100644 index 0000000..597cb55 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d2_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 2, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d2_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5378835201263428}, {"step": 200, "epoch": 0, "train_loss": 0.8362271785736084}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.6174, "eval_loss": 0.9981978393554688, "val_acc": 0.6174, "val_loss": 0.9981978393554688}, {"step": 400, "epoch": 1, "train_loss": 0.7236090302467346}, {"step": 600, "epoch": 1, "train_loss": 0.732539713382721}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.6244, "eval_loss": 0.99426201171875, "val_acc": 0.6244, "val_loss": 0.99426201171875}, {"step": 800, "epoch": 2, "train_loss": 0.7037859559059143}, {"step": 1000, "epoch": 2, "train_loss": 0.7181667685508728}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6252, "eval_loss": 0.9997278076171875, "val_acc": 0.6252, "val_loss": 0.9997278076171875}, {"step": 1200, "epoch": 3, "train_loss": 0.8484516143798828}, {"step": 1400, "epoch": 3, "train_loss": 0.9854567646980286}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6178, "eval_loss": 1.0343426635742188, "val_acc": 0.6178, "val_loss": 1.0343426635742188}, {"step": 1600, "epoch": 4, "train_loss": 0.7158283591270447}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6178, "eval_loss": 1.0126439208984375, "val_acc": 0.6178, "val_loss": 1.0126439208984375}, {"step": 1800, "epoch": 5, "train_loss": 0.7714849710464478}, {"step": 2000, "epoch": 5, "train_loss": 0.6831921339035034}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.6112, "eval_loss": 1.0534729370117188, "val_acc": 0.6112, "val_loss": 1.0534729370117188}, {"step": 2200, "epoch": 6, "train_loss": 0.8236176371574402}, {"step": 2400, "epoch": 6, "train_loss": 0.759265124797821}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.6262, "eval_loss": 1.0188918823242188, "val_acc": 0.6262, "val_loss": 1.0188918823242188}, {"step": 2600, "epoch": 7, "train_loss": 0.7377707362174988}, {"step": 2800, "epoch": 7, "train_loss": 0.9144394993782043}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.6066, "eval_loss": 1.08231669921875, "val_acc": 0.6066, "val_loss": 1.08231669921875}, {"step": 3000, "epoch": 8, "train_loss": 0.6569148302078247}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6148, "eval_loss": 1.0635174560546874, "val_acc": 0.6148, "val_loss": 1.0635174560546874}, {"step": 3200, "epoch": 9, "train_loss": 0.602764904499054}, {"step": 3400, "epoch": 9, "train_loss": 0.569445013999939}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.604, "eval_loss": 1.086694580078125, "val_acc": 0.604, "val_loss": 1.086694580078125}, {"step": 3600, "epoch": 10, "train_loss": 0.64704430103302}, {"step": 3800, "epoch": 10, "train_loss": 0.778519332408905}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.6044, "eval_loss": 1.0840155883789062, "val_acc": 0.6044, "val_loss": 1.0840155883789062}, {"step": 4000, "epoch": 11, "train_loss": 0.6884896755218506}, {"step": 4200, "epoch": 11, "train_loss": 0.8264381885528564}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.6038, "eval_loss": 1.1155463134765624, "val_acc": 0.6038, "val_loss": 1.1155463134765624}, {"step": 4400, "epoch": 12, "train_loss": 0.6245763301849365}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.6066, "eval_loss": 1.111953564453125, "val_acc": 0.6066, "val_loss": 1.111953564453125}, {"step": 4600, "epoch": 13, "train_loss": 0.7497974634170532}, {"step": 4800, "epoch": 13, "train_loss": 0.6287288665771484}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.6014, "eval_loss": 1.157133251953125, "val_acc": 0.6014, "val_loss": 1.157133251953125}, {"step": 5000, "epoch": 14, "train_loss": 0.6910437345504761}, {"step": 5200, "epoch": 14, "train_loss": 0.6045576930046082}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.602, "eval_loss": 1.143605908203125, "val_acc": 0.602, "val_loss": 1.143605908203125}, {"step": 5400, "epoch": 15, "train_loss": 0.704504132270813}, {"step": 5600, "epoch": 15, "train_loss": 0.7717189788818359}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5932, "eval_loss": 1.188294921875, "val_acc": 0.5932, "val_loss": 1.188294921875}, {"step": 5800, "epoch": 16, "train_loss": 0.6528366208076477}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5992, "eval_loss": 1.1741950439453126, "val_acc": 0.5992, "val_loss": 1.1741950439453126}, {"step": 6000, "epoch": 17, "train_loss": 0.6485159397125244}, {"step": 6200, "epoch": 17, "train_loss": 0.582676887512207}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5962, "eval_loss": 1.2025969482421874, "val_acc": 0.5962, "val_loss": 1.2025969482421874}, {"step": 6400, "epoch": 18, "train_loss": 0.7955219149589539}, {"step": 6600, "epoch": 18, "train_loss": 0.6003790497779846}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5924, "eval_loss": 1.214786328125, "val_acc": 0.5924, "val_loss": 1.214786328125}, {"step": 6800, "epoch": 19, "train_loss": 0.8257665634155273}, {"step": 7000, "epoch": 19, "train_loss": 0.4760558009147644}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5956, "eval_loss": 1.2264597900390626, "val_acc": 0.5956, "val_loss": 1.2264597900390626}, {"step": 7200, "epoch": 20, "train_loss": 0.5883042216300964}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5892, "eval_loss": 1.2485189697265624, "val_acc": 0.5892, "val_loss": 1.2485189697265624}, {"step": 7400, "epoch": 21, "train_loss": 0.6486283540725708}, {"step": 7600, "epoch": 21, "train_loss": 0.551514744758606}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5868, "eval_loss": 1.2586528076171875, "val_acc": 0.5868, "val_loss": 1.2586528076171875}, {"step": 7800, "epoch": 22, "train_loss": 0.6804865598678589}, {"step": 8000, "epoch": 22, "train_loss": 0.5737948417663574}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5838, "eval_loss": 1.274739111328125, "val_acc": 0.5838, "val_loss": 1.274739111328125}, {"step": 8200, "epoch": 23, "train_loss": 0.4766664505004883}, {"step": 8400, "epoch": 23, "train_loss": 0.7162339091300964}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5796, "eval_loss": 1.299013330078125, "val_acc": 0.5796, "val_loss": 1.299013330078125}, {"step": 8600, "epoch": 24, "train_loss": 0.48768115043640137}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5794, "eval_loss": 1.30275439453125, "val_acc": 0.5794, "val_loss": 1.30275439453125}], "final": {"eval_split": "validation", "eval_acc": 0.5794, "eval_loss": 1.30275439453125, "wall_s": 18.107185125350952, "val_acc": 0.5794, "val_loss": 1.30275439453125}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d4_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d4_t0_s0.json new file mode 100644 index 0000000..cdda2d2 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d4_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 4, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d4_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4882280826568604}, {"step": 200, "epoch": 0, "train_loss": 0.9054072499275208}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.6162, "eval_loss": 1.0237540161132812, "val_acc": 0.6162, "val_loss": 1.0237540161132812}, {"step": 400, "epoch": 1, "train_loss": 0.7456945180892944}, {"step": 600, "epoch": 1, "train_loss": 0.7214746475219727}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.6178, "eval_loss": 1.0069253051757812, "val_acc": 0.6178, "val_loss": 1.0069253051757812}, {"step": 800, "epoch": 2, "train_loss": 0.7784503698348999}, {"step": 1000, "epoch": 2, "train_loss": 0.7319915890693665}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6192, "eval_loss": 1.0175387329101562, "val_acc": 0.6192, "val_loss": 1.0175387329101562}, {"step": 1200, "epoch": 3, "train_loss": 0.8478718400001526}, {"step": 1400, "epoch": 3, "train_loss": 0.9292729496955872}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6124, "eval_loss": 1.0385492553710938, "val_acc": 0.6124, "val_loss": 1.0385492553710938}, {"step": 1600, "epoch": 4, "train_loss": 0.6804534792900085}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6198, "eval_loss": 1.0237674072265626, "val_acc": 0.6198, "val_loss": 1.0237674072265626}, {"step": 1800, "epoch": 5, "train_loss": 0.7726636528968811}, {"step": 2000, "epoch": 5, "train_loss": 0.6768437027931213}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.6182, "eval_loss": 1.0602895385742188, "val_acc": 0.6182, "val_loss": 1.0602895385742188}, {"step": 2200, "epoch": 6, "train_loss": 0.7809285521507263}, {"step": 2400, "epoch": 6, "train_loss": 0.7038103342056274}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.6186, "eval_loss": 1.0337721313476562, "val_acc": 0.6186, "val_loss": 1.0337721313476562}, {"step": 2600, "epoch": 7, "train_loss": 0.7057100534439087}, {"step": 2800, "epoch": 7, "train_loss": 0.891932487487793}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.6074, "eval_loss": 1.0968569091796876, "val_acc": 0.6074, "val_loss": 1.0968569091796876}, {"step": 3000, "epoch": 8, "train_loss": 0.7323035597801208}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6156, "eval_loss": 1.0815179443359375, "val_acc": 0.6156, "val_loss": 1.0815179443359375}, {"step": 3200, "epoch": 9, "train_loss": 0.6907006502151489}, {"step": 3400, "epoch": 9, "train_loss": 0.7368860244750977}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.6042, "eval_loss": 1.1099479736328124, "val_acc": 0.6042, "val_loss": 1.1099479736328124}, {"step": 3600, "epoch": 10, "train_loss": 0.6811631321907043}, {"step": 3800, "epoch": 10, "train_loss": 0.6820284724235535}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.6106, "eval_loss": 1.102748095703125, "val_acc": 0.6106, "val_loss": 1.102748095703125}, {"step": 4000, "epoch": 11, "train_loss": 0.6430980563163757}, {"step": 4200, "epoch": 11, "train_loss": 0.7353668212890625}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5954, "eval_loss": 1.1535440673828126, "val_acc": 0.5954, "val_loss": 1.1535440673828126}, {"step": 4400, "epoch": 12, "train_loss": 0.6156095266342163}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.599, "eval_loss": 1.14924482421875, "val_acc": 0.599, "val_loss": 1.14924482421875}, {"step": 4600, "epoch": 13, "train_loss": 0.696312427520752}, {"step": 4800, "epoch": 13, "train_loss": 0.6119407415390015}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5936, "eval_loss": 1.1916462890625, "val_acc": 0.5936, "val_loss": 1.1916462890625}, {"step": 5000, "epoch": 14, "train_loss": 0.6664527058601379}, {"step": 5200, "epoch": 14, "train_loss": 0.5013567209243774}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5924, "eval_loss": 1.209540234375, "val_acc": 0.5924, "val_loss": 1.209540234375}, {"step": 5400, "epoch": 15, "train_loss": 0.653146505355835}, {"step": 5600, "epoch": 15, "train_loss": 0.5721628665924072}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5892, "eval_loss": 1.232269873046875, "val_acc": 0.5892, "val_loss": 1.232269873046875}, {"step": 5800, "epoch": 16, "train_loss": 0.604249119758606}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5996, "eval_loss": 1.2246965087890624, "val_acc": 0.5996, "val_loss": 1.2246965087890624}, {"step": 6000, "epoch": 17, "train_loss": 0.6022902131080627}, {"step": 6200, "epoch": 17, "train_loss": 0.6290896534919739}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5898, "eval_loss": 1.2786100830078124, "val_acc": 0.5898, "val_loss": 1.2786100830078124}, {"step": 6400, "epoch": 18, "train_loss": 0.5739793181419373}, {"step": 6600, "epoch": 18, "train_loss": 0.5909854769706726}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5836, "eval_loss": 1.2779569091796874, "val_acc": 0.5836, "val_loss": 1.2779569091796874}, {"step": 6800, "epoch": 19, "train_loss": 0.5921121835708618}, {"step": 7000, "epoch": 19, "train_loss": 0.4734802544116974}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.585, "eval_loss": 1.2972416015625, "val_acc": 0.585, "val_loss": 1.2972416015625}, {"step": 7200, "epoch": 20, "train_loss": 0.5883579254150391}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5826, "eval_loss": 1.3348498779296876, "val_acc": 0.5826, "val_loss": 1.3348498779296876}, {"step": 7400, "epoch": 21, "train_loss": 0.5489111542701721}, {"step": 7600, "epoch": 21, "train_loss": 0.5122550129890442}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5814, "eval_loss": 1.3466891845703124, "val_acc": 0.5814, "val_loss": 1.3466891845703124}, {"step": 7800, "epoch": 22, "train_loss": 0.5395210981369019}, {"step": 8000, "epoch": 22, "train_loss": 0.5577489137649536}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5816, "eval_loss": 1.371901025390625, "val_acc": 0.5816, "val_loss": 1.371901025390625}, {"step": 8200, "epoch": 23, "train_loss": 0.4875646233558655}, {"step": 8400, "epoch": 23, "train_loss": 0.6638826727867126}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5766, "eval_loss": 1.4083632568359374, "val_acc": 0.5766, "val_loss": 1.4083632568359374}, {"step": 8600, "epoch": 24, "train_loss": 0.3843157887458801}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5738, "eval_loss": 1.431485693359375, "val_acc": 0.5738, "val_loss": 1.431485693359375}], "final": {"eval_split": "validation", "eval_acc": 0.5738, "eval_loss": 1.431485693359375, "wall_s": 26.39419412612915, "val_acc": 0.5738, "val_loss": 1.431485693359375}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d6_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d6_t0_s0.json new file mode 100644 index 0000000..5420c68 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d6_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 6, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d6_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6210927963256836}, {"step": 200, "epoch": 0, "train_loss": 0.8622533679008484}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.612, "eval_loss": 1.0252984497070312, "val_acc": 0.612, "val_loss": 1.0252984497070312}, {"step": 400, "epoch": 1, "train_loss": 0.77760910987854}, {"step": 600, "epoch": 1, "train_loss": 0.7434456944465637}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.6186, "eval_loss": 1.0156798828125, "val_acc": 0.6186, "val_loss": 1.0156798828125}, {"step": 800, "epoch": 2, "train_loss": 0.7321397662162781}, {"step": 1000, "epoch": 2, "train_loss": 0.7317296862602234}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6136, "eval_loss": 1.0229468505859376, "val_acc": 0.6136, "val_loss": 1.0229468505859376}, {"step": 1200, "epoch": 3, "train_loss": 0.8721165657043457}, {"step": 1400, "epoch": 3, "train_loss": 0.9030106067657471}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6102, "eval_loss": 1.0437629760742186, "val_acc": 0.6102, "val_loss": 1.0437629760742186}, {"step": 1600, "epoch": 4, "train_loss": 0.727023720741272}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6184, "eval_loss": 1.0310751220703125, "val_acc": 0.6184, "val_loss": 1.0310751220703125}, {"step": 1800, "epoch": 5, "train_loss": 0.797160267829895}, {"step": 2000, "epoch": 5, "train_loss": 0.6620596051216125}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.6126, "eval_loss": 1.0606338989257813, "val_acc": 0.6126, "val_loss": 1.0606338989257813}, {"step": 2200, "epoch": 6, "train_loss": 0.8294033408164978}, {"step": 2400, "epoch": 6, "train_loss": 0.6756864786148071}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.62, "eval_loss": 1.0471800903320312, "val_acc": 0.62, "val_loss": 1.0471800903320312}, {"step": 2600, "epoch": 7, "train_loss": 0.7365713119506836}, {"step": 2800, "epoch": 7, "train_loss": 0.8060657978057861}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.604, "eval_loss": 1.102895166015625, "val_acc": 0.604, "val_loss": 1.102895166015625}, {"step": 3000, "epoch": 8, "train_loss": 0.6958932280540466}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6106, "eval_loss": 1.0889811767578126, "val_acc": 0.6106, "val_loss": 1.0889811767578126}, {"step": 3200, "epoch": 9, "train_loss": 0.6129227876663208}, {"step": 3400, "epoch": 9, "train_loss": 0.5703102946281433}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.611, "eval_loss": 1.1095732177734374, "val_acc": 0.611, "val_loss": 1.1095732177734374}, {"step": 3600, "epoch": 10, "train_loss": 0.6207870841026306}, {"step": 3800, "epoch": 10, "train_loss": 0.692367672920227}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.611, "eval_loss": 1.11912265625, "val_acc": 0.611, "val_loss": 1.11912265625}, {"step": 4000, "epoch": 11, "train_loss": 0.7206392288208008}, {"step": 4200, "epoch": 11, "train_loss": 0.6902603507041931}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.6044, "eval_loss": 1.167743212890625, "val_acc": 0.6044, "val_loss": 1.167743212890625}, {"step": 4400, "epoch": 12, "train_loss": 0.5203877091407776}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.6016, "eval_loss": 1.1713595458984376, "val_acc": 0.6016, "val_loss": 1.1713595458984376}, {"step": 4600, "epoch": 13, "train_loss": 0.650784969329834}, {"step": 4800, "epoch": 13, "train_loss": 0.560661792755127}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5876, "eval_loss": 1.2254881103515625, "val_acc": 0.5876, "val_loss": 1.2254881103515625}, {"step": 5000, "epoch": 14, "train_loss": 0.6800820231437683}, {"step": 5200, "epoch": 14, "train_loss": 0.5899974703788757}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5984, "eval_loss": 1.2158177978515625, "val_acc": 0.5984, "val_loss": 1.2158177978515625}, {"step": 5400, "epoch": 15, "train_loss": 0.6280472278594971}, {"step": 5600, "epoch": 15, "train_loss": 0.6516405344009399}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5912, "eval_loss": 1.249712353515625, "val_acc": 0.5912, "val_loss": 1.249712353515625}, {"step": 5800, "epoch": 16, "train_loss": 0.6372895836830139}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5978, "eval_loss": 1.2696236328125, "val_acc": 0.5978, "val_loss": 1.2696236328125}, {"step": 6000, "epoch": 17, "train_loss": 0.5179353952407837}, {"step": 6200, "epoch": 17, "train_loss": 0.5249927639961243}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5928, "eval_loss": 1.3020653076171875, "val_acc": 0.5928, "val_loss": 1.3020653076171875}, {"step": 6400, "epoch": 18, "train_loss": 0.6160680055618286}, {"step": 6600, "epoch": 18, "train_loss": 0.6579370498657227}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5894, "eval_loss": 1.3265169921875, "val_acc": 0.5894, "val_loss": 1.3265169921875}, {"step": 6800, "epoch": 19, "train_loss": 0.6454458236694336}, {"step": 7000, "epoch": 19, "train_loss": 0.39317917823791504}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5888, "eval_loss": 1.3616431640625, "val_acc": 0.5888, "val_loss": 1.3616431640625}, {"step": 7200, "epoch": 20, "train_loss": 0.5328649282455444}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5848, "eval_loss": 1.401586328125, "val_acc": 0.5848, "val_loss": 1.401586328125}, {"step": 7400, "epoch": 21, "train_loss": 0.5527584552764893}, {"step": 7600, "epoch": 21, "train_loss": 0.4882585108280182}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5864, "eval_loss": 1.4212303955078125, "val_acc": 0.5864, "val_loss": 1.4212303955078125}, {"step": 7800, "epoch": 22, "train_loss": 0.4863404631614685}, {"step": 8000, "epoch": 22, "train_loss": 0.4108026623725891}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5756, "eval_loss": 1.483331103515625, "val_acc": 0.5756, "val_loss": 1.483331103515625}, {"step": 8200, "epoch": 23, "train_loss": 0.392582505941391}, {"step": 8400, "epoch": 23, "train_loss": 0.616544783115387}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5834, "eval_loss": 1.49861015625, "val_acc": 0.5834, "val_loss": 1.49861015625}, {"step": 8600, "epoch": 24, "train_loss": 0.4344726800918579}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5714, "eval_loss": 1.5335162353515626, "val_acc": 0.5714, "val_loss": 1.5335162353515626}], "final": {"eval_split": "validation", "eval_acc": 0.5714, "eval_loss": 1.5335162353515626, "wall_s": 35.77094578742981, "val_acc": 0.5714, "val_loss": 1.5335162353515626}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_teacher_bp_w64_d8_t0_s0.json b/results/depthtask_dev_v1_teacher_bp_w64_d8_t0_s0.json new file mode 100644 index 0000000..da06d88 --- /dev/null +++ b/results/depthtask_dev_v1_teacher_bp_w64_d8_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "teacher", "depth": 8, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_teacher_bp_w64_d8_t0_s0", "n_in": 128, "n_out": 10}, "split": {"dataset": "teacher", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "0ec30707a69784626a2d17128e5408bb8a8a8964e2ea753ef8e54b35ffb36355", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.564910411834717}, {"step": 200, "epoch": 0, "train_loss": 0.9054244756698608}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.6184, "eval_loss": 1.0137853515625, "val_acc": 0.6184, "val_loss": 1.0137853515625}, {"step": 400, "epoch": 1, "train_loss": 0.7534605264663696}, {"step": 600, "epoch": 1, "train_loss": 0.7791372537612915}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.616, "eval_loss": 1.0175526611328125, "val_acc": 0.616, "val_loss": 1.0175526611328125}, {"step": 800, "epoch": 2, "train_loss": 0.7227439284324646}, {"step": 1000, "epoch": 2, "train_loss": 0.7281097769737244}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.6092, "eval_loss": 1.0258677368164062, "val_acc": 0.6092, "val_loss": 1.0258677368164062}, {"step": 1200, "epoch": 3, "train_loss": 0.8531402349472046}, {"step": 1400, "epoch": 3, "train_loss": 0.8890358209609985}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.6096, "eval_loss": 1.0535975341796875, "val_acc": 0.6096, "val_loss": 1.0535975341796875}, {"step": 1600, "epoch": 4, "train_loss": 0.6758511662483215}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.6186, "eval_loss": 1.0217825439453125, "val_acc": 0.6186, "val_loss": 1.0217825439453125}, {"step": 1800, "epoch": 5, "train_loss": 0.784747838973999}, {"step": 2000, "epoch": 5, "train_loss": 0.6705027222633362}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.608, "eval_loss": 1.0609456176757812, "val_acc": 0.608, "val_loss": 1.0609456176757812}, {"step": 2200, "epoch": 6, "train_loss": 0.7481552958488464}, {"step": 2400, "epoch": 6, "train_loss": 0.6858530044555664}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.6126, "eval_loss": 1.0318828491210938, "val_acc": 0.6126, "val_loss": 1.0318828491210938}, {"step": 2600, "epoch": 7, "train_loss": 0.7171128392219543}, {"step": 2800, "epoch": 7, "train_loss": 0.7544036507606506}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.6042, "eval_loss": 1.1035579833984375, "val_acc": 0.6042, "val_loss": 1.1035579833984375}, {"step": 3000, "epoch": 8, "train_loss": 0.7477214932441711}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.6062, "eval_loss": 1.0809581787109375, "val_acc": 0.6062, "val_loss": 1.0809581787109375}, {"step": 3200, "epoch": 9, "train_loss": 0.6675366163253784}, {"step": 3400, "epoch": 9, "train_loss": 0.5769951343536377}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.6004, "eval_loss": 1.1271369873046875, "val_acc": 0.6004, "val_loss": 1.1271369873046875}, {"step": 3600, "epoch": 10, "train_loss": 0.5943953990936279}, {"step": 3800, "epoch": 10, "train_loss": 0.6529951095581055}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.6064, "eval_loss": 1.1046400146484374, "val_acc": 0.6064, "val_loss": 1.1046400146484374}, {"step": 4000, "epoch": 11, "train_loss": 0.6365727186203003}, {"step": 4200, "epoch": 11, "train_loss": 0.733120858669281}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.601, "eval_loss": 1.1599071044921876, "val_acc": 0.601, "val_loss": 1.1599071044921876}, {"step": 4400, "epoch": 12, "train_loss": 0.6451032161712646}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.6016, "eval_loss": 1.1620322021484375, "val_acc": 0.6016, "val_loss": 1.1620322021484375}, {"step": 4600, "epoch": 13, "train_loss": 0.6921226978302002}, {"step": 4800, "epoch": 13, "train_loss": 0.5964938998222351}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5942, "eval_loss": 1.1940201171875, "val_acc": 0.5942, "val_loss": 1.1940201171875}, {"step": 5000, "epoch": 14, "train_loss": 0.5242152214050293}, {"step": 5200, "epoch": 14, "train_loss": 0.6223666667938232}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5888, "eval_loss": 1.2247827880859374, "val_acc": 0.5888, "val_loss": 1.2247827880859374}, {"step": 5400, "epoch": 15, "train_loss": 0.6306442022323608}, {"step": 5600, "epoch": 15, "train_loss": 0.5820850729942322}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5844, "eval_loss": 1.2776964111328124, "val_acc": 0.5844, "val_loss": 1.2776964111328124}, {"step": 5800, "epoch": 16, "train_loss": 0.4614133834838867}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.593, "eval_loss": 1.2561759765625, "val_acc": 0.593, "val_loss": 1.2561759765625}, {"step": 6000, "epoch": 17, "train_loss": 0.6130412220954895}, {"step": 6200, "epoch": 17, "train_loss": 0.6101951003074646}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5792, "eval_loss": 1.3334126953125, "val_acc": 0.5792, "val_loss": 1.3334126953125}, {"step": 6400, "epoch": 18, "train_loss": 0.5869726538658142}, {"step": 6600, "epoch": 18, "train_loss": 0.5814520716667175}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5816, "eval_loss": 1.334586962890625, "val_acc": 0.5816, "val_loss": 1.334586962890625}, {"step": 6800, "epoch": 19, "train_loss": 0.5441330671310425}, {"step": 7000, "epoch": 19, "train_loss": 0.3414742052555084}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5872, "eval_loss": 1.3782404296875, "val_acc": 0.5872, "val_loss": 1.3782404296875}, {"step": 7200, "epoch": 20, "train_loss": 0.44521811604499817}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5802, "eval_loss": 1.4049444580078125, "val_acc": 0.5802, "val_loss": 1.4049444580078125}, {"step": 7400, "epoch": 21, "train_loss": 0.5824435353279114}, {"step": 7600, "epoch": 21, "train_loss": 0.37066158652305603}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5776, "eval_loss": 1.4556610595703126, "val_acc": 0.5776, "val_loss": 1.4556610595703126}, {"step": 7800, "epoch": 22, "train_loss": 0.39698153734207153}, {"step": 8000, "epoch": 22, "train_loss": 0.3983050584793091}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5746, "eval_loss": 1.49265849609375, "val_acc": 0.5746, "val_loss": 1.49265849609375}, {"step": 8200, "epoch": 23, "train_loss": 0.32650813460350037}, {"step": 8400, "epoch": 23, "train_loss": 0.48107656836509705}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5676, "eval_loss": 1.5484889892578124, "val_acc": 0.5676, "val_loss": 1.5484889892578124}, {"step": 8600, "epoch": 24, "train_loss": 0.3155350387096405}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5674, "eval_loss": 1.574935498046875, "val_acc": 0.5674, "val_loss": 1.574935498046875}], "final": {"eval_split": "validation", "eval_acc": 0.5674, "eval_loss": 1.574935498046875, "wall_s": 43.34907793998718, "val_acc": 0.5674, "val_loss": 1.574935498046875}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0.json new file mode 100644 index 0000000..6352a34 --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 12, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d12_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.6930825710296631}, {"step": 200, "epoch": 0, "train_loss": 0.6938381791114807}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931531005859375, "val_acc": 0.5, "val_loss": 0.6931531005859375}, {"step": 400, "epoch": 1, "train_loss": 0.6926819086074829}, {"step": 600, "epoch": 1, "train_loss": 0.6931769847869873}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931669311523437, "val_acc": 0.5, "val_loss": 0.6931669311523437}, {"step": 800, "epoch": 2, "train_loss": 0.6925782561302185}, {"step": 1000, "epoch": 2, "train_loss": 0.6941807866096497}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931544311523438, "val_acc": 0.5, "val_loss": 0.6931544311523438}, {"step": 1200, "epoch": 3, "train_loss": 0.6932147741317749}, {"step": 1400, "epoch": 3, "train_loss": 0.6932030916213989}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931945556640625, "val_acc": 0.5, "val_loss": 0.6931945556640625}, {"step": 1600, "epoch": 4, "train_loss": 0.6930280327796936}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933091186523438, "val_acc": 0.5, "val_loss": 0.6933091186523438}, {"step": 1800, "epoch": 5, "train_loss": 0.692607045173645}, {"step": 2000, "epoch": 5, "train_loss": 0.6932975053787231}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933172973632813, "val_acc": 0.5, "val_loss": 0.6933172973632813}, {"step": 2200, "epoch": 6, "train_loss": 0.6937260031700134}, {"step": 2400, "epoch": 6, "train_loss": 0.6948747634887695}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931823486328125, "val_acc": 0.5, "val_loss": 0.6931823486328125}, {"step": 2600, "epoch": 7, "train_loss": 0.6933664679527283}, {"step": 2800, "epoch": 7, "train_loss": 0.6931474804878235}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931917602539063, "val_acc": 0.5, "val_loss": 0.6931917602539063}, {"step": 3000, "epoch": 8, "train_loss": 0.6913998126983643}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693229736328125, "val_acc": 0.5, "val_loss": 0.693229736328125}, {"step": 3200, "epoch": 9, "train_loss": 0.697612464427948}, {"step": 3400, "epoch": 9, "train_loss": 0.6939010620117188}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932556518554688, "val_acc": 0.5, "val_loss": 0.6932556518554688}, {"step": 3600, "epoch": 10, "train_loss": 0.6927855014801025}, {"step": 3800, "epoch": 10, "train_loss": 0.6943454742431641}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69319423828125, "val_acc": 0.5, "val_loss": 0.69319423828125}, {"step": 4000, "epoch": 11, "train_loss": 0.6909392476081848}, {"step": 4200, "epoch": 11, "train_loss": 0.6942079663276672}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933954956054688, "val_acc": 0.5, "val_loss": 0.6933954956054688}, {"step": 4400, "epoch": 12, "train_loss": 0.6931478977203369}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932764770507812, "val_acc": 0.5, "val_loss": 0.6932764770507812}, {"step": 4600, "epoch": 13, "train_loss": 0.6924095749855042}, {"step": 4800, "epoch": 13, "train_loss": 0.6935188174247742}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932409790039062, "val_acc": 0.5, "val_loss": 0.6932409790039062}, {"step": 5000, "epoch": 14, "train_loss": 0.6938604712486267}, {"step": 5200, "epoch": 14, "train_loss": 0.6906082034111023}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931619018554688, "val_acc": 0.5, "val_loss": 0.6931619018554688}, {"step": 5400, "epoch": 15, "train_loss": 0.6930281519889832}, {"step": 5600, "epoch": 15, "train_loss": 0.6928437352180481}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931508911132812, "val_acc": 0.5, "val_loss": 0.6931508911132812}, {"step": 5800, "epoch": 16, "train_loss": 0.6918275952339172}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932150756835938, "val_acc": 0.5, "val_loss": 0.6932150756835938}, {"step": 6000, "epoch": 17, "train_loss": 0.6927527189254761}, {"step": 6200, "epoch": 17, "train_loss": 0.6930550336837769}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932824584960937, "val_acc": 0.5, "val_loss": 0.6932824584960937}, {"step": 6400, "epoch": 18, "train_loss": 0.6927084922790527}, {"step": 6600, "epoch": 18, "train_loss": 0.6926276683807373}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6934605224609375, "val_acc": 0.5, "val_loss": 0.6934605224609375}, {"step": 6800, "epoch": 19, "train_loss": 0.6931626200675964}, {"step": 7000, "epoch": 19, "train_loss": 0.6941932439804077}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932431640625, "val_acc": 0.5, "val_loss": 0.6932431640625}, {"step": 7200, "epoch": 20, "train_loss": 0.6931239366531372}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931667358398438, "val_acc": 0.5, "val_loss": 0.6931667358398438}, {"step": 7400, "epoch": 21, "train_loss": 0.6931486129760742}, {"step": 7600, "epoch": 21, "train_loss": 0.6912513971328735}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693173779296875, "val_acc": 0.5, "val_loss": 0.693173779296875}, {"step": 7800, "epoch": 22, "train_loss": 0.6928568482398987}, {"step": 8000, "epoch": 22, "train_loss": 0.6926016807556152}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693434326171875, "val_acc": 0.5, "val_loss": 0.693434326171875}, {"step": 8200, "epoch": 23, "train_loss": 0.6905764937400818}, {"step": 8400, "epoch": 23, "train_loss": 0.693047285079956}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931752807617187, "val_acc": 0.5, "val_loss": 0.6931752807617187}, {"step": 8600, "epoch": 24, "train_loss": 0.6939669847488403}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6937800170898437, "val_acc": 0.5, "val_loss": 0.6937800170898437}, {"step": 8800, "epoch": 25, "train_loss": 0.6915557384490967}, {"step": 9000, "epoch": 25, "train_loss": 0.6919586658477783}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6940059326171875, "val_acc": 0.5, "val_loss": 0.6940059326171875}, {"step": 9200, "epoch": 26, "train_loss": 0.6947410106658936}, {"step": 9400, "epoch": 26, "train_loss": 0.6924943327903748}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932072021484375, "val_acc": 0.5, "val_loss": 0.6932072021484375}, {"step": 9600, "epoch": 27, "train_loss": 0.6933077573776245}, {"step": 9800, "epoch": 27, "train_loss": 0.6919479370117188}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931978515625, "val_acc": 0.5, "val_loss": 0.6931978515625}, {"step": 10000, "epoch": 28, "train_loss": 0.6930237412452698}, {"step": 10200, "epoch": 28, "train_loss": 0.6942576766014099}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931475708007813, "val_acc": 0.5, "val_loss": 0.6931475708007813}, {"step": 10400, "epoch": 29, "train_loss": 0.6928622722625732}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931646728515625, "val_acc": 0.5, "val_loss": 0.6931646728515625}, {"step": 10600, "epoch": 30, "train_loss": 0.6964982748031616}, {"step": 10800, "epoch": 30, "train_loss": 0.7022808194160461}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931561889648438, "val_acc": 0.5, "val_loss": 0.6931561889648438}, {"step": 11000, "epoch": 31, "train_loss": 0.6962814331054688}, {"step": 11200, "epoch": 31, "train_loss": 0.6930593252182007}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69413857421875, "val_acc": 0.5, "val_loss": 0.69413857421875}, {"step": 11400, "epoch": 32, "train_loss": 0.6911011338233948}, {"step": 11600, "epoch": 32, "train_loss": 0.6936676502227783}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69334921875, "val_acc": 0.5, "val_loss": 0.69334921875}, {"step": 11800, "epoch": 33, "train_loss": 0.68876713514328}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933681396484375, "val_acc": 0.5, "val_loss": 0.6933681396484375}, {"step": 12000, "epoch": 34, "train_loss": 0.6938066482543945}, {"step": 12200, "epoch": 34, "train_loss": 0.693248450756073}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693290234375, "val_acc": 0.5, "val_loss": 0.693290234375}, {"step": 12400, "epoch": 35, "train_loss": 0.6956208348274231}, {"step": 12600, "epoch": 35, "train_loss": 0.6932070255279541}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6934223999023438, "val_acc": 0.5, "val_loss": 0.6934223999023438}, {"step": 12800, "epoch": 36, "train_loss": 0.6957260966300964}, {"step": 13000, "epoch": 36, "train_loss": 0.6920433640480042}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69317412109375, "val_acc": 0.5, "val_loss": 0.69317412109375}, {"step": 13200, "epoch": 37, "train_loss": 0.6919190287590027}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932241577148438, "val_acc": 0.5, "val_loss": 0.6932241577148438}, {"step": 13400, "epoch": 38, "train_loss": 0.6928016543388367}, {"step": 13600, "epoch": 38, "train_loss": 0.6936776638031006}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931553833007813, "val_acc": 0.5, "val_loss": 0.6931553833007813}, {"step": 13800, "epoch": 39, "train_loss": 0.6939064860343933}, {"step": 14000, "epoch": 39, "train_loss": 0.6943252086639404}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931608764648437, "val_acc": 0.5, "val_loss": 0.6931608764648437}], "final": {"eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931608764648437, "wall_s": 77.23110818862915, "val_acc": 0.5, "val_loss": 0.6931608764648437}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0.json new file mode 100644 index 0000000..d42d4f8 --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 1, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d1_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.703719437122345}, {"step": 200, "epoch": 0, "train_loss": 0.6960983872413635}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.499, "eval_loss": 0.6955363525390625, "val_acc": 0.499, "val_loss": 0.6955363525390625}, {"step": 400, "epoch": 1, "train_loss": 0.6928220987319946}, {"step": 600, "epoch": 1, "train_loss": 0.6938133835792542}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.4994, "eval_loss": 0.6933939331054687, "val_acc": 0.4994, "val_loss": 0.6933939331054687}, {"step": 800, "epoch": 2, "train_loss": 0.693915843963623}, {"step": 1000, "epoch": 2, "train_loss": 0.6944924592971802}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6951395385742187, "val_acc": 0.5, "val_loss": 0.6951395385742187}, {"step": 1200, "epoch": 3, "train_loss": 0.6921833753585815}, {"step": 1400, "epoch": 3, "train_loss": 0.699383556842804}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5022, "eval_loss": 0.694149853515625, "val_acc": 0.5022, "val_loss": 0.694149853515625}, {"step": 1600, "epoch": 4, "train_loss": 0.694177508354187}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6979835571289063, "val_acc": 0.5, "val_loss": 0.6979835571289063}, {"step": 1800, "epoch": 5, "train_loss": 0.702458381652832}, {"step": 2000, "epoch": 5, "train_loss": 0.6914790868759155}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.503, "eval_loss": 0.6939902954101562, "val_acc": 0.503, "val_loss": 0.6939902954101562}, {"step": 2200, "epoch": 6, "train_loss": 0.6876993775367737}, {"step": 2400, "epoch": 6, "train_loss": 0.6922135353088379}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69367763671875, "val_acc": 0.5, "val_loss": 0.69367763671875}, {"step": 2600, "epoch": 7, "train_loss": 0.6973649859428406}, {"step": 2800, "epoch": 7, "train_loss": 0.6960991024971008}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.4952, "eval_loss": 0.693429296875, "val_acc": 0.4952, "val_loss": 0.693429296875}, {"step": 3000, "epoch": 8, "train_loss": 0.69532310962677}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5038, "eval_loss": 0.6935332275390625, "val_acc": 0.5038, "val_loss": 0.6935332275390625}, {"step": 3200, "epoch": 9, "train_loss": 0.7044647336006165}, {"step": 3400, "epoch": 9, "train_loss": 0.6970611810684204}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.6937386108398438, "val_acc": 0.497, "val_loss": 0.6937386108398438}, {"step": 3600, "epoch": 10, "train_loss": 0.691082239151001}, {"step": 3800, "epoch": 10, "train_loss": 0.692335307598114}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.4954, "eval_loss": 0.69340556640625, "val_acc": 0.4954, "val_loss": 0.69340556640625}, {"step": 4000, "epoch": 11, "train_loss": 0.6901642084121704}, {"step": 4200, "epoch": 11, "train_loss": 0.6964151263237}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.4972, "eval_loss": 0.6937971435546875, "val_acc": 0.4972, "val_loss": 0.6937971435546875}, {"step": 4400, "epoch": 12, "train_loss": 0.6922164559364319}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.4968, "eval_loss": 0.6934918823242188, "val_acc": 0.4968, "val_loss": 0.6934918823242188}, {"step": 4600, "epoch": 13, "train_loss": 0.6954686045646667}, {"step": 4800, "epoch": 13, "train_loss": 0.6956145167350769}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5024, "eval_loss": 0.693566015625, "val_acc": 0.5024, "val_loss": 0.693566015625}, {"step": 5000, "epoch": 14, "train_loss": 0.6930936574935913}, {"step": 5200, "epoch": 14, "train_loss": 0.6898251175880432}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.6935318115234375, "val_acc": 0.497, "val_loss": 0.6935318115234375}, {"step": 5400, "epoch": 15, "train_loss": 0.693204402923584}, {"step": 5600, "epoch": 15, "train_loss": 0.6911609172821045}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6933051635742188, "val_acc": 0.5008, "val_loss": 0.6933051635742188}, {"step": 5800, "epoch": 16, "train_loss": 0.6871203780174255}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.4978, "eval_loss": 0.6938286376953124, "val_acc": 0.4978, "val_loss": 0.6938286376953124}, {"step": 6000, "epoch": 17, "train_loss": 0.6957153677940369}, {"step": 6200, "epoch": 17, "train_loss": 0.6930288076400757}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5022, "eval_loss": 0.6934176635742187, "val_acc": 0.5022, "val_loss": 0.6934176635742187}, {"step": 6400, "epoch": 18, "train_loss": 0.6988169550895691}, {"step": 6600, "epoch": 18, "train_loss": 0.6898086667060852}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.501, "eval_loss": 0.6943442993164063, "val_acc": 0.501, "val_loss": 0.6943442993164063}, {"step": 6800, "epoch": 19, "train_loss": 0.6919689178466797}, {"step": 7000, "epoch": 19, "train_loss": 0.6962940096855164}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.506, "eval_loss": 0.6932731811523437, "val_acc": 0.506, "val_loss": 0.6932731811523437}, {"step": 7200, "epoch": 20, "train_loss": 0.692005455493927}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.69381123046875, "val_acc": 0.497, "val_loss": 0.69381123046875}, {"step": 7400, "epoch": 21, "train_loss": 0.691240668296814}, {"step": 7600, "epoch": 21, "train_loss": 0.6895701289176941}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.503, "eval_loss": 0.6931635986328125, "val_acc": 0.503, "val_loss": 0.6931635986328125}, {"step": 7800, "epoch": 22, "train_loss": 0.6936513781547546}, {"step": 8000, "epoch": 22, "train_loss": 0.6913608312606812}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.503, "eval_loss": 0.6938065307617187, "val_acc": 0.503, "val_loss": 0.6938065307617187}, {"step": 8200, "epoch": 23, "train_loss": 0.6909218430519104}, {"step": 8400, "epoch": 23, "train_loss": 0.690192461013794}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.4992, "eval_loss": 0.6940737182617187, "val_acc": 0.4992, "val_loss": 0.6940737182617187}, {"step": 8600, "epoch": 24, "train_loss": 0.6942642331123352}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.499, "eval_loss": 0.6941519653320313, "val_acc": 0.499, "val_loss": 0.6941519653320313}, {"step": 8800, "epoch": 25, "train_loss": 0.6888716816902161}, {"step": 9000, "epoch": 25, "train_loss": 0.6925976872444153}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.4982, "eval_loss": 0.6939918212890624, "val_acc": 0.4982, "val_loss": 0.6939918212890624}, {"step": 9200, "epoch": 26, "train_loss": 0.695248544216156}, {"step": 9400, "epoch": 26, "train_loss": 0.6917391419410706}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.4954, "eval_loss": 0.6933025268554688, "val_acc": 0.4954, "val_loss": 0.6933025268554688}, {"step": 9600, "epoch": 27, "train_loss": 0.6939871907234192}, {"step": 9800, "epoch": 27, "train_loss": 0.6950322389602661}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.4916, "eval_loss": 0.6935301635742187, "val_acc": 0.4916, "val_loss": 0.6935301635742187}, {"step": 10000, "epoch": 28, "train_loss": 0.6917943954467773}, {"step": 10200, "epoch": 28, "train_loss": 0.6948773264884949}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.6933760131835938, "val_acc": 0.497, "val_loss": 0.6933760131835938}, {"step": 10400, "epoch": 29, "train_loss": 0.6894591450691223}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.4998, "eval_loss": 0.6933372802734376, "val_acc": 0.4998, "val_loss": 0.6933372802734376}, {"step": 10600, "epoch": 30, "train_loss": 0.6986364722251892}, {"step": 10800, "epoch": 30, "train_loss": 0.7052015066146851}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.4966, "eval_loss": 0.6932595458984375, "val_acc": 0.4966, "val_loss": 0.6932595458984375}, {"step": 11000, "epoch": 31, "train_loss": 0.693498969078064}, {"step": 11200, "epoch": 31, "train_loss": 0.6896229386329651}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.6950401000976563, "val_acc": 0.5004, "val_loss": 0.6950401000976563}, {"step": 11400, "epoch": 32, "train_loss": 0.6916294097900391}, {"step": 11600, "epoch": 32, "train_loss": 0.6946629881858826}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.5048, "eval_loss": 0.693760498046875, "val_acc": 0.5048, "val_loss": 0.693760498046875}, {"step": 11800, "epoch": 33, "train_loss": 0.6890158653259277}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5022, "eval_loss": 0.6936679443359375, "val_acc": 0.5022, "val_loss": 0.6936679443359375}, {"step": 12000, "epoch": 34, "train_loss": 0.6943905353546143}, {"step": 12200, "epoch": 34, "train_loss": 0.6925678849220276}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.5016, "eval_loss": 0.6935269287109375, "val_acc": 0.5016, "val_loss": 0.6935269287109375}, {"step": 12400, "epoch": 35, "train_loss": 0.6957834362983704}, {"step": 12600, "epoch": 35, "train_loss": 0.6930543780326843}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.5026, "eval_loss": 0.6935149658203125, "val_acc": 0.5026, "val_loss": 0.6935149658203125}, {"step": 12800, "epoch": 36, "train_loss": 0.6965872049331665}, {"step": 13000, "epoch": 36, "train_loss": 0.6903831362724304}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.4914, "eval_loss": 0.6935820434570312, "val_acc": 0.4914, "val_loss": 0.6935820434570312}, {"step": 13200, "epoch": 37, "train_loss": 0.6929136514663696}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.4964, "eval_loss": 0.6935388061523438, "val_acc": 0.4964, "val_loss": 0.6935388061523438}, {"step": 13400, "epoch": 38, "train_loss": 0.6918665766716003}, {"step": 13600, "epoch": 38, "train_loss": 0.6932151913642883}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.5026, "eval_loss": 0.6934680419921875, "val_acc": 0.5026, "val_loss": 0.6934680419921875}, {"step": 13800, "epoch": 39, "train_loss": 0.6936224102973938}, {"step": 14000, "epoch": 39, "train_loss": 0.6969361901283264}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.49, "eval_loss": 0.6934670654296875, "val_acc": 0.49, "val_loss": 0.6934670654296875}], "final": {"eval_split": "validation", "eval_acc": 0.49, "eval_loss": 0.6934670654296875, "wall_s": 21.48953342437744, "val_acc": 0.49, "val_loss": 0.6934670654296875}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0.json new file mode 100644 index 0000000..07f3990 --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 2, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d2_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.7234192490577698}, {"step": 200, "epoch": 0, "train_loss": 0.6983705163002014}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.4944, "eval_loss": 0.6948132934570312, "val_acc": 0.4944, "val_loss": 0.6948132934570312}, {"step": 400, "epoch": 1, "train_loss": 0.6936428546905518}, {"step": 600, "epoch": 1, "train_loss": 0.6950218677520752}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.5022, "eval_loss": 0.6933030883789062, "val_acc": 0.5022, "val_loss": 0.6933030883789062}, {"step": 800, "epoch": 2, "train_loss": 0.6947194337844849}, {"step": 1000, "epoch": 2, "train_loss": 0.6933380365371704}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.6936936645507813, "val_acc": 0.497, "val_loss": 0.6936936645507813}, {"step": 1200, "epoch": 3, "train_loss": 0.6922563314437866}, {"step": 1400, "epoch": 3, "train_loss": 0.6952409744262695}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.505, "eval_loss": 0.6932832397460937, "val_acc": 0.505, "val_loss": 0.6932832397460937}, {"step": 1600, "epoch": 4, "train_loss": 0.6934345364570618}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.4992, "eval_loss": 0.6934339965820312, "val_acc": 0.4992, "val_loss": 0.6934339965820312}, {"step": 1800, "epoch": 5, "train_loss": 0.6906495690345764}, {"step": 2000, "epoch": 5, "train_loss": 0.6929758191108704}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.4994, "eval_loss": 0.6934252075195313, "val_acc": 0.4994, "val_loss": 0.6934252075195313}, {"step": 2200, "epoch": 6, "train_loss": 0.6911870241165161}, {"step": 2400, "epoch": 6, "train_loss": 0.6939542889595032}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6934014404296875, "val_acc": 0.4996, "val_loss": 0.6934014404296875}, {"step": 2600, "epoch": 7, "train_loss": 0.6970890760421753}, {"step": 2800, "epoch": 7, "train_loss": 0.6932133436203003}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.4956, "eval_loss": 0.693291845703125, "val_acc": 0.4956, "val_loss": 0.693291845703125}, {"step": 3000, "epoch": 8, "train_loss": 0.6915990710258484}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.4962, "eval_loss": 0.6932441040039062, "val_acc": 0.4962, "val_loss": 0.6932441040039062}, {"step": 3200, "epoch": 9, "train_loss": 0.6991944909095764}, {"step": 3400, "epoch": 9, "train_loss": 0.695619523525238}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.4926, "eval_loss": 0.693361083984375, "val_acc": 0.4926, "val_loss": 0.693361083984375}, {"step": 3600, "epoch": 10, "train_loss": 0.69111567735672}, {"step": 3800, "epoch": 10, "train_loss": 0.6944504976272583}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.4962, "eval_loss": 0.693263232421875, "val_acc": 0.4962, "val_loss": 0.693263232421875}, {"step": 4000, "epoch": 11, "train_loss": 0.6895580887794495}, {"step": 4200, "epoch": 11, "train_loss": 0.6945664882659912}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.4988, "eval_loss": 0.6936599487304688, "val_acc": 0.4988, "val_loss": 0.6936599487304688}, {"step": 4400, "epoch": 12, "train_loss": 0.6921815276145935}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.4954, "eval_loss": 0.6932859375, "val_acc": 0.4954, "val_loss": 0.6932859375}, {"step": 4600, "epoch": 13, "train_loss": 0.6926528215408325}, {"step": 4800, "epoch": 13, "train_loss": 0.6943957805633545}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5012, "eval_loss": 0.6933865234375, "val_acc": 0.5012, "val_loss": 0.6933865234375}, {"step": 5000, "epoch": 14, "train_loss": 0.6933137774467468}, {"step": 5200, "epoch": 14, "train_loss": 0.6908711194992065}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5034, "eval_loss": 0.6933139770507812, "val_acc": 0.5034, "val_loss": 0.6933139770507812}, {"step": 5400, "epoch": 15, "train_loss": 0.6929924488067627}, {"step": 5600, "epoch": 15, "train_loss": 0.6907548904418945}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4978, "eval_loss": 0.6932108764648437, "val_acc": 0.4978, "val_loss": 0.6932108764648437}, {"step": 5800, "epoch": 16, "train_loss": 0.689414381980896}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.4982, "eval_loss": 0.6935081420898438, "val_acc": 0.4982, "val_loss": 0.6935081420898438}, {"step": 6000, "epoch": 17, "train_loss": 0.692956268787384}, {"step": 6200, "epoch": 17, "train_loss": 0.6924958229064941}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.6933629028320313, "val_acc": 0.5006, "val_loss": 0.6933629028320313}, {"step": 6400, "epoch": 18, "train_loss": 0.6946048140525818}, {"step": 6600, "epoch": 18, "train_loss": 0.6906641125679016}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.6938782104492187, "val_acc": 0.5006, "val_loss": 0.6938782104492187}, {"step": 6800, "epoch": 19, "train_loss": 0.6922234892845154}, {"step": 7000, "epoch": 19, "train_loss": 0.6951857209205627}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5024, "eval_loss": 0.693321923828125, "val_acc": 0.5024, "val_loss": 0.693321923828125}, {"step": 7200, "epoch": 20, "train_loss": 0.6930521130561829}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4962, "eval_loss": 0.6934287841796875, "val_acc": 0.4962, "val_loss": 0.6934287841796875}, {"step": 7400, "epoch": 21, "train_loss": 0.693526029586792}, {"step": 7600, "epoch": 21, "train_loss": 0.6901332139968872}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.4986, "eval_loss": 0.693211572265625, "val_acc": 0.4986, "val_loss": 0.693211572265625}, {"step": 7800, "epoch": 22, "train_loss": 0.693686842918396}, {"step": 8000, "epoch": 22, "train_loss": 0.6924529671669006}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6936642700195312, "val_acc": 0.5008, "val_loss": 0.6936642700195312}, {"step": 8200, "epoch": 23, "train_loss": 0.6910799741744995}, {"step": 8400, "epoch": 23, "train_loss": 0.6932209730148315}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.503, "eval_loss": 0.6934892822265625, "val_acc": 0.503, "val_loss": 0.6934892822265625}, {"step": 8600, "epoch": 24, "train_loss": 0.6934233903884888}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6940283935546875, "val_acc": 0.5002, "val_loss": 0.6940283935546875}, {"step": 8800, "epoch": 25, "train_loss": 0.6923726797103882}, {"step": 9000, "epoch": 25, "train_loss": 0.6930972933769226}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6940987915039063, "val_acc": 0.5002, "val_loss": 0.6940987915039063}, {"step": 9200, "epoch": 26, "train_loss": 0.6952126622200012}, {"step": 9400, "epoch": 26, "train_loss": 0.6929704546928406}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.5034, "eval_loss": 0.69327421875, "val_acc": 0.5034, "val_loss": 0.69327421875}, {"step": 9600, "epoch": 27, "train_loss": 0.6948537826538086}, {"step": 9800, "epoch": 27, "train_loss": 0.6948608756065369}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.4934, "eval_loss": 0.6933148315429688, "val_acc": 0.4934, "val_loss": 0.6933148315429688}, {"step": 10000, "epoch": 28, "train_loss": 0.6924528479576111}, {"step": 10200, "epoch": 28, "train_loss": 0.6937589049339294}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.5062, "eval_loss": 0.6932617309570313, "val_acc": 0.5062, "val_loss": 0.6932617309570313}, {"step": 10400, "epoch": 29, "train_loss": 0.6898597478866577}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.4998, "eval_loss": 0.6932134887695313, "val_acc": 0.4998, "val_loss": 0.6932134887695313}, {"step": 10600, "epoch": 30, "train_loss": 0.6981315016746521}, {"step": 10800, "epoch": 30, "train_loss": 0.702637791633606}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6931874389648438, "val_acc": 0.4996, "val_loss": 0.6931874389648438}, {"step": 11000, "epoch": 31, "train_loss": 0.6947645545005798}, {"step": 11200, "epoch": 31, "train_loss": 0.6895925402641296}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6947183959960938, "val_acc": 0.4996, "val_loss": 0.6947183959960938}, {"step": 11400, "epoch": 32, "train_loss": 0.6899244785308838}, {"step": 11600, "epoch": 32, "train_loss": 0.6939110159873962}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.501, "eval_loss": 0.6935629638671875, "val_acc": 0.501, "val_loss": 0.6935629638671875}, {"step": 11800, "epoch": 33, "train_loss": 0.6895370483398438}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.69351015625, "val_acc": 0.5004, "val_loss": 0.69351015625}, {"step": 12000, "epoch": 34, "train_loss": 0.6940256357192993}, {"step": 12200, "epoch": 34, "train_loss": 0.6927611231803894}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.5018, "eval_loss": 0.6933942260742187, "val_acc": 0.5018, "val_loss": 0.6933942260742187}, {"step": 12400, "epoch": 35, "train_loss": 0.6971215605735779}, {"step": 12600, "epoch": 35, "train_loss": 0.692359983921051}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.502, "eval_loss": 0.6934452270507813, "val_acc": 0.502, "val_loss": 0.6934452270507813}, {"step": 12800, "epoch": 36, "train_loss": 0.6958345174789429}, {"step": 13000, "epoch": 36, "train_loss": 0.6922397017478943}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.5024, "eval_loss": 0.6932959106445312, "val_acc": 0.5024, "val_loss": 0.6932959106445312}, {"step": 13200, "epoch": 37, "train_loss": 0.6923678517341614}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.5024, "eval_loss": 0.6933904174804687, "val_acc": 0.5024, "val_loss": 0.6933904174804687}, {"step": 13400, "epoch": 38, "train_loss": 0.6921576261520386}, {"step": 13600, "epoch": 38, "train_loss": 0.6934102177619934}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.504, "eval_loss": 0.6933526000976562, "val_acc": 0.504, "val_loss": 0.6933526000976562}, {"step": 13800, "epoch": 39, "train_loss": 0.6931068301200867}, {"step": 14000, "epoch": 39, "train_loss": 0.6963883638381958}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.498, "eval_loss": 0.6932501098632813, "val_acc": 0.498, "val_loss": 0.6932501098632813}], "final": {"eval_split": "validation", "eval_acc": 0.498, "eval_loss": 0.6932501098632813, "wall_s": 26.63870906829834, "val_acc": 0.498, "val_loss": 0.6932501098632813}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0.json new file mode 100644 index 0000000..507179b --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 4, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d4_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.7022197246551514}, {"step": 200, "epoch": 0, "train_loss": 0.6925510764122009}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.49, "eval_loss": 0.6934619018554687, "val_acc": 0.49, "val_loss": 0.6934619018554687}, {"step": 400, "epoch": 1, "train_loss": 0.6936402916908264}, {"step": 600, "epoch": 1, "train_loss": 0.6925376653671265}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.4914, "eval_loss": 0.6933869140625, "val_acc": 0.4914, "val_loss": 0.6933869140625}, {"step": 800, "epoch": 2, "train_loss": 0.6937887668609619}, {"step": 1000, "epoch": 2, "train_loss": 0.6941705346107483}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5098, "eval_loss": 0.69330537109375, "val_acc": 0.5098, "val_loss": 0.69330537109375}, {"step": 1200, "epoch": 3, "train_loss": 0.6934511065483093}, {"step": 1400, "epoch": 3, "train_loss": 0.6938009858131409}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5026, "eval_loss": 0.6934269165039062, "val_acc": 0.5026, "val_loss": 0.6934269165039062}, {"step": 1600, "epoch": 4, "train_loss": 0.690829336643219}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.693430029296875, "val_acc": 0.5006, "val_loss": 0.693430029296875}, {"step": 1800, "epoch": 5, "train_loss": 0.6926023960113525}, {"step": 2000, "epoch": 5, "train_loss": 0.6927932500839233}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.4986, "eval_loss": 0.6934110229492187, "val_acc": 0.4986, "val_loss": 0.6934110229492187}, {"step": 2200, "epoch": 6, "train_loss": 0.6911272406578064}, {"step": 2400, "epoch": 6, "train_loss": 0.6944061517715454}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.4984, "eval_loss": 0.6933203735351563, "val_acc": 0.4984, "val_loss": 0.6933203735351563}, {"step": 2600, "epoch": 7, "train_loss": 0.6943874955177307}, {"step": 2800, "epoch": 7, "train_loss": 0.6926553249359131}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.4986, "eval_loss": 0.6933603759765625, "val_acc": 0.4986, "val_loss": 0.6933603759765625}, {"step": 3000, "epoch": 8, "train_loss": 0.6917888522148132}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.4988, "eval_loss": 0.6933662231445312, "val_acc": 0.4988, "val_loss": 0.6933662231445312}, {"step": 3200, "epoch": 9, "train_loss": 0.698246419429779}, {"step": 3400, "epoch": 9, "train_loss": 0.6951472759246826}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.69345, "val_acc": 0.5004, "val_loss": 0.69345}, {"step": 3600, "epoch": 10, "train_loss": 0.6905182003974915}, {"step": 3800, "epoch": 10, "train_loss": 0.6948990225791931}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.4932, "eval_loss": 0.6933667358398438, "val_acc": 0.4932, "val_loss": 0.6933667358398438}, {"step": 4000, "epoch": 11, "train_loss": 0.6905462145805359}, {"step": 4200, "epoch": 11, "train_loss": 0.692357063293457}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.499, "eval_loss": 0.6935945678710937, "val_acc": 0.499, "val_loss": 0.6935945678710937}, {"step": 4400, "epoch": 12, "train_loss": 0.6917365193367004}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.498, "eval_loss": 0.6935004272460937, "val_acc": 0.498, "val_loss": 0.6935004272460937}, {"step": 4600, "epoch": 13, "train_loss": 0.692046046257019}, {"step": 4800, "epoch": 13, "train_loss": 0.6930823922157288}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.4966, "eval_loss": 0.6934499877929687, "val_acc": 0.4966, "val_loss": 0.6934499877929687}, {"step": 5000, "epoch": 14, "train_loss": 0.693751871585846}, {"step": 5200, "epoch": 14, "train_loss": 0.6913657784461975}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.4964, "eval_loss": 0.6933742797851562, "val_acc": 0.4964, "val_loss": 0.6933742797851562}, {"step": 5400, "epoch": 15, "train_loss": 0.6927146315574646}, {"step": 5600, "epoch": 15, "train_loss": 0.6928483843803406}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4836, "eval_loss": 0.6934332397460937, "val_acc": 0.4836, "val_loss": 0.6934332397460937}, {"step": 5800, "epoch": 16, "train_loss": 0.6919213533401489}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6934302124023437, "val_acc": 0.5008, "val_loss": 0.6934302124023437}, {"step": 6000, "epoch": 17, "train_loss": 0.6956812739372253}, {"step": 6200, "epoch": 17, "train_loss": 0.6929510235786438}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.4988, "eval_loss": 0.6935355834960938, "val_acc": 0.4988, "val_loss": 0.6935355834960938}, {"step": 6400, "epoch": 18, "train_loss": 0.6935717463493347}, {"step": 6600, "epoch": 18, "train_loss": 0.6900875568389893}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5016, "eval_loss": 0.6937994995117187, "val_acc": 0.5016, "val_loss": 0.6937994995117187}, {"step": 6800, "epoch": 19, "train_loss": 0.6928388476371765}, {"step": 7000, "epoch": 19, "train_loss": 0.6949319243431091}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4984, "eval_loss": 0.6934734130859375, "val_acc": 0.4984, "val_loss": 0.6934734130859375}, {"step": 7200, "epoch": 20, "train_loss": 0.6940304636955261}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4936, "eval_loss": 0.693409033203125, "val_acc": 0.4936, "val_loss": 0.693409033203125}, {"step": 7400, "epoch": 21, "train_loss": 0.6921476721763611}, {"step": 7600, "epoch": 21, "train_loss": 0.6907647252082825}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.4998, "eval_loss": 0.6933627685546875, "val_acc": 0.4998, "val_loss": 0.6933627685546875}, {"step": 7800, "epoch": 22, "train_loss": 0.6935514211654663}, {"step": 8000, "epoch": 22, "train_loss": 0.6911067962646484}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4994, "eval_loss": 0.6938143432617188, "val_acc": 0.4994, "val_loss": 0.6938143432617188}, {"step": 8200, "epoch": 23, "train_loss": 0.6894157528877258}, {"step": 8400, "epoch": 23, "train_loss": 0.6921218633651733}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.6934918701171875, "val_acc": 0.5006, "val_loss": 0.6934918701171875}, {"step": 8600, "epoch": 24, "train_loss": 0.6922644376754761}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6942336547851562, "val_acc": 0.5, "val_loss": 0.6942336547851562}, {"step": 8800, "epoch": 25, "train_loss": 0.6897350549697876}, {"step": 9000, "epoch": 25, "train_loss": 0.6909540891647339}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6941972290039062, "val_acc": 0.5002, "val_loss": 0.6941972290039062}, {"step": 9200, "epoch": 26, "train_loss": 0.6953274011611938}, {"step": 9400, "epoch": 26, "train_loss": 0.6913111805915833}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.4982, "eval_loss": 0.6934556396484375, "val_acc": 0.4982, "val_loss": 0.6934556396484375}, {"step": 9600, "epoch": 27, "train_loss": 0.6937059760093689}, {"step": 9800, "epoch": 27, "train_loss": 0.693418562412262}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.4926, "eval_loss": 0.6934234741210937, "val_acc": 0.4926, "val_loss": 0.6934234741210937}, {"step": 10000, "epoch": 28, "train_loss": 0.6936168670654297}, {"step": 10200, "epoch": 28, "train_loss": 0.6930007338523865}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.498, "eval_loss": 0.69338193359375, "val_acc": 0.498, "val_loss": 0.69338193359375}, {"step": 10400, "epoch": 29, "train_loss": 0.691835880279541}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.4914, "eval_loss": 0.6933900390625, "val_acc": 0.4914, "val_loss": 0.6933900390625}, {"step": 10600, "epoch": 30, "train_loss": 0.6983358263969421}, {"step": 10800, "epoch": 30, "train_loss": 0.7040852308273315}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.4942, "eval_loss": 0.6934786987304687, "val_acc": 0.4942, "val_loss": 0.6934786987304687}, {"step": 11000, "epoch": 31, "train_loss": 0.69489985704422}, {"step": 11200, "epoch": 31, "train_loss": 0.693248450756073}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6946350952148438, "val_acc": 0.5, "val_loss": 0.6946350952148438}, {"step": 11400, "epoch": 32, "train_loss": 0.6915619969367981}, {"step": 11600, "epoch": 32, "train_loss": 0.691857099533081}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.4976, "eval_loss": 0.6937075073242187, "val_acc": 0.4976, "val_loss": 0.6937075073242187}, {"step": 11800, "epoch": 33, "train_loss": 0.6887158751487732}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6936916381835937, "val_acc": 0.5008, "val_loss": 0.6936916381835937}, {"step": 12000, "epoch": 34, "train_loss": 0.6929938793182373}, {"step": 12200, "epoch": 34, "train_loss": 0.6936434507369995}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.498, "eval_loss": 0.6936242065429687, "val_acc": 0.498, "val_loss": 0.6936242065429687}, {"step": 12400, "epoch": 35, "train_loss": 0.6947640180587769}, {"step": 12600, "epoch": 35, "train_loss": 0.6921163201332092}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6937748291015625, "val_acc": 0.5002, "val_loss": 0.6937748291015625}, {"step": 12800, "epoch": 36, "train_loss": 0.6961686015129089}, {"step": 13000, "epoch": 36, "train_loss": 0.6913411617279053}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.4906, "eval_loss": 0.693613330078125, "val_acc": 0.4906, "val_loss": 0.693613330078125}, {"step": 13200, "epoch": 37, "train_loss": 0.6913988590240479}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6934991577148437, "val_acc": 0.4996, "val_loss": 0.6934991577148437}, {"step": 13400, "epoch": 38, "train_loss": 0.6926538944244385}, {"step": 13600, "epoch": 38, "train_loss": 0.691521942615509}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.501, "eval_loss": 0.6935242919921875, "val_acc": 0.501, "val_loss": 0.6935242919921875}, {"step": 13800, "epoch": 39, "train_loss": 0.693479597568512}, {"step": 14000, "epoch": 39, "train_loss": 0.6951172351837158}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.5062, "eval_loss": 0.6936030395507813, "val_acc": 0.5062, "val_loss": 0.6936030395507813}], "final": {"eval_split": "validation", "eval_acc": 0.5062, "eval_loss": 0.6936030395507813, "wall_s": 38.0889253616333, "val_acc": 0.5062, "val_loss": 0.6936030395507813}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0.json new file mode 100644 index 0000000..097e6a4 --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 6, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d6_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.6928590536117554}, {"step": 200, "epoch": 0, "train_loss": 0.6938450336456299}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.4968, "eval_loss": 0.6932424926757812, "val_acc": 0.4968, "val_loss": 0.6932424926757812}, {"step": 400, "epoch": 1, "train_loss": 0.6921735405921936}, {"step": 600, "epoch": 1, "train_loss": 0.6930134296417236}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.497, "eval_loss": 0.6932382446289063, "val_acc": 0.497, "val_loss": 0.6932382446289063}, {"step": 800, "epoch": 2, "train_loss": 0.6925055980682373}, {"step": 1000, "epoch": 2, "train_loss": 0.6947975158691406}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5044, "eval_loss": 0.693189306640625, "val_acc": 0.5044, "val_loss": 0.693189306640625}, {"step": 1200, "epoch": 3, "train_loss": 0.6924083828926086}, {"step": 1400, "epoch": 3, "train_loss": 0.6937776803970337}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933202026367188, "val_acc": 0.5, "val_loss": 0.6933202026367188}, {"step": 1600, "epoch": 4, "train_loss": 0.6917003393173218}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933621948242188, "val_acc": 0.5, "val_loss": 0.6933621948242188}, {"step": 1800, "epoch": 5, "train_loss": 0.6928338408470154}, {"step": 2000, "epoch": 5, "train_loss": 0.6931189894676208}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6933397338867188, "val_acc": 0.5008, "val_loss": 0.6933397338867188}, {"step": 2200, "epoch": 6, "train_loss": 0.6914609670639038}, {"step": 2400, "epoch": 6, "train_loss": 0.6944755911827087}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.4936, "eval_loss": 0.6932679321289063, "val_acc": 0.4936, "val_loss": 0.6932679321289063}, {"step": 2600, "epoch": 7, "train_loss": 0.6937891840934753}, {"step": 2800, "epoch": 7, "train_loss": 0.6930403709411621}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6932306396484375, "val_acc": 0.5002, "val_loss": 0.6932306396484375}, {"step": 3000, "epoch": 8, "train_loss": 0.6917064189910889}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6932857543945312, "val_acc": 0.4996, "val_loss": 0.6932857543945312}, {"step": 3200, "epoch": 9, "train_loss": 0.6983595490455627}, {"step": 3400, "epoch": 9, "train_loss": 0.6949564218521118}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69331455078125, "val_acc": 0.5, "val_loss": 0.69331455078125}, {"step": 3600, "epoch": 10, "train_loss": 0.6908610463142395}, {"step": 3800, "epoch": 10, "train_loss": 0.6944295167922974}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.6932333740234375, "val_acc": 0.5006, "val_loss": 0.6932333740234375}, {"step": 4000, "epoch": 11, "train_loss": 0.6910235285758972}, {"step": 4200, "epoch": 11, "train_loss": 0.6929867267608643}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6934860107421875, "val_acc": 0.5008, "val_loss": 0.6934860107421875}, {"step": 4400, "epoch": 12, "train_loss": 0.6926133036613464}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693273583984375, "val_acc": 0.5, "val_loss": 0.693273583984375}, {"step": 4600, "epoch": 13, "train_loss": 0.6919313073158264}, {"step": 4800, "epoch": 13, "train_loss": 0.6933034658432007}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.4998, "eval_loss": 0.6933156372070313, "val_acc": 0.4998, "val_loss": 0.6933156372070313}, {"step": 5000, "epoch": 14, "train_loss": 0.6936420202255249}, {"step": 5200, "epoch": 14, "train_loss": 0.6913618445396423}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69323125, "val_acc": 0.5, "val_loss": 0.69323125}, {"step": 5400, "epoch": 15, "train_loss": 0.6928245425224304}, {"step": 5600, "epoch": 15, "train_loss": 0.6929822564125061}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69324013671875, "val_acc": 0.5, "val_loss": 0.69324013671875}, {"step": 5800, "epoch": 16, "train_loss": 0.6921864151954651}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5018, "eval_loss": 0.693311328125, "val_acc": 0.5018, "val_loss": 0.693311328125}, {"step": 6000, "epoch": 17, "train_loss": 0.694209098815918}, {"step": 6200, "epoch": 17, "train_loss": 0.6931802034378052}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693387939453125, "val_acc": 0.5, "val_loss": 0.693387939453125}, {"step": 6400, "epoch": 18, "train_loss": 0.6933950781822205}, {"step": 6600, "epoch": 18, "train_loss": 0.6909139752388}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.502, "eval_loss": 0.6936298583984375, "val_acc": 0.502, "val_loss": 0.6936298583984375}, {"step": 6800, "epoch": 19, "train_loss": 0.6926027536392212}, {"step": 7000, "epoch": 19, "train_loss": 0.6945126056671143}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4988, "eval_loss": 0.6933175048828125, "val_acc": 0.4988, "val_loss": 0.6933175048828125}, {"step": 7200, "epoch": 20, "train_loss": 0.6935617327690125}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4936, "eval_loss": 0.6933082763671875, "val_acc": 0.4936, "val_loss": 0.6933082763671875}, {"step": 7400, "epoch": 21, "train_loss": 0.6923162341117859}, {"step": 7600, "epoch": 21, "train_loss": 0.6906459331512451}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.69322353515625, "val_acc": 0.5002, "val_loss": 0.69322353515625}, {"step": 7800, "epoch": 22, "train_loss": 0.6934617757797241}, {"step": 8000, "epoch": 22, "train_loss": 0.6912260055541992}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4954, "eval_loss": 0.6938241821289063, "val_acc": 0.4954, "val_loss": 0.6938241821289063}, {"step": 8200, "epoch": 23, "train_loss": 0.6896759867668152}, {"step": 8400, "epoch": 23, "train_loss": 0.6918059587478638}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.6933515869140625, "val_acc": 0.5004, "val_loss": 0.6933515869140625}, {"step": 8600, "epoch": 24, "train_loss": 0.6928461790084839}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6941350341796875, "val_acc": 0.5, "val_loss": 0.6941350341796875}, {"step": 8800, "epoch": 25, "train_loss": 0.6902450323104858}, {"step": 9000, "epoch": 25, "train_loss": 0.6906232237815857}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6939969604492188, "val_acc": 0.5, "val_loss": 0.6939969604492188}, {"step": 9200, "epoch": 26, "train_loss": 0.6954138875007629}, {"step": 9400, "epoch": 26, "train_loss": 0.6905629634857178}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.5052, "eval_loss": 0.693370068359375, "val_acc": 0.5052, "val_loss": 0.693370068359375}, {"step": 9600, "epoch": 27, "train_loss": 0.6932179927825928}, {"step": 9800, "epoch": 27, "train_loss": 0.6923965215682983}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.4958, "eval_loss": 0.693275634765625, "val_acc": 0.4958, "val_loss": 0.693275634765625}, {"step": 10000, "epoch": 28, "train_loss": 0.6931954622268677}, {"step": 10200, "epoch": 28, "train_loss": 0.692685067653656}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.4962, "eval_loss": 0.6933490478515625, "val_acc": 0.4962, "val_loss": 0.6933490478515625}, {"step": 10400, "epoch": 29, "train_loss": 0.6921876668930054}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.4958, "eval_loss": 0.6932742919921875, "val_acc": 0.4958, "val_loss": 0.6932742919921875}, {"step": 10600, "epoch": 30, "train_loss": 0.6979708075523376}, {"step": 10800, "epoch": 30, "train_loss": 0.7037988305091858}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.4926, "eval_loss": 0.693386962890625, "val_acc": 0.4926, "val_loss": 0.693386962890625}, {"step": 11000, "epoch": 31, "train_loss": 0.6972269415855408}, {"step": 11200, "epoch": 31, "train_loss": 0.6931207180023193}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6945745361328125, "val_acc": 0.5, "val_loss": 0.6945745361328125}, {"step": 11400, "epoch": 32, "train_loss": 0.6919587254524231}, {"step": 11600, "epoch": 32, "train_loss": 0.693355143070221}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.6936034790039063, "val_acc": 0.5008, "val_loss": 0.6936034790039063}, {"step": 11800, "epoch": 33, "train_loss": 0.68900066614151}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5018, "eval_loss": 0.693598974609375, "val_acc": 0.5018, "val_loss": 0.693598974609375}, {"step": 12000, "epoch": 34, "train_loss": 0.6928737759590149}, {"step": 12200, "epoch": 34, "train_loss": 0.6938790082931519}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.5016, "eval_loss": 0.6934698364257813, "val_acc": 0.5016, "val_loss": 0.6934698364257813}, {"step": 12400, "epoch": 35, "train_loss": 0.6947739720344543}, {"step": 12600, "epoch": 35, "train_loss": 0.6918246746063232}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.4996, "eval_loss": 0.6935453735351562, "val_acc": 0.4996, "val_loss": 0.6935453735351562}, {"step": 12800, "epoch": 36, "train_loss": 0.6953124403953552}, {"step": 13000, "epoch": 36, "train_loss": 0.6913015246391296}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.4946, "eval_loss": 0.6934827392578125, "val_acc": 0.4946, "val_loss": 0.6934827392578125}, {"step": 13200, "epoch": 37, "train_loss": 0.6909523606300354}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.5038, "eval_loss": 0.6933150756835937, "val_acc": 0.5038, "val_loss": 0.6933150756835937}, {"step": 13400, "epoch": 38, "train_loss": 0.6924707889556885}, {"step": 13600, "epoch": 38, "train_loss": 0.6919642686843872}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.502, "eval_loss": 0.6932087036132812, "val_acc": 0.502, "val_loss": 0.6932087036132812}, {"step": 13800, "epoch": 39, "train_loss": 0.6929119825363159}, {"step": 14000, "epoch": 39, "train_loss": 0.695218026638031}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.6934271606445312, "val_acc": 0.5004, "val_loss": 0.6934271606445312}], "final": {"eval_split": "validation", "eval_acc": 0.5004, "eval_loss": 0.6934271606445312, "wall_s": 46.88235116004944, "val_acc": 0.5004, "val_loss": 0.6934271606445312}} \ No newline at end of file diff --git a/results/depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0.json b/results/depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0.json new file mode 100644 index 0000000..78ff43d --- /dev/null +++ b/results/depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "bp", "dataset": "tentmap", "depth": 8, "width": 16, "act": "relu", "residual": 0, "epochs": 40, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 7, "task_n_in": 4, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.02, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_tentmap_bp_w16_d8_t0_s0", "n_in": 4, "n_out": 2}, "split": {"dataset": "tentmap", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "291d95d8a591bae65a0250e7365655c3fc52324bdc34677026467ce13bf433b9", "validation_class_counts": {"0": 2500, "1": 2500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 0.6925473809242249}, {"step": 200, "epoch": 0, "train_loss": 0.6939254999160767}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.4994, "eval_loss": 0.693342578125, "val_acc": 0.4994, "val_loss": 0.693342578125}, {"step": 400, "epoch": 1, "train_loss": 0.6924886703491211}, {"step": 600, "epoch": 1, "train_loss": 0.6929612159729004}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.4986, "eval_loss": 0.693191015625, "val_acc": 0.4986, "val_loss": 0.693191015625}, {"step": 800, "epoch": 2, "train_loss": 0.693604052066803}, {"step": 1000, "epoch": 2, "train_loss": 0.6941399574279785}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931922729492187, "val_acc": 0.5, "val_loss": 0.6931922729492187}, {"step": 1200, "epoch": 3, "train_loss": 0.6931291818618774}, {"step": 1400, "epoch": 3, "train_loss": 0.6932064294815063}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6931789428710937, "val_acc": 0.5, "val_loss": 0.6931789428710937}, {"step": 1600, "epoch": 4, "train_loss": 0.6927685737609863}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933283569335937, "val_acc": 0.5, "val_loss": 0.6933283569335937}, {"step": 1800, "epoch": 5, "train_loss": 0.6924670338630676}, {"step": 2000, "epoch": 5, "train_loss": 0.6930816173553467}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6933635131835938, "val_acc": 0.5002, "val_loss": 0.6933635131835938}, {"step": 2200, "epoch": 6, "train_loss": 0.6924358010292053}, {"step": 2400, "epoch": 6, "train_loss": 0.694743812084198}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932129638671874, "val_acc": 0.5, "val_loss": 0.6932129638671874}, {"step": 2600, "epoch": 7, "train_loss": 0.6937341094017029}, {"step": 2800, "epoch": 7, "train_loss": 0.6930980086326599}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693216943359375, "val_acc": 0.5, "val_loss": 0.693216943359375}, {"step": 3000, "epoch": 8, "train_loss": 0.6914985775947571}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932589111328125, "val_acc": 0.5, "val_loss": 0.6932589111328125}, {"step": 3200, "epoch": 9, "train_loss": 0.6979081034660339}, {"step": 3400, "epoch": 9, "train_loss": 0.6944769620895386}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933515625, "val_acc": 0.5, "val_loss": 0.6933515625}, {"step": 3600, "epoch": 10, "train_loss": 0.6905509233474731}, {"step": 3800, "epoch": 10, "train_loss": 0.6946561336517334}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6932527709960937, "val_acc": 0.5, "val_loss": 0.6932527709960937}, {"step": 4000, "epoch": 11, "train_loss": 0.6903437972068787}, {"step": 4200, "epoch": 11, "train_loss": 0.6946027278900146}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.5002, "eval_loss": 0.6935705322265625, "val_acc": 0.5002, "val_loss": 0.6935705322265625}, {"step": 4400, "epoch": 12, "train_loss": 0.6928010582923889}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933148559570312, "val_acc": 0.5, "val_loss": 0.6933148559570312}, {"step": 4600, "epoch": 13, "train_loss": 0.6920830011367798}, {"step": 4800, "epoch": 13, "train_loss": 0.6938961148262024}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933397094726562, "val_acc": 0.5, "val_loss": 0.6933397094726562}, {"step": 5000, "epoch": 14, "train_loss": 0.6941024661064148}, {"step": 5200, "epoch": 14, "train_loss": 0.6911484003067017}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.4924, "eval_loss": 0.6933812866210938, "val_acc": 0.4924, "val_loss": 0.6933812866210938}, {"step": 5400, "epoch": 15, "train_loss": 0.6929672956466675}, {"step": 5600, "epoch": 15, "train_loss": 0.6928272843360901}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4912, "eval_loss": 0.6933106201171875, "val_acc": 0.4912, "val_loss": 0.6933106201171875}, {"step": 5800, "epoch": 16, "train_loss": 0.692277729511261}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693445751953125, "val_acc": 0.5, "val_loss": 0.693445751953125}, {"step": 6000, "epoch": 17, "train_loss": 0.693669855594635}, {"step": 6200, "epoch": 17, "train_loss": 0.69309002161026}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6934526489257813, "val_acc": 0.5, "val_loss": 0.6934526489257813}, {"step": 6400, "epoch": 18, "train_loss": 0.69322669506073}, {"step": 6600, "epoch": 18, "train_loss": 0.6917468309402466}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.5006, "eval_loss": 0.6936138305664062, "val_acc": 0.5006, "val_loss": 0.6936138305664062}, {"step": 6800, "epoch": 19, "train_loss": 0.6926660537719727}, {"step": 7000, "epoch": 19, "train_loss": 0.6946768164634705}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.5012, "eval_loss": 0.6933239379882813, "val_acc": 0.5012, "val_loss": 0.6933239379882813}, {"step": 7200, "epoch": 20, "train_loss": 0.6937772631645203}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.4956, "eval_loss": 0.6933817260742188, "val_acc": 0.4956, "val_loss": 0.6933817260742188}, {"step": 7400, "epoch": 21, "train_loss": 0.6924129128456116}, {"step": 7600, "epoch": 21, "train_loss": 0.6895524263381958}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.5018, "eval_loss": 0.69325654296875, "val_acc": 0.5018, "val_loss": 0.69325654296875}, {"step": 7800, "epoch": 22, "train_loss": 0.6929672360420227}, {"step": 8000, "epoch": 22, "train_loss": 0.6922848224639893}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6936069213867188, "val_acc": 0.5, "val_loss": 0.6936069213867188}, {"step": 8200, "epoch": 23, "train_loss": 0.689821183681488}, {"step": 8400, "epoch": 23, "train_loss": 0.6919513940811157}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.5008, "eval_loss": 0.69342958984375, "val_acc": 0.5008, "val_loss": 0.69342958984375}, {"step": 8600, "epoch": 24, "train_loss": 0.6932429671287537}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6940988525390624, "val_acc": 0.5, "val_loss": 0.6940988525390624}, {"step": 8800, "epoch": 25, "train_loss": 0.6902653574943542}, {"step": 9000, "epoch": 25, "train_loss": 0.6910394430160522}, {"epoch_end": 25, "step": 9152, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6940709594726563, "val_acc": 0.5, "val_loss": 0.6940709594726563}, {"step": 9200, "epoch": 26, "train_loss": 0.6949759125709534}, {"step": 9400, "epoch": 26, "train_loss": 0.6906465291976929}, {"epoch_end": 26, "step": 9504, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693342041015625, "val_acc": 0.5, "val_loss": 0.693342041015625}, {"step": 9600, "epoch": 27, "train_loss": 0.6932830810546875}, {"step": 9800, "epoch": 27, "train_loss": 0.6916790008544922}, {"epoch_end": 27, "step": 9856, "eval_split": "validation", "eval_acc": 0.4938, "eval_loss": 0.6933596801757812, "val_acc": 0.4938, "val_loss": 0.6933596801757812}, {"step": 10000, "epoch": 28, "train_loss": 0.6938391327857971}, {"step": 10200, "epoch": 28, "train_loss": 0.6932548880577087}, {"epoch_end": 28, "step": 10208, "eval_split": "validation", "eval_acc": 0.4948, "eval_loss": 0.6933255981445312, "val_acc": 0.4948, "val_loss": 0.6933255981445312}, {"step": 10400, "epoch": 29, "train_loss": 0.6923519372940063}, {"epoch_end": 29, "step": 10560, "eval_split": "validation", "eval_acc": 0.4938, "eval_loss": 0.6932929565429687, "val_acc": 0.4938, "val_loss": 0.6932929565429687}, {"step": 10600, "epoch": 30, "train_loss": 0.6978004574775696}, {"step": 10800, "epoch": 30, "train_loss": 0.7013691067695618}, {"epoch_end": 30, "step": 10912, "eval_split": "validation", "eval_acc": 0.4932, "eval_loss": 0.6933165405273437, "val_acc": 0.4932, "val_loss": 0.6933165405273437}, {"step": 11000, "epoch": 31, "train_loss": 0.6967677474021912}, {"step": 11200, "epoch": 31, "train_loss": 0.6926473379135132}, {"epoch_end": 31, "step": 11264, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6944642578125, "val_acc": 0.5, "val_loss": 0.6944642578125}, {"step": 11400, "epoch": 32, "train_loss": 0.6913284063339233}, {"step": 11600, "epoch": 32, "train_loss": 0.6943497061729431}, {"epoch_end": 32, "step": 11616, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.69360283203125, "val_acc": 0.5, "val_loss": 0.69360283203125}, {"step": 11800, "epoch": 33, "train_loss": 0.6884170770645142}, {"epoch_end": 33, "step": 11968, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.693474267578125, "val_acc": 0.5, "val_loss": 0.693474267578125}, {"step": 12000, "epoch": 34, "train_loss": 0.6932011246681213}, {"step": 12200, "epoch": 34, "train_loss": 0.6934447884559631}, {"epoch_end": 34, "step": 12320, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6933995361328125, "val_acc": 0.5, "val_loss": 0.6933995361328125}, {"step": 12400, "epoch": 35, "train_loss": 0.6944392919540405}, {"step": 12600, "epoch": 35, "train_loss": 0.6931549906730652}, {"epoch_end": 35, "step": 12672, "eval_split": "validation", "eval_acc": 0.5, "eval_loss": 0.6934893188476563, "val_acc": 0.5, "val_loss": 0.6934893188476563}, {"step": 12800, "epoch": 36, "train_loss": 0.6956762075424194}, {"step": 13000, "epoch": 36, "train_loss": 0.6915833353996277}, {"epoch_end": 36, "step": 13024, "eval_split": "validation", "eval_acc": 0.4896, "eval_loss": 0.6934812622070312, "val_acc": 0.4896, "val_loss": 0.6934812622070312}, {"step": 13200, "epoch": 37, "train_loss": 0.6911165714263916}, {"epoch_end": 37, "step": 13376, "eval_split": "validation", "eval_acc": 0.4912, "eval_loss": 0.693531103515625, "val_acc": 0.4912, "val_loss": 0.693531103515625}, {"step": 13400, "epoch": 38, "train_loss": 0.6930030584335327}, {"step": 13600, "epoch": 38, "train_loss": 0.6933897733688354}, {"epoch_end": 38, "step": 13728, "eval_split": "validation", "eval_acc": 0.4908, "eval_loss": 0.69335078125, "val_acc": 0.4908, "val_loss": 0.69335078125}, {"step": 13800, "epoch": 39, "train_loss": 0.6938889026641846}, {"step": 14000, "epoch": 39, "train_loss": 0.6948762536048889}, {"epoch_end": 39, "step": 14080, "eval_split": "validation", "eval_acc": 0.493, "eval_loss": 0.6935481079101562, "val_acc": 0.493, "val_loss": 0.6935481079101562}], "final": {"eval_split": "validation", "eval_acc": 0.493, "eval_loss": 0.6935481079101562, "wall_s": 59.5033061504364, "val_acc": 0.493, "val_loss": 0.6935481079101562}} \ No newline at end of file -- cgit v1.2.3