1
|
{"args": {"mode": "bp", "dataset": "hierarchical", "depth": 1, "width": 64, "act": "tanh", "residual": 1, "epochs": 25, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 6, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.03, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 1, "raw_scale_control": "none", "learn_A": 1, "learn_P": 1, "p_neutral": 1, "p_warmup_steps": 200, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_mode": "soma", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 200, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "depthtask_dev_v1_hierarchical_bp_w64_d1_t0_s0", "n_in": 64, "n_out": 10}, "split": {"dataset": "hierarchical", "task_seed": 0, "train_examples": 45000, "test_examples": 10000, "evaluation_split": "validation", "synthetic_generator": true, "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "f5282ed201086357dbe24c23e70cc9eb86deaaf70d99c41553ffc78626ee8d6c", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "split_from_training_only": true}, "provenance": {"git_commit": "a0696a3d72cc5bf69876e1716b74f7e1ac525dd0", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.4180097579956055}, {"step": 200, "epoch": 0, "train_loss": 1.7349522113800049}, {"epoch_end": 0, "step": 352, "eval_split": "validation", "eval_acc": 0.3352, "eval_loss": 1.8947329833984374, "val_acc": 0.3352, "val_loss": 1.8947329833984374}, {"step": 400, "epoch": 1, "train_loss": 1.7823184728622437}, {"step": 600, "epoch": 1, "train_loss": 1.7122774124145508}, {"epoch_end": 1, "step": 704, "eval_split": "validation", "eval_acc": 0.3418, "eval_loss": 1.8817173095703126, "val_acc": 0.3418, "val_loss": 1.8817173095703126}, {"step": 800, "epoch": 2, "train_loss": 1.6958614587783813}, {"step": 1000, "epoch": 2, "train_loss": 1.7972378730773926}, {"epoch_end": 2, "step": 1056, "eval_split": "validation", "eval_acc": 0.3496, "eval_loss": 1.862398828125, "val_acc": 0.3496, "val_loss": 1.862398828125}, {"step": 1200, "epoch": 3, "train_loss": 1.593858003616333}, {"step": 1400, "epoch": 3, "train_loss": 1.5995712280273438}, {"epoch_end": 3, "step": 1408, "eval_split": "validation", "eval_acc": 0.3586, "eval_loss": 1.846577880859375, "val_acc": 0.3586, "val_loss": 1.846577880859375}, {"step": 1600, "epoch": 4, "train_loss": 1.6386404037475586}, {"epoch_end": 4, "step": 1760, "eval_split": "validation", "eval_acc": 0.3694, "eval_loss": 1.81514814453125, "val_acc": 0.3694, "val_loss": 1.81514814453125}, {"step": 1800, "epoch": 5, "train_loss": 1.808537483215332}, {"step": 2000, "epoch": 5, "train_loss": 1.6063623428344727}, {"epoch_end": 5, "step": 2112, "eval_split": "validation", "eval_acc": 0.3666, "eval_loss": 1.7993331787109375, "val_acc": 0.3666, "val_loss": 1.7993331787109375}, {"step": 2200, "epoch": 6, "train_loss": 1.622808575630188}, {"step": 2400, "epoch": 6, "train_loss": 1.5499234199523926}, {"epoch_end": 6, "step": 2464, "eval_split": "validation", "eval_acc": 0.3756, "eval_loss": 1.7813814697265624, "val_acc": 0.3756, "val_loss": 1.7813814697265624}, {"step": 2600, "epoch": 7, "train_loss": 1.5938136577606201}, {"step": 2800, "epoch": 7, "train_loss": 1.7228647470474243}, {"epoch_end": 7, "step": 2816, "eval_split": "validation", "eval_acc": 0.3806, "eval_loss": 1.7557990966796875, "val_acc": 0.3806, "val_loss": 1.7557990966796875}, {"step": 3000, "epoch": 8, "train_loss": 1.5742205381393433}, {"epoch_end": 8, "step": 3168, "eval_split": "validation", "eval_acc": 0.3878, "eval_loss": 1.75081669921875, "val_acc": 0.3878, "val_loss": 1.75081669921875}, {"step": 3200, "epoch": 9, "train_loss": 1.5627541542053223}, {"step": 3400, "epoch": 9, "train_loss": 1.5008689165115356}, {"epoch_end": 9, "step": 3520, "eval_split": "validation", "eval_acc": 0.3828, "eval_loss": 1.74557509765625, "val_acc": 0.3828, "val_loss": 1.74557509765625}, {"step": 3600, "epoch": 10, "train_loss": 1.518060326576233}, {"step": 3800, "epoch": 10, "train_loss": 1.3843923807144165}, {"epoch_end": 10, "step": 3872, "eval_split": "validation", "eval_acc": 0.3936, "eval_loss": 1.7410957763671875, "val_acc": 0.3936, "val_loss": 1.7410957763671875}, {"step": 4000, "epoch": 11, "train_loss": 1.6026524305343628}, {"step": 4200, "epoch": 11, "train_loss": 1.6293758153915405}, {"epoch_end": 11, "step": 4224, "eval_split": "validation", "eval_acc": 0.393, "eval_loss": 1.7204920166015625, "val_acc": 0.393, "val_loss": 1.7204920166015625}, {"step": 4400, "epoch": 12, "train_loss": 1.6586055755615234}, {"epoch_end": 12, "step": 4576, "eval_split": "validation", "eval_acc": 0.3854, "eval_loss": 1.7557451171875, "val_acc": 0.3854, "val_loss": 1.7557451171875}, {"step": 4600, "epoch": 13, "train_loss": 1.4167895317077637}, {"step": 4800, "epoch": 13, "train_loss": 1.5495729446411133}, {"epoch_end": 13, "step": 4928, "eval_split": "validation", "eval_acc": 0.3844, "eval_loss": 1.7392519775390625, "val_acc": 0.3844, "val_loss": 1.7392519775390625}, {"step": 5000, "epoch": 14, "train_loss": 1.2447478771209717}, {"step": 5200, "epoch": 14, "train_loss": 1.4339793920516968}, {"epoch_end": 14, "step": 5280, "eval_split": "validation", "eval_acc": 0.3948, "eval_loss": 1.7428477294921876, "val_acc": 0.3948, "val_loss": 1.7428477294921876}, {"step": 5400, "epoch": 15, "train_loss": 1.7283892631530762}, {"step": 5600, "epoch": 15, "train_loss": 1.3699817657470703}, {"epoch_end": 15, "step": 5632, "eval_split": "validation", "eval_acc": 0.4036, "eval_loss": 1.7237943603515624, "val_acc": 0.4036, "val_loss": 1.7237943603515624}, {"step": 5800, "epoch": 16, "train_loss": 1.3725944757461548}, {"epoch_end": 16, "step": 5984, "eval_split": "validation", "eval_acc": 0.3978, "eval_loss": 1.7360341064453124, "val_acc": 0.3978, "val_loss": 1.7360341064453124}, {"step": 6000, "epoch": 17, "train_loss": 1.3971965312957764}, {"step": 6200, "epoch": 17, "train_loss": 1.3876622915267944}, {"epoch_end": 17, "step": 6336, "eval_split": "validation", "eval_acc": 0.4012, "eval_loss": 1.7350836669921874, "val_acc": 0.4012, "val_loss": 1.7350836669921874}, {"step": 6400, "epoch": 18, "train_loss": 1.267738938331604}, {"step": 6600, "epoch": 18, "train_loss": 1.4521484375}, {"epoch_end": 18, "step": 6688, "eval_split": "validation", "eval_acc": 0.4072, "eval_loss": 1.7213315673828125, "val_acc": 0.4072, "val_loss": 1.7213315673828125}, {"step": 6800, "epoch": 19, "train_loss": 1.4703563451766968}, {"step": 7000, "epoch": 19, "train_loss": 1.2981882095336914}, {"epoch_end": 19, "step": 7040, "eval_split": "validation", "eval_acc": 0.4064, "eval_loss": 1.706935205078125, "val_acc": 0.4064, "val_loss": 1.706935205078125}, {"step": 7200, "epoch": 20, "train_loss": 1.5431913137435913}, {"epoch_end": 20, "step": 7392, "eval_split": "validation", "eval_acc": 0.403, "eval_loss": 1.7214145751953125, "val_acc": 0.403, "val_loss": 1.7214145751953125}, {"step": 7400, "epoch": 21, "train_loss": 1.3633081912994385}, {"step": 7600, "epoch": 21, "train_loss": 1.3754812479019165}, {"epoch_end": 21, "step": 7744, "eval_split": "validation", "eval_acc": 0.4022, "eval_loss": 1.711796533203125, "val_acc": 0.4022, "val_loss": 1.711796533203125}, {"step": 7800, "epoch": 22, "train_loss": 1.505449891090393}, {"step": 8000, "epoch": 22, "train_loss": 1.436380386352539}, {"epoch_end": 22, "step": 8096, "eval_split": "validation", "eval_acc": 0.4126, "eval_loss": 1.6952454345703125, "val_acc": 0.4126, "val_loss": 1.6952454345703125}, {"step": 8200, "epoch": 23, "train_loss": 1.330977201461792}, {"step": 8400, "epoch": 23, "train_loss": 1.526324987411499}, {"epoch_end": 23, "step": 8448, "eval_split": "validation", "eval_acc": 0.409, "eval_loss": 1.6973236328125, "val_acc": 0.409, "val_loss": 1.6973236328125}, {"step": 8600, "epoch": 24, "train_loss": 1.3941482305526733}, {"epoch_end": 24, "step": 8800, "eval_split": "validation", "eval_acc": 0.408, "eval_loss": 1.6856623291015624, "val_acc": 0.408, "val_loss": 1.6856623291015624}], "final": {"eval_split": "validation", "eval_acc": 0.408, "eval_loss": 1.6856623291015624, "wall_s": 14.246614694595337, "val_acc": 0.408, "val_loss": 1.6856623291015624}}
|