{ "architecture": { "adaptive_apical_parameters": 0, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_traffic_coefficients": 0, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 0, "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/home/yurenh2/sdrn/data", "depth": 20, "device": "cuda:0", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 20, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mode": "bp", "momentum": 0.9, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "results/oral_a_dev/bp_reference_primary.json", "output_lr": null, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 0, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_warmup_examples": 0 }, "diagnostics": null, "epochs": [ { "epoch": 1, "lr": 0.1, "output_lr": 0.1, "step": 352, "train_examples": 45000, "train_loss": 1.629477106920878 }, { "epoch": 2, "lr": 0.1, "output_lr": 0.1, "step": 704, "train_examples": 45000, "train_loss": 1.1536506812625462 }, { "epoch": 3, "lr": 0.1, "output_lr": 0.1, "step": 1056, "train_examples": 45000, "train_loss": 0.9180113962067498 }, { "epoch": 4, "lr": 0.1, "output_lr": 0.1, "step": 1408, "train_examples": 45000, "train_loss": 0.778831071917216 }, { "epoch": 5, "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.6890841632313198 }, { "epoch": 6, "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.6290077259063721 }, { "epoch": 7, "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.5832801877975464 }, { "epoch": 8, "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.543322308868832 }, { "epoch": 9, "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5136268635855781 }, { "epoch": 10, "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.4896943368858761 }, { "epoch": 11, "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.472258512157864 }, { "epoch": 12, "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.4496769655333625 }, { "epoch": 13, "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.4295078576935662 }, { "epoch": 14, "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.4181124239179823 }, { "epoch": 15, "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.40270601289007396 }, { "epoch": 16, "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.39158849102656046 }, { "epoch": 17, "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.3856213444179959 }, { "epoch": 18, "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.3813650788201226 }, { "epoch": 19, "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.3676941867086622 }, { "epoch": 20, "eval_accuracy": 0.8102, "eval_loss": 0.62576728515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.3598926120493147 }, { "epoch": 21, "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.3462830693827735 }, { "epoch": 22, "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.34032730323473614 }, { "epoch": 23, "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.3366120978249444 }, { "epoch": 24, "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.3290186872588264 }, { "epoch": 25, "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.3262175612237718 }, { "epoch": 26, "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.32130949290593463 }, { "epoch": 27, "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.3114652105993695 }, { "epoch": 28, "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.30679907630284625 }, { "epoch": 29, "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.3038229338857863 }, { "epoch": 30, "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.29693536558151246 }, { "epoch": 31, "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.2942162125375536 }, { "epoch": 32, "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.2900532486173842 }, { "epoch": 33, "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.2877517813046773 }, { "epoch": 34, "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.2830353302425808 }, { "epoch": 35, "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.27711815487013924 }, { "epoch": 36, "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.27821736765967475 }, { "epoch": 37, "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.27669897685580785 }, { "epoch": 38, "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.26504462584919397 }, { "epoch": 39, "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.2690969581815931 }, { "epoch": 40, "eval_accuracy": 0.8656, "eval_loss": 0.4462982849121094, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.2612774503389994 }, { "epoch": 41, "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.2594946438206567 }, { "epoch": 42, "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.25380932817988927 }, { "epoch": 43, "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.25994675586488514 }, { "epoch": 44, "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.257961567179362 }, { "epoch": 45, "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.2525651240958108 }, { "epoch": 46, "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.254560999584198 }, { "epoch": 47, "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.2471615205552843 }, { "epoch": 48, "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.24812334311803183 }, { "epoch": 49, "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.2416081429057651 }, { "epoch": 50, "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.2418114467408922 }, { "epoch": 51, "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.2372267860915926 }, { "epoch": 52, "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.232856031343672 }, { "epoch": 53, "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.2328554102261861 }, { "epoch": 54, "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.23843903945816888 }, { "epoch": 55, "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.23594626662466262 }, { "epoch": 56, "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.23276948260996078 }, { "epoch": 57, "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.2300440298875173 }, { "epoch": 58, "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.22433708667755126 }, { "epoch": 59, "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.23259679017331866 }, { "epoch": 60, "eval_accuracy": 0.8376, "eval_loss": 0.5762138427734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.221930826971266 }, { "epoch": 61, "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.22306284332010481 }, { "epoch": 62, "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.21996720467143588 }, { "epoch": 63, "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.21993547526200613 }, { "epoch": 64, "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.22175351356665293 }, { "epoch": 65, "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.21980250878069135 }, { "epoch": 66, "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.22193617814646827 }, { "epoch": 67, "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.21733659199078878 }, { "epoch": 68, "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.21201883059077792 }, { "epoch": 69, "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.21097899855507746 }, { "epoch": 70, "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.2180972268342972 }, { "epoch": 71, "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.20807346503204768 }, { "epoch": 72, "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.2113001620133718 }, { "epoch": 73, "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.20991453639666238 }, { "epoch": 74, "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.2111522406551573 }, { "epoch": 75, "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.20713426054053835 }, { "epoch": 76, "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.2090695972919464 }, { "epoch": 77, "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.21206452231407166 }, { "epoch": 78, "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.2080325007915497 }, { "epoch": 79, "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.20438791779147253 }, { "epoch": 80, "eval_accuracy": 0.8716, "eval_loss": 0.45828941650390626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.2006779747698042 }, { "epoch": 81, "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.2016580670568678 }, { "epoch": 82, "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.2003150415526496 }, { "epoch": 83, "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.19765809888839722 }, { "epoch": 84, "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.20244128450287713 }, { "epoch": 85, "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.19974544689920212 }, { "epoch": 86, "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.19561397054460314 }, { "epoch": 87, "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.20291065661112467 }, { "epoch": 88, "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.1980198811451594 }, { "epoch": 89, "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.1991081144505077 }, { "epoch": 90, "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.19957862480746374 }, { "epoch": 91, "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.2043161620643404 }, { "epoch": 92, "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.19370153923299577 }, { "epoch": 93, "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.19246835175620186 }, { "epoch": 94, "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.19274455511305066 }, { "epoch": 95, "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.18495470209121703 }, { "epoch": 96, "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.1947995986170239 }, { "epoch": 97, "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.19470539894368913 }, { "epoch": 98, "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.19306121972931756 }, { "epoch": 99, "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.19163403051959144 }, { "epoch": 100, "eval_accuracy": 0.8688, "eval_loss": 0.4629053649902344, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.1941945056743092 }, { "epoch": 101, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.12243073383967082 }, { "epoch": 102, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.09238274479839537 }, { "epoch": 103, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.08373940632475747 }, { "epoch": 104, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.07404987008968988 }, { "epoch": 105, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.07065127567052841 }, { "epoch": 106, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.06621434763802422 }, { "epoch": 107, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.06265637842085627 }, { "epoch": 108, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.06095097218089633 }, { "epoch": 109, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.055481788088215724 }, { "epoch": 110, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.05485475784805086 }, { "epoch": 111, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.052292619497246215 }, { "epoch": 112, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.05090429345236884 }, { "epoch": 113, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.04814498667187161 }, { "epoch": 114, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.04657038381099701 }, { "epoch": 115, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.045128318380978374 }, { "epoch": 116, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.04501160361369451 }, { "epoch": 117, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.04166722600724962 }, { "epoch": 118, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.04189523547887802 }, { "epoch": 119, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.0410013985686832 }, { "epoch": 120, "eval_accuracy": 0.9116, "eval_loss": 0.36133499145507814, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.039646570123897655 }, { "epoch": 121, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.038702496344513365 }, { "epoch": 122, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.03543033310820659 }, { "epoch": 123, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.037469266428550085 }, { "epoch": 124, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.03570658944944541 }, { "epoch": 125, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.036685267938176794 }, { "epoch": 126, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.034107129124800364 }, { "epoch": 127, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.03400421402851741 }, { "epoch": 128, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.03237723284893566 }, { "epoch": 129, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.032963586113188004 }, { "epoch": 130, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.029909599794447423 }, { "epoch": 131, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.03154643616692888 }, { "epoch": 132, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.030607043651739756 }, { "epoch": 133, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.029234873590535587 }, { "epoch": 134, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.027656678012675708 }, { "epoch": 135, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.029045232111877865 }, { "epoch": 136, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.027592006523079343 }, { "epoch": 137, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.028573222221930823 }, { "epoch": 138, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.026246732861631445 }, { "epoch": 139, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.026507694556978014 }, { "epoch": 140, "eval_accuracy": 0.9104, "eval_loss": 0.41732127685546877, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.024990961343050004 }, { "epoch": 141, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.0275127333773507 }, { "epoch": 142, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.024205242278178534 }, { "epoch": 143, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.02479735333588388 }, { "epoch": 144, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.023810774516893757 }, { "epoch": 145, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.025666841644710964 }, { "epoch": 146, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.023461431486739053 }, { "epoch": 147, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.02378552058537801 }, { "epoch": 148, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.023739897603789965 }, { "epoch": 149, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.022505639592144223 }, { "epoch": 150, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.020517713482843505 }, { "epoch": 151, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.019582247539361317 }, { "epoch": 152, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.019260346906714968 }, { "epoch": 153, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.017384963521858057 }, { "epoch": 154, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.017249316464033392 }, { "epoch": 155, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.016512117852105036 }, { "epoch": 156, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.01810812204281489 }, { "epoch": 157, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.017985127888123193 }, { "epoch": 158, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.016650764848291873 }, { "epoch": 159, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.016366760524776248 }, { "epoch": 160, "eval_accuracy": 0.916, "eval_loss": 0.41492218017578125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.017086565133598117 }, { "epoch": 161, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.015958600907524427 }, { "epoch": 162, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.016478912470158605 }, { "epoch": 163, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.016271839502453804 }, { "epoch": 164, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.016035092358125582 }, { "epoch": 165, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.016342996538347667 }, { "epoch": 166, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.015872134373295637 }, { "epoch": 167, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.016195324125885962 }, { "epoch": 168, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.015301043385598394 }, { "epoch": 169, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.015656031346321105 }, { "epoch": 170, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.015911012617084715 }, { "epoch": 171, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.016036496425006125 }, { "epoch": 172, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.015414181932475832 }, { "epoch": 173, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.015800860342052248 }, { "epoch": 174, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.015768850159976217 }, { "epoch": 175, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.015496016425887743 }, { "epoch": 176, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.014675625985695256 }, { "epoch": 177, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.014459471281700664 }, { "epoch": 178, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.015453773557477526 }, { "epoch": 179, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.014391206828753153 }, { "epoch": 180, "eval_accuracy": 0.9152, "eval_loss": 0.41804723510742187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.015613929537600942 }, { "epoch": 181, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.015048576422201263 }, { "epoch": 182, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.01569497499167919 }, { "epoch": 183, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.014797748851279418 }, { "epoch": 184, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.014610261275370916 }, { "epoch": 185, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.013999619007110596 }, { "epoch": 186, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.014426271572377946 }, { "epoch": 187, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.013885394373204973 }, { "epoch": 188, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.014582767293105522 }, { "epoch": 189, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.015294219624665048 }, { "epoch": 190, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.014451671667562591 }, { "epoch": 191, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.014434750450319713 }, { "epoch": 192, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.013754335116677814 }, { "epoch": 193, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.014247742917802599 }, { "epoch": 194, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.01404493830733829 }, { "epoch": 195, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.014140160277816984 }, { "epoch": 196, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.013918220730291473 }, { "epoch": 197, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.01464969994003574 }, { "epoch": 198, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.013554245031542247 }, { "epoch": 199, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.014428260192275047 }, { "epoch": 200, "eval_accuracy": 0.9162, "eval_loss": 0.42326114501953127, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.01528975431472063 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 11 }, "final": { "accuracy": 0.9162, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.42326114501953127, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device": "cuda:0", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 2169162752, "peak_memory_reserved_bytes": 2755657728, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "c8ae43fb284cf5be54066b4c0b5b17dcb088227f", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 3.8121464252471924, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 3405.721784353256, "train_wall_s": 3401.876144886017 }, "work": { "apical_macs_per_example": 0, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 0, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 729918720000000, "local_weight_correlation_macs": 0, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; elementwise nonlinearities and optimizer arithmetic excluded", "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1094878080000000 } }