{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 0, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 20, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "bp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-bp-d20-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": null, "epochs": [ { "epoch": 1, "eval_accuracy": 0.4004, "eval_loss": 1.7710138671875, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 1.6644643401463826 }, { "epoch": 2, "eval_accuracy": 0.5672, "eval_loss": 1.221260009765625, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.2860143685658774 }, { "epoch": 3, "eval_accuracy": 0.6406, "eval_loss": 1.0877959594726563, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.02516774397956 }, { "epoch": 4, "eval_accuracy": 0.6802, "eval_loss": 0.9318223510742187, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 0.8597116688304477 }, { "epoch": 5, "eval_accuracy": 0.7032, "eval_loss": 0.9318287963867188, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.7553892990854051 }, { "epoch": 6, "eval_accuracy": 0.737, "eval_loss": 0.864343017578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.6687519911342197 }, { "epoch": 7, "eval_accuracy": 0.7616, "eval_loss": 0.7147335205078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.6076406918737624 }, { "epoch": 8, "eval_accuracy": 0.7384, "eval_loss": 0.8417417602539062, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.5667279717922211 }, { "epoch": 9, "eval_accuracy": 0.7888, "eval_loss": 0.6749005004882812, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5312818857087029 }, { "epoch": 10, "eval_accuracy": 0.8044, "eval_loss": 0.602718798828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.5028076828956604 }, { "epoch": 11, "eval_accuracy": 0.8276, "eval_loss": 0.5217552856445312, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.4791169890032874 }, { "epoch": 12, "eval_accuracy": 0.7946, "eval_loss": 0.63441904296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.4623024181683858 }, { "epoch": 13, "eval_accuracy": 0.6858, "eval_loss": 1.0865167114257812, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.43909971352683175 }, { "epoch": 14, "eval_accuracy": 0.8122, "eval_loss": 0.5628994506835937, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.42348679066763983 }, { "epoch": 15, "eval_accuracy": 0.8034, "eval_loss": 0.6175327880859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.41002807636260985 }, { "epoch": 16, "eval_accuracy": 0.8388, "eval_loss": 0.50029931640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.39710193020502726 }, { "epoch": 17, "eval_accuracy": 0.8058, "eval_loss": 0.578526904296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.3893488602956136 }, { "epoch": 18, "eval_accuracy": 0.8182, "eval_loss": 0.56311103515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.38157559702661303 }, { "epoch": 19, "eval_accuracy": 0.8238, "eval_loss": 0.5585554077148438, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.3700638519499037 }, { "epoch": 20, "eval_accuracy": 0.8182, "eval_loss": 0.6097387573242188, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.3558312208970388 }, { "epoch": 21, "eval_accuracy": 0.8246, "eval_loss": 0.5422500793457031, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.3505221447202894 }, { "epoch": 22, "eval_accuracy": 0.8226, "eval_loss": 0.5890034423828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.3476858967781067 }, { "epoch": 23, "eval_accuracy": 0.8584, "eval_loss": 0.45730882568359377, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.3428149689250522 }, { "epoch": 24, "eval_accuracy": 0.8518, "eval_loss": 0.48339465942382814, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.3287880612267388 }, { "epoch": 25, "eval_accuracy": 0.8414, "eval_loss": 0.4980908935546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.32596546165678236 }, { "epoch": 26, "eval_accuracy": 0.8368, "eval_loss": 0.5045202209472657, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.31808142843776277 }, { "epoch": 27, "eval_accuracy": 0.8258, "eval_loss": 0.5857073852539062, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.31575259125762517 }, { "epoch": 28, "eval_accuracy": 0.8596, "eval_loss": 0.4352029235839844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.30214522661368054 }, { "epoch": 29, "eval_accuracy": 0.8388, "eval_loss": 0.5140209655761718, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.3071780029588275 }, { "epoch": 30, "eval_accuracy": 0.844, "eval_loss": 0.5278230224609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.30251549474928113 }, { "epoch": 31, "eval_accuracy": 0.8484, "eval_loss": 0.4901044494628906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.2975416218333774 }, { "epoch": 32, "eval_accuracy": 0.8412, "eval_loss": 0.49973211669921874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.28743110587861803 }, { "epoch": 33, "eval_accuracy": 0.859, "eval_loss": 0.45563653564453127, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.2848365594731437 }, { "epoch": 34, "eval_accuracy": 0.8556, "eval_loss": 0.4716713928222656, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.2897914389504327 }, { "epoch": 35, "eval_accuracy": 0.8738, "eval_loss": 0.4081214294433594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.2804644786781735 }, { "epoch": 36, "eval_accuracy": 0.8702, "eval_loss": 0.4287448791503906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.27175004272990755 }, { "epoch": 37, "eval_accuracy": 0.8618, "eval_loss": 0.4426470031738281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.27865564083125854 }, { "epoch": 38, "eval_accuracy": 0.8396, "eval_loss": 0.5234903503417969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.26684371184772915 }, { "epoch": 39, "eval_accuracy": 0.855, "eval_loss": 0.48744876708984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.2674422241899702 }, { "epoch": 40, "eval_accuracy": 0.865, "eval_loss": 0.4351408203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.2645341257254283 }, { "epoch": 41, "eval_accuracy": 0.8506, "eval_loss": 0.4751714965820312, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.2622300498406092 }, { "epoch": 42, "eval_accuracy": 0.8486, "eval_loss": 0.5085056274414063, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.25661233155727387 }, { "epoch": 43, "eval_accuracy": 0.8576, "eval_loss": 0.4584455322265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.256074648004108 }, { "epoch": 44, "eval_accuracy": 0.805, "eval_loss": 0.6773380615234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.25414007183975645 }, { "epoch": 45, "eval_accuracy": 0.867, "eval_loss": 0.458577587890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.24826880225075615 }, { "epoch": 46, "eval_accuracy": 0.8544, "eval_loss": 0.47776199951171877, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.2539279241243998 }, { "epoch": 47, "eval_accuracy": 0.864, "eval_loss": 0.44519176635742186, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.2478049456278483 }, { "epoch": 48, "eval_accuracy": 0.8556, "eval_loss": 0.466750341796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.24715948182211983 }, { "epoch": 49, "eval_accuracy": 0.8706, "eval_loss": 0.45115664672851563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.24359825609525046 }, { "epoch": 50, "eval_accuracy": 0.8546, "eval_loss": 0.4703095520019531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.24361659493313895 }, { "epoch": 51, "eval_accuracy": 0.8532, "eval_loss": 0.5028222534179687, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.24154270447625054 }, { "epoch": 52, "eval_accuracy": 0.8768, "eval_loss": 0.4012300231933594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.23156300439834596 }, { "epoch": 53, "eval_accuracy": 0.8702, "eval_loss": 0.43121511840820315, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.23431335463523864 }, { "epoch": 54, "eval_accuracy": 0.8506, "eval_loss": 0.47547684326171874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.23226308568848503 }, { "epoch": 55, "eval_accuracy": 0.8574, "eval_loss": 0.47655361328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.23324218198458355 }, { "epoch": 56, "eval_accuracy": 0.8666, "eval_loss": 0.43212182006835936, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.23033563688066272 }, { "epoch": 57, "eval_accuracy": 0.8346, "eval_loss": 0.5559804565429688, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.23134963205655415 }, { "epoch": 58, "eval_accuracy": 0.8638, "eval_loss": 0.4514068420410156, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.2259135717921787 }, { "epoch": 59, "eval_accuracy": 0.8464, "eval_loss": 0.4881473083496094, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.2296271209306187 }, { "epoch": 60, "eval_accuracy": 0.862, "eval_loss": 0.48375531005859373, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.22572548664675818 }, { "epoch": 61, "eval_accuracy": 0.8684, "eval_loss": 0.43897296142578124, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.22529616802533467 }, { "epoch": 62, "eval_accuracy": 0.8742, "eval_loss": 0.39048966674804686, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.2210662999153137 }, { "epoch": 63, "eval_accuracy": 0.8618, "eval_loss": 0.4357768005371094, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.2175708965169059 }, { "epoch": 64, "eval_accuracy": 0.8634, "eval_loss": 0.46370264282226564, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.21798163765536413 }, { "epoch": 65, "eval_accuracy": 0.8574, "eval_loss": 0.47452117309570313, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.22943376750946046 }, { "epoch": 66, "eval_accuracy": 0.8706, "eval_loss": 0.42474490966796874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.22070531824032466 }, { "epoch": 67, "eval_accuracy": 0.8738, "eval_loss": 0.43662334594726565, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.21509841103288863 }, { "epoch": 68, "eval_accuracy": 0.8518, "eval_loss": 0.47741646728515624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.21424531423250834 }, { "epoch": 69, "eval_accuracy": 0.8728, "eval_loss": 0.445956689453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.20924902565744188 }, { "epoch": 70, "eval_accuracy": 0.8602, "eval_loss": 0.4686448669433594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.21512837672498492 }, { "epoch": 71, "eval_accuracy": 0.8564, "eval_loss": 0.511124951171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.2124501904964447 }, { "epoch": 72, "eval_accuracy": 0.8566, "eval_loss": 0.4767055786132812, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.2073291993273629 }, { "epoch": 73, "eval_accuracy": 0.8534, "eval_loss": 0.5192368408203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.21053057844903733 }, { "epoch": 74, "eval_accuracy": 0.8766, "eval_loss": 0.38260752563476563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.21595640751520792 }, { "epoch": 75, "eval_accuracy": 0.8756, "eval_loss": 0.4221235717773438, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.21067103199164072 }, { "epoch": 76, "eval_accuracy": 0.876, "eval_loss": 0.42229520263671877, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.20760168025758532 }, { "epoch": 77, "eval_accuracy": 0.8816, "eval_loss": 0.41327566528320314, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.20539346924357943 }, { "epoch": 78, "eval_accuracy": 0.855, "eval_loss": 0.4727892761230469, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.20733415001233418 }, { "epoch": 79, "eval_accuracy": 0.8538, "eval_loss": 0.5247862976074219, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.20816828174591065 }, { "epoch": 80, "eval_accuracy": 0.8562, "eval_loss": 0.5231691284179687, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.20593991249402363 }, { "epoch": 81, "eval_accuracy": 0.8644, "eval_loss": 0.434323828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.20798121780554454 }, { "epoch": 82, "eval_accuracy": 0.8718, "eval_loss": 0.43466107177734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.2018360275056627 }, { "epoch": 83, "eval_accuracy": 0.873, "eval_loss": 0.4336739562988281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.20214488338894315 }, { "epoch": 84, "eval_accuracy": 0.8738, "eval_loss": 0.4181335754394531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.20384543903138902 }, { "epoch": 85, "eval_accuracy": 0.8588, "eval_loss": 0.5384344909667969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.20373935463693407 }, { "epoch": 86, "eval_accuracy": 0.8714, "eval_loss": 0.4508935974121094, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.20023504439459908 }, { "epoch": 87, "eval_accuracy": 0.8722, "eval_loss": 0.4011263122558594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.20357054704560174 }, { "epoch": 88, "eval_accuracy": 0.8724, "eval_loss": 0.42971153564453124, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.2017909148454666 }, { "epoch": 89, "eval_accuracy": 0.8508, "eval_loss": 0.5215956726074219, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.19414195964336395 }, { "epoch": 90, "eval_accuracy": 0.8584, "eval_loss": 0.5140850219726563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.19675261680814954 }, { "epoch": 91, "eval_accuracy": 0.8542, "eval_loss": 0.5065567810058593, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.20285941220124562 }, { "epoch": 92, "eval_accuracy": 0.8632, "eval_loss": 0.4859201049804687, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.19762985503408645 }, { "epoch": 93, "eval_accuracy": 0.8656, "eval_loss": 0.4395970275878906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.18883612869050767 }, { "epoch": 94, "eval_accuracy": 0.8754, "eval_loss": 0.4072813049316406, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.20028164596822526 }, { "epoch": 95, "eval_accuracy": 0.876, "eval_loss": 0.4278625915527344, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.18935567673047385 }, { "epoch": 96, "eval_accuracy": 0.8754, "eval_loss": 0.448179248046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.1924068394528495 }, { "epoch": 97, "eval_accuracy": 0.859, "eval_loss": 0.4913785766601563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.19636243831846448 }, { "epoch": 98, "eval_accuracy": 0.8798, "eval_loss": 0.39225457153320314, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.19402525822851394 }, { "epoch": 99, "eval_accuracy": 0.8718, "eval_loss": 0.4399384094238281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.19180790162351397 }, { "epoch": 100, "eval_accuracy": 0.8756, "eval_loss": 0.44355946044921873, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.19071120822164747 }, { "epoch": 101, "eval_accuracy": 0.9076, "eval_loss": 0.306420263671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.12239563805394703 }, { "epoch": 102, "eval_accuracy": 0.9104, "eval_loss": 0.30657166137695313, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.09218944064643649 }, { "epoch": 103, "eval_accuracy": 0.9124, "eval_loss": 0.298024169921875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.08602881506813898 }, { "epoch": 104, "eval_accuracy": 0.91, "eval_loss": 0.30647501831054685, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.07542413108613756 }, { "epoch": 105, "eval_accuracy": 0.9144, "eval_loss": 0.3046997314453125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.07289705408944024 }, { "epoch": 106, "eval_accuracy": 0.9158, "eval_loss": 0.30186732177734377, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.06816188242700365 }, { "epoch": 107, "eval_accuracy": 0.9152, "eval_loss": 0.3045905822753906, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.06303669462733799 }, { "epoch": 108, "eval_accuracy": 0.9138, "eval_loss": 0.31312174072265625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.06031152280039258 }, { "epoch": 109, "eval_accuracy": 0.913, "eval_loss": 0.3162181823730469, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.05866686734623379 }, { "epoch": 110, "eval_accuracy": 0.916, "eval_loss": 0.3138496337890625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.0575275326596366 }, { "epoch": 111, "eval_accuracy": 0.9168, "eval_loss": 0.31661144409179687, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.05273066160678864 }, { "epoch": 112, "eval_accuracy": 0.9194, "eval_loss": 0.3204001953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.05101389784415563 }, { "epoch": 113, "eval_accuracy": 0.9174, "eval_loss": 0.33216910400390626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.04935557192696465 }, { "epoch": 114, "eval_accuracy": 0.9158, "eval_loss": 0.33527969970703125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.04651711027887132 }, { "epoch": 115, "eval_accuracy": 0.9148, "eval_loss": 0.3381342224121094, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.046925569189919365 }, { "epoch": 116, "eval_accuracy": 0.9182, "eval_loss": 0.33178223266601564, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.042672778570652006 }, { "epoch": 117, "eval_accuracy": 0.9158, "eval_loss": 0.34461751098632815, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.044006208296616875 }, { "epoch": 118, "eval_accuracy": 0.917, "eval_loss": 0.3422942260742188, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.04278108269870281 }, { "epoch": 119, "eval_accuracy": 0.9158, "eval_loss": 0.34879398803710937, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.039726313829421996 }, { "epoch": 120, "eval_accuracy": 0.9192, "eval_loss": 0.3475035583496094, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.0380223665383127 }, { "epoch": 121, "eval_accuracy": 0.9174, "eval_loss": 0.35022559814453125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.037888774723476834 }, { "epoch": 122, "eval_accuracy": 0.9158, "eval_loss": 0.34550585327148436, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.03741276666960783 }, { "epoch": 123, "eval_accuracy": 0.9174, "eval_loss": 0.3567695190429688, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.03865679248174032 }, { "epoch": 124, "eval_accuracy": 0.9176, "eval_loss": 0.35861453857421877, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.035508182628618344 }, { "epoch": 125, "eval_accuracy": 0.9162, "eval_loss": 0.35652288208007815, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.036840546764598955 }, { "epoch": 126, "eval_accuracy": 0.918, "eval_loss": 0.35606851806640627, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.03339896608259943 }, { "epoch": 127, "eval_accuracy": 0.9166, "eval_loss": 0.36003599243164064, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.034402696437305876 }, { "epoch": 128, "eval_accuracy": 0.9166, "eval_loss": 0.36662847900390627, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.03277938154472245 }, { "epoch": 129, "eval_accuracy": 0.9194, "eval_loss": 0.36271561279296877, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.0318130090382364 }, { "epoch": 130, "eval_accuracy": 0.9186, "eval_loss": 0.36240728149414064, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.0301810850335492 }, { "epoch": 131, "eval_accuracy": 0.9156, "eval_loss": 0.36919815063476563, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.03182596413758066 }, { "epoch": 132, "eval_accuracy": 0.9184, "eval_loss": 0.3730984680175781, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.03062839696539773 }, { "epoch": 133, "eval_accuracy": 0.9164, "eval_loss": 0.37771748046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.028816458198097018 }, { "epoch": 134, "eval_accuracy": 0.9186, "eval_loss": 0.3720545104980469, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.029397612818082175 }, { "epoch": 135, "eval_accuracy": 0.9176, "eval_loss": 0.3824631408691406, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.028310401866502233 }, { "epoch": 136, "eval_accuracy": 0.9184, "eval_loss": 0.3975944519042969, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.027445427227682537 }, { "epoch": 137, "eval_accuracy": 0.9154, "eval_loss": 0.388535009765625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.028050902290145556 }, { "epoch": 138, "eval_accuracy": 0.9144, "eval_loss": 0.39537998046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.027626405088106792 }, { "epoch": 139, "eval_accuracy": 0.9174, "eval_loss": 0.3798079833984375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.02575553153918849 }, { "epoch": 140, "eval_accuracy": 0.9154, "eval_loss": 0.3928522644042969, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.026475244792302448 }, { "epoch": 141, "eval_accuracy": 0.9176, "eval_loss": 0.38615267944335935, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.026054457494947645 }, { "epoch": 142, "eval_accuracy": 0.9152, "eval_loss": 0.3925371520996094, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.024948420998040174 }, { "epoch": 143, "eval_accuracy": 0.9142, "eval_loss": 0.40529662475585937, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.025066455528471206 }, { "epoch": 144, "eval_accuracy": 0.9148, "eval_loss": 0.3978242797851563, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.023501766060127154 }, { "epoch": 145, "eval_accuracy": 0.9146, "eval_loss": 0.3887966552734375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.02534153993262185 }, { "epoch": 146, "eval_accuracy": 0.9182, "eval_loss": 0.3958949401855469, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.025001446268293592 }, { "epoch": 147, "eval_accuracy": 0.9152, "eval_loss": 0.3987830993652344, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.024140962322553 }, { "epoch": 148, "eval_accuracy": 0.9128, "eval_loss": 0.3882256103515625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.02524253683288892 }, { "epoch": 149, "eval_accuracy": 0.9156, "eval_loss": 0.39553275756835937, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.024576971726285087 }, { "epoch": 150, "eval_accuracy": 0.9168, "eval_loss": 0.389462451171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.022645456993414297 }, { "epoch": 151, "eval_accuracy": 0.9182, "eval_loss": 0.38770169067382815, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.01990334998567899 }, { "epoch": 152, "eval_accuracy": 0.9184, "eval_loss": 0.38250919189453125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.018938107203278275 }, { "epoch": 153, "eval_accuracy": 0.9152, "eval_loss": 0.38870892333984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.019380051201913093 }, { "epoch": 154, "eval_accuracy": 0.9174, "eval_loss": 0.38606708984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.01811076421704557 }, { "epoch": 155, "eval_accuracy": 0.917, "eval_loss": 0.38509130859375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.017462889037529628 }, { "epoch": 156, "eval_accuracy": 0.9178, "eval_loss": 0.3827947204589844, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.017325110151370365 }, { "epoch": 157, "eval_accuracy": 0.9174, "eval_loss": 0.3864782897949219, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.017640994083881378 }, { "epoch": 158, "eval_accuracy": 0.9168, "eval_loss": 0.3881909729003906, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.017731406083785824 }, { "epoch": 159, "eval_accuracy": 0.9178, "eval_loss": 0.38386309204101565, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.01699283284942309 }, { "epoch": 160, "eval_accuracy": 0.9176, "eval_loss": 0.38543032836914065, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.017252897179871798 }, { "epoch": 161, "eval_accuracy": 0.917, "eval_loss": 0.3836103637695312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.016278477271108163 }, { "epoch": 162, "eval_accuracy": 0.9164, "eval_loss": 0.388681640625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.01604987183109754 }, { "epoch": 163, "eval_accuracy": 0.9186, "eval_loss": 0.38605330200195315, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.01634608430729972 }, { "epoch": 164, "eval_accuracy": 0.918, "eval_loss": 0.38527861328125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.015447496734228398 }, { "epoch": 165, "eval_accuracy": 0.9162, "eval_loss": 0.39043060913085936, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.016543969903389612 }, { "epoch": 166, "eval_accuracy": 0.9168, "eval_loss": 0.3898049377441406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.016445220247407754 }, { "epoch": 167, "eval_accuracy": 0.917, "eval_loss": 0.3887971130371094, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.016121218882666693 }, { "epoch": 168, "eval_accuracy": 0.9172, "eval_loss": 0.3925276428222656, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.015302956238720153 }, { "epoch": 169, "eval_accuracy": 0.9184, "eval_loss": 0.3891949768066406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.01579265182117621 }, { "epoch": 170, "eval_accuracy": 0.916, "eval_loss": 0.3865777526855469, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.015928712855113877 }, { "epoch": 171, "eval_accuracy": 0.9184, "eval_loss": 0.3891114501953125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.01610312660369608 }, { "epoch": 172, "eval_accuracy": 0.9178, "eval_loss": 0.3897466430664063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.015435847022467189 }, { "epoch": 173, "eval_accuracy": 0.917, "eval_loss": 0.39024139404296876, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.016074572068452836 }, { "epoch": 174, "eval_accuracy": 0.9178, "eval_loss": 0.3874936279296875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.01542677370963825 }, { "epoch": 175, "eval_accuracy": 0.9168, "eval_loss": 0.3924413757324219, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.014539433761768871 }, { "epoch": 176, "eval_accuracy": 0.9176, "eval_loss": 0.38622310791015624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.01533671252793736 }, { "epoch": 177, "eval_accuracy": 0.9186, "eval_loss": 0.39207570190429686, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.01441938015388118 }, { "epoch": 178, "eval_accuracy": 0.9172, "eval_loss": 0.394850341796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.015913767455352678 }, { "epoch": 179, "eval_accuracy": 0.9184, "eval_loss": 0.3906371459960937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.015869515031576156 }, { "epoch": 180, "eval_accuracy": 0.9184, "eval_loss": 0.3919496215820312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.014408293558988306 }, { "epoch": 181, "eval_accuracy": 0.9196, "eval_loss": 0.3897723571777344, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.01504027492403984 }, { "epoch": 182, "eval_accuracy": 0.9188, "eval_loss": 0.3978993347167969, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.015615745646092628 }, { "epoch": 183, "eval_accuracy": 0.919, "eval_loss": 0.39478623046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.015364365304840935 }, { "epoch": 184, "eval_accuracy": 0.9186, "eval_loss": 0.39719932250976564, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.014254255270957947 }, { "epoch": 185, "eval_accuracy": 0.9188, "eval_loss": 0.3978095458984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.01493217945512798 }, { "epoch": 186, "eval_accuracy": 0.9186, "eval_loss": 0.39569725341796874, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.013478640712632073 }, { "epoch": 187, "eval_accuracy": 0.9166, "eval_loss": 0.39535325317382813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.013779820157090823 }, { "epoch": 188, "eval_accuracy": 0.9184, "eval_loss": 0.3943298767089844, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.014935846232540078 }, { "epoch": 189, "eval_accuracy": 0.9178, "eval_loss": 0.39513787841796877, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.014631074411628975 }, { "epoch": 190, "eval_accuracy": 0.917, "eval_loss": 0.3951256713867187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.01456148929099242 }, { "epoch": 191, "eval_accuracy": 0.9182, "eval_loss": 0.3951748596191406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.013960837727391885 }, { "epoch": 192, "eval_accuracy": 0.9178, "eval_loss": 0.39580638427734377, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.014646381699293852 }, { "epoch": 193, "eval_accuracy": 0.9184, "eval_loss": 0.3964273864746094, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.013860816383361816 }, { "epoch": 194, "eval_accuracy": 0.9186, "eval_loss": 0.3953535705566406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.013962972517146005 }, { "epoch": 195, "eval_accuracy": 0.9196, "eval_loss": 0.3967518371582031, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.013807961952024037 }, { "epoch": 196, "eval_accuracy": 0.9182, "eval_loss": 0.3972501220703125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.014517988362577226 }, { "epoch": 197, "eval_accuracy": 0.9184, "eval_loss": 0.3951761962890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.01375881134768327 }, { "epoch": 198, "eval_accuracy": 0.9164, "eval_loss": 0.39577669677734373, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.013727891698976358 }, { "epoch": 199, "eval_accuracy": 0.918, "eval_loss": 0.3989869873046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.014122135368155108 }, { "epoch": 200, "eval_accuracy": 0.9176, "eval_loss": 0.39629163818359375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.014614876673618953 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.9176, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.39629163818359375, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2017119744, "peak_memory_reserved_bytes": 2464153600, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 21.029086351394653, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1224.873178243637, "train_wall_s": 1203.823739528656 }, "work": { "apical_macs_per_example": 0, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 0, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 729918720000000, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 0, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1094878080000000 } }