{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 9, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 56, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 853018, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 0, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 56, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "bp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-bp-d56-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": null, "epochs": [ { "epoch": 1, "eval_accuracy": 0.4062, "eval_loss": 1.6383858154296875, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 1.8120329790115357 }, { "epoch": 2, "eval_accuracy": 0.5926, "eval_loss": 1.153287646484375, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.3592044618182713 }, { "epoch": 3, "eval_accuracy": 0.5084, "eval_loss": 1.90244970703125, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.0838589077843561 }, { "epoch": 4, "eval_accuracy": 0.693, "eval_loss": 0.906397900390625, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 0.8900402983453539 }, { "epoch": 5, "eval_accuracy": 0.7638, "eval_loss": 0.6916922607421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.7705084403991699 }, { "epoch": 6, "eval_accuracy": 0.7054, "eval_loss": 0.94351083984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.6632061253759596 }, { "epoch": 7, "eval_accuracy": 0.7784, "eval_loss": 0.6527540771484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.5979521300209893 }, { "epoch": 8, "eval_accuracy": 0.7632, "eval_loss": 0.7341368408203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.55327621333864 }, { "epoch": 9, "eval_accuracy": 0.8116, "eval_loss": 0.5726607421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5106070032013788 }, { "epoch": 10, "eval_accuracy": 0.7938, "eval_loss": 0.6018488891601562, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.47956937680774264 }, { "epoch": 11, "eval_accuracy": 0.8024, "eval_loss": 0.61379228515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.45889593749046326 }, { "epoch": 12, "eval_accuracy": 0.8038, "eval_loss": 0.6077332397460937, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.438798218621148 }, { "epoch": 13, "eval_accuracy": 0.7766, "eval_loss": 0.7508157470703125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.4087996634165446 }, { "epoch": 14, "eval_accuracy": 0.8144, "eval_loss": 0.5816595092773438, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.39873176553514267 }, { "epoch": 15, "eval_accuracy": 0.84, "eval_loss": 0.48526373901367187, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.3821409888108571 }, { "epoch": 16, "eval_accuracy": 0.832, "eval_loss": 0.5142687622070312, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.36610251981947156 }, { "epoch": 17, "eval_accuracy": 0.8192, "eval_loss": 0.5443266357421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.35214182429843477 }, { "epoch": 18, "eval_accuracy": 0.8386, "eval_loss": 0.49019057006835937, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.341371633805169 }, { "epoch": 19, "eval_accuracy": 0.8502, "eval_loss": 0.4660570251464844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.333972642771403 }, { "epoch": 20, "eval_accuracy": 0.8532, "eval_loss": 0.43096478271484373, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.31695578266514673 }, { "epoch": 21, "eval_accuracy": 0.8168, "eval_loss": 0.60798935546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.30790028344260323 }, { "epoch": 22, "eval_accuracy": 0.8586, "eval_loss": 0.4445894714355469, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.3030786698553297 }, { "epoch": 23, "eval_accuracy": 0.8612, "eval_loss": 0.431785498046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.2980527818997701 }, { "epoch": 24, "eval_accuracy": 0.8438, "eval_loss": 0.5205806335449219, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.2837291211393144 }, { "epoch": 25, "eval_accuracy": 0.863, "eval_loss": 0.4326460021972656, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.27650729268391927 }, { "epoch": 26, "eval_accuracy": 0.8456, "eval_loss": 0.5047505187988282, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.270019421143002 }, { "epoch": 27, "eval_accuracy": 0.8434, "eval_loss": 0.5102612182617188, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.2668691424396303 }, { "epoch": 28, "eval_accuracy": 0.8578, "eval_loss": 0.4414801574707031, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.25704341024292837 }, { "epoch": 29, "eval_accuracy": 0.8668, "eval_loss": 0.4320094970703125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.2572188554790285 }, { "epoch": 30, "eval_accuracy": 0.8714, "eval_loss": 0.408448828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.250815947622723 }, { "epoch": 31, "eval_accuracy": 0.837, "eval_loss": 0.5562254150390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.248208172082901 }, { "epoch": 32, "eval_accuracy": 0.8584, "eval_loss": 0.46939553833007813, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.23669359466499754 }, { "epoch": 33, "eval_accuracy": 0.864, "eval_loss": 0.44012159423828123, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.2358193315267563 }, { "epoch": 34, "eval_accuracy": 0.8726, "eval_loss": 0.41900897827148437, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.23047334933280944 }, { "epoch": 35, "eval_accuracy": 0.8484, "eval_loss": 0.5120837097167968, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.22745651706324682 }, { "epoch": 36, "eval_accuracy": 0.8572, "eval_loss": 0.48343660888671874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.2273322538084454 }, { "epoch": 37, "eval_accuracy": 0.8596, "eval_loss": 0.4978451171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.22201022511985566 }, { "epoch": 38, "eval_accuracy": 0.8446, "eval_loss": 0.5256515441894531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.2145939707385169 }, { "epoch": 39, "eval_accuracy": 0.8696, "eval_loss": 0.43493318481445314, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.20739925054709116 }, { "epoch": 40, "eval_accuracy": 0.8666, "eval_loss": 0.4600316223144531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.20801596263779534 }, { "epoch": 41, "eval_accuracy": 0.8632, "eval_loss": 0.4669625122070313, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.20819860476387872 }, { "epoch": 42, "eval_accuracy": 0.8686, "eval_loss": 0.4578409973144531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.19786155010196899 }, { "epoch": 43, "eval_accuracy": 0.8662, "eval_loss": 0.46103836059570313, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.20556741065979003 }, { "epoch": 44, "eval_accuracy": 0.8394, "eval_loss": 0.5724481323242188, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.1993922583738963 }, { "epoch": 45, "eval_accuracy": 0.8724, "eval_loss": 0.43330186157226563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.19485141789913177 }, { "epoch": 46, "eval_accuracy": 0.8764, "eval_loss": 0.42409732666015626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.19267305657333797 }, { "epoch": 47, "eval_accuracy": 0.885, "eval_loss": 0.39403966674804686, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.1875338579866621 }, { "epoch": 48, "eval_accuracy": 0.8796, "eval_loss": 0.40434483642578123, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.18509351403978136 }, { "epoch": 49, "eval_accuracy": 0.88, "eval_loss": 0.4242395751953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.18649417563014561 }, { "epoch": 50, "eval_accuracy": 0.8704, "eval_loss": 0.4550154113769531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.18717047963407304 }, { "epoch": 51, "eval_accuracy": 0.8744, "eval_loss": 0.44483524169921873, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.1796641605509652 }, { "epoch": 52, "eval_accuracy": 0.8818, "eval_loss": 0.40557909545898435, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.17563802019225228 }, { "epoch": 53, "eval_accuracy": 0.8742, "eval_loss": 0.42595355224609377, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.17193800271352133 }, { "epoch": 54, "eval_accuracy": 0.8312, "eval_loss": 0.6097184692382812, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.17408619323306612 }, { "epoch": 55, "eval_accuracy": 0.863, "eval_loss": 0.47159163208007815, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.17443495961295233 }, { "epoch": 56, "eval_accuracy": 0.864, "eval_loss": 0.47021598510742185, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.17730448887348174 }, { "epoch": 57, "eval_accuracy": 0.845, "eval_loss": 0.5302630187988281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.17513225899802315 }, { "epoch": 58, "eval_accuracy": 0.8764, "eval_loss": 0.45107080078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.16688513896730212 }, { "epoch": 59, "eval_accuracy": 0.8506, "eval_loss": 0.5074487365722656, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.17318025396664938 }, { "epoch": 60, "eval_accuracy": 0.872, "eval_loss": 0.43073905639648435, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.16225387883716158 }, { "epoch": 61, "eval_accuracy": 0.8646, "eval_loss": 0.4888678771972656, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.1628989502257771 }, { "epoch": 62, "eval_accuracy": 0.89, "eval_loss": 0.3716917114257812, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.16541327353583443 }, { "epoch": 63, "eval_accuracy": 0.867, "eval_loss": 0.48051559448242187, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.15507885179254743 }, { "epoch": 64, "eval_accuracy": 0.8856, "eval_loss": 0.4047019226074219, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.15761819744375016 }, { "epoch": 65, "eval_accuracy": 0.8712, "eval_loss": 0.4679113525390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.16318066529962752 }, { "epoch": 66, "eval_accuracy": 0.869, "eval_loss": 0.46758770141601563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.15842568448649513 }, { "epoch": 67, "eval_accuracy": 0.8764, "eval_loss": 0.47932765502929686, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.15360924773481158 }, { "epoch": 68, "eval_accuracy": 0.8536, "eval_loss": 0.52894326171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.1567973585764567 }, { "epoch": 69, "eval_accuracy": 0.8874, "eval_loss": 0.3929457092285156, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.15907586552831862 }, { "epoch": 70, "eval_accuracy": 0.8816, "eval_loss": 0.42247525634765626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.15716197686725192 }, { "epoch": 71, "eval_accuracy": 0.8732, "eval_loss": 0.4963585998535156, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.14983130187855825 }, { "epoch": 72, "eval_accuracy": 0.8732, "eval_loss": 0.46758525390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.15397654530207316 }, { "epoch": 73, "eval_accuracy": 0.8784, "eval_loss": 0.43674370727539064, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.14723493348757427 }, { "epoch": 74, "eval_accuracy": 0.8886, "eval_loss": 0.39118277587890626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.14652091862890457 }, { "epoch": 75, "eval_accuracy": 0.8752, "eval_loss": 0.4687583251953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.1545022050380707 }, { "epoch": 76, "eval_accuracy": 0.876, "eval_loss": 0.4439466125488281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.14616850409242843 }, { "epoch": 77, "eval_accuracy": 0.8882, "eval_loss": 0.39720289306640627, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.1465005384021335 }, { "epoch": 78, "eval_accuracy": 0.887, "eval_loss": 0.4100860900878906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.15173963310188718 }, { "epoch": 79, "eval_accuracy": 0.8672, "eval_loss": 0.4720408081054687, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.1440488050142924 }, { "epoch": 80, "eval_accuracy": 0.8848, "eval_loss": 0.4128118469238281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.14068703662686877 }, { "epoch": 81, "eval_accuracy": 0.8622, "eval_loss": 0.4955517456054688, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.14217469872898525 }, { "epoch": 82, "eval_accuracy": 0.8926, "eval_loss": 0.3864740173339844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.14880184517701467 }, { "epoch": 83, "eval_accuracy": 0.8698, "eval_loss": 0.5053119140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.1299323884540134 }, { "epoch": 84, "eval_accuracy": 0.8806, "eval_loss": 0.4496087341308594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.146550003431903 }, { "epoch": 85, "eval_accuracy": 0.8928, "eval_loss": 0.40095016479492185, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.14196164631048838 }, { "epoch": 86, "eval_accuracy": 0.8936, "eval_loss": 0.38955796508789065, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.13579268198278216 }, { "epoch": 87, "eval_accuracy": 0.8726, "eval_loss": 0.4710050598144531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.14606884476078882 }, { "epoch": 88, "eval_accuracy": 0.8852, "eval_loss": 0.40862398071289063, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.14596923381487528 }, { "epoch": 89, "eval_accuracy": 0.8938, "eval_loss": 0.37538721313476564, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.13962470082706877 }, { "epoch": 90, "eval_accuracy": 0.8798, "eval_loss": 0.45380982666015623, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.136911416721344 }, { "epoch": 91, "eval_accuracy": 0.8842, "eval_loss": 0.4425386474609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.13629336178965037 }, { "epoch": 92, "eval_accuracy": 0.8908, "eval_loss": 0.419219775390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.1369322536945343 }, { "epoch": 93, "eval_accuracy": 0.893, "eval_loss": 0.3760003112792969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.13725584357579548 }, { "epoch": 94, "eval_accuracy": 0.8704, "eval_loss": 0.4654718566894531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.13652064226733313 }, { "epoch": 95, "eval_accuracy": 0.8868, "eval_loss": 0.44302418212890626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.12910948644744025 }, { "epoch": 96, "eval_accuracy": 0.8864, "eval_loss": 0.42267026977539063, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.13443772603140938 }, { "epoch": 97, "eval_accuracy": 0.8926, "eval_loss": 0.3810096862792969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.13513379742834303 }, { "epoch": 98, "eval_accuracy": 0.8934, "eval_loss": 0.3915801513671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.12859395507971447 }, { "epoch": 99, "eval_accuracy": 0.8918, "eval_loss": 0.4213328430175781, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.13369986132780712 }, { "epoch": 100, "eval_accuracy": 0.886, "eval_loss": 0.45385445556640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.13087427303592364 }, { "epoch": 101, "eval_accuracy": 0.9204, "eval_loss": 0.2958070129394531, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.07391229368348916 }, { "epoch": 102, "eval_accuracy": 0.9242, "eval_loss": 0.28999569702148437, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.04571805165542497 }, { "epoch": 103, "eval_accuracy": 0.9242, "eval_loss": 0.2971516357421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.036192750480605496 }, { "epoch": 104, "eval_accuracy": 0.9262, "eval_loss": 0.3033703857421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.03154912928475274 }, { "epoch": 105, "eval_accuracy": 0.9256, "eval_loss": 0.30697164306640623, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.02741032799548573 }, { "epoch": 106, "eval_accuracy": 0.9268, "eval_loss": 0.30802741088867186, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.02428152202632692 }, { "epoch": 107, "eval_accuracy": 0.9262, "eval_loss": 0.314338623046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.021879386997885174 }, { "epoch": 108, "eval_accuracy": 0.925, "eval_loss": 0.3235135375976563, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.020878948243459067 }, { "epoch": 109, "eval_accuracy": 0.9252, "eval_loss": 0.3302208251953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.01850255666706297 }, { "epoch": 110, "eval_accuracy": 0.9262, "eval_loss": 0.32489039916992185, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.01726404068602456 }, { "epoch": 111, "eval_accuracy": 0.9268, "eval_loss": 0.3281711608886719, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.016243692442443634 }, { "epoch": 112, "eval_accuracy": 0.9268, "eval_loss": 0.3317916564941406, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.014255007772313224 }, { "epoch": 113, "eval_accuracy": 0.9268, "eval_loss": 0.3346408752441406, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.014053582479059697 }, { "epoch": 114, "eval_accuracy": 0.9258, "eval_loss": 0.3327147705078125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.013204236159059737 }, { "epoch": 115, "eval_accuracy": 0.9264, "eval_loss": 0.3379136962890625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.012523622225059403 }, { "epoch": 116, "eval_accuracy": 0.925, "eval_loss": 0.3409310119628906, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.011970065443052185 }, { "epoch": 117, "eval_accuracy": 0.9276, "eval_loss": 0.341762646484375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.010813051444954343 }, { "epoch": 118, "eval_accuracy": 0.9268, "eval_loss": 0.338385888671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.011047906530731254 }, { "epoch": 119, "eval_accuracy": 0.924, "eval_loss": 0.3458584655761719, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.01061292423490021 }, { "epoch": 120, "eval_accuracy": 0.9268, "eval_loss": 0.34402819213867186, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.009872842174685663 }, { "epoch": 121, "eval_accuracy": 0.9262, "eval_loss": 0.3493848388671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.008324120312101311 }, { "epoch": 122, "eval_accuracy": 0.9276, "eval_loss": 0.3444608703613281, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.00849333224710491 }, { "epoch": 123, "eval_accuracy": 0.9264, "eval_loss": 0.3520544494628906, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.008254868710206614 }, { "epoch": 124, "eval_accuracy": 0.9262, "eval_loss": 0.3435565612792969, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.007909329082051084 }, { "epoch": 125, "eval_accuracy": 0.9258, "eval_loss": 0.35690042114257814, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.008038395318388939 }, { "epoch": 126, "eval_accuracy": 0.9262, "eval_loss": 0.35696865234375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.007849043796294265 }, { "epoch": 127, "eval_accuracy": 0.9256, "eval_loss": 0.369244384765625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.008171430269297626 }, { "epoch": 128, "eval_accuracy": 0.924, "eval_loss": 0.3637481201171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.007164580019977358 }, { "epoch": 129, "eval_accuracy": 0.9276, "eval_loss": 0.35849393920898437, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.007030607246607542 }, { "epoch": 130, "eval_accuracy": 0.9268, "eval_loss": 0.3662152770996094, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.006088745883686675 }, { "epoch": 131, "eval_accuracy": 0.9274, "eval_loss": 0.355767724609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.006438479425261418 }, { "epoch": 132, "eval_accuracy": 0.9272, "eval_loss": 0.3704664978027344, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.006546230017228259 }, { "epoch": 133, "eval_accuracy": 0.9276, "eval_loss": 0.37374725952148435, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.005257100144318409 }, { "epoch": 134, "eval_accuracy": 0.9288, "eval_loss": 0.3644460998535156, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.005803062219565941 }, { "epoch": 135, "eval_accuracy": 0.9268, "eval_loss": 0.3769530700683594, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.0059276600245075925 }, { "epoch": 136, "eval_accuracy": 0.9252, "eval_loss": 0.3732922607421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.005344935539116462 }, { "epoch": 137, "eval_accuracy": 0.9256, "eval_loss": 0.3735669189453125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.006024956390758355 }, { "epoch": 138, "eval_accuracy": 0.9274, "eval_loss": 0.37350067749023436, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.00587833823416796 }, { "epoch": 139, "eval_accuracy": 0.93, "eval_loss": 0.3658798034667969, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.005202372343217333 }, { "epoch": 140, "eval_accuracy": 0.928, "eval_loss": 0.37819749145507814, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.00522608685038156 }, { "epoch": 141, "eval_accuracy": 0.9308, "eval_loss": 0.3692561706542969, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.005239222901273105 }, { "epoch": 142, "eval_accuracy": 0.9276, "eval_loss": 0.37637430419921875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.004970019086450338 }, { "epoch": 143, "eval_accuracy": 0.9266, "eval_loss": 0.3803944091796875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.004805412318226364 }, { "epoch": 144, "eval_accuracy": 0.9282, "eval_loss": 0.3740898742675781, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.004170282630084289 }, { "epoch": 145, "eval_accuracy": 0.9276, "eval_loss": 0.38094301147460935, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.004932723968476057 }, { "epoch": 146, "eval_accuracy": 0.9262, "eval_loss": 0.37821016845703126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.00465814622434684 }, { "epoch": 147, "eval_accuracy": 0.9282, "eval_loss": 0.374492822265625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.004465697120130062 }, { "epoch": 148, "eval_accuracy": 0.9272, "eval_loss": 0.37554210205078126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.0049913340316878425 }, { "epoch": 149, "eval_accuracy": 0.9274, "eval_loss": 0.3821321533203125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.004511870892842611 }, { "epoch": 150, "eval_accuracy": 0.9278, "eval_loss": 0.383819873046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.0036155341097464165 }, { "epoch": 151, "eval_accuracy": 0.9266, "eval_loss": 0.3865296875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.0034015125179870263 }, { "epoch": 152, "eval_accuracy": 0.93, "eval_loss": 0.38060599365234377, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.0038181717752996417 }, { "epoch": 153, "eval_accuracy": 0.928, "eval_loss": 0.38813572998046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.003342558716175457 }, { "epoch": 154, "eval_accuracy": 0.9288, "eval_loss": 0.37930936889648437, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.0037702425530387294 }, { "epoch": 155, "eval_accuracy": 0.9294, "eval_loss": 0.37951343994140624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.0035697890337970523 }, { "epoch": 156, "eval_accuracy": 0.929, "eval_loss": 0.37994603881835937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.0036909519653353425 }, { "epoch": 157, "eval_accuracy": 0.9288, "eval_loss": 0.38521229858398437, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.0035891185532013576 }, { "epoch": 158, "eval_accuracy": 0.9296, "eval_loss": 0.38098255004882814, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.0032051278701103808 }, { "epoch": 159, "eval_accuracy": 0.93, "eval_loss": 0.3787800048828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.003374717134113113 }, { "epoch": 160, "eval_accuracy": 0.9296, "eval_loss": 0.38265086059570314, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.002994217939178149 }, { "epoch": 161, "eval_accuracy": 0.9286, "eval_loss": 0.3790346862792969, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.003431437090711875 }, { "epoch": 162, "eval_accuracy": 0.929, "eval_loss": 0.3793521911621094, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.0029321252649649977 }, { "epoch": 163, "eval_accuracy": 0.9296, "eval_loss": 0.3795800048828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.0036018194581071534 }, { "epoch": 164, "eval_accuracy": 0.929, "eval_loss": 0.3825399169921875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.0027656607893606026 }, { "epoch": 165, "eval_accuracy": 0.928, "eval_loss": 0.37968671264648435, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.0026229754688011277 }, { "epoch": 166, "eval_accuracy": 0.929, "eval_loss": 0.38276746826171876, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.0029054207376307912 }, { "epoch": 167, "eval_accuracy": 0.9292, "eval_loss": 0.3794607421875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.003060741257626149 }, { "epoch": 168, "eval_accuracy": 0.929, "eval_loss": 0.38132125244140624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.002886012737949689 }, { "epoch": 169, "eval_accuracy": 0.929, "eval_loss": 0.3822179992675781, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.003108068531089359 }, { "epoch": 170, "eval_accuracy": 0.9292, "eval_loss": 0.38042718505859374, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.0029554093821181193 }, { "epoch": 171, "eval_accuracy": 0.929, "eval_loss": 0.383385693359375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.0030305214785453344 }, { "epoch": 172, "eval_accuracy": 0.9304, "eval_loss": 0.38013319091796877, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.0031653479740954937 }, { "epoch": 173, "eval_accuracy": 0.9288, "eval_loss": 0.38019481811523437, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.0032616001981827947 }, { "epoch": 174, "eval_accuracy": 0.9294, "eval_loss": 0.3823200317382813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.0026846566768984 }, { "epoch": 175, "eval_accuracy": 0.9294, "eval_loss": 0.38054329833984374, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.0028761062923197945 }, { "epoch": 176, "eval_accuracy": 0.9294, "eval_loss": 0.37557706298828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.002718526501969124 }, { "epoch": 177, "eval_accuracy": 0.9296, "eval_loss": 0.38403538208007815, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.002765856211798059 }, { "epoch": 178, "eval_accuracy": 0.9288, "eval_loss": 0.3827006591796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.002846009177507626 }, { "epoch": 179, "eval_accuracy": 0.9304, "eval_loss": 0.37569268798828126, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.0028106547514183656 }, { "epoch": 180, "eval_accuracy": 0.9308, "eval_loss": 0.37752535400390624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.002670673717599776 }, { "epoch": 181, "eval_accuracy": 0.9294, "eval_loss": 0.37972734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.0029900958141932887 }, { "epoch": 182, "eval_accuracy": 0.93, "eval_loss": 0.3836199890136719, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.0028344500539824367 }, { "epoch": 183, "eval_accuracy": 0.9298, "eval_loss": 0.382769482421875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.002919924992824801 }, { "epoch": 184, "eval_accuracy": 0.93, "eval_loss": 0.38172957153320314, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.0029668405563053157 }, { "epoch": 185, "eval_accuracy": 0.9286, "eval_loss": 0.37836466674804686, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.002790116118432747 }, { "epoch": 186, "eval_accuracy": 0.9302, "eval_loss": 0.3797643493652344, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.002748481237143278 }, { "epoch": 187, "eval_accuracy": 0.9288, "eval_loss": 0.3819689208984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.002598481794156962 }, { "epoch": 188, "eval_accuracy": 0.929, "eval_loss": 0.38522958984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.0023670312017202376 }, { "epoch": 189, "eval_accuracy": 0.9284, "eval_loss": 0.38395161743164063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.0026725557989130417 }, { "epoch": 190, "eval_accuracy": 0.9278, "eval_loss": 0.3851235168457031, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.002891599158321818 }, { "epoch": 191, "eval_accuracy": 0.9292, "eval_loss": 0.38445775756835937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.0026930961543590658 }, { "epoch": 192, "eval_accuracy": 0.9286, "eval_loss": 0.38256485595703127, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.002824814874927203 }, { "epoch": 193, "eval_accuracy": 0.93, "eval_loss": 0.38405804443359376, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.002977210904844105 }, { "epoch": 194, "eval_accuracy": 0.93, "eval_loss": 0.3784375061035156, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.0028413962472023237 }, { "epoch": 195, "eval_accuracy": 0.93, "eval_loss": 0.3832097351074219, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.0030580059261837355 }, { "epoch": 196, "eval_accuracy": 0.9294, "eval_loss": 0.37996414184570315, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.0026476701118155485 }, { "epoch": 197, "eval_accuracy": 0.9292, "eval_loss": 0.38070816650390626, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.0029351543212205997 }, { "epoch": 198, "eval_accuracy": 0.9298, "eval_loss": 0.3816475341796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.0026628320027556685 }, { "epoch": 199, "eval_accuracy": 0.9306, "eval_loss": 0.3811450012207031, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.002589297404181626 }, { "epoch": 200, "eval_accuracy": 0.93, "eval_loss": 0.3817935302734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.002858151467392842 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.93, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.3817935302734375, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 3257588736, "peak_memory_reserved_bytes": 4322230272, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 60.09430003166199, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 3323.5966560840607, "train_wall_s": 3263.4807090759277 }, "work": { "apical_macs_per_example": 0, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 0, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 2258742528000000, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 0, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 1129371264000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 125485696, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 3388113792000000 } }