{ "architecture": { "adaptive_apical_parameters": 2260992, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 188416, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 376832, "residual_scale": 1.0, "vectorizer_mode": "spatial_template", "vectorizer_parameters": 1884160 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 20, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.01, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "dfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-dfa-d20-lr0p01.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "full_hidden_field", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": -4.417266851911942e-05, "innovation_negative_gradient_cosine": [ -0.00042737211333587766, 0.0018140280153602362, 0.0009411051869392395, -0.002272804267704487, -0.001042853808030486, 0.0007228609756566584, -0.0014636360574513674, 0.004689148627221584, 0.00022076242021284997, 0.0029502036049962044, 0.006819497793912888, 0.005044919438660145, 0.007197106722742319, 0.019712356850504875, 0.021992990747094154, 0.02051355317234993, 0.026908088475465775, 0.029072165489196777, 0.039473552256822586 ], "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ -0.00042737211333587766, 0.0018140280153602362, 0.0009411051869392395, -0.002272804267704487, -0.001042853808030486, 0.0007228609756566584, -0.0014636360574513674, 0.004689148627221584, 0.00022076242021284997, 0.0029502036049962044, 0.006819497793912888, 0.005044919438660145, 0.007197106722742319, 0.019712356850504875, 0.021992990747094154, 0.02051355317234993, 0.026908088475465775, 0.029072165489196777, 0.039473552256822586 ], "teaching_negative_gradient_cosine": [ -0.00042737211333587766, 0.0018140280153602362, 0.0009411051869392395, -0.002272804267704487, -0.001042853808030486, 0.0007228609756566584, -0.0014636360574513674, 0.004689148627221584, 0.00022076242021284997, 0.0029502036049962044, 0.006819497793912888, 0.005044919438660145, 0.007197106722742319, 0.019712356850504875, 0.021992990747094154, 0.02051355317234993, 0.026908088475465775, 0.029072165489196777, 0.039473552256822586 ], "wall_s": 0.13636183738708496 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.2384, "eval_loss": 2.13388974609375, "eval_split": "validation", "lr": 0.002, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.196710070376926 }, { "epoch": 2, "eval_accuracy": 0.219, "eval_loss": 2.118686376953125, "eval_split": "validation", "lr": 0.004, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 2.1524469988505044 }, { "epoch": 3, "eval_accuracy": 0.2358, "eval_loss": 2.120386865234375, "eval_split": "validation", "lr": 0.006, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 2.16505956264072 }, { "epoch": 4, "eval_accuracy": 0.2538, "eval_loss": 2.0546119140625, "eval_split": "validation", "lr": 0.008, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 2.250287850613064 }, { "epoch": 5, "eval_accuracy": 0.2272, "eval_loss": 2.4211458984375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 2.4122211878458657 }, { "epoch": 6, "eval_accuracy": 0.2418, "eval_loss": 2.48471376953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 2.5066193411933053 }, { "epoch": 7, "eval_accuracy": 0.2642, "eval_loss": 2.71391015625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 3.1259462588416205 }, { "epoch": 8, "eval_accuracy": 0.2838, "eval_loss": 3.04355810546875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 3.7678212508307563 }, { "epoch": 9, "eval_accuracy": 0.2724, "eval_loss": 3.169311083984375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 3.511760868496365 }, { "epoch": 10, "eval_accuracy": 0.2212, "eval_loss": 7.113378125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 4.115778273179796 }, { "epoch": 11, "eval_accuracy": 0.2276, "eval_loss": 3.861981689453125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 5.214946193271213 }, { "epoch": 12, "eval_accuracy": 0.3098, "eval_loss": 3.261718896484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 5.978883670467801 }, { "epoch": 13, "eval_accuracy": 0.2664, "eval_loss": 4.601353125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 6.004014733632405 }, { "epoch": 14, "eval_accuracy": 0.2076, "eval_loss": 8.8213029296875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 6.477945835537381 }, { "epoch": 15, "eval_accuracy": 0.1582, "eval_loss": 10.4473234375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 8.101313818952772 }, { "epoch": 16, "eval_accuracy": 0.3258, "eval_loss": 4.61436240234375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 8.165552450985379 }, { "epoch": 17, "eval_accuracy": 0.3088, "eval_loss": 10.7543853515625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 9.495957034132216 }, { "epoch": 18, "eval_accuracy": 0.2616, "eval_loss": 12.048984375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 10.429058261617024 }, { "epoch": 19, "eval_accuracy": 0.2384, "eval_loss": 11.6567517578125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 10.979766198221842 }, { "epoch": 20, "eval_accuracy": 0.2934, "eval_loss": 14.16575390625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 12.528717605929904 }, { "epoch": 21, "eval_accuracy": 0.232, "eval_loss": 26.35266015625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 14.306350407918295 }, { "epoch": 22, "eval_accuracy": 0.2194, "eval_loss": 22.857603125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 14.619046181911893 }, { "epoch": 23, "eval_accuracy": 0.2256, "eval_loss": 11.67859609375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 16.98607453087701 }, { "epoch": 24, "eval_accuracy": 0.2354, "eval_loss": 17.170334375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 19.04719298078749 }, { "epoch": 25, "eval_accuracy": 0.2598, "eval_loss": 15.6980568359375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 20.507712957763673 }, { "epoch": 26, "eval_accuracy": 0.2124, "eval_loss": 24.550714453125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 20.977451344129776 }, { "epoch": 27, "eval_accuracy": 0.2686, "eval_loss": 34.49674140625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 22.611929234483508 }, { "epoch": 28, "eval_accuracy": 0.2596, "eval_loss": 18.92392265625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 22.959516687011718 }, { "epoch": 29, "eval_accuracy": 0.2792, "eval_loss": 27.662224609375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 24.995158879937065 }, { "epoch": 30, "eval_accuracy": 0.2662, "eval_loss": 33.141328515625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 29.480212257554797 }, { "epoch": 31, "eval_accuracy": 0.226, "eval_loss": 27.803342578125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 26.761602039252388 }, { "epoch": 32, "eval_accuracy": 0.277, "eval_loss": 20.175499609375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 30.244316629367404 }, { "epoch": 33, "eval_accuracy": 0.3044, "eval_loss": 29.908916796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 31.322398626708985 }, { "epoch": 34, "eval_accuracy": 0.245, "eval_loss": 45.0069875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 33.19071531711155 }, { "epoch": 35, "eval_accuracy": 0.3816, "eval_loss": 12.8741255859375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 35.12927552693685 }, { "epoch": 36, "eval_accuracy": 0.2418, "eval_loss": 62.24336953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 38.10827041354709 }, { "epoch": 37, "eval_accuracy": 0.295, "eval_loss": 36.87111953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 42.39294600694444 }, { "epoch": 38, "eval_accuracy": 0.1248, "eval_loss": 83.8959890625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 42.81453029039171 }, { "epoch": 39, "eval_accuracy": 0.289, "eval_loss": 85.4705140625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 46.396105011664496 }, { "epoch": 40, "eval_accuracy": 0.224, "eval_loss": 59.92510703125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 46.26691556532118 }, { "epoch": 41, "eval_accuracy": 0.2546, "eval_loss": 37.7355953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 50.41342158237033 }, { "epoch": 42, "eval_accuracy": 0.2456, "eval_loss": 77.8837359375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 50.42762740614149 }, { "epoch": 43, "eval_accuracy": 0.2972, "eval_loss": 37.9858015625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 55.54701350640191 }, { "epoch": 44, "eval_accuracy": 0.3668, "eval_loss": 43.6133109375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 62.59512099134657 }, { "epoch": 45, "eval_accuracy": 0.2564, "eval_loss": 53.872640625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 56.61767745632596 }, { "epoch": 46, "eval_accuracy": 0.1912, "eval_loss": 132.7386125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 70.22152931179471 }, { "epoch": 47, "eval_accuracy": 0.368, "eval_loss": 35.1759109375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 70.48875649888781 }, { "epoch": 48, "eval_accuracy": 0.365, "eval_loss": 30.53370625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 69.93644878607856 }, { "epoch": 49, "eval_accuracy": 0.283, "eval_loss": 57.0330375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 77.78397584296333 }, { "epoch": 50, "eval_accuracy": 0.2704, "eval_loss": 118.6991953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 75.2017873196072 }, { "epoch": 51, "eval_accuracy": 0.316, "eval_loss": 63.6082796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 83.56330694444445 }, { "epoch": 52, "eval_accuracy": 0.2914, "eval_loss": 108.32306875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 86.26330736897786 }, { "epoch": 53, "eval_accuracy": 0.334, "eval_loss": 46.92616015625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 87.97140079684787 }, { "epoch": 54, "eval_accuracy": 0.2518, "eval_loss": 104.82296875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 93.9687024102105 }, { "epoch": 55, "eval_accuracy": 0.3186, "eval_loss": 61.5724078125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 96.0325408203125 }, { "epoch": 56, "eval_accuracy": 0.3622, "eval_loss": 54.3312796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 103.135226820204 }, { "epoch": 57, "eval_accuracy": 0.2204, "eval_loss": 214.8653625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 112.44556560058594 }, { "epoch": 58, "eval_accuracy": 0.336, "eval_loss": 76.492653125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 97.48807627766926 }, { "epoch": 59, "eval_accuracy": 0.295, "eval_loss": 134.529453125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 115.6962455078125 }, { "epoch": 60, "eval_accuracy": 0.3338, "eval_loss": 80.4154484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 114.1658334906684 }, { "epoch": 61, "eval_accuracy": 0.2612, "eval_loss": 82.935240625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 120.49449004584419 }, { "epoch": 62, "eval_accuracy": 0.2506, "eval_loss": 177.4444, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 129.52251632215712 }, { "epoch": 63, "eval_accuracy": 0.2992, "eval_loss": 158.935075, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 126.56348369276259 }, { "epoch": 64, "eval_accuracy": 0.2318, "eval_loss": 224.766190625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 129.15274677734374 }, { "epoch": 65, "eval_accuracy": 0.258, "eval_loss": 149.426728125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 149.42977838812934 }, { "epoch": 66, "eval_accuracy": 0.1468, "eval_loss": 236.724253125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 137.12026451009115 }, { "epoch": 67, "eval_accuracy": 0.288, "eval_loss": 133.139496875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 164.30003099907768 }, { "epoch": 68, "eval_accuracy": 0.2536, "eval_loss": 175.942903125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 146.02838853624132 }, { "epoch": 69, "eval_accuracy": 0.2536, "eval_loss": 117.812740625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 170.32516332465278 }, { "epoch": 70, "eval_accuracy": 0.3408, "eval_loss": 139.700415625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 167.26187187771268 }, { "epoch": 71, "eval_accuracy": 0.275, "eval_loss": 271.8581, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 150.94737664930557 }, { "epoch": 72, "eval_accuracy": 0.2768, "eval_loss": 109.6359796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 178.7975426405165 }, { "epoch": 73, "eval_accuracy": 0.2492, "eval_loss": 153.839534375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 181.78071877712674 }, { "epoch": 74, "eval_accuracy": 0.2398, "eval_loss": 362.14533125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 179.54143683810764 }, { "epoch": 75, "eval_accuracy": 0.333, "eval_loss": 109.10584375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 228.60323557128908 }, { "epoch": 76, "eval_accuracy": 0.1564, "eval_loss": 465.6028625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 178.3261564453125 }, { "epoch": 77, "eval_accuracy": 0.3438, "eval_loss": 100.3464203125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 208.42907971191406 }, { "epoch": 78, "eval_accuracy": 0.2746, "eval_loss": 294.67795, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 210.42169096137152 }, { "epoch": 79, "eval_accuracy": 0.276, "eval_loss": 190.441990625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 224.93065251193576 }, { "epoch": 80, "eval_accuracy": 0.3246, "eval_loss": 248.689990625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 222.3671440999349 }, { "epoch": 81, "eval_accuracy": 0.271, "eval_loss": 167.538346875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 235.71425759006075 }, { "epoch": 82, "eval_accuracy": 0.1452, "eval_loss": 355.31036875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 222.38550850423178 }, { "epoch": 83, "eval_accuracy": 0.2744, "eval_loss": 190.79715625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 234.47545372721353 }, { "epoch": 84, "eval_accuracy": 0.2446, "eval_loss": 268.720678125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 239.26784101833766 }, { "epoch": 85, "eval_accuracy": 0.2664, "eval_loss": 219.119975, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 277.5253189887153 }, { "epoch": 86, "eval_accuracy": 0.2812, "eval_loss": 186.918509375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 267.0558938340929 }, { "epoch": 87, "eval_accuracy": 0.275, "eval_loss": 291.21615625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 253.1571425998264 }, { "epoch": 88, "eval_accuracy": 0.4022, "eval_loss": 197.7845375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 271.55762882486977 }, { "epoch": 89, "eval_accuracy": 0.2136, "eval_loss": 384.08820625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 272.41770344509547 }, { "epoch": 90, "eval_accuracy": 0.2894, "eval_loss": 266.3597, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 279.4282325954861 }, { "epoch": 91, "eval_accuracy": 0.3094, "eval_loss": 177.42945, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 307.67940743001304 }, { "epoch": 92, "eval_accuracy": 0.1138, "eval_loss": 565.199775, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 308.0857044731988 }, { "epoch": 93, "eval_accuracy": 0.2484, "eval_loss": 306.35499375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 296.103281765408 }, { "epoch": 94, "eval_accuracy": 0.3628, "eval_loss": 315.681325, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 322.4415712673611 }, { "epoch": 95, "eval_accuracy": 0.3176, "eval_loss": 212.66410625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 327.5514536295573 }, { "epoch": 96, "eval_accuracy": 0.345, "eval_loss": 154.168359375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 375.67241025661895 }, { "epoch": 97, "eval_accuracy": 0.364, "eval_loss": 292.67804375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 345.29349494900174 }, { "epoch": 98, "eval_accuracy": 0.3088, "eval_loss": 412.27108125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 366.83919205729165 }, { "epoch": 99, "eval_accuracy": 0.2158, "eval_loss": 538.530225, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 346.40431893988716 }, { "epoch": 100, "eval_accuracy": 0.2714, "eval_loss": 350.2196375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 364.6515966362847 }, { "epoch": 101, "eval_accuracy": 0.4338, "eval_loss": 72.9980640625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 97.5824759250217 }, { "epoch": 102, "eval_accuracy": 0.3946, "eval_loss": 63.793271875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 68.66056476982965 }, { "epoch": 103, "eval_accuracy": 0.3972, "eval_loss": 54.701396875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 58.456144613308375 }, { "epoch": 104, "eval_accuracy": 0.395, "eval_loss": 45.80713984375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 52.66843123033312 }, { "epoch": 105, "eval_accuracy": 0.3904, "eval_loss": 42.960628125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 47.554370183648004 }, { "epoch": 106, "eval_accuracy": 0.3928, "eval_loss": 37.1106109375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 43.874717364501954 }, { "epoch": 107, "eval_accuracy": 0.4084, "eval_loss": 33.58920625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 42.896230186631946 }, { "epoch": 108, "eval_accuracy": 0.3816, "eval_loss": 35.4541578125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 40.49658525119358 }, { "epoch": 109, "eval_accuracy": 0.3904, "eval_loss": 31.881768359375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 38.327581633843316 }, { "epoch": 110, "eval_accuracy": 0.3458, "eval_loss": 38.830978125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 35.389524947781034 }, { "epoch": 111, "eval_accuracy": 0.3544, "eval_loss": 36.43687421875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 34.1201142171224 }, { "epoch": 112, "eval_accuracy": 0.3744, "eval_loss": 27.77460859375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 32.8625382297092 }, { "epoch": 113, "eval_accuracy": 0.3666, "eval_loss": 34.01153984375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 32.72871079440647 }, { "epoch": 114, "eval_accuracy": 0.3624, "eval_loss": 29.06900859375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 31.676572363620334 }, { "epoch": 115, "eval_accuracy": 0.2994, "eval_loss": 38.16306328125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 30.014509815131294 }, { "epoch": 116, "eval_accuracy": 0.348, "eval_loss": 27.01443515625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 30.27423641289605 }, { "epoch": 117, "eval_accuracy": 0.3002, "eval_loss": 45.1408640625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 30.936224088541667 }, { "epoch": 118, "eval_accuracy": 0.3548, "eval_loss": 34.59181484375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 30.146907942708335 }, { "epoch": 119, "eval_accuracy": 0.3376, "eval_loss": 32.60268515625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 28.432915776231553 }, { "epoch": 120, "eval_accuracy": 0.3364, "eval_loss": 34.4127140625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 29.565025434705944 }, { "epoch": 121, "eval_accuracy": 0.3672, "eval_loss": 21.1856453125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 28.357878097195094 }, { "epoch": 122, "eval_accuracy": 0.3018, "eval_loss": 31.5717625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 29.79608405388726 }, { "epoch": 123, "eval_accuracy": 0.3136, "eval_loss": 28.0333640625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 32.39813755900065 }, { "epoch": 124, "eval_accuracy": 0.33, "eval_loss": 25.2027203125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 28.785149905225964 }, { "epoch": 125, "eval_accuracy": 0.365, "eval_loss": 50.01820859375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 30.066769323052302 }, { "epoch": 126, "eval_accuracy": 0.2992, "eval_loss": 38.751096875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 28.825669424777562 }, { "epoch": 127, "eval_accuracy": 0.3188, "eval_loss": 31.16794609375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 31.951569648573134 }, { "epoch": 128, "eval_accuracy": 0.3536, "eval_loss": 26.708534375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 28.16607522176107 }, { "epoch": 129, "eval_accuracy": 0.3712, "eval_loss": 22.56696171875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 30.68563767361111 }, { "epoch": 130, "eval_accuracy": 0.3722, "eval_loss": 27.211113671875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 26.697583384874132 }, { "epoch": 131, "eval_accuracy": 0.3952, "eval_loss": 15.98902734375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 28.169558378770617 }, { "epoch": 132, "eval_accuracy": 0.345, "eval_loss": 27.111884375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 29.73483961995443 }, { "epoch": 133, "eval_accuracy": 0.3092, "eval_loss": 33.95772265625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 35.36185829772949 }, { "epoch": 134, "eval_accuracy": 0.3584, "eval_loss": 20.575744921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 30.647867134602865 }, { "epoch": 135, "eval_accuracy": 0.3062, "eval_loss": 25.4248328125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 26.337036939154732 }, { "epoch": 136, "eval_accuracy": 0.4092, "eval_loss": 15.70295703125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 33.879409608968096 }, { "epoch": 137, "eval_accuracy": 0.2672, "eval_loss": 40.63083671875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 30.210656193712023 }, { "epoch": 138, "eval_accuracy": 0.2778, "eval_loss": 34.45653125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 34.42727603759766 }, { "epoch": 139, "eval_accuracy": 0.3152, "eval_loss": 41.16488515625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 30.716559368896483 }, { "epoch": 140, "eval_accuracy": 0.293, "eval_loss": 29.28139296875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 30.197615693155925 }, { "epoch": 141, "eval_accuracy": 0.2916, "eval_loss": 32.38239140625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 28.30102506205241 }, { "epoch": 142, "eval_accuracy": 0.2882, "eval_loss": 31.02913203125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 33.08134716661241 }, { "epoch": 143, "eval_accuracy": 0.3546, "eval_loss": 26.13366640625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 35.202170224338104 }, { "epoch": 144, "eval_accuracy": 0.4018, "eval_loss": 18.689922265625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 28.16269857449002 }, { "epoch": 145, "eval_accuracy": 0.2002, "eval_loss": 45.4462328125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 29.617123545328777 }, { "epoch": 146, "eval_accuracy": 0.3582, "eval_loss": 24.901905078125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 34.85614291212294 }, { "epoch": 147, "eval_accuracy": 0.3712, "eval_loss": 39.63477265625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 32.07841902872721 }, { "epoch": 148, "eval_accuracy": 0.3844, "eval_loss": 23.235046875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 34.80584049445258 }, { "epoch": 149, "eval_accuracy": 0.3602, "eval_loss": 31.175896484375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 32.27111835700141 }, { "epoch": 150, "eval_accuracy": 0.2914, "eval_loss": 28.874794921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 31.977565850151908 }, { "epoch": 151, "eval_accuracy": 0.4476, "eval_loss": 10.8708392578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 11.651757261149088 }, { "epoch": 152, "eval_accuracy": 0.446, "eval_loss": 9.7358521484375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 9.99678972998725 }, { "epoch": 153, "eval_accuracy": 0.4404, "eval_loss": 8.9593001953125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 9.319264670477972 }, { "epoch": 154, "eval_accuracy": 0.4428, "eval_loss": 8.37555732421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 8.697566080050999 }, { "epoch": 155, "eval_accuracy": 0.4502, "eval_loss": 7.80713427734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 8.319801394992405 }, { "epoch": 156, "eval_accuracy": 0.4344, "eval_loss": 7.308902734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 7.8531677338494195 }, { "epoch": 157, "eval_accuracy": 0.4406, "eval_loss": 6.8099802734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 7.516104418097602 }, { "epoch": 158, "eval_accuracy": 0.4278, "eval_loss": 6.6249916015625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 7.2278142467922635 }, { "epoch": 159, "eval_accuracy": 0.4346, "eval_loss": 6.33050771484375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 6.960628581576877 }, { "epoch": 160, "eval_accuracy": 0.4234, "eval_loss": 6.38564306640625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 6.7058130749172635 }, { "epoch": 161, "eval_accuracy": 0.4256, "eval_loss": 5.79991982421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 6.504179000430637 }, { "epoch": 162, "eval_accuracy": 0.408, "eval_loss": 5.9061658203125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 6.2047558926052515 }, { "epoch": 163, "eval_accuracy": 0.4004, "eval_loss": 6.0522150390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 6.164733709801568 }, { "epoch": 164, "eval_accuracy": 0.4006, "eval_loss": 5.61034873046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 5.856545046403673 }, { "epoch": 165, "eval_accuracy": 0.3968, "eval_loss": 5.4717162109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 5.771546636369493 }, { "epoch": 166, "eval_accuracy": 0.3862, "eval_loss": 5.516412109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 5.6266596131218805 }, { "epoch": 167, "eval_accuracy": 0.4108, "eval_loss": 4.80401162109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 5.476546478610569 }, { "epoch": 168, "eval_accuracy": 0.3934, "eval_loss": 5.0674400390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 5.386792821163601 }, { "epoch": 169, "eval_accuracy": 0.3716, "eval_loss": 5.19190400390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 5.217026385074192 }, { "epoch": 170, "eval_accuracy": 0.4034, "eval_loss": 4.618946875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 5.097870582156711 }, { "epoch": 171, "eval_accuracy": 0.3978, "eval_loss": 4.6441703125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 4.992071345859104 }, { "epoch": 172, "eval_accuracy": 0.415, "eval_loss": 4.309574365234375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 5.006023575761583 }, { "epoch": 173, "eval_accuracy": 0.3728, "eval_loss": 4.7692791015625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 4.765749631924099 }, { "epoch": 174, "eval_accuracy": 0.3972, "eval_loss": 4.273984814453125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 4.669230929056804 }, { "epoch": 175, "eval_accuracy": 0.3868, "eval_loss": 4.346198095703125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 4.767588217163086 }, { "epoch": 176, "eval_accuracy": 0.4138, "eval_loss": 4.04446513671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 4.574014286422729 }, { "epoch": 177, "eval_accuracy": 0.3986, "eval_loss": 4.01624287109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 4.483139426252577 }, { "epoch": 178, "eval_accuracy": 0.379, "eval_loss": 4.116311572265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 4.440480245547825 }, { "epoch": 179, "eval_accuracy": 0.411, "eval_loss": 3.7937888671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 4.464287152438693 }, { "epoch": 180, "eval_accuracy": 0.3336, "eval_loss": 4.47425, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 4.374478776211209 }, { "epoch": 181, "eval_accuracy": 0.3926, "eval_loss": 3.835095654296875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 4.33659748111301 }, { "epoch": 182, "eval_accuracy": 0.3928, "eval_loss": 3.6995392578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 4.252237670898437 }, { "epoch": 183, "eval_accuracy": 0.3914, "eval_loss": 3.63160205078125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 4.279515455034044 }, { "epoch": 184, "eval_accuracy": 0.3968, "eval_loss": 3.59172255859375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 4.1540915985107425 }, { "epoch": 185, "eval_accuracy": 0.3818, "eval_loss": 3.789047998046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 4.0526812603420685 }, { "epoch": 186, "eval_accuracy": 0.361, "eval_loss": 4.066609326171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 4.036473704528809 }, { "epoch": 187, "eval_accuracy": 0.3994, "eval_loss": 3.52081162109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 4.109895914713542 }, { "epoch": 188, "eval_accuracy": 0.3908, "eval_loss": 3.533601025390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 4.0574144656711155 }, { "epoch": 189, "eval_accuracy": 0.3962, "eval_loss": 3.42502001953125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 4.032029030354818 }, { "epoch": 190, "eval_accuracy": 0.4156, "eval_loss": 3.239801220703125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 3.874290327750312 }, { "epoch": 191, "eval_accuracy": 0.3698, "eval_loss": 3.478581982421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 3.7694188574896916 }, { "epoch": 192, "eval_accuracy": 0.3578, "eval_loss": 3.897442578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 3.7616168645222983 }, { "epoch": 193, "eval_accuracy": 0.3774, "eval_loss": 3.65839599609375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 3.8300268634372285 }, { "epoch": 194, "eval_accuracy": 0.3948, "eval_loss": 3.29561572265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 3.8239806078592937 }, { "epoch": 195, "eval_accuracy": 0.3592, "eval_loss": 3.819576904296875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 3.7138434155782063 }, { "epoch": 196, "eval_accuracy": 0.4016, "eval_loss": 3.35995888671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 3.6911021950191922 }, { "epoch": 197, "eval_accuracy": 0.3778, "eval_loss": 3.279795556640625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 3.6857616521199543 }, { "epoch": 198, "eval_accuracy": 0.3356, "eval_loss": 4.24252001953125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 3.709500290086534 }, { "epoch": 199, "eval_accuracy": 0.3088, "eval_loss": 3.90576396484375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 3.7073160080379908 }, { "epoch": 200, "eval_accuracy": 0.3492, "eval_loss": 3.6838392578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 3.5896300240410697 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.3492, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 3.6838392578125, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2018397696, "peak_memory_reserved_bytes": 2480930816, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 21.157899856567383, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1183.4196124076843, "train_wall_s": 1162.2410652637482 }, "work": { "apical_macs_per_example": 1884160, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 16957440000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 364959360000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 746876160000000 } }