{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 5, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 32, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 464154, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 0, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 32, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "bp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-bp-d32-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": null, "epochs": [ { "epoch": 1, "eval_accuracy": 0.4654, "eval_loss": 1.4851486328125, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 1.7367673873901368 }, { "epoch": 2, "eval_accuracy": 0.4898, "eval_loss": 1.725862939453125, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.3518918582280477 }, { "epoch": 3, "eval_accuracy": 0.5918, "eval_loss": 1.3513257568359376, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.0766678378211127 }, { "epoch": 4, "eval_accuracy": 0.6896, "eval_loss": 0.9191304931640625, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 0.8923857101016575 }, { "epoch": 5, "eval_accuracy": 0.7498, "eval_loss": 0.7415965698242187, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.767474871105618 }, { "epoch": 6, "eval_accuracy": 0.7114, "eval_loss": 0.9565532348632813, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.6632765820503235 }, { "epoch": 7, "eval_accuracy": 0.7736, "eval_loss": 0.671961181640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.6028720584339565 }, { "epoch": 8, "eval_accuracy": 0.7782, "eval_loss": 0.70337177734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.5587517645835877 }, { "epoch": 9, "eval_accuracy": 0.7972, "eval_loss": 0.6166611938476563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.516674728096856 }, { "epoch": 10, "eval_accuracy": 0.7304, "eval_loss": 0.9077167846679688, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.4872661090373993 }, { "epoch": 11, "eval_accuracy": 0.7792, "eval_loss": 0.687501904296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.46315930485195583 }, { "epoch": 12, "eval_accuracy": 0.8068, "eval_loss": 0.602014111328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.4376789878103468 }, { "epoch": 13, "eval_accuracy": 0.7708, "eval_loss": 0.7402918701171874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.4173557227876451 }, { "epoch": 14, "eval_accuracy": 0.8168, "eval_loss": 0.5883634521484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.4026338017993503 }, { "epoch": 15, "eval_accuracy": 0.836, "eval_loss": 0.5093399963378906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.38672829824553595 }, { "epoch": 16, "eval_accuracy": 0.826, "eval_loss": 0.5640574462890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.37543256346384685 }, { "epoch": 17, "eval_accuracy": 0.8372, "eval_loss": 0.48900656127929687, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.3632183216094971 }, { "epoch": 18, "eval_accuracy": 0.8556, "eval_loss": 0.4457982177734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.35278323027822706 }, { "epoch": 19, "eval_accuracy": 0.8474, "eval_loss": 0.462450390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.344698157954216 }, { "epoch": 20, "eval_accuracy": 0.8326, "eval_loss": 0.5396587097167969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.33207386435932584 }, { "epoch": 21, "eval_accuracy": 0.8402, "eval_loss": 0.5037933044433593, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.3211999874644809 }, { "epoch": 22, "eval_accuracy": 0.8164, "eval_loss": 0.5877996826171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.3155520805676778 }, { "epoch": 23, "eval_accuracy": 0.8612, "eval_loss": 0.45332628173828127, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.30989496260748967 }, { "epoch": 24, "eval_accuracy": 0.8544, "eval_loss": 0.455251806640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.29552004895475176 }, { "epoch": 25, "eval_accuracy": 0.8598, "eval_loss": 0.4580159118652344, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.29108409735891555 }, { "epoch": 26, "eval_accuracy": 0.8516, "eval_loss": 0.45268468017578123, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.290835695192549 }, { "epoch": 27, "eval_accuracy": 0.8604, "eval_loss": 0.4285613464355469, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.2841388143777847 }, { "epoch": 28, "eval_accuracy": 0.8634, "eval_loss": 0.4222153564453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.2743539887905121 }, { "epoch": 29, "eval_accuracy": 0.8402, "eval_loss": 0.5224630859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.27201610174179075 }, { "epoch": 30, "eval_accuracy": 0.8474, "eval_loss": 0.4655813903808594, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.26682973040474783 }, { "epoch": 31, "eval_accuracy": 0.8522, "eval_loss": 0.4705499938964844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.26481335138214956 }, { "epoch": 32, "eval_accuracy": 0.8432, "eval_loss": 0.5508898071289062, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.26295674863391455 }, { "epoch": 33, "eval_accuracy": 0.868, "eval_loss": 0.4072789001464844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.25482014421357047 }, { "epoch": 34, "eval_accuracy": 0.8502, "eval_loss": 0.4737674072265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.25594374244478013 }, { "epoch": 35, "eval_accuracy": 0.8636, "eval_loss": 0.43671715698242186, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.24550499177773794 }, { "epoch": 36, "eval_accuracy": 0.8504, "eval_loss": 0.5042031433105468, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.24113377828068203 }, { "epoch": 37, "eval_accuracy": 0.8564, "eval_loss": 0.456636279296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.24051628319422405 }, { "epoch": 38, "eval_accuracy": 0.8644, "eval_loss": 0.455577294921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.23370062657992044 }, { "epoch": 39, "eval_accuracy": 0.8668, "eval_loss": 0.4439416625976563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.2288697966337204 }, { "epoch": 40, "eval_accuracy": 0.876, "eval_loss": 0.40666158447265627, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.2292720184326172 }, { "epoch": 41, "eval_accuracy": 0.874, "eval_loss": 0.439620068359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.2260119872940911 }, { "epoch": 42, "eval_accuracy": 0.8744, "eval_loss": 0.410631787109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.22043352348274656 }, { "epoch": 43, "eval_accuracy": 0.8492, "eval_loss": 0.5022360961914063, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.2215538299176428 }, { "epoch": 44, "eval_accuracy": 0.861, "eval_loss": 0.4755216369628906, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.22306056750350528 }, { "epoch": 45, "eval_accuracy": 0.8722, "eval_loss": 0.43333682250976563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.2135424311319987 }, { "epoch": 46, "eval_accuracy": 0.8742, "eval_loss": 0.44612857666015626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.21563978569772507 }, { "epoch": 47, "eval_accuracy": 0.8712, "eval_loss": 0.4285671081542969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.21078225373162163 }, { "epoch": 48, "eval_accuracy": 0.88, "eval_loss": 0.3932395385742187, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.21454219284587436 }, { "epoch": 49, "eval_accuracy": 0.848, "eval_loss": 0.5626197265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.21450545298788282 }, { "epoch": 50, "eval_accuracy": 0.8706, "eval_loss": 0.4620752685546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.20769385964075723 }, { "epoch": 51, "eval_accuracy": 0.8528, "eval_loss": 0.49712684326171874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.21213035280969408 }, { "epoch": 52, "eval_accuracy": 0.8806, "eval_loss": 0.4304973815917969, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.2030811865568161 }, { "epoch": 53, "eval_accuracy": 0.8882, "eval_loss": 0.36722509765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.2000371700392829 }, { "epoch": 54, "eval_accuracy": 0.8664, "eval_loss": 0.4356230651855469, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.19917343689335718 }, { "epoch": 55, "eval_accuracy": 0.8716, "eval_loss": 0.43104464721679686, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.19837952054871452 }, { "epoch": 56, "eval_accuracy": 0.8512, "eval_loss": 0.49728991088867186, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.19955373254352146 }, { "epoch": 57, "eval_accuracy": 0.851, "eval_loss": 0.5140265563964844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.19353483844863043 }, { "epoch": 58, "eval_accuracy": 0.8788, "eval_loss": 0.41481446533203126, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.19488789674705928 }, { "epoch": 59, "eval_accuracy": 0.8672, "eval_loss": 0.4865489929199219, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.1920552120367686 }, { "epoch": 60, "eval_accuracy": 0.8594, "eval_loss": 0.5026045593261719, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.18388274129231771 }, { "epoch": 61, "eval_accuracy": 0.8774, "eval_loss": 0.421068212890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.18769480295181273 }, { "epoch": 62, "eval_accuracy": 0.8728, "eval_loss": 0.406421240234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.193258737399843 }, { "epoch": 63, "eval_accuracy": 0.858, "eval_loss": 0.5191707092285156, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.1826606490029229 }, { "epoch": 64, "eval_accuracy": 0.8816, "eval_loss": 0.41435826416015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.18747838848696816 }, { "epoch": 65, "eval_accuracy": 0.8784, "eval_loss": 0.40977137451171874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.18679874833689797 }, { "epoch": 66, "eval_accuracy": 0.8744, "eval_loss": 0.4389544189453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.18423253170251846 }, { "epoch": 67, "eval_accuracy": 0.878, "eval_loss": 0.43681519775390626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.18141219682428572 }, { "epoch": 68, "eval_accuracy": 0.8818, "eval_loss": 0.3969242736816406, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.1803228695180681 }, { "epoch": 69, "eval_accuracy": 0.8846, "eval_loss": 0.40659450073242187, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.1756576668156518 }, { "epoch": 70, "eval_accuracy": 0.8704, "eval_loss": 0.4603804931640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.18106614275773367 }, { "epoch": 71, "eval_accuracy": 0.8642, "eval_loss": 0.4872785766601562, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.17989884740511577 }, { "epoch": 72, "eval_accuracy": 0.872, "eval_loss": 0.41939688110351564, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.17623830699788198 }, { "epoch": 73, "eval_accuracy": 0.8822, "eval_loss": 0.4099404174804688, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.17245613755914901 }, { "epoch": 74, "eval_accuracy": 0.8872, "eval_loss": 0.37339692993164064, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.17451896119647556 }, { "epoch": 75, "eval_accuracy": 0.878, "eval_loss": 0.4249140869140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.17885927769872878 }, { "epoch": 76, "eval_accuracy": 0.8756, "eval_loss": 0.41772691650390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.16925643913613425 }, { "epoch": 77, "eval_accuracy": 0.8868, "eval_loss": 0.40187772216796874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.16989823605219523 }, { "epoch": 78, "eval_accuracy": 0.8786, "eval_loss": 0.4158897705078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.17419387707710265 }, { "epoch": 79, "eval_accuracy": 0.8718, "eval_loss": 0.4515111572265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.1669309623559316 }, { "epoch": 80, "eval_accuracy": 0.8772, "eval_loss": 0.4646386657714844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.1685080126285553 }, { "epoch": 81, "eval_accuracy": 0.8792, "eval_loss": 0.4025916625976563, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.1665036998987198 }, { "epoch": 82, "eval_accuracy": 0.856, "eval_loss": 0.49355731201171876, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.16681153111457825 }, { "epoch": 83, "eval_accuracy": 0.8674, "eval_loss": 0.4592894470214844, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.17225918037626478 }, { "epoch": 84, "eval_accuracy": 0.8668, "eval_loss": 0.49534368896484376, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.1667035684797499 }, { "epoch": 85, "eval_accuracy": 0.8798, "eval_loss": 0.44453221435546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.16662992577022975 }, { "epoch": 86, "eval_accuracy": 0.8926, "eval_loss": 0.3840708984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.1652555229081048 }, { "epoch": 87, "eval_accuracy": 0.891, "eval_loss": 0.382837548828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.16847461541493733 }, { "epoch": 88, "eval_accuracy": 0.886, "eval_loss": 0.4266284973144531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.16859921624395582 }, { "epoch": 89, "eval_accuracy": 0.8776, "eval_loss": 0.4573221496582031, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.16235651333332063 }, { "epoch": 90, "eval_accuracy": 0.8702, "eval_loss": 0.46487689819335937, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.16057908042801752 }, { "epoch": 91, "eval_accuracy": 0.8654, "eval_loss": 0.4855129089355469, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.16279987126191456 }, { "epoch": 92, "eval_accuracy": 0.881, "eval_loss": 0.43439296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.16621251893308428 }, { "epoch": 93, "eval_accuracy": 0.8926, "eval_loss": 0.3748136779785156, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.1611718230115043 }, { "epoch": 94, "eval_accuracy": 0.871, "eval_loss": 0.4397787536621094, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.16647623745997747 }, { "epoch": 95, "eval_accuracy": 0.8814, "eval_loss": 0.4218956359863281, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.16139989402559068 }, { "epoch": 96, "eval_accuracy": 0.887, "eval_loss": 0.4029042053222656, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.15817028217315673 }, { "epoch": 97, "eval_accuracy": 0.8846, "eval_loss": 0.426631787109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.15957610891660054 }, { "epoch": 98, "eval_accuracy": 0.8962, "eval_loss": 0.35802305908203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.15509013244311015 }, { "epoch": 99, "eval_accuracy": 0.8836, "eval_loss": 0.4078686767578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.16025661662419638 }, { "epoch": 100, "eval_accuracy": 0.8698, "eval_loss": 0.4947103332519531, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.15619702618320783 }, { "epoch": 101, "eval_accuracy": 0.9172, "eval_loss": 0.283290478515625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.0919350504954656 }, { "epoch": 102, "eval_accuracy": 0.916, "eval_loss": 0.2839746948242188, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.06293851057622168 }, { "epoch": 103, "eval_accuracy": 0.9204, "eval_loss": 0.28171181640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.053611354100538626 }, { "epoch": 104, "eval_accuracy": 0.9216, "eval_loss": 0.2781740661621094, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.04668084240456422 }, { "epoch": 105, "eval_accuracy": 0.9226, "eval_loss": 0.2879105224609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.04359266593654951 }, { "epoch": 106, "eval_accuracy": 0.9234, "eval_loss": 0.29206656494140626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.038716788862148924 }, { "epoch": 107, "eval_accuracy": 0.9246, "eval_loss": 0.29641119384765624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.036085647984345756 }, { "epoch": 108, "eval_accuracy": 0.9232, "eval_loss": 0.30074464111328125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.03377311499449942 }, { "epoch": 109, "eval_accuracy": 0.9242, "eval_loss": 0.30086492919921876, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.03104732546210289 }, { "epoch": 110, "eval_accuracy": 0.924, "eval_loss": 0.3048627014160156, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.030359695131911172 }, { "epoch": 111, "eval_accuracy": 0.924, "eval_loss": 0.3087982421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.027889062374830246 }, { "epoch": 112, "eval_accuracy": 0.924, "eval_loss": 0.3089269226074219, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.027552290483315787 }, { "epoch": 113, "eval_accuracy": 0.9266, "eval_loss": 0.3071017822265625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.025298097997903824 }, { "epoch": 114, "eval_accuracy": 0.9212, "eval_loss": 0.3117630615234375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.02453123506307602 }, { "epoch": 115, "eval_accuracy": 0.9254, "eval_loss": 0.31803255615234377, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.022481246304677592 }, { "epoch": 116, "eval_accuracy": 0.923, "eval_loss": 0.3159791198730469, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.022579287205139797 }, { "epoch": 117, "eval_accuracy": 0.9256, "eval_loss": 0.3194157165527344, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.021970157868001196 }, { "epoch": 118, "eval_accuracy": 0.924, "eval_loss": 0.3299554748535156, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.020222671439912583 }, { "epoch": 119, "eval_accuracy": 0.9256, "eval_loss": 0.3334829528808594, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.019925816707147492 }, { "epoch": 120, "eval_accuracy": 0.9262, "eval_loss": 0.3268382507324219, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.017402058001400697 }, { "epoch": 121, "eval_accuracy": 0.925, "eval_loss": 0.3368515625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.01769845224486457 }, { "epoch": 122, "eval_accuracy": 0.9274, "eval_loss": 0.3335461181640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.017841399673289723 }, { "epoch": 123, "eval_accuracy": 0.927, "eval_loss": 0.33780157470703126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.016299792051646445 }, { "epoch": 124, "eval_accuracy": 0.9268, "eval_loss": 0.34122034301757814, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.015568790648380916 }, { "epoch": 125, "eval_accuracy": 0.9256, "eval_loss": 0.34111203002929685, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.016821574689199526 }, { "epoch": 126, "eval_accuracy": 0.9244, "eval_loss": 0.34721368408203124, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.015542411519090334 }, { "epoch": 127, "eval_accuracy": 0.9256, "eval_loss": 0.34593865356445314, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.015203730338811875 }, { "epoch": 128, "eval_accuracy": 0.9262, "eval_loss": 0.3516455078125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.013415788523107767 }, { "epoch": 129, "eval_accuracy": 0.9264, "eval_loss": 0.35247120971679685, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.013082009490993288 }, { "epoch": 130, "eval_accuracy": 0.9238, "eval_loss": 0.3506563232421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.012456533164613776 }, { "epoch": 131, "eval_accuracy": 0.9248, "eval_loss": 0.3509290588378906, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.013791085198024909 }, { "epoch": 132, "eval_accuracy": 0.9244, "eval_loss": 0.3555397583007813, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.012909759015010463 }, { "epoch": 133, "eval_accuracy": 0.9258, "eval_loss": 0.3627603454589844, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.012380503948198424 }, { "epoch": 134, "eval_accuracy": 0.9258, "eval_loss": 0.36262833251953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.011786968642969926 }, { "epoch": 135, "eval_accuracy": 0.9268, "eval_loss": 0.3640386047363281, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.012401803022126357 }, { "epoch": 136, "eval_accuracy": 0.925, "eval_loss": 0.36981715087890626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.01138345877594418 }, { "epoch": 137, "eval_accuracy": 0.9254, "eval_loss": 0.36221641845703123, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.01095986443956693 }, { "epoch": 138, "eval_accuracy": 0.9254, "eval_loss": 0.37304404296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.011773464465969139 }, { "epoch": 139, "eval_accuracy": 0.9246, "eval_loss": 0.37177071533203127, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.010575827517815762 }, { "epoch": 140, "eval_accuracy": 0.9246, "eval_loss": 0.37671232299804686, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.01054492362919781 }, { "epoch": 141, "eval_accuracy": 0.9246, "eval_loss": 0.3732326416015625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.011174578830599784 }, { "epoch": 142, "eval_accuracy": 0.925, "eval_loss": 0.373262890625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.009631121079499523 }, { "epoch": 143, "eval_accuracy": 0.9266, "eval_loss": 0.3794520751953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.010214703265577555 }, { "epoch": 144, "eval_accuracy": 0.925, "eval_loss": 0.3776400390625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.009037613876826233 }, { "epoch": 145, "eval_accuracy": 0.9218, "eval_loss": 0.3810528930664063, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.009570675100634496 }, { "epoch": 146, "eval_accuracy": 0.9242, "eval_loss": 0.3810512023925781, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.009632527514712679 }, { "epoch": 147, "eval_accuracy": 0.924, "eval_loss": 0.3873039978027344, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.009912042107847002 }, { "epoch": 148, "eval_accuracy": 0.9258, "eval_loss": 0.3850289794921875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.009672875482009517 }, { "epoch": 149, "eval_accuracy": 0.9262, "eval_loss": 0.3870732299804687, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.008430721307463116 }, { "epoch": 150, "eval_accuracy": 0.925, "eval_loss": 0.3842845153808594, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.00836476296401686 }, { "epoch": 151, "eval_accuracy": 0.9248, "eval_loss": 0.3796745849609375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.007752285371720791 }, { "epoch": 152, "eval_accuracy": 0.926, "eval_loss": 0.3802146240234375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.008240172734318508 }, { "epoch": 153, "eval_accuracy": 0.9252, "eval_loss": 0.38012276000976564, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.006998140365506212 }, { "epoch": 154, "eval_accuracy": 0.9266, "eval_loss": 0.3791354736328125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.006879981412159072 }, { "epoch": 155, "eval_accuracy": 0.9258, "eval_loss": 0.37881537475585936, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.006742739064494769 }, { "epoch": 156, "eval_accuracy": 0.9264, "eval_loss": 0.38017742919921876, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.006501108894248804 }, { "epoch": 157, "eval_accuracy": 0.9254, "eval_loss": 0.3797306640625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.006946949698196517 }, { "epoch": 158, "eval_accuracy": 0.9252, "eval_loss": 0.3788091552734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.0069799597129432695 }, { "epoch": 159, "eval_accuracy": 0.9256, "eval_loss": 0.378277099609375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.006285468248588343 }, { "epoch": 160, "eval_accuracy": 0.927, "eval_loss": 0.37642570190429686, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.006426012566747765 }, { "epoch": 161, "eval_accuracy": 0.925, "eval_loss": 0.37553992919921875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.005865842514650689 }, { "epoch": 162, "eval_accuracy": 0.9256, "eval_loss": 0.38009876708984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.006607880344159074 }, { "epoch": 163, "eval_accuracy": 0.9254, "eval_loss": 0.3770572082519531, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.006660557381560405 }, { "epoch": 164, "eval_accuracy": 0.9266, "eval_loss": 0.38073275146484375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.006553415514073438 }, { "epoch": 165, "eval_accuracy": 0.9262, "eval_loss": 0.3793877258300781, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.005639047432028585 }, { "epoch": 166, "eval_accuracy": 0.928, "eval_loss": 0.3806024658203125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.006318632692760891 }, { "epoch": 167, "eval_accuracy": 0.9256, "eval_loss": 0.3804926208496094, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.005757771301083267 }, { "epoch": 168, "eval_accuracy": 0.9266, "eval_loss": 0.3818713256835938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.005887672925574912 }, { "epoch": 169, "eval_accuracy": 0.9256, "eval_loss": 0.38314972534179687, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.0062801586909840505 }, { "epoch": 170, "eval_accuracy": 0.9266, "eval_loss": 0.3803857055664063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.005388368136166699 }, { "epoch": 171, "eval_accuracy": 0.9274, "eval_loss": 0.38005389404296874, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.005335355056242811 }, { "epoch": 172, "eval_accuracy": 0.926, "eval_loss": 0.3798578369140625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.005680962507923444 }, { "epoch": 173, "eval_accuracy": 0.9268, "eval_loss": 0.37983125610351565, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.005903353605791926 }, { "epoch": 174, "eval_accuracy": 0.927, "eval_loss": 0.3794900756835938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.005541315438598394 }, { "epoch": 175, "eval_accuracy": 0.9274, "eval_loss": 0.37762247924804687, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.006261111334876882 }, { "epoch": 176, "eval_accuracy": 0.9266, "eval_loss": 0.37954530029296873, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.0054626991358068255 }, { "epoch": 177, "eval_accuracy": 0.926, "eval_loss": 0.37930660400390626, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.0054296861392756305 }, { "epoch": 178, "eval_accuracy": 0.9274, "eval_loss": 0.3783561584472656, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.005808477004700237 }, { "epoch": 179, "eval_accuracy": 0.9254, "eval_loss": 0.3786826538085937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.005417727620734109 }, { "epoch": 180, "eval_accuracy": 0.9268, "eval_loss": 0.37825419921875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.005960534370400839 }, { "epoch": 181, "eval_accuracy": 0.9276, "eval_loss": 0.37896533203125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.005777932195696566 }, { "epoch": 182, "eval_accuracy": 0.9258, "eval_loss": 0.3841477783203125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.00565131838483115 }, { "epoch": 183, "eval_accuracy": 0.926, "eval_loss": 0.37931566162109376, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.006461898795018593 }, { "epoch": 184, "eval_accuracy": 0.9268, "eval_loss": 0.3812836486816406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.005682292328650753 }, { "epoch": 185, "eval_accuracy": 0.9268, "eval_loss": 0.3813713623046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.005426007693178124 }, { "epoch": 186, "eval_accuracy": 0.9268, "eval_loss": 0.3784933288574219, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.005445328628644347 }, { "epoch": 187, "eval_accuracy": 0.925, "eval_loss": 0.3797018127441406, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.0051834056191146375 }, { "epoch": 188, "eval_accuracy": 0.9268, "eval_loss": 0.3820699096679688, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.005792698964145448 }, { "epoch": 189, "eval_accuracy": 0.9248, "eval_loss": 0.3816817443847656, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.00558649147922794 }, { "epoch": 190, "eval_accuracy": 0.9264, "eval_loss": 0.3805133972167969, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.005222728777097331 }, { "epoch": 191, "eval_accuracy": 0.9264, "eval_loss": 0.38058997192382815, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.004994279914928807 }, { "epoch": 192, "eval_accuracy": 0.9268, "eval_loss": 0.3790363037109375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.005501532499823305 }, { "epoch": 193, "eval_accuracy": 0.927, "eval_loss": 0.3807512573242188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.005647506911224789 }, { "epoch": 194, "eval_accuracy": 0.9254, "eval_loss": 0.37857630004882814, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.005686942210959064 }, { "epoch": 195, "eval_accuracy": 0.928, "eval_loss": 0.3788825134277344, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.005199345403330193 }, { "epoch": 196, "eval_accuracy": 0.9272, "eval_loss": 0.3805579833984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.005200389449753695 }, { "epoch": 197, "eval_accuracy": 0.9274, "eval_loss": 0.38221766967773435, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.005538683751142687 }, { "epoch": 198, "eval_accuracy": 0.927, "eval_loss": 0.38246532592773436, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.005221181215594212 }, { "epoch": 199, "eval_accuracy": 0.9274, "eval_loss": 0.37890045166015623, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.005684674559947517 }, { "epoch": 200, "eval_accuracy": 0.928, "eval_loss": 0.38430252685546873, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.005607284581330087 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.928, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.38430252685546873, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2330820608, "peak_memory_reserved_bytes": 3049259008, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 33.98609757423401, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1926.7095592021942, "train_wall_s": 1892.7023992538452 }, "work": { "apical_macs_per_example": 0, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 0, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 1239526656000000, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 0, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 619763328000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 68862592, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1859289984000000 } }