{ "architecture": { "adaptive_apical_parameters": 6389760, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 9, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 56, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 532480, "forward_parameters": 853018, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 1064960, "residual_scale": 1.0, "vectorizer_mode": "spatial_template", "vectorizer_parameters": 5324800 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 56, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.01, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "dfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-dfa-d56-lr0p01.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "full_hidden_field", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.00035024905325068784, "innovation_negative_gradient_cosine": [ -0.0008385714027099311, 0.002124390099197626, -0.0008659408194944263, -0.00014567584730684757, -0.0005021363031119108, 0.001265335944481194, 0.004038718529045582, 0.0005503536085598171, 0.0014425356639549136, -0.0012388156028464437, 0.0004629977629519999, -0.0005257049342617393, 0.0005172170931473374, 0.0012648290721699595, -0.0009433561353944242, 0.00048206010251306, -0.00037864106707274914, -0.00040511280531063676, -0.0019009984098374844, 0.002641211496666074, 0.000786549411714077, -0.0003178365295752883, 0.0014189683133736253, 0.00026458967477083206, 0.0013584874104708433, 8.317664469359443e-05, 0.0022656084038317204, 0.0007815274875611067, -0.0014294714201241732, 0.003384759183973074, 0.0010553388856351376, 0.0004074107273481786, -0.0002539380802772939, 7.720990106463432e-05, -0.0019574719481170177, 0.0013086958788335323, -0.001038939692080021, 0.009168915450572968, 0.007564560975879431, 0.005770865827798843, 0.008899712935090065, 0.007965256460011005, 0.01344345323741436, 0.009990139864385128, 0.012594806961715221, 0.009420137852430344, 0.007213872857391834, 0.003913925029337406, 0.006504267454147339, 0.006452905014157295, 0.017092103138566017, 0.006244623102247715, 0.013663386926054955, 0.01786511018872261, 0.02073792740702629 ], "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ -0.0008385714027099311, 0.002124390099197626, -0.0008659408194944263, -0.00014567584730684757, -0.0005021363031119108, 0.001265335944481194, 0.004038718529045582, 0.0005503536085598171, 0.0014425356639549136, -0.0012388156028464437, 0.0004629977629519999, -0.0005257049342617393, 0.0005172170931473374, 0.0012648290721699595, -0.0009433561353944242, 0.00048206010251306, -0.00037864106707274914, -0.00040511280531063676, -0.0019009984098374844, 0.002641211496666074, 0.000786549411714077, -0.0003178365295752883, 0.0014189683133736253, 0.00026458967477083206, 0.0013584874104708433, 8.317664469359443e-05, 0.0022656084038317204, 0.0007815274875611067, -0.0014294714201241732, 0.003384759183973074, 0.0010553388856351376, 0.0004074107273481786, -0.0002539380802772939, 7.720990106463432e-05, -0.0019574719481170177, 0.0013086958788335323, -0.001038939692080021, 0.009168915450572968, 0.007564560975879431, 0.005770865827798843, 0.008899712935090065, 0.007965256460011005, 0.01344345323741436, 0.009990139864385128, 0.012594806961715221, 0.009420137852430344, 0.007213872857391834, 0.003913925029337406, 0.006504267454147339, 0.006452905014157295, 0.017092103138566017, 0.006244623102247715, 0.013663386926054955, 0.01786511018872261, 0.02073792740702629 ], "teaching_negative_gradient_cosine": [ -0.0008385714027099311, 0.002124390099197626, -0.0008659408194944263, -0.00014567584730684757, -0.0005021363031119108, 0.001265335944481194, 0.004038718529045582, 0.0005503536085598171, 0.0014425356639549136, -0.0012388156028464437, 0.0004629977629519999, -0.0005257049342617393, 0.0005172170931473374, 0.0012648290721699595, -0.0009433561353944242, 0.00048206010251306, -0.00037864106707274914, -0.00040511280531063676, -0.0019009984098374844, 0.002641211496666074, 0.000786549411714077, -0.0003178365295752883, 0.0014189683133736253, 0.00026458967477083206, 0.0013584874104708433, 8.317664469359443e-05, 0.0022656084038317204, 0.0007815274875611067, -0.0014294714201241732, 0.003384759183973074, 0.0010553388856351376, 0.0004074107273481786, -0.0002539380802772939, 7.720990106463432e-05, -0.0019574719481170177, 0.0013086958788335323, -0.001038939692080021, 0.009168915450572968, 0.007564560975879431, 0.005770865827798843, 0.008899712935090065, 0.007965256460011005, 0.01344345323741436, 0.009990139864385128, 0.012594806961715221, 0.009420137852430344, 0.007213872857391834, 0.003913925029337406, 0.006504267454147339, 0.006452905014157295, 0.017092103138566017, 0.006244623102247715, 0.013663386926054955, 0.01786511018872261, 0.02073792740702629 ], "wall_s": 0.17446684837341309 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.1736, "eval_loss": 2.3541751953125, "eval_split": "validation", "lr": 0.002, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.479923766793145 }, { "epoch": 2, "eval_accuracy": 0.171, "eval_loss": 9.3748625, "eval_split": "validation", "lr": 0.004, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 9.503815193684895 }, { "epoch": 3, "eval_accuracy": 0.1162, "eval_loss": 15.8507943359375, "eval_split": "validation", "lr": 0.006, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 17.57388380262587 }, { "epoch": 4, "eval_accuracy": 0.1476, "eval_loss": 18.62470546875, "eval_split": "validation", "lr": 0.008, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 20.294757021755643 }, { "epoch": 5, "eval_accuracy": 0.2192, "eval_loss": 17.0168251953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 22.494775368584527 }, { "epoch": 6, "eval_accuracy": 0.2456, "eval_loss": 12.4064818359375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 18.441068319702147 }, { "epoch": 7, "eval_accuracy": 0.2018, "eval_loss": 13.71370859375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 18.688175535922582 }, { "epoch": 8, "eval_accuracy": 0.1932, "eval_loss": 24.330255078125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 20.849487725830077 }, { "epoch": 9, "eval_accuracy": 0.2196, "eval_loss": 15.015166796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 20.860968447875976 }, { "epoch": 10, "eval_accuracy": 0.2212, "eval_loss": 22.310587890625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 22.45043119913737 }, { "epoch": 11, "eval_accuracy": 0.1606, "eval_loss": 24.616283203125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 21.248531058417427 }, { "epoch": 12, "eval_accuracy": 0.1408, "eval_loss": 38.6989578125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 23.867157828097874 }, { "epoch": 13, "eval_accuracy": 0.1746, "eval_loss": 33.787591796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 25.00604586452908 }, { "epoch": 14, "eval_accuracy": 0.1706, "eval_loss": 35.00100546875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 29.429117143419052 }, { "epoch": 15, "eval_accuracy": 0.1468, "eval_loss": 49.8456734375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 35.39160467122396 }, { "epoch": 16, "eval_accuracy": 0.1636, "eval_loss": 35.58575703125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 31.424257394070096 }, { "epoch": 17, "eval_accuracy": 0.2082, "eval_loss": 38.31974375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 41.756677141655814 }, { "epoch": 18, "eval_accuracy": 0.1674, "eval_loss": 55.60708984375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 41.471936461046006 }, { "epoch": 19, "eval_accuracy": 0.2752, "eval_loss": 26.146371484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 47.22188578592936 }, { "epoch": 20, "eval_accuracy": 0.246, "eval_loss": 49.61728359375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 48.96045647583008 }, { "epoch": 21, "eval_accuracy": 0.3108, "eval_loss": 28.35482109375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 54.232426001315645 }, { "epoch": 22, "eval_accuracy": 0.193, "eval_loss": 78.530896875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 56.057253458658856 }, { "epoch": 23, "eval_accuracy": 0.239, "eval_loss": 56.023084375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 61.60340079481337 }, { "epoch": 24, "eval_accuracy": 0.2034, "eval_loss": 140.8517625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 68.93976577148437 }, { "epoch": 25, "eval_accuracy": 0.2146, "eval_loss": 98.26845, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 65.16236778971354 }, { "epoch": 26, "eval_accuracy": 0.1006, "eval_loss": 183.918659375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 83.24809537217882 }, { "epoch": 27, "eval_accuracy": 0.2808, "eval_loss": 129.1784984375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 84.530659375 }, { "epoch": 28, "eval_accuracy": 0.2766, "eval_loss": 76.771484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 95.1158966044108 }, { "epoch": 29, "eval_accuracy": 0.2638, "eval_loss": 93.3139046875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 95.88311271023221 }, { "epoch": 30, "eval_accuracy": 0.2536, "eval_loss": 129.6387484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 109.07512716064453 }, { "epoch": 31, "eval_accuracy": 0.1254, "eval_loss": 210.85293125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 115.62372081434462 }, { "epoch": 32, "eval_accuracy": 0.2206, "eval_loss": 185.76780625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 133.46289936523436 }, { "epoch": 33, "eval_accuracy": 0.225, "eval_loss": 185.7995, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 137.48025703667534 }, { "epoch": 34, "eval_accuracy": 0.1878, "eval_loss": 260.351153125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 157.19087931043836 }, { "epoch": 35, "eval_accuracy": 0.1858, "eval_loss": 387.71186875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 155.11019038628473 }, { "epoch": 36, "eval_accuracy": 0.1748, "eval_loss": 393.25378125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 170.66294742838542 }, { "epoch": 37, "eval_accuracy": 0.3108, "eval_loss": 177.023921875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 191.58247672254774 }, { "epoch": 38, "eval_accuracy": 0.2834, "eval_loss": 254.260515625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 209.28699675835503 }, { "epoch": 39, "eval_accuracy": 0.2852, "eval_loss": 224.945253125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 235.84405463324651 }, { "epoch": 40, "eval_accuracy": 0.1732, "eval_loss": 513.14443125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 239.26524459092883 }, { "epoch": 41, "eval_accuracy": 0.231, "eval_loss": 222.885778125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 254.86575007052951 }, { "epoch": 42, "eval_accuracy": 0.2524, "eval_loss": 229.431778125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 261.95233366970484 }, { "epoch": 43, "eval_accuracy": 0.3022, "eval_loss": 391.91845625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 324.3291342556424 }, { "epoch": 44, "eval_accuracy": 0.2278, "eval_loss": 556.278825, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 312.7284970106337 }, { "epoch": 45, "eval_accuracy": 0.1716, "eval_loss": 764.924875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 358.8140581542969 }, { "epoch": 46, "eval_accuracy": 0.1858, "eval_loss": 484.53405, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 334.96564144422746 }, { "epoch": 47, "eval_accuracy": 0.1762, "eval_loss": 656.2453375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 390.17689079318575 }, { "epoch": 48, "eval_accuracy": 0.2056, "eval_loss": 441.7227625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 406.4874663411458 }, { "epoch": 49, "eval_accuracy": 0.2152, "eval_loss": 727.2657625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 465.0384421766493 }, { "epoch": 50, "eval_accuracy": 0.2126, "eval_loss": 541.7233875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 481.0208101074219 }, { "epoch": 51, "eval_accuracy": 0.1636, "eval_loss": 1147.0993, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 481.1614602701823 }, { "epoch": 52, "eval_accuracy": 0.132, "eval_loss": 840.8927625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 548.6089418836806 }, { "epoch": 53, "eval_accuracy": 0.2612, "eval_loss": 661.988025, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 678.038278624132 }, { "epoch": 54, "eval_accuracy": 0.1514, "eval_loss": 2164.9526, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 609.5724734592014 }, { "epoch": 55, "eval_accuracy": 0.2108, "eval_loss": 1088.262275, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 725.6776028862847 }, { "epoch": 56, "eval_accuracy": 0.331, "eval_loss": 319.69473125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 736.4521655978733 }, { "epoch": 57, "eval_accuracy": 0.2552, "eval_loss": 764.159225, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 651.7272706271701 }, { "epoch": 58, "eval_accuracy": 0.2334, "eval_loss": 1569.883025, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 754.1738535807292 }, { "epoch": 59, "eval_accuracy": 0.2296, "eval_loss": 1001.5583875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 898.3274509548611 }, { "epoch": 60, "eval_accuracy": 0.2058, "eval_loss": 942.179375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 842.5285305989584 }, { "epoch": 61, "eval_accuracy": 0.2784, "eval_loss": 641.63215, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 922.3867413628473 }, { "epoch": 62, "eval_accuracy": 0.2018, "eval_loss": 1669.65185, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 936.2655243923612 }, { "epoch": 63, "eval_accuracy": 0.1514, "eval_loss": 2189.349025, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 1097.9668812065972 }, { "epoch": 64, "eval_accuracy": 0.1242, "eval_loss": 1848.996975, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 904.8054986979166 }, { "epoch": 65, "eval_accuracy": 0.2676, "eval_loss": 945.107175, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 1117.1221231336806 }, { "epoch": 66, "eval_accuracy": 0.2208, "eval_loss": 877.7712375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 1260.3183142415364 }, { "epoch": 67, "eval_accuracy": 0.1668, "eval_loss": 1989.77125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 1177.6693628472221 }, { "epoch": 68, "eval_accuracy": 0.2552, "eval_loss": 2615.7875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 1239.7195300347223 }, { "epoch": 69, "eval_accuracy": 0.2904, "eval_loss": 1145.899225, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 1413.3063585828993 }, { "epoch": 70, "eval_accuracy": 0.1982, "eval_loss": 1340.564725, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 1432.3528199001737 }, { "epoch": 71, "eval_accuracy": 0.2026, "eval_loss": 2114.94005, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 1649.5298797743055 }, { "epoch": 72, "eval_accuracy": 0.2952, "eval_loss": 817.0742125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 1511.4559931857639 }, { "epoch": 73, "eval_accuracy": 0.1986, "eval_loss": 5055.5722, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 1597.8940986979167 }, { "epoch": 74, "eval_accuracy": 0.2644, "eval_loss": 1979.6754, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 1545.4152473090278 }, { "epoch": 75, "eval_accuracy": 0.2184, "eval_loss": 1628.492025, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 1909.3885863715277 }, { "epoch": 76, "eval_accuracy": 0.115, "eval_loss": 3524.5311, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 1744.735998372396 }, { "epoch": 77, "eval_accuracy": 0.2232, "eval_loss": 1634.16325, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 1917.358931282552 }, { "epoch": 78, "eval_accuracy": 0.2678, "eval_loss": 1975.21855, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 1775.3661026584202 }, { "epoch": 79, "eval_accuracy": 0.12, "eval_loss": 5105.1117, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 2197.024656922743 }, { "epoch": 80, "eval_accuracy": 0.2726, "eval_loss": 1750.003225, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 2032.038926204427 }, { "epoch": 81, "eval_accuracy": 0.1904, "eval_loss": 2697.03705, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 2351.129897764757 }, { "epoch": 82, "eval_accuracy": 0.1592, "eval_loss": 3450.82265, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 2180.3887864583335 }, { "epoch": 83, "eval_accuracy": 0.3354, "eval_loss": 1321.29855, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 2424.0763131944445 }, { "epoch": 84, "eval_accuracy": 0.2848, "eval_loss": 3661.75795, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 2325.0078926649308 }, { "epoch": 85, "eval_accuracy": 0.2994, "eval_loss": 1387.98565, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 2394.1546099826387 }, { "epoch": 86, "eval_accuracy": 0.2162, "eval_loss": 5530.6169, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 2654.00433984375 }, { "epoch": 87, "eval_accuracy": 0.1348, "eval_loss": 4538.7721, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 2801.9152317708335 }, { "epoch": 88, "eval_accuracy": 0.2436, "eval_loss": 3880.88055, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 2592.33646875 }, { "epoch": 89, "eval_accuracy": 0.2474, "eval_loss": 3858.4386, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 2924.044119314236 }, { "epoch": 90, "eval_accuracy": 0.1872, "eval_loss": 4376.7555, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 2877.3811128689235 }, { "epoch": 91, "eval_accuracy": 0.227, "eval_loss": 3983.18415, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 3019.5719048611113 }, { "epoch": 92, "eval_accuracy": 0.1876, "eval_loss": 4822.9704, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 3324.442807378472 }, { "epoch": 93, "eval_accuracy": 0.1002, "eval_loss": 8843.1426, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 3076.9131136284723 }, { "epoch": 94, "eval_accuracy": 0.2588, "eval_loss": 2395.90985, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 3655.9118378038193 }, { "epoch": 95, "eval_accuracy": 0.3154, "eval_loss": 2502.6303, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 3351.3480279513888 }, { "epoch": 96, "eval_accuracy": 0.2102, "eval_loss": 2872.629, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 3646.8260487413195 }, { "epoch": 97, "eval_accuracy": 0.2226, "eval_loss": 3102.1834, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 3670.6937383246527 }, { "epoch": 98, "eval_accuracy": 0.204, "eval_loss": 5511.3655, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 3852.314850607639 }, { "epoch": 99, "eval_accuracy": 0.2012, "eval_loss": 3771.54135, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 3782.515890190972 }, { "epoch": 100, "eval_accuracy": 0.224, "eval_loss": 5541.5195, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 4224.866707638889 }, { "epoch": 101, "eval_accuracy": 0.3192, "eval_loss": 954.1664625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 1023.3584813802083 }, { "epoch": 102, "eval_accuracy": 0.3176, "eval_loss": 666.8220625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 674.6085620225695 }, { "epoch": 103, "eval_accuracy": 0.3044, "eval_loss": 627.003725, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 585.7811496582032 }, { "epoch": 104, "eval_accuracy": 0.3124, "eval_loss": 584.7140875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 545.9971641438802 }, { "epoch": 105, "eval_accuracy": 0.3118, "eval_loss": 552.403825, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 524.543052484809 }, { "epoch": 106, "eval_accuracy": 0.32, "eval_loss": 489.4699125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 491.8761935221354 }, { "epoch": 107, "eval_accuracy": 0.3254, "eval_loss": 419.153225, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 467.915876936849 }, { "epoch": 108, "eval_accuracy": 0.3148, "eval_loss": 416.48076875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 445.60208774414065 }, { "epoch": 109, "eval_accuracy": 0.3162, "eval_loss": 417.7529375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 418.3163262369792 }, { "epoch": 110, "eval_accuracy": 0.3118, "eval_loss": 381.2394, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 394.4938233561198 }, { "epoch": 111, "eval_accuracy": 0.2974, "eval_loss": 393.32450625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 393.7556446126302 }, { "epoch": 112, "eval_accuracy": 0.3308, "eval_loss": 316.0081375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 375.48029161783853 }, { "epoch": 113, "eval_accuracy": 0.33, "eval_loss": 293.41238125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 355.54808799913195 }, { "epoch": 114, "eval_accuracy": 0.3242, "eval_loss": 295.97705625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 340.8098280056424 }, { "epoch": 115, "eval_accuracy": 0.272, "eval_loss": 356.230325, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 324.02832730577256 }, { "epoch": 116, "eval_accuracy": 0.2806, "eval_loss": 388.42944375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 317.93263887261287 }, { "epoch": 117, "eval_accuracy": 0.2912, "eval_loss": 320.12799375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 328.08235987413195 }, { "epoch": 118, "eval_accuracy": 0.2682, "eval_loss": 365.60305, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 316.4193104817708 }, { "epoch": 119, "eval_accuracy": 0.3076, "eval_loss": 293.89094375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 315.2604624891493 }, { "epoch": 120, "eval_accuracy": 0.2916, "eval_loss": 338.8138, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 311.2781292751736 }, { "epoch": 121, "eval_accuracy": 0.2784, "eval_loss": 359.22824375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 308.00667970920136 }, { "epoch": 122, "eval_accuracy": 0.3256, "eval_loss": 303.96686875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 306.2332032118056 }, { "epoch": 123, "eval_accuracy": 0.246, "eval_loss": 472.69735625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 326.6572144422743 }, { "epoch": 124, "eval_accuracy": 0.3092, "eval_loss": 303.3160625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 327.3754111029731 }, { "epoch": 125, "eval_accuracy": 0.3476, "eval_loss": 250.8448625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 333.8108040581597 }, { "epoch": 126, "eval_accuracy": 0.3196, "eval_loss": 226.150090625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 308.0572482096354 }, { "epoch": 127, "eval_accuracy": 0.3436, "eval_loss": 242.99584375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 302.3140259521484 }, { "epoch": 128, "eval_accuracy": 0.3344, "eval_loss": 201.0353, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 297.69994912923175 }, { "epoch": 129, "eval_accuracy": 0.2382, "eval_loss": 500.881875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 310.16952446831596 }, { "epoch": 130, "eval_accuracy": 0.2756, "eval_loss": 516.33688125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 327.5882095594618 }, { "epoch": 131, "eval_accuracy": 0.3174, "eval_loss": 267.765934375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 350.485053257921 }, { "epoch": 132, "eval_accuracy": 0.2736, "eval_loss": 290.18941875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 317.8272129801432 }, { "epoch": 133, "eval_accuracy": 0.3064, "eval_loss": 302.160225, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 305.53068083767363 }, { "epoch": 134, "eval_accuracy": 0.3088, "eval_loss": 261.52979375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 303.8541805284288 }, { "epoch": 135, "eval_accuracy": 0.3396, "eval_loss": 214.982534375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 330.44600800238715 }, { "epoch": 136, "eval_accuracy": 0.3392, "eval_loss": 236.768690625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 304.66661754014757 }, { "epoch": 137, "eval_accuracy": 0.3212, "eval_loss": 232.519890625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 349.3437628499349 }, { "epoch": 138, "eval_accuracy": 0.2252, "eval_loss": 339.20315, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 296.8857865234375 }, { "epoch": 139, "eval_accuracy": 0.3216, "eval_loss": 316.37996875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 366.07723196614586 }, { "epoch": 140, "eval_accuracy": 0.2446, "eval_loss": 391.34220625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 324.58141136610243 }, { "epoch": 141, "eval_accuracy": 0.2642, "eval_loss": 596.2132, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 298.179056000434 }, { "epoch": 142, "eval_accuracy": 0.2394, "eval_loss": 403.21318125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 344.9279659396701 }, { "epoch": 143, "eval_accuracy": 0.2662, "eval_loss": 385.6030375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 337.4383267252604 }, { "epoch": 144, "eval_accuracy": 0.3, "eval_loss": 316.413725, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 322.35182532552085 }, { "epoch": 145, "eval_accuracy": 0.2924, "eval_loss": 302.7712375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 328.3091288248698 }, { "epoch": 146, "eval_accuracy": 0.3518, "eval_loss": 263.23478125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 357.0935332411024 }, { "epoch": 147, "eval_accuracy": 0.2666, "eval_loss": 348.51591875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 302.8438815375434 }, { "epoch": 148, "eval_accuracy": 0.3322, "eval_loss": 237.38480625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 351.8545443223741 }, { "epoch": 149, "eval_accuracy": 0.2848, "eval_loss": 410.83615, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 337.79270292426213 }, { "epoch": 150, "eval_accuracy": 0.3464, "eval_loss": 277.364209375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 314.32726003689237 }, { "epoch": 151, "eval_accuracy": 0.4056, "eval_loss": 109.8672171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 116.31430750325521 }, { "epoch": 152, "eval_accuracy": 0.388, "eval_loss": 104.958153125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 105.8084699001736 }, { "epoch": 153, "eval_accuracy": 0.3916, "eval_loss": 96.0502734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 100.08656565348308 }, { "epoch": 154, "eval_accuracy": 0.3864, "eval_loss": 92.389784375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 93.1440177951389 }, { "epoch": 155, "eval_accuracy": 0.3882, "eval_loss": 86.4438921875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 88.13311031901041 }, { "epoch": 156, "eval_accuracy": 0.3774, "eval_loss": 84.1961578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 84.23837499864366 }, { "epoch": 157, "eval_accuracy": 0.378, "eval_loss": 76.8194421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 81.50850522867839 }, { "epoch": 158, "eval_accuracy": 0.3542, "eval_loss": 76.5250671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 77.57814040527344 }, { "epoch": 159, "eval_accuracy": 0.3394, "eval_loss": 79.1525265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 76.05412509901258 }, { "epoch": 160, "eval_accuracy": 0.351, "eval_loss": 73.306775, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 72.83907199164497 }, { "epoch": 161, "eval_accuracy": 0.3548, "eval_loss": 67.07043828125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 71.70867970987956 }, { "epoch": 162, "eval_accuracy": 0.3582, "eval_loss": 63.2703171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 68.49551196695964 }, { "epoch": 163, "eval_accuracy": 0.3382, "eval_loss": 64.855196875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 67.76478578287761 }, { "epoch": 164, "eval_accuracy": 0.3164, "eval_loss": 68.83066171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 66.98758099500868 }, { "epoch": 165, "eval_accuracy": 0.3122, "eval_loss": 76.994125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 65.67458069729275 }, { "epoch": 166, "eval_accuracy": 0.3226, "eval_loss": 64.54301171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 66.97706856689453 }, { "epoch": 167, "eval_accuracy": 0.345, "eval_loss": 66.2377984375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 65.27456371934679 }, { "epoch": 168, "eval_accuracy": 0.3366, "eval_loss": 58.94499375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 64.11031446533202 }, { "epoch": 169, "eval_accuracy": 0.3396, "eval_loss": 63.12518359375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 64.05919189724392 }, { "epoch": 170, "eval_accuracy": 0.3254, "eval_loss": 60.609440625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 61.94588626302083 }, { "epoch": 171, "eval_accuracy": 0.3226, "eval_loss": 63.21683515625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 61.45856361355252 }, { "epoch": 172, "eval_accuracy": 0.3216, "eval_loss": 61.59688359375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 62.51791443006727 }, { "epoch": 173, "eval_accuracy": 0.3212, "eval_loss": 60.5227796875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 61.21382712944879 }, { "epoch": 174, "eval_accuracy": 0.3418, "eval_loss": 56.33953046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 60.35559227159288 }, { "epoch": 175, "eval_accuracy": 0.3166, "eval_loss": 66.64052890625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 59.094696812608504 }, { "epoch": 176, "eval_accuracy": 0.33, "eval_loss": 58.2246609375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 59.71331578233507 }, { "epoch": 177, "eval_accuracy": 0.3022, "eval_loss": 60.79954296875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 59.35683131239149 }, { "epoch": 178, "eval_accuracy": 0.3458, "eval_loss": 53.1319875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 57.96395812988281 }, { "epoch": 179, "eval_accuracy": 0.3396, "eval_loss": 51.00816796875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 58.248469355604385 }, { "epoch": 180, "eval_accuracy": 0.3052, "eval_loss": 56.26803671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 58.54176217244466 }, { "epoch": 181, "eval_accuracy": 0.3184, "eval_loss": 54.643240625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 57.55351157226563 }, { "epoch": 182, "eval_accuracy": 0.2988, "eval_loss": 57.60181640625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 57.566943718804254 }, { "epoch": 183, "eval_accuracy": 0.301, "eval_loss": 56.3104078125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 57.762457067192926 }, { "epoch": 184, "eval_accuracy": 0.3196, "eval_loss": 56.75072109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 59.09771092393663 }, { "epoch": 185, "eval_accuracy": 0.3478, "eval_loss": 49.8344, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 56.15469523654514 }, { "epoch": 186, "eval_accuracy": 0.2954, "eval_loss": 53.380528125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 57.07655614352756 }, { "epoch": 187, "eval_accuracy": 0.3048, "eval_loss": 59.88317734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 56.7686597418891 }, { "epoch": 188, "eval_accuracy": 0.3098, "eval_loss": 53.8027515625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 56.743705487060545 }, { "epoch": 189, "eval_accuracy": 0.3278, "eval_loss": 49.3894125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 56.37033995768229 }, { "epoch": 190, "eval_accuracy": 0.2882, "eval_loss": 57.20807890625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 56.76239995727539 }, { "epoch": 191, "eval_accuracy": 0.3118, "eval_loss": 52.07348515625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 56.76262446221246 }, { "epoch": 192, "eval_accuracy": 0.3122, "eval_loss": 51.81205, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 55.770336328125 }, { "epoch": 193, "eval_accuracy": 0.2786, "eval_loss": 55.8960453125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 55.33157925279406 }, { "epoch": 194, "eval_accuracy": 0.2784, "eval_loss": 69.81824453125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 55.13422055121528 }, { "epoch": 195, "eval_accuracy": 0.3014, "eval_loss": 52.612559375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 56.69760437011719 }, { "epoch": 196, "eval_accuracy": 0.2598, "eval_loss": 55.4450078125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 54.42104867485894 }, { "epoch": 197, "eval_accuracy": 0.2926, "eval_loss": 61.0219375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 55.378040165201824 }, { "epoch": 198, "eval_accuracy": 0.277, "eval_loss": 58.84813046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 56.909702324761284 }, { "epoch": 199, "eval_accuracy": 0.2776, "eval_loss": 59.28854296875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 57.713160746934676 }, { "epoch": 200, "eval_accuracy": 0.284, "eval_loss": 56.89802421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 56.61742428792318 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.284, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 56.89802421875, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 3276921856, "peak_memory_reserved_bytes": 4416602112, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 60.47297954559326, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 3241.7450346946716, "train_wall_s": 3181.2487540245056 }, "work": { "apical_macs_per_example": 5324800, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 47923200000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 1129371264000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 1129371264000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 125485696, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 2306665728000000 } }