{ "architecture": { "adaptive_apical_parameters": 3637248, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 5, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 32, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 303104, "forward_parameters": 464154, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 606208, "residual_scale": 1.0, "vectorizer_mode": "spatial_template", "vectorizer_parameters": 3031040 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 32, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.01, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "dfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-dfa-d32-lr0p01.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "full_hidden_field", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.00031910948309814556, "innovation_negative_gradient_cosine": [ 0.0026197603438049555, 0.0006819418631494045, 0.00017868289432954043, 0.0009858061093837023, -0.001170104369521141, 0.0005506974994204938, 0.00034609687281772494, 5.504034925252199e-05, -0.0002867505536414683, -0.0007700761780142784, 0.0017122221179306507, 0.004392784088850021, 0.0056973351165652275, -0.00015289167640730739, 0.0028711319901049137, 0.003501438070088625, 0.005120588466525078, 0.003510239999741316, 0.00014667602954432368, 0.0016334315296262503, 0.0033825868740677834, 0.011951932683587074, 0.016150185838341713, 0.017887040972709656, 0.010713891126215458, 0.017346883192658424, 0.025565773248672485, 0.023414287716150284, 0.025312259793281555, 0.020356435328722, 0.04579668864607811 ], "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.0026197603438049555, 0.0006819418631494045, 0.00017868289432954043, 0.0009858061093837023, -0.001170104369521141, 0.0005506974994204938, 0.00034609687281772494, 5.504034925252199e-05, -0.0002867505536414683, -0.0007700761780142784, 0.0017122221179306507, 0.004392784088850021, 0.0056973351165652275, -0.00015289167640730739, 0.0028711319901049137, 0.003501438070088625, 0.005120588466525078, 0.003510239999741316, 0.00014667602954432368, 0.0016334315296262503, 0.0033825868740677834, 0.011951932683587074, 0.016150185838341713, 0.017887040972709656, 0.010713891126215458, 0.017346883192658424, 0.025565773248672485, 0.023414287716150284, 0.025312259793281555, 0.020356435328722, 0.04579668864607811 ], "teaching_negative_gradient_cosine": [ 0.0026197603438049555, 0.0006819418631494045, 0.00017868289432954043, 0.0009858061093837023, -0.001170104369521141, 0.0005506974994204938, 0.00034609687281772494, 5.504034925252199e-05, -0.0002867505536414683, -0.0007700761780142784, 0.0017122221179306507, 0.004392784088850021, 0.0056973351165652275, -0.00015289167640730739, 0.0028711319901049137, 0.003501438070088625, 0.005120588466525078, 0.003510239999741316, 0.00014667602954432368, 0.0016334315296262503, 0.0033825868740677834, 0.011951932683587074, 0.016150185838341713, 0.017887040972709656, 0.010713891126215458, 0.017346883192658424, 0.025565773248672485, 0.023414287716150284, 0.025312259793281555, 0.020356435328722, 0.04579668864607811 ], "wall_s": 0.1506354808807373 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.1968, "eval_loss": 2.13564140625, "eval_split": "validation", "lr": 0.002, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.2802412104288736 }, { "epoch": 2, "eval_accuracy": 0.1762, "eval_loss": 2.403104150390625, "eval_split": "validation", "lr": 0.004, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 2.3138541755676267 }, { "epoch": 3, "eval_accuracy": 0.166, "eval_loss": 2.668672314453125, "eval_split": "validation", "lr": 0.006, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 3.1551799483829073 }, { "epoch": 4, "eval_accuracy": 0.1524, "eval_loss": 3.85100947265625, "eval_split": "validation", "lr": 0.008, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 6.567851277033488 }, { "epoch": 5, "eval_accuracy": 0.1702, "eval_loss": 9.0174177734375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 8.539597244093153 }, { "epoch": 6, "eval_accuracy": 0.2132, "eval_loss": 6.2054705078125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 8.005350156317817 }, { "epoch": 7, "eval_accuracy": 0.2122, "eval_loss": 6.59003876953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 8.283805978224013 }, { "epoch": 8, "eval_accuracy": 0.1796, "eval_loss": 10.077484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 8.76988885184394 }, { "epoch": 9, "eval_accuracy": 0.194, "eval_loss": 12.0967720703125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 9.657652395799424 }, { "epoch": 10, "eval_accuracy": 0.244, "eval_loss": 5.8700173828125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 10.630738082038032 }, { "epoch": 11, "eval_accuracy": 0.229, "eval_loss": 9.34055859375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 11.782854916551377 }, { "epoch": 12, "eval_accuracy": 0.257, "eval_loss": 13.1749107421875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 12.472624915907119 }, { "epoch": 13, "eval_accuracy": 0.2512, "eval_loss": 15.2414419921875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 16.400539314439563 }, { "epoch": 14, "eval_accuracy": 0.2382, "eval_loss": 13.90708046875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 15.362716340637206 }, { "epoch": 15, "eval_accuracy": 0.1612, "eval_loss": 20.7498, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 15.200875530666774 }, { "epoch": 16, "eval_accuracy": 0.1846, "eval_loss": 27.910105078125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 18.039595056830514 }, { "epoch": 17, "eval_accuracy": 0.268, "eval_loss": 27.628282421875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 19.268495307752822 }, { "epoch": 18, "eval_accuracy": 0.2842, "eval_loss": 22.1950453125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 19.945682086859808 }, { "epoch": 19, "eval_accuracy": 0.2712, "eval_loss": 20.5347578125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 22.335486112467446 }, { "epoch": 20, "eval_accuracy": 0.2604, "eval_loss": 22.29314609375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 25.390615134006076 }, { "epoch": 21, "eval_accuracy": 0.1656, "eval_loss": 40.85045546875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 24.838533505588106 }, { "epoch": 22, "eval_accuracy": 0.2032, "eval_loss": 59.94360859375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 30.458272143554687 }, { "epoch": 23, "eval_accuracy": 0.3094, "eval_loss": 24.10346015625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 31.5929201107449 }, { "epoch": 24, "eval_accuracy": 0.2626, "eval_loss": 27.9797484375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 35.06654516364203 }, { "epoch": 25, "eval_accuracy": 0.2232, "eval_loss": 40.38759375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 34.452620131429036 }, { "epoch": 26, "eval_accuracy": 0.2136, "eval_loss": 38.92077890625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 39.40891842041015 }, { "epoch": 27, "eval_accuracy": 0.2128, "eval_loss": 36.42456640625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 42.401445976426864 }, { "epoch": 28, "eval_accuracy": 0.3382, "eval_loss": 41.78907578125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 48.708959084743924 }, { "epoch": 29, "eval_accuracy": 0.3258, "eval_loss": 47.034034375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 47.791174917263454 }, { "epoch": 30, "eval_accuracy": 0.2702, "eval_loss": 50.88515546875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 59.97448439670139 }, { "epoch": 31, "eval_accuracy": 0.2674, "eval_loss": 62.69679375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 55.62923475884332 }, { "epoch": 32, "eval_accuracy": 0.2688, "eval_loss": 91.7570109375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 56.54406637641059 }, { "epoch": 33, "eval_accuracy": 0.25, "eval_loss": 53.91616796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 56.0292227613661 }, { "epoch": 34, "eval_accuracy": 0.2872, "eval_loss": 108.42245, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 65.2930051079644 }, { "epoch": 35, "eval_accuracy": 0.3082, "eval_loss": 52.419546875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 62.557755900065104 }, { "epoch": 36, "eval_accuracy": 0.21, "eval_loss": 248.62119375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 71.82943644748264 }, { "epoch": 37, "eval_accuracy": 0.3456, "eval_loss": 104.5305140625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 80.15177752956814 }, { "epoch": 38, "eval_accuracy": 0.2798, "eval_loss": 63.1959390625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 74.20427698228625 }, { "epoch": 39, "eval_accuracy": 0.2526, "eval_loss": 67.9075953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 86.0083361219618 }, { "epoch": 40, "eval_accuracy": 0.1372, "eval_loss": 213.52529375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 90.54625876193576 }, { "epoch": 41, "eval_accuracy": 0.291, "eval_loss": 85.5634140625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 97.03032708468967 }, { "epoch": 42, "eval_accuracy": 0.287, "eval_loss": 132.8560890625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 102.40799818793403 }, { "epoch": 43, "eval_accuracy": 0.226, "eval_loss": 219.480903125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 110.62748044162326 }, { "epoch": 44, "eval_accuracy": 0.3476, "eval_loss": 139.70363125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 121.17438940836588 }, { "epoch": 45, "eval_accuracy": 0.3148, "eval_loss": 115.74535625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 117.96440033772787 }, { "epoch": 46, "eval_accuracy": 0.2498, "eval_loss": 161.649003125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 130.1123986111111 }, { "epoch": 47, "eval_accuracy": 0.2454, "eval_loss": 309.7527625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 132.362695046658 }, { "epoch": 48, "eval_accuracy": 0.2128, "eval_loss": 173.7661875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 141.5597231499566 }, { "epoch": 49, "eval_accuracy": 0.323, "eval_loss": 87.1395671875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 139.6630462632921 }, { "epoch": 50, "eval_accuracy": 0.2816, "eval_loss": 232.42523125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 163.6217903415256 }, { "epoch": 51, "eval_accuracy": 0.1946, "eval_loss": 188.797478125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 164.3333604844835 }, { "epoch": 52, "eval_accuracy": 0.2566, "eval_loss": 239.084840625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 178.35102162000868 }, { "epoch": 53, "eval_accuracy": 0.3502, "eval_loss": 123.9788515625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 175.44256982150608 }, { "epoch": 54, "eval_accuracy": 0.3146, "eval_loss": 206.992815625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 184.28907900390624 }, { "epoch": 55, "eval_accuracy": 0.3146, "eval_loss": 163.399478125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 207.67702931043837 }, { "epoch": 56, "eval_accuracy": 0.2962, "eval_loss": 223.243553125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 205.11963244628907 }, { "epoch": 57, "eval_accuracy": 0.3784, "eval_loss": 137.992953125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 214.7449376844618 }, { "epoch": 58, "eval_accuracy": 0.2166, "eval_loss": 476.17575, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 239.8989421766493 }, { "epoch": 59, "eval_accuracy": 0.2722, "eval_loss": 290.41935625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 239.53743671875 }, { "epoch": 60, "eval_accuracy": 0.316, "eval_loss": 164.1238, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 245.6346437608507 }, { "epoch": 61, "eval_accuracy": 0.1988, "eval_loss": 365.0298, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 251.1119849609375 }, { "epoch": 62, "eval_accuracy": 0.2056, "eval_loss": 389.20041875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 266.53731458333334 }, { "epoch": 63, "eval_accuracy": 0.3122, "eval_loss": 268.056540625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 275.1557644124349 }, { "epoch": 64, "eval_accuracy": 0.22, "eval_loss": 282.2733, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 276.21525709092884 }, { "epoch": 65, "eval_accuracy": 0.3348, "eval_loss": 217.802796875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 293.0577929416233 }, { "epoch": 66, "eval_accuracy": 0.2684, "eval_loss": 286.4739, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 333.1723864176432 }, { "epoch": 67, "eval_accuracy": 0.3034, "eval_loss": 199.15364375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 319.33838850911457 }, { "epoch": 68, "eval_accuracy": 0.2108, "eval_loss": 308.4932, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 284.5920985188802 }, { "epoch": 69, "eval_accuracy": 0.2392, "eval_loss": 458.07015, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 337.78335944281685 }, { "epoch": 70, "eval_accuracy": 0.2808, "eval_loss": 321.44930625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 315.11677765570744 }, { "epoch": 71, "eval_accuracy": 0.225, "eval_loss": 421.11063125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 358.4162332628038 }, { "epoch": 72, "eval_accuracy": 0.325, "eval_loss": 251.6319625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 358.8881578938802 }, { "epoch": 73, "eval_accuracy": 0.3256, "eval_loss": 257.94384375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 403.11145792100695 }, { "epoch": 74, "eval_accuracy": 0.312, "eval_loss": 222.5570625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 384.9969331814236 }, { "epoch": 75, "eval_accuracy": 0.2346, "eval_loss": 340.03154375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 401.10929453396267 }, { "epoch": 76, "eval_accuracy": 0.2106, "eval_loss": 1018.6606125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 399.87897292751734 }, { "epoch": 77, "eval_accuracy": 0.3102, "eval_loss": 404.8272375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 429.4044539496528 }, { "epoch": 78, "eval_accuracy": 0.2868, "eval_loss": 436.610575, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 457.54408018663196 }, { "epoch": 79, "eval_accuracy": 0.2612, "eval_loss": 579.3421, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 483.91433331163194 }, { "epoch": 80, "eval_accuracy": 0.2456, "eval_loss": 575.697925, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 465.56115231119793 }, { "epoch": 81, "eval_accuracy": 0.22, "eval_loss": 1274.014525, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 491.67860532769095 }, { "epoch": 82, "eval_accuracy": 0.181, "eval_loss": 725.602575, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 509.37582771809895 }, { "epoch": 83, "eval_accuracy": 0.2862, "eval_loss": 433.20714375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 523.651078266059 }, { "epoch": 84, "eval_accuracy": 0.306, "eval_loss": 331.74839375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 505.1366246799045 }, { "epoch": 85, "eval_accuracy": 0.2364, "eval_loss": 566.8942875, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 579.8360815646702 }, { "epoch": 86, "eval_accuracy": 0.2528, "eval_loss": 943.22735, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 574.1495292317709 }, { "epoch": 87, "eval_accuracy": 0.276, "eval_loss": 709.0178, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 538.2599395833333 }, { "epoch": 88, "eval_accuracy": 0.2866, "eval_loss": 380.433375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 624.6833575466579 }, { "epoch": 89, "eval_accuracy": 0.2842, "eval_loss": 482.03155625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 608.3776178927951 }, { "epoch": 90, "eval_accuracy": 0.3342, "eval_loss": 464.89378125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 647.8050713107639 }, { "epoch": 91, "eval_accuracy": 0.3126, "eval_loss": 836.0266375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 613.0687445529514 }, { "epoch": 92, "eval_accuracy": 0.3, "eval_loss": 486.60365, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 650.7298907063802 }, { "epoch": 93, "eval_accuracy": 0.298, "eval_loss": 469.757075, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 620.019738937717 }, { "epoch": 94, "eval_accuracy": 0.2938, "eval_loss": 415.58044375, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 746.7210650390625 }, { "epoch": 95, "eval_accuracy": 0.3562, "eval_loss": 411.128125, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 742.6021716959635 }, { "epoch": 96, "eval_accuracy": 0.2962, "eval_loss": 554.3056, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 746.4939790690104 }, { "epoch": 97, "eval_accuracy": 0.2416, "eval_loss": 825.879775, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 697.7495639756944 }, { "epoch": 98, "eval_accuracy": 0.3696, "eval_loss": 489.983625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 766.2687794487847 }, { "epoch": 99, "eval_accuracy": 0.249, "eval_loss": 866.526825, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 707.4956386827257 }, { "epoch": 100, "eval_accuracy": 0.2272, "eval_loss": 736.6153625, "eval_split": "validation", "lr": 0.01, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 860.6614454047309 }, { "epoch": 101, "eval_accuracy": 0.3856, "eval_loss": 170.472615625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 196.49338107910157 }, { "epoch": 102, "eval_accuracy": 0.3778, "eval_loss": 125.7411875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 141.02132633734809 }, { "epoch": 103, "eval_accuracy": 0.356, "eval_loss": 110.767259375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 115.80608062608506 }, { "epoch": 104, "eval_accuracy": 0.343, "eval_loss": 106.7759078125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 103.91751080322265 }, { "epoch": 105, "eval_accuracy": 0.3468, "eval_loss": 96.4980328125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 96.93153265652127 }, { "epoch": 106, "eval_accuracy": 0.3528, "eval_loss": 81.44060625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 92.24946930202908 }, { "epoch": 107, "eval_accuracy": 0.353, "eval_loss": 77.130496875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 87.91589212239583 }, { "epoch": 108, "eval_accuracy": 0.3476, "eval_loss": 75.27756875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 82.24052918836806 }, { "epoch": 109, "eval_accuracy": 0.3438, "eval_loss": 74.3921109375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 80.62625283610026 }, { "epoch": 110, "eval_accuracy": 0.3346, "eval_loss": 82.432540625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 74.16640807834202 }, { "epoch": 111, "eval_accuracy": 0.3414, "eval_loss": 68.23063359375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 72.85556735432942 }, { "epoch": 112, "eval_accuracy": 0.3604, "eval_loss": 60.68131328125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 71.44236545952691 }, { "epoch": 113, "eval_accuracy": 0.3438, "eval_loss": 63.771634375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 66.29341225043403 }, { "epoch": 114, "eval_accuracy": 0.359, "eval_loss": 59.54249375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 68.79256528998481 }, { "epoch": 115, "eval_accuracy": 0.3114, "eval_loss": 64.330353125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 64.35555018920898 }, { "epoch": 116, "eval_accuracy": 0.2398, "eval_loss": 98.6124921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 63.517505746799046 }, { "epoch": 117, "eval_accuracy": 0.3264, "eval_loss": 54.6644921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 64.07564553019206 }, { "epoch": 118, "eval_accuracy": 0.3136, "eval_loss": 73.9800765625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 63.32237302517361 }, { "epoch": 119, "eval_accuracy": 0.3248, "eval_loss": 56.1960296875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 62.23008333536784 }, { "epoch": 120, "eval_accuracy": 0.3352, "eval_loss": 76.2859921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 64.19782397460938 }, { "epoch": 121, "eval_accuracy": 0.325, "eval_loss": 52.52334140625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 62.10008289048937 }, { "epoch": 122, "eval_accuracy": 0.3006, "eval_loss": 64.4516078125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 69.5385602355957 }, { "epoch": 123, "eval_accuracy": 0.3222, "eval_loss": 59.18459375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 68.50677893473308 }, { "epoch": 124, "eval_accuracy": 0.3454, "eval_loss": 66.70076875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 64.05500425075955 }, { "epoch": 125, "eval_accuracy": 0.299, "eval_loss": 96.0758625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 67.54195568440755 }, { "epoch": 126, "eval_accuracy": 0.3506, "eval_loss": 50.27091875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 63.50760168999566 }, { "epoch": 127, "eval_accuracy": 0.3584, "eval_loss": 42.83064453125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 61.460221661376956 }, { "epoch": 128, "eval_accuracy": 0.3492, "eval_loss": 46.741225, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 68.67775972290039 }, { "epoch": 129, "eval_accuracy": 0.3366, "eval_loss": 55.25401015625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 65.46874283650716 }, { "epoch": 130, "eval_accuracy": 0.3758, "eval_loss": 35.30758203125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 60.136354113091365 }, { "epoch": 131, "eval_accuracy": 0.381, "eval_loss": 46.256021875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 71.47179066297743 }, { "epoch": 132, "eval_accuracy": 0.3672, "eval_loss": 39.7463421875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 62.817046925184464 }, { "epoch": 133, "eval_accuracy": 0.3436, "eval_loss": 65.4880921875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 70.35553123440212 }, { "epoch": 134, "eval_accuracy": 0.3516, "eval_loss": 61.6984265625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 64.2483411376953 }, { "epoch": 135, "eval_accuracy": 0.3028, "eval_loss": 63.19440390625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 66.96016059977214 }, { "epoch": 136, "eval_accuracy": 0.3524, "eval_loss": 51.108896875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 62.91782479654948 }, { "epoch": 137, "eval_accuracy": 0.216, "eval_loss": 78.7760421875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 70.46476604546442 }, { "epoch": 138, "eval_accuracy": 0.368, "eval_loss": 79.4366125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 72.66207418416342 }, { "epoch": 139, "eval_accuracy": 0.3388, "eval_loss": 49.279284375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 61.06694605577257 }, { "epoch": 140, "eval_accuracy": 0.4082, "eval_loss": 31.25261875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 59.71975162150065 }, { "epoch": 141, "eval_accuracy": 0.3726, "eval_loss": 47.8163640625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 69.24733488498264 }, { "epoch": 142, "eval_accuracy": 0.2152, "eval_loss": 96.3982875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 61.999896885850696 }, { "epoch": 143, "eval_accuracy": 0.418, "eval_loss": 33.0312359375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 75.65242304958767 }, { "epoch": 144, "eval_accuracy": 0.356, "eval_loss": 51.88513671875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 66.79744441663954 }, { "epoch": 145, "eval_accuracy": 0.3446, "eval_loss": 57.6310875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 68.28875555216472 }, { "epoch": 146, "eval_accuracy": 0.3326, "eval_loss": 53.0010203125, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 68.38004661187065 }, { "epoch": 147, "eval_accuracy": 0.4004, "eval_loss": 39.793740625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 72.77143829074436 }, { "epoch": 148, "eval_accuracy": 0.3338, "eval_loss": 62.11200625, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 63.826129070366754 }, { "epoch": 149, "eval_accuracy": 0.2826, "eval_loss": 98.2671859375, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 71.38788469509548 }, { "epoch": 150, "eval_accuracy": 0.3802, "eval_loss": 62.30995546875, "eval_split": "validation", "lr": 0.001, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 69.05508831041124 }, { "epoch": 151, "eval_accuracy": 0.4546, "eval_loss": 23.298765625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 25.48181363050673 }, { "epoch": 152, "eval_accuracy": 0.4396, "eval_loss": 21.12952734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 22.125638820054796 }, { "epoch": 153, "eval_accuracy": 0.4406, "eval_loss": 19.194971875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 20.11697272983127 }, { "epoch": 154, "eval_accuracy": 0.4418, "eval_loss": 17.68252578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 18.992026596917047 }, { "epoch": 155, "eval_accuracy": 0.438, "eval_loss": 16.4560037109375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 17.603953161621092 }, { "epoch": 156, "eval_accuracy": 0.427, "eval_loss": 15.984819140625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 16.884023179796007 }, { "epoch": 157, "eval_accuracy": 0.427, "eval_loss": 14.9954673828125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 16.29205541856554 }, { "epoch": 158, "eval_accuracy": 0.4164, "eval_loss": 14.2277224609375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 15.487207347954644 }, { "epoch": 159, "eval_accuracy": 0.4124, "eval_loss": 14.00275390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 15.221728933207194 }, { "epoch": 160, "eval_accuracy": 0.3914, "eval_loss": 14.5430076171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 14.397079717508952 }, { "epoch": 161, "eval_accuracy": 0.4068, "eval_loss": 13.4264064453125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 14.152302168443468 }, { "epoch": 162, "eval_accuracy": 0.403, "eval_loss": 12.5586671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 13.672727896457248 }, { "epoch": 163, "eval_accuracy": 0.391, "eval_loss": 12.6078431640625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 13.379090177917481 }, { "epoch": 164, "eval_accuracy": 0.396, "eval_loss": 11.770783203125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 12.801284927707249 }, { "epoch": 165, "eval_accuracy": 0.3832, "eval_loss": 11.81651875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 12.41921732228597 }, { "epoch": 166, "eval_accuracy": 0.3774, "eval_loss": 11.469639453125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 12.336118894958496 }, { "epoch": 167, "eval_accuracy": 0.403, "eval_loss": 10.486908984375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 11.962089084540473 }, { "epoch": 168, "eval_accuracy": 0.3634, "eval_loss": 11.5825072265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 11.826469014824761 }, { "epoch": 169, "eval_accuracy": 0.3782, "eval_loss": 11.0532982421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 11.664914200168186 }, { "epoch": 170, "eval_accuracy": 0.3866, "eval_loss": 10.220952734375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 11.301445455593534 }, { "epoch": 171, "eval_accuracy": 0.363, "eval_loss": 11.0618185546875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 11.134456986490886 }, { "epoch": 172, "eval_accuracy": 0.3632, "eval_loss": 11.0839998046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 10.998900364685058 }, { "epoch": 173, "eval_accuracy": 0.3562, "eval_loss": 10.4976865234375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 10.807568714396158 }, { "epoch": 174, "eval_accuracy": 0.3702, "eval_loss": 11.3861921875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 10.480875332811143 }, { "epoch": 175, "eval_accuracy": 0.3412, "eval_loss": 10.180069140625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 10.594809376186795 }, { "epoch": 176, "eval_accuracy": 0.3464, "eval_loss": 9.7542810546875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 10.234108125474718 }, { "epoch": 177, "eval_accuracy": 0.3656, "eval_loss": 9.5753017578125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 10.208396461486817 }, { "epoch": 178, "eval_accuracy": 0.3656, "eval_loss": 8.915300390625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 10.092519539896648 }, { "epoch": 179, "eval_accuracy": 0.3652, "eval_loss": 8.97712861328125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 10.079463104248047 }, { "epoch": 180, "eval_accuracy": 0.2898, "eval_loss": 10.8206451171875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 9.76496174299452 }, { "epoch": 181, "eval_accuracy": 0.3582, "eval_loss": 9.1681966796875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 10.213150364345974 }, { "epoch": 182, "eval_accuracy": 0.365, "eval_loss": 8.5061740234375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 9.497418525526259 }, { "epoch": 183, "eval_accuracy": 0.3328, "eval_loss": 10.3511533203125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 9.881835655890571 }, { "epoch": 184, "eval_accuracy": 0.3122, "eval_loss": 10.184031640625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 9.944425131225586 }, { "epoch": 185, "eval_accuracy": 0.384, "eval_loss": 9.4912837890625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 9.53767821384006 }, { "epoch": 186, "eval_accuracy": 0.3214, "eval_loss": 9.5392822265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 9.37409217291938 }, { "epoch": 187, "eval_accuracy": 0.3552, "eval_loss": 8.4641732421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 9.708195000712077 }, { "epoch": 188, "eval_accuracy": 0.3766, "eval_loss": 7.79647529296875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 9.330968306647407 }, { "epoch": 189, "eval_accuracy": 0.3472, "eval_loss": 8.42413623046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 9.682495934889051 }, { "epoch": 190, "eval_accuracy": 0.3468, "eval_loss": 8.903707421875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 9.455760409037271 }, { "epoch": 191, "eval_accuracy": 0.3394, "eval_loss": 9.9961833984375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 9.311902354431153 }, { "epoch": 192, "eval_accuracy": 0.3286, "eval_loss": 8.53327626953125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 9.558651632351346 }, { "epoch": 193, "eval_accuracy": 0.3126, "eval_loss": 9.6648263671875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 9.197669339497883 }, { "epoch": 194, "eval_accuracy": 0.373, "eval_loss": 7.50697080078125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 9.651352426656088 }, { "epoch": 195, "eval_accuracy": 0.3362, "eval_loss": 9.22571796875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 8.665485123782688 }, { "epoch": 196, "eval_accuracy": 0.3336, "eval_loss": 8.859921875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 8.966691216362847 }, { "epoch": 197, "eval_accuracy": 0.3446, "eval_loss": 7.8034123046875, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 8.929122918023003 }, { "epoch": 198, "eval_accuracy": 0.2802, "eval_loss": 12.0830345703125, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 9.355501737297907 }, { "epoch": 199, "eval_accuracy": 0.3612, "eval_loss": 7.60638193359375, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 9.219078210618761 }, { "epoch": 200, "eval_accuracy": 0.3874, "eval_loss": 6.95157197265625, "eval_split": "validation", "lr": 0.00010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 8.747222507137723 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.3874, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 6.95157197265625, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2338062336, "peak_memory_reserved_bytes": 3078619136, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 34.20064926147461, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1875.3221385478973, "train_wall_s": 1841.099274635315 }, "work": { "apical_macs_per_example": 3031040, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 27279360000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 619763328000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 619763328000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 68862592, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1266806016000000 } }