{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 5, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 32, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 461440, "fixed_traffic_coefficients": 0, "forward_parameters": 464154, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 32, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "hfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-fa-d32-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.03778243931010365, "feedback_forward_cosine": [ 0.13522903621196747, 0.2389027625322342, 0.1656235307455063, 0.25669336318969727, 0.08168920129537582, 0.24313712120056152, 0.03679082542657852, 0.16495703160762787, 0.043550122529268265, 0.20206722617149353, 0.052305079996585846, 0.1600673943758011, 0.04140310361981392, 0.1889246553182602, 0.029380766674876213, 0.2227826863527298, 0.028732571750879288, 0.18993735313415527, 0.032700490206480026, 0.19198478758335114, 0.031028691679239273, 0.1495836079120636, 0.017455775290727615, 0.18182963132858276, 0.03303111344575882, 0.18500036001205444, 0.003500960301607847, 0.19491636753082275, 0.02336471900343895, 0.15348230302333832, 0.7153934240341187 ], "feedback_forward_norm_ratio": [ 1.6532303094863892, 1.3528220653533936, 1.8407398462295532, 1.573699712753296, 2.2097935676574707, 1.9533603191375732, 2.9062178134918213, 2.332139253616333, 2.6777613162994385, 2.2939107418060303, 2.361605405807495, 1.6632351875305176, 2.157731771469116, 1.681369423866272, 2.3610785007476807, 1.9888919591903687, 2.5523250102996826, 2.211498737335205, 2.42690110206604, 2.11393141746521, 2.266143560409546, 1.3281869888305664, 2.0636491775512695, 1.2860081195831299, 1.958283543586731, 1.3220630884170532, 1.8889795541763306, 1.3131144046783447, 2.109546184539795, 1.3858412504196167, 0.19881561398506165 ], "feedback_forward_relative_error": [ 1.8127440214157104, 1.477748990058899, 1.9438579082489014, 1.6335893869400024, 2.349926710128784, 1.9661505222320557, 3.0384628772735596, 2.3810644149780273, 2.817298650741577, 2.3097572326660156, 2.5159752368927, 1.7983025312423706, 2.340327739715576, 1.7865326404571533, 2.5369174480438232, 2.0173025131225586, 2.7143495082855225, 2.247361660003662, 2.5944416522979736, 2.158013343811035, 2.448423147201538, 1.5384182929992676, 2.277411460876465, 1.4785629510879517, 2.169217586517334, 1.5028926134109497, 2.134248733520508, 1.4874053001403809, 2.3133537769317627, 1.5796048641204834, 0.8689447045326233 ], "innovation_negative_gradient_cosine": [ 0.00606947299093008, 0.009478073567152023, 0.024084236472845078, 0.022062642499804497, 0.04974904656410217, 0.037176258862018585, 0.07845072448253632, 0.028204817324876785, 0.09064127504825592, 0.03190784528851509, 0.09537523239850998, 0.06018902733922005, 0.18250532448291779, 0.06845758110284805, 0.22662648558616638, 0.09742648154497147, 0.2728409171104431, 0.07810325175523758, 0.29824674129486084, 0.08288314938545227, 0.3066348731517792, 0.09523385763168335, 0.4438329339027405, 0.10535746812820435, 0.4930099844932556, 0.13920406997203827, 0.5292818546295166, 0.2641158998012543, 0.6173524260520935, 0.31898194551467896, 0.7836034893989563 ], "mean_feedback_forward_cosine": 0.1417885826930644, "mean_feedback_forward_relative_error": 2.072213174835328, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.00606947299093008, 0.009478073567152023, 0.024084236472845078, 0.022062642499804497, 0.04974904656410217, 0.037176258862018585, 0.07845072448253632, 0.028204817324876785, 0.09064127504825592, 0.03190784528851509, 0.09537523239850998, 0.06018902733922005, 0.18250532448291779, 0.06845758110284805, 0.22662648558616638, 0.09742648154497147, 0.2728409171104431, 0.07810325175523758, 0.29824674129486084, 0.08288314938545227, 0.3066348731517792, 0.09523385763168335, 0.4438329339027405, 0.10535746812820435, 0.4930099844932556, 0.13920406997203827, 0.5292818546295166, 0.2641158998012543, 0.6173524260520935, 0.31898194551467896, 0.7836034893989563 ], "teaching_negative_gradient_cosine": [ 0.00606947299093008, 0.009478073567152023, 0.024084236472845078, 0.022062642499804497, 0.04974904656410217, 0.037176258862018585, 0.07845072448253632, 0.028204817324876785, 0.09064127504825592, 0.03190784528851509, 0.09537523239850998, 0.06018902733922005, 0.18250532448291779, 0.06845758110284805, 0.22662648558616638, 0.09742648154497147, 0.2728409171104431, 0.07810325175523758, 0.29824674129486084, 0.08288314938545227, 0.3066348731517792, 0.09523385763168335, 0.4438329339027405, 0.10535746812820435, 0.4930099844932556, 0.13920406997203827, 0.5292818546295166, 0.2641158998012543, 0.6173524260520935, 0.31898194551467896, 0.7836034893989563 ], "wall_s": 0.11364865303039551 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.2956, "eval_loss": 1.986936767578125, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.195509643088447 }, { "epoch": 2, "eval_accuracy": 0.2702, "eval_loss": 2.53878330078125, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 2.3834243949042424 }, { "epoch": 3, "eval_accuracy": 0.2754, "eval_loss": 3.973369384765625, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 3.8713371835496693 }, { "epoch": 4, "eval_accuracy": 0.272, "eval_loss": 7.13771689453125, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 6.064967641448975 }, { "epoch": 5, "eval_accuracy": 0.2578, "eval_loss": 9.420830078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 7.330231070963542 }, { "epoch": 6, "eval_accuracy": 0.3024, "eval_loss": 7.5071580078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 7.459590669589573 }, { "epoch": 7, "eval_accuracy": 0.341, "eval_loss": 9.0689892578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 6.910371139611138 }, { "epoch": 8, "eval_accuracy": 0.2986, "eval_loss": 7.185187890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 7.848369245402019 }, { "epoch": 9, "eval_accuracy": 0.268, "eval_loss": 7.8466748046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 7.287076099565294 }, { "epoch": 10, "eval_accuracy": 0.3114, "eval_loss": 6.8664982421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 6.893469244893392 }, { "epoch": 11, "eval_accuracy": 0.2968, "eval_loss": 6.61613349609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 7.038937747870551 }, { "epoch": 12, "eval_accuracy": 0.3484, "eval_loss": 8.7687521484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 6.735957527669271 }, { "epoch": 13, "eval_accuracy": 0.3388, "eval_loss": 6.116796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 6.188509490797255 }, { "epoch": 14, "eval_accuracy": 0.3352, "eval_loss": 6.60065009765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 6.898669404178196 }, { "epoch": 15, "eval_accuracy": 0.3442, "eval_loss": 7.7424158203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 6.403976938290066 }, { "epoch": 16, "eval_accuracy": 0.3778, "eval_loss": 6.02613154296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 6.261937475925022 }, { "epoch": 17, "eval_accuracy": 0.3454, "eval_loss": 6.16180947265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 5.652168246968587 }, { "epoch": 18, "eval_accuracy": 0.2904, "eval_loss": 12.1865435546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 5.759846517774794 }, { "epoch": 19, "eval_accuracy": 0.3586, "eval_loss": 6.29294453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 5.43130024939643 }, { "epoch": 20, "eval_accuracy": 0.3414, "eval_loss": 6.084059375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 5.368133390469021 }, { "epoch": 21, "eval_accuracy": 0.3324, "eval_loss": 7.98075751953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 5.172292945861816 }, { "epoch": 22, "eval_accuracy": 0.3692, "eval_loss": 6.4959990234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 5.412291467454699 }, { "epoch": 23, "eval_accuracy": 0.362, "eval_loss": 6.58297880859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 5.337951386176215 }, { "epoch": 24, "eval_accuracy": 0.3838, "eval_loss": 5.59174921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 5.547587069659763 }, { "epoch": 25, "eval_accuracy": 0.3284, "eval_loss": 8.17561748046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 5.564922823164198 }, { "epoch": 26, "eval_accuracy": 0.4088, "eval_loss": 5.76070908203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 5.24930276345147 }, { "epoch": 27, "eval_accuracy": 0.3016, "eval_loss": 7.5848359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 5.235181749979655 }, { "epoch": 28, "eval_accuracy": 0.3864, "eval_loss": 6.51845185546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 5.172612402937148 }, { "epoch": 29, "eval_accuracy": 0.3368, "eval_loss": 7.98949931640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 5.318213782840305 }, { "epoch": 30, "eval_accuracy": 0.3612, "eval_loss": 8.5869908203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 5.080642896185981 }, { "epoch": 31, "eval_accuracy": 0.3554, "eval_loss": 6.6961919921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 5.069903329298231 }, { "epoch": 32, "eval_accuracy": 0.3928, "eval_loss": 6.05183935546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 5.545271482086181 }, { "epoch": 33, "eval_accuracy": 0.3728, "eval_loss": 7.6160564453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 5.059899168311225 }, { "epoch": 34, "eval_accuracy": 0.4254, "eval_loss": 4.392253515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 4.735173885133531 }, { "epoch": 35, "eval_accuracy": 0.4154, "eval_loss": 5.35446240234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 4.707660108100043 }, { "epoch": 36, "eval_accuracy": 0.4556, "eval_loss": 5.477988671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 4.8679831588745115 }, { "epoch": 37, "eval_accuracy": 0.3956, "eval_loss": 5.809548828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 5.061632610660129 }, { "epoch": 38, "eval_accuracy": 0.38, "eval_loss": 8.34639951171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 5.17016610599094 }, { "epoch": 39, "eval_accuracy": 0.3596, "eval_loss": 10.3157998046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 5.13461835738288 }, { "epoch": 40, "eval_accuracy": 0.4494, "eval_loss": 3.57537568359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 4.814193962224325 }, { "epoch": 41, "eval_accuracy": 0.3972, "eval_loss": 7.6974388671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 4.812456588575575 }, { "epoch": 42, "eval_accuracy": 0.4116, "eval_loss": 5.53400478515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 4.879522632090251 }, { "epoch": 43, "eval_accuracy": 0.3586, "eval_loss": 7.28328564453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 4.666603200615777 }, { "epoch": 44, "eval_accuracy": 0.4092, "eval_loss": 5.62242421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 5.149397599199083 }, { "epoch": 45, "eval_accuracy": 0.4616, "eval_loss": 4.175123388671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 4.626690245098538 }, { "epoch": 46, "eval_accuracy": 0.4692, "eval_loss": 5.34783779296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 4.866097333908081 }, { "epoch": 47, "eval_accuracy": 0.4406, "eval_loss": 5.89131806640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 4.398048905860053 }, { "epoch": 48, "eval_accuracy": 0.4358, "eval_loss": 5.7748138671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 4.245615175713433 }, { "epoch": 49, "eval_accuracy": 0.5006, "eval_loss": 4.4333083984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 4.748879802788628 }, { "epoch": 50, "eval_accuracy": 0.4424, "eval_loss": 4.04569853515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 4.1075999011993405 }, { "epoch": 51, "eval_accuracy": 0.4298, "eval_loss": 4.8061736328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 4.082825281778971 }, { "epoch": 52, "eval_accuracy": 0.3572, "eval_loss": 5.676712109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 4.619352707672119 }, { "epoch": 53, "eval_accuracy": 0.423, "eval_loss": 6.05435361328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 3.9728969636705185 }, { "epoch": 54, "eval_accuracy": 0.4374, "eval_loss": 4.6374767578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 4.3532811665005156 }, { "epoch": 55, "eval_accuracy": 0.3908, "eval_loss": 5.56046455078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 3.9575316127353246 }, { "epoch": 56, "eval_accuracy": 0.4264, "eval_loss": 4.6221392578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 4.364873327128093 }, { "epoch": 57, "eval_accuracy": 0.4556, "eval_loss": 3.86793564453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 3.9743894003974067 }, { "epoch": 58, "eval_accuracy": 0.401, "eval_loss": 5.83616787109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 4.274858414755927 }, { "epoch": 59, "eval_accuracy": 0.4062, "eval_loss": 5.9770345703125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 4.168988529247708 }, { "epoch": 60, "eval_accuracy": 0.4162, "eval_loss": 5.7100212890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 4.416859284888374 }, { "epoch": 61, "eval_accuracy": 0.4016, "eval_loss": 4.9233658203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 4.03270875193278 }, { "epoch": 62, "eval_accuracy": 0.41, "eval_loss": 7.848937890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 4.23637970928616 }, { "epoch": 63, "eval_accuracy": 0.4404, "eval_loss": 8.1851318359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 4.32700122680664 }, { "epoch": 64, "eval_accuracy": 0.4304, "eval_loss": 5.8247, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 4.107528818427192 }, { "epoch": 65, "eval_accuracy": 0.4472, "eval_loss": 6.40511494140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 4.552944485388862 }, { "epoch": 66, "eval_accuracy": 0.395, "eval_loss": 6.11930693359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 4.474366613896688 }, { "epoch": 67, "eval_accuracy": 0.4084, "eval_loss": 6.2334013671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 4.986977877638075 }, { "epoch": 68, "eval_accuracy": 0.4232, "eval_loss": 5.4462650390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 4.605135821109348 }, { "epoch": 69, "eval_accuracy": 0.3384, "eval_loss": 6.6896943359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 4.689142846934001 }, { "epoch": 70, "eval_accuracy": 0.4314, "eval_loss": 7.1887201171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 4.31898379787869 }, { "epoch": 71, "eval_accuracy": 0.4278, "eval_loss": 7.44157431640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 4.600417254977756 }, { "epoch": 72, "eval_accuracy": 0.409, "eval_loss": 6.05228955078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 4.883821003723145 }, { "epoch": 73, "eval_accuracy": 0.4002, "eval_loss": 6.30699609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 4.3505779678344725 }, { "epoch": 74, "eval_accuracy": 0.4464, "eval_loss": 6.32979833984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 4.398072329033746 }, { "epoch": 75, "eval_accuracy": 0.4112, "eval_loss": 6.6822724609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 4.89097486360338 }, { "epoch": 76, "eval_accuracy": 0.4596, "eval_loss": 4.2010662109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 4.577514958106147 }, { "epoch": 77, "eval_accuracy": 0.3782, "eval_loss": 9.2190607421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 4.218928383212619 }, { "epoch": 78, "eval_accuracy": 0.4284, "eval_loss": 9.0243501953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 4.1683951346503365 }, { "epoch": 79, "eval_accuracy": 0.3524, "eval_loss": 8.21492509765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 4.540081050364177 }, { "epoch": 80, "eval_accuracy": 0.406, "eval_loss": 6.62808154296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 4.4213002469380696 }, { "epoch": 81, "eval_accuracy": 0.4084, "eval_loss": 7.6263900390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 4.814154179806179 }, { "epoch": 82, "eval_accuracy": 0.4404, "eval_loss": 4.99802724609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 4.313245312457615 }, { "epoch": 83, "eval_accuracy": 0.4326, "eval_loss": 4.130868115234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 4.179187333128187 }, { "epoch": 84, "eval_accuracy": 0.4598, "eval_loss": 6.097021484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 4.335098880301581 }, { "epoch": 85, "eval_accuracy": 0.4, "eval_loss": 6.01697724609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 4.538031046464708 }, { "epoch": 86, "eval_accuracy": 0.4672, "eval_loss": 5.2787099609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 4.391405413013034 }, { "epoch": 87, "eval_accuracy": 0.328, "eval_loss": 7.990158203125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 4.530714601389567 }, { "epoch": 88, "eval_accuracy": 0.4342, "eval_loss": 5.50915888671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 4.405182353210449 }, { "epoch": 89, "eval_accuracy": 0.4862, "eval_loss": 3.551749169921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 4.707141447533502 }, { "epoch": 90, "eval_accuracy": 0.4614, "eval_loss": 5.64707607421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 4.449501358328925 }, { "epoch": 91, "eval_accuracy": 0.4286, "eval_loss": 6.6657060546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 4.62092832438151 }, { "epoch": 92, "eval_accuracy": 0.391, "eval_loss": 7.563044140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 4.743001677449544 }, { "epoch": 93, "eval_accuracy": 0.4466, "eval_loss": 6.4824744140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 4.3673409123738605 }, { "epoch": 94, "eval_accuracy": 0.4352, "eval_loss": 6.52478466796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 4.221223247782389 }, { "epoch": 95, "eval_accuracy": 0.4942, "eval_loss": 3.797342041015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 4.0709133242713085 }, { "epoch": 96, "eval_accuracy": 0.3552, "eval_loss": 11.0053232421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 4.388050371297201 }, { "epoch": 97, "eval_accuracy": 0.4682, "eval_loss": 5.0339734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 4.638358270899455 }, { "epoch": 98, "eval_accuracy": 0.4216, "eval_loss": 7.56427587890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 4.665724361250136 }, { "epoch": 99, "eval_accuracy": 0.3896, "eval_loss": 5.62162314453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 4.479719784079657 }, { "epoch": 100, "eval_accuracy": 0.4674, "eval_loss": 6.46364716796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 5.066503650241428 }, { "epoch": 101, "eval_accuracy": 0.609, "eval_loss": 1.586387109375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 1.721678271569146 }, { "epoch": 102, "eval_accuracy": 0.5992, "eval_loss": 1.4983593505859376, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 1.3279080866071913 }, { "epoch": 103, "eval_accuracy": 0.6246, "eval_loss": 1.256317919921875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 1.232182222451104 }, { "epoch": 104, "eval_accuracy": 0.5786, "eval_loss": 1.4460140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 1.1727672132703992 }, { "epoch": 105, "eval_accuracy": 0.6232, "eval_loss": 1.2341310546875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 1.1651357496897379 }, { "epoch": 106, "eval_accuracy": 0.6248, "eval_loss": 1.1990308349609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 1.153296654340956 }, { "epoch": 107, "eval_accuracy": 0.627, "eval_loss": 1.151527783203125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 1.1303095881144205 }, { "epoch": 108, "eval_accuracy": 0.6266, "eval_loss": 1.139106787109375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 1.1244081782446966 }, { "epoch": 109, "eval_accuracy": 0.6224, "eval_loss": 1.18290263671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 1.121556561088562 }, { "epoch": 110, "eval_accuracy": 0.623, "eval_loss": 1.1661594482421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 1.1135010125690037 }, { "epoch": 111, "eval_accuracy": 0.6088, "eval_loss": 1.201440478515625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 1.1076628268559774 }, { "epoch": 112, "eval_accuracy": 0.6354, "eval_loss": 1.09391640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 1.1044298093159994 }, { "epoch": 113, "eval_accuracy": 0.6282, "eval_loss": 1.1468849365234375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 1.090382902208964 }, { "epoch": 114, "eval_accuracy": 0.6192, "eval_loss": 1.1721736328125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 1.0959963248146904 }, { "epoch": 115, "eval_accuracy": 0.6326, "eval_loss": 1.1188074951171876, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 1.0874598748736912 }, { "epoch": 116, "eval_accuracy": 0.6348, "eval_loss": 1.119938037109375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 1.0830459158155654 }, { "epoch": 117, "eval_accuracy": 0.6334, "eval_loss": 1.0968715087890626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 1.0895018880844116 }, { "epoch": 118, "eval_accuracy": 0.6556, "eval_loss": 1.06753017578125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 1.0812106000264485 }, { "epoch": 119, "eval_accuracy": 0.6272, "eval_loss": 1.1438458740234374, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 1.0666006845792135 }, { "epoch": 120, "eval_accuracy": 0.6512, "eval_loss": 1.0582649169921876, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 1.0607601169480219 }, { "epoch": 121, "eval_accuracy": 0.6484, "eval_loss": 1.0663829833984375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 1.0521053105036418 }, { "epoch": 122, "eval_accuracy": 0.6476, "eval_loss": 1.0945978271484376, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 1.049345637872484 }, { "epoch": 123, "eval_accuracy": 0.6316, "eval_loss": 1.1688353271484375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 1.0518553288565742 }, { "epoch": 124, "eval_accuracy": 0.6596, "eval_loss": 1.0690121826171874, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 1.050257617494795 }, { "epoch": 125, "eval_accuracy": 0.6264, "eval_loss": 1.1545436279296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 1.0591116312238906 }, { "epoch": 126, "eval_accuracy": 0.6508, "eval_loss": 1.0498425415039063, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 1.0364673189057245 }, { "epoch": 127, "eval_accuracy": 0.6358, "eval_loss": 1.1038102294921874, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 1.04405638639662 }, { "epoch": 128, "eval_accuracy": 0.6582, "eval_loss": 1.0474168212890624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 1.041512263361613 }, { "epoch": 129, "eval_accuracy": 0.6444, "eval_loss": 1.0852489501953124, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 1.0383492436091104 }, { "epoch": 130, "eval_accuracy": 0.628, "eval_loss": 1.138535400390625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 1.0526941585858662 }, { "epoch": 131, "eval_accuracy": 0.6438, "eval_loss": 1.08569150390625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 1.0424592800352308 }, { "epoch": 132, "eval_accuracy": 0.6164, "eval_loss": 1.1733404296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 1.0678051187939115 }, { "epoch": 133, "eval_accuracy": 0.6428, "eval_loss": 1.0911018798828125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 1.0511749137242634 }, { "epoch": 134, "eval_accuracy": 0.6284, "eval_loss": 1.1672166748046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 1.0622696600808037 }, { "epoch": 135, "eval_accuracy": 0.6302, "eval_loss": 1.107805029296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 1.0528499618742202 }, { "epoch": 136, "eval_accuracy": 0.6398, "eval_loss": 1.1062733154296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 1.0609219336191813 }, { "epoch": 137, "eval_accuracy": 0.6424, "eval_loss": 1.0821095703125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 1.0891843078931174 }, { "epoch": 138, "eval_accuracy": 0.6324, "eval_loss": 1.0882267578125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 1.0656020960172017 }, { "epoch": 139, "eval_accuracy": 0.6506, "eval_loss": 1.062216015625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 1.04979617284139 }, { "epoch": 140, "eval_accuracy": 0.6542, "eval_loss": 1.0492350952148437, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 1.039383688206143 }, { "epoch": 141, "eval_accuracy": 0.634, "eval_loss": 1.0878307861328125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 1.046560775396559 }, { "epoch": 142, "eval_accuracy": 0.6532, "eval_loss": 1.0724321533203125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 1.0318034744050768 }, { "epoch": 143, "eval_accuracy": 0.6452, "eval_loss": 1.06745087890625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 1.0459841170628865 }, { "epoch": 144, "eval_accuracy": 0.6494, "eval_loss": 1.0546759521484375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 1.0411283879597981 }, { "epoch": 145, "eval_accuracy": 0.6406, "eval_loss": 1.07638974609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 1.03138457192315 }, { "epoch": 146, "eval_accuracy": 0.6496, "eval_loss": 1.0701206787109374, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 1.021044852172004 }, { "epoch": 147, "eval_accuracy": 0.66, "eval_loss": 1.0486619995117188, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 1.0230277407752144 }, { "epoch": 148, "eval_accuracy": 0.6444, "eval_loss": 1.066232470703125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 1.0228486086951363 }, { "epoch": 149, "eval_accuracy": 0.6516, "eval_loss": 1.0704355102539063, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 1.0319631608539157 }, { "epoch": 150, "eval_accuracy": 0.6548, "eval_loss": 1.0434142211914061, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 1.0307153160836962 }, { "epoch": 151, "eval_accuracy": 0.6632, "eval_loss": 1.0081596069335939, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.968408794424269 }, { "epoch": 152, "eval_accuracy": 0.6622, "eval_loss": 1.0009671264648436, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.961383619011773 }, { "epoch": 153, "eval_accuracy": 0.6626, "eval_loss": 1.0000935791015626, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.9587891780005561 }, { "epoch": 154, "eval_accuracy": 0.6666, "eval_loss": 0.9947133178710937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.956661511707306 }, { "epoch": 155, "eval_accuracy": 0.667, "eval_loss": 0.9916768676757812, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.9527008137491014 }, { "epoch": 156, "eval_accuracy": 0.6698, "eval_loss": 0.9854952758789063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.9535861522886488 }, { "epoch": 157, "eval_accuracy": 0.6702, "eval_loss": 0.9857482788085937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.9495243875291612 }, { "epoch": 158, "eval_accuracy": 0.6678, "eval_loss": 0.9886399169921875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.9482226912604438 }, { "epoch": 159, "eval_accuracy": 0.6692, "eval_loss": 0.9884629272460937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.9453291122012668 }, { "epoch": 160, "eval_accuracy": 0.6702, "eval_loss": 0.98918701171875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.9501123986562093 }, { "epoch": 161, "eval_accuracy": 0.6724, "eval_loss": 0.9819580810546875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.9426417893515693 }, { "epoch": 162, "eval_accuracy": 0.6688, "eval_loss": 0.9828267333984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.9445630306455824 }, { "epoch": 163, "eval_accuracy": 0.6716, "eval_loss": 0.9865187255859375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.9460579630851745 }, { "epoch": 164, "eval_accuracy": 0.672, "eval_loss": 0.9791216430664063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.9461332703696357 }, { "epoch": 165, "eval_accuracy": 0.671, "eval_loss": 0.980871533203125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.9464517212549846 }, { "epoch": 166, "eval_accuracy": 0.6692, "eval_loss": 0.9821738891601562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.9537665562417772 }, { "epoch": 167, "eval_accuracy": 0.6728, "eval_loss": 0.9786509887695313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.9519137758678861 }, { "epoch": 168, "eval_accuracy": 0.6714, "eval_loss": 0.9796623901367187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.9474307224697537 }, { "epoch": 169, "eval_accuracy": 0.6732, "eval_loss": 0.9656408813476562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.9520944051954481 }, { "epoch": 170, "eval_accuracy": 0.6716, "eval_loss": 0.9688844848632813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.946247570154402 }, { "epoch": 171, "eval_accuracy": 0.6714, "eval_loss": 0.9677995239257813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.9489625805536905 }, { "epoch": 172, "eval_accuracy": 0.67, "eval_loss": 0.9761918212890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.9467603574222988 }, { "epoch": 173, "eval_accuracy": 0.6702, "eval_loss": 0.968112744140625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.9482885099093119 }, { "epoch": 174, "eval_accuracy": 0.6734, "eval_loss": 0.975332275390625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.9473493633694119 }, { "epoch": 175, "eval_accuracy": 0.6762, "eval_loss": 0.9680783447265625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.9499148143344456 }, { "epoch": 176, "eval_accuracy": 0.6714, "eval_loss": 0.9696656860351562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.9587628659142389 }, { "epoch": 177, "eval_accuracy": 0.6732, "eval_loss": 0.9686334350585938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.955567098681132 }, { "epoch": 178, "eval_accuracy": 0.6734, "eval_loss": 0.9767455810546875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.9594909250683255 }, { "epoch": 179, "eval_accuracy": 0.6736, "eval_loss": 0.9675688354492188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.9592544206619262 }, { "epoch": 180, "eval_accuracy": 0.674, "eval_loss": 0.9692090087890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.9600356777615018 }, { "epoch": 181, "eval_accuracy": 0.673, "eval_loss": 0.9752307861328126, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.9585328283309936 }, { "epoch": 182, "eval_accuracy": 0.6732, "eval_loss": 0.9749939697265625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.9576578861024645 }, { "epoch": 183, "eval_accuracy": 0.668, "eval_loss": 0.9789309448242187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.9648777356147766 }, { "epoch": 184, "eval_accuracy": 0.6728, "eval_loss": 0.9707718383789062, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.9659501979933844 }, { "epoch": 185, "eval_accuracy": 0.6704, "eval_loss": 0.97909375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.969595404349433 }, { "epoch": 186, "eval_accuracy": 0.6708, "eval_loss": 0.9784969604492187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.9665438864601983 }, { "epoch": 187, "eval_accuracy": 0.6696, "eval_loss": 0.981677734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.9694981577661302 }, { "epoch": 188, "eval_accuracy": 0.6668, "eval_loss": 0.9806268432617188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.9674224305470784 }, { "epoch": 189, "eval_accuracy": 0.668, "eval_loss": 0.97913740234375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.9666299751281738 }, { "epoch": 190, "eval_accuracy": 0.6686, "eval_loss": 0.9715440063476563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.9722860072347853 }, { "epoch": 191, "eval_accuracy": 0.6676, "eval_loss": 0.9761428833007812, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.9745998671107822 }, { "epoch": 192, "eval_accuracy": 0.6666, "eval_loss": 0.9851692260742188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.9772617618454827 }, { "epoch": 193, "eval_accuracy": 0.6644, "eval_loss": 0.9863299438476563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.9811174005296496 }, { "epoch": 194, "eval_accuracy": 0.6638, "eval_loss": 0.9889223022460938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.9881035271220737 }, { "epoch": 195, "eval_accuracy": 0.6534, "eval_loss": 1.0029588500976563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.9892041141933865 }, { "epoch": 196, "eval_accuracy": 0.649, "eval_loss": 1.0210272705078125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 1.0075765220854018 }, { "epoch": 197, "eval_accuracy": 0.6484, "eval_loss": 1.0257604370117188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 1.0129783128950332 }, { "epoch": 198, "eval_accuracy": 0.6512, "eval_loss": 1.0173834716796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 1.0185926798078748 }, { "epoch": 199, "eval_accuracy": 0.651, "eval_loss": 1.0110072143554687, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 1.0170071312798394 }, { "epoch": 200, "eval_accuracy": 0.6548, "eval_loss": 0.9980604614257812, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 1.0106280994839139 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.6548, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.9980604614257812, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2324148736, "peak_memory_reserved_bytes": 3162505216, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 34.08719086647034, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 2176.771654367447, "train_wall_s": 2142.661477804184 }, "work": { "apical_macs_per_example": 68420224, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 615782016000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 619763328000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 619763328000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 68862592, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1855308672000000 } }