{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 461440, "base_width": 16, "blocks_per_stage": 5, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 32, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 464154, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 32, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "kp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-clean_kp-d32-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "reciprocal_local_activity_products", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.9990160942077637, "feedback_forward_cosine": [ 0.9995843172073364, 0.9995485544204712, 0.9993047714233398, 0.9992356300354004, 0.999225914478302, 0.9990967512130737, 0.9992426037788391, 0.9990879893302917, 0.9994840621948242, 0.9992990493774414, 0.999346911907196, 0.9995205402374268, 0.9992691278457642, 0.9992083311080933, 0.9994052648544312, 0.9992618560791016, 0.9994874000549316, 0.9992926120758057, 0.999449610710144, 0.9992502331733704, 0.999462366104126, 0.9996726512908936, 0.9996097087860107, 0.9995791912078857, 0.9996154308319092, 0.9994989633560181, 0.9995627403259277, 0.999337375164032, 0.9994921088218689, 0.9988247156143188, 0.9999656677246094 ], "feedback_forward_norm_ratio": [ 0.9991628527641296, 1.001270055770874, 0.9982960224151611, 1.0040854215621948, 0.9988148212432861, 1.0012292861938477, 0.9982872605323792, 1.0016695261001587, 0.9984201192855835, 1.0020995140075684, 0.9984967708587646, 1.000747799873352, 0.9983559846878052, 1.0024127960205078, 0.9985647797584534, 1.0024219751358032, 0.9993768334388733, 1.0025209188461304, 0.9989345669746399, 1.0021547079086304, 0.9993236064910889, 1.000596046447754, 0.9998040199279785, 1.0014662742614746, 1.0001678466796875, 1.0017902851104736, 0.9997692108154297, 1.0016337633132935, 0.9996170401573181, 1.0019867420196533, 1.005363941192627 ], "feedback_forward_relative_error": [ 0.028834059834480286, 0.03009512461721897, 0.037293966859579086, 0.03939209133386612, 0.03934045135974884, 0.04254467412829399, 0.038926754146814346, 0.04277598485350609, 0.03213443234562874, 0.03754224628210068, 0.036144670099020004, 0.030987465754151344, 0.038239117711782455, 0.039911918342113495, 0.03449464589357376, 0.038545139133930206, 0.03201395645737648, 0.037745725363492966, 0.03317772224545479, 0.03882520645856857, 0.03278729319572449, 0.02560167759656906, 0.027935020625591278, 0.02906847931444645, 0.027740592136979103, 0.03173808380961418, 0.0295693501830101, 0.03646891936659813, 0.03187037259340286, 0.04857011139392853, 0.009890343062579632 ], "innovation_negative_gradient_cosine": [ 0.999089241027832, 0.9990065097808838, 0.9990898370742798, 0.9988292455673218, 0.999106764793396, 0.9988035559654236, 0.9991393089294434, 0.9989110231399536, 0.999163031578064, 0.9990224242210388, 0.9991826415061951, 0.9991794228553772, 0.9992508888244629, 0.9989583492279053, 0.9992785453796387, 0.9990521669387817, 0.9993072748184204, 0.9991351366043091, 0.9993723630905151, 0.9991949796676636, 0.9994121789932251, 0.999466598033905, 0.9995043873786926, 0.9994280338287354, 0.999567985534668, 0.9995042085647583, 0.9996387362480164, 0.9997044801712036, 0.999808669090271, 0.9998710751533508, 0.7805278897285461 ], "mean_feedback_forward_cosine": 0.9993942726042963, "mean_feedback_forward_relative_error": 0.034200180532230486, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.999089241027832, 0.9990065097808838, 0.9990898370742798, 0.9988292455673218, 0.999106764793396, 0.9988035559654236, 0.9991393089294434, 0.9989110231399536, 0.999163031578064, 0.9990224242210388, 0.9991826415061951, 0.9991794228553772, 0.9992508888244629, 0.9989583492279053, 0.9992785453796387, 0.9990521669387817, 0.9993072748184204, 0.9991351366043091, 0.9993723630905151, 0.9991949796676636, 0.9994121789932251, 0.999466598033905, 0.9995043873786926, 0.9994280338287354, 0.999567985534668, 0.9995042085647583, 0.9996387362480164, 0.9997044801712036, 0.999808669090271, 0.9998710751533508, 0.7805278897285461 ], "teaching_negative_gradient_cosine": [ 0.999089241027832, 0.9990065097808838, 0.9990898370742798, 0.9988292455673218, 0.999106764793396, 0.9988035559654236, 0.9991393089294434, 0.9989110231399536, 0.999163031578064, 0.9990224242210388, 0.9991826415061951, 0.9991794228553772, 0.9992508888244629, 0.9989583492279053, 0.9992785453796387, 0.9990521669387817, 0.9993072748184204, 0.9991351366043091, 0.9993723630905151, 0.9991949796676636, 0.9994121789932251, 0.999466598033905, 0.9995043873786926, 0.9994280338287354, 0.999567985534668, 0.9995042085647583, 0.9996387362480164, 0.9997044801712036, 0.999808669090271, 0.9998710751533508, 0.7805278897285461 ], "wall_s": 0.08741545677185059 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.3352, "eval_loss": 1.85539453125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3970344066619873, "mean_feedback_forward_cosine": 0.09891654959609432, "mean_feedback_forward_relative_error": 1.3545093651740783, "min_feedback_forward_cosine": 0.030816495418548584 }, "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.0165474932140772 }, { "epoch": 2, "eval_accuracy": 0.474, "eval_loss": 1.5613578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3619446754455566, "mean_feedback_forward_cosine": 0.21640455626672314, "mean_feedback_forward_relative_error": 1.2635457823353429, "min_feedback_forward_cosine": 0.08645570278167725 }, "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.574120481385125 }, { "epoch": 3, "eval_accuracy": 0.5534, "eval_loss": 1.43058212890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.31855046749115, "mean_feedback_forward_cosine": 0.33052211519210567, "mean_feedback_forward_relative_error": 1.1678868647544616, "min_feedback_forward_cosine": 0.15054291486740112 }, "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.2379753240161473 }, { "epoch": 4, "eval_accuracy": 0.6548, "eval_loss": 1.0312754150390624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.2712821960449219, "mean_feedback_forward_cosine": 0.42535690578722185, "mean_feedback_forward_relative_error": 1.0820181158281141, "min_feedback_forward_cosine": 0.21556095778942108 }, "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 0.9983540509329902 }, { "epoch": 5, "eval_accuracy": 0.6956, "eval_loss": 0.9139252319335938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.2214312553405762, "mean_feedback_forward_cosine": 0.5065497131116928, "mean_feedback_forward_relative_error": 1.0019216018338357, "min_feedback_forward_cosine": 0.2794457972049713 }, "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.8451392686208089 }, { "epoch": 6, "eval_accuracy": 0.7304, "eval_loss": 0.777873779296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1813551187515259, "mean_feedback_forward_cosine": 0.559566403588941, "mean_feedback_forward_relative_error": 0.9465686207817446, "min_feedback_forward_cosine": 0.32730311155319214 }, "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.7229798585573832 }, { "epoch": 7, "eval_accuracy": 0.7702, "eval_loss": 0.6828182861328125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1461174488067627, "mean_feedback_forward_cosine": 0.6001128660094354, "mean_feedback_forward_relative_error": 0.9015945369197477, "min_feedback_forward_cosine": 0.36858493089675903 }, "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.6540972160975138 }, { "epoch": 8, "eval_accuracy": 0.747, "eval_loss": 0.7888611328125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1137171983718872, "mean_feedback_forward_cosine": 0.634972870349884, "mean_feedback_forward_relative_error": 0.8613815144185097, "min_feedback_forward_cosine": 0.4044458270072937 }, "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.6051028917206658 }, { "epoch": 9, "eval_accuracy": 0.755, "eval_loss": 0.8275123046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0851657390594482, "mean_feedback_forward_cosine": 0.6635892391204834, "mean_feedback_forward_relative_error": 0.8266697622114613, "min_feedback_forward_cosine": 0.4357264041900635 }, "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5544356402185228 }, { "epoch": 10, "eval_accuracy": 0.7566, "eval_loss": 0.7798774658203125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0581560134887695, "mean_feedback_forward_cosine": 0.689135649511891, "mean_feedback_forward_relative_error": 0.7944988915997167, "min_feedback_forward_cosine": 0.4646669626235962 }, "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.5214713230662875 }, { "epoch": 11, "eval_accuracy": 0.8146, "eval_loss": 0.5679540466308594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0313493013381958, "mean_feedback_forward_cosine": 0.7127979820774447, "mean_feedback_forward_relative_error": 0.76344284222972, "min_feedback_forward_cosine": 0.4922131299972534 }, "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.4940733931541443 }, { "epoch": 12, "eval_accuracy": 0.8034, "eval_loss": 0.5874515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0037760734558105, "mean_feedback_forward_cosine": 0.7339891156842632, "mean_feedback_forward_relative_error": 0.7344710971078565, "min_feedback_forward_cosine": 0.5191805362701416 }, "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.4745852570427789 }, { "epoch": 13, "eval_accuracy": 0.772, "eval_loss": 0.727918994140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9788193106651306, "mean_feedback_forward_cosine": 0.7526846374234846, "mean_feedback_forward_relative_error": 0.7078268095370261, "min_feedback_forward_cosine": 0.5433098077774048 }, "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.447769571240743 }, { "epoch": 14, "eval_accuracy": 0.8288, "eval_loss": 0.51325146484375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.953144371509552, "mean_feedback_forward_cosine": 0.7700060529093589, "mean_feedback_forward_relative_error": 0.6821638220740903, "min_feedback_forward_cosine": 0.5672977566719055 }, "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.43158293512132434 }, { "epoch": 15, "eval_accuracy": 0.817, "eval_loss": 0.5514772705078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9272802472114563, "mean_feedback_forward_cosine": 0.7858748801292912, "mean_feedback_forward_relative_error": 0.6579482872639933, "min_feedback_forward_cosine": 0.590796709060669 }, "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.41741799857351514 }, { "epoch": 16, "eval_accuracy": 0.8046, "eval_loss": 0.6012989379882813, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9033938050270081, "mean_feedback_forward_cosine": 0.8003424771370427, "mean_feedback_forward_relative_error": 0.6350040791496154, "min_feedback_forward_cosine": 0.6120290756225586 }, "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.39520628892580667 }, { "epoch": 17, "eval_accuracy": 0.8054, "eval_loss": 0.6249626220703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8786085247993469, "mean_feedback_forward_cosine": 0.8139687603519808, "mean_feedback_forward_relative_error": 0.6127420500401528, "min_feedback_forward_cosine": 0.6332476139068604 }, "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.38424887357287935 }, { "epoch": 18, "eval_accuracy": 0.826, "eval_loss": 0.5176603759765624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8530976176261902, "mean_feedback_forward_cosine": 0.8264068634279312, "mean_feedback_forward_relative_error": 0.5914711466720027, "min_feedback_forward_cosine": 0.654157280921936 }, "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.3791499035358429 }, { "epoch": 19, "eval_accuracy": 0.844, "eval_loss": 0.4981465942382812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8279763460159302, "mean_feedback_forward_cosine": 0.8380863012806061, "mean_feedback_forward_relative_error": 0.5709285841834161, "min_feedback_forward_cosine": 0.674217939376831 }, "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.3649848249647352 }, { "epoch": 20, "eval_accuracy": 0.841, "eval_loss": 0.4900862609863281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8037641644477844, "mean_feedback_forward_cosine": 0.8487852657994917, "mean_feedback_forward_relative_error": 0.5513923168182373, "min_feedback_forward_cosine": 0.6925684809684753 }, "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.3498300515757667 }, { "epoch": 21, "eval_accuracy": 0.8254, "eval_loss": 0.5741294128417969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7798997163772583, "mean_feedback_forward_cosine": 0.8588206902627022, "mean_feedback_forward_relative_error": 0.5324669249596135, "min_feedback_forward_cosine": 0.7107298374176025 }, "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.3389130860964457 }, { "epoch": 22, "eval_accuracy": 0.8452, "eval_loss": 0.48783974609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7567204236984253, "mean_feedback_forward_cosine": 0.8682854021749189, "mean_feedback_forward_relative_error": 0.5141304625618842, "min_feedback_forward_cosine": 0.7275015115737915 }, "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.3313982831213209 }, { "epoch": 23, "eval_accuracy": 0.8432, "eval_loss": 0.503389306640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7334077954292297, "mean_feedback_forward_cosine": 0.8772400752190621, "mean_feedback_forward_relative_error": 0.4961547774653281, "min_feedback_forward_cosine": 0.7437876462936401 }, "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.32460021476745604 }, { "epoch": 24, "eval_accuracy": 0.8662, "eval_loss": 0.4224889404296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.710907518863678, "mean_feedback_forward_cosine": 0.8852154189540494, "mean_feedback_forward_relative_error": 0.4794098816571697, "min_feedback_forward_cosine": 0.7589513063430786 }, "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.3124096696138382 }, { "epoch": 25, "eval_accuracy": 0.8464, "eval_loss": 0.5034165222167969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6883212327957153, "mean_feedback_forward_cosine": 0.8927982334167727, "mean_feedback_forward_relative_error": 0.46311643960014465, "min_feedback_forward_cosine": 0.7737209796905518 }, "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.30748651559087964 }, { "epoch": 26, "eval_accuracy": 0.8578, "eval_loss": 0.4695193481445312, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6669498682022095, "mean_feedback_forward_cosine": 0.8997289615292703, "mean_feedback_forward_relative_error": 0.4476435371944981, "min_feedback_forward_cosine": 0.7872694730758667 }, "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.29803875002331204 }, { "epoch": 27, "eval_accuracy": 0.8472, "eval_loss": 0.49544317626953127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6458977460861206, "mean_feedback_forward_cosine": 0.9063345193862915, "mean_feedback_forward_relative_error": 0.43247731029987335, "min_feedback_forward_cosine": 0.80039381980896 }, "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.29557929752137924 }, { "epoch": 28, "eval_accuracy": 0.8522, "eval_loss": 0.4892141296386719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.626682698726654, "mean_feedback_forward_cosine": 0.9123510795254861, "mean_feedback_forward_relative_error": 0.4181007968802606, "min_feedback_forward_cosine": 0.8119982481002808 }, "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.2796997773885727 }, { "epoch": 29, "eval_accuracy": 0.8618, "eval_loss": 0.4524398193359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6067200303077698, "mean_feedback_forward_cosine": 0.9181783026264559, "mean_feedback_forward_relative_error": 0.4038001053756283, "min_feedback_forward_cosine": 0.823555588722229 }, "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.28144939953486126 }, { "epoch": 30, "eval_accuracy": 0.8616, "eval_loss": 0.431435400390625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5873559713363647, "mean_feedback_forward_cosine": 0.9236067668084176, "mean_feedback_forward_relative_error": 0.3899670858536997, "min_feedback_forward_cosine": 0.8343836069107056 }, "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.27674690407911934 }, { "epoch": 31, "eval_accuracy": 0.8578, "eval_loss": 0.4860141845703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5684483051300049, "mean_feedback_forward_cosine": 0.9285307911134535, "mean_feedback_forward_relative_error": 0.3769292422840672, "min_feedback_forward_cosine": 0.8449437618255615 }, "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.2692386422687107 }, { "epoch": 32, "eval_accuracy": 0.84, "eval_loss": 0.5316449401855469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5495582222938538, "mean_feedback_forward_cosine": 0.9332671357739356, "mean_feedback_forward_relative_error": 0.3640456214066475, "min_feedback_forward_cosine": 0.8548435568809509 }, "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.26496250779893665 }, { "epoch": 33, "eval_accuracy": 0.8594, "eval_loss": 0.46718753662109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5314036011695862, "mean_feedback_forward_cosine": 0.9376626629983226, "mean_feedback_forward_relative_error": 0.351678614174166, "min_feedback_forward_cosine": 0.864128053188324 }, "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.2612344945536719 }, { "epoch": 34, "eval_accuracy": 0.8486, "eval_loss": 0.5073669921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5140032768249512, "mean_feedback_forward_cosine": 0.9416962304422932, "mean_feedback_forward_relative_error": 0.3399790626379751, "min_feedback_forward_cosine": 0.8728002309799194 }, "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.25332926568190256 }, { "epoch": 35, "eval_accuracy": 0.8634, "eval_loss": 0.4601386779785156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.49668073654174805, "mean_feedback_forward_cosine": 0.9455604130221952, "mean_feedback_forward_relative_error": 0.3283394209800228, "min_feedback_forward_cosine": 0.8810791969299316 }, "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.24765972827275595 }, { "epoch": 36, "eval_accuracy": 0.8416, "eval_loss": 0.49482080688476565, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.48018109798431396, "mean_feedback_forward_cosine": 0.949139166262842, "mean_feedback_forward_relative_error": 0.3172376600484694, "min_feedback_forward_cosine": 0.8887827396392822 }, "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.24774828658103942 }, { "epoch": 37, "eval_accuracy": 0.858, "eval_loss": 0.45331826782226564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4640062749385834, "mean_feedback_forward_cosine": 0.9525774159739094, "mean_feedback_forward_relative_error": 0.30619221156643284, "min_feedback_forward_cosine": 0.8959776163101196 }, "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.24434037954939736 }, { "epoch": 38, "eval_accuracy": 0.858, "eval_loss": 0.45240281982421876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4489477574825287, "mean_feedback_forward_cosine": 0.9556983863153765, "mean_feedback_forward_relative_error": 0.29581394238818076, "min_feedback_forward_cosine": 0.9025242328643799 }, "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.23976409662034776 }, { "epoch": 39, "eval_accuracy": 0.8412, "eval_loss": 0.5876475219726562, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4343760013580322, "mean_feedback_forward_cosine": 0.9584913234556874, "mean_feedback_forward_relative_error": 0.2862166019697343, "min_feedback_forward_cosine": 0.9086928963661194 }, "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.23123540512985655 }, { "epoch": 40, "eval_accuracy": 0.8564, "eval_loss": 0.4765188659667969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.41979628801345825, "mean_feedback_forward_cosine": 0.9612213392411509, "mean_feedback_forward_relative_error": 0.2765878001528402, "min_feedback_forward_cosine": 0.9146870970726013 }, "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.2318395030286577 }, { "epoch": 41, "eval_accuracy": 0.8616, "eval_loss": 0.44323438720703123, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.40531429648399353, "mean_feedback_forward_cosine": 0.9637255207184823, "mean_feedback_forward_relative_error": 0.26743238106850653, "min_feedback_forward_cosine": 0.9204114675521851 }, "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.22619207657972973 }, { "epoch": 42, "eval_accuracy": 0.8578, "eval_loss": 0.4867693237304688, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.391878217458725, "mean_feedback_forward_cosine": 0.966075841457613, "mean_feedback_forward_relative_error": 0.2584934775387087, "min_feedback_forward_cosine": 0.9255408644676208 }, "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.22141475805441538 }, { "epoch": 43, "eval_accuracy": 0.8746, "eval_loss": 0.41213989868164064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3782900869846344, "mean_feedback_forward_cosine": 0.9682946012866113, "mean_feedback_forward_relative_error": 0.2497686491377892, "min_feedback_forward_cosine": 0.9305530786514282 }, "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.2203050850868225 }, { "epoch": 44, "eval_accuracy": 0.8488, "eval_loss": 0.5225678588867188, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.36502012610435486, "mean_feedback_forward_cosine": 0.9704237772572425, "mean_feedback_forward_relative_error": 0.2411658537964667, "min_feedback_forward_cosine": 0.9352737665176392 }, "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.21957209897041322 }, { "epoch": 45, "eval_accuracy": 0.849, "eval_loss": 0.5496326416015626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.35209617018699646, "mean_feedback_forward_cosine": 0.9723464500519537, "mean_feedback_forward_relative_error": 0.23312005520828308, "min_feedback_forward_cosine": 0.9396935701370239 }, "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.21895495686531066 }, { "epoch": 46, "eval_accuracy": 0.86, "eval_loss": 0.4849064758300781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.33995580673217773, "mean_feedback_forward_cosine": 0.9741548203652904, "mean_feedback_forward_relative_error": 0.2253057812490771, "min_feedback_forward_cosine": 0.9437055587768555 }, "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.21140181116792892 }, { "epoch": 47, "eval_accuracy": 0.8596, "eval_loss": 0.48711629028320313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.32750967144966125, "mean_feedback_forward_cosine": 0.9759039148207633, "mean_feedback_forward_relative_error": 0.21750406536363787, "min_feedback_forward_cosine": 0.9477157592773438 }, "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.21739240936703152 }, { "epoch": 48, "eval_accuracy": 0.8674, "eval_loss": 0.49024164428710937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3152298629283905, "mean_feedback_forward_cosine": 0.9775446115001556, "mean_feedback_forward_relative_error": 0.20989031272549782, "min_feedback_forward_cosine": 0.9515104293823242 }, "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.21653300149705676 }, { "epoch": 49, "eval_accuracy": 0.8672, "eval_loss": 0.4632137329101563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.30373454093933105, "mean_feedback_forward_cosine": 0.9790571889569682, "mean_feedback_forward_relative_error": 0.20261672836157582, "min_feedback_forward_cosine": 0.954938530921936 }, "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.20910456528663635 }, { "epoch": 50, "eval_accuracy": 0.8686, "eval_loss": 0.44734768676757813, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2930586338043213, "mean_feedback_forward_cosine": 0.980450362928452, "mean_feedback_forward_relative_error": 0.19571300307589193, "min_feedback_forward_cosine": 0.958027184009552 }, "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.20682951056427426 }, { "epoch": 51, "eval_accuracy": 0.865, "eval_loss": 0.4583529357910156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.28304439783096313, "mean_feedback_forward_cosine": 0.9817609517805038, "mean_feedback_forward_relative_error": 0.18900507039600803, "min_feedback_forward_cosine": 0.9608170986175537 }, "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.20303286356396144 }, { "epoch": 52, "eval_accuracy": 0.8758, "eval_loss": 0.42540660400390623, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.27335530519485474, "mean_feedback_forward_cosine": 0.9829263110314647, "mean_feedback_forward_relative_error": 0.18280399518628274, "min_feedback_forward_cosine": 0.9634319543838501 }, "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.1975233178668552 }, { "epoch": 53, "eval_accuracy": 0.8726, "eval_loss": 0.45839552612304685, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2639857232570648, "mean_feedback_forward_cosine": 0.9840461400247389, "mean_feedback_forward_relative_error": 0.1766628747986209, "min_feedback_forward_cosine": 0.9658682346343994 }, "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.19599860397444832 }, { "epoch": 54, "eval_accuracy": 0.854, "eval_loss": 0.5225734069824218, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.25491610169410706, "mean_feedback_forward_cosine": 0.9850916497169002, "mean_feedback_forward_relative_error": 0.17073152082100992, "min_feedback_forward_cosine": 0.9681482911109924 }, "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.19324108230802747 }, { "epoch": 55, "eval_accuracy": 0.8656, "eval_loss": 0.4879412841796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.24540641903877258, "mean_feedback_forward_cosine": 0.9861299530152352, "mean_feedback_forward_relative_error": 0.1646571411721168, "min_feedback_forward_cosine": 0.9704469442367554 }, "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.20186779841846889 }, { "epoch": 56, "eval_accuracy": 0.8788, "eval_loss": 0.4124189697265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.23672057688236237, "mean_feedback_forward_cosine": 0.9870482760090982, "mean_feedback_forward_relative_error": 0.15906442100963286, "min_feedback_forward_cosine": 0.9724932312965393 }, "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.1911707753446367 }, { "epoch": 57, "eval_accuracy": 0.8544, "eval_loss": 0.4946718139648438, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.22838672995567322, "mean_feedback_forward_cosine": 0.9879102610772655, "mean_feedback_forward_relative_error": 0.1536721505465046, "min_feedback_forward_cosine": 0.9743702411651611 }, "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.19003599887424044 }, { "epoch": 58, "eval_accuracy": 0.8834, "eval_loss": 0.4138064086914062, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.22036190330982208, "mean_feedback_forward_cosine": 0.9887177309682292, "mean_feedback_forward_relative_error": 0.14841678906832972, "min_feedback_forward_cosine": 0.9761249423027039 }, "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.19302229064305623 }, { "epoch": 59, "eval_accuracy": 0.862, "eval_loss": 0.49976304931640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.21271266043186188, "mean_feedback_forward_cosine": 0.9894644348852096, "mean_feedback_forward_relative_error": 0.14339836915173837, "min_feedback_forward_cosine": 0.9777436852455139 }, "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.1886476122485267 }, { "epoch": 60, "eval_accuracy": 0.886, "eval_loss": 0.3878099365234375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.20517779886722565, "mean_feedback_forward_cosine": 0.9901608478638434, "mean_feedback_forward_relative_error": 0.1385545569562143, "min_feedback_forward_cosine": 0.9792742133140564 }, "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.184096456334326 }, { "epoch": 61, "eval_accuracy": 0.87, "eval_loss": 0.45004430541992185, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1976340413093567, "mean_feedback_forward_cosine": 0.9908320807641552, "mean_feedback_forward_relative_error": 0.13373789431587343, "min_feedback_forward_cosine": 0.9807661771774292 }, "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.1952857186794281 }, { "epoch": 62, "eval_accuracy": 0.8708, "eval_loss": 0.42280288696289064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.19097411632537842, "mean_feedback_forward_cosine": 0.9914130280094762, "mean_feedback_forward_relative_error": 0.12940076714561832, "min_feedback_forward_cosine": 0.9820346832275391 }, "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.1781928380449613 }, { "epoch": 63, "eval_accuracy": 0.8804, "eval_loss": 0.40265328369140624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.18434743583202362, "mean_feedback_forward_cosine": 0.9919711351394653, "mean_feedback_forward_relative_error": 0.125099069769344, "min_feedback_forward_cosine": 0.9832502007484436 }, "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.18024166654480828 }, { "epoch": 64, "eval_accuracy": 0.8768, "eval_loss": 0.4114610107421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.17806272208690643, "mean_feedback_forward_cosine": 0.9924912568061582, "mean_feedback_forward_relative_error": 0.12095758090576818, "min_feedback_forward_cosine": 0.9843647480010986 }, "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.17777254914310242 }, { "epoch": 65, "eval_accuracy": 0.8712, "eval_loss": 0.4435559143066406, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1717073768377304, "mean_feedback_forward_cosine": 0.9929938431709043, "mean_feedback_forward_relative_error": 0.1168181098276569, "min_feedback_forward_cosine": 0.9854501485824585 }, "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.18547025267018213 }, { "epoch": 66, "eval_accuracy": 0.859, "eval_loss": 0.5121481506347656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.16578994691371918, "mean_feedback_forward_cosine": 0.9934470845806983, "mean_feedback_forward_relative_error": 0.11296291853631696, "min_feedback_forward_cosine": 0.986427903175354 }, "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.1755339354938931 }, { "epoch": 67, "eval_accuracy": 0.855, "eval_loss": 0.5351258056640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.15990713238716125, "mean_feedback_forward_cosine": 0.993884357713884, "mean_feedback_forward_relative_error": 0.10910652541825848, "min_feedback_forward_cosine": 0.9873668551445007 }, "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.1767852502849367 }, { "epoch": 68, "eval_accuracy": 0.8736, "eval_loss": 0.44542548828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.15426933765411377, "mean_feedback_forward_cosine": 0.9942979985667814, "mean_feedback_forward_relative_error": 0.10534040029010465, "min_feedback_forward_cosine": 0.9882389307022095 }, "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.17708395219379 }, { "epoch": 69, "eval_accuracy": 0.8866, "eval_loss": 0.37270454711914064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14849302172660828, "mean_feedback_forward_cosine": 0.9946968151677039, "mean_feedback_forward_relative_error": 0.10158244051760243, "min_feedback_forward_cosine": 0.9890974164009094 }, "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.18407729478412205 }, { "epoch": 70, "eval_accuracy": 0.8848, "eval_loss": 0.3816723022460938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14344274997711182, "mean_feedback_forward_cosine": 0.9950423971299203, "mean_feedback_forward_relative_error": 0.09819682723572178, "min_feedback_forward_cosine": 0.989820122718811 }, "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.17256281439993115 }, { "epoch": 71, "eval_accuracy": 0.871, "eval_loss": 0.47614798583984375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.13826242089271545, "mean_feedback_forward_cosine": 0.9953846220047243, "mean_feedback_forward_relative_error": 0.09473993376858773, "min_feedback_forward_cosine": 0.9905393719673157 }, "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.17987764293617672 }, { "epoch": 72, "eval_accuracy": 0.8598, "eval_loss": 0.46955314331054687, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.13329215347766876, "mean_feedback_forward_cosine": 0.9956990288149926, "mean_feedback_forward_relative_error": 0.09145044511364352, "min_feedback_forward_cosine": 0.991203784942627 }, "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.17530702959431543 }, { "epoch": 73, "eval_accuracy": 0.8896, "eval_loss": 0.37162421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.12890847027301788, "mean_feedback_forward_cosine": 0.99597418115985, "mean_feedback_forward_relative_error": 0.08846384130658642, "min_feedback_forward_cosine": 0.9917711019515991 }, "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.16974435313542685 }, { "epoch": 74, "eval_accuracy": 0.8748, "eval_loss": 0.4273910888671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.12445683777332306, "mean_feedback_forward_cosine": 0.9962359916779303, "mean_feedback_forward_relative_error": 0.0855239714465795, "min_feedback_forward_cosine": 0.9923257827758789 }, "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.16758987526098887 }, { "epoch": 75, "eval_accuracy": 0.8744, "eval_loss": 0.44162723388671876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1202189177274704, "mean_feedback_forward_cosine": 0.996487186801049, "mean_feedback_forward_relative_error": 0.08261592692184833, "min_feedback_forward_cosine": 0.9928371906280518 }, "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.16726809644434187 }, { "epoch": 76, "eval_accuracy": 0.8748, "eval_loss": 0.4214301574707031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11572326719760895, "mean_feedback_forward_cosine": 0.9967352132643422, "mean_feedback_forward_relative_error": 0.07963655528522307, "min_feedback_forward_cosine": 0.993360161781311 }, "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.1751393345170551 }, { "epoch": 77, "eval_accuracy": 0.8956, "eval_loss": 0.34109723510742185, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11186333745718002, "mean_feedback_forward_cosine": 0.9969496880808184, "mean_feedback_forward_relative_error": 0.07697323192992518, "min_feedback_forward_cosine": 0.9937939643859863 }, "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.16733670739597745 }, { "epoch": 78, "eval_accuracy": 0.872, "eval_loss": 0.44417415771484375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.10790038108825684, "mean_feedback_forward_cosine": 0.9971546011586343, "mean_feedback_forward_relative_error": 0.07434488015790139, "min_feedback_forward_cosine": 0.9942234754562378 }, "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.17388162036736807 }, { "epoch": 79, "eval_accuracy": 0.8782, "eval_loss": 0.438529736328125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.10394710302352905, "mean_feedback_forward_cosine": 0.997349654474566, "mean_feedback_forward_relative_error": 0.07174537811548479, "min_feedback_forward_cosine": 0.9946376085281372 }, "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.1652422828303443 }, { "epoch": 80, "eval_accuracy": 0.8816, "eval_loss": 0.44652198486328126, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.10049350559711456, "mean_feedback_forward_cosine": 0.9975251978443515, "mean_feedback_forward_relative_error": 0.06931953246314679, "min_feedback_forward_cosine": 0.9949864745140076 }, "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.16283351455264622 }, { "epoch": 81, "eval_accuracy": 0.8752, "eval_loss": 0.4451551513671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09698614478111267, "mean_feedback_forward_cosine": 0.9976857150754621, "mean_feedback_forward_relative_error": 0.06702608723313577, "min_feedback_forward_cosine": 0.9953293800354004 }, "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.1627018078883489 }, { "epoch": 82, "eval_accuracy": 0.8712, "eval_loss": 0.4183915771484375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09360911697149277, "mean_feedback_forward_cosine": 0.9978386798212605, "mean_feedback_forward_relative_error": 0.06476938940825001, "min_feedback_forward_cosine": 0.9956478476524353 }, "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.1625231981145011 }, { "epoch": 83, "eval_accuracy": 0.864, "eval_loss": 0.479559423828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09036646038293839, "mean_feedback_forward_cosine": 0.9979804735029897, "mean_feedback_forward_relative_error": 0.06260339933778009, "min_feedback_forward_cosine": 0.9959428310394287 }, "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.15952994990878636 }, { "epoch": 84, "eval_accuracy": 0.8664, "eval_loss": 0.5053081115722656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08696158975362778, "mean_feedback_forward_cosine": 0.9981216576791578, "mean_feedback_forward_relative_error": 0.06037566810846329, "min_feedback_forward_cosine": 0.9962424039840698 }, "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.16951513698101045 }, { "epoch": 85, "eval_accuracy": 0.878, "eval_loss": 0.46674307861328124, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08394859731197357, "mean_feedback_forward_cosine": 0.9982455045946182, "mean_feedback_forward_relative_error": 0.05834392362063931, "min_feedback_forward_cosine": 0.996497392654419 }, "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.16335849794281854 }, { "epoch": 86, "eval_accuracy": 0.8914, "eval_loss": 0.3704887084960938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08105872571468353, "mean_feedback_forward_cosine": 0.9983624296803628, "mean_feedback_forward_relative_error": 0.05636267388059247, "min_feedback_forward_cosine": 0.9967339634895325 }, "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.15780939542982314 }, { "epoch": 87, "eval_accuracy": 0.8826, "eval_loss": 0.3811180114746094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0780579075217247, "mean_feedback_forward_cosine": 0.9984782568870052, "mean_feedback_forward_relative_error": 0.054333017117554144, "min_feedback_forward_cosine": 0.9969696998596191 }, "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.16681171383327908 }, { "epoch": 88, "eval_accuracy": 0.8872, "eval_loss": 0.4038883117675781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.07522793114185333, "mean_feedback_forward_cosine": 0.998582543865327, "mean_feedback_forward_relative_error": 0.05243379346305324, "min_feedback_forward_cosine": 0.9971845746040344 }, "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.16635543229844835 }, { "epoch": 89, "eval_accuracy": 0.8768, "eval_loss": 0.4656008239746094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.07262639701366425, "mean_feedback_forward_cosine": 0.9986755482612117, "mean_feedback_forward_relative_error": 0.05068007844590371, "min_feedback_forward_cosine": 0.9973758459091187 }, "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.15748041656017303 }, { "epoch": 90, "eval_accuracy": 0.8846, "eval_loss": 0.4177832824707031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06999342143535614, "mean_feedback_forward_cosine": 0.9987672355867201, "mean_feedback_forward_relative_error": 0.048894857086481586, "min_feedback_forward_cosine": 0.9975628852844238 }, "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.16211600266562567 }, { "epoch": 91, "eval_accuracy": 0.8716, "eval_loss": 0.4431572265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06744895130395889, "mean_feedback_forward_cosine": 0.9988512204539391, "mean_feedback_forward_relative_error": 0.04720152908515546, "min_feedback_forward_cosine": 0.997735857963562 }, "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.16203772835466596 }, { "epoch": 92, "eval_accuracy": 0.8826, "eval_loss": 0.40832467041015624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06500688195228577, "mean_feedback_forward_cosine": 0.9989292698521768, "mean_feedback_forward_relative_error": 0.04557065719798688, "min_feedback_forward_cosine": 0.9978965520858765 }, "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.15830527657402887 }, { "epoch": 93, "eval_accuracy": 0.8902, "eval_loss": 0.37456282958984377, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06275323033332825, "mean_feedback_forward_cosine": 0.9990006685256958, "mean_feedback_forward_relative_error": 0.04402178369702831, "min_feedback_forward_cosine": 0.9980393648147583 }, "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.1551544521861606 }, { "epoch": 94, "eval_accuracy": 0.8852, "eval_loss": 0.43639714965820314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0605853907763958, "mean_feedback_forward_cosine": 0.9990669758089127, "mean_feedback_forward_relative_error": 0.04253085158885487, "min_feedback_forward_cosine": 0.998172402381897 }, "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.15768385762373607 }, { "epoch": 95, "eval_accuracy": 0.8828, "eval_loss": 0.42318448486328125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.05844554677605629, "mean_feedback_forward_cosine": 0.9991313084479301, "mean_feedback_forward_relative_error": 0.04103709913549885, "min_feedback_forward_cosine": 0.9982991218566895 }, "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.1587442197839419 }, { "epoch": 96, "eval_accuracy": 0.8878, "eval_loss": 0.4036041809082031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.05644100531935692, "mean_feedback_forward_cosine": 0.9991878405694039, "mean_feedback_forward_relative_error": 0.03967912615306916, "min_feedback_forward_cosine": 0.9984134435653687 }, "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.15544112352265252 }, { "epoch": 97, "eval_accuracy": 0.8914, "eval_loss": 0.37009312133789063, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.054409269243478775, "mean_feedback_forward_cosine": 0.9992446053412652, "mean_feedback_forward_relative_error": 0.038267940523162965, "min_feedback_forward_cosine": 0.9985255599021912 }, "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.15759313933319516 }, { "epoch": 98, "eval_accuracy": 0.88, "eval_loss": 0.4166911987304687, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.05243669077754021, "mean_feedback_forward_cosine": 0.9992959845450616, "mean_feedback_forward_relative_error": 0.03694337375101543, "min_feedback_forward_cosine": 0.9986302256584167 }, "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.1612001913335588 }, { "epoch": 99, "eval_accuracy": 0.8714, "eval_loss": 0.4708991271972656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.05059374123811722, "mean_feedback_forward_cosine": 0.9993423665723493, "mean_feedback_forward_relative_error": 0.035702559405997876, "min_feedback_forward_cosine": 0.9987248778343201 }, "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.15767538166840872 }, { "epoch": 100, "eval_accuracy": 0.8808, "eval_loss": 0.450357470703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04881930351257324, "mean_feedback_forward_cosine": 0.9993862932728182, "mean_feedback_forward_relative_error": 0.03448866133487994, "min_feedback_forward_cosine": 0.9988125562667847 }, "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.15321411666737664 }, { "epoch": 101, "eval_accuracy": 0.9136, "eval_loss": 0.29533384399414064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048803918063640594, "mean_feedback_forward_cosine": 0.9993866758961831, "mean_feedback_forward_relative_error": 0.03447543967875742, "min_feedback_forward_cosine": 0.998813271522522 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.09057808789942 }, { "epoch": 102, "eval_accuracy": 0.9196, "eval_loss": 0.28288860778808594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048796601593494415, "mean_feedback_forward_cosine": 0.9993869008556489, "mean_feedback_forward_relative_error": 0.03446682533549686, "min_feedback_forward_cosine": 0.9988136291503906 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.06322400026718776 }, { "epoch": 103, "eval_accuracy": 0.9212, "eval_loss": 0.2858207183837891, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04879026859998703, "mean_feedback_forward_cosine": 0.9993870719786613, "mean_feedback_forward_relative_error": 0.03445892669861355, "min_feedback_forward_cosine": 0.9988139867782593 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.0535766043484211 }, { "epoch": 104, "eval_accuracy": 0.9246, "eval_loss": 0.2870035583496094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04878412187099457, "mean_feedback_forward_cosine": 0.9993872354107518, "mean_feedback_forward_relative_error": 0.03445159391530098, "min_feedback_forward_cosine": 0.9988143444061279 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.04680160608887672 }, { "epoch": 105, "eval_accuracy": 0.9246, "eval_loss": 0.29164626159667967, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048778191208839417, "mean_feedback_forward_cosine": 0.9993874142246861, "mean_feedback_forward_relative_error": 0.034444511237163696, "min_feedback_forward_cosine": 0.9988146424293518 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.043014900404877134 }, { "epoch": 106, "eval_accuracy": 0.9218, "eval_loss": 0.29402776794433594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04877280443906784, "mean_feedback_forward_cosine": 0.9993875834249681, "mean_feedback_forward_relative_error": 0.03443780937983144, "min_feedback_forward_cosine": 0.9988148212432861 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.03942505518330468 }, { "epoch": 107, "eval_accuracy": 0.9238, "eval_loss": 0.30112089538574216, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04876742511987686, "mean_feedback_forward_cosine": 0.9993877507025196, "mean_feedback_forward_relative_error": 0.03443125629376981, "min_feedback_forward_cosine": 0.99881511926651 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.035907337534758776 }, { "epoch": 108, "eval_accuracy": 0.923, "eval_loss": 0.3071636474609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04876227304339409, "mean_feedback_forward_cosine": 0.999387917980071, "mean_feedback_forward_relative_error": 0.03442491798271095, "min_feedback_forward_cosine": 0.9988153576850891 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.03364239944087134 }, { "epoch": 109, "eval_accuracy": 0.922, "eval_loss": 0.3126777282714844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048756614327430725, "mean_feedback_forward_cosine": 0.9993880660303177, "mean_feedback_forward_relative_error": 0.03441854629425272, "min_feedback_forward_cosine": 0.998815655708313 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.03245734071003066 }, { "epoch": 110, "eval_accuracy": 0.9204, "eval_loss": 0.30980113525390623, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04875122755765915, "mean_feedback_forward_cosine": 0.9993882583033654, "mean_feedback_forward_relative_error": 0.034412265725193486, "min_feedback_forward_cosine": 0.9988158941268921 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.031768651305966907 }, { "epoch": 111, "eval_accuracy": 0.924, "eval_loss": 0.31072572021484374, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04874620586633682, "mean_feedback_forward_cosine": 0.9993884063536121, "mean_feedback_forward_relative_error": 0.0344061431805453, "min_feedback_forward_cosine": 0.9988161325454712 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.029296634758843317 }, { "epoch": 112, "eval_accuracy": 0.9254, "eval_loss": 0.31651325073242187, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0487414114177227, "mean_feedback_forward_cosine": 0.9993885736311635, "mean_feedback_forward_relative_error": 0.03440025157385295, "min_feedback_forward_cosine": 0.9988164901733398 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.026635085297955406 }, { "epoch": 113, "eval_accuracy": 0.9234, "eval_loss": 0.3184968017578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04873606190085411, "mean_feedback_forward_cosine": 0.9993887293723321, "mean_feedback_forward_relative_error": 0.03439420197279223, "min_feedback_forward_cosine": 0.9988166093826294 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.02689870360626115 }, { "epoch": 114, "eval_accuracy": 0.9246, "eval_loss": 0.3188640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04873174428939819, "mean_feedback_forward_cosine": 0.9993888601180045, "mean_feedback_forward_relative_error": 0.03438880129326736, "min_feedback_forward_cosine": 0.9988168478012085 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.02336271217018366 }, { "epoch": 115, "eval_accuracy": 0.9254, "eval_loss": 0.3224325378417969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04872721806168556, "mean_feedback_forward_cosine": 0.9993890216273646, "mean_feedback_forward_relative_error": 0.0343832528038371, "min_feedback_forward_cosine": 0.9988170862197876 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.022886741083198124 }, { "epoch": 116, "eval_accuracy": 0.9242, "eval_loss": 0.3264565856933594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048722509294748306, "mean_feedback_forward_cosine": 0.9993891754458027, "mean_feedback_forward_relative_error": 0.034377753614417965, "min_feedback_forward_cosine": 0.9988173246383667 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.02161789578249057 }, { "epoch": 117, "eval_accuracy": 0.9246, "eval_loss": 0.3350888854980469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048718128353357315, "mean_feedback_forward_cosine": 0.9993893273415104, "mean_feedback_forward_relative_error": 0.034372437234607436, "min_feedback_forward_cosine": 0.9988175630569458 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.02008457115491231 }, { "epoch": 118, "eval_accuracy": 0.9222, "eval_loss": 0.3312977966308594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04871320724487305, "mean_feedback_forward_cosine": 0.9993894561644523, "mean_feedback_forward_relative_error": 0.034366853925729954, "min_feedback_forward_cosine": 0.9988176822662354 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.021647869668073125 }, { "epoch": 119, "eval_accuracy": 0.9222, "eval_loss": 0.33949063720703127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0487087108194828, "mean_feedback_forward_cosine": 0.9993896061374296, "mean_feedback_forward_relative_error": 0.034361511408802003, "min_feedback_forward_cosine": 0.998818039894104 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.02027899324049552 }, { "epoch": 120, "eval_accuracy": 0.921, "eval_loss": 0.34436965942382813, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04870382696390152, "mean_feedback_forward_cosine": 0.9993897695695201, "mean_feedback_forward_relative_error": 0.03435609096120442, "min_feedback_forward_cosine": 0.9988182187080383 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.01882550497353077 }, { "epoch": 121, "eval_accuracy": 0.9208, "eval_loss": 0.342112255859375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04869933798909187, "mean_feedback_forward_cosine": 0.9993899022379229, "mean_feedback_forward_relative_error": 0.034350986412215616, "min_feedback_forward_cosine": 0.9988184571266174 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.01746830699750119 }, { "epoch": 122, "eval_accuracy": 0.924, "eval_loss": 0.34617767333984373, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04869527742266655, "mean_feedback_forward_cosine": 0.999390056056361, "mean_feedback_forward_relative_error": 0.03434607020068553, "min_feedback_forward_cosine": 0.9988187551498413 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.016621154091341628 }, { "epoch": 123, "eval_accuracy": 0.923, "eval_loss": 0.3514703369140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04869047924876213, "mean_feedback_forward_cosine": 0.9993902041066077, "mean_feedback_forward_relative_error": 0.03434080309084346, "min_feedback_forward_cosine": 0.9988188743591309 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.01763997759670019 }, { "epoch": 124, "eval_accuracy": 0.9196, "eval_loss": 0.3572915588378906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04868617281317711, "mean_feedback_forward_cosine": 0.9993903194704363, "mean_feedback_forward_relative_error": 0.034335700164158496, "min_feedback_forward_cosine": 0.9988191723823547 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.01719067797842953 }, { "epoch": 125, "eval_accuracy": 0.9222, "eval_loss": 0.35623099365234373, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04868151620030403, "mean_feedback_forward_cosine": 0.9993904636752221, "mean_feedback_forward_relative_error": 0.034330394599706895, "min_feedback_forward_cosine": 0.9988192915916443 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.017087505733304552 }, { "epoch": 126, "eval_accuracy": 0.9236, "eval_loss": 0.35596282958984377, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04867681860923767, "mean_feedback_forward_cosine": 0.9993906117254688, "mean_feedback_forward_relative_error": 0.03432521590542409, "min_feedback_forward_cosine": 0.9988195300102234 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.01596804515255822 }, { "epoch": 127, "eval_accuracy": 0.9226, "eval_loss": 0.356564501953125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04867197573184967, "mean_feedback_forward_cosine": 0.9993907713120983, "mean_feedback_forward_relative_error": 0.034319929628362576, "min_feedback_forward_cosine": 0.9988197088241577 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.01586283933967352 }, { "epoch": 128, "eval_accuracy": 0.9218, "eval_loss": 0.3588898681640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0486680269241333, "mean_feedback_forward_cosine": 0.9993909020577708, "mean_feedback_forward_relative_error": 0.034315337787472436, "min_feedback_forward_cosine": 0.9988199472427368 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.013547314140200615 }, { "epoch": 129, "eval_accuracy": 0.9224, "eval_loss": 0.36866251831054686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04866375774145126, "mean_feedback_forward_cosine": 0.9993910404943651, "mean_feedback_forward_relative_error": 0.034310508098813794, "min_feedback_forward_cosine": 0.9988202452659607 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.014398164713051585 }, { "epoch": 130, "eval_accuracy": 0.9218, "eval_loss": 0.365063037109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04865895211696625, "mean_feedback_forward_cosine": 0.9993912231537604, "mean_feedback_forward_relative_error": 0.03430531098837814, "min_feedback_forward_cosine": 0.9988205432891846 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.01393503595052494 }, { "epoch": 131, "eval_accuracy": 0.9254, "eval_loss": 0.3608143493652344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04865493252873421, "mean_feedback_forward_cosine": 0.999391338517589, "mean_feedback_forward_relative_error": 0.03430056653075641, "min_feedback_forward_cosine": 0.9988206624984741 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.012824879109197192 }, { "epoch": 132, "eval_accuracy": 0.9224, "eval_loss": 0.3637261047363281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04865088686347008, "mean_feedback_forward_cosine": 0.9993914654178004, "mean_feedback_forward_relative_error": 0.03429574687634745, "min_feedback_forward_cosine": 0.9988207817077637 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.012399559729629092 }, { "epoch": 133, "eval_accuracy": 0.9222, "eval_loss": 0.36333014526367186, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048646971583366394, "mean_feedback_forward_cosine": 0.9993916269271604, "mean_feedback_forward_relative_error": 0.03429104835395851, "min_feedback_forward_cosine": 0.998820960521698 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.012052169627075395 }, { "epoch": 134, "eval_accuracy": 0.9244, "eval_loss": 0.3689380126953125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048642974346876144, "mean_feedback_forward_cosine": 0.9993917595955634, "mean_feedback_forward_relative_error": 0.03428640291695633, "min_feedback_forward_cosine": 0.9988212585449219 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.01183781708114677 }, { "epoch": 135, "eval_accuracy": 0.9242, "eval_loss": 0.36527835083007815, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04863850027322769, "mean_feedback_forward_cosine": 0.9993918884185052, "mean_feedback_forward_relative_error": 0.034281394594619354, "min_feedback_forward_cosine": 0.9988214373588562 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.012423885153399573 }, { "epoch": 136, "eval_accuracy": 0.9228, "eval_loss": 0.37191195068359373, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048634033650159836, "mean_feedback_forward_cosine": 0.9993920499278653, "mean_feedback_forward_relative_error": 0.03427618378472905, "min_feedback_forward_cosine": 0.9988217353820801 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.011888691175646253 }, { "epoch": 137, "eval_accuracy": 0.9252, "eval_loss": 0.3752788452148437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04862968251109123, "mean_feedback_forward_cosine": 0.999392197978112, "mean_feedback_forward_relative_error": 0.03427136731484244, "min_feedback_forward_cosine": 0.9988219141960144 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.011469858308798738 }, { "epoch": 138, "eval_accuracy": 0.9234, "eval_loss": 0.3746169250488281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04862533137202263, "mean_feedback_forward_cosine": 0.9993923421828977, "mean_feedback_forward_relative_error": 0.03426646318046316, "min_feedback_forward_cosine": 0.9988220930099487 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.011192755055841472 }, { "epoch": 139, "eval_accuracy": 0.923, "eval_loss": 0.3725655700683594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04862077161669731, "mean_feedback_forward_cosine": 0.9993924863876835, "mean_feedback_forward_relative_error": 0.034261413399250276, "min_feedback_forward_cosine": 0.9988223910331726 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.011524058209856351 }, { "epoch": 140, "eval_accuracy": 0.9226, "eval_loss": 0.37775662841796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04861658811569214, "mean_feedback_forward_cosine": 0.9993926363606607, "mean_feedback_forward_relative_error": 0.03425657896385077, "min_feedback_forward_cosine": 0.9988225698471069 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.010894056089719136 }, { "epoch": 141, "eval_accuracy": 0.9254, "eval_loss": 0.3685088928222656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048611849546432495, "mean_feedback_forward_cosine": 0.9993928036382121, "mean_feedback_forward_relative_error": 0.03425116128017826, "min_feedback_forward_cosine": 0.9988226294517517 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.011159929553253784 }, { "epoch": 142, "eval_accuracy": 0.9258, "eval_loss": 0.3666699462890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048607733100652695, "mean_feedback_forward_cosine": 0.9993929363066151, "mean_feedback_forward_relative_error": 0.03424643322585091, "min_feedback_forward_cosine": 0.9988230466842651 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.010106286029020944 }, { "epoch": 143, "eval_accuracy": 0.9222, "eval_loss": 0.3864923645019531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0486031174659729, "mean_feedback_forward_cosine": 0.9993930862795922, "mean_feedback_forward_relative_error": 0.034241410603206006, "min_feedback_forward_cosine": 0.9988232254981995 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.010455552863805659 }, { "epoch": 144, "eval_accuracy": 0.923, "eval_loss": 0.37877412109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04859888553619385, "mean_feedback_forward_cosine": 0.9993932766299094, "mean_feedback_forward_relative_error": 0.034236317200045434, "min_feedback_forward_cosine": 0.998823344707489 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.010130042814215024 }, { "epoch": 145, "eval_accuracy": 0.9224, "eval_loss": 0.38209491577148436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048594359308481216, "mean_feedback_forward_cosine": 0.9993934035301208, "mean_feedback_forward_relative_error": 0.0342312341916465, "min_feedback_forward_cosine": 0.9988236427307129 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.009922520908858213 }, { "epoch": 146, "eval_accuracy": 0.9222, "eval_loss": 0.3881881774902344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04858988896012306, "mean_feedback_forward_cosine": 0.9993935381212542, "mean_feedback_forward_relative_error": 0.034226064540205464, "min_feedback_forward_cosine": 0.9988237023353577 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.009807878665212127 }, { "epoch": 147, "eval_accuracy": 0.9248, "eval_loss": 0.38153494262695314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048584867268800735, "mean_feedback_forward_cosine": 0.9993937188579191, "mean_feedback_forward_relative_error": 0.03422067278335171, "min_feedback_forward_cosine": 0.998823881149292 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.010108151466813353 }, { "epoch": 148, "eval_accuracy": 0.9246, "eval_loss": 0.39089484252929685, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04858054965734482, "mean_feedback_forward_cosine": 0.9993938476808609, "mean_feedback_forward_relative_error": 0.034215778472923467, "min_feedback_forward_cosine": 0.9988242387771606 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.00944744374089771 }, { "epoch": 149, "eval_accuracy": 0.9234, "eval_loss": 0.3983838195800781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857631400227547, "mean_feedback_forward_cosine": 0.9993940303402562, "mean_feedback_forward_relative_error": 0.03421078793584339, "min_feedback_forward_cosine": 0.9988244771957397 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.009071883625868294 }, { "epoch": 150, "eval_accuracy": 0.922, "eval_loss": 0.3920445617675781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571620136499405, "mean_feedback_forward_cosine": 0.9993941918496163, "mean_feedback_forward_relative_error": 0.03420544635023801, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.009368490175157786 }, { "epoch": 151, "eval_accuracy": 0.9202, "eval_loss": 0.3945726989746094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857156425714493, "mean_feedback_forward_cosine": 0.9993941880041554, "mean_feedback_forward_relative_error": 0.03420531115825138, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.008574614812102583 }, { "epoch": 152, "eval_accuracy": 0.9208, "eval_loss": 0.3895898193359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857151582837105, "mean_feedback_forward_cosine": 0.9993941841586944, "mean_feedback_forward_relative_error": 0.034205187893202225, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.00854987682186895 }, { "epoch": 153, "eval_accuracy": 0.9218, "eval_loss": 0.3936317932128906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571471124887466, "mean_feedback_forward_cosine": 0.9993941918496163, "mean_feedback_forward_relative_error": 0.03420507057660049, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.007438057490438223 }, { "epoch": 154, "eval_accuracy": 0.9226, "eval_loss": 0.38970969848632814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857144504785538, "mean_feedback_forward_cosine": 0.9993941976178077, "mean_feedback_forward_relative_error": 0.034204961972371224, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.007093484061956406 }, { "epoch": 155, "eval_accuracy": 0.9222, "eval_loss": 0.3903849304199219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857141524553299, "mean_feedback_forward_cosine": 0.9993941899268858, "mean_feedback_forward_relative_error": 0.03420485216643541, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.007574405139767462 }, { "epoch": 156, "eval_accuracy": 0.923, "eval_loss": 0.3892175231933594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0485713854432106, "mean_feedback_forward_cosine": 0.9993941918496163, "mean_feedback_forward_relative_error": 0.034204739085849256, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.00694707155831986 }, { "epoch": 157, "eval_accuracy": 0.9224, "eval_loss": 0.38980198974609376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571355640888214, "mean_feedback_forward_cosine": 0.9993941880041554, "mean_feedback_forward_relative_error": 0.034204619486005075, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.007672812810457415 }, { "epoch": 158, "eval_accuracy": 0.9222, "eval_loss": 0.3905103515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857131466269493, "mean_feedback_forward_cosine": 0.9993942110769211, "mean_feedback_forward_relative_error": 0.03420450631529093, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.0080210231008629 }, { "epoch": 159, "eval_accuracy": 0.924, "eval_loss": 0.38340865478515623, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571277409791946, "mean_feedback_forward_cosine": 0.9993941880041554, "mean_feedback_forward_relative_error": 0.034204392543723504, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.0068947837022650576 }, { "epoch": 160, "eval_accuracy": 0.9236, "eval_loss": 0.3892705810546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571255058050156, "mean_feedback_forward_cosine": 0.9993941995405382, "mean_feedback_forward_relative_error": 0.03420428601243804, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.006723156801238656 }, { "epoch": 161, "eval_accuracy": 0.924, "eval_loss": 0.387517919921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857123643159866, "mean_feedback_forward_cosine": 0.9993942110769211, "mean_feedback_forward_relative_error": 0.03420418536951465, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.006679223413185941 }, { "epoch": 162, "eval_accuracy": 0.9234, "eval_loss": 0.3882124084472656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857119545340538, "mean_feedback_forward_cosine": 0.9993941956950773, "mean_feedback_forward_relative_error": 0.0342040729498671, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.007147442474319703 }, { "epoch": 163, "eval_accuracy": 0.924, "eval_loss": 0.3867006103515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571158200502396, "mean_feedback_forward_cosine": 0.9993942129996515, "mean_feedback_forward_relative_error": 0.034203966688965595, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.006905054523878627 }, { "epoch": 164, "eval_accuracy": 0.9226, "eval_loss": 0.38806248779296876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857112839818001, "mean_feedback_forward_cosine": 0.9993942091541905, "mean_feedback_forward_relative_error": 0.03420385676285913, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.006833887228535281 }, { "epoch": 165, "eval_accuracy": 0.9228, "eval_loss": 0.389813525390625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857109487056732, "mean_feedback_forward_cosine": 0.999394218767843, "mean_feedback_forward_relative_error": 0.03420375596972242, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.006642061247221298 }, { "epoch": 166, "eval_accuracy": 0.9226, "eval_loss": 0.390858056640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048571065068244934, "mean_feedback_forward_cosine": 0.9993942206905734, "mean_feedback_forward_relative_error": 0.03420365085044215, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.006464248421953784 }, { "epoch": 167, "eval_accuracy": 0.9242, "eval_loss": 0.38848478393554686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857103154063225, "mean_feedback_forward_cosine": 0.9993942283814953, "mean_feedback_forward_relative_error": 0.03420353828058127, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.006532345111005836 }, { "epoch": 168, "eval_accuracy": 0.9248, "eval_loss": 0.38907427978515624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857099801301956, "mean_feedback_forward_cosine": 0.999394214922382, "mean_feedback_forward_relative_error": 0.03420343000682131, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.006440749948720137 }, { "epoch": 169, "eval_accuracy": 0.9236, "eval_loss": 0.38989791870117185, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570968210697174, "mean_feedback_forward_cosine": 0.9993942206905734, "mean_feedback_forward_relative_error": 0.034203322544213266, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.006686322028934956 }, { "epoch": 170, "eval_accuracy": 0.9236, "eval_loss": 0.38908255004882814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570938408374786, "mean_feedback_forward_cosine": 0.9993942091541905, "mean_feedback_forward_relative_error": 0.03420321913736482, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.006311853679766257 }, { "epoch": 171, "eval_accuracy": 0.9238, "eval_loss": 0.38905315551757813, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570916056632996, "mean_feedback_forward_cosine": 0.9993942341496868, "mean_feedback_forward_relative_error": 0.034203112335695375, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.006446439210573832 }, { "epoch": 172, "eval_accuracy": 0.9258, "eval_loss": 0.3909088073730469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857088252902031, "mean_feedback_forward_cosine": 0.9993942168451124, "mean_feedback_forward_relative_error": 0.0342030058945379, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.006494547173836165 }, { "epoch": 173, "eval_accuracy": 0.9252, "eval_loss": 0.3877605590820313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570845276117325, "mean_feedback_forward_cosine": 0.9993942264587649, "mean_feedback_forward_relative_error": 0.03420290344905469, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.006705886676493618 }, { "epoch": 174, "eval_accuracy": 0.9242, "eval_loss": 0.3882752746582031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857081547379494, "mean_feedback_forward_cosine": 0.9993942303042258, "mean_feedback_forward_relative_error": 0.034202803166643266, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.00622351783282227 }, { "epoch": 175, "eval_accuracy": 0.924, "eval_loss": 0.38828839111328123, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570796847343445, "mean_feedback_forward_cosine": 0.9993942533769915, "mean_feedback_forward_relative_error": 0.034202703304829135, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.005534759585931897 }, { "epoch": 176, "eval_accuracy": 0.9254, "eval_loss": 0.3911351684570312, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570770770311356, "mean_feedback_forward_cosine": 0.9993942437633392, "mean_feedback_forward_relative_error": 0.03420259406970393, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.005964737568009231 }, { "epoch": 177, "eval_accuracy": 0.9248, "eval_loss": 0.3912963134765625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570748418569565, "mean_feedback_forward_cosine": 0.9993942360724172, "mean_feedback_forward_relative_error": 0.03420249706194285, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.005666052417498496 }, { "epoch": 178, "eval_accuracy": 0.9246, "eval_loss": 0.39074390869140624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857071861624718, "mean_feedback_forward_cosine": 0.9993942322269562, "mean_feedback_forward_relative_error": 0.03420238794698831, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.00602857864888178 }, { "epoch": 179, "eval_accuracy": 0.9262, "eval_loss": 0.38614667358398436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570699989795685, "mean_feedback_forward_cosine": 0.9993942303042258, "mean_feedback_forward_relative_error": 0.03420228733410759, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.005615825949195358 }, { "epoch": 180, "eval_accuracy": 0.9244, "eval_loss": 0.38893945922851564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570673912763596, "mean_feedback_forward_cosine": 0.9993942572224525, "mean_feedback_forward_relative_error": 0.03420218726199481, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.006089276160837875 }, { "epoch": 181, "eval_accuracy": 0.9238, "eval_loss": 0.3898399291992187, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857064411044121, "mean_feedback_forward_cosine": 0.9993942437633392, "mean_feedback_forward_relative_error": 0.03420209064478836, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.006377839122795396 }, { "epoch": 182, "eval_accuracy": 0.923, "eval_loss": 0.395673095703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857062175869942, "mean_feedback_forward_cosine": 0.9993942245360343, "mean_feedback_forward_relative_error": 0.03420198555555074, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.005886330561753777 }, { "epoch": 183, "eval_accuracy": 0.9234, "eval_loss": 0.39157060546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857058823108673, "mean_feedback_forward_cosine": 0.9993942379951477, "mean_feedback_forward_relative_error": 0.034201881517806364, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.00615320463238491 }, { "epoch": 184, "eval_accuracy": 0.9234, "eval_loss": 0.3938642578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857056587934494, "mean_feedback_forward_cosine": 0.9993942399178782, "mean_feedback_forward_relative_error": 0.0342017823469735, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.006089492196589708 }, { "epoch": 185, "eval_accuracy": 0.9244, "eval_loss": 0.39137650146484376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570528626441956, "mean_feedback_forward_cosine": 0.9993942341496868, "mean_feedback_forward_relative_error": 0.03420168437784718, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.005729687671032217 }, { "epoch": 186, "eval_accuracy": 0.9238, "eval_loss": 0.3917858642578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857049137353897, "mean_feedback_forward_cosine": 0.9993942418406087, "mean_feedback_forward_relative_error": 0.034201580460273454, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.0060106748471657435 }, { "epoch": 187, "eval_accuracy": 0.922, "eval_loss": 0.3935861572265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857047274708748, "mean_feedback_forward_cosine": 0.9993942360724172, "mean_feedback_forward_relative_error": 0.034201479006198146, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.006099106899317768 }, { "epoch": 188, "eval_accuracy": 0.9238, "eval_loss": 0.3924464660644531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570454120635986, "mean_feedback_forward_cosine": 0.9993942629906439, "mean_feedback_forward_relative_error": 0.03420138022591991, "min_feedback_forward_cosine": 0.9988248944282532 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.005720732238267859 }, { "epoch": 189, "eval_accuracy": 0.9258, "eval_loss": 0.38947210693359374, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0485704243183136, "mean_feedback_forward_cosine": 0.999394255299722, "mean_feedback_forward_relative_error": 0.03420127672894347, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.0063833029953142 }, { "epoch": 190, "eval_accuracy": 0.9254, "eval_loss": 0.3864773376464844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857039451599121, "mean_feedback_forward_cosine": 0.999394255299722, "mean_feedback_forward_relative_error": 0.03420117773836659, "min_feedback_forward_cosine": 0.9988246560096741 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.005768505500422584 }, { "epoch": 191, "eval_accuracy": 0.9246, "eval_loss": 0.38983641967773436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857035353779793, "mean_feedback_forward_cosine": 0.9993942476088001, "mean_feedback_forward_relative_error": 0.03420107397100618, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.006166870318022039 }, { "epoch": 192, "eval_accuracy": 0.9242, "eval_loss": 0.3892133483886719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570334911346436, "mean_feedback_forward_cosine": 0.9993942668361049, "mean_feedback_forward_relative_error": 0.03420097753405571, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.005772096807261308 }, { "epoch": 193, "eval_accuracy": 0.926, "eval_loss": 0.3912098205566406, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570312559604645, "mean_feedback_forward_cosine": 0.999394259145183, "mean_feedback_forward_relative_error": 0.03420088317004904, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.005735846981571781 }, { "epoch": 194, "eval_accuracy": 0.924, "eval_loss": 0.38991021728515624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570286482572556, "mean_feedback_forward_cosine": 0.9993942456860696, "mean_feedback_forward_relative_error": 0.03420078535113604, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.005394473344584306 }, { "epoch": 195, "eval_accuracy": 0.9234, "eval_loss": 0.39238130493164064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857025295495987, "mean_feedback_forward_cosine": 0.9993942456860696, "mean_feedback_forward_relative_error": 0.03420068224471423, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.005845885767539342 }, { "epoch": 196, "eval_accuracy": 0.924, "eval_loss": 0.388215380859375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857022315263748, "mean_feedback_forward_cosine": 0.9993942649133744, "mean_feedback_forward_relative_error": 0.034200580430126956, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.005960262824677758 }, { "epoch": 197, "eval_accuracy": 0.925, "eval_loss": 0.3863689880371094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857020080089569, "mean_feedback_forward_cosine": 0.9993942783724877, "mean_feedback_forward_relative_error": 0.034200483362280557, "min_feedback_forward_cosine": 0.9988247752189636 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.005644922489176194 }, { "epoch": 198, "eval_accuracy": 0.9244, "eval_loss": 0.3886321044921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570167273283005, "mean_feedback_forward_cosine": 0.9993942649133744, "mean_feedback_forward_relative_error": 0.034200379955432104, "min_feedback_forward_cosine": 0.9988248944282532 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.005755332447257307 }, { "epoch": 199, "eval_accuracy": 0.926, "eval_loss": 0.3910266357421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.048570141196250916, "mean_feedback_forward_cosine": 0.999394255299722, "mean_feedback_forward_relative_error": 0.03420028096485522, "min_feedback_forward_cosine": 0.9988248348236084 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.006012655192530817 }, { "epoch": 200, "eval_accuracy": 0.9238, "eval_loss": 0.39594262084960935, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04857011139392853, "mean_feedback_forward_cosine": 0.9993942726042963, "mean_feedback_forward_relative_error": 0.034200180532230486, "min_feedback_forward_cosine": 0.9988247156143188 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.0059044962678311596 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.9238, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.39594262084960935, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2325996544, "peak_memory_reserved_bytes": 3166699520, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 34.060356855392456, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 2877.0025794506073, "train_wall_s": 2841.6028168201447 }, "work": { "apical_macs_per_example": 68420224, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 615782016000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 615782016000000, "local_weight_correlation_macs": 619763328000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 619763328000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 68862592, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 2471090688000000 } }