{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 848512, "base_width": 16, "blocks_per_stage": 9, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 56, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 853018, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 56, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "kp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-clean_kp-d56-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "reciprocal_local_activity_products", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.9988037016656663, "feedback_forward_cosine": [ 0.9995574951171875, 0.9995169639587402, 0.9992508888244629, 0.9991180896759033, 0.9991408586502075, 0.9988906979560852, 0.999122142791748, 0.9988346099853516, 0.9992246627807617, 0.9988415837287903, 0.9990280866622925, 0.9985275864601135, 0.9986708164215088, 0.9977948069572449, 0.9980864524841309, 0.9977025985717773, 0.9983896017074585, 0.9977715611457825, 0.9988182783126831, 0.9991542100906372, 0.9989104866981506, 0.9987741708755493, 0.9988317489624023, 0.9986496567726135, 0.9990257620811462, 0.9987555146217346, 0.9989592432975769, 0.9986085891723633, 0.9990679621696472, 0.998760461807251, 0.9990558624267578, 0.9986815452575684, 0.9991776943206787, 0.9988480806350708, 0.9991104006767273, 0.9987267255783081, 0.9992961883544922, 0.9995409250259399, 0.9993419647216797, 0.9993253946304321, 0.9993946552276611, 0.9992978572845459, 0.9994099736213684, 0.9992327690124512, 0.9994537830352783, 0.9991894960403442, 0.9993447065353394, 0.9989761114120483, 0.9992188215255737, 0.9986401796340942, 0.9989041686058044, 0.997963547706604, 0.9979575872421265, 0.9966350197792053, 0.9999642968177795 ], "feedback_forward_norm_ratio": [ 0.9988628625869751, 1.00169038772583, 0.9988455772399902, 1.0018149614334106, 0.9983507394790649, 1.001532793045044, 0.9981478452682495, 1.00508713722229, 0.9976799488067627, 1.002779483795166, 0.996472954750061, 1.0031712055206299, 0.9947890639305115, 1.0027819871902466, 0.9938843250274658, 1.0071712732315063, 0.9960893988609314, 1.0045490264892578, 0.9968646764755249, 1.0018043518066406, 0.9983800649642944, 1.0021274089813232, 0.9981029033660889, 1.002813696861267, 0.998471736907959, 1.0024747848510742, 0.9984707236289978, 1.00377357006073, 0.9984996318817139, 1.003908634185791, 0.9981768727302551, 1.00295889377594, 0.9980287551879883, 1.003975510597229, 0.9989507794380188, 1.003403663635254, 0.9981476068496704, 1.0010191202163696, 0.9987508058547974, 1.0020904541015625, 0.9993308186531067, 1.0017856359481812, 0.9992122650146484, 1.0019315481185913, 0.9992152452468872, 1.0023112297058105, 0.9992201924324036, 1.0025296211242676, 0.9988380670547485, 1.002525806427002, 0.9991728663444519, 1.003301739692688, 0.9986709356307983, 1.003277063369751, 1.0064365863800049 ], "feedback_forward_relative_error": [ 0.029755709692835808, 0.03115258552134037, 0.03870101645588875, 0.042074669152498245, 0.04145186021924019, 0.04716512933373451, 0.041904985904693604, 0.04866664856672287, 0.03940116614103317, 0.04828055575489998, 0.04415307566523552, 0.054445065557956696, 0.05168891325592995, 0.06656099855899811, 0.061974987387657166, 0.0684041976928711, 0.05677487328648567, 0.0670657828450203, 0.04864046350121498, 0.041204363107681274, 0.04667006433010101, 0.04961398243904114, 0.04832734540104866, 0.05211685970425606, 0.04413510486483574, 0.05001169815659523, 0.04561459273099899, 0.05298462510108948, 0.043167274445295334, 0.050040122121572495, 0.04345225915312767, 0.05151088535785675, 0.04056119546294212, 0.048257168382406235, 0.04217178001999855, 0.05066346749663353, 0.03753187507390976, 0.030329721048474312, 0.03627943620085716, 0.03683214634656906, 0.034789882600307465, 0.03754897788167, 0.03434815630316734, 0.03925550356507301, 0.03304633870720863, 0.040373899042606354, 0.03619636967778206, 0.045381058007478714, 0.039520811289548874, 0.05227590724825859, 0.046804919838905334, 0.06400913000106812, 0.06388391554355621, 0.08223697543144226, 0.01064779981970787 ], "innovation_negative_gradient_cosine": [ 0.9990317821502686, 0.9989892244338989, 0.9989813566207886, 0.9987704753875732, 0.9989952445030212, 0.9988008737564087, 0.9990298748016357, 0.9987648129463196, 0.99904465675354, 0.9989824891090393, 0.9990545511245728, 0.9986403584480286, 0.9990695714950562, 0.9982811212539673, 0.9990877509117126, 0.9978867769241333, 0.9990891814231873, 0.9979665279388428, 0.9990986585617065, 0.998831033706665, 0.9991048574447632, 0.9985469579696655, 0.9991083145141602, 0.9985823035240173, 0.9991117715835571, 0.9986124634742737, 0.9991379380226135, 0.9986610412597656, 0.9991350173950195, 0.9989628195762634, 0.9991565942764282, 0.9987471699714661, 0.9991878867149353, 0.9989113807678223, 0.9992119073867798, 0.9989118576049805, 0.9992275238037109, 0.9992373585700989, 0.9992811679840088, 0.999153733253479, 0.9993259906768799, 0.9991576671600342, 0.9993447661399841, 0.9992607235908508, 0.9994027614593506, 0.9993295073509216, 0.9994453191757202, 0.9994139671325684, 0.9994925260543823, 0.9995317459106445, 0.9995478391647339, 0.9996591210365295, 0.9996875524520874, 0.9998064041137695, 0.7163748741149902 ], "mean_feedback_forward_cosine": 0.9988813335245306, "mean_feedback_forward_relative_error": 0.04600105993449688, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.9990317821502686, 0.9989892244338989, 0.9989813566207886, 0.9987704753875732, 0.9989952445030212, 0.9988008737564087, 0.9990298748016357, 0.9987648129463196, 0.99904465675354, 0.9989824891090393, 0.9990545511245728, 0.9986403584480286, 0.9990695714950562, 0.9982811212539673, 0.9990877509117126, 0.9978867769241333, 0.9990891814231873, 0.9979665279388428, 0.9990986585617065, 0.998831033706665, 0.9991048574447632, 0.9985469579696655, 0.9991083145141602, 0.9985823035240173, 0.9991117715835571, 0.9986124634742737, 0.9991379380226135, 0.9986610412597656, 0.9991350173950195, 0.9989628195762634, 0.9991565942764282, 0.9987471699714661, 0.9991878867149353, 0.9989113807678223, 0.9992119073867798, 0.9989118576049805, 0.9992275238037109, 0.9992373585700989, 0.9992811679840088, 0.999153733253479, 0.9993259906768799, 0.9991576671600342, 0.9993447661399841, 0.9992607235908508, 0.9994027614593506, 0.9993295073509216, 0.9994453191757202, 0.9994139671325684, 0.9994925260543823, 0.9995317459106445, 0.9995478391647339, 0.9996591210365295, 0.9996875524520874, 0.9998064041137695, 0.7163748741149902 ], "teaching_negative_gradient_cosine": [ 0.9990317821502686, 0.9989892244338989, 0.9989813566207886, 0.9987704753875732, 0.9989952445030212, 0.9988008737564087, 0.9990298748016357, 0.9987648129463196, 0.99904465675354, 0.9989824891090393, 0.9990545511245728, 0.9986403584480286, 0.9990695714950562, 0.9982811212539673, 0.9990877509117126, 0.9978867769241333, 0.9990891814231873, 0.9979665279388428, 0.9990986585617065, 0.998831033706665, 0.9991048574447632, 0.9985469579696655, 0.9991083145141602, 0.9985823035240173, 0.9991117715835571, 0.9986124634742737, 0.9991379380226135, 0.9986610412597656, 0.9991350173950195, 0.9989628195762634, 0.9991565942764282, 0.9987471699714661, 0.9991878867149353, 0.9989113807678223, 0.9992119073867798, 0.9989118576049805, 0.9992275238037109, 0.9992373585700989, 0.9992811679840088, 0.999153733253479, 0.9993259906768799, 0.9991576671600342, 0.9993447661399841, 0.9992607235908508, 0.9994027614593506, 0.9993295073509216, 0.9994453191757202, 0.9994139671325684, 0.9994925260543823, 0.9995317459106445, 0.9995478391647339, 0.9996591210365295, 0.9996875524520874, 0.9998064041137695, 0.7163748741149902 ], "wall_s": 0.11626768112182617 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.2936, "eval_loss": 2.060192431640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.4729894399642944, "mean_feedback_forward_cosine": 0.08207923307676207, "mean_feedback_forward_relative_error": 1.3605215722864323, "min_feedback_forward_cosine": 0.011852272786200047 }, "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.123790234099494 }, { "epoch": 2, "eval_accuracy": 0.4336, "eval_loss": 1.644146044921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3818473815917969, "mean_feedback_forward_cosine": 0.1517215799878944, "mean_feedback_forward_relative_error": 1.306954277645458, "min_feedback_forward_cosine": 0.04962993040680885 }, "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.6988532908757528 }, { "epoch": 3, "eval_accuracy": 0.5284, "eval_loss": 1.41752919921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3391482830047607, "mean_feedback_forward_cosine": 0.2346487126567147, "mean_feedback_forward_relative_error": 1.2409382657571273, "min_feedback_forward_cosine": 0.11064116656780243 }, "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.40682961162991 }, { "epoch": 4, "eval_accuracy": 0.5884, "eval_loss": 1.1971573974609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3097155094146729, "mean_feedback_forward_cosine": 0.3149321618405255, "mean_feedback_forward_relative_error": 1.1737277052619242, "min_feedback_forward_cosine": 0.14912492036819458 }, "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 1.1264890681160822 }, { "epoch": 5, "eval_accuracy": 0.7082, "eval_loss": 0.8434026123046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.2819832563400269, "mean_feedback_forward_cosine": 0.387133172696287, "mean_feedback_forward_relative_error": 1.109520400654186, "min_feedback_forward_cosine": 0.1867155283689499 }, "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.9187799799389309 }, { "epoch": 6, "eval_accuracy": 0.728, "eval_loss": 0.8178329467773438, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.260962724685669, "mean_feedback_forward_cosine": 0.43850364685058596, "mean_feedback_forward_relative_error": 1.0616818113760516, "min_feedback_forward_cosine": 0.2145915925502777 }, "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.7764964687347412 }, { "epoch": 7, "eval_accuracy": 0.7022, "eval_loss": 0.9358474975585938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.2412327527999878, "mean_feedback_forward_cosine": 0.4796803523193706, "mean_feedback_forward_relative_error": 1.0219877210530368, "min_feedback_forward_cosine": 0.24086108803749084 }, "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.6912625069724189 }, { "epoch": 8, "eval_accuracy": 0.7508, "eval_loss": 0.762169921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.222935676574707, "mean_feedback_forward_cosine": 0.5153755480592901, "mean_feedback_forward_relative_error": 0.986245432767001, "min_feedback_forward_cosine": 0.26393070816993713 }, "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.6286246035257975 }, { "epoch": 9, "eval_accuracy": 0.7888, "eval_loss": 0.6249593627929687, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.2051806449890137, "mean_feedback_forward_cosine": 0.5469873997298154, "mean_feedback_forward_relative_error": 0.9534298192371021, "min_feedback_forward_cosine": 0.2858530282974243 }, "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5727805726899041 }, { "epoch": 10, "eval_accuracy": 0.768, "eval_loss": 0.7355963623046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1889394521713257, "mean_feedback_forward_cosine": 0.5755576019937342, "mean_feedback_forward_relative_error": 0.9226999954743819, "min_feedback_forward_cosine": 0.30642619729042053 }, "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.5328205897172292 }, { "epoch": 11, "eval_accuracy": 0.8112, "eval_loss": 0.5712257080078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1723517179489136, "mean_feedback_forward_cosine": 0.6018412416631526, "mean_feedback_forward_relative_error": 0.8934933689507571, "min_feedback_forward_cosine": 0.3266719579696655 }, "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.5016598609076606 }, { "epoch": 12, "eval_accuracy": 0.7896, "eval_loss": 0.6734730712890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1551438570022583, "mean_feedback_forward_cosine": 0.625412240895358, "mean_feedback_forward_relative_error": 0.8661270428787579, "min_feedback_forward_cosine": 0.34698301553726196 }, "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.47733594166437787 }, { "epoch": 13, "eval_accuracy": 0.799, "eval_loss": 0.6092771240234375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.138596773147583, "mean_feedback_forward_cosine": 0.6471591234207154, "mean_feedback_forward_relative_error": 0.8402352311394431, "min_feedback_forward_cosine": 0.36682766675949097 }, "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.4463163204775916 }, { "epoch": 14, "eval_accuracy": 0.8226, "eval_loss": 0.5384412719726562, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.122653603553772, "mean_feedback_forward_cosine": 0.6674662720073353, "mean_feedback_forward_relative_error": 0.8154430156404322, "min_feedback_forward_cosine": 0.3852914571762085 }, "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.4283656439781189 }, { "epoch": 15, "eval_accuracy": 0.829, "eval_loss": 0.5133809020996094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1056475639343262, "mean_feedback_forward_cosine": 0.6869502766565843, "mean_feedback_forward_relative_error": 0.7906913573091681, "min_feedback_forward_cosine": 0.4046149253845215 }, "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.4076533457332187 }, { "epoch": 16, "eval_accuracy": 0.8106, "eval_loss": 0.6083410766601562, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0893713235855103, "mean_feedback_forward_cosine": 0.7045990922234275, "mean_feedback_forward_relative_error": 0.7676530827175487, "min_feedback_forward_cosine": 0.42278337478637695 }, "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.3880259382724762 }, { "epoch": 17, "eval_accuracy": 0.8292, "eval_loss": 0.503566552734375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0723820924758911, "mean_feedback_forward_cosine": 0.7214057423851706, "mean_feedback_forward_relative_error": 0.7450004333799536, "min_feedback_forward_cosine": 0.44093620777130127 }, "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.3736611439810859 }, { "epoch": 18, "eval_accuracy": 0.8352, "eval_loss": 0.5023697204589844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0543376207351685, "mean_feedback_forward_cosine": 0.737669068033045, "mean_feedback_forward_relative_error": 0.7226391394029964, "min_feedback_forward_cosine": 0.4603174924850464 }, "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.364715851465861 }, { "epoch": 19, "eval_accuracy": 0.8164, "eval_loss": 0.603892041015625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.035783290863037, "mean_feedback_forward_cosine": 0.7531207366423174, "mean_feedback_forward_relative_error": 0.70054920993068, "min_feedback_forward_cosine": 0.4795728921890259 }, "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.3488689161459605 }, { "epoch": 20, "eval_accuracy": 0.8404, "eval_loss": 0.5018754943847656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0169116258621216, "mean_feedback_forward_cosine": 0.7675304158167405, "mean_feedback_forward_relative_error": 0.6793056907978925, "min_feedback_forward_cosine": 0.4986239969730377 }, "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.33735975733862983 }, { "epoch": 21, "eval_accuracy": 0.8446, "eval_loss": 0.4680168029785156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9975670576095581, "mean_feedback_forward_cosine": 0.7813035347244957, "mean_feedback_forward_relative_error": 0.658438462560827, "min_feedback_forward_cosine": 0.5182281732559204 }, "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.3261894694434272 }, { "epoch": 22, "eval_accuracy": 0.8524, "eval_loss": 0.4533489501953125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9778302311897278, "mean_feedback_forward_cosine": 0.7944718913598494, "mean_feedback_forward_relative_error": 0.6378612987019799, "min_feedback_forward_cosine": 0.5373923778533936 }, "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.3175746521313985 }, { "epoch": 23, "eval_accuracy": 0.8608, "eval_loss": 0.4396246276855469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9584059715270996, "mean_feedback_forward_cosine": 0.8066396474838257, "mean_feedback_forward_relative_error": 0.6182341255924918, "min_feedback_forward_cosine": 0.5559208393096924 }, "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.30371766968833075 }, { "epoch": 24, "eval_accuracy": 0.8596, "eval_loss": 0.4563602478027344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9386764168739319, "mean_feedback_forward_cosine": 0.8177748517556624, "mean_feedback_forward_relative_error": 0.5997207224369049, "min_feedback_forward_cosine": 0.5744795799255371 }, "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.2900086401462555 }, { "epoch": 25, "eval_accuracy": 0.8586, "eval_loss": 0.4243275390625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9187594652175903, "mean_feedback_forward_cosine": 0.8285161896185441, "mean_feedback_forward_relative_error": 0.5813728538426486, "min_feedback_forward_cosine": 0.5922850370407104 }, "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.2870960140122308 }, { "epoch": 26, "eval_accuracy": 0.866, "eval_loss": 0.41880641479492187, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8995776772499084, "mean_feedback_forward_cosine": 0.8383215871724216, "mean_feedback_forward_relative_error": 0.5641180030324242, "min_feedback_forward_cosine": 0.6091452240943909 }, "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.2801684870455 }, { "epoch": 27, "eval_accuracy": 0.8608, "eval_loss": 0.45782495727539063, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8790687918663025, "mean_feedback_forward_cosine": 0.8478951313278892, "mean_feedback_forward_relative_error": 0.5467334628105164, "min_feedback_forward_cosine": 0.6270616054534912 }, "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.276506783774164 }, { "epoch": 28, "eval_accuracy": 0.8738, "eval_loss": 0.41229105224609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8599552512168884, "mean_feedback_forward_cosine": 0.8569087667898698, "mean_feedback_forward_relative_error": 0.5298725553534248, "min_feedback_forward_cosine": 0.6432315111160278 }, "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.25949633451567755 }, { "epoch": 29, "eval_accuracy": 0.8548, "eval_loss": 0.47992633666992185, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8409947752952576, "mean_feedback_forward_cosine": 0.8654873620380055, "mean_feedback_forward_relative_error": 0.5133874578909441, "min_feedback_forward_cosine": 0.658990740776062 }, "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.2583834177679486 }, { "epoch": 30, "eval_accuracy": 0.8498, "eval_loss": 0.49892302856445314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8211984038352966, "mean_feedback_forward_cosine": 0.8737081343477423, "mean_feedback_forward_relative_error": 0.4970983491702513, "min_feedback_forward_cosine": 0.6749225854873657 }, "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.25416444894737666 }, { "epoch": 31, "eval_accuracy": 0.8446, "eval_loss": 0.5110629577636718, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8005052804946899, "mean_feedback_forward_cosine": 0.8813880790363658, "mean_feedback_forward_relative_error": 0.4814133836464448, "min_feedback_forward_cosine": 0.6910892724990845 }, "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.2507732811000612 }, { "epoch": 32, "eval_accuracy": 0.8732, "eval_loss": 0.40844691162109376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7807812094688416, "mean_feedback_forward_cosine": 0.8887567043304443, "mean_feedback_forward_relative_error": 0.4659483096816323, "min_feedback_forward_cosine": 0.7062845230102539 }, "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.24385885693762038 }, { "epoch": 33, "eval_accuracy": 0.8492, "eval_loss": 0.49456326904296877, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7614753842353821, "mean_feedback_forward_cosine": 0.8955482537096197, "mean_feedback_forward_relative_error": 0.4511532629078085, "min_feedback_forward_cosine": 0.720395565032959 }, "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.23739461857477823 }, { "epoch": 34, "eval_accuracy": 0.8498, "eval_loss": 0.5223807678222656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.742235541343689, "mean_feedback_forward_cosine": 0.9018027283928611, "mean_feedback_forward_relative_error": 0.43716591732068494, "min_feedback_forward_cosine": 0.7343444228172302 }, "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.23336360233359868 }, { "epoch": 35, "eval_accuracy": 0.8744, "eval_loss": 0.41874742431640627, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7225374579429626, "mean_feedback_forward_cosine": 0.9077971696853637, "mean_feedback_forward_relative_error": 0.4234206673773852, "min_feedback_forward_cosine": 0.7480750679969788 }, "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.22778456059561836 }, { "epoch": 36, "eval_accuracy": 0.8776, "eval_loss": 0.3977263732910156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7031345367431641, "mean_feedback_forward_cosine": 0.9135233012112705, "mean_feedback_forward_relative_error": 0.4098250017924742, "min_feedback_forward_cosine": 0.7613703012466431 }, "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.2255130520661672 }, { "epoch": 37, "eval_accuracy": 0.867, "eval_loss": 0.4421707946777344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6846021413803101, "mean_feedback_forward_cosine": 0.9187919194048101, "mean_feedback_forward_relative_error": 0.39689874730326913, "min_feedback_forward_cosine": 0.7737734913825989 }, "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.2240035187959671 }, { "epoch": 38, "eval_accuracy": 0.851, "eval_loss": 0.4847253173828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6660941243171692, "mean_feedback_forward_cosine": 0.9238915584304116, "mean_feedback_forward_relative_error": 0.3839693303812634, "min_feedback_forward_cosine": 0.7856288552284241 }, "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.21737773218684725 }, { "epoch": 39, "eval_accuracy": 0.8788, "eval_loss": 0.41233887939453123, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6483564972877502, "mean_feedback_forward_cosine": 0.9285368594256315, "mean_feedback_forward_relative_error": 0.3718270332975821, "min_feedback_forward_cosine": 0.7968446016311646 }, "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.2110462031231986 }, { "epoch": 40, "eval_accuracy": 0.8744, "eval_loss": 0.42741173706054686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6304129362106323, "mean_feedback_forward_cosine": 0.9328895178708163, "mean_feedback_forward_relative_error": 0.3601139377463948, "min_feedback_forward_cosine": 0.8078715801239014 }, "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.20277180547714233 }, { "epoch": 41, "eval_accuracy": 0.881, "eval_loss": 0.40434840698242186, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6114498376846313, "mean_feedback_forward_cosine": 0.9371648885987022, "mean_feedback_forward_relative_error": 0.34830014421181243, "min_feedback_forward_cosine": 0.8190717101097107 }, "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.20585658853848776 }, { "epoch": 42, "eval_accuracy": 0.878, "eval_loss": 0.4233556945800781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5938428640365601, "mean_feedback_forward_cosine": 0.9411213528026234, "mean_feedback_forward_relative_error": 0.33697369437326086, "min_feedback_forward_cosine": 0.8294274210929871 }, "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.2012337659464942 }, { "epoch": 43, "eval_accuracy": 0.8768, "eval_loss": 0.41400225830078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5771043300628662, "mean_feedback_forward_cosine": 0.944767753644423, "mean_feedback_forward_relative_error": 0.32624045339497654, "min_feedback_forward_cosine": 0.8388245105743408 }, "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.19511909804344177 }, { "epoch": 44, "eval_accuracy": 0.8104, "eval_loss": 0.7237696166992188, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5596101880073547, "mean_feedback_forward_cosine": 0.948338532447815, "mean_feedback_forward_relative_error": 0.31540666994723404, "min_feedback_forward_cosine": 0.8483365774154663 }, "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.1980742193804847 }, { "epoch": 45, "eval_accuracy": 0.8706, "eval_loss": 0.46084964599609374, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5431535243988037, "mean_feedback_forward_cosine": 0.9515498302199624, "mean_feedback_forward_relative_error": 0.3053073207085783, "min_feedback_forward_cosine": 0.8570070266723633 }, "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.19275552099015977 }, { "epoch": 46, "eval_accuracy": 0.8814, "eval_loss": 0.40947244873046873, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5276136994361877, "mean_feedback_forward_cosine": 0.9546002951535312, "mean_feedback_forward_relative_error": 0.2954358386722478, "min_feedback_forward_cosine": 0.8650082349777222 }, "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.18924892360104456 }, { "epoch": 47, "eval_accuracy": 0.8824, "eval_loss": 0.41092626342773436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5122539401054382, "mean_feedback_forward_cosine": 0.9575513818047263, "mean_feedback_forward_relative_error": 0.2855187581344084, "min_feedback_forward_cosine": 0.8727079629898071 }, "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.18873042728106182 }, { "epoch": 48, "eval_accuracy": 0.873, "eval_loss": 0.4387502258300781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.49630874395370483, "mean_feedback_forward_cosine": 0.9602571855891835, "mean_feedback_forward_relative_error": 0.2761423014781692, "min_feedback_forward_cosine": 0.8804479241371155 }, "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.18430980693764157 }, { "epoch": 49, "eval_accuracy": 0.8618, "eval_loss": 0.4662376098632813, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.48133349418640137, "mean_feedback_forward_cosine": 0.9627048893408342, "mean_feedback_forward_relative_error": 0.26738952113823455, "min_feedback_forward_cosine": 0.8874017000198364 }, "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.1800568481153912 }, { "epoch": 50, "eval_accuracy": 0.8826, "eval_loss": 0.4051923889160156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.466120183467865, "mean_feedback_forward_cosine": 0.9650715307755904, "mean_feedback_forward_relative_error": 0.2586525908925317, "min_feedback_forward_cosine": 0.8943054676055908 }, "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.1789180386662483 }, { "epoch": 51, "eval_accuracy": 0.8702, "eval_loss": 0.4498435302734375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4508410096168518, "mean_feedback_forward_cosine": 0.9673665068366311, "mean_feedback_forward_relative_error": 0.24993357875130393, "min_feedback_forward_cosine": 0.9010016918182373 }, "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.18010127037101323 }, { "epoch": 52, "eval_accuracy": 0.87, "eval_loss": 0.477175048828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4368517994880676, "mean_feedback_forward_cosine": 0.9694177584214644, "mean_feedback_forward_relative_error": 0.24190838066014378, "min_feedback_forward_cosine": 0.9070504307746887 }, "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.16981975546148087 }, { "epoch": 53, "eval_accuracy": 0.8716, "eval_loss": 0.4523770324707031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4235183298587799, "mean_feedback_forward_cosine": 0.9713853868571195, "mean_feedback_forward_relative_error": 0.23388134376569228, "min_feedback_forward_cosine": 0.9125978946685791 }, "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.17002208354208204 }, { "epoch": 54, "eval_accuracy": 0.8596, "eval_loss": 0.5152298583984375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.40936705470085144, "mean_feedback_forward_cosine": 0.9733334248716181, "mean_feedback_forward_relative_error": 0.2257189244031906, "min_feedback_forward_cosine": 0.9182888865470886 }, "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.17592860356701745 }, { "epoch": 55, "eval_accuracy": 0.8734, "eval_loss": 0.4423846618652344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3969172537326813, "mean_feedback_forward_cosine": 0.9750462586229498, "mean_feedback_forward_relative_error": 0.21827290789647535, "min_feedback_forward_cosine": 0.9230918884277344 }, "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.17371374536090428 }, { "epoch": 56, "eval_accuracy": 0.8784, "eval_loss": 0.4110608825683594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.38447803258895874, "mean_feedback_forward_cosine": 0.976641688563607, "mean_feedback_forward_relative_error": 0.2111172491176562, "min_feedback_forward_cosine": 0.9277975559234619 }, "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.16767991562949286 }, { "epoch": 57, "eval_accuracy": 0.8784, "eval_loss": 0.4192649353027344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3719860017299652, "mean_feedback_forward_cosine": 0.97813284072009, "mean_feedback_forward_relative_error": 0.2041995076293295, "min_feedback_forward_cosine": 0.9323537349700928 }, "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.16788513456980386 }, { "epoch": 58, "eval_accuracy": 0.886, "eval_loss": 0.37670152587890626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3604535162448883, "mean_feedback_forward_cosine": 0.9794968269088051, "mean_feedback_forward_relative_error": 0.1976644179360433, "min_feedback_forward_cosine": 0.9364805221557617 }, "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.16070309614075554 }, { "epoch": 59, "eval_accuracy": 0.8636, "eval_loss": 0.4858129577636719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3487560451030731, "mean_feedback_forward_cosine": 0.9808387929742987, "mean_feedback_forward_relative_error": 0.1910235660997304, "min_feedback_forward_cosine": 0.9404898881912231 }, "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.1631975841826863 }, { "epoch": 60, "eval_accuracy": 0.8766, "eval_loss": 0.4174827453613281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.33727237582206726, "mean_feedback_forward_cosine": 0.982091445272619, "mean_feedback_forward_relative_error": 0.18464546623555098, "min_feedback_forward_cosine": 0.9443246722221375 }, "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.1633899968147278 }, { "epoch": 61, "eval_accuracy": 0.873, "eval_loss": 0.452418115234375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.32584843039512634, "mean_feedback_forward_cosine": 0.9832355997779153, "mean_feedback_forward_relative_error": 0.17862626761198044, "min_feedback_forward_cosine": 0.9479833245277405 }, "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.159811972117424 }, { "epoch": 62, "eval_accuracy": 0.8828, "eval_loss": 0.4084390075683594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.31567618250846863, "mean_feedback_forward_cosine": 0.9843033476309343, "mean_feedback_forward_relative_error": 0.17278472164815123, "min_feedback_forward_cosine": 0.9511356353759766 }, "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.15469107734097376 }, { "epoch": 63, "eval_accuracy": 0.878, "eval_loss": 0.44356014404296873, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.30494773387908936, "mean_feedback_forward_cosine": 0.9853211641311646, "mean_feedback_forward_relative_error": 0.16705804108218714, "min_feedback_forward_cosine": 0.9543746709823608 }, "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.1573526954491933 }, { "epoch": 64, "eval_accuracy": 0.8818, "eval_loss": 0.4164936279296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.29509037733078003, "mean_feedback_forward_cosine": 0.9862557031891562, "mean_feedback_forward_relative_error": 0.16163663694804364, "min_feedback_forward_cosine": 0.9572689533233643 }, "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.15185034220880933 }, { "epoch": 65, "eval_accuracy": 0.8884, "eval_loss": 0.429320068359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.28480038046836853, "mean_feedback_forward_cosine": 0.9871627710082315, "mean_feedback_forward_relative_error": 0.15618729252706876, "min_feedback_forward_cosine": 0.9601784944534302 }, "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.15663046832614475 }, { "epoch": 66, "eval_accuracy": 0.8818, "eval_loss": 0.3846602600097656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.27500370144844055, "mean_feedback_forward_cosine": 0.9880119280381636, "mean_feedback_forward_relative_error": 0.15090371072292327, "min_feedback_forward_cosine": 0.9628419280052185 }, "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.152567342710495 }, { "epoch": 67, "eval_accuracy": 0.8742, "eval_loss": 0.4532151306152344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2653149366378784, "mean_feedback_forward_cosine": 0.9888372052799571, "mean_feedback_forward_relative_error": 0.14560815332965418, "min_feedback_forward_cosine": 0.9653981924057007 }, "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.15156706712577078 }, { "epoch": 68, "eval_accuracy": 0.8854, "eval_loss": 0.413903759765625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2560727298259735, "mean_feedback_forward_cosine": 0.9895687645131891, "mean_feedback_forward_relative_error": 0.1407341560179537, "min_feedback_forward_cosine": 0.9677327871322632 }, "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.15645641708903843 }, { "epoch": 69, "eval_accuracy": 0.8872, "eval_loss": 0.40043238525390623, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.24709388613700867, "mean_feedback_forward_cosine": 0.9902782396836715, "mean_feedback_forward_relative_error": 0.13584166609428144, "min_feedback_forward_cosine": 0.9699423909187317 }, "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.15490477414660983 }, { "epoch": 70, "eval_accuracy": 0.885, "eval_loss": 0.397725732421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.23907920718193054, "mean_feedback_forward_cosine": 0.9909099470485341, "mean_feedback_forward_relative_error": 0.13134042986414649, "min_feedback_forward_cosine": 0.9718361496925354 }, "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.1508726365831163 }, { "epoch": 71, "eval_accuracy": 0.8558, "eval_loss": 0.5760824829101563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2312377542257309, "mean_feedback_forward_cosine": 0.9915095892819491, "mean_feedback_forward_relative_error": 0.12692420821298253, "min_feedback_forward_cosine": 0.9736427068710327 }, "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.14491609041425918 }, { "epoch": 72, "eval_accuracy": 0.8696, "eval_loss": 0.458574853515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.22312340140342712, "mean_feedback_forward_cosine": 0.9920836979692632, "mean_feedback_forward_relative_error": 0.12254367403008722, "min_feedback_forward_cosine": 0.9754534363746643 }, "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.1479260725710127 }, { "epoch": 73, "eval_accuracy": 0.8892, "eval_loss": 0.40083897705078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.21591386198997498, "mean_feedback_forward_cosine": 0.9926146171309731, "mean_feedback_forward_relative_error": 0.11832766709002582, "min_feedback_forward_cosine": 0.976998507976532 }, "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.14577782358063593 }, { "epoch": 74, "eval_accuracy": 0.8836, "eval_loss": 0.4026210205078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.20882253348827362, "mean_feedback_forward_cosine": 0.9930870424617421, "mean_feedback_forward_relative_error": 0.11447676802900704, "min_feedback_forward_cosine": 0.9784666299819946 }, "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.14426382974121305 }, { "epoch": 75, "eval_accuracy": 0.883, "eval_loss": 0.42882922973632814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.20159201323986053, "mean_feedback_forward_cosine": 0.9935504837469621, "mean_feedback_forward_relative_error": 0.11056213744662025, "min_feedback_forward_cosine": 0.9799209237098694 }, "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.14628605412244797 }, { "epoch": 76, "eval_accuracy": 0.878, "eval_loss": 0.41888806762695313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1942160427570343, "mean_feedback_forward_cosine": 0.9940022219311108, "mean_feedback_forward_relative_error": 0.10662056024778974, "min_feedback_forward_cosine": 0.9813616275787354 }, "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.15107803481419882 }, { "epoch": 77, "eval_accuracy": 0.892, "eval_loss": 0.3812136474609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.18739287555217743, "mean_feedback_forward_cosine": 0.9944140856916254, "mean_feedback_forward_relative_error": 0.10289184376597404, "min_feedback_forward_cosine": 0.982636034488678 }, "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.145390626361635 }, { "epoch": 78, "eval_accuracy": 0.8826, "eval_loss": 0.4390092895507812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1810525357723236, "mean_feedback_forward_cosine": 0.9947815277359703, "mean_feedback_forward_relative_error": 0.0994456759230657, "min_feedback_forward_cosine": 0.9837870597839355 }, "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.14267062601778244 }, { "epoch": 79, "eval_accuracy": 0.8756, "eval_loss": 0.41855242919921876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1744450032711029, "mean_feedback_forward_cosine": 0.9951367963444103, "mean_feedback_forward_relative_error": 0.09600104195150462, "min_feedback_forward_cosine": 0.9849445819854736 }, "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.14812842531204223 }, { "epoch": 80, "eval_accuracy": 0.8682, "eval_loss": 0.4982807067871094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.16858580708503723, "mean_feedback_forward_cosine": 0.9954568223519759, "mean_feedback_forward_relative_error": 0.0927825734696605, "min_feedback_forward_cosine": 0.985930323600769 }, "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.14163471700880262 }, { "epoch": 81, "eval_accuracy": 0.8788, "eval_loss": 0.4318050842285156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1628764420747757, "mean_feedback_forward_cosine": 0.9957529859109359, "mean_feedback_forward_relative_error": 0.08970520404929465, "min_feedback_forward_cosine": 0.9868632555007935 }, "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.14164452673594158 }, { "epoch": 82, "eval_accuracy": 0.8824, "eval_loss": 0.4356259216308594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.15716975927352905, "mean_feedback_forward_cosine": 0.9960444970564408, "mean_feedback_forward_relative_error": 0.08655340471728282, "min_feedback_forward_cosine": 0.9877631068229675 }, "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.1429812172730764 }, { "epoch": 83, "eval_accuracy": 0.8834, "eval_loss": 0.4211099670410156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1516208052635193, "mean_feedback_forward_cosine": 0.996317475492304, "mean_feedback_forward_relative_error": 0.08351170965893702, "min_feedback_forward_cosine": 0.9886099696159363 }, "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.14329515885247124 }, { "epoch": 84, "eval_accuracy": 0.9018, "eval_loss": 0.35779424438476565, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14630314707756042, "mean_feedback_forward_cosine": 0.9965671257539229, "mean_feedback_forward_relative_error": 0.08063399812037295, "min_feedback_forward_cosine": 0.9893922805786133 }, "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.14221931150092018 }, { "epoch": 85, "eval_accuracy": 0.8702, "eval_loss": 0.4682876647949219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14148655533790588, "mean_feedback_forward_cosine": 0.9967920650135387, "mean_feedback_forward_relative_error": 0.0779483347792517, "min_feedback_forward_cosine": 0.9900739192962646 }, "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.137186794895596 }, { "epoch": 86, "eval_accuracy": 0.8932, "eval_loss": 0.3757369873046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1365615576505661, "mean_feedback_forward_cosine": 0.9970066233114763, "mean_feedback_forward_relative_error": 0.07529233558611437, "min_feedback_forward_cosine": 0.9907506704330444 }, "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.1364652813633283 }, { "epoch": 87, "eval_accuracy": 0.8844, "eval_loss": 0.4202875732421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.13171401619911194, "mean_feedback_forward_cosine": 0.9972147313031283, "mean_feedback_forward_relative_error": 0.07261722778732127, "min_feedback_forward_cosine": 0.9913944602012634 }, "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.14023481232060325 }, { "epoch": 88, "eval_accuracy": 0.8998, "eval_loss": 0.3637839233398438, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1271563023328781, "mean_feedback_forward_cosine": 0.997396829995242, "mean_feedback_forward_relative_error": 0.07020163962786848, "min_feedback_forward_cosine": 0.9919781684875488 }, "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.13764463415410783 }, { "epoch": 89, "eval_accuracy": 0.8942, "eval_loss": 0.37466764526367186, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.12278088927268982, "mean_feedback_forward_cosine": 0.9975727265531367, "mean_feedback_forward_relative_error": 0.06778270504014058, "min_feedback_forward_cosine": 0.9925185441970825 }, "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.13379682774146398 }, { "epoch": 90, "eval_accuracy": 0.8878, "eval_loss": 0.41289153442382814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11860892176628113, "mean_feedback_forward_cosine": 0.9977324615825306, "mean_feedback_forward_relative_error": 0.06551586030559106, "min_feedback_forward_cosine": 0.9930169582366943 }, "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.13367654723591274 }, { "epoch": 91, "eval_accuracy": 0.8796, "eval_loss": 0.4534392883300781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11397954821586609, "mean_feedback_forward_cosine": 0.9978942480954257, "mean_feedback_forward_relative_error": 0.06314405470409176, "min_feedback_forward_cosine": 0.9935492277145386 }, "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.1437890195131302 }, { "epoch": 92, "eval_accuracy": 0.877, "eval_loss": 0.4637198852539062, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11020797491073608, "mean_feedback_forward_cosine": 0.9980307849970731, "mean_feedback_forward_relative_error": 0.061057206615805625, "min_feedback_forward_cosine": 0.9939678311347961 }, "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.1297376984834671 }, { "epoch": 93, "eval_accuracy": 0.8974, "eval_loss": 0.38976353759765625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.10636366158723831, "mean_feedback_forward_cosine": 0.9981618870388378, "mean_feedback_forward_relative_error": 0.05898658186197281, "min_feedback_forward_cosine": 0.9943795204162598 }, "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.13253259558942582 }, { "epoch": 94, "eval_accuracy": 0.881, "eval_loss": 0.45050140991210935, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1024697870016098, "mean_feedback_forward_cosine": 0.9982858592813665, "mean_feedback_forward_relative_error": 0.05696909615600651, "min_feedback_forward_cosine": 0.9947818517684937 }, "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.13139092605246439 }, { "epoch": 95, "eval_accuracy": 0.884, "eval_loss": 0.42125306396484374, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09880731254816055, "mean_feedback_forward_cosine": 0.9984017632224343, "mean_feedback_forward_relative_error": 0.05500872118229216, "min_feedback_forward_cosine": 0.9951469302177429 }, "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.13053015309174856 }, { "epoch": 96, "eval_accuracy": 0.8994, "eval_loss": 0.37246392211914064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09534408897161484, "mean_feedback_forward_cosine": 0.9985089713876898, "mean_feedback_forward_relative_error": 0.053137221051888034, "min_feedback_forward_cosine": 0.9954792261123657 }, "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.13170791505177815 }, { "epoch": 97, "eval_accuracy": 0.8916, "eval_loss": 0.37829818115234376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09184065461158752, "mean_feedback_forward_cosine": 0.9986103144558993, "mean_feedback_forward_relative_error": 0.051301561533050107, "min_feedback_forward_cosine": 0.9958046674728394 }, "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.1322530888001124 }, { "epoch": 98, "eval_accuracy": 0.8822, "eval_loss": 0.44099720458984376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08854187279939651, "mean_feedback_forward_cosine": 0.9987025206739252, "mean_feedback_forward_relative_error": 0.04957084210420197, "min_feedback_forward_cosine": 0.9960996508598328 }, "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.1289476733631558 }, { "epoch": 99, "eval_accuracy": 0.898, "eval_loss": 0.3525207153320313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08554445952177048, "mean_feedback_forward_cosine": 0.9987886905670166, "mean_feedback_forward_relative_error": 0.047894603725184094, "min_feedback_forward_cosine": 0.9963589906692505 }, "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.1272515431880951 }, { "epoch": 100, "eval_accuracy": 0.8954, "eval_loss": 0.400292919921875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08254595100879669, "mean_feedback_forward_cosine": 0.9988718823953109, "mean_feedback_forward_relative_error": 0.04622269711372527, "min_feedback_forward_cosine": 0.9966089129447937 }, "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.1293600611527761 }, { "epoch": 101, "eval_accuracy": 0.9198, "eval_loss": 0.28196166381835935, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08252088725566864, "mean_feedback_forward_cosine": 0.9988725673068654, "mean_feedback_forward_relative_error": 0.04620732959698547, "min_feedback_forward_cosine": 0.9966108798980713 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.06943065629336569 }, { "epoch": 102, "eval_accuracy": 0.9222, "eval_loss": 0.28367977294921876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08251013606786728, "mean_feedback_forward_cosine": 0.9988728794184598, "mean_feedback_forward_relative_error": 0.04619971408762715, "min_feedback_forward_cosine": 0.9966118931770325 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.0442628238108423 }, { "epoch": 103, "eval_accuracy": 0.9236, "eval_loss": 0.27802401123046877, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08250072598457336, "mean_feedback_forward_cosine": 0.9988731460137801, "mean_feedback_forward_relative_error": 0.046192759241570125, "min_feedback_forward_cosine": 0.9966127872467041 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.03693747533584634 }, { "epoch": 104, "eval_accuracy": 0.925, "eval_loss": 0.2826873077392578, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0824924111366272, "mean_feedback_forward_cosine": 0.9988733931021256, "mean_feedback_forward_relative_error": 0.04618666246533394, "min_feedback_forward_cosine": 0.9966134428977966 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.030649015731364488 }, { "epoch": 105, "eval_accuracy": 0.9262, "eval_loss": 0.2913733154296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.082485131919384, "mean_feedback_forward_cosine": 0.9988736239346591, "mean_feedback_forward_relative_error": 0.04618093506856398, "min_feedback_forward_cosine": 0.9966140389442444 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.02735501567953163 }, { "epoch": 106, "eval_accuracy": 0.9246, "eval_loss": 0.2939286346435547, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08247771114110947, "mean_feedback_forward_cosine": 0.9988738623532382, "mean_feedback_forward_relative_error": 0.04617522387680682, "min_feedback_forward_cosine": 0.9966146349906921 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.024195579751663737 }, { "epoch": 107, "eval_accuracy": 0.9272, "eval_loss": 0.29316375732421873, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08247034251689911, "mean_feedback_forward_cosine": 0.9988740758462386, "mean_feedback_forward_relative_error": 0.046169685081324796, "min_feedback_forward_cosine": 0.9966151714324951 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.022561528134014873 }, { "epoch": 108, "eval_accuracy": 0.9244, "eval_loss": 0.30675077514648436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08246370404958725, "mean_feedback_forward_cosine": 0.9988743045113303, "mean_feedback_forward_relative_error": 0.04616451940753243, "min_feedback_forward_cosine": 0.9966158270835876 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.02048250459664398 }, { "epoch": 109, "eval_accuracy": 0.9252, "eval_loss": 0.3081547302246094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08245643228292465, "mean_feedback_forward_cosine": 0.9988745136694475, "mean_feedback_forward_relative_error": 0.04615932416848161, "min_feedback_forward_cosine": 0.9966166019439697 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.019332495719856686 }, { "epoch": 110, "eval_accuracy": 0.9258, "eval_loss": 0.3063327392578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08244861662387848, "mean_feedback_forward_cosine": 0.9988747369159352, "mean_feedback_forward_relative_error": 0.04615418922833421, "min_feedback_forward_cosine": 0.9966172575950623 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.018840931750006146 }, { "epoch": 111, "eval_accuracy": 0.926, "eval_loss": 0.30996431884765624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08244211226701736, "mean_feedback_forward_cosine": 0.9988749330694026, "mean_feedback_forward_relative_error": 0.04614953860979189, "min_feedback_forward_cosine": 0.9966177344322205 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.016484283983376292 }, { "epoch": 112, "eval_accuracy": 0.9262, "eval_loss": 0.31271492309570315, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0824364498257637, "mean_feedback_forward_cosine": 0.9988750945438039, "mean_feedback_forward_relative_error": 0.04614522804252126, "min_feedback_forward_cosine": 0.9966182708740234 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.014451664542489582 }, { "epoch": 113, "eval_accuracy": 0.926, "eval_loss": 0.322545263671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08243008702993393, "mean_feedback_forward_cosine": 0.9988752787763422, "mean_feedback_forward_relative_error": 0.04614073788239197, "min_feedback_forward_cosine": 0.9966187477111816 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.01427282026078966 }, { "epoch": 114, "eval_accuracy": 0.9246, "eval_loss": 0.32204202270507815, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08242438733577728, "mean_feedback_forward_cosine": 0.9988754662600431, "mean_feedback_forward_relative_error": 0.04613645566119389, "min_feedback_forward_cosine": 0.9966192245483398 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.01288464905437496 }, { "epoch": 115, "eval_accuracy": 0.9238, "eval_loss": 0.32415628662109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08241870999336243, "mean_feedback_forward_cosine": 0.9988756277344444, "mean_feedback_forward_relative_error": 0.046132276952266696, "min_feedback_forward_cosine": 0.996619701385498 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.012184910022715727 }, { "epoch": 116, "eval_accuracy": 0.927, "eval_loss": 0.32800870971679685, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0824129655957222, "mean_feedback_forward_cosine": 0.9988758065483787, "mean_feedback_forward_relative_error": 0.0461282127621499, "min_feedback_forward_cosine": 0.9966202974319458 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.011643429762952857 }, { "epoch": 117, "eval_accuracy": 0.9266, "eval_loss": 0.3297094970703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08240707963705063, "mean_feedback_forward_cosine": 0.9988759918646379, "mean_feedback_forward_relative_error": 0.04612408006055788, "min_feedback_forward_cosine": 0.996620774269104 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.011566649926371044 }, { "epoch": 118, "eval_accuracy": 0.9274, "eval_loss": 0.33520316162109376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0824013203382492, "mean_feedback_forward_cosine": 0.9988761804320595, "mean_feedback_forward_relative_error": 0.04611968616531654, "min_feedback_forward_cosine": 0.996621310710907 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.01146308294420855 }, { "epoch": 119, "eval_accuracy": 0.9252, "eval_loss": 0.3379811279296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08239556103944778, "mean_feedback_forward_cosine": 0.9988763310692527, "mean_feedback_forward_relative_error": 0.04611563034016978, "min_feedback_forward_cosine": 0.9966216087341309 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.010218534137308598 }, { "epoch": 120, "eval_accuracy": 0.9264, "eval_loss": 0.33973890380859373, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08238988369703293, "mean_feedback_forward_cosine": 0.9988765250552785, "mean_feedback_forward_relative_error": 0.04611164289103313, "min_feedback_forward_cosine": 0.9966222047805786 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.00960727816954669 }, { "epoch": 121, "eval_accuracy": 0.9266, "eval_loss": 0.34343662719726564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08238489925861359, "mean_feedback_forward_cosine": 0.998876690864563, "mean_feedback_forward_relative_error": 0.046107920445501806, "min_feedback_forward_cosine": 0.9966225624084473 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.009085430883988738 }, { "epoch": 122, "eval_accuracy": 0.9246, "eval_loss": 0.34254222412109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08237940073013306, "mean_feedback_forward_cosine": 0.9988768653436141, "mean_feedback_forward_relative_error": 0.04610400257462805, "min_feedback_forward_cosine": 0.996623158454895 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.008975493807718157 }, { "epoch": 123, "eval_accuracy": 0.9276, "eval_loss": 0.34295497436523437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0823746845126152, "mean_feedback_forward_cosine": 0.9988770127296448, "mean_feedback_forward_relative_error": 0.04610043037682772, "min_feedback_forward_cosine": 0.9966235756874084 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.008150759787774749 }, { "epoch": 124, "eval_accuracy": 0.9246, "eval_loss": 0.3488459045410156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08236976712942123, "mean_feedback_forward_cosine": 0.998877163366838, "mean_feedback_forward_relative_error": 0.04609683183106509, "min_feedback_forward_cosine": 0.9966238737106323 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.008191198907544215 }, { "epoch": 125, "eval_accuracy": 0.9276, "eval_loss": 0.34850970458984376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08236398547887802, "mean_feedback_forward_cosine": 0.9988773215900768, "mean_feedback_forward_relative_error": 0.0460928878154267, "min_feedback_forward_cosine": 0.9966244101524353 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.008717926258511014 }, { "epoch": 126, "eval_accuracy": 0.9266, "eval_loss": 0.3463415405273437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08235813677310944, "mean_feedback_forward_cosine": 0.9988774852319198, "mean_feedback_forward_relative_error": 0.04608909797600724, "min_feedback_forward_cosine": 0.9966248273849487 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.008424199743734465 }, { "epoch": 127, "eval_accuracy": 0.9242, "eval_loss": 0.3489424072265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08235276490449905, "mean_feedback_forward_cosine": 0.9988776391202753, "mean_feedback_forward_relative_error": 0.046085428514263845, "min_feedback_forward_cosine": 0.9966253042221069 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.00735124247815046 }, { "epoch": 128, "eval_accuracy": 0.9268, "eval_loss": 0.3469889953613281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08234743773937225, "mean_feedback_forward_cosine": 0.9988778103481639, "mean_feedback_forward_relative_error": 0.04608147801323371, "min_feedback_forward_cosine": 0.9966257810592651 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.0076482207431561415 }, { "epoch": 129, "eval_accuracy": 0.9268, "eval_loss": 0.3487642822265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08234293758869171, "mean_feedback_forward_cosine": 0.9988779599016363, "mean_feedback_forward_relative_error": 0.04607815569774671, "min_feedback_forward_cosine": 0.9966261386871338 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.006547223501776655 }, { "epoch": 130, "eval_accuracy": 0.9266, "eval_loss": 0.35033135986328123, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08233887702226639, "mean_feedback_forward_cosine": 0.9988781018690629, "mean_feedback_forward_relative_error": 0.04607508634640412, "min_feedback_forward_cosine": 0.9966265559196472 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.006076416883534855 }, { "epoch": 131, "eval_accuracy": 0.9282, "eval_loss": 0.35761566162109376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08233317732810974, "mean_feedback_forward_cosine": 0.998878276348114, "mean_feedback_forward_relative_error": 0.04607112404297699, "min_feedback_forward_cosine": 0.9966269731521606 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.007004095608658261 }, { "epoch": 132, "eval_accuracy": 0.9256, "eval_loss": 0.35786424560546876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08232785016298294, "mean_feedback_forward_cosine": 0.9988784291527488, "mean_feedback_forward_relative_error": 0.046067386340688576, "min_feedback_forward_cosine": 0.9966274499893188 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.00657963326341576 }, { "epoch": 133, "eval_accuracy": 0.927, "eval_loss": 0.3533356994628906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08232413232326508, "mean_feedback_forward_cosine": 0.9988785591992465, "mean_feedback_forward_relative_error": 0.04606463924388994, "min_feedback_forward_cosine": 0.996627688407898 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.005323932779717466 }, { "epoch": 134, "eval_accuracy": 0.9276, "eval_loss": 0.35352208251953127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08231943100690842, "mean_feedback_forward_cosine": 0.9988786946643483, "mean_feedback_forward_relative_error": 0.04606130861423232, "min_feedback_forward_cosine": 0.9966281056404114 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.005774464671355155 }, { "epoch": 135, "eval_accuracy": 0.927, "eval_loss": 0.3579586608886719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08231444656848907, "mean_feedback_forward_cosine": 0.9988788355480541, "mean_feedback_forward_relative_error": 0.046057646366005595, "min_feedback_forward_cosine": 0.9966285228729248 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.006122449112104045 }, { "epoch": 136, "eval_accuracy": 0.9266, "eval_loss": 0.3627355712890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08231008797883987, "mean_feedback_forward_cosine": 0.9988789666782726, "mean_feedback_forward_relative_error": 0.046054657260802656, "min_feedback_forward_cosine": 0.9966288805007935 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.005008096188720729 }, { "epoch": 137, "eval_accuracy": 0.9254, "eval_loss": 0.36479898681640627, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08230576664209366, "mean_feedback_forward_cosine": 0.9988791205666282, "mean_feedback_forward_relative_error": 0.04605141476812688, "min_feedback_forward_cosine": 0.9966292381286621 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.00519936425000843 }, { "epoch": 138, "eval_accuracy": 0.9272, "eval_loss": 0.36759619140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08230125904083252, "mean_feedback_forward_cosine": 0.9988792657852172, "mean_feedback_forward_relative_error": 0.04604820312762802, "min_feedback_forward_cosine": 0.9966295957565308 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.005097926148772239 }, { "epoch": 139, "eval_accuracy": 0.928, "eval_loss": 0.367848046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08229579031467438, "mean_feedback_forward_cosine": 0.9988794348456643, "mean_feedback_forward_relative_error": 0.04604436362331564, "min_feedback_forward_cosine": 0.9966301321983337 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.00578090578098264 }, { "epoch": 140, "eval_accuracy": 0.9258, "eval_loss": 0.3670384765625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08228998631238937, "mean_feedback_forward_cosine": 0.9988796158270402, "mean_feedback_forward_relative_error": 0.04604042116552591, "min_feedback_forward_cosine": 0.9966304898262024 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.005641720619507962 }, { "epoch": 141, "eval_accuracy": 0.9266, "eval_loss": 0.36997833251953127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08228462934494019, "mean_feedback_forward_cosine": 0.998879792473533, "mean_feedback_forward_relative_error": 0.04603636854074218, "min_feedback_forward_cosine": 0.9966309070587158 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.0057345138311800025 }, { "epoch": 142, "eval_accuracy": 0.9278, "eval_loss": 0.36403873291015626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08227932453155518, "mean_feedback_forward_cosine": 0.998879955031655, "mean_feedback_forward_relative_error": 0.046032756346870554, "min_feedback_forward_cosine": 0.9966314435005188 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.004907455729775958 }, { "epoch": 143, "eval_accuracy": 0.928, "eval_loss": 0.36518594360351564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08227457106113434, "mean_feedback_forward_cosine": 0.9988800861618735, "mean_feedback_forward_relative_error": 0.046029586328024216, "min_feedback_forward_cosine": 0.9966318607330322 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.004633074706503087 }, { "epoch": 144, "eval_accuracy": 0.9288, "eval_loss": 0.36308513793945313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822695642709732, "mean_feedback_forward_cosine": 0.9988802649758078, "mean_feedback_forward_relative_error": 0.04602613601494919, "min_feedback_forward_cosine": 0.9966320991516113 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.004616090032748051 }, { "epoch": 145, "eval_accuracy": 0.928, "eval_loss": 0.3633923767089844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08226427435874939, "mean_feedback_forward_cosine": 0.998880432952534, "mean_feedback_forward_relative_error": 0.04602236039936543, "min_feedback_forward_cosine": 0.9966326951980591 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.005115178668167856 }, { "epoch": 146, "eval_accuracy": 0.9282, "eval_loss": 0.3682091247558594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822596624493599, "mean_feedback_forward_cosine": 0.9988805814222856, "mean_feedback_forward_relative_error": 0.0460187761282379, "min_feedback_forward_cosine": 0.9966330528259277 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.004550867236633268 }, { "epoch": 147, "eval_accuracy": 0.927, "eval_loss": 0.3651136474609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08225411176681519, "mean_feedback_forward_cosine": 0.99888076023622, "mean_feedback_forward_relative_error": 0.04601478727365082, "min_feedback_forward_cosine": 0.9966334700584412 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.004593415929294295 }, { "epoch": 148, "eval_accuracy": 0.9262, "eval_loss": 0.3646269836425781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08224842697381973, "mean_feedback_forward_cosine": 0.9988809282129462, "mean_feedback_forward_relative_error": 0.046011200902814214, "min_feedback_forward_cosine": 0.9966338872909546 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.004782757617574599 }, { "epoch": 149, "eval_accuracy": 0.9272, "eval_loss": 0.365397119140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822431892156601, "mean_feedback_forward_cosine": 0.9988811276175759, "mean_feedback_forward_relative_error": 0.04600701702928001, "min_feedback_forward_cosine": 0.9966343641281128 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.004701021136467655 }, { "epoch": 150, "eval_accuracy": 0.9304, "eval_loss": 0.3664459228515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223860710859299, "mean_feedback_forward_cosine": 0.9988812652501193, "mean_feedback_forward_relative_error": 0.0460035984150388, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.004233766572032538 }, { "epoch": 151, "eval_accuracy": 0.9292, "eval_loss": 0.36865162353515624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223855495452881, "mean_feedback_forward_cosine": 0.9988812836733731, "mean_feedback_forward_relative_error": 0.046003527346659794, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.0036866345710224574 }, { "epoch": 152, "eval_accuracy": 0.93, "eval_loss": 0.36565570068359377, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223850280046463, "mean_feedback_forward_cosine": 0.9988812869245356, "mean_feedback_forward_relative_error": 0.046003469282930545, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.003957245495936109 }, { "epoch": 153, "eval_accuracy": 0.929, "eval_loss": 0.3695786437988281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223845064640045, "mean_feedback_forward_cosine": 0.9988812869245356, "mean_feedback_forward_relative_error": 0.04600340781564062, "min_feedback_forward_cosine": 0.9966347813606262 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.003925301420285056 }, { "epoch": 154, "eval_accuracy": 0.9302, "eval_loss": 0.36479189453125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223842084407806, "mean_feedback_forward_cosine": 0.998881278254769, "mean_feedback_forward_relative_error": 0.046003351631489664, "min_feedback_forward_cosine": 0.9966347813606262 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.0035732608032723267 }, { "epoch": 155, "eval_accuracy": 0.9302, "eval_loss": 0.3620485961914062, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223836869001389, "mean_feedback_forward_cosine": 0.9988812825896524, "mean_feedback_forward_relative_error": 0.04600329211151058, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.0037292424756826628 }, { "epoch": 156, "eval_accuracy": 0.9308, "eval_loss": 0.3636377868652344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822383388876915, "mean_feedback_forward_cosine": 0.9988812825896524, "mean_feedback_forward_relative_error": 0.046003235639496286, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.0035863490228851638 }, { "epoch": 157, "eval_accuracy": 0.93, "eval_loss": 0.36617817993164065, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223830908536911, "mean_feedback_forward_cosine": 0.9988812869245356, "mean_feedback_forward_relative_error": 0.04600318036973476, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.0034266716464733085 }, { "epoch": 158, "eval_accuracy": 0.9284, "eval_loss": 0.36658130493164065, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223827183246613, "mean_feedback_forward_cosine": 0.9988812825896524, "mean_feedback_forward_relative_error": 0.04600312345745888, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.0035902588734713693 }, { "epoch": 159, "eval_accuracy": 0.93, "eval_loss": 0.3643918701171875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223822712898254, "mean_feedback_forward_cosine": 0.998881290175698, "mean_feedback_forward_relative_error": 0.04600307231938297, "min_feedback_forward_cosine": 0.9966347813606262 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.003073369382456359 }, { "epoch": 160, "eval_accuracy": 0.9296, "eval_loss": 0.3648558898925781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223821222782135, "mean_feedback_forward_cosine": 0.998881290175698, "mean_feedback_forward_relative_error": 0.04600302441553636, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.0029175158710322445 }, { "epoch": 161, "eval_accuracy": 0.9304, "eval_loss": 0.367481298828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223816752433777, "mean_feedback_forward_cosine": 0.9988812869245356, "mean_feedback_forward_relative_error": 0.04600296841764992, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.0034142314993465942 }, { "epoch": 162, "eval_accuracy": 0.9284, "eval_loss": 0.3675195251464844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223813772201538, "mean_feedback_forward_cosine": 0.9988812934268605, "mean_feedback_forward_relative_error": 0.04600291731344028, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.0030324965446359583 }, { "epoch": 163, "eval_accuracy": 0.9292, "eval_loss": 0.36677179565429685, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822380930185318, "mean_feedback_forward_cosine": 0.998881302096627, "mean_feedback_forward_relative_error": 0.04600286566737023, "min_feedback_forward_cosine": 0.9966347217559814 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.0034874971714284686 }, { "epoch": 164, "eval_accuracy": 0.9286, "eval_loss": 0.36896765747070315, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223806321620941, "mean_feedback_forward_cosine": 0.998881302096627, "mean_feedback_forward_relative_error": 0.046002815003422175, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.0029989460522101986 }, { "epoch": 165, "eval_accuracy": 0.9306, "eval_loss": 0.366157421875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223803341388702, "mean_feedback_forward_cosine": 0.9988813031803477, "mean_feedback_forward_relative_error": 0.04600276467813687, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.0031791578263044356 }, { "epoch": 166, "eval_accuracy": 0.9296, "eval_loss": 0.3687070068359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223800361156464, "mean_feedback_forward_cosine": 0.9988812880082564, "mean_feedback_forward_relative_error": 0.0460027188570662, "min_feedback_forward_cosine": 0.9966347813606262 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.002584952381066978 }, { "epoch": 167, "eval_accuracy": 0.93, "eval_loss": 0.3658307983398438, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223797380924225, "mean_feedback_forward_cosine": 0.9988812923431396, "mean_feedback_forward_relative_error": 0.04600266805765304, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.0029853353516198695 }, { "epoch": 168, "eval_accuracy": 0.9294, "eval_loss": 0.36633271484375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223794400691986, "mean_feedback_forward_cosine": 0.9988813064315102, "mean_feedback_forward_relative_error": 0.04600261669944633, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.0029499868230480285 }, { "epoch": 169, "eval_accuracy": 0.9298, "eval_loss": 0.36940147705078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223791420459747, "mean_feedback_forward_cosine": 0.9988812934268605, "mean_feedback_forward_relative_error": 0.046002566916021434, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.002881501671630475 }, { "epoch": 170, "eval_accuracy": 0.9294, "eval_loss": 0.369974560546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822378620505333, "mean_feedback_forward_cosine": 0.9988812999291854, "mean_feedback_forward_relative_error": 0.04600251288237897, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.0030441269177322585 }, { "epoch": 171, "eval_accuracy": 0.9282, "eval_loss": 0.36931307983398437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223782479763031, "mean_feedback_forward_cosine": 0.9988813096826726, "mean_feedback_forward_relative_error": 0.04600245668129487, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.0033884187957892815 }, { "epoch": 172, "eval_accuracy": 0.9286, "eval_loss": 0.36912783813476563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223780989646912, "mean_feedback_forward_cosine": 0.9988813031803477, "mean_feedback_forward_relative_error": 0.04600240898064591, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.0030959877320668764 }, { "epoch": 173, "eval_accuracy": 0.929, "eval_loss": 0.36873092041015626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223778009414673, "mean_feedback_forward_cosine": 0.9988813042640686, "mean_feedback_forward_relative_error": 0.04600236126306382, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.0028156025466819605 }, { "epoch": 174, "eval_accuracy": 0.9298, "eval_loss": 0.36716961669921877, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223774284124374, "mean_feedback_forward_cosine": 0.9988812934268605, "mean_feedback_forward_relative_error": 0.04600231291895563, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.0027567072859654824 }, { "epoch": 175, "eval_accuracy": 0.9292, "eval_loss": 0.3688115600585937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223771303892136, "mean_feedback_forward_cosine": 0.9988813085989519, "mean_feedback_forward_relative_error": 0.04600225873291493, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.003222914586795701 }, { "epoch": 176, "eval_accuracy": 0.9296, "eval_loss": 0.36736928100585936, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223768323659897, "mean_feedback_forward_cosine": 0.9988813031803477, "mean_feedback_forward_relative_error": 0.04600221047347242, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.0028732660255498354 }, { "epoch": 177, "eval_accuracy": 0.9294, "eval_loss": 0.372470849609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223765343427658, "mean_feedback_forward_cosine": 0.9988813107663935, "mean_feedback_forward_relative_error": 0.04600216378881173, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.0025538987044348483 }, { "epoch": 178, "eval_accuracy": 0.9284, "eval_loss": 0.36910101928710937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822376236319542, "mean_feedback_forward_cosine": 0.9988813064315102, "mean_feedback_forward_relative_error": 0.04600211475044489, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.002970595129744874 }, { "epoch": 179, "eval_accuracy": 0.9298, "eval_loss": 0.37037894287109374, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822376161813736, "mean_feedback_forward_cosine": 0.998881314017556, "mean_feedback_forward_relative_error": 0.046002069691365416, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.0025246295870385237 }, { "epoch": 180, "eval_accuracy": 0.9294, "eval_loss": 0.36845943603515624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223757892847061, "mean_feedback_forward_cosine": 0.9988813075152311, "mean_feedback_forward_relative_error": 0.0460020206191323, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.002713063888189693 }, { "epoch": 181, "eval_accuracy": 0.9286, "eval_loss": 0.3703472412109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223755657672882, "mean_feedback_forward_cosine": 0.9988813118501143, "mean_feedback_forward_relative_error": 0.04600197120823644, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.0025600299073590175 }, { "epoch": 182, "eval_accuracy": 0.9292, "eval_loss": 0.3755940856933594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223753422498703, "mean_feedback_forward_cosine": 0.9988812988454645, "mean_feedback_forward_relative_error": 0.0460019274699417, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.0027186543648027714 }, { "epoch": 183, "eval_accuracy": 0.9292, "eval_loss": 0.3694640441894531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223750442266464, "mean_feedback_forward_cosine": 0.9988813085989519, "mean_feedback_forward_relative_error": 0.04600187953222882, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.0028076297329221334 }, { "epoch": 184, "eval_accuracy": 0.9292, "eval_loss": 0.3719008056640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223746716976166, "mean_feedback_forward_cosine": 0.9988813118501143, "mean_feedback_forward_relative_error": 0.046001831357452005, "min_feedback_forward_cosine": 0.9966347813606262 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.00280507246243457 }, { "epoch": 185, "eval_accuracy": 0.9292, "eval_loss": 0.3697983947753906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223744481801987, "mean_feedback_forward_cosine": 0.9988813129338351, "mean_feedback_forward_relative_error": 0.046001782928678125, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.002665952594392002 }, { "epoch": 186, "eval_accuracy": 0.9294, "eval_loss": 0.3683447998046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223741501569748, "mean_feedback_forward_cosine": 0.9988813216036017, "mean_feedback_forward_relative_error": 0.04600173328071833, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.0028820886498110163 }, { "epoch": 187, "eval_accuracy": 0.9282, "eval_loss": 0.37149351806640624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223740011453629, "mean_feedback_forward_cosine": 0.9988813172687184, "mean_feedback_forward_relative_error": 0.04600168620659546, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.00259548195157614 }, { "epoch": 188, "eval_accuracy": 0.9298, "eval_loss": 0.37394226684570314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822373703122139, "mean_feedback_forward_cosine": 0.9988813085989519, "mean_feedback_forward_relative_error": 0.0460016364401037, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.0025710957238243687 }, { "epoch": 189, "eval_accuracy": 0.9294, "eval_loss": 0.3728668823242188, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223734050989151, "mean_feedback_forward_cosine": 0.9988813161849975, "mean_feedback_forward_relative_error": 0.04600158809599551, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.002441268061970671 }, { "epoch": 190, "eval_accuracy": 0.9278, "eval_loss": 0.37325433959960935, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223730325698853, "mean_feedback_forward_cosine": 0.9988813237710432, "mean_feedback_forward_relative_error": 0.04600153495980935, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.0030400358228633803 }, { "epoch": 191, "eval_accuracy": 0.929, "eval_loss": 0.3715138000488281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223726600408554, "mean_feedback_forward_cosine": 0.9988813443617387, "mean_feedback_forward_relative_error": 0.04600149122151462, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.0025101503582723025 }, { "epoch": 192, "eval_accuracy": 0.9292, "eval_loss": 0.3713754638671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223722875118256, "mean_feedback_forward_cosine": 0.9988813129338351, "mean_feedback_forward_relative_error": 0.04600143927064809, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.0031009860323948993 }, { "epoch": 193, "eval_accuracy": 0.9292, "eval_loss": 0.3713826843261719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223719894886017, "mean_feedback_forward_cosine": 0.9988813270222057, "mean_feedback_forward_relative_error": 0.046001392823051324, "min_feedback_forward_cosine": 0.996634840965271 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.0025039921342084807 }, { "epoch": 194, "eval_accuracy": 0.9298, "eval_loss": 0.3682757446289063, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223717659711838, "mean_feedback_forward_cosine": 0.9988813324408098, "mean_feedback_forward_relative_error": 0.046001344089480964, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.002788148091774848 }, { "epoch": 195, "eval_accuracy": 0.9296, "eval_loss": 0.37077115478515627, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0822371393442154, "mean_feedback_forward_cosine": 0.9988813226873224, "mean_feedback_forward_relative_error": 0.046001296236433765, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.002563142611583074 }, { "epoch": 196, "eval_accuracy": 0.9296, "eval_loss": 0.37052415771484376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223710209131241, "mean_feedback_forward_cosine": 0.9988813378594138, "mean_feedback_forward_relative_error": 0.04600124660540711, "min_feedback_forward_cosine": 0.9966350197792053 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.0027777536426153446 }, { "epoch": 197, "eval_accuracy": 0.929, "eval_loss": 0.36994708862304687, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223707228899002, "mean_feedback_forward_cosine": 0.9988813497803428, "mean_feedback_forward_relative_error": 0.04600120046260682, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.0028230392361473706 }, { "epoch": 198, "eval_accuracy": 0.9292, "eval_loss": 0.3723174560546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223704993724823, "mean_feedback_forward_cosine": 0.9988813291896473, "mean_feedback_forward_relative_error": 0.04600115440447222, "min_feedback_forward_cosine": 0.9966349005699158 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.0022861307460400795 }, { "epoch": 199, "eval_accuracy": 0.9296, "eval_loss": 0.36884978637695315, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223701268434525, "mean_feedback_forward_cosine": 0.9988813216036017, "mean_feedback_forward_relative_error": 0.046001107211817396, "min_feedback_forward_cosine": 0.9966349601745605 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.0030935465381791193 }, { "epoch": 200, "eval_accuracy": 0.9274, "eval_loss": 0.3740764099121094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08223697543144226, "mean_feedback_forward_cosine": 0.9988813335245306, "mean_feedback_forward_relative_error": 0.04600105993449688, "min_feedback_forward_cosine": 0.9966350197792053 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.002820015812975665 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.9274, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.3740764099121094, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 3256025088, "peak_memory_reserved_bytes": 4517265408, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 60.171127796173096, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 5054.333840370178, "train_wall_s": 4991.6432955265045 }, "work": { "apical_macs_per_example": 125043328, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 1125389952000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 1125389952000000, "local_weight_correlation_macs": 1129371264000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 1129371264000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 125485696, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 4509522432000000 } }