{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 9, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 56, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 848512, "fixed_traffic_coefficients": 0, "forward_parameters": 853018, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 56, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "hfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-fa-d56-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.08863549338032801, "feedback_forward_cosine": [ 0.0882125198841095, 0.17185500264167786, 0.10954485088586807, 0.2577724754810333, 0.0751032680273056, 0.23121197521686554, 0.030148033052682877, 0.26019108295440674, 0.050409719347953796, 0.19008716940879822, 0.0399165078997612, 0.21744656562805176, 0.0001835389994084835, 0.1896965205669403, 0.005662070121616125, 0.20933006703853607, 0.01125209592282772, 0.1695132851600647, 0.017937814816832542, 0.1433870494365692, 0.013061119243502617, 0.1942385882139206, 0.005128783639520407, 0.2021099328994751, -0.0006857686676084995, 0.20494231581687927, 0.0395386703312397, 0.1583186686038971, 0.016033835709095, 0.18731288611888885, 0.021174851804971695, 0.16396485269069672, 0.030186234042048454, 0.1645135134458542, 0.007649475708603859, 0.15658310055732727, 0.011635647155344486, 0.1251221001148224, -0.008313348516821861, 0.15915539860725403, -0.0014332830905914307, 0.1680000275373459, 0.011308528482913971, 0.16522729396820068, 0.006545661482959986, 0.15889963507652283, 0.006269207689911127, 0.17684805393218994, 0.006641895975917578, 0.15410152077674866, 0.01070297509431839, 0.15132766962051392, 0.00690346397459507, 0.13190671801567078, 0.6286851167678833 ], "feedback_forward_norm_ratio": [ 1.6574243307113647, 1.1986840963363647, 1.6578441858291626, 1.143052101135254, 2.059192657470703, 1.446895956993103, 2.117647409439087, 1.6426010131835938, 2.1686482429504395, 1.708986520767212, 2.569164752960205, 2.15853214263916, 2.5361809730529785, 1.9963648319244385, 2.6983582973480225, 2.1399641036987305, 3.1610701084136963, 2.68005633354187, 2.4815921783447266, 1.5921815633773804, 2.099860191345215, 1.5018749237060547, 2.329667568206787, 1.6975750923156738, 2.184513807296753, 1.6134381294250488, 2.444791316986084, 1.7782717943191528, 2.475090503692627, 1.9780645370483398, 2.562943935394287, 1.9800993204116821, 2.487797498703003, 1.9621620178222656, 2.9988152980804443, 2.466535806655884, 2.4743497371673584, 1.2880759239196777, 1.9693315029144287, 1.1085004806518555, 1.9485834836959839, 1.1041178703308105, 1.955966830253601, 1.1079226732254028, 1.9907394647598267, 1.2147018909454346, 2.0718092918395996, 1.319077968597412, 2.0721075534820557, 1.3644046783447266, 2.153334856033325, 1.4132341146469116, 2.29006028175354, 1.3792732954025269, 0.112843818962574 ], "feedback_forward_relative_error": [ 1.8586674928665161, 1.4229700565338135, 1.8398997783660889, 1.3104478120803833, 2.220578908920288, 1.5570577383041382, 2.3144640922546387, 1.6862257719039917, 2.3418779373168945, 1.8085689544677734, 2.7194676399230957, 2.172678232192993, 2.7260379791259766, 2.0562262535095215, 2.872382402420044, 2.1641461849212646, 3.3047280311584473, 2.6970527172088623, 2.6588101387023926, 1.7545499801635742, 2.3139920234680176, 1.6346817016601562, 2.5305044651031494, 1.787615180015564, 2.4031431674957275, 1.7151849269866943, 2.6045494079589844, 1.8971514701843262, 2.654562473297119, 2.0424752235412598, 2.73132586479187, 2.06675124168396, 2.6531007289886475, 2.0504820346832275, 3.1538889408111572, 2.512242555618286, 2.6579737663269043, 1.5286616086959839, 2.2160797119140625, 1.369644284248352, 2.1914751529693604, 1.3594456911087036, 2.1866798400878906, 1.3643220663070679, 2.2219321727752686, 1.4454996585845947, 2.2948672771453857, 1.507784366607666, 2.294799327850342, 1.5623975992202759, 2.36447811126709, 1.6029685735702515, 2.4925405979156494, 1.5932745933532715, 0.9331920146942139 ], "innovation_negative_gradient_cosine": [ 0.008553816005587578, 0.025900859385728836, 0.0376245342195034, 0.03193657472729683, 0.09551645815372467, 0.039293598383665085, 0.13530397415161133, 0.04041023924946785, 0.158193439245224, 0.035545770078897476, 0.17993035912513733, 0.04054297134280205, 0.19581130146980286, 0.04374796524643898, 0.21109670400619507, 0.04255548119544983, 0.22164040803909302, 0.05183442682027817, 0.224349245429039, 0.04830259829759598, 0.26252907514572144, 0.06813947856426239, 0.2766053080558777, 0.07549480348825455, 0.29249435663223267, 0.09466566145420074, 0.3062906861305237, 0.04542122036218643, 0.31328457593917847, 0.07723840326070786, 0.3224060535430908, 0.04863288253545761, 0.327239990234375, 0.04049643874168396, 0.3324066400527954, 0.08639751374721527, 0.3271884620189667, 0.06347719579935074, 0.39523422718048096, 0.04708479344844818, 0.4143325090408325, 0.06797029078006744, 0.42466670274734497, 0.08129915595054626, 0.44150951504707336, 0.07288248836994171, 0.44816941022872925, 0.15117616951465607, 0.4542672038078308, 0.14126504957675934, 0.4803707003593445, 0.19390016794204712, 0.4851304888725281, 0.22901073098182678, 0.6826860904693604 ], "mean_feedback_forward_cosine": 0.11095394464209676, "mean_feedback_forward_relative_error": 2.098663744059476, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.008553816005587578, 0.025900859385728836, 0.0376245342195034, 0.03193657472729683, 0.09551645815372467, 0.039293598383665085, 0.13530397415161133, 0.04041023924946785, 0.158193439245224, 0.035545770078897476, 0.17993035912513733, 0.04054297134280205, 0.19581130146980286, 0.04374796524643898, 0.21109670400619507, 0.04255548119544983, 0.22164040803909302, 0.05183442682027817, 0.224349245429039, 0.04830259829759598, 0.26252907514572144, 0.06813947856426239, 0.2766053080558777, 0.07549480348825455, 0.29249435663223267, 0.09466566145420074, 0.3062906861305237, 0.04542122036218643, 0.31328457593917847, 0.07723840326070786, 0.3224060535430908, 0.04863288253545761, 0.327239990234375, 0.04049643874168396, 0.3324066400527954, 0.08639751374721527, 0.3271884620189667, 0.06347719579935074, 0.39523422718048096, 0.04708479344844818, 0.4143325090408325, 0.06797029078006744, 0.42466670274734497, 0.08129915595054626, 0.44150951504707336, 0.07288248836994171, 0.44816941022872925, 0.15117616951465607, 0.4542672038078308, 0.14126504957675934, 0.4803707003593445, 0.19390016794204712, 0.4851304888725281, 0.22901073098182678, 0.6826860904693604 ], "teaching_negative_gradient_cosine": [ 0.008553816005587578, 0.025900859385728836, 0.0376245342195034, 0.03193657472729683, 0.09551645815372467, 0.039293598383665085, 0.13530397415161133, 0.04041023924946785, 0.158193439245224, 0.035545770078897476, 0.17993035912513733, 0.04054297134280205, 0.19581130146980286, 0.04374796524643898, 0.21109670400619507, 0.04255548119544983, 0.22164040803909302, 0.05183442682027817, 0.224349245429039, 0.04830259829759598, 0.26252907514572144, 0.06813947856426239, 0.2766053080558777, 0.07549480348825455, 0.29249435663223267, 0.09466566145420074, 0.3062906861305237, 0.04542122036218643, 0.31328457593917847, 0.07723840326070786, 0.3224060535430908, 0.04863288253545761, 0.327239990234375, 0.04049643874168396, 0.3324066400527954, 0.08639751374721527, 0.3271884620189667, 0.06347719579935074, 0.39523422718048096, 0.04708479344844818, 0.4143325090408325, 0.06797029078006744, 0.42466670274734497, 0.08129915595054626, 0.44150951504707336, 0.07288248836994171, 0.44816941022872925, 0.15117616951465607, 0.4542672038078308, 0.14126504957675934, 0.4803707003593445, 0.19390016794204712, 0.4851304888725281, 0.22901073098182678, 0.6826860904693604 ], "wall_s": 0.5787839889526367 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.2598, "eval_loss": 2.63627958984375, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.7094667250739204 }, { "epoch": 2, "eval_accuracy": 0.244, "eval_loss": 8.75294052734375, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 7.502461778089735 }, { "epoch": 3, "eval_accuracy": 0.248, "eval_loss": 14.208425, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 13.557118966674805 }, { "epoch": 4, "eval_accuracy": 0.2646, "eval_loss": 19.696252734375, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 19.190646782769097 }, { "epoch": 5, "eval_accuracy": 0.2452, "eval_loss": 33.2675609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 23.807205302937824 }, { "epoch": 6, "eval_accuracy": 0.2678, "eval_loss": 40.026609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 24.055041174994575 }, { "epoch": 7, "eval_accuracy": 0.3196, "eval_loss": 23.8587390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 24.712686389160154 }, { "epoch": 8, "eval_accuracy": 0.3278, "eval_loss": 27.1260609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 23.086525019327798 }, { "epoch": 9, "eval_accuracy": 0.2696, "eval_loss": 30.96389921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 24.295748993937174 }, { "epoch": 10, "eval_accuracy": 0.2384, "eval_loss": 51.4358140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 21.023040753851998 }, { "epoch": 11, "eval_accuracy": 0.3404, "eval_loss": 25.350265234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 23.475594851345488 }, { "epoch": 12, "eval_accuracy": 0.336, "eval_loss": 22.1634453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 22.52266331515842 }, { "epoch": 13, "eval_accuracy": 0.3306, "eval_loss": 23.82544453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 23.4229757297092 }, { "epoch": 14, "eval_accuracy": 0.2642, "eval_loss": 34.5797359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 23.008342339409722 }, { "epoch": 15, "eval_accuracy": 0.375, "eval_loss": 23.1807421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 20.60292657385932 }, { "epoch": 16, "eval_accuracy": 0.2904, "eval_loss": 36.161196875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 19.139730751546224 }, { "epoch": 17, "eval_accuracy": 0.3454, "eval_loss": 26.833031640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 20.002529979112413 }, { "epoch": 18, "eval_accuracy": 0.3586, "eval_loss": 21.24528046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 18.727348812188044 }, { "epoch": 19, "eval_accuracy": 0.3632, "eval_loss": 25.525848828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 17.44186926167806 }, { "epoch": 20, "eval_accuracy": 0.301, "eval_loss": 36.5179703125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 17.90213321668837 }, { "epoch": 21, "eval_accuracy": 0.3958, "eval_loss": 19.76304296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 17.890375726996528 }, { "epoch": 22, "eval_accuracy": 0.327, "eval_loss": 28.7622765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 17.43689203559028 }, { "epoch": 23, "eval_accuracy": 0.2592, "eval_loss": 41.68627578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 17.345420552571614 }, { "epoch": 24, "eval_accuracy": 0.4054, "eval_loss": 21.936447265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 16.934118476019965 }, { "epoch": 25, "eval_accuracy": 0.2902, "eval_loss": 30.93798828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 18.798614492119682 }, { "epoch": 26, "eval_accuracy": 0.3712, "eval_loss": 29.504349609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 18.812271053059895 }, { "epoch": 27, "eval_accuracy": 0.342, "eval_loss": 26.395713671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 18.473190761650933 }, { "epoch": 28, "eval_accuracy": 0.3854, "eval_loss": 26.093215625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 18.005538069322373 }, { "epoch": 29, "eval_accuracy": 0.3012, "eval_loss": 25.42871171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 18.125954042222766 }, { "epoch": 30, "eval_accuracy": 0.4244, "eval_loss": 19.527813671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 18.05612528415256 }, { "epoch": 31, "eval_accuracy": 0.3614, "eval_loss": 21.34248828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 19.15135492943658 }, { "epoch": 32, "eval_accuracy": 0.4132, "eval_loss": 20.4143234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 18.49009884847005 }, { "epoch": 33, "eval_accuracy": 0.4256, "eval_loss": 16.4301474609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 18.47117029859755 }, { "epoch": 34, "eval_accuracy": 0.4202, "eval_loss": 15.4893919921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 17.859162979804147 }, { "epoch": 35, "eval_accuracy": 0.388, "eval_loss": 16.226535546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 18.110402368503145 }, { "epoch": 36, "eval_accuracy": 0.4052, "eval_loss": 18.623937890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 17.06648885972765 }, { "epoch": 37, "eval_accuracy": 0.3954, "eval_loss": 18.58285390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 19.626207305230036 }, { "epoch": 38, "eval_accuracy": 0.424, "eval_loss": 26.581407421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 18.639922721354168 }, { "epoch": 39, "eval_accuracy": 0.4192, "eval_loss": 19.451832421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 18.782825440131294 }, { "epoch": 40, "eval_accuracy": 0.3804, "eval_loss": 26.744866015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 17.683322509087457 }, { "epoch": 41, "eval_accuracy": 0.395, "eval_loss": 34.78169375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 18.225805063544378 }, { "epoch": 42, "eval_accuracy": 0.412, "eval_loss": 29.765325, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 17.984680138481988 }, { "epoch": 43, "eval_accuracy": 0.3786, "eval_loss": 19.825704296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 17.825573151312934 }, { "epoch": 44, "eval_accuracy": 0.3604, "eval_loss": 26.8407375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 19.19038238796658 }, { "epoch": 45, "eval_accuracy": 0.4052, "eval_loss": 12.7454291015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 16.198456757269966 }, { "epoch": 46, "eval_accuracy": 0.424, "eval_loss": 15.499886328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 16.85351919962565 }, { "epoch": 47, "eval_accuracy": 0.4306, "eval_loss": 16.8180568359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 17.23167397986518 }, { "epoch": 48, "eval_accuracy": 0.4574, "eval_loss": 15.12474765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 17.16782407752143 }, { "epoch": 49, "eval_accuracy": 0.3906, "eval_loss": 33.472205859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 17.989877756754556 }, { "epoch": 50, "eval_accuracy": 0.3944, "eval_loss": 18.846742578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 16.750614368184408 }, { "epoch": 51, "eval_accuracy": 0.3306, "eval_loss": 20.342544921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 16.608609683566623 }, { "epoch": 52, "eval_accuracy": 0.4454, "eval_loss": 21.5571515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 16.961722309366863 }, { "epoch": 53, "eval_accuracy": 0.3998, "eval_loss": 23.065123828125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 16.919527493286132 }, { "epoch": 54, "eval_accuracy": 0.3482, "eval_loss": 25.1215953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 16.035512492031522 }, { "epoch": 55, "eval_accuracy": 0.469, "eval_loss": 15.480585546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 17.075127189466688 }, { "epoch": 56, "eval_accuracy": 0.4464, "eval_loss": 14.592352734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 17.66614246198866 }, { "epoch": 57, "eval_accuracy": 0.4314, "eval_loss": 22.738269140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 16.894754077487523 }, { "epoch": 58, "eval_accuracy": 0.3318, "eval_loss": 45.84163984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 19.05143542683919 }, { "epoch": 59, "eval_accuracy": 0.372, "eval_loss": 31.423384375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 18.783138044230142 }, { "epoch": 60, "eval_accuracy": 0.418, "eval_loss": 16.9460552734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 16.77694915907118 }, { "epoch": 61, "eval_accuracy": 0.361, "eval_loss": 22.063344140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 16.14378400200738 }, { "epoch": 62, "eval_accuracy": 0.408, "eval_loss": 24.965109765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 17.721834357367623 }, { "epoch": 63, "eval_accuracy": 0.4464, "eval_loss": 20.872457421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 17.106755812411837 }, { "epoch": 64, "eval_accuracy": 0.351, "eval_loss": 27.144359765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 16.525339327663847 }, { "epoch": 65, "eval_accuracy": 0.401, "eval_loss": 28.997582421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 17.898866891988117 }, { "epoch": 66, "eval_accuracy": 0.4388, "eval_loss": 25.025003515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 18.09744178805881 }, { "epoch": 67, "eval_accuracy": 0.4728, "eval_loss": 16.6167294921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 17.755582858784994 }, { "epoch": 68, "eval_accuracy": 0.4108, "eval_loss": 19.801496484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 17.263119559054903 }, { "epoch": 69, "eval_accuracy": 0.4906, "eval_loss": 18.20902421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 17.33434205186632 }, { "epoch": 70, "eval_accuracy": 0.4292, "eval_loss": 34.2252921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 18.17401082695855 }, { "epoch": 71, "eval_accuracy": 0.4798, "eval_loss": 15.21786796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 18.021223406304255 }, { "epoch": 72, "eval_accuracy": 0.4518, "eval_loss": 22.791141015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 19.531677550930446 }, { "epoch": 73, "eval_accuracy": 0.368, "eval_loss": 38.81344453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 18.620982016838923 }, { "epoch": 74, "eval_accuracy": 0.4228, "eval_loss": 30.719596484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 20.337078319295248 }, { "epoch": 75, "eval_accuracy": 0.4418, "eval_loss": 21.886297265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 20.1115397922092 }, { "epoch": 76, "eval_accuracy": 0.4868, "eval_loss": 16.3975734375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 17.937315833706325 }, { "epoch": 77, "eval_accuracy": 0.325, "eval_loss": 45.389496875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 21.48694476860894 }, { "epoch": 78, "eval_accuracy": 0.4012, "eval_loss": 26.195025390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 22.31231401570638 }, { "epoch": 79, "eval_accuracy": 0.445, "eval_loss": 27.56462890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 21.119349666341147 }, { "epoch": 80, "eval_accuracy": 0.471, "eval_loss": 17.123298046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 20.679742971123588 }, { "epoch": 81, "eval_accuracy": 0.4214, "eval_loss": 27.093696484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 20.63988988172743 }, { "epoch": 82, "eval_accuracy": 0.4414, "eval_loss": 26.012460546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 21.493989885457356 }, { "epoch": 83, "eval_accuracy": 0.3698, "eval_loss": 30.0991921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 22.169163477918836 }, { "epoch": 84, "eval_accuracy": 0.3986, "eval_loss": 31.00485078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 23.3011970703125 }, { "epoch": 85, "eval_accuracy": 0.442, "eval_loss": 23.574222265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 21.34971837056478 }, { "epoch": 86, "eval_accuracy": 0.4296, "eval_loss": 29.412936328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 21.91920473361545 }, { "epoch": 87, "eval_accuracy": 0.4386, "eval_loss": 20.903475390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 22.060477025689018 }, { "epoch": 88, "eval_accuracy": 0.4506, "eval_loss": 22.551448046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 21.711965223524306 }, { "epoch": 89, "eval_accuracy": 0.3526, "eval_loss": 61.11854921875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 21.463106849839953 }, { "epoch": 90, "eval_accuracy": 0.4564, "eval_loss": 23.186648046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 24.00905051337348 }, { "epoch": 91, "eval_accuracy": 0.376, "eval_loss": 60.64270546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 21.28097244635688 }, { "epoch": 92, "eval_accuracy": 0.3868, "eval_loss": 27.0673390625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 23.36898587782118 }, { "epoch": 93, "eval_accuracy": 0.4672, "eval_loss": 22.039832421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 20.88351126539442 }, { "epoch": 94, "eval_accuracy": 0.3888, "eval_loss": 25.698695703125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 21.979886994425456 }, { "epoch": 95, "eval_accuracy": 0.4346, "eval_loss": 26.78786640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 21.236860284084745 }, { "epoch": 96, "eval_accuracy": 0.3624, "eval_loss": 36.5288453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 21.10884918484158 }, { "epoch": 97, "eval_accuracy": 0.4434, "eval_loss": 23.964403125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 20.604113126966688 }, { "epoch": 98, "eval_accuracy": 0.4674, "eval_loss": 24.196286328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 19.82856385260688 }, { "epoch": 99, "eval_accuracy": 0.4354, "eval_loss": 24.922025, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 19.128273210313584 }, { "epoch": 100, "eval_accuracy": 0.3788, "eval_loss": 31.4631015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 21.582442571343314 }, { "epoch": 101, "eval_accuracy": 0.5972, "eval_loss": 4.836526171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 5.9259513893975155 }, { "epoch": 102, "eval_accuracy": 0.5624, "eval_loss": 4.101729345703125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 3.619677195019192 }, { "epoch": 103, "eval_accuracy": 0.5986, "eval_loss": 2.667718505859375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 2.880115439690484 }, { "epoch": 104, "eval_accuracy": 0.5958, "eval_loss": 2.390951025390625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 2.4437281640370685 }, { "epoch": 105, "eval_accuracy": 0.574, "eval_loss": 2.260222998046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 2.226529400253296 }, { "epoch": 106, "eval_accuracy": 0.5504, "eval_loss": 2.49472744140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 2.185105883640713 }, { "epoch": 107, "eval_accuracy": 0.5266, "eval_loss": 2.41015546875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 2.0920644403245716 }, { "epoch": 108, "eval_accuracy": 0.5886, "eval_loss": 1.7911347412109375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 2.0197150400797526 }, { "epoch": 109, "eval_accuracy": 0.5726, "eval_loss": 2.175161474609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 1.8753828492058648 }, { "epoch": 110, "eval_accuracy": 0.58, "eval_loss": 1.9253150146484375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 1.8506183098475137 }, { "epoch": 111, "eval_accuracy": 0.5912, "eval_loss": 1.810534423828125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 1.7877488494873046 }, { "epoch": 112, "eval_accuracy": 0.5956, "eval_loss": 1.6881039306640624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 1.7687504001193577 }, { "epoch": 113, "eval_accuracy": 0.5764, "eval_loss": 1.8380051513671876, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 1.7672821660783555 }, { "epoch": 114, "eval_accuracy": 0.5794, "eval_loss": 1.6862110595703126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 1.6414273686091105 }, { "epoch": 115, "eval_accuracy": 0.5752, "eval_loss": 1.6944744384765624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 1.6939214492797852 }, { "epoch": 116, "eval_accuracy": 0.5926, "eval_loss": 1.582383349609375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 1.597629587088691 }, { "epoch": 117, "eval_accuracy": 0.5588, "eval_loss": 1.856890869140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 1.6295654713312784 }, { "epoch": 118, "eval_accuracy": 0.5834, "eval_loss": 1.705884130859375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 1.5944301096810234 }, { "epoch": 119, "eval_accuracy": 0.608, "eval_loss": 1.561981005859375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 1.5895581109788683 }, { "epoch": 120, "eval_accuracy": 0.5932, "eval_loss": 1.6351948486328125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 1.5375917362001208 }, { "epoch": 121, "eval_accuracy": 0.5716, "eval_loss": 1.6493072265625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 1.5845890295876397 }, { "epoch": 122, "eval_accuracy": 0.6058, "eval_loss": 1.49820810546875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 1.5254730051252576 }, { "epoch": 123, "eval_accuracy": 0.5652, "eval_loss": 1.77642001953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 1.5247097325219048 }, { "epoch": 124, "eval_accuracy": 0.6068, "eval_loss": 1.376882470703125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 1.5499936188379924 }, { "epoch": 125, "eval_accuracy": 0.5676, "eval_loss": 1.7324075927734375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 1.615310203382704 }, { "epoch": 126, "eval_accuracy": 0.5954, "eval_loss": 1.5954062255859376, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 1.4982189151763916 }, { "epoch": 127, "eval_accuracy": 0.5846, "eval_loss": 1.7751647705078124, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 1.5301205956353081 }, { "epoch": 128, "eval_accuracy": 0.5602, "eval_loss": 1.6907564697265625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 1.4734539789411756 }, { "epoch": 129, "eval_accuracy": 0.6002, "eval_loss": 1.40965439453125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 1.4641339381747775 }, { "epoch": 130, "eval_accuracy": 0.6192, "eval_loss": 1.4004435791015626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 1.5231939977010092 }, { "epoch": 131, "eval_accuracy": 0.5982, "eval_loss": 1.45526376953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 1.497420593600803 }, { "epoch": 132, "eval_accuracy": 0.5884, "eval_loss": 1.550844140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 1.469409120665656 }, { "epoch": 133, "eval_accuracy": 0.6256, "eval_loss": 1.267538330078125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 1.4565586593204074 }, { "epoch": 134, "eval_accuracy": 0.5592, "eval_loss": 1.77311513671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 1.437351505109999 }, { "epoch": 135, "eval_accuracy": 0.5574, "eval_loss": 1.940101904296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 1.4218262961917454 }, { "epoch": 136, "eval_accuracy": 0.5774, "eval_loss": 1.6147098388671874, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 1.411111260647244 }, { "epoch": 137, "eval_accuracy": 0.6128, "eval_loss": 1.357390869140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 1.5000552250120376 }, { "epoch": 138, "eval_accuracy": 0.5848, "eval_loss": 1.632561083984375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 1.3685510100682576 }, { "epoch": 139, "eval_accuracy": 0.6142, "eval_loss": 1.3133041015625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 1.3762463880327014 }, { "epoch": 140, "eval_accuracy": 0.5754, "eval_loss": 1.5640064453125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 1.401551789580451 }, { "epoch": 141, "eval_accuracy": 0.594, "eval_loss": 1.479112841796875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 1.4058031635072497 }, { "epoch": 142, "eval_accuracy": 0.5914, "eval_loss": 1.5028365478515624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 1.4034333087073432 }, { "epoch": 143, "eval_accuracy": 0.6102, "eval_loss": 1.5048456298828126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 1.3954313831117418 }, { "epoch": 144, "eval_accuracy": 0.5666, "eval_loss": 1.6636828369140626, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 1.3667300954606798 }, { "epoch": 145, "eval_accuracy": 0.5612, "eval_loss": 1.6101176025390624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 1.404260525724623 }, { "epoch": 146, "eval_accuracy": 0.5556, "eval_loss": 1.876030859375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 1.4051593517515395 }, { "epoch": 147, "eval_accuracy": 0.5764, "eval_loss": 1.6018065673828126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 1.4870435859256321 }, { "epoch": 148, "eval_accuracy": 0.6056, "eval_loss": 1.43818701171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 1.367290024079217 }, { "epoch": 149, "eval_accuracy": 0.6162, "eval_loss": 1.3064309814453126, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 1.3197986438751221 }, { "epoch": 150, "eval_accuracy": 0.6296, "eval_loss": 1.2498236572265624, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 1.3129838515387642 }, { "epoch": 151, "eval_accuracy": 0.6534, "eval_loss": 1.07179833984375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 1.026788145626916 }, { "epoch": 152, "eval_accuracy": 0.6568, "eval_loss": 1.0430185913085936, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 1.009344142680698 }, { "epoch": 153, "eval_accuracy": 0.658, "eval_loss": 1.0307321044921876, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 1.0141865419387817 }, { "epoch": 154, "eval_accuracy": 0.659, "eval_loss": 1.02932734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 1.0022637588077121 }, { "epoch": 155, "eval_accuracy": 0.6604, "eval_loss": 1.0242865844726563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.9988587782012092 }, { "epoch": 156, "eval_accuracy": 0.6674, "eval_loss": 1.0057396484375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.9961366279178195 }, { "epoch": 157, "eval_accuracy": 0.6548, "eval_loss": 1.03570576171875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.9966530807283189 }, { "epoch": 158, "eval_accuracy": 0.6616, "eval_loss": 1.0033466552734376, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 1.0007755590226914 }, { "epoch": 159, "eval_accuracy": 0.6624, "eval_loss": 0.99225693359375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 1.0026236204147339 }, { "epoch": 160, "eval_accuracy": 0.661, "eval_loss": 1.00777568359375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 1.0010402308146158 }, { "epoch": 161, "eval_accuracy": 0.6566, "eval_loss": 1.0218382690429688, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.9932583589553833 }, { "epoch": 162, "eval_accuracy": 0.6546, "eval_loss": 1.0098359619140624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 1.0004163008266025 }, { "epoch": 163, "eval_accuracy": 0.662, "eval_loss": 1.0110062622070313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 1.0034730763753255 }, { "epoch": 164, "eval_accuracy": 0.6494, "eval_loss": 1.0401352172851563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 1.0073212409337362 }, { "epoch": 165, "eval_accuracy": 0.6474, "eval_loss": 1.0578818725585937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 1.0492681529257033 }, { "epoch": 166, "eval_accuracy": 0.6434, "eval_loss": 1.0694183837890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 1.0751917953279284 }, { "epoch": 167, "eval_accuracy": 0.6294, "eval_loss": 1.1221494384765625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 1.0811405420939129 }, { "epoch": 168, "eval_accuracy": 0.6354, "eval_loss": 1.0892340576171875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 1.0801018522050645 }, { "epoch": 169, "eval_accuracy": 0.6412, "eval_loss": 1.0978382080078124, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 1.0860861628214518 }, { "epoch": 170, "eval_accuracy": 0.6346, "eval_loss": 1.090638720703125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 1.0723167603810628 }, { "epoch": 171, "eval_accuracy": 0.6272, "eval_loss": 1.1234599609375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 1.0920719518237645 }, { "epoch": 172, "eval_accuracy": 0.6284, "eval_loss": 1.099410595703125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 1.0925795223236083 }, { "epoch": 173, "eval_accuracy": 0.63, "eval_loss": 1.104658056640625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 1.087668931304084 }, { "epoch": 174, "eval_accuracy": 0.628, "eval_loss": 1.1068023193359375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 1.094618272082011 }, { "epoch": 175, "eval_accuracy": 0.6318, "eval_loss": 1.09778740234375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 1.0823923013687133 }, { "epoch": 176, "eval_accuracy": 0.6308, "eval_loss": 1.10460810546875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 1.0776995142830743 }, { "epoch": 177, "eval_accuracy": 0.6418, "eval_loss": 1.0786893798828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 1.069732749218411 }, { "epoch": 178, "eval_accuracy": 0.6406, "eval_loss": 1.0766607421875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 1.0717433659447564 }, { "epoch": 179, "eval_accuracy": 0.635, "eval_loss": 1.0887271728515624, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 1.0777871327506172 }, { "epoch": 180, "eval_accuracy": 0.6436, "eval_loss": 1.062487890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 1.070056160566542 }, { "epoch": 181, "eval_accuracy": 0.6448, "eval_loss": 1.060628564453125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 1.0583967365688747 }, { "epoch": 182, "eval_accuracy": 0.6446, "eval_loss": 1.058402197265625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 1.0691630625618829 }, { "epoch": 183, "eval_accuracy": 0.6366, "eval_loss": 1.0809754150390625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 1.0663337293412951 }, { "epoch": 184, "eval_accuracy": 0.6452, "eval_loss": 1.058856298828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 1.0665179736455281 }, { "epoch": 185, "eval_accuracy": 0.6398, "eval_loss": 1.06523369140625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 1.0648094150119358 }, { "epoch": 186, "eval_accuracy": 0.64, "eval_loss": 1.060458837890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 1.0582156455569798 }, { "epoch": 187, "eval_accuracy": 0.6538, "eval_loss": 1.04734462890625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 1.0498132875124613 }, { "epoch": 188, "eval_accuracy": 0.6562, "eval_loss": 1.0362562622070313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 1.0539691292444864 }, { "epoch": 189, "eval_accuracy": 0.6546, "eval_loss": 1.0296682861328126, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 1.050129378912184 }, { "epoch": 190, "eval_accuracy": 0.6484, "eval_loss": 1.0466437377929687, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 1.051998159429762 }, { "epoch": 191, "eval_accuracy": 0.6538, "eval_loss": 1.0468611083984376, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 1.0416840789159139 }, { "epoch": 192, "eval_accuracy": 0.6592, "eval_loss": 1.0471241577148438, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 1.0441420639038086 }, { "epoch": 193, "eval_accuracy": 0.6478, "eval_loss": 1.0665528564453124, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 1.048444183370802 }, { "epoch": 194, "eval_accuracy": 0.647, "eval_loss": 1.0716345703125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 1.0648873981157938 }, { "epoch": 195, "eval_accuracy": 0.6476, "eval_loss": 1.0518780395507812, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 1.0581021981451246 }, { "epoch": 196, "eval_accuracy": 0.647, "eval_loss": 1.0528640258789062, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 1.0561888460053337 }, { "epoch": 197, "eval_accuracy": 0.6446, "eval_loss": 1.0466599609375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 1.0471556855837505 }, { "epoch": 198, "eval_accuracy": 0.653, "eval_loss": 1.0403861328125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 1.0446702560000949 }, { "epoch": 199, "eval_accuracy": 0.6442, "eval_loss": 1.060380322265625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 1.0528953741285536 }, { "epoch": 200, "eval_accuracy": 0.6436, "eval_loss": 1.0704212158203126, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 1.0543489791870118 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.6436, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 1.0704212158203126, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 3252628992, "peak_memory_reserved_bytes": 4510973952, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 61.098384141922, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 3827.3347294330597, "train_wall_s": 3766.213252544403 }, "work": { "apical_macs_per_example": 125043328, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 1125389952000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 1129371264000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 1129371264000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 125485696, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 3384132480000000 } }