{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 267904, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 20, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "kp", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-clean_kp-d20-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "reciprocal_local_activity_products", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.9992254873116811, "feedback_forward_cosine": [ 0.9996554255485535, 0.9996746182441711, 0.9996549487113953, 0.9996075630187988, 0.9996635913848877, 0.9995270371437073, 0.9995354413986206, 0.9996858835220337, 0.9996363520622253, 0.9995448589324951, 0.999627411365509, 0.9995063543319702, 0.9995788335800171, 0.999750554561615, 0.9997305870056152, 0.999675989151001, 0.9997004270553589, 0.9992839097976685, 0.9999722242355347 ], "feedback_forward_norm_ratio": [ 0.9991434216499329, 1.0004491806030273, 0.9987601041793823, 1.0013868808746338, 0.999297022819519, 1.0023059844970703, 0.9987834692001343, 1.0002436637878418, 0.9993070363998413, 1.0014671087265015, 0.9994328618049622, 1.0015302896499634, 0.9993026256561279, 1.0005580186843872, 1.0002413988113403, 1.0010871887207031, 1.0002120733261108, 1.0017412900924683, 1.0046420097351074 ], "feedback_forward_relative_error": [ 0.02625316195189953, 0.025520561262965202, 0.026284009218215942, 0.028065064921975136, 0.025940094143152237, 0.03087770752608776, 0.03048705868422985, 0.02506886050105095, 0.026966994628310204, 0.030226128175854683, 0.02730029635131359, 0.03148436173796654, 0.029020819813013077, 0.022351281717419624, 0.02321099117398262, 0.02549651823937893, 0.024476630613207817, 0.03791650012135506, 0.008795272558927536 ], "innovation_negative_gradient_cosine": [ 0.9992389678955078, 0.9991669058799744, 0.999206006526947, 0.9992231726646423, 0.9992378950119019, 0.9992799758911133, 0.9992815256118774, 0.9993095397949219, 0.999367356300354, 0.9992690086364746, 0.9994315505027771, 0.999388575553894, 0.9994919300079346, 0.9995896816253662, 0.9996410608291626, 0.999697208404541, 0.9998255968093872, 0.9999359846115112, 0.8563728332519531 ], "mean_feedback_forward_cosine": 0.9996322111079567, "mean_feedback_forward_relative_error": 0.026618016491595068, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.9992389678955078, 0.9991669058799744, 0.999206006526947, 0.9992231726646423, 0.9992378950119019, 0.9992799758911133, 0.9992815256118774, 0.9993095397949219, 0.999367356300354, 0.9992690086364746, 0.9994315505027771, 0.999388575553894, 0.9994919300079346, 0.9995896816253662, 0.9996410608291626, 0.999697208404541, 0.9998255968093872, 0.9999359846115112, 0.8563728332519531 ], "teaching_negative_gradient_cosine": [ 0.9992389678955078, 0.9991669058799744, 0.999206006526947, 0.9992231726646423, 0.9992378950119019, 0.9992799758911133, 0.9992815256118774, 0.9993095397949219, 0.999367356300354, 0.9992690086364746, 0.9994315505027771, 0.999388575553894, 0.9994919300079346, 0.9995896816253662, 0.9996410608291626, 0.999697208404541, 0.9998255968093872, 0.9999359846115112, 0.8563728332519531 ], "wall_s": 0.06803202629089355 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.344, "eval_loss": 1.81885517578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.396217942237854, "mean_feedback_forward_cosine": 0.12113288064536296, "mean_feedback_forward_relative_error": 1.3444790902890658, "min_feedback_forward_cosine": 0.037865087389945984 }, "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 1.9119543294694687 }, { "epoch": 2, "eval_accuracy": 0.4864, "eval_loss": 1.565498681640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3504620790481567, "mean_feedback_forward_cosine": 0.27226419001817703, "mean_feedback_forward_relative_error": 1.222043868742491, "min_feedback_forward_cosine": 0.11271074414253235 }, "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.4822090652677749 }, { "epoch": 3, "eval_accuracy": 0.523, "eval_loss": 1.6564058837890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.3010425567626953, "mean_feedback_forward_cosine": 0.39278248579878555, "mean_feedback_forward_relative_error": 1.11243883873287, "min_feedback_forward_cosine": 0.18469145894050598 }, "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 1.19166419444614 }, { "epoch": 4, "eval_accuracy": 0.6216, "eval_loss": 1.09284404296875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.246029257774353, "mean_feedback_forward_cosine": 0.49751683755924825, "mean_feedback_forward_relative_error": 1.0094205486147028, "min_feedback_forward_cosine": 0.25789177417755127 }, "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 1.0127930777443779 }, { "epoch": 5, "eval_accuracy": 0.7116, "eval_loss": 0.8747228881835938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1837794780731201, "mean_feedback_forward_cosine": 0.5858596798620725, "mean_feedback_forward_relative_error": 0.9147494780389887, "min_feedback_forward_cosine": 0.3337680697441101 }, "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 0.884297638130188 }, { "epoch": 6, "eval_accuracy": 0.6672, "eval_loss": 0.985279248046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.1347962617874146, "mean_feedback_forward_cosine": 0.6410800830314034, "mean_feedback_forward_relative_error": 0.8509495085791537, "min_feedback_forward_cosine": 0.38860657811164856 }, "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 0.7689341519885593 }, { "epoch": 7, "eval_accuracy": 0.745, "eval_loss": 0.7586026489257812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0899189710617065, "mean_feedback_forward_cosine": 0.6840777710864419, "mean_feedback_forward_relative_error": 0.798096848161597, "min_feedback_forward_cosine": 0.4376838803291321 }, "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 0.7034475085046556 }, { "epoch": 8, "eval_accuracy": 0.702, "eval_loss": 1.04657080078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0519425868988037, "mean_feedback_forward_cosine": 0.7168333953932712, "mean_feedback_forward_relative_error": 0.7551552151378832, "min_feedback_forward_cosine": 0.4767589867115021 }, "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 0.6440844105932447 }, { "epoch": 9, "eval_accuracy": 0.7628, "eval_loss": 0.7188642578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 1.0166592597961426, "mean_feedback_forward_cosine": 0.744070269559559, "mean_feedback_forward_relative_error": 0.7177636921405792, "min_feedback_forward_cosine": 0.5122615694999695 }, "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 0.5978653068330553 }, { "epoch": 10, "eval_accuracy": 0.7684, "eval_loss": 0.7278686767578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9829434752464294, "mean_feedback_forward_cosine": 0.7671844739662973, "mean_feedback_forward_relative_error": 0.6843707843830711, "min_feedback_forward_cosine": 0.5441762208938599 }, "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 0.5641649359703064 }, { "epoch": 11, "eval_accuracy": 0.7844, "eval_loss": 0.6429546142578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.9501974582672119, "mean_feedback_forward_cosine": 0.787681868201808, "mean_feedback_forward_relative_error": 0.6532509734756068, "min_feedback_forward_cosine": 0.574102520942688 }, "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 0.5336678455458747 }, { "epoch": 12, "eval_accuracy": 0.7888, "eval_loss": 0.6300875366210937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.918483316898346, "mean_feedback_forward_cosine": 0.8054801445258292, "mean_feedback_forward_relative_error": 0.6250106943281073, "min_feedback_forward_cosine": 0.6022139191627502 }, "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 0.5122270748244392 }, { "epoch": 13, "eval_accuracy": 0.6694, "eval_loss": 1.1285370361328124, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8890088796615601, "mean_feedback_forward_cosine": 0.8212189956715232, "mean_feedback_forward_relative_error": 0.5988754441863612, "min_feedback_forward_cosine": 0.6274921894073486 }, "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 0.4805156542142232 }, { "epoch": 14, "eval_accuracy": 0.8094, "eval_loss": 0.5873873657226563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.859317421913147, "mean_feedback_forward_cosine": 0.8354297970470629, "mean_feedback_forward_relative_error": 0.5742914959004051, "min_feedback_forward_cosine": 0.651719868183136 }, "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 0.4709179120169746 }, { "epoch": 15, "eval_accuracy": 0.8018, "eval_loss": 0.631718359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8302932977676392, "mean_feedback_forward_cosine": 0.8483938072857103, "mean_feedback_forward_relative_error": 0.550973863978135, "min_feedback_forward_cosine": 0.674503743648529 }, "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 0.44848755186398825 }, { "epoch": 16, "eval_accuracy": 0.8008, "eval_loss": 0.6399617309570312, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.8032397627830505, "mean_feedback_forward_cosine": 0.8598326538738451, "mean_feedback_forward_relative_error": 0.529568424350337, "min_feedback_forward_cosine": 0.6950962543487549 }, "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 0.4364324880705939 }, { "epoch": 17, "eval_accuracy": 0.8222, "eval_loss": 0.5439112243652344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7772430777549744, "mean_feedback_forward_cosine": 0.8702934415716874, "mean_feedback_forward_relative_error": 0.5092110178972545, "min_feedback_forward_cosine": 0.7146843671798706 }, "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 0.4180992658085293 }, { "epoch": 18, "eval_accuracy": 0.8316, "eval_loss": 0.5281030395507812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7511368989944458, "mean_feedback_forward_cosine": 0.8800302555686549, "mean_feedback_forward_relative_error": 0.48952555499578776, "min_feedback_forward_cosine": 0.7333462238311768 }, "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 0.4113643139521281 }, { "epoch": 19, "eval_accuracy": 0.834, "eval_loss": 0.5129178466796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7260403633117676, "mean_feedback_forward_cosine": 0.8888662520207857, "mean_feedback_forward_relative_error": 0.47090583176989304, "min_feedback_forward_cosine": 0.7505145072937012 }, "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 0.398461009144783 }, { "epoch": 20, "eval_accuracy": 0.8144, "eval_loss": 0.5892133605957032, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.7021915912628174, "mean_feedback_forward_cosine": 0.8966989234874123, "mean_feedback_forward_relative_error": 0.45369475923086466, "min_feedback_forward_cosine": 0.7663941979408264 }, "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 0.3833774073653751 }, { "epoch": 21, "eval_accuracy": 0.8162, "eval_loss": 0.6017692626953125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6776108145713806, "mean_feedback_forward_cosine": 0.9041856401845029, "mean_feedback_forward_relative_error": 0.4366687630352221, "min_feedback_forward_cosine": 0.7823076248168945 }, "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 0.373022927708096 }, { "epoch": 22, "eval_accuracy": 0.7892, "eval_loss": 0.7000044067382812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6551166772842407, "mean_feedback_forward_cosine": 0.911015090189482, "mean_feedback_forward_relative_error": 0.4206081620956722, "min_feedback_forward_cosine": 0.796286940574646 }, "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 0.368713469309277 }, { "epoch": 23, "eval_accuracy": 0.8424, "eval_loss": 0.4894224792480469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6320359110832214, "mean_feedback_forward_cosine": 0.9173811485892848, "mean_feedback_forward_relative_error": 0.4050847472328889, "min_feedback_forward_cosine": 0.8102049827575684 }, "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 0.36200492996639677 }, { "epoch": 24, "eval_accuracy": 0.8508, "eval_loss": 0.4847625244140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.6104835271835327, "mean_feedback_forward_cosine": 0.923206090927124, "mean_feedback_forward_relative_error": 0.39038152600589554, "min_feedback_forward_cosine": 0.8226820230484009 }, "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 0.35031071446206835 }, { "epoch": 25, "eval_accuracy": 0.8472, "eval_loss": 0.48265894165039064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5895683169364929, "mean_feedback_forward_cosine": 0.9285419740174946, "mean_feedback_forward_relative_error": 0.37639613763282176, "min_feedback_forward_cosine": 0.8343791961669922 }, "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 0.3469265750249227 }, { "epoch": 26, "eval_accuracy": 0.8544, "eval_loss": 0.44391314697265627, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5687019228935242, "mean_feedback_forward_cosine": 0.9335442655964902, "mean_feedback_forward_relative_error": 0.3628646017689454, "min_feedback_forward_cosine": 0.8457885384559631 }, "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 0.34203060767385696 }, { "epoch": 27, "eval_accuracy": 0.7932, "eval_loss": 0.6590688598632812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.549074113368988, "mean_feedback_forward_cosine": 0.9380777917410198, "mean_feedback_forward_relative_error": 0.35010523309833125, "min_feedback_forward_cosine": 0.8560115098953247 }, "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 0.3337548480987549 }, { "epoch": 28, "eval_accuracy": 0.8348, "eval_loss": 0.5370311096191406, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5305789709091187, "mean_feedback_forward_cosine": 0.9421965573963366, "mean_feedback_forward_relative_error": 0.338118544534633, "min_feedback_forward_cosine": 0.8653731942176819 }, "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 0.3222589003774855 }, { "epoch": 29, "eval_accuracy": 0.8502, "eval_loss": 0.4641535888671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.5120760798454285, "mean_feedback_forward_cosine": 0.9460670446094713, "mean_feedback_forward_relative_error": 0.32643518400819677, "min_feedback_forward_cosine": 0.8744317293167114 }, "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 0.31773917949464586 }, { "epoch": 30, "eval_accuracy": 0.8528, "eval_loss": 0.4488963806152344, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.49475499987602234, "mean_feedback_forward_cosine": 0.9497027867718747, "mean_feedback_forward_relative_error": 0.3151285601289649, "min_feedback_forward_cosine": 0.882604718208313 }, "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 0.3195970536020067 }, { "epoch": 31, "eval_accuracy": 0.83, "eval_loss": 0.5759987670898438, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.47704029083251953, "mean_feedback_forward_cosine": 0.9531683921813965, "mean_feedback_forward_relative_error": 0.3039606629233611, "min_feedback_forward_cosine": 0.8906716704368591 }, "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 0.312859878677792 }, { "epoch": 32, "eval_accuracy": 0.8274, "eval_loss": 0.5443523193359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.46091774106025696, "mean_feedback_forward_cosine": 0.9562506518865886, "mean_feedback_forward_relative_error": 0.2936018642626311, "min_feedback_forward_cosine": 0.8978977203369141 }, "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 0.3004345349841648 }, { "epoch": 33, "eval_accuracy": 0.8412, "eval_loss": 0.5110523986816407, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.44484663009643555, "mean_feedback_forward_cosine": 0.9592594598468981, "mean_feedback_forward_relative_error": 0.28327554934903193, "min_feedback_forward_cosine": 0.904775857925415 }, "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 0.3016047252337138 }, { "epoch": 34, "eval_accuracy": 0.8304, "eval_loss": 0.5683611450195313, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.42912110686302185, "mean_feedback_forward_cosine": 0.9620242558027569, "mean_feedback_forward_relative_error": 0.2734151631593704, "min_feedback_forward_cosine": 0.9112752079963684 }, "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 0.29844820080068374 }, { "epoch": 35, "eval_accuracy": 0.8534, "eval_loss": 0.47788355712890623, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.4136193096637726, "mean_feedback_forward_cosine": 0.9646216285856146, "mean_feedback_forward_relative_error": 0.26376486295147944, "min_feedback_forward_cosine": 0.9175251126289368 }, "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 0.29182118734253776 }, { "epoch": 36, "eval_accuracy": 0.829, "eval_loss": 0.5739090393066406, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3991897404193878, "mean_feedback_forward_cosine": 0.9669801373230783, "mean_feedback_forward_relative_error": 0.2547991220888339, "min_feedback_forward_cosine": 0.9230731725692749 }, "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 0.2934884912861718 }, { "epoch": 37, "eval_accuracy": 0.8344, "eval_loss": 0.5700015991210937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3849577009677887, "mean_feedback_forward_cosine": 0.9692228216873972, "mean_feedback_forward_relative_error": 0.24591049551963806, "min_feedback_forward_cosine": 0.9283632636070251 }, "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 0.28581399149894715 }, { "epoch": 38, "eval_accuracy": 0.8496, "eval_loss": 0.46519459228515625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3715720474720001, "mean_feedback_forward_cosine": 0.9713154152819985, "mean_feedback_forward_relative_error": 0.2373458535263413, "min_feedback_forward_cosine": 0.9331613779067993 }, "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 0.2865924285676744 }, { "epoch": 39, "eval_accuracy": 0.8558, "eval_loss": 0.46593084716796873, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3588463366031647, "mean_feedback_forward_cosine": 0.9731747727645071, "mean_feedback_forward_relative_error": 0.22942296886130384, "min_feedback_forward_cosine": 0.937605619430542 }, "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 0.2737637662622664 }, { "epoch": 40, "eval_accuracy": 0.8636, "eval_loss": 0.44457278442382814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3455275595188141, "mean_feedback_forward_cosine": 0.9750205466621801, "mean_feedback_forward_relative_error": 0.2213271828858476, "min_feedback_forward_cosine": 0.9420970678329468 }, "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 0.27786194910473294 }, { "epoch": 41, "eval_accuracy": 0.846, "eval_loss": 0.5155881774902343, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3331117630004883, "mean_feedback_forward_cosine": 0.9767144510620519, "mean_feedback_forward_relative_error": 0.21364634640906988, "min_feedback_forward_cosine": 0.946147084236145 }, "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 0.2707260728518168 }, { "epoch": 42, "eval_accuracy": 0.8526, "eval_loss": 0.49671691284179686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.3209340572357178, "mean_feedback_forward_cosine": 0.9782712177226418, "mean_feedback_forward_relative_error": 0.20631324695913414, "min_feedback_forward_cosine": 0.9499820470809937 }, "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 0.2681165763537089 }, { "epoch": 43, "eval_accuracy": 0.8602, "eval_loss": 0.4529365417480469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.30942007899284363, "mean_feedback_forward_cosine": 0.9797280869985882, "mean_feedback_forward_relative_error": 0.19923599417272367, "min_feedback_forward_cosine": 0.9534589648246765 }, "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 0.26589359577231936 }, { "epoch": 44, "eval_accuracy": 0.816, "eval_loss": 0.6069492797851562, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.29825714230537415, "mean_feedback_forward_cosine": 0.9811234944745114, "mean_feedback_forward_relative_error": 0.1922379583120346, "min_feedback_forward_cosine": 0.9567015171051025 }, "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 0.2647001281181971 }, { "epoch": 45, "eval_accuracy": 0.8246, "eval_loss": 0.6435483520507812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.28758206963539124, "mean_feedback_forward_cosine": 0.9823637510600843, "mean_feedback_forward_relative_error": 0.18576494329854062, "min_feedback_forward_cosine": 0.9596829414367676 }, "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 0.25985294319258795 }, { "epoch": 46, "eval_accuracy": 0.845, "eval_loss": 0.5288216491699219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2769462466239929, "mean_feedback_forward_cosine": 0.9835391013245833, "mean_feedback_forward_relative_error": 0.17942392904507487, "min_feedback_forward_cosine": 0.96257483959198 }, "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 0.2615274556848738 }, { "epoch": 47, "eval_accuracy": 0.8418, "eval_loss": 0.54138017578125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.2668825387954712, "mean_feedback_forward_cosine": 0.984656035900116, "mean_feedback_forward_relative_error": 0.17317641526460648, "min_feedback_forward_cosine": 0.9652228355407715 }, "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 0.2564132101482815 }, { "epoch": 48, "eval_accuracy": 0.8372, "eval_loss": 0.5357763732910156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.25704485177993774, "mean_feedback_forward_cosine": 0.9856965698693928, "mean_feedback_forward_relative_error": 0.1671780539970649, "min_feedback_forward_cosine": 0.9677011966705322 }, "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 0.25630424637264676 }, { "epoch": 49, "eval_accuracy": 0.8638, "eval_loss": 0.44562494506835937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.24754087626934052, "mean_feedback_forward_cosine": 0.9866711967869809, "mean_feedback_forward_relative_error": 0.1613692139324389, "min_feedback_forward_cosine": 0.9700177311897278 }, "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 0.25752347220314875 }, { "epoch": 50, "eval_accuracy": 0.865, "eval_loss": 0.4701431762695312, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.23877203464508057, "mean_feedback_forward_cosine": 0.9875494618164865, "mean_feedback_forward_relative_error": 0.1559329197594994, "min_feedback_forward_cosine": 0.9720914363861084 }, "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 0.2516157629966736 }, { "epoch": 51, "eval_accuracy": 0.854, "eval_loss": 0.4998943542480469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.22992095351219177, "mean_feedback_forward_cosine": 0.9883927734274613, "mean_feedback_forward_relative_error": 0.1505319970218759, "min_feedback_forward_cosine": 0.9741135239601135 }, "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 0.24805901011890835 }, { "epoch": 52, "eval_accuracy": 0.8616, "eval_loss": 0.47119757690429687, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.22150832414627075, "mean_feedback_forward_cosine": 0.9891759470889443, "mean_feedback_forward_relative_error": 0.1453473183669542, "min_feedback_forward_cosine": 0.9759514927864075 }, "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 0.24537688566843668 }, { "epoch": 53, "eval_accuracy": 0.8556, "eval_loss": 0.48224800415039065, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.21376891434192657, "mean_feedback_forward_cosine": 0.989898261271025, "mean_feedback_forward_relative_error": 0.14038500679950966, "min_feedback_forward_cosine": 0.9775823354721069 }, "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 0.2405990086025662 }, { "epoch": 54, "eval_accuracy": 0.8436, "eval_loss": 0.5470617431640625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.20610255002975464, "mean_feedback_forward_cosine": 0.9905684119776675, "mean_feedback_forward_relative_error": 0.1356346622893685, "min_feedback_forward_cosine": 0.9791518449783325 }, "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 0.2398143388748169 }, { "epoch": 55, "eval_accuracy": 0.8622, "eval_loss": 0.45401356811523436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.19825775921344757, "mean_feedback_forward_cosine": 0.9912248034226266, "mean_feedback_forward_relative_error": 0.13083300131716227, "min_feedback_forward_cosine": 0.9806845784187317 }, "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 0.2417209722412957 }, { "epoch": 56, "eval_accuracy": 0.8272, "eval_loss": 0.6230890991210938, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.19106264412403107, "mean_feedback_forward_cosine": 0.9918148360754314, "mean_feedback_forward_relative_error": 0.12633993947192243, "min_feedback_forward_cosine": 0.9820552468299866 }, "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 0.23602942765553792 }, { "epoch": 57, "eval_accuracy": 0.8342, "eval_loss": 0.5783703979492187, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.18371108174324036, "mean_feedback_forward_cosine": 0.9923666746992814, "mean_feedback_forward_relative_error": 0.12198558371318013, "min_feedback_forward_cosine": 0.9833942651748657 }, "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 0.2385865336894989 }, { "epoch": 58, "eval_accuracy": 0.8152, "eval_loss": 0.6801926147460937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.17712336778640747, "mean_feedback_forward_cosine": 0.992893824451848, "mean_feedback_forward_relative_error": 0.11769728735089302, "min_feedback_forward_cosine": 0.9845579266548157 }, "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 0.23616963873969185 }, { "epoch": 59, "eval_accuracy": 0.8444, "eval_loss": 0.5382642761230468, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1707431674003601, "mean_feedback_forward_cosine": 0.9933741876953527, "mean_feedback_forward_relative_error": 0.113632299594189, "min_feedback_forward_cosine": 0.9856466054916382 }, "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 0.2340568670378791 }, { "epoch": 60, "eval_accuracy": 0.8684, "eval_loss": 0.42916826171875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1647421419620514, "mean_feedback_forward_cosine": 0.9938058602182489, "mean_feedback_forward_relative_error": 0.10984297096729279, "min_feedback_forward_cosine": 0.9866265654563904 }, "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 0.22967808141708373 }, { "epoch": 61, "eval_accuracy": 0.8644, "eval_loss": 0.4622958190917969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1589381992816925, "mean_feedback_forward_cosine": 0.9942190270674857, "mean_feedback_forward_relative_error": 0.1061004608085281, "min_feedback_forward_cosine": 0.9875530004501343 }, "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 0.22695105500353707 }, { "epoch": 62, "eval_accuracy": 0.8694, "eval_loss": 0.4372173278808594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.15320304036140442, "mean_feedback_forward_cosine": 0.9946047820542988, "mean_feedback_forward_relative_error": 0.1024947821309692, "min_feedback_forward_cosine": 0.9884278774261475 }, "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 0.22514011753400168 }, { "epoch": 63, "eval_accuracy": 0.8506, "eval_loss": 0.534511572265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14787736535072327, "mean_feedback_forward_cosine": 0.9949603143491244, "mean_feedback_forward_relative_error": 0.0990475590683912, "min_feedback_forward_cosine": 0.9892134666442871 }, "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 0.22366815836164686 }, { "epoch": 64, "eval_accuracy": 0.8492, "eval_loss": 0.4916988586425781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.14245589077472687, "mean_feedback_forward_cosine": 0.9952998600508037, "mean_feedback_forward_relative_error": 0.09564386621901863, "min_feedback_forward_cosine": 0.9899836778640747 }, "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 0.22651206641462115 }, { "epoch": 65, "eval_accuracy": 0.8582, "eval_loss": 0.4878775207519531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1371895670890808, "mean_feedback_forward_cosine": 0.9956255743378087, "mean_feedback_forward_relative_error": 0.09226729152233977, "min_feedback_forward_cosine": 0.9907054901123047 }, "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 0.23046863102383083 }, { "epoch": 66, "eval_accuracy": 0.8532, "eval_loss": 0.5311714599609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.13216394186019897, "mean_feedback_forward_cosine": 0.9959230548457095, "mean_feedback_forward_relative_error": 0.08907792697611608, "min_feedback_forward_cosine": 0.991371750831604 }, "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 0.22570315517319572 }, { "epoch": 67, "eval_accuracy": 0.8616, "eval_loss": 0.47444708251953127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.12750616669654846, "mean_feedback_forward_cosine": 0.9961913918194018, "mean_feedback_forward_relative_error": 0.08607606923109606, "min_feedback_forward_cosine": 0.9919623136520386 }, "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 0.2197730148103502 }, { "epoch": 68, "eval_accuracy": 0.8686, "eval_loss": 0.4310839172363281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.12284544110298157, "mean_feedback_forward_cosine": 0.9964495489471837, "mean_feedback_forward_relative_error": 0.08310531922861149, "min_feedback_forward_cosine": 0.9925363063812256 }, "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 0.22210470549265543 }, { "epoch": 69, "eval_accuracy": 0.875, "eval_loss": 0.39954692993164065, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11851232498884201, "mean_feedback_forward_cosine": 0.9966876569547152, "mean_feedback_forward_relative_error": 0.08026892731064245, "min_feedback_forward_cosine": 0.9930498600006104 }, "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 0.22326679899957444 }, { "epoch": 70, "eval_accuracy": 0.8728, "eval_loss": 0.431579052734375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1143125668168068, "mean_feedback_forward_cosine": 0.9969074663363005, "mean_feedback_forward_relative_error": 0.07755606699930995, "min_feedback_forward_cosine": 0.9935322403907776 }, "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 0.21717988074090747 }, { "epoch": 71, "eval_accuracy": 0.8372, "eval_loss": 0.6019211547851563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.11009687930345535, "mean_feedback_forward_cosine": 0.9971224697012651, "mean_feedback_forward_relative_error": 0.07480305041137494, "min_feedback_forward_cosine": 0.9939974546432495 }, "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 0.21987548260688783 }, { "epoch": 72, "eval_accuracy": 0.844, "eval_loss": 0.5271776062011718, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.1060536578297615, "mean_feedback_forward_cosine": 0.9973184591845462, "mean_feedback_forward_relative_error": 0.07221450186089466, "min_feedback_forward_cosine": 0.9944281578063965 }, "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 0.21815802181826696 }, { "epoch": 73, "eval_accuracy": 0.8644, "eval_loss": 0.4716430725097656, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.10231104493141174, "mean_feedback_forward_cosine": 0.9974972291996604, "mean_feedback_forward_relative_error": 0.06975691196949858, "min_feedback_forward_cosine": 0.994812548160553 }, "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 0.21477413632074993 }, { "epoch": 74, "eval_accuracy": 0.8756, "eval_loss": 0.39738220825195314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09869157522916794, "mean_feedback_forward_cosine": 0.9976618415430972, "mean_feedback_forward_relative_error": 0.06742280917732339, "min_feedback_forward_cosine": 0.9951719045639038 }, "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 0.2134038785510593 }, { "epoch": 75, "eval_accuracy": 0.8396, "eval_loss": 0.5778799682617187, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09520690888166428, "mean_feedback_forward_cosine": 0.9978216541440863, "mean_feedback_forward_relative_error": 0.0650710579203932, "min_feedback_forward_cosine": 0.9955058097839355 }, "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 0.21306624372800193 }, { "epoch": 76, "eval_accuracy": 0.8564, "eval_loss": 0.50355625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.09168129414319992, "mean_feedback_forward_cosine": 0.9979705936030338, "mean_feedback_forward_relative_error": 0.06280808003717347, "min_feedback_forward_cosine": 0.9958318471908569 }, "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 0.21620365244812437 }, { "epoch": 77, "eval_accuracy": 0.8696, "eval_loss": 0.44153466796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08841861039400101, "mean_feedback_forward_cosine": 0.9981047730696829, "mean_feedback_forward_relative_error": 0.0606959780776187, "min_feedback_forward_cosine": 0.9961221218109131 }, "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 0.2079311021433936 }, { "epoch": 78, "eval_accuracy": 0.8704, "eval_loss": 0.4515508117675781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08516950905323029, "mean_feedback_forward_cosine": 0.9982353982172514, "mean_feedback_forward_relative_error": 0.058566737037740256, "min_feedback_forward_cosine": 0.9964010715484619 }, "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 0.21112659882969326 }, { "epoch": 79, "eval_accuracy": 0.8624, "eval_loss": 0.47880274658203126, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.08209028840065002, "mean_feedback_forward_cosine": 0.9983568599349574, "mean_feedback_forward_relative_error": 0.05651370122244483, "min_feedback_forward_cosine": 0.9966554045677185 }, "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 0.21050622888141207 }, { "epoch": 80, "eval_accuracy": 0.8636, "eval_loss": 0.4666690185546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.07915076613426208, "mean_feedback_forward_cosine": 0.9984677810417978, "mean_feedback_forward_relative_error": 0.05457279988025364, "min_feedback_forward_cosine": 0.9968898296356201 }, "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 0.21067021816306644 }, { "epoch": 81, "eval_accuracy": 0.8598, "eval_loss": 0.5046466125488281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.07637186348438263, "mean_feedback_forward_cosine": 0.9985681176185608, "mean_feedback_forward_relative_error": 0.05274927233786959, "min_feedback_forward_cosine": 0.9971036911010742 }, "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 0.20502160912619696 }, { "epoch": 82, "eval_accuracy": 0.8576, "eval_loss": 0.4760834167480469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0736217275261879, "mean_feedback_forward_cosine": 0.9986653202458432, "mean_feedback_forward_relative_error": 0.050925137965302715, "min_feedback_forward_cosine": 0.997308611869812 }, "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 0.20797349837091234 }, { "epoch": 83, "eval_accuracy": 0.8376, "eval_loss": 0.611455859375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.07095649093389511, "mean_feedback_forward_cosine": 0.9987575662763495, "mean_feedback_forward_relative_error": 0.049138400703668594, "min_feedback_forward_cosine": 0.997499406337738 }, "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 0.20943366742134095 }, { "epoch": 84, "eval_accuracy": 0.8716, "eval_loss": 0.4457356201171875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06834620982408524, "mean_feedback_forward_cosine": 0.9988417311718589, "mean_feedback_forward_relative_error": 0.04744118040329531, "min_feedback_forward_cosine": 0.9976792335510254 }, "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 0.2061102368089888 }, { "epoch": 85, "eval_accuracy": 0.8524, "eval_loss": 0.5395504333496094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06592147052288055, "mean_feedback_forward_cosine": 0.9989195466041565, "mean_feedback_forward_relative_error": 0.04582055912990319, "min_feedback_forward_cosine": 0.9978403449058533 }, "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 0.20714529931810166 }, { "epoch": 86, "eval_accuracy": 0.875, "eval_loss": 0.4334523864746094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06359504163265228, "mean_feedback_forward_cosine": 0.9989917152806332, "mean_feedback_forward_relative_error": 0.04426226617866441, "min_feedback_forward_cosine": 0.9979900121688843 }, "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 0.20295997999509174 }, { "epoch": 87, "eval_accuracy": 0.873, "eval_loss": 0.43320928955078125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.06130767986178398, "mean_feedback_forward_cosine": 0.9990615468276175, "mean_feedback_forward_relative_error": 0.04270692159862895, "min_feedback_forward_cosine": 0.9981316328048706 }, "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 0.20736424657503763 }, { "epoch": 88, "eval_accuracy": 0.8666, "eval_loss": 0.45640607299804686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.059117674827575684, "mean_feedback_forward_cosine": 0.9991248218636763, "mean_feedback_forward_relative_error": 0.04123614924518686, "min_feedback_forward_cosine": 0.9982626438140869 }, "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 0.20548082500298817 }, { "epoch": 89, "eval_accuracy": 0.874, "eval_loss": 0.41520469360351564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.056990038603544235, "mean_feedback_forward_cosine": 0.9991847339429354, "mean_feedback_forward_relative_error": 0.039800861948414853, "min_feedback_forward_cosine": 0.9983851909637451 }, "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 0.20585563192102643 }, { "epoch": 90, "eval_accuracy": 0.839, "eval_loss": 0.569453662109375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.055011142045259476, "mean_feedback_forward_cosine": 0.9992381836238661, "mean_feedback_forward_relative_error": 0.038467583197512124, "min_feedback_forward_cosine": 0.9984948635101318 }, "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 0.20076531094180214 }, { "epoch": 91, "eval_accuracy": 0.8722, "eval_loss": 0.4262968078613281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.052972324192523956, "mean_feedback_forward_cosine": 0.9992925712936803, "mean_feedback_forward_relative_error": 0.03706920274386281, "min_feedback_forward_cosine": 0.9986041784286499 }, "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 0.20624251328044468 }, { "epoch": 92, "eval_accuracy": 0.871, "eval_loss": 0.4491199462890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.05109149217605591, "mean_feedback_forward_cosine": 0.9993400699213931, "mean_feedback_forward_relative_error": 0.03580162468317308, "min_feedback_forward_cosine": 0.9987013339996338 }, "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 0.19799577930238513 }, { "epoch": 93, "eval_accuracy": 0.8736, "eval_loss": 0.4416592041015625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0493144765496254, "mean_feedback_forward_cosine": 0.9993836095458583, "mean_feedback_forward_relative_error": 0.03459886961469525, "min_feedback_forward_cosine": 0.9987897276878357 }, "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 0.19725176190800137 }, { "epoch": 94, "eval_accuracy": 0.8626, "eval_loss": 0.47947452392578127, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.047581423074007034, "mean_feedback_forward_cosine": 0.9994248214520907, "mean_feedback_forward_relative_error": 0.03341968107576433, "min_feedback_forward_cosine": 0.9988730549812317 }, "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 0.19693422346115114 }, { "epoch": 95, "eval_accuracy": 0.8508, "eval_loss": 0.5477066467285157, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04589957743883133, "mean_feedback_forward_cosine": 0.9994630186181319, "mean_feedback_forward_relative_error": 0.032289010129476846, "min_feedback_forward_cosine": 0.9989511966705322 }, "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 0.19458590910699633 }, { "epoch": 96, "eval_accuracy": 0.8694, "eval_loss": 0.4502195617675781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04428688809275627, "mean_feedback_forward_cosine": 0.9994986276877554, "mean_feedback_forward_relative_error": 0.031198943376933273, "min_feedback_forward_cosine": 0.9990235567092896 }, "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 0.19458247496816847 }, { "epoch": 97, "eval_accuracy": 0.8682, "eval_loss": 0.46479819946289064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.04265602305531502, "mean_feedback_forward_cosine": 0.9995334713082564, "mean_feedback_forward_relative_error": 0.030095937563792655, "min_feedback_forward_cosine": 0.9990940690040588 }, "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 0.19885163509315915 }, { "epoch": 98, "eval_accuracy": 0.8678, "eval_loss": 0.4972033447265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.041172705590724945, "mean_feedback_forward_cosine": 0.9995646257149545, "mean_feedback_forward_relative_error": 0.029072351851745656, "min_feedback_forward_cosine": 0.9991556406021118 }, "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 0.19531077443758646 }, { "epoch": 99, "eval_accuracy": 0.8752, "eval_loss": 0.40619945068359375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03969261795282364, "mean_feedback_forward_cosine": 0.9995948766407213, "mean_feedback_forward_relative_error": 0.028044214913327443, "min_feedback_forward_cosine": 0.9992151260375977 }, "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 0.1985523914443122 }, { "epoch": 100, "eval_accuracy": 0.8546, "eval_loss": 0.5547154479980468, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03826097771525383, "mean_feedback_forward_cosine": 0.9996227025985718, "mean_feedback_forward_relative_error": 0.027064508856519273, "min_feedback_forward_cosine": 0.9992707967758179 }, "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 0.19719866987334358 }, { "epoch": 101, "eval_accuracy": 0.9096, "eval_loss": 0.31504560546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03824806213378906, "mean_feedback_forward_cosine": 0.9996229880734494, "mean_feedback_forward_relative_error": 0.02705035456701329, "min_feedback_forward_cosine": 0.9992711544036865 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.12498004048400455 }, { "epoch": 102, "eval_accuracy": 0.9116, "eval_loss": 0.31542617797851563, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03824153542518616, "mean_feedback_forward_cosine": 0.9996231637502971, "mean_feedback_forward_relative_error": 0.02704000105395129, "min_feedback_forward_cosine": 0.9992715716362 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.09414871436489954 }, { "epoch": 103, "eval_accuracy": 0.9148, "eval_loss": 0.3152183624267578, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03823477402329445, "mean_feedback_forward_cosine": 0.9996233425642315, "mean_feedback_forward_relative_error": 0.02702999928672063, "min_feedback_forward_cosine": 0.999271810054779 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.08886900408930248 }, { "epoch": 104, "eval_accuracy": 0.9156, "eval_loss": 0.3212423614501953, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038228511810302734, "mean_feedback_forward_cosine": 0.999623533926512, "mean_feedback_forward_relative_error": 0.027020629740467195, "min_feedback_forward_cosine": 0.9992719888687134 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.07943104676802953 }, { "epoch": 105, "eval_accuracy": 0.915, "eval_loss": 0.3224820953369141, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03822202607989311, "mean_feedback_forward_cosine": 0.9996236876437539, "mean_feedback_forward_relative_error": 0.02701137523706022, "min_feedback_forward_cosine": 0.9992722272872925 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.07692426940202712 }, { "epoch": 106, "eval_accuracy": 0.9132, "eval_loss": 0.3243196716308594, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03821607679128647, "mean_feedback_forward_cosine": 0.9996238539093419, "mean_feedback_forward_relative_error": 0.027002569288015366, "min_feedback_forward_cosine": 0.9992725253105164 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.0701384553776847 }, { "epoch": 107, "eval_accuracy": 0.9132, "eval_loss": 0.3256701171875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038209863007068634, "mean_feedback_forward_cosine": 0.9996240139007568, "mean_feedback_forward_relative_error": 0.02699356859451846, "min_feedback_forward_cosine": 0.9992727041244507 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.06748027348253462 }, { "epoch": 108, "eval_accuracy": 0.9144, "eval_loss": 0.333216845703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038203537464141846, "mean_feedback_forward_cosine": 0.999624208400124, "mean_feedback_forward_relative_error": 0.026984702501642078, "min_feedback_forward_cosine": 0.9992730021476746 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.06455075730615192 }, { "epoch": 109, "eval_accuracy": 0.9104, "eval_loss": 0.34080203857421876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03819728270173073, "mean_feedback_forward_cosine": 0.9996243401577598, "mean_feedback_forward_relative_error": 0.02697615119579591, "min_feedback_forward_cosine": 0.9992731809616089 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.06166491029262543 }, { "epoch": 110, "eval_accuracy": 0.914, "eval_loss": 0.3373171447753906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038191262632608414, "mean_feedback_forward_cosine": 0.9996245283829538, "mean_feedback_forward_relative_error": 0.02696770125705945, "min_feedback_forward_cosine": 0.999273419380188 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.05793297163115607 }, { "epoch": 111, "eval_accuracy": 0.9152, "eval_loss": 0.3412690979003906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0381854884326458, "mean_feedback_forward_cosine": 0.9996246883743688, "mean_feedback_forward_relative_error": 0.026959390379488468, "min_feedback_forward_cosine": 0.9992736577987671 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.05538705672224363 }, { "epoch": 112, "eval_accuracy": 0.9112, "eval_loss": 0.34866596069335937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03817934915423393, "mean_feedback_forward_cosine": 0.9996248546399569, "mean_feedback_forward_relative_error": 0.026950864709521596, "min_feedback_forward_cosine": 0.9992738962173462 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.05465268326600393 }, { "epoch": 113, "eval_accuracy": 0.9114, "eval_loss": 0.3563314697265625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03817310184240341, "mean_feedback_forward_cosine": 0.9996250209055448, "mean_feedback_forward_relative_error": 0.026942566282262926, "min_feedback_forward_cosine": 0.9992742538452148 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.05348444962501526 }, { "epoch": 114, "eval_accuracy": 0.9146, "eval_loss": 0.3597590148925781, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03816705942153931, "mean_feedback_forward_cosine": 0.9996251683486136, "mean_feedback_forward_relative_error": 0.026934282364029633, "min_feedback_forward_cosine": 0.9992744326591492 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.05038708394269149 }, { "epoch": 115, "eval_accuracy": 0.915, "eval_loss": 0.3545485961914063, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038161080330610275, "mean_feedback_forward_cosine": 0.9996253597108942, "mean_feedback_forward_relative_error": 0.02692613059556798, "min_feedback_forward_cosine": 0.9992746710777283 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.047704472191300654 }, { "epoch": 116, "eval_accuracy": 0.9148, "eval_loss": 0.3614710632324219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038155052810907364, "mean_feedback_forward_cosine": 0.9996255008797896, "mean_feedback_forward_relative_error": 0.026917944368171066, "min_feedback_forward_cosine": 0.999274730682373 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.046668650693363616 }, { "epoch": 117, "eval_accuracy": 0.9118, "eval_loss": 0.36147152099609375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038148727267980576, "mean_feedback_forward_cosine": 0.9996256859678971, "mean_feedback_forward_relative_error": 0.026909909701268924, "min_feedback_forward_cosine": 0.9992750883102417 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.0468660827504264 }, { "epoch": 118, "eval_accuracy": 0.9142, "eval_loss": 0.36134048461914064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03814224898815155, "mean_feedback_forward_cosine": 0.9996258585076583, "mean_feedback_forward_relative_error": 0.026901894298038985, "min_feedback_forward_cosine": 0.9992753863334656 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.04667721270521482 }, { "epoch": 119, "eval_accuracy": 0.9118, "eval_loss": 0.3710879089355469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03813629969954491, "mean_feedback_forward_cosine": 0.9996260247732464, "mean_feedback_forward_relative_error": 0.026893928549007365, "min_feedback_forward_cosine": 0.9992755651473999 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.04263128900461727 }, { "epoch": 120, "eval_accuracy": 0.9124, "eval_loss": 0.37179076538085937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038130130618810654, "mean_feedback_forward_cosine": 0.9996262004500941, "mean_feedback_forward_relative_error": 0.026885935301451308, "min_feedback_forward_cosine": 0.9992758631706238 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.04206890949805578 }, { "epoch": 121, "eval_accuracy": 0.9148, "eval_loss": 0.3723926452636719, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038124118000268936, "mean_feedback_forward_cosine": 0.9996263635785956, "mean_feedback_forward_relative_error": 0.02687794715166092, "min_feedback_forward_cosine": 0.9992761015892029 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.04026431170701981 }, { "epoch": 122, "eval_accuracy": 0.9142, "eval_loss": 0.3758395263671875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03811798617243767, "mean_feedback_forward_cosine": 0.9996265361183568, "mean_feedback_forward_relative_error": 0.02686990219119348, "min_feedback_forward_cosine": 0.9992762804031372 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.03920797461072604 }, { "epoch": 123, "eval_accuracy": 0.9152, "eval_loss": 0.3701650634765625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03811146691441536, "mean_feedback_forward_cosine": 0.9996267274806374, "mean_feedback_forward_relative_error": 0.02686190257143033, "min_feedback_forward_cosine": 0.9992765188217163 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.040231052759620876 }, { "epoch": 124, "eval_accuracy": 0.9148, "eval_loss": 0.3734594177246094, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038105301558971405, "mean_feedback_forward_cosine": 0.9996268906091389, "mean_feedback_forward_relative_error": 0.026853734676383044, "min_feedback_forward_cosine": 0.9992768168449402 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.038030407783057954 }, { "epoch": 125, "eval_accuracy": 0.9142, "eval_loss": 0.37734255981445314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038098517805337906, "mean_feedback_forward_cosine": 0.9996270788343329, "mean_feedback_forward_relative_error": 0.02684540046673072, "min_feedback_forward_cosine": 0.9992770552635193 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.03932609410782655 }, { "epoch": 126, "eval_accuracy": 0.9162, "eval_loss": 0.37866737670898437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0380915105342865, "mean_feedback_forward_cosine": 0.999627267059527, "mean_feedback_forward_relative_error": 0.026837026700377464, "min_feedback_forward_cosine": 0.9992772936820984 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.037950586869650416 }, { "epoch": 127, "eval_accuracy": 0.9132, "eval_loss": 0.39278297119140626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038084693253040314, "mean_feedback_forward_cosine": 0.9996274395992881, "mean_feedback_forward_relative_error": 0.02682868611851805, "min_feedback_forward_cosine": 0.9992775321006775 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.03678174229264259 }, { "epoch": 128, "eval_accuracy": 0.915, "eval_loss": 0.38518326416015625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03807844966650009, "mean_feedback_forward_cosine": 0.9996276246873956, "mean_feedback_forward_relative_error": 0.026820657823823, "min_feedback_forward_cosine": 0.9992778301239014 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.03376755590836207 }, { "epoch": 129, "eval_accuracy": 0.9154, "eval_loss": 0.3975419860839844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03807184472680092, "mean_feedback_forward_cosine": 0.9996278191867628, "mean_feedback_forward_relative_error": 0.026812335966449035, "min_feedback_forward_cosine": 0.9992780685424805 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.03459894592629539 }, { "epoch": 130, "eval_accuracy": 0.9134, "eval_loss": 0.3980976745605469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03806491941213608, "mean_feedback_forward_cosine": 0.9996280074119568, "mean_feedback_forward_relative_error": 0.02680385995068048, "min_feedback_forward_cosine": 0.9992783665657043 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.034467040161291755 }, { "epoch": 131, "eval_accuracy": 0.9106, "eval_loss": 0.401936376953125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03805799409747124, "mean_feedback_forward_cosine": 0.999628157992112, "mean_feedback_forward_relative_error": 0.026795381287995138, "min_feedback_forward_cosine": 0.9992786049842834 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.03290436211890645 }, { "epoch": 132, "eval_accuracy": 0.9158, "eval_loss": 0.39828818969726565, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03805088624358177, "mean_feedback_forward_cosine": 0.9996284026848642, "mean_feedback_forward_relative_error": 0.02678674944725476, "min_feedback_forward_cosine": 0.9992789030075073 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.03265204352868928 }, { "epoch": 133, "eval_accuracy": 0.9134, "eval_loss": 0.4009542297363281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0380437932908535, "mean_feedback_forward_cosine": 0.999628600321318, "mean_feedback_forward_relative_error": 0.02677821461111307, "min_feedback_forward_cosine": 0.9992791414260864 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.03201477077437772 }, { "epoch": 134, "eval_accuracy": 0.9138, "eval_loss": 0.40583228759765627, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038036979734897614, "mean_feedback_forward_cosine": 0.9996287540385598, "mean_feedback_forward_relative_error": 0.026769806189756645, "min_feedback_forward_cosine": 0.999279260635376 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.031194838628504012 }, { "epoch": 135, "eval_accuracy": 0.9122, "eval_loss": 0.3971060607910156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038029663264751434, "mean_feedback_forward_cosine": 0.999628976771706, "mean_feedback_forward_relative_error": 0.026760906618284553, "min_feedback_forward_cosine": 0.9992796182632446 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.03187097754743364 }, { "epoch": 136, "eval_accuracy": 0.9136, "eval_loss": 0.40547701416015625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038022592663764954, "mean_feedback_forward_cosine": 0.9996291806823329, "mean_feedback_forward_relative_error": 0.026752426828208723, "min_feedback_forward_cosine": 0.999279797077179 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.029618267251054445 }, { "epoch": 137, "eval_accuracy": 0.9144, "eval_loss": 0.40041107177734375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.038015320897102356, "mean_feedback_forward_cosine": 0.9996294034154791, "mean_feedback_forward_relative_error": 0.02674361695780566, "min_feedback_forward_cosine": 0.9992802143096924 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.03065378427306811 }, { "epoch": 138, "eval_accuracy": 0.9152, "eval_loss": 0.4129467590332031, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03800799697637558, "mean_feedback_forward_cosine": 0.9996295885035866, "mean_feedback_forward_relative_error": 0.026734913454244013, "min_feedback_forward_cosine": 0.9992804527282715 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 0.02922247618569268 }, { "epoch": 139, "eval_accuracy": 0.916, "eval_loss": 0.40856820678710937, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03800143301486969, "mean_feedback_forward_cosine": 0.999629773591694, "mean_feedback_forward_relative_error": 0.02672667232783217, "min_feedback_forward_cosine": 0.9992806911468506 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.02787504948510064 }, { "epoch": 140, "eval_accuracy": 0.912, "eval_loss": 0.43249401245117186, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03799450770020485, "mean_feedback_forward_cosine": 0.999629977502321, "mean_feedback_forward_relative_error": 0.026718208664341977, "min_feedback_forward_cosine": 0.9992810487747192 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.027838887613349492 }, { "epoch": 141, "eval_accuracy": 0.9126, "eval_loss": 0.4213609069824219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037987120449543, "mean_feedback_forward_cosine": 0.9996301782758612, "mean_feedback_forward_relative_error": 0.02670954457043033, "min_feedback_forward_cosine": 0.9992812275886536 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 0.02806180555969477 }, { "epoch": 142, "eval_accuracy": 0.9142, "eval_loss": 0.42442941284179686, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037980616092681885, "mean_feedback_forward_cosine": 0.9996303570897955, "mean_feedback_forward_relative_error": 0.02670134569665319, "min_feedback_forward_cosine": 0.9992814064025879 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 0.025535029594269065 }, { "epoch": 143, "eval_accuracy": 0.914, "eval_loss": 0.42216495971679685, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03797249123454094, "mean_feedback_forward_cosine": 0.9996305798229418, "mean_feedback_forward_relative_error": 0.026691938505360956, "min_feedback_forward_cosine": 0.9992818236351013 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 0.028624223914245763 }, { "epoch": 144, "eval_accuracy": 0.9144, "eval_loss": 0.4278658020019531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037965077906847, "mean_feedback_forward_cosine": 0.9996307805964821, "mean_feedback_forward_relative_error": 0.026683067559803788, "min_feedback_forward_cosine": 0.9992820620536804 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 0.026180000118662915 }, { "epoch": 145, "eval_accuracy": 0.9138, "eval_loss": 0.427544677734375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03795746713876724, "mean_feedback_forward_cosine": 0.9996310190150612, "mean_feedback_forward_relative_error": 0.026674046377210242, "min_feedback_forward_cosine": 0.9992823600769043 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 0.026351813669668305 }, { "epoch": 146, "eval_accuracy": 0.9158, "eval_loss": 0.42938318481445314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03794943168759346, "mean_feedback_forward_cosine": 0.9996312386111209, "mean_feedback_forward_relative_error": 0.02666486049757192, "min_feedback_forward_cosine": 0.999282717704773 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.026147830514444245 }, { "epoch": 147, "eval_accuracy": 0.9154, "eval_loss": 0.43108264770507815, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037941813468933105, "mean_feedback_forward_cosine": 0.9996314613442672, "mean_feedback_forward_relative_error": 0.026655893233653746, "min_feedback_forward_cosine": 0.999282956123352 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.025178877196378176 }, { "epoch": 148, "eval_accuracy": 0.912, "eval_loss": 0.43701239624023436, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03793426975607872, "mean_feedback_forward_cosine": 0.9996316495694613, "mean_feedback_forward_relative_error": 0.026646792251420647, "min_feedback_forward_cosine": 0.9992832541465759 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 0.024480403775639006 }, { "epoch": 149, "eval_accuracy": 0.9118, "eval_loss": 0.4395541748046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037926580756902695, "mean_feedback_forward_cosine": 0.9996318691655209, "mean_feedback_forward_relative_error": 0.02663764043858177, "min_feedback_forward_cosine": 0.9992836117744446 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 0.024357059074110454 }, { "epoch": 150, "eval_accuracy": 0.914, "eval_loss": 0.4387383911132812, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791917487978935, "mean_feedback_forward_cosine": 0.9996321075841, "mean_feedback_forward_relative_error": 0.02662865788136658, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 0.023285648666487798 }, { "epoch": 151, "eval_accuracy": 0.9142, "eval_loss": 0.43026748046875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0379190668463707, "mean_feedback_forward_cosine": 0.9996320981728403, "mean_feedback_forward_relative_error": 0.026628399218775724, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 0.0211612816479471 }, { "epoch": 152, "eval_accuracy": 0.914, "eval_loss": 0.42774334716796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918996065855026, "mean_feedback_forward_cosine": 0.9996321013099269, "mean_feedback_forward_relative_error": 0.026628176142510614, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.02011557665401035 }, { "epoch": 153, "eval_accuracy": 0.9134, "eval_loss": 0.4272701232910156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791893273591995, "mean_feedback_forward_cosine": 0.9996320981728403, "mean_feedback_forward_relative_error": 0.0266279557131623, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.019754009400142564 }, { "epoch": 154, "eval_accuracy": 0.9158, "eval_loss": 0.423570166015625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791886940598488, "mean_feedback_forward_cosine": 0.9996320950357538, "mean_feedback_forward_relative_error": 0.026627739205172186, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.019484071310361225 }, { "epoch": 155, "eval_accuracy": 0.9162, "eval_loss": 0.42812459716796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918820977211, "mean_feedback_forward_cosine": 0.9996320981728403, "mean_feedback_forward_relative_error": 0.02662751343297331, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.01772839131222831 }, { "epoch": 156, "eval_accuracy": 0.9168, "eval_loss": 0.4284971862792969, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791876137256622, "mean_feedback_forward_cosine": 0.9996321044470134, "mean_feedback_forward_relative_error": 0.026627286141248124, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.01800470546417766 }, { "epoch": 157, "eval_accuracy": 0.9156, "eval_loss": 0.425212060546875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791870176792145, "mean_feedback_forward_cosine": 0.9996321138582731, "mean_feedback_forward_relative_error": 0.026627064094339545, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.019227959014640913 }, { "epoch": 158, "eval_accuracy": 0.9154, "eval_loss": 0.4282466613769531, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791864588856697, "mean_feedback_forward_cosine": 0.9996321326807925, "mean_feedback_forward_relative_error": 0.026626851164588804, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.017664594351748625 }, { "epoch": 159, "eval_accuracy": 0.9174, "eval_loss": 0.42084263916015624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791859373450279, "mean_feedback_forward_cosine": 0.9996321138582731, "mean_feedback_forward_relative_error": 0.026626633970361007, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.017749026487767695 }, { "epoch": 160, "eval_accuracy": 0.9164, "eval_loss": 0.42557537231445314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918537855148315, "mean_feedback_forward_cosine": 0.9996321201324463, "mean_feedback_forward_relative_error": 0.02662641520758993, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.01739938084317578 }, { "epoch": 161, "eval_accuracy": 0.9164, "eval_loss": 0.42110528564453126, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918489426374435, "mean_feedback_forward_cosine": 0.9996321389549657, "mean_feedback_forward_relative_error": 0.026626198503531907, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.01759473463681837 }, { "epoch": 162, "eval_accuracy": 0.9154, "eval_loss": 0.42479563598632814, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918440997600555, "mean_feedback_forward_cosine": 0.999632151503312, "mean_feedback_forward_relative_error": 0.026625978564353364, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.01624706518434816 }, { "epoch": 163, "eval_accuracy": 0.9128, "eval_loss": 0.4251840393066406, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791838884353638, "mean_feedback_forward_cosine": 0.9996321075841, "mean_feedback_forward_relative_error": 0.02662576034076904, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.01809051398370001 }, { "epoch": 164, "eval_accuracy": 0.9162, "eval_loss": 0.42689862060546874, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0379183292388916, "mean_feedback_forward_cosine": 0.9996321232695329, "mean_feedback_forward_relative_error": 0.02662554500918639, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.017154754579729505 }, { "epoch": 165, "eval_accuracy": 0.9156, "eval_loss": 0.42907059326171876, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791828826069832, "mean_feedback_forward_cosine": 0.9996321420920523, "mean_feedback_forward_relative_error": 0.026625329530552813, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.015940935181909137 }, { "epoch": 166, "eval_accuracy": 0.9146, "eval_loss": 0.42847799072265624, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791823983192444, "mean_feedback_forward_cosine": 0.9996321483662254, "mean_feedback_forward_relative_error": 0.026625118463447218, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.01682934757007493 }, { "epoch": 167, "eval_accuracy": 0.9148, "eval_loss": 0.42574083251953126, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791818395256996, "mean_feedback_forward_cosine": 0.9996321169953597, "mean_feedback_forward_relative_error": 0.026624903916136214, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.016822115646633835 }, { "epoch": 168, "eval_accuracy": 0.9148, "eval_loss": 0.4300515563964844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918128073215485, "mean_feedback_forward_cosine": 0.9996321326807925, "mean_feedback_forward_relative_error": 0.026624686182721666, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.016840671036309665 }, { "epoch": 169, "eval_accuracy": 0.9152, "eval_loss": 0.42753214111328125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037918079644441605, "mean_feedback_forward_cosine": 0.999632157777485, "mean_feedback_forward_relative_error": 0.026624476488091443, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.01653002626688944 }, { "epoch": 170, "eval_accuracy": 0.9152, "eval_loss": 0.4329725341796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791803494095802, "mean_feedback_forward_cosine": 0.9996321452291388, "mean_feedback_forward_relative_error": 0.026624266499359357, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.01631236160033279 }, { "epoch": 171, "eval_accuracy": 0.915, "eval_loss": 0.43096278686523437, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791797533631325, "mean_feedback_forward_cosine": 0.9996321483662254, "mean_feedback_forward_relative_error": 0.026624056167508427, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.017680182982815637 }, { "epoch": 172, "eval_accuracy": 0.915, "eval_loss": 0.4310341735839844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791791573166847, "mean_feedback_forward_cosine": 0.9996321640516582, "mean_feedback_forward_relative_error": 0.0266238445121991, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.01705649436513583 }, { "epoch": 173, "eval_accuracy": 0.9148, "eval_loss": 0.4284998229980469, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037917863577604294, "mean_feedback_forward_cosine": 0.999632157777485, "mean_feedback_forward_relative_error": 0.02662362472007149, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.016325897006193798 }, { "epoch": 174, "eval_accuracy": 0.9156, "eval_loss": 0.42368416137695314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791780769824982, "mean_feedback_forward_cosine": 0.9996321671887448, "mean_feedback_forward_relative_error": 0.026623414927407316, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.016306531962255635 }, { "epoch": 175, "eval_accuracy": 0.915, "eval_loss": 0.42613728637695314, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791775926947594, "mean_feedback_forward_cosine": 0.9996321546403986, "mean_feedback_forward_relative_error": 0.026623194743143886, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.016608378148078917 }, { "epoch": 176, "eval_accuracy": 0.915, "eval_loss": 0.42469633178710936, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791771084070206, "mean_feedback_forward_cosine": 0.9996321483662254, "mean_feedback_forward_relative_error": 0.026622989509058625, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.01599796301147176 }, { "epoch": 177, "eval_accuracy": 0.9142, "eval_loss": 0.42996865234375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791766241192818, "mean_feedback_forward_cosine": 0.9996321766000045, "mean_feedback_forward_relative_error": 0.026622781431988665, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.0145107354823086 }, { "epoch": 178, "eval_accuracy": 0.9154, "eval_loss": 0.42992142333984373, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.0379176065325737, "mean_feedback_forward_cosine": 0.9996321452291388, "mean_feedback_forward_relative_error": 0.026622566737626727, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.016593861082527372 }, { "epoch": 179, "eval_accuracy": 0.9154, "eval_loss": 0.429712548828125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791755437850952, "mean_feedback_forward_cosine": 0.9996321671887448, "mean_feedback_forward_relative_error": 0.026622350278653596, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.015633646452095775 }, { "epoch": 180, "eval_accuracy": 0.9142, "eval_loss": 0.4295874938964844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037917498499155045, "mean_feedback_forward_cosine": 0.9996321671887448, "mean_feedback_forward_relative_error": 0.026622139946802667, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.01656670587816172 }, { "epoch": 181, "eval_accuracy": 0.9166, "eval_loss": 0.4243903991699219, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037917450070381165, "mean_feedback_forward_cosine": 0.9996321797370911, "mean_feedback_forward_relative_error": 0.02662193775177002, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.01582161951859792 }, { "epoch": 182, "eval_accuracy": 0.9154, "eval_loss": 0.43365278930664064, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791740536689758, "mean_feedback_forward_cosine": 0.999632157777485, "mean_feedback_forward_relative_error": 0.02662172746893607, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.014813974743419223 }, { "epoch": 183, "eval_accuracy": 0.9148, "eval_loss": 0.42709647216796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791734576225281, "mean_feedback_forward_cosine": 0.9996321891483507, "mean_feedback_forward_relative_error": 0.026621517872339802, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.01592662673095862 }, { "epoch": 184, "eval_accuracy": 0.9162, "eval_loss": 0.4307603088378906, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791729733347893, "mean_feedback_forward_cosine": 0.9996321671887448, "mean_feedback_forward_relative_error": 0.026621317441918348, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.016338840604159566 }, { "epoch": 185, "eval_accuracy": 0.9146, "eval_loss": 0.43272603149414063, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037917252629995346, "mean_feedback_forward_cosine": 0.9996321860112642, "mean_feedback_forward_relative_error": 0.02662111627624223, "min_feedback_forward_cosine": 0.999284029006958 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.015533369680245717 }, { "epoch": 186, "eval_accuracy": 0.9148, "eval_loss": 0.43155269775390626, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791719302535057, "mean_feedback_forward_cosine": 0.9996321640516582, "mean_feedback_forward_relative_error": 0.02662091192446257, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.015310422006249427 }, { "epoch": 187, "eval_accuracy": 0.9148, "eval_loss": 0.431560595703125, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791714087128639, "mean_feedback_forward_cosine": 0.9996321954225239, "mean_feedback_forward_relative_error": 0.02662071384685604, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.015171491112642817 }, { "epoch": 188, "eval_accuracy": 0.9154, "eval_loss": 0.4299284484863281, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791709616780281, "mean_feedback_forward_cosine": 0.9996321703258314, "mean_feedback_forward_relative_error": 0.026620496799679177, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.015132849889993668 }, { "epoch": 189, "eval_accuracy": 0.9144, "eval_loss": 0.43136605224609376, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037917036563158035, "mean_feedback_forward_cosine": 0.9996321922854373, "mean_feedback_forward_relative_error": 0.02662028823243944, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.01564434177271194 }, { "epoch": 190, "eval_accuracy": 0.9138, "eval_loss": 0.42769647216796874, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916988134384155, "mean_feedback_forward_cosine": 0.9996322142450433, "mean_feedback_forward_relative_error": 0.02662007956716575, "min_feedback_forward_cosine": 0.9992838501930237 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.015331490024593141 }, { "epoch": 191, "eval_accuracy": 0.9144, "eval_loss": 0.43386570434570315, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791693598031998, "mean_feedback_forward_cosine": 0.9996321891483507, "mean_feedback_forward_relative_error": 0.026619868353009224, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.015315960738725133 }, { "epoch": 192, "eval_accuracy": 0.9144, "eval_loss": 0.43133213500976564, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916891276836395, "mean_feedback_forward_cosine": 0.9996322111079567, "mean_feedback_forward_relative_error": 0.026619663118923966, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.015171922739346822 }, { "epoch": 193, "eval_accuracy": 0.9144, "eval_loss": 0.431591796875, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916846573352814, "mean_feedback_forward_cosine": 0.9996322205192164, "mean_feedback_forward_relative_error": 0.02661946067880643, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.014588061490986083 }, { "epoch": 194, "eval_accuracy": 0.9144, "eval_loss": 0.4299183837890625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916794419288635, "mean_feedback_forward_cosine": 0.9996322079708702, "mean_feedback_forward_relative_error": 0.0266192503469555, "min_feedback_forward_cosine": 0.9992837905883789 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.015228129545847575 }, { "epoch": 195, "eval_accuracy": 0.916, "eval_loss": 0.4288531494140625, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791675344109535, "mean_feedback_forward_cosine": 0.9996321985596105, "mean_feedback_forward_relative_error": 0.026619042858089272, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.014976719170146518 }, { "epoch": 196, "eval_accuracy": 0.9144, "eval_loss": 0.4313197021484375, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916697561740875, "mean_feedback_forward_cosine": 0.9996321891483507, "mean_feedback_forward_relative_error": 0.026618830761627146, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.01579895223768221 }, { "epoch": 197, "eval_accuracy": 0.9152, "eval_loss": 0.4294109436035156, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916649132966995, "mean_feedback_forward_cosine": 0.9996321891483507, "mean_feedback_forward_relative_error": 0.026618630282188718, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.014463566927115123 }, { "epoch": 198, "eval_accuracy": 0.9168, "eval_loss": 0.42698069458007815, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916600704193115, "mean_feedback_forward_cosine": 0.9996321985596105, "mean_feedback_forward_relative_error": 0.02661842259725458, "min_feedback_forward_cosine": 0.9992839694023132 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.015557571692268053 }, { "epoch": 199, "eval_accuracy": 0.916, "eval_loss": 0.43350626220703126, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.037916556000709534, "mean_feedback_forward_cosine": 0.9996322205192164, "mean_feedback_forward_relative_error": 0.0266182226570029, "min_feedback_forward_cosine": 0.999284029006958 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.014629167970021565 }, { "epoch": 200, "eval_accuracy": 0.9144, "eval_loss": 0.4333634704589844, "eval_split": "validation", "feedback_tracking": { "max_feedback_forward_relative_error": 0.03791650012135506, "mean_feedback_forward_cosine": 0.9996322111079567, "mean_feedback_forward_relative_error": 0.026618016491595068, "min_feedback_forward_cosine": 0.9992839097976685 }, "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.016335480781065094 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.9144, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.4333634704589844, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2010747392, "peak_memory_reserved_bytes": 2552233984, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 21.03406047821045, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1780.5374817848206, "train_wall_s": 1758.6518173217773 }, "work": { "apical_macs_per_example": 40108672, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 360978048000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 360978048000000, "local_weight_correlation_macs": 364959360000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1451874816000000 } }