{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 267904, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 0, "fixed_traffic_coefficients": 0, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/home/yurenh2/sdrn/data", "depth": 20, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 0, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 20, "mode": "rrm", "momentum": 0.9, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "results/residual_mirror_full/rrm.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 0, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": "local_parent_child_response_residual", "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 4420, "mirror_events": 4420, "mirror_readout_examples": 4526080, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_warmup_examples": 0 }, "diagnostics": { "early_third_mean": 0.8774353464444479, "feedback_forward_cosine": [ 1.0, 1.0, 1.0, 1.0, 1.0, 1.0, 1.0, 1.0, 0.9999998807907104, 1.0, 1.0, 0.9999999403953552, 1.0, 0.9999999403953552, 1.0, 0.9999998807907104, 0.9999998807907104, 1.0, 0.999961793422699 ], "feedback_forward_norm_ratio": [ 1.000159502029419, 1.000159740447998, 1.0001599788665771, 1.0001596212387085, 1.0001596212387085, 1.0001600980758667, 1.000162959098816, 1.0001602172851562, 1.000161051750183, 1.0001603364944458, 1.0001589059829712, 1.000158667564392, 1.0001603364944458, 1.0001589059829712, 1.0001580715179443, 1.0001592636108398, 1.000157356262207, 1.0001590251922607, 1.0024465322494507 ], "innovation_negative_gradient_cosine": [ 0.8722070455551147, 0.8785926699638367, 0.8789833784103394, 0.877299964427948, 0.8784912824630737, 0.8790377378463745, 0.8774803876876831, 0.8692848086357117, 0.8782165050506592, 0.8673566579818726, 0.8740392923355103, 0.8405126929283142, 0.8707835078239441, 0.848376452922821, 0.8770161867141724, 0.8456900119781494, 0.9081377387046814, 0.8670427799224854, 0.43746840953826904 ], "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.8722070455551147, 0.8785926699638367, 0.8789833784103394, 0.877299964427948, 0.8784912824630737, 0.8790377378463745, 0.8774803876876831, 0.8692848086357117, 0.8782165050506592, 0.8673566579818726, 0.8740392923355103, 0.8405126929283142, 0.8707835078239441, 0.848376452922821, 0.8770161867141724, 0.8456900119781494, 0.9081377387046814, 0.8670427799224854, 0.43746840953826904 ], "teaching_negative_gradient_cosine": [ 0.8722070455551147, 0.8785926699638367, 0.8789833784103394, 0.877299964427948, 0.8784912824630737, 0.8790377378463745, 0.8774803876876831, 0.8692848086357117, 0.8782165050506592, 0.8673566579818726, 0.8740392923355103, 0.8405126929283142, 0.8707835078239441, 0.848376452922821, 0.8770161867141724, 0.8456900119781494, 0.9081377387046814, 0.8670427799224854, 0.43746840953826904 ], "wall_s": 0.12804341316223145 }, "epochs": [ { "epoch": 1, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.21472547346632692, "mirror_response_residual_rms": 0.2952180119297088, "mirror_update_rms": 0.05842629268416273, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 352, "train_examples": 45000, "train_loss": 2.6106753037346735 }, { "epoch": 2, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.15766319208710644, "mirror_response_residual_rms": 0.2251705946689076, "mirror_update_rms": 0.029419690545340785, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 704, "train_examples": 45000, "train_loss": 2.507496058061388 }, { "epoch": 3, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14360009119075642, "mirror_response_residual_rms": 0.21789556492020895, "mirror_update_rms": 0.024176202518473574, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 1056, "train_examples": 45000, "train_loss": 2.3631224157333373 }, { "epoch": 4, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.13956318963644174, "mirror_response_residual_rms": 0.2275245609332117, "mirror_update_rms": 0.023461374725354724, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 1408, "train_examples": 45000, "train_loss": 2.407446045939128 }, { "epoch": 5, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14322111557358022, "mirror_response_residual_rms": 0.2562621412969786, "mirror_update_rms": 0.02647737383341734, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 3.116548478105333 }, { "epoch": 6, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14567420421636174, "mirror_response_residual_rms": 0.2909153129107003, "mirror_update_rms": 0.030809725691105457, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 3.5446029083251953 }, { "epoch": 7, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1501736402592817, "mirror_response_residual_rms": 0.33786408134495804, "mirror_update_rms": 0.03518108381263723, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 4.556180107116699 }, { "epoch": 8, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1575769384844244, "mirror_response_residual_rms": 0.40699926289597027, "mirror_update_rms": 0.04229958157085732, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 6.37619294535319 }, { "epoch": 9, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1527819485339171, "mirror_response_residual_rms": 0.4540714081553837, "mirror_update_rms": 0.04667154633073083, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 7.500557015991211 }, { "epoch": 10, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1453256332382141, "mirror_response_residual_rms": 0.4906493030655051, "mirror_update_rms": 0.052956356645615044, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 8.279763238016765 }, { "epoch": 11, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14547492011618718, "mirror_response_residual_rms": 0.5564810488728783, "mirror_update_rms": 0.05899267587832491, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 10.849900153944228 }, { "epoch": 12, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14372628437196464, "mirror_response_residual_rms": 0.6242942240346081, "mirror_update_rms": 0.06731443842928729, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 13.869815299987794 }, { "epoch": 13, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.148832145293135, "mirror_response_residual_rms": 0.7445651127936855, "mirror_update_rms": 0.08094001692560394, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 19.6516478451199 }, { "epoch": 14, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14691836590168458, "mirror_response_residual_rms": 0.8481962493905075, "mirror_update_rms": 0.09503342386989845, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 25.50753713446723 }, { "epoch": 15, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.14379049690829254, "mirror_response_residual_rms": 0.9495757975526531, "mirror_update_rms": 0.10675460737862502, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 30.04840303717719 }, { "epoch": 16, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1507171526261422, "mirror_response_residual_rms": 1.1510456359288477, "mirror_update_rms": 0.12834573186914466, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 45.06078114624023 }, { "epoch": 17, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.15367017306020433, "mirror_response_residual_rms": 1.37932800198578, "mirror_update_rms": 0.157787521273463, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 63.5289334499783 }, { "epoch": 18, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.15778397220927287, "mirror_response_residual_rms": 1.6670247928094992, "mirror_update_rms": 0.19010092950359214, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 88.0200079155816 }, { "epoch": 19, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16451180865244322, "mirror_response_residual_rms": 2.07706585442247, "mirror_update_rms": 0.23401384275961049, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 137.8758198594835 }, { "epoch": 20, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16324027357678314, "mirror_response_residual_rms": 2.4645421680686357, "mirror_update_rms": 0.28651428026731585, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 195.62825753580728 }, { "epoch": 21, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16087264351439118, "mirror_response_residual_rms": 2.8832505643891166, "mirror_update_rms": 0.33799926118866, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 242.12724807400173 }, { "epoch": 22, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16066775997432384, "mirror_response_residual_rms": 3.4065093210563533, "mirror_update_rms": 0.40086883494305686, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 374.081559109158 }, { "epoch": 23, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1605061240086014, "mirror_response_residual_rms": 4.04260058210834, "mirror_update_rms": 0.4765740674998487, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 482.38347734375 }, { "epoch": 24, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16148118244370566, "mirror_response_residual_rms": 4.864803373614072, "mirror_update_rms": 0.5765041467876094, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 669.3851554253472 }, { "epoch": 25, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16112621762216398, "mirror_response_residual_rms": 5.7837605311443605, "mirror_update_rms": 0.6935191516283535, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 945.77810703125 }, { "epoch": 26, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16955177432825977, "mirror_response_residual_rms": 7.38037095066013, "mirror_update_rms": 0.887455653630104, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 1498.9955378689235 }, { "epoch": 27, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.165461056050357, "mirror_response_residual_rms": 8.671575736742273, "mirror_update_rms": 1.0559527828793684, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 2073.428576931424 }, { "epoch": 28, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.16891245524497428, "mirror_response_residual_rms": 10.776266650324944, "mirror_update_rms": 1.3449962853721882, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 3305.028286545139 }, { "epoch": 29, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1822719349967337, "mirror_response_residual_rms": 14.59802131644838, "mirror_update_rms": 1.7913343699511124, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 5879.760441753472 }, { "epoch": 30, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17733698926528618, "mirror_response_residual_rms": 17.678691942838245, "mirror_update_rms": 2.2343160417827197, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 8133.397268142361 }, { "epoch": 31, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18213210933401422, "mirror_response_residual_rms": 22.904314957885802, "mirror_update_rms": 2.8373341960709793, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 13725.4761734375 }, { "epoch": 32, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1789663801607258, "mirror_response_residual_rms": 27.909721052714108, "mirror_update_rms": 3.500229807028831, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 21255.801840277778 }, { "epoch": 33, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1826883230505971, "mirror_response_residual_rms": 36.14833313188745, "mirror_update_rms": 4.585687181367318, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 34844.32973229167 }, { "epoch": 34, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18316842271969627, "mirror_response_residual_rms": 45.552103503047434, "mirror_update_rms": 5.635638935034679, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 54909.510695833334 }, { "epoch": 35, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17648959479192375, "mirror_response_residual_rms": 54.71937135242436, "mirror_update_rms": 7.081058243249486, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 78984.31330972222 }, { "epoch": 36, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18068314391799956, "mirror_response_residual_rms": 70.05446728839674, "mirror_update_rms": 8.812665459758465, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 127665.53662222222 }, { "epoch": 37, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17869210854684028, "mirror_response_residual_rms": 86.35653559685802, "mirror_update_rms": 10.983280710794133, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 201991.81146111112 }, { "epoch": 38, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18076611558431824, "mirror_response_residual_rms": 109.84225883439413, "mirror_update_rms": 13.950523977016003, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 309671.7070666667 }, { "epoch": 39, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17605196837879125, "mirror_response_residual_rms": 133.35982368514505, "mirror_update_rms": 17.57761647720774, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 465965.03088888887 }, { "epoch": 40, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18244029527013597, "mirror_response_residual_rms": 173.67093988393012, "mirror_update_rms": 22.281607999226715, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 811913.9667111111 }, { "epoch": 41, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18349701300469448, "mirror_response_residual_rms": 222.03079537354787, "mirror_update_rms": 29.00421429258447, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 1318171.975288889 }, { "epoch": 42, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1865372831351474, "mirror_response_residual_rms": 287.27786676741204, "mirror_update_rms": 36.48357445045527, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 2149740.2739333333 }, { "epoch": 43, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18663987868197604, "mirror_response_residual_rms": 365.9685794801296, "mirror_update_rms": 46.608857436484044, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 3348368.5892 }, { "epoch": 44, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1879507796520401, "mirror_response_residual_rms": 467.21583939832925, "mirror_update_rms": 58.335997671156115, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 5636463.313244444 }, { "epoch": 45, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1744555416960315, "mirror_response_residual_rms": 534.8003540964359, "mirror_update_rms": 71.101584860161, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 6791371.261511111 }, { "epoch": 46, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18611447036962508, "mirror_response_residual_rms": 724.0998592595789, "mirror_update_rms": 90.09689791886062, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 13092151.4672 }, { "epoch": 47, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1746190608773175, "mirror_response_residual_rms": 841.7455450074359, "mirror_update_rms": 110.74197641879132, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 17874979.08088889 }, { "epoch": 48, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18332063396202763, "mirror_response_residual_rms": 1106.44388714552, "mirror_update_rms": 142.67215538580754, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 29886619.14311111 }, { "epoch": 49, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17559674342885276, "mirror_response_residual_rms": 1309.3478547752472, "mirror_update_rms": 169.48276893487449, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 44705749.668977775 }, { "epoch": 50, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.178813686974769, "mirror_response_residual_rms": 1666.470702060352, "mirror_update_rms": 214.71438013214353, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 68346633.8752 }, { "epoch": 51, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18662713391866761, "mirror_response_residual_rms": 2217.8449316645742, "mirror_update_rms": 284.10560923075167, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 124116914.99235556 }, { "epoch": 52, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17934205222275518, "mirror_response_residual_rms": 2659.718713499525, "mirror_update_rms": 343.0783791711567, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 172458058.5841778 }, { "epoch": 53, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1859129208889452, "mirror_response_residual_rms": 3513.790284573236, "mirror_update_rms": 450.09763237392434, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 309339393.3368889 }, { "epoch": 54, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18399153254195033, "mirror_response_residual_rms": 4393.667547175527, "mirror_update_rms": 570.2181829209991, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 459414734.4497778 }, { "epoch": 55, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1853021813264698, "mirror_response_residual_rms": 5590.08499909042, "mirror_update_rms": 718.4029199901084, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 793463121.351111 }, { "epoch": 56, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.19489280827420655, "mirror_response_residual_rms": 7560.064761557443, "mirror_update_rms": 968.9969079091342, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 1333007938.8899555 }, { "epoch": 57, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17073401016694076, "mirror_response_residual_rms": 8083.455972286784, "mirror_update_rms": 1081.7724898096308, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 1532922301.4741333 }, { "epoch": 58, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17630603683121485, "mirror_response_residual_rms": 10384.860035012036, "mirror_update_rms": 1322.3898705386234, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 2652798095.223467 }, { "epoch": 59, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18140232516945584, "mirror_response_residual_rms": 13574.046510492546, "mirror_update_rms": 1755.2198073305533, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 4811285971.672177 }, { "epoch": 60, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18453846032492838, "mirror_response_residual_rms": 17470.456784532664, "mirror_update_rms": 2280.3137307007123, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 7552221584.497778 }, { "epoch": 61, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18107685799981055, "mirror_response_residual_rms": 21497.63299855653, "mirror_update_rms": 2873.2881216182727, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 10946728254.21369 }, { "epoch": 62, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18102814453764157, "mirror_response_residual_rms": 26976.778231466178, "mirror_update_rms": 3507.690709372985, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 17564997953.854576 }, { "epoch": 63, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1783837304563061, "mirror_response_residual_rms": 33000.382614263886, "mirror_update_rms": 4304.0797659547425, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 26833638107.81867 }, { "epoch": 64, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17535460293748267, "mirror_response_residual_rms": 40099.594777386184, "mirror_update_rms": 5198.018456255257, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 41140095756.24249 }, { "epoch": 65, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17961166106353832, "mirror_response_residual_rms": 51367.058565221116, "mirror_update_rms": 6777.709826647028, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 60773717620.235374 }, { "epoch": 66, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1811269145069264, "mirror_response_residual_rms": 64865.691350121044, "mirror_update_rms": 8338.061636316976, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 98383998289.32835 }, { "epoch": 67, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18463290853391082, "mirror_response_residual_rms": 83802.55149915033, "mirror_update_rms": 10957.47010951481, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 176490147237.79697 }, { "epoch": 68, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1794876925592518, "mirror_response_residual_rms": 101696.82013722709, "mirror_update_rms": 13411.347290345682, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 255842117496.19485 }, { "epoch": 69, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17822795020917803, "mirror_response_residual_rms": 125772.15171833048, "mirror_update_rms": 16511.972454146486, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 358484388522.6667 }, { "epoch": 70, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.19554289081997547, "mirror_response_residual_rms": 177640.9328548121, "mirror_update_rms": 22584.679571557284, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 792783113077.1001 }, { "epoch": 71, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1861383153455823, "mirror_response_residual_rms": 213763.8259464994, "mirror_update_rms": 28572.979543306457, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 1043875938761.2957 }, { "epoch": 72, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1802558879375276, "mirror_response_residual_rms": 258722.47525963813, "mirror_update_rms": 34050.38042401327, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 1588843875908.5398 }, { "epoch": 73, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18096636689451612, "mirror_response_residual_rms": 324379.86535966373, "mirror_update_rms": 42201.77580655228, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 2706677120683.213 }, { "epoch": 74, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18419010067841654, "mirror_response_residual_rms": 418610.1161341559, "mirror_update_rms": 55279.74510038989, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 3922646842660.9097 }, { "epoch": 75, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.17973940148357895, "mirror_response_residual_rms": 508044.559060313, "mirror_update_rms": 65859.1019107165, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 6108011498185.25 }, { "epoch": 76, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18388618506857934, "mirror_response_residual_rms": 657493.4999174849, "mirror_update_rms": 85321.28164034746, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 10141217093344.006 }, { "epoch": 77, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18735740182710184, "mirror_response_residual_rms": 854163.0224306438, "mirror_update_rms": 110091.04673989624, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 17790416377715.098 }, { "epoch": 78, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.19003628168513673, "mirror_response_residual_rms": 1119451.5912114652, "mirror_update_rms": 147374.52377531424, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 30380973543280.55 }, { "epoch": 79, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18090824787881385, "mirror_response_residual_rms": 1335647.463668788, "mirror_update_rms": 177988.60969112904, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 41709467618235.01 }, { "epoch": 80, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1898431409649226, "mirror_response_residual_rms": 1800206.3382607142, "mirror_update_rms": 231471.48319929, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 79553879526628.11 }, { "epoch": 81, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18858933860173666, "mirror_response_residual_rms": 2290311.9855850786, "mirror_update_rms": 304715.60732280766, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 134003902370149.53 }, { "epoch": 82, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18903455431275143, "mirror_response_residual_rms": 2935674.0224626358, "mirror_update_rms": 380333.01479478984, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 195446795575323.66 }, { "epoch": 83, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18552133326240253, "mirror_response_residual_rms": 3649113.9615057916, "mirror_update_rms": 472973.0840752212, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 328307573206507.7 }, { "epoch": 84, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1871710235829224, "mirror_response_residual_rms": 4712112.5393311195, "mirror_update_rms": 625773.0681054839, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 540371527653689.5 }, { "epoch": 85, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18686970229182326, "mirror_response_residual_rms": 5959242.205373104, "mirror_update_rms": 782316.5334189691, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 809226572376921.4 }, { "epoch": 86, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18170413384572284, "mirror_response_residual_rms": 7280688.028885112, "mirror_update_rms": 943222.9128179882, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 1202605108566151.8 }, { "epoch": 87, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18938218997417897, "mirror_response_residual_rms": 9736101.237685226, "mirror_update_rms": 1256339.8531903229, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 2290791576165842.0 }, { "epoch": 88, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.18570973089994655, "mirror_response_residual_rms": 12105269.685644234, "mirror_update_rms": 1611442.535408771, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 3386755509415738.5 }, { "epoch": 89, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1843602737209167, "mirror_response_residual_rms": 15199152.999261754, "mirror_update_rms": 1971571.6992519656, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 5208089187694965.0 }, { "epoch": 90, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.21858175499831747, "mirror_response_residual_rms": 23037592.17211868, "mirror_update_rms": 2566309.0258844886, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 9531445722550406.0 }, { "epoch": 91, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.20686517289704395, "mirror_response_residual_rms": 26926553.356225573, "mirror_update_rms": 3094218.4297929276, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 1.1028518796957628e+16 }, { "epoch": 92, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.2184259488858253, "mirror_response_residual_rms": 33706387.541730076, "mirror_update_rms": 3494422.0886306763, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 1.5808196181353206e+16 }, { "epoch": 93, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1900621536360849, "mirror_response_residual_rms": 32980082.75589377, "mirror_update_rms": 3963598.358970932, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 1.4888829304130642e+16 }, { "epoch": 94, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.13379056089318841, "mirror_response_residual_rms": 23828338.58614168, "mirror_update_rms": 3886010.939256947, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 1.3880673278480904e+16 }, { "epoch": 95, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.128798268991764, "mirror_response_residual_rms": 23047462.405486204, "mirror_update_rms": 3772978.128276217, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 1.3919191122053262e+16 }, { "epoch": 96, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.1316850882560173, "mirror_response_residual_rms": 23885031.5393649, "mirror_update_rms": 3797964.952497794, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 1.2508984939937554e+16 }, { "epoch": 97, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.11539434120659725, "mirror_response_residual_rms": 20917237.293214742, "mirror_update_rms": 3629201.827944914, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 1.2320241830166044e+16 }, { "epoch": 98, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.10226171819833896, "mirror_response_residual_rms": 18389204.321048595, "mirror_update_rms": 3453547.717277361, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 1.0208179499010662e+16 }, { "epoch": 99, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.10653423496776888, "mirror_response_residual_rms": 19073907.00763785, "mirror_update_rms": 3576712.541446859, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 1.1274575128102436e+16 }, { "epoch": 100, "lr": 0.1, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.09601334576024682, "mirror_response_residual_rms": 16954939.118557964, "mirror_update_rms": 3631376.9407005864, "readout_batch_size": 1024.0 }, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 9654927919423592.0 }, { "epoch": 101, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.05007619556399978, "mirror_response_residual_rms": 8678039.387749843, "mirror_update_rms": 2200752.763350605, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 2685812866323736.0 }, { "epoch": 102, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.025464442061644322, "mirror_response_residual_rms": 4338527.072616534, "mirror_update_rms": 831726.585555313, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 1542737949098170.5 }, { "epoch": 103, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.017440496623211545, "mirror_response_residual_rms": 2953668.1739617838, "mirror_update_rms": 413629.8954984534, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 1183100001330467.0 }, { "epoch": 104, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.013086733649498918, "mirror_response_residual_rms": 2194251.548283121, "mirror_update_rms": 257828.15337585015, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 968386359265154.4 }, { "epoch": 105, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.01088335763231425, "mirror_response_residual_rms": 1813165.2837789103, "mirror_update_rms": 195048.0940523917, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 869776046322561.9 }, { "epoch": 106, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.009499648803500215, "mirror_response_residual_rms": 1573611.7734772088, "mirror_update_rms": 162998.96583068467, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 768828992904786.4 }, { "epoch": 107, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.008443350908718023, "mirror_response_residual_rms": 1390910.5224194033, "mirror_update_rms": 138976.35164619682, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 731888668104644.6 }, { "epoch": 108, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.008011575043358851, "mirror_response_residual_rms": 1312958.2721799032, "mirror_update_rms": 128914.45254236949, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 713305250399594.5 }, { "epoch": 109, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0073659721440511835, "mirror_response_residual_rms": 1201779.4236550073, "mirror_update_rms": 120465.23578049015, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 677757413458252.0 }, { "epoch": 110, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007133456253102175, "mirror_response_residual_rms": 1157068.9408236998, "mirror_update_rms": 112291.41033770666, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 625836772680904.8 }, { "epoch": 111, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007280583051060433, "mirror_response_residual_rms": 1177446.0560974798, "mirror_update_rms": 110508.36704757994, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 672107429864931.4 }, { "epoch": 112, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006962275900756396, "mirror_response_residual_rms": 1119853.1181717757, "mirror_update_rms": 104260.1949019794, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 584026185917035.0 }, { "epoch": 113, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007171235033341957, "mirror_response_residual_rms": 1150059.4935755366, "mirror_update_rms": 103543.28291815725, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 655910883588786.6 }, { "epoch": 114, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006791146840872226, "mirror_response_residual_rms": 1085348.125182368, "mirror_update_rms": 100022.97957162489, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 594731629461728.2 }, { "epoch": 115, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0066752400037565504, "mirror_response_residual_rms": 1061156.3200544603, "mirror_update_rms": 97680.03463975567, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 585738924981922.5 }, { "epoch": 116, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.00687073840358863, "mirror_response_residual_rms": 1089158.2530041405, "mirror_update_rms": 97449.83883362441, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 648997796046001.5 }, { "epoch": 117, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006623191988131194, "mirror_response_residual_rms": 1044907.0573297386, "mirror_update_rms": 94962.5233855449, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 627047655602394.9 }, { "epoch": 118, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006828525904102637, "mirror_response_residual_rms": 1074762.5561427027, "mirror_update_rms": 98280.48257698271, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 628574778039631.1 }, { "epoch": 119, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006799931982003371, "mirror_response_residual_rms": 1064404.0593299875, "mirror_update_rms": 95447.1747766641, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 589941104878201.5 }, { "epoch": 120, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0067998542391554395, "mirror_response_residual_rms": 1061315.1924613614, "mirror_update_rms": 94584.0734345371, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 573994089067536.6 }, { "epoch": 121, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006642465879742914, "mirror_response_residual_rms": 1032394.358680163, "mirror_update_rms": 92066.28875345645, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 568712569978850.9 }, { "epoch": 122, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006595007918939228, "mirror_response_residual_rms": 1017818.1026309867, "mirror_update_rms": 90729.02627546371, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 552122170345963.9 }, { "epoch": 123, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006832428471027269, "mirror_response_residual_rms": 1053073.9852018063, "mirror_update_rms": 91736.27698295841, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 618764466178810.8 }, { "epoch": 124, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006809612547507064, "mirror_response_residual_rms": 1046847.8183816015, "mirror_update_rms": 92294.90685002417, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 611452914381351.2 }, { "epoch": 125, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006667132503391487, "mirror_response_residual_rms": 1021494.4585219845, "mirror_update_rms": 92605.79022325971, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 581556050629586.0 }, { "epoch": 126, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006782468377429878, "mirror_response_residual_rms": 1033167.6328883163, "mirror_update_rms": 92334.49869874583, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 600776144712397.2 }, { "epoch": 127, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006833546552036531, "mirror_response_residual_rms": 1038288.8922962393, "mirror_update_rms": 92362.97052286884, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 631050040659038.1 }, { "epoch": 128, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006990183509284284, "mirror_response_residual_rms": 1060676.5728971122, "mirror_update_rms": 95248.81431576378, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 624655222047675.4 }, { "epoch": 129, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0068044943283255745, "mirror_response_residual_rms": 1025096.6113397344, "mirror_update_rms": 90868.9044800425, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 559598045456615.2 }, { "epoch": 130, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.00664731148503295, "mirror_response_residual_rms": 998640.0638799268, "mirror_update_rms": 88580.75029270866, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 553175264007314.2 }, { "epoch": 131, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.00727493634617216, "mirror_response_residual_rms": 1089527.24497701, "mirror_update_rms": 92118.74338608036, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 637205817216467.0 }, { "epoch": 132, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007176356642018252, "mirror_response_residual_rms": 1071260.3932451278, "mirror_update_rms": 93108.29632830959, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 585200561449482.5 }, { "epoch": 133, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006926766321691114, "mirror_response_residual_rms": 1032639.9513879622, "mirror_update_rms": 90711.73210164852, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 608497134244911.1 }, { "epoch": 134, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007031989825841695, "mirror_response_residual_rms": 1041955.9011630568, "mirror_update_rms": 90427.13109136443, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 620365679009039.1 }, { "epoch": 135, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006995993190008252, "mirror_response_residual_rms": 1033365.2555759613, "mirror_update_rms": 90241.4221074971, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 594346064258473.1 }, { "epoch": 136, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007197294502746857, "mirror_response_residual_rms": 1058573.849334281, "mirror_update_rms": 90254.36168400788, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 612038576587121.9 }, { "epoch": 137, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007682614039846408, "mirror_response_residual_rms": 1126129.1386334912, "mirror_update_rms": 95748.24352914802, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 626325654461824.6 }, { "epoch": 138, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007144809275862734, "mirror_response_residual_rms": 1045163.2029975861, "mirror_update_rms": 94728.94677210202, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 590664627087404.8 }, { "epoch": 139, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006923401842169676, "mirror_response_residual_rms": 1009537.7472674883, "mirror_update_rms": 91395.75034929103, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 568850763128580.0 }, { "epoch": 140, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007964083169015453, "mirror_response_residual_rms": 1155621.3027283526, "mirror_update_rms": 95774.40004307772, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 644006964805902.9 }, { "epoch": 141, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0072351711936741595, "mirror_response_residual_rms": 1046475.7189914059, "mirror_update_rms": 92505.73905233058, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 590609789821858.6 }, { "epoch": 142, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0071366416802181995, "mirror_response_residual_rms": 1028323.5082519726, "mirror_update_rms": 90241.17121400796, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 562891237973289.25 }, { "epoch": 143, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007187517113215339, "mirror_response_residual_rms": 1032971.3788936894, "mirror_update_rms": 88456.59733694022, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 578743017739864.6 }, { "epoch": 144, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007152436765486301, "mirror_response_residual_rms": 1022168.385118116, "mirror_update_rms": 88797.28812404908, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 566067590032616.5 }, { "epoch": 145, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.006981905942004935, "mirror_response_residual_rms": 995277.1459890343, "mirror_update_rms": 88761.07033959444, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 574351047832004.2 }, { "epoch": 146, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.00733955937548507, "mirror_response_residual_rms": 1043803.7987524386, "mirror_update_rms": 89058.0615793717, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 576169318693417.8 }, { "epoch": 147, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007256925117479931, "mirror_response_residual_rms": 1027582.2779337709, "mirror_update_rms": 88435.61686661586, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 547014509576824.06 }, { "epoch": 148, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007177127243177316, "mirror_response_residual_rms": 1012994.2162651333, "mirror_update_rms": 87382.46114962958, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 532413816954229.0 }, { "epoch": 149, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007089626319017847, "mirror_response_residual_rms": 997003.6974855083, "mirror_update_rms": 86343.38372993768, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 546490833460532.94 }, { "epoch": 150, "lr": 0.010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.007007133536513155, "mirror_response_residual_rms": 980852.6251162622, "mirror_update_rms": 86053.87791524969, "readout_batch_size": 1024.0 }, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 536405733433724.1 }, { "epoch": 151, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0032087842642215675, "mirror_response_residual_rms": 447777.9449965618, "mirror_update_rms": 52933.57200670927, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 290791142991977.94 }, { "epoch": 152, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.001999295464187333, "mirror_response_residual_rms": 279073.6974907134, "mirror_update_rms": 23165.475315146145, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 255500716981762.28 }, { "epoch": 153, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0017815018538181486, "mirror_response_residual_rms": 248959.96729436552, "mirror_update_rms": 16594.365705704, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 237142084347768.2 }, { "epoch": 154, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0016639341173205543, "mirror_response_residual_rms": 232207.99658755856, "mirror_update_rms": 14970.390528111138, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 224787508784115.8 }, { "epoch": 155, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0016099386838185669, "mirror_response_residual_rms": 224474.44327205757, "mirror_update_rms": 14151.976886641462, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 212567207284117.78 }, { "epoch": 156, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0014943898185704003, "mirror_response_residual_rms": 208407.78769944093, "mirror_update_rms": 13113.396606462915, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 208400407312174.66 }, { "epoch": 157, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0014775262134272362, "mirror_response_residual_rms": 205385.44525231214, "mirror_update_rms": 12672.589007105735, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 194515582748086.2 }, { "epoch": 158, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0014208568165277507, "mirror_response_residual_rms": 197479.6332734282, "mirror_update_rms": 12243.487475586227, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 189595967321124.97 }, { "epoch": 159, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0013475312519654994, "mirror_response_residual_rms": 187505.40203064497, "mirror_update_rms": 11711.669432348875, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 183776109209647.7 }, { "epoch": 160, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0013431393270176373, "mirror_response_residual_rms": 187143.39466572073, "mirror_update_rms": 11320.88741566046, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 173374222030427.47 }, { "epoch": 161, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0012856528402726945, "mirror_response_residual_rms": 178642.99113782975, "mirror_update_rms": 11126.734709863245, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 173037323713039.56 }, { "epoch": 162, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0012500955155314282, "mirror_response_residual_rms": 173963.05234524232, "mirror_update_rms": 10750.137351449426, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 162943987695717.94 }, { "epoch": 163, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0012274067571383946, "mirror_response_residual_rms": 170544.54784321238, "mirror_update_rms": 10308.406553602488, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 160870316729317.6 }, { "epoch": 164, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0012143428054024142, "mirror_response_residual_rms": 168541.9411038527, "mirror_update_rms": 10026.049650677493, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 152615502997403.16 }, { "epoch": 165, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0011618848960382778, "mirror_response_residual_rms": 161249.47841337245, "mirror_update_rms": 9877.76319917752, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 147715078304539.9 }, { "epoch": 166, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0011709939764778443, "mirror_response_residual_rms": 162409.74849408612, "mirror_update_rms": 9581.047165424463, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 149022314113729.97 }, { "epoch": 167, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.00114368928852084, "mirror_response_residual_rms": 158723.66304442205, "mirror_update_rms": 9274.600017548708, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 145975274601662.97 }, { "epoch": 168, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0011113454636964505, "mirror_response_residual_rms": 153535.55047773395, "mirror_update_rms": 9169.623612582436, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 140674355640815.53 }, { "epoch": 169, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0010955640187658362, "mirror_response_residual_rms": 151636.68171368883, "mirror_update_rms": 9028.461506247086, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 138681999363460.3 }, { "epoch": 170, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0011083108631044982, "mirror_response_residual_rms": 153273.4338426599, "mirror_update_rms": 8847.45158370748, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 134086743509958.66 }, { "epoch": 171, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.001059070866597855, "mirror_response_residual_rms": 146400.78252848756, "mirror_update_rms": 8638.841519859418, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 130867960700690.61 }, { "epoch": 172, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0010782376483572434, "mirror_response_residual_rms": 148982.80637432565, "mirror_update_rms": 8500.595883124372, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 131899575170941.3 }, { "epoch": 173, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.001025326273471645, "mirror_response_residual_rms": 141895.38581659968, "mirror_update_rms": 8448.631889640494, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 126561423696354.05 }, { "epoch": 174, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0010562072572070209, "mirror_response_residual_rms": 145845.37717105175, "mirror_update_rms": 8471.085631430662, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 124120458756020.27 }, { "epoch": 175, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0010165783017837598, "mirror_response_residual_rms": 140287.6153044427, "mirror_update_rms": 8216.515302120677, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 122149353463835.67 }, { "epoch": 176, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009861995894133544, "mirror_response_residual_rms": 135997.74408898997, "mirror_update_rms": 7994.437876091781, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 119131704066991.72 }, { "epoch": 177, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0010089913501434918, "mirror_response_residual_rms": 139091.17556596536, "mirror_update_rms": 8007.664973720693, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 118752039003476.61 }, { "epoch": 178, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009991471698646422, "mirror_response_residual_rms": 137830.24079490898, "mirror_update_rms": 7845.982322296591, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 116937039180207.81 }, { "epoch": 179, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009777638864413196, "mirror_response_residual_rms": 134920.04129773405, "mirror_update_rms": 7699.635825450148, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 115498679129004.08 }, { "epoch": 180, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009629198876278138, "mirror_response_residual_rms": 132860.51200841728, "mirror_update_rms": 7640.070607115113, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 110589073182978.5 }, { "epoch": 181, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009544134332446694, "mirror_response_residual_rms": 131206.3883222477, "mirror_update_rms": 7493.416145239424, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 107961896251995.66 }, { "epoch": 182, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009379672638411429, "mirror_response_residual_rms": 129260.96492484286, "mirror_update_rms": 7425.527523645123, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 105197935579714.9 }, { "epoch": 183, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.000977036531632824, "mirror_response_residual_rms": 134436.5471177028, "mirror_update_rms": 7443.531530709466, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 108604489967261.73 }, { "epoch": 184, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009384160472791108, "mirror_response_residual_rms": 129188.49014012153, "mirror_update_rms": 7296.443772341943, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 109384364098019.52 }, { "epoch": 185, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009414905730334572, "mirror_response_residual_rms": 129269.97882887031, "mirror_update_rms": 7243.7012446729705, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 103255089672082.05 }, { "epoch": 186, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.000932192632579979, "mirror_response_residual_rms": 128013.12664497542, "mirror_update_rms": 7146.149532650844, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 102638880865526.31 }, { "epoch": 187, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009103720910796426, "mirror_response_residual_rms": 124976.02616910689, "mirror_update_rms": 7148.405145932297, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 98623481536018.3 }, { "epoch": 188, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009235896524995814, "mirror_response_residual_rms": 126771.72839843947, "mirror_update_rms": 7089.127334086657, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 97190608395013.69 }, { "epoch": 189, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.000918707577524986, "mirror_response_residual_rms": 126163.4560925949, "mirror_update_rms": 7040.906495507836, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 100718257142543.89 }, { "epoch": 190, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009150105731567869, "mirror_response_residual_rms": 125399.70188986123, "mirror_update_rms": 7085.229258096326, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 100124271651050.11 }, { "epoch": 191, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009168686247955499, "mirror_response_residual_rms": 125690.86517330584, "mirror_update_rms": 6912.006706956782, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 96021660878026.25 }, { "epoch": 192, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008978633099696281, "mirror_response_residual_rms": 123156.36110672857, "mirror_update_rms": 6793.551535886159, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 96242815941150.12 }, { "epoch": 193, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008827945562784333, "mirror_response_residual_rms": 121085.07525103634, "mirror_update_rms": 6824.396519630675, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 90978474028346.03 }, { "epoch": 194, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009324719244620326, "mirror_response_residual_rms": 127985.53551857443, "mirror_update_rms": 6947.703788473882, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 96810687187403.84 }, { "epoch": 195, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0009198801757618173, "mirror_response_residual_rms": 125902.66336070251, "mirror_update_rms": 6847.628727216657, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 94776781496344.77 }, { "epoch": 196, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008748863621404889, "mirror_response_residual_rms": 119901.70220166737, "mirror_update_rms": 6681.125528773386, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 94696944802481.22 }, { "epoch": 197, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008890893212298624, "mirror_response_residual_rms": 121926.22679854333, "mirror_update_rms": 6669.037733824636, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 91934331761194.14 }, { "epoch": 198, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008945555896561919, "mirror_response_residual_rms": 122263.97020262144, "mirror_update_rms": 6600.694677847766, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 91486208920160.39 }, { "epoch": 199, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008649277129327108, "mirror_response_residual_rms": 118035.00068733803, "mirror_update_rms": 6560.013784059727, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 87027075818455.05 }, { "epoch": 200, "lr": 0.0010000000000000002, "mirror": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.0008524223930613697, "mirror_response_residual_rms": 116590.40100360393, "mirror_update_rms": 6515.713952715815, "readout_batch_size": 1024.0 }, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 89503349143584.4 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 1 }, "final": { "accuracy": 0.1, "epoch": 200, "evaluation_split": "validation", "finite": false, "loss": NaN, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device": "cuda", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 2161716736, "peak_memory_reserved_bytes": 2883584000, "torch_version": "2.3.1+cu118" }, "mirror_warmup": { "first": { "conv_batch_size": 1, "mirror_response_residual_fraction": 1.4124661316345333, "mirror_response_residual_rms": 1.90927576279183, "mirror_update_rms": 0.25520769706611623, "readout_batch_size": 1024 }, "last": { "conv_batch_size": 1, "mirror_response_residual_fraction": 0.26271250078043745, "mirror_response_residual_rms": 0.3557588547676734, "mirror_update_rms": 0.0907495165488641, "readout_batch_size": 1024 }, "mean": { "conv_batch_size": 1.0, "mirror_response_residual_fraction": 0.6719071790962137, "mirror_response_residual_rms": 0.9100978838204868, "mirror_update_rms": 0.15685383656211757, "readout_batch_size": 1024.0 }, "steps": 20 }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "8a5c1045a43b1f91fd46b2fcc044b032cb14718c", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/home/yurenh2/sdrn/data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 0.3643169403076172, "mirror_warmup_wall_s": 0.564356803894043, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 4057.1195838451385, "train_wall_s": 4056.162163734436 }, "work": { "apical_macs_per_example": 40108672, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 360978048000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "local_weight_correlation_macs": 364959360000000, "mirror_feedback_prediction_macs": 180174192640, "mirror_local_correlation_macs": 180174192640, "mirror_response_macs": 180174192640, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; elementwise nonlinearities and optimizer arithmetic excluded", "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "mirror_probe_examples": 4420, "mirror_readout_probe_examples": 4526080, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1091437290577920 } }