{ "architecture": { "adaptive_apical_parameters": 0, "adaptive_feedback_parameters": 0, "base_width": 16, "blocks_per_stage": 3, "bn_eps": 1e-05, "bn_momentum": 0.1, "depth": 20, "family": "CIFAR 6n+2 ResNet, option-A shortcuts", "fixed_feedback_parameters": 267904, "fixed_traffic_coefficients": 0, "forward_parameters": 269722, "hidden_shapes": [ [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 16, 32, 32 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 32, 16, 16 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ], [ 64, 8, 8 ] ], "normalization": "batchnorm", "predictor_parameters": 0, "residual_scale": 1.0, "vectorizer_mode": null, "vectorizer_parameters": 0 }, "args": { "a_scale": 1.0, "a_warmup_steps": 0, "alignment_probe": 32, "apical_calibration_mode": "unit_targets", "apical_seed": null, "augment_train": 1, "batch_size": 128, "bn_eps": 1e-05, "bn_momentum": 0.1, "data_dir": "/orion/u/oscarwan/scratch/sdil-data", "depth": 20, "device": "cuda", "epochs": 200, "eta_A": 0.01, "eta_P": 0.01, "eval_every": 1, "eval_split": "validation", "learn_P": 0, "loader_seed": 0, "lr": 0.1, "lr_gamma": 0.1, "lr_milestones": "100,150", "lr_schedule": "step", "max_steps": 0, "mirror_batch_size": 1, "mirror_eta": 0.1, "mirror_every": 16, "mirror_noise_std": 1.0, "mirror_seed": 3000, "mirror_warmup_steps": 0, "mode": "hfa", "momentum": 0.9, "neutral_projection": 0, "normalization": "batchnorm", "nuisance_scale": 0.0, "out": "/orion/u/oscarwan/scratch/sdil-work/sdil-a6000-full-rerun/results/resnet_crossover/r2/resnet-r2-fa-d20-lr0p1.json", "output_lr": 0.1, "pert_directions": 1, "pert_every": 4, "pert_sigma": 0.01, "perturb_seed": 1000, "predictor_every": 0, "predictor_mode": "nlms", "predictor_warmup_steps": 0, "residual_scale": null, "seed": 0, "split_seed": 2027, "traffic_calibration_examples": 64, "traffic_ratio": 4.0, "traffic_rule": "innovation", "traffic_seed": 4000, "train_limit": 0, "use_residual": 1, "val_examples": 5000, "vectorizer_mode": "spatial_template", "warmup_epochs": 5, "weight_decay": 0.0001, "weight_scale": 1.0, "width": 16 }, "calibration_metric_space": null, "counters": { "apical_warmup_examples": 0, "calibration_event_examples": 0, "causal_scalar_observations": 0, "logical_batch_loss_queries": 0, "mirror_conv_examples": 0, "mirror_events": 0, "mirror_readout_examples": 0, "neutral_projection_examples": 0, "ordinary_examples": 9000000, "per_example_loss_terms": 0, "perturbation_events": 0, "perturbation_forward_examples": 0, "predictor_update_examples": 0, "predictor_warmup_examples": 0, "traffic_audit_examples": 0, "traffic_calibration_examples": 0 }, "diagnostics": { "early_third_mean": 0.011225155787542462, "feedback_forward_cosine": [ 0.06530784070491791, 0.23644882440567017, 0.14832958579063416, 0.27313339710235596, 0.11167817562818527, 0.22827664017677307, 0.11369006335735321, 0.18833361566066742, 0.08932708203792572, 0.2524581551551819, 0.10242670029401779, 0.24816101789474487, 0.08819255232810974, 0.19018340110778809, 0.08682424575090408, 0.2735845446586609, 0.09671223163604736, 0.26411014795303345, 0.7856658697128296 ], "feedback_forward_norm_ratio": [ 1.5932362079620361, 1.5769914388656616, 1.9141095876693726, 1.9809224605560303, 2.1602015495300293, 2.258635997772217, 2.286642551422119, 1.7141746282577515, 2.1372995376586914, 1.9748387336730957, 2.4078481197357178, 2.3249430656433105, 2.3330516815185547, 1.5594871044158936, 1.7516019344329834, 1.3729456663131714, 1.6120082139968872, 1.1900783777236938, 0.22846350073814392 ], "feedback_forward_relative_error": [ 1.8249109983444214, 1.6556408405303955, 2.0238521099090576, 1.9600871801376343, 2.276834726333618, 2.2517213821411133, 2.3893086910247803, 1.8145856857299805, 2.2773256301879883, 1.9755656719207764, 2.5108718872070312, 2.2916018962860107, 2.455934762954712, 1.6848807334899902, 1.940089225769043, 1.4607349634170532, 1.812944769859314, 1.3370351791381836, 0.8325884938240051 ], "innovation_negative_gradient_cosine": [ 0.0030611385591328144, 0.006984669715166092, 0.015605964697897434, 0.010937267914414406, 0.02078421413898468, 0.009977679699659348, 0.03010556846857071, 0.02181582897901535, 0.06369832903146744, 0.040703386068344116, 0.09983091056346893, 0.06209838390350342, 0.13944962620735168, 0.11991359293460846, 0.28113487362861633, 0.28801897168159485, 0.4426411986351013, 0.47109293937683105, 0.8467425107955933 ], "mean_feedback_forward_cosine": 0.2022549521766211, "mean_feedback_forward_relative_error": 1.9356060435897426, "normalization_state": "training_batch_stats_without_running_update", "raw_negative_gradient_cosine": [ 0.0030611385591328144, 0.006984669715166092, 0.015605964697897434, 0.010937267914414406, 0.02078421413898468, 0.009977679699659348, 0.03010556846857071, 0.02181582897901535, 0.06369832903146744, 0.040703386068344116, 0.09983091056346893, 0.06209838390350342, 0.13944962620735168, 0.11991359293460846, 0.28113487362861633, 0.28801897168159485, 0.4426411986351013, 0.47109293937683105, 0.8467425107955933 ], "teaching_negative_gradient_cosine": [ 0.0030611385591328144, 0.006984669715166092, 0.015605964697897434, 0.010937267914414406, 0.02078421413898468, 0.009977679699659348, 0.03010556846857071, 0.02181582897901535, 0.06369832903146744, 0.040703386068344116, 0.09983091056346893, 0.06209838390350342, 0.13944962620735168, 0.11991359293460846, 0.28113487362861633, 0.28801897168159485, 0.4426411986351013, 0.47109293937683105, 0.8467425107955933 ], "wall_s": 0.10387682914733887 }, "epochs": [ { "epoch": 1, "eval_accuracy": 0.3056, "eval_loss": 1.9553183349609375, "eval_split": "validation", "lr": 0.02, "output_lr": 0.02, "step": 352, "train_examples": 45000, "train_loss": 2.0639842291302153 }, { "epoch": 2, "eval_accuracy": 0.3414, "eval_loss": 1.8812863037109375, "eval_split": "validation", "lr": 0.04, "output_lr": 0.04, "step": 704, "train_examples": 45000, "train_loss": 1.91367295850118 }, { "epoch": 3, "eval_accuracy": 0.3298, "eval_loss": 1.8941572509765625, "eval_split": "validation", "lr": 0.06000000000000001, "output_lr": 0.06000000000000001, "step": 1056, "train_examples": 45000, "train_loss": 2.0059402748743693 }, { "epoch": 4, "eval_accuracy": 0.3868, "eval_loss": 2.012137060546875, "eval_split": "validation", "lr": 0.08, "output_lr": 0.08, "step": 1408, "train_examples": 45000, "train_loss": 2.1139173667060005 }, { "epoch": 5, "eval_accuracy": 0.3448, "eval_loss": 2.873762353515625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 1760, "train_examples": 45000, "train_loss": 2.4378785884433323 }, { "epoch": 6, "eval_accuracy": 0.4028, "eval_loss": 2.19697216796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2112, "train_examples": 45000, "train_loss": 2.382185635460748 }, { "epoch": 7, "eval_accuracy": 0.3742, "eval_loss": 2.617165966796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2464, "train_examples": 45000, "train_loss": 2.240234103329976 }, { "epoch": 8, "eval_accuracy": 0.3884, "eval_loss": 2.572106884765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 2816, "train_examples": 45000, "train_loss": 2.071946952946981 }, { "epoch": 9, "eval_accuracy": 0.4522, "eval_loss": 1.9747636474609376, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3168, "train_examples": 45000, "train_loss": 2.058614935133192 }, { "epoch": 10, "eval_accuracy": 0.432, "eval_loss": 2.391416796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3520, "train_examples": 45000, "train_loss": 1.9395815348519219 }, { "epoch": 11, "eval_accuracy": 0.3852, "eval_loss": 2.6288126953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 3872, "train_examples": 45000, "train_loss": 1.9402141478644477 }, { "epoch": 12, "eval_accuracy": 0.419, "eval_loss": 2.22531181640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4224, "train_examples": 45000, "train_loss": 1.9182814904106988 }, { "epoch": 13, "eval_accuracy": 0.4612, "eval_loss": 1.892072021484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4576, "train_examples": 45000, "train_loss": 1.7968032083511352 }, { "epoch": 14, "eval_accuracy": 0.417, "eval_loss": 2.081826513671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 4928, "train_examples": 45000, "train_loss": 1.8566136685053507 }, { "epoch": 15, "eval_accuracy": 0.438, "eval_loss": 1.9989041015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5280, "train_examples": 45000, "train_loss": 1.7629460686153835 }, { "epoch": 16, "eval_accuracy": 0.458, "eval_loss": 2.0938974365234375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5632, "train_examples": 45000, "train_loss": 1.7258217601776122 }, { "epoch": 17, "eval_accuracy": 0.4368, "eval_loss": 2.362848486328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 5984, "train_examples": 45000, "train_loss": 1.7666962187872992 }, { "epoch": 18, "eval_accuracy": 0.4846, "eval_loss": 1.92572080078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6336, "train_examples": 45000, "train_loss": 1.7164832483503554 }, { "epoch": 19, "eval_accuracy": 0.494, "eval_loss": 1.8626768310546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 6688, "train_examples": 45000, "train_loss": 1.6503403984917535 }, { "epoch": 20, "eval_accuracy": 0.3992, "eval_loss": 3.14110546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7040, "train_examples": 45000, "train_loss": 1.7138124549018012 }, { "epoch": 21, "eval_accuracy": 0.4812, "eval_loss": 1.944050341796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7392, "train_examples": 45000, "train_loss": 1.6447507121192084 }, { "epoch": 22, "eval_accuracy": 0.4892, "eval_loss": 1.911722021484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 7744, "train_examples": 45000, "train_loss": 1.6547758380042181 }, { "epoch": 23, "eval_accuracy": 0.485, "eval_loss": 1.815741455078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8096, "train_examples": 45000, "train_loss": 1.5776512994130452 }, { "epoch": 24, "eval_accuracy": 0.5166, "eval_loss": 1.5387634521484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8448, "train_examples": 45000, "train_loss": 1.61900724834866 }, { "epoch": 25, "eval_accuracy": 0.4492, "eval_loss": 2.1026521484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 8800, "train_examples": 45000, "train_loss": 1.6446258316040039 }, { "epoch": 26, "eval_accuracy": 0.461, "eval_loss": 1.787435693359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9152, "train_examples": 45000, "train_loss": 1.635316059621175 }, { "epoch": 27, "eval_accuracy": 0.4612, "eval_loss": 2.1551716796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9504, "train_examples": 45000, "train_loss": 1.624604059685601 }, { "epoch": 28, "eval_accuracy": 0.4852, "eval_loss": 1.75483876953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 9856, "train_examples": 45000, "train_loss": 1.6604180307176377 }, { "epoch": 29, "eval_accuracy": 0.5064, "eval_loss": 1.5234459716796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10208, "train_examples": 45000, "train_loss": 1.585603558646308 }, { "epoch": 30, "eval_accuracy": 0.4848, "eval_loss": 1.8498150634765624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10560, "train_examples": 45000, "train_loss": 1.5916083756128947 }, { "epoch": 31, "eval_accuracy": 0.4718, "eval_loss": 1.84035732421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 10912, "train_examples": 45000, "train_loss": 1.6653513647927178 }, { "epoch": 32, "eval_accuracy": 0.5348, "eval_loss": 1.6685882568359376, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11264, "train_examples": 45000, "train_loss": 1.6522833022647434 }, { "epoch": 33, "eval_accuracy": 0.463, "eval_loss": 2.010286328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11616, "train_examples": 45000, "train_loss": 1.581467076174418 }, { "epoch": 34, "eval_accuracy": 0.4372, "eval_loss": 2.1312464111328127, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 11968, "train_examples": 45000, "train_loss": 1.6292456374486288 }, { "epoch": 35, "eval_accuracy": 0.5374, "eval_loss": 1.577523291015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12320, "train_examples": 45000, "train_loss": 1.5334896649254692 }, { "epoch": 36, "eval_accuracy": 0.4628, "eval_loss": 1.90355205078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 12672, "train_examples": 45000, "train_loss": 1.504615032196045 }, { "epoch": 37, "eval_accuracy": 0.5238, "eval_loss": 1.5645536376953124, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13024, "train_examples": 45000, "train_loss": 1.596086120054457 }, { "epoch": 38, "eval_accuracy": 0.5198, "eval_loss": 1.5882181884765625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13376, "train_examples": 45000, "train_loss": 1.5680132107628717 }, { "epoch": 39, "eval_accuracy": 0.5282, "eval_loss": 1.6558640380859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 13728, "train_examples": 45000, "train_loss": 1.5771280631595188 }, { "epoch": 40, "eval_accuracy": 0.5684, "eval_loss": 1.37480546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14080, "train_examples": 45000, "train_loss": 1.6025711276796129 }, { "epoch": 41, "eval_accuracy": 0.5168, "eval_loss": 1.548530712890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14432, "train_examples": 45000, "train_loss": 1.5799489162021214 }, { "epoch": 42, "eval_accuracy": 0.4688, "eval_loss": 2.0833614990234377, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 14784, "train_examples": 45000, "train_loss": 1.5346269664764405 }, { "epoch": 43, "eval_accuracy": 0.5302, "eval_loss": 1.5688693359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15136, "train_examples": 45000, "train_loss": 1.5281175550248889 }, { "epoch": 44, "eval_accuracy": 0.483, "eval_loss": 1.8670911376953125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15488, "train_examples": 45000, "train_loss": 1.4591134276707967 }, { "epoch": 45, "eval_accuracy": 0.5122, "eval_loss": 1.7008560546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 15840, "train_examples": 45000, "train_loss": 1.4886928064134386 }, { "epoch": 46, "eval_accuracy": 0.5714, "eval_loss": 1.379425, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16192, "train_examples": 45000, "train_loss": 1.5013230222066243 }, { "epoch": 47, "eval_accuracy": 0.5548, "eval_loss": 1.540955224609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16544, "train_examples": 45000, "train_loss": 1.423521467505561 }, { "epoch": 48, "eval_accuracy": 0.5066, "eval_loss": 1.8178400634765626, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 16896, "train_examples": 45000, "train_loss": 1.473559805340237 }, { "epoch": 49, "eval_accuracy": 0.5778, "eval_loss": 1.350400732421875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17248, "train_examples": 45000, "train_loss": 1.512079693031311 }, { "epoch": 50, "eval_accuracy": 0.5722, "eval_loss": 1.516371484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17600, "train_examples": 45000, "train_loss": 1.461774546453688 }, { "epoch": 51, "eval_accuracy": 0.507, "eval_loss": 1.701910693359375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 17952, "train_examples": 45000, "train_loss": 1.464529783630371 }, { "epoch": 52, "eval_accuracy": 0.5038, "eval_loss": 1.78495341796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18304, "train_examples": 45000, "train_loss": 1.5189528352101644 }, { "epoch": 53, "eval_accuracy": 0.5186, "eval_loss": 1.6093507080078124, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 18656, "train_examples": 45000, "train_loss": 1.4640200068155924 }, { "epoch": 54, "eval_accuracy": 0.52, "eval_loss": 1.6729033447265624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19008, "train_examples": 45000, "train_loss": 1.4083326490402222 }, { "epoch": 55, "eval_accuracy": 0.5778, "eval_loss": 1.3512170654296876, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19360, "train_examples": 45000, "train_loss": 1.416956041378445 }, { "epoch": 56, "eval_accuracy": 0.5506, "eval_loss": 1.6091921142578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 19712, "train_examples": 45000, "train_loss": 1.4798751659181384 }, { "epoch": 57, "eval_accuracy": 0.512, "eval_loss": 1.6767433837890624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20064, "train_examples": 45000, "train_loss": 1.4291151117112901 }, { "epoch": 58, "eval_accuracy": 0.545, "eval_loss": 1.5081556396484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20416, "train_examples": 45000, "train_loss": 1.3918506565093993 }, { "epoch": 59, "eval_accuracy": 0.539, "eval_loss": 1.5954337890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 20768, "train_examples": 45000, "train_loss": 1.5130316936280992 }, { "epoch": 60, "eval_accuracy": 0.5556, "eval_loss": 1.492790185546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21120, "train_examples": 45000, "train_loss": 1.47905190410614 }, { "epoch": 61, "eval_accuracy": 0.521, "eval_loss": 1.7738572021484376, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21472, "train_examples": 45000, "train_loss": 1.3852702054129706 }, { "epoch": 62, "eval_accuracy": 0.5432, "eval_loss": 1.5759424560546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 21824, "train_examples": 45000, "train_loss": 1.4184113253699409 }, { "epoch": 63, "eval_accuracy": 0.5626, "eval_loss": 1.61301494140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22176, "train_examples": 45000, "train_loss": 1.5066941794501412 }, { "epoch": 64, "eval_accuracy": 0.5646, "eval_loss": 1.675884912109375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22528, "train_examples": 45000, "train_loss": 1.4340424686219957 }, { "epoch": 65, "eval_accuracy": 0.5372, "eval_loss": 1.64473779296875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 22880, "train_examples": 45000, "train_loss": 1.4120538077672322 }, { "epoch": 66, "eval_accuracy": 0.5084, "eval_loss": 1.7685004150390624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23232, "train_examples": 45000, "train_loss": 1.4140199373457167 }, { "epoch": 67, "eval_accuracy": 0.5182, "eval_loss": 1.8401543212890625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23584, "train_examples": 45000, "train_loss": 1.4402784141964382 }, { "epoch": 68, "eval_accuracy": 0.5674, "eval_loss": 1.4143515380859375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 23936, "train_examples": 45000, "train_loss": 1.4850667947769165 }, { "epoch": 69, "eval_accuracy": 0.581, "eval_loss": 1.3920767578125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24288, "train_examples": 45000, "train_loss": 1.3742551008436414 }, { "epoch": 70, "eval_accuracy": 0.526, "eval_loss": 1.6470415283203126, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24640, "train_examples": 45000, "train_loss": 1.439255021180047 }, { "epoch": 71, "eval_accuracy": 0.5476, "eval_loss": 1.4234358154296876, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 24992, "train_examples": 45000, "train_loss": 1.402162924469842 }, { "epoch": 72, "eval_accuracy": 0.527, "eval_loss": 1.6882696044921874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25344, "train_examples": 45000, "train_loss": 1.3987669376797147 }, { "epoch": 73, "eval_accuracy": 0.5564, "eval_loss": 1.527014453125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 25696, "train_examples": 45000, "train_loss": 1.3347418962902493 }, { "epoch": 74, "eval_accuracy": 0.497, "eval_loss": 1.6632053955078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26048, "train_examples": 45000, "train_loss": 1.3455509513643054 }, { "epoch": 75, "eval_accuracy": 0.5554, "eval_loss": 1.44293671875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26400, "train_examples": 45000, "train_loss": 1.3510505442301433 }, { "epoch": 76, "eval_accuracy": 0.562, "eval_loss": 1.5632307861328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 26752, "train_examples": 45000, "train_loss": 1.4097723316192627 }, { "epoch": 77, "eval_accuracy": 0.4878, "eval_loss": 1.86476484375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27104, "train_examples": 45000, "train_loss": 1.3837750133726332 }, { "epoch": 78, "eval_accuracy": 0.5332, "eval_loss": 1.5847595947265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27456, "train_examples": 45000, "train_loss": 1.396502939499749 }, { "epoch": 79, "eval_accuracy": 0.5112, "eval_loss": 1.5564174560546875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 27808, "train_examples": 45000, "train_loss": 1.3709289339065551 }, { "epoch": 80, "eval_accuracy": 0.5394, "eval_loss": 1.9737873046875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28160, "train_examples": 45000, "train_loss": 1.4022963900883993 }, { "epoch": 81, "eval_accuracy": 0.5584, "eval_loss": 1.5171572021484374, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28512, "train_examples": 45000, "train_loss": 1.370726917775472 }, { "epoch": 82, "eval_accuracy": 0.5358, "eval_loss": 1.4977206787109374, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 28864, "train_examples": 45000, "train_loss": 1.4500145688374837 }, { "epoch": 83, "eval_accuracy": 0.5152, "eval_loss": 1.8416988037109374, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29216, "train_examples": 45000, "train_loss": 1.4227493050893147 }, { "epoch": 84, "eval_accuracy": 0.5836, "eval_loss": 1.352899951171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29568, "train_examples": 45000, "train_loss": 1.3736794021606444 }, { "epoch": 85, "eval_accuracy": 0.5584, "eval_loss": 1.6942635498046874, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 29920, "train_examples": 45000, "train_loss": 1.389241146045261 }, { "epoch": 86, "eval_accuracy": 0.5596, "eval_loss": 1.4475465087890624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30272, "train_examples": 45000, "train_loss": 1.270623020532396 }, { "epoch": 87, "eval_accuracy": 0.5794, "eval_loss": 1.3361758056640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30624, "train_examples": 45000, "train_loss": 1.3661915603425767 }, { "epoch": 88, "eval_accuracy": 0.5566, "eval_loss": 1.4134527587890624, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 30976, "train_examples": 45000, "train_loss": 1.3660098644044665 }, { "epoch": 89, "eval_accuracy": 0.53, "eval_loss": 1.5531100341796875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31328, "train_examples": 45000, "train_loss": 1.2967509341133965 }, { "epoch": 90, "eval_accuracy": 0.51, "eval_loss": 1.7390384521484374, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 31680, "train_examples": 45000, "train_loss": 1.3260442124684653 }, { "epoch": 91, "eval_accuracy": 0.5874, "eval_loss": 1.3916345458984376, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32032, "train_examples": 45000, "train_loss": 1.3153838235431248 }, { "epoch": 92, "eval_accuracy": 0.5636, "eval_loss": 1.4337053955078125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32384, "train_examples": 45000, "train_loss": 1.2993551434834798 }, { "epoch": 93, "eval_accuracy": 0.533, "eval_loss": 1.6667333984375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 32736, "train_examples": 45000, "train_loss": 1.3019694290796915 }, { "epoch": 94, "eval_accuracy": 0.5652, "eval_loss": 1.4489898681640625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33088, "train_examples": 45000, "train_loss": 1.2822739417394002 }, { "epoch": 95, "eval_accuracy": 0.5668, "eval_loss": 1.419910986328125, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33440, "train_examples": 45000, "train_loss": 1.3006300278769598 }, { "epoch": 96, "eval_accuracy": 0.5394, "eval_loss": 1.69527265625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 33792, "train_examples": 45000, "train_loss": 1.238620239914788 }, { "epoch": 97, "eval_accuracy": 0.513, "eval_loss": 1.7494765869140625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34144, "train_examples": 45000, "train_loss": 1.2671517435497708 }, { "epoch": 98, "eval_accuracy": 0.5838, "eval_loss": 1.2681653076171875, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34496, "train_examples": 45000, "train_loss": 1.3089203299416436 }, { "epoch": 99, "eval_accuracy": 0.5436, "eval_loss": 1.52252724609375, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 34848, "train_examples": 45000, "train_loss": 1.3226820044411554 }, { "epoch": 100, "eval_accuracy": 0.6308, "eval_loss": 1.1525076416015625, "eval_split": "validation", "lr": 0.1, "output_lr": 0.1, "step": 35200, "train_examples": 45000, "train_loss": 1.2924140570958456 }, { "epoch": 101, "eval_accuracy": 0.682, "eval_loss": 0.922958056640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35552, "train_examples": 45000, "train_loss": 0.9534723613103231 }, { "epoch": 102, "eval_accuracy": 0.6796, "eval_loss": 0.9390528076171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 35904, "train_examples": 45000, "train_loss": 0.9059994698312548 }, { "epoch": 103, "eval_accuracy": 0.686, "eval_loss": 0.9127562133789062, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36256, "train_examples": 45000, "train_loss": 0.8874733817100525 }, { "epoch": 104, "eval_accuracy": 0.6914, "eval_loss": 0.89916376953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36608, "train_examples": 45000, "train_loss": 0.8901613323529561 }, { "epoch": 105, "eval_accuracy": 0.6866, "eval_loss": 0.9040415405273438, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 36960, "train_examples": 45000, "train_loss": 0.8719133009168837 }, { "epoch": 106, "eval_accuracy": 0.6934, "eval_loss": 0.91411796875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37312, "train_examples": 45000, "train_loss": 0.8583287696414523 }, { "epoch": 107, "eval_accuracy": 0.6924, "eval_loss": 0.89068076171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 37664, "train_examples": 45000, "train_loss": 0.8588273622512818 }, { "epoch": 108, "eval_accuracy": 0.6922, "eval_loss": 0.9007458984375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38016, "train_examples": 45000, "train_loss": 0.8597999311447143 }, { "epoch": 109, "eval_accuracy": 0.7014, "eval_loss": 0.8806451171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38368, "train_examples": 45000, "train_loss": 0.8486230295923021 }, { "epoch": 110, "eval_accuracy": 0.689, "eval_loss": 0.9200911865234375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 38720, "train_examples": 45000, "train_loss": 0.8488019719229805 }, { "epoch": 111, "eval_accuracy": 0.7036, "eval_loss": 0.8662437866210938, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39072, "train_examples": 45000, "train_loss": 0.8433535183800591 }, { "epoch": 112, "eval_accuracy": 0.6954, "eval_loss": 0.8857200561523437, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39424, "train_examples": 45000, "train_loss": 0.8497770226160685 }, { "epoch": 113, "eval_accuracy": 0.696, "eval_loss": 0.8835077026367187, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 39776, "train_examples": 45000, "train_loss": 0.8537612689124213 }, { "epoch": 114, "eval_accuracy": 0.6884, "eval_loss": 0.8951915893554687, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40128, "train_examples": 45000, "train_loss": 0.8630593092494541 }, { "epoch": 115, "eval_accuracy": 0.692, "eval_loss": 0.89095966796875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40480, "train_examples": 45000, "train_loss": 0.8638030516730415 }, { "epoch": 116, "eval_accuracy": 0.7048, "eval_loss": 0.877529052734375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 40832, "train_examples": 45000, "train_loss": 0.8609290717230903 }, { "epoch": 117, "eval_accuracy": 0.7066, "eval_loss": 0.8617789794921875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41184, "train_examples": 45000, "train_loss": 0.8482380716853671 }, { "epoch": 118, "eval_accuracy": 0.6902, "eval_loss": 0.901466943359375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41536, "train_examples": 45000, "train_loss": 0.8500684111277262 }, { "epoch": 119, "eval_accuracy": 0.6872, "eval_loss": 0.9289511840820313, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 41888, "train_examples": 45000, "train_loss": 0.8877813004069858 }, { "epoch": 120, "eval_accuracy": 0.6874, "eval_loss": 0.937879931640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42240, "train_examples": 45000, "train_loss": 0.9034233251783583 }, { "epoch": 121, "eval_accuracy": 0.6836, "eval_loss": 0.9336000122070313, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42592, "train_examples": 45000, "train_loss": 0.9166675170262655 }, { "epoch": 122, "eval_accuracy": 0.6874, "eval_loss": 0.919823388671875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 42944, "train_examples": 45000, "train_loss": 0.8952297897338867 }, { "epoch": 123, "eval_accuracy": 0.6752, "eval_loss": 0.9460063232421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43296, "train_examples": 45000, "train_loss": 0.9035753014034695 }, { "epoch": 124, "eval_accuracy": 0.681, "eval_loss": 0.939022802734375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 43648, "train_examples": 45000, "train_loss": 0.908453873623742 }, { "epoch": 125, "eval_accuracy": 0.6914, "eval_loss": 0.9120480102539062, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44000, "train_examples": 45000, "train_loss": 0.9134819952646891 }, { "epoch": 126, "eval_accuracy": 0.684, "eval_loss": 0.9374011962890625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44352, "train_examples": 45000, "train_loss": 0.906762312274509 }, { "epoch": 127, "eval_accuracy": 0.6816, "eval_loss": 0.9479945434570313, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 44704, "train_examples": 45000, "train_loss": 0.900509298239814 }, { "epoch": 128, "eval_accuracy": 0.6754, "eval_loss": 0.96343857421875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45056, "train_examples": 45000, "train_loss": 0.8953627472347684 }, { "epoch": 129, "eval_accuracy": 0.6742, "eval_loss": 0.968261376953125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45408, "train_examples": 45000, "train_loss": 0.9279563033845689 }, { "epoch": 130, "eval_accuracy": 0.6846, "eval_loss": 0.9416985961914063, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 45760, "train_examples": 45000, "train_loss": 0.9155617316775851 }, { "epoch": 131, "eval_accuracy": 0.6666, "eval_loss": 0.9798123779296875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46112, "train_examples": 45000, "train_loss": 0.9026238541709052 }, { "epoch": 132, "eval_accuracy": 0.6714, "eval_loss": 0.96294951171875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46464, "train_examples": 45000, "train_loss": 0.9165382932874891 }, { "epoch": 133, "eval_accuracy": 0.678, "eval_loss": 0.9479088256835938, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 46816, "train_examples": 45000, "train_loss": 0.8981040594206916 }, { "epoch": 134, "eval_accuracy": 0.6714, "eval_loss": 0.9769468994140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47168, "train_examples": 45000, "train_loss": 0.9077048551559448 }, { "epoch": 135, "eval_accuracy": 0.6674, "eval_loss": 0.966569775390625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47520, "train_examples": 45000, "train_loss": 0.9450435054779053 }, { "epoch": 136, "eval_accuracy": 0.6658, "eval_loss": 0.9645234619140625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 47872, "train_examples": 45000, "train_loss": 0.9295638001971774 }, { "epoch": 137, "eval_accuracy": 0.6238, "eval_loss": 1.1051807861328125, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48224, "train_examples": 45000, "train_loss": 0.95655686923133 }, { "epoch": 138, "eval_accuracy": 0.642, "eval_loss": 1.03306103515625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48576, "train_examples": 45000, "train_loss": 1.0022516270955404 }, { "epoch": 139, "eval_accuracy": 0.6416, "eval_loss": 1.0455357788085937, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 48928, "train_examples": 45000, "train_loss": 0.9911704215155708 }, { "epoch": 140, "eval_accuracy": 0.6474, "eval_loss": 1.0605947875976562, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49280, "train_examples": 45000, "train_loss": 0.9922565679762099 }, { "epoch": 141, "eval_accuracy": 0.6374, "eval_loss": 1.07503681640625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49632, "train_examples": 45000, "train_loss": 1.0034182527012294 }, { "epoch": 142, "eval_accuracy": 0.641, "eval_loss": 1.061389990234375, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 49984, "train_examples": 45000, "train_loss": 1.0350198850949606 }, { "epoch": 143, "eval_accuracy": 0.6272, "eval_loss": 1.091273046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50336, "train_examples": 45000, "train_loss": 1.015117134115431 }, { "epoch": 144, "eval_accuracy": 0.634, "eval_loss": 1.0583884765625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 50688, "train_examples": 45000, "train_loss": 1.0244670013639663 }, { "epoch": 145, "eval_accuracy": 0.653, "eval_loss": 1.0368972412109374, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51040, "train_examples": 45000, "train_loss": 1.0196523662779067 }, { "epoch": 146, "eval_accuracy": 0.6564, "eval_loss": 1.007610009765625, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51392, "train_examples": 45000, "train_loss": 0.981625235833062 }, { "epoch": 147, "eval_accuracy": 0.6548, "eval_loss": 1.0109105224609376, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 51744, "train_examples": 45000, "train_loss": 0.9948846951166789 }, { "epoch": 148, "eval_accuracy": 0.6306, "eval_loss": 1.0539881225585936, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52096, "train_examples": 45000, "train_loss": 1.052033565235138 }, { "epoch": 149, "eval_accuracy": 0.61, "eval_loss": 1.15952216796875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52448, "train_examples": 45000, "train_loss": 1.0489593990325927 }, { "epoch": 150, "eval_accuracy": 0.6218, "eval_loss": 1.085763623046875, "eval_split": "validation", "lr": 0.010000000000000002, "output_lr": 0.010000000000000002, "step": 52800, "train_examples": 45000, "train_loss": 1.1033223127788967 }, { "epoch": 151, "eval_accuracy": 0.654, "eval_loss": 1.0092583862304687, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53152, "train_examples": 45000, "train_loss": 1.0319644333945381 }, { "epoch": 152, "eval_accuracy": 0.676, "eval_loss": 0.9723513427734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53504, "train_examples": 45000, "train_loss": 0.994410558075375 }, { "epoch": 153, "eval_accuracy": 0.6766, "eval_loss": 0.9589015747070313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 53856, "train_examples": 45000, "train_loss": 0.9668529237747192 }, { "epoch": 154, "eval_accuracy": 0.6738, "eval_loss": 0.95261396484375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54208, "train_examples": 45000, "train_loss": 0.9483775505489773 }, { "epoch": 155, "eval_accuracy": 0.6798, "eval_loss": 0.9446010498046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54560, "train_examples": 45000, "train_loss": 0.9422066597832573 }, { "epoch": 156, "eval_accuracy": 0.6814, "eval_loss": 0.9320489990234375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 54912, "train_examples": 45000, "train_loss": 0.9290729566150241 }, { "epoch": 157, "eval_accuracy": 0.6882, "eval_loss": 0.9252060791015625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55264, "train_examples": 45000, "train_loss": 0.9260442474683126 }, { "epoch": 158, "eval_accuracy": 0.6916, "eval_loss": 0.9229399536132813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55616, "train_examples": 45000, "train_loss": 0.9205480414920383 }, { "epoch": 159, "eval_accuracy": 0.6904, "eval_loss": 0.9217549682617188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 55968, "train_examples": 45000, "train_loss": 0.9238852113935683 }, { "epoch": 160, "eval_accuracy": 0.6848, "eval_loss": 0.9292841796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56320, "train_examples": 45000, "train_loss": 0.9197275682343377 }, { "epoch": 161, "eval_accuracy": 0.6886, "eval_loss": 0.9162351684570312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 56672, "train_examples": 45000, "train_loss": 0.9102767890082465 }, { "epoch": 162, "eval_accuracy": 0.6914, "eval_loss": 0.9114646118164063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57024, "train_examples": 45000, "train_loss": 0.9038821694480048 }, { "epoch": 163, "eval_accuracy": 0.697, "eval_loss": 0.9089584228515625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57376, "train_examples": 45000, "train_loss": 0.9043405807918973 }, { "epoch": 164, "eval_accuracy": 0.6988, "eval_loss": 0.9067180297851563, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 57728, "train_examples": 45000, "train_loss": 0.8994147229936388 }, { "epoch": 165, "eval_accuracy": 0.6932, "eval_loss": 0.9099502319335937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58080, "train_examples": 45000, "train_loss": 0.9026298767301771 }, { "epoch": 166, "eval_accuracy": 0.6942, "eval_loss": 0.9057412231445312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58432, "train_examples": 45000, "train_loss": 0.9046581612269083 }, { "epoch": 167, "eval_accuracy": 0.6932, "eval_loss": 0.906397509765625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 58784, "train_examples": 45000, "train_loss": 0.9021518977906969 }, { "epoch": 168, "eval_accuracy": 0.6908, "eval_loss": 0.9119505981445313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59136, "train_examples": 45000, "train_loss": 0.9030990373081631 }, { "epoch": 169, "eval_accuracy": 0.6868, "eval_loss": 0.9118242309570312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59488, "train_examples": 45000, "train_loss": 0.9032874836497836 }, { "epoch": 170, "eval_accuracy": 0.6822, "eval_loss": 0.92456123046875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 59840, "train_examples": 45000, "train_loss": 0.9015067362467448 }, { "epoch": 171, "eval_accuracy": 0.686, "eval_loss": 0.9098457397460937, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60192, "train_examples": 45000, "train_loss": 0.9019311337153116 }, { "epoch": 172, "eval_accuracy": 0.6856, "eval_loss": 0.9247203979492188, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60544, "train_examples": 45000, "train_loss": 0.9169406125810411 }, { "epoch": 173, "eval_accuracy": 0.6864, "eval_loss": 0.9248978637695312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 60896, "train_examples": 45000, "train_loss": 0.9140570906321208 }, { "epoch": 174, "eval_accuracy": 0.686, "eval_loss": 0.916908447265625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61248, "train_examples": 45000, "train_loss": 0.9104670696258544 }, { "epoch": 175, "eval_accuracy": 0.686, "eval_loss": 0.92089794921875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61600, "train_examples": 45000, "train_loss": 0.9013468429777357 }, { "epoch": 176, "eval_accuracy": 0.6868, "eval_loss": 0.9163492797851562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 61952, "train_examples": 45000, "train_loss": 0.9033487060334947 }, { "epoch": 177, "eval_accuracy": 0.6832, "eval_loss": 0.9202944091796875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62304, "train_examples": 45000, "train_loss": 0.9047088833385044 }, { "epoch": 178, "eval_accuracy": 0.6766, "eval_loss": 0.9400230834960938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 62656, "train_examples": 45000, "train_loss": 0.915128051270379 }, { "epoch": 179, "eval_accuracy": 0.68, "eval_loss": 0.9347542114257813, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63008, "train_examples": 45000, "train_loss": 0.9253638660642836 }, { "epoch": 180, "eval_accuracy": 0.6784, "eval_loss": 0.9496093017578126, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63360, "train_examples": 45000, "train_loss": 0.9585485564867655 }, { "epoch": 181, "eval_accuracy": 0.6754, "eval_loss": 0.9441274047851562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 63712, "train_examples": 45000, "train_loss": 0.9477499859068129 }, { "epoch": 182, "eval_accuracy": 0.6798, "eval_loss": 0.93713427734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64064, "train_examples": 45000, "train_loss": 0.9405778836568197 }, { "epoch": 183, "eval_accuracy": 0.6762, "eval_loss": 0.9379406616210938, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64416, "train_examples": 45000, "train_loss": 0.9201891781171163 }, { "epoch": 184, "eval_accuracy": 0.6798, "eval_loss": 0.9241371215820312, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 64768, "train_examples": 45000, "train_loss": 0.9184683513959249 }, { "epoch": 185, "eval_accuracy": 0.681, "eval_loss": 0.9289290649414063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65120, "train_examples": 45000, "train_loss": 0.9075623473697239 }, { "epoch": 186, "eval_accuracy": 0.682, "eval_loss": 0.9222794555664062, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65472, "train_examples": 45000, "train_loss": 0.9138578772544861 }, { "epoch": 187, "eval_accuracy": 0.6778, "eval_loss": 0.9411468017578125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 65824, "train_examples": 45000, "train_loss": 0.917494329823388 }, { "epoch": 188, "eval_accuracy": 0.6734, "eval_loss": 0.952200244140625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66176, "train_examples": 45000, "train_loss": 0.9213011764632331 }, { "epoch": 189, "eval_accuracy": 0.6812, "eval_loss": 0.9310021484375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66528, "train_examples": 45000, "train_loss": 0.9217213383992513 }, { "epoch": 190, "eval_accuracy": 0.682, "eval_loss": 0.9291856201171875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 66880, "train_examples": 45000, "train_loss": 0.9160469234360589 }, { "epoch": 191, "eval_accuracy": 0.6774, "eval_loss": 0.93428427734375, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67232, "train_examples": 45000, "train_loss": 0.9122076215638055 }, { "epoch": 192, "eval_accuracy": 0.6754, "eval_loss": 0.944618798828125, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67584, "train_examples": 45000, "train_loss": 0.9217920794275072 }, { "epoch": 193, "eval_accuracy": 0.6768, "eval_loss": 0.9403953857421875, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 67936, "train_examples": 45000, "train_loss": 0.9300884993659125 }, { "epoch": 194, "eval_accuracy": 0.6846, "eval_loss": 0.9310226684570313, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68288, "train_examples": 45000, "train_loss": 0.9326077370961507 }, { "epoch": 195, "eval_accuracy": 0.6812, "eval_loss": 0.9314572143554688, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68640, "train_examples": 45000, "train_loss": 0.9251852588123746 }, { "epoch": 196, "eval_accuracy": 0.6792, "eval_loss": 0.9355191040039063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 68992, "train_examples": 45000, "train_loss": 0.924093881840176 }, { "epoch": 197, "eval_accuracy": 0.6796, "eval_loss": 0.9381912963867187, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69344, "train_examples": 45000, "train_loss": 0.9298513369878133 }, { "epoch": 198, "eval_accuracy": 0.6796, "eval_loss": 0.9357055297851562, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 69696, "train_examples": 45000, "train_loss": 0.9319831230163574 }, { "epoch": 199, "eval_accuracy": 0.6888, "eval_loss": 0.9251195556640625, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70048, "train_examples": 45000, "train_loss": 0.9235278500239055 }, { "epoch": 200, "eval_accuracy": 0.6854, "eval_loss": 0.9467566040039063, "eval_split": "validation", "lr": 0.0010000000000000002, "output_lr": 0.0010000000000000002, "step": 70400, "train_examples": 45000, "train_loss": 0.9284468433168199 } ], "evaluation_protocol": { "test_evaluations": 0, "test_used_for_selection": false, "validation_evaluations": 201 }, "final": { "accuracy": 0.6854, "epoch": 200, "evaluation_split": "validation", "finite": true, "loss": 0.9467566040039063, "step": 70400 }, "hardware": { "cuda_device_name": "NVIDIA RTX A6000", "cuda_visible_devices": "0", "device": "cuda", "device_total_memory_bytes": 50896568320, "peak_memory_allocated_bytes": 2009673728, "peak_memory_reserved_bytes": 2550136832, "torch_version": "2.3.1+cu118" }, "protocol_family": "oral_a_cifar_local_resnet_development", "provenance": { "git_commit": "f55872beaee658ff76ac15fd421b73017820c320", "git_tracked_dirty": false }, "schema_version": 1, "split": { "cifar_source_files": [ { "bytes": 31035704, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_1", "sha256": "54636561a3ce25bd3e19253c6b0d8538147b0ae398331ac4a2d86c6d987368cd" }, { "bytes": 31035320, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_2", "sha256": "766b2cef9fbc745cf056b3152224f7cf77163b330ea9a15f9392beb8b89bc5a8" }, { "bytes": 31035999, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_3", "sha256": "0f00d98ebfb30b3ec0ad19f9756dc2630b89003e10525f5e148445e82aa6a1f9" }, { "bytes": 31035696, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_4", "sha256": "3f7bb240661948b8f4d53e36ec720d8306f5668bd0071dcb4e6c947f78e9682b" }, { "bytes": 31035623, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/data_batch_5", "sha256": "d91802434d8376bbaeeadf58a737e3a1b12ac839077e931237e0dcd43adcb154" }, { "bytes": 31035526, "path": "/orion/u/oscarwan/scratch/sdil-data/cifar-10-batches-py/test_batch", "sha256": "f53d8d457504f7cff4ea9e021afcf0e0ad8e24a91f3fc42091b8adef61157831" } ], "dataset": "cifar10", "evaluation_split": "validation", "input_layout": "NCHW", "input_shape": [ 3, 32, 32 ], "loader_seed": 0, "normalization_mean": [ 0.49140000343322754, 0.4821999967098236, 0.4465000033378601 ], "normalization_std": [ 0.24699999392032623, 0.2434999942779541, 0.26159998774528503 ], "split_from_training_only": true, "split_seed": 2027, "test_examples": 10000, "train_examples": 45000, "training_augmentation": "random_crop_32_padding_4_zero_then_horizontal_flip_p0.5", "validation_class_counts": { "0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500 }, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b" }, "timing": { "apical_warmup_wall_s": 0.0, "evaluation_wall_s": 21.07404398918152, "mirror_warmup_wall_s": 0.0, "predictor_warmup_wall_s": 0.0, "timing_excludes_data_loading_hashing_and_model_construction": true, "total_timed_wall_s": 1361.8625671863556, "train_wall_s": 1340.767660856247 }, "work": { "apical_macs_per_example": 40108672, "causal_scalar_observations": 0, "components": { "apical_projection_macs": 360978048000000, "apical_regression_macs": 0, "bp_reverse_macs_estimate": 0, "kp_reciprocal_correlation_macs": 0, "local_weight_correlation_macs": 364959360000000, "mirror_feedback_prediction_macs": 0, "mirror_local_correlation_macs": 0, "mirror_response_macs": 0, "ordinary_forward_macs": 364959360000000, "perturbation_forward_macs": 0, "warmup_clean_forward_macs": 0 }, "definition": "multiply-accumulates in conv/linear maps; one local weight correlation equals one forward-weight MAC count; BP reverse is estimated as one weight-gradient plus one activation-gradient convolution per forward convolution; mixed-traffic/predictor elementwise arithmetic is reported as a conservative operation estimate separately and is not folded into MACs", "elementwise_operations_estimate": 0, "forward_macs_per_example": 40551040, "logical_batch_loss_queries": 0, "mirror_probe_examples": 0, "mirror_readout_probe_examples": 0, "neutral_projection_observations": 0, "per_example_cross_entropy_terms": 0, "total_clean_forward_examples": 9000000, "total_forward_equivalent_examples": 9000000, "total_macs_estimate": 1090896768000000 } }