diff options
| author | YurenHao0426 <Blackhao0426@gmail.com> | 2026-07-22 02:18:47 -0500 |
|---|---|---|
| committer | YurenHao0426 <Blackhao0426@gmail.com> | 2026-07-22 02:18:47 -0500 |
| commit | 7ae095f6e87977caece1d53380c2b395d69d6000 (patch) | |
| tree | cece7a4b92f8e8a799191e592a4f21f78808ac5b | |
| parent | 1a22a99a5ebc857ae5a5270ffddacce6aa1386d8 (diff) | |
results: identify 16x lower-query calibration
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_dfa_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k16_e4_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k1_e16_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k1_e4_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k1_e8_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k2_e32_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k2_e8_s0.json | 1 | ||||
| -rw-r--r-- | results/query_dev_v1_cifar10_d20_k4_e16_s0.json | 1 |
8 files changed, 8 insertions, 0 deletions
diff --git a/results/query_dev_v1_cifar10_d20_dfa_s0.json b/results/query_dev_v1_cifar10_d20_dfa_s0.json new file mode 100644 index 0000000..7040183 --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_dfa_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_dfa_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3666, "eval_loss": 1.8242423583984375, "wall_s": 15.126713752746582, "val_acc": 0.3666, "val_loss": 1.8242423583984375}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 15.093709230422974, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 15.093709230422974, "evaluation_wall_s": 0.032353878021240234}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "max_perturbation_batch_expansion": 0}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k16_e4_s0.json b/results/query_dev_v1_cifar10_d20_k16_e4_s0.json new file mode 100644 index 0000000..dc1bfea --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k16_e4_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k16_e4_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3746, "eval_loss": 1.7985405517578126, "wall_s": 18.42129898071289, "val_acc": 0.3746, "val_loss": 1.7985405517578126}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 18.393327474594116, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 18.393327474594116, "evaluation_wall_s": 0.027316570281982422}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 440, "calibration_batch_loss_evaluations": 14080, "calibration_example_loss_evaluations": 1802240, "calibration_forward_equivalent_examples": 1858560.0, "max_perturbation_batch_expansion": 32}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k1_e16_s0.json b/results/query_dev_v1_cifar10_d20_k1_e16_s0.json new file mode 100644 index 0000000..d890ef3 --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k1_e16_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 16, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k1_e16_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3652, "eval_loss": 1.81310078125, "wall_s": 22.77718949317932, "val_acc": 0.3652, "val_loss": 1.81310078125}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 22.74253273010254, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 22.74253273010254, "evaluation_wall_s": 0.033913612365722656}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 110, "calibration_batch_loss_evaluations": 220, "calibration_example_loss_evaluations": 28160, "calibration_forward_equivalent_examples": 42240.0, "max_perturbation_batch_expansion": 2}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k1_e4_s0.json b/results/query_dev_v1_cifar10_d20_k1_e4_s0.json new file mode 100644 index 0000000..4476bc3 --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k1_e4_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k1_e4_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3808, "eval_loss": 1.7738605224609374, "wall_s": 18.63955855369568, "val_acc": 0.3808, "val_loss": 1.7738605224609374}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 18.59639620780945, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 18.59639620780945, "evaluation_wall_s": 0.042571067810058594}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 440, "calibration_batch_loss_evaluations": 880, "calibration_example_loss_evaluations": 112640, "calibration_forward_equivalent_examples": 168960.0, "max_perturbation_batch_expansion": 2}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k1_e8_s0.json b/results/query_dev_v1_cifar10_d20_k1_e8_s0.json new file mode 100644 index 0000000..0f7aafd --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k1_e8_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 8, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k1_e8_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.367, "eval_loss": 1.80562412109375, "wall_s": 18.2256863117218, "val_acc": 0.367, "val_loss": 1.80562412109375}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 18.194968223571777, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 18.194968223571777, "evaluation_wall_s": 0.029844999313354492}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 220, "calibration_batch_loss_evaluations": 440, "calibration_example_loss_evaluations": 56320, "calibration_forward_equivalent_examples": 84480.0, "max_perturbation_batch_expansion": 2}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k2_e32_s0.json b/results/query_dev_v1_cifar10_d20_k2_e32_s0.json new file mode 100644 index 0000000..64e4154 --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k2_e32_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 32, "pert_ndirs": 2, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k2_e32_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3678, "eval_loss": 1.827108837890625, "wall_s": 15.419371843338013, "val_acc": 0.3678, "val_loss": 1.827108837890625}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 15.384203672409058, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 15.384203672409058, "evaluation_wall_s": 0.03455829620361328}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 55, "calibration_batch_loss_evaluations": 220, "calibration_example_loss_evaluations": 28160, "calibration_forward_equivalent_examples": 35200.0, "max_perturbation_batch_expansion": 4}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k2_e8_s0.json b/results/query_dev_v1_cifar10_d20_k2_e8_s0.json new file mode 100644 index 0000000..d4e0dad --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k2_e8_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 8, "pert_ndirs": 2, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k2_e8_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3732, "eval_loss": 1.80643046875, "wall_s": 16.527502298355103, "val_acc": 0.3732, "val_loss": 1.80643046875}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 16.486323833465576, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 16.486323833465576, "evaluation_wall_s": 0.040602684020996094}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 220, "calibration_batch_loss_evaluations": 880, "calibration_example_loss_evaluations": 112640, "calibration_forward_equivalent_examples": 140800.0, "max_perturbation_batch_expansion": 4}}
\ No newline at end of file diff --git a/results/query_dev_v1_cifar10_d20_k4_e16_s0.json b/results/query_dev_v1_cifar10_d20_k4_e16_s0.json new file mode 100644 index 0000000..3dc523e --- /dev/null +++ b/results/query_dev_v1_cifar10_d20_k4_e16_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 5000, "split_seed": 2027, "eval_split": "validation", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 16, "pert_ndirs": 4, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_dev_v1_cifar10_d20_k4_e16_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": 2027, "validation_examples": 5000, "validation_index_sha256": "8328b206a97c420e49e54e3eca4abe3274c4756b084355784ea3fb8059e4515b", "validation_class_counts": {"0": 500, "1": 500, "2": 500, "3": 500, "4": 500, "5": 500, "6": 500, "7": 500, "8": 500, "9": 500}, "train_examples": 45000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "validation"}, "provenance": {"git_commit": "1a22a99a5ebc857ae5a5270ffddacce6aa1386d8", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.44761323928833}, {"epoch_end": 0, "step": 352}, {"epoch_end": 1, "step": 704}, {"epoch_end": 2, "step": 1056}, {"epoch_end": 3, "step": 1408}, {"epoch_end": 4, "step": 1760}], "final": {"eval_split": "validation", "eval_acc": 0.3598, "eval_loss": 1.81782216796875, "wall_s": 16.376822233200073, "val_acc": 0.3598, "val_loss": 1.81782216796875}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 16.33908247947693, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 16.33908247947693, "evaluation_wall_s": 0.03708195686340332}, "cost": {"train_steps": 1760, "ordinary_training_forward_examples": 225000, "predictor_warmup_forward_examples": 0, "perturbation_events": 110, "calibration_batch_loss_evaluations": 880, "calibration_example_loss_evaluations": 112640, "calibration_forward_equivalent_examples": 126720.0, "max_perturbation_batch_expansion": 8}}
\ No newline at end of file |
