diff options
15 files changed, 15 insertions, 0 deletions
diff --git a/results/query_confirm_v1_cifar10_d20_dfa_s0.json b/results/query_confirm_v1_cifar10_d20_dfa_s0.json new file mode 100644 index 0000000..eedc3f5 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_dfa_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_dfa_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5764718055725098}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3824, "eval_loss": 1.7975571655273437, "wall_s": 18.077406406402588, "test_acc": 0.3824, "test_loss": 1.7975571655273437}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 18.006752967834473, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 18.006752967834473, "evaluation_wall_s": 0.07001876831054688}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "training_forward_equivalent_examples": 250000.0, "max_perturbation_batch_expansion": 0}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_dfa_s1.json b/results/query_confirm_v1_cifar10_d20_dfa_s1.json new file mode 100644 index 0000000..e500fe4 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_dfa_s1.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 1, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_dfa_s1", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.8419671058654785}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3685, "eval_loss": 1.8002416870117188, "wall_s": 15.876123428344727, "test_acc": 0.3685, "test_loss": 1.8002416870117188}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 15.822102308273315, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 15.822102308273315, "evaluation_wall_s": 0.05331277847290039}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "training_forward_equivalent_examples": 250000.0, "max_perturbation_batch_expansion": 0}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_dfa_s2.json b/results/query_confirm_v1_cifar10_d20_dfa_s2.json new file mode 100644 index 0000000..462fdd4 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_dfa_s2.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 2, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_dfa_s2", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6389660835266113}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3641, "eval_loss": 1.8239850830078126, "wall_s": 20.725680828094482, "test_acc": 0.3641, "test_loss": 1.8239850830078126}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 20.67683982849121, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 20.67683982849121, "evaluation_wall_s": 0.048128604888916016}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "training_forward_equivalent_examples": 250000.0, "max_perturbation_batch_expansion": 0}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_dfa_s3.json b/results/query_confirm_v1_cifar10_d20_dfa_s3.json new file mode 100644 index 0000000..a5d1211 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_dfa_s3.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 3, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_dfa_s3", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5661840438842773}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3673, "eval_loss": 1.79790966796875, "wall_s": 16.544461488723755, "test_acc": 0.3673, "test_loss": 1.79790966796875}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 16.490129947662354, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 16.490129947662354, "evaluation_wall_s": 0.05352592468261719}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "training_forward_equivalent_examples": 250000.0, "max_perturbation_batch_expansion": 0}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_dfa_s4.json b/results/query_confirm_v1_cifar10_d20_dfa_s4.json new file mode 100644 index 0000000..a1df1c0 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_dfa_s4.json @@ -0,0 +1 @@ +{"args": {"mode": "dfa", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 4, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_dfa_s4", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6019721031188965}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.373, "eval_loss": 1.7807241577148438, "wall_s": 16.302547216415405, "test_acc": 0.373, "test_loss": 1.7807241577148438}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 16.257509231567383, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 16.257509231567383, "evaluation_wall_s": 0.04439687728881836}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 0, "calibration_batch_loss_evaluations": 0, "calibration_example_loss_evaluations": 0, "calibration_forward_equivalent_examples": 0.0, "training_forward_equivalent_examples": 250000.0, "max_perturbation_batch_expansion": 0}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k16_e4_s0.json b/results/query_confirm_v1_cifar10_d20_k16_e4_s0.json new file mode 100644 index 0000000..d89ad06 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k16_e4_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k16_e4_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5764718055725098}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3925, "eval_loss": 1.7664053100585937, "wall_s": 20.409565210342407, "test_acc": 0.3925, "test_loss": 1.7664053100585937}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 20.371642351150513, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 20.371642351150513, "evaluation_wall_s": 0.037268877029418945}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 15648, "calibration_example_loss_evaluations": 2001408, "calibration_forward_equivalent_examples": 2063952.0, "training_forward_equivalent_examples": 2313952.0, "max_perturbation_batch_expansion": 32}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 842534400, "peak_memory_reserved_bytes": 855638016}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k16_e4_s1.json b/results/query_confirm_v1_cifar10_d20_k16_e4_s1.json new file mode 100644 index 0000000..74323df --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k16_e4_s1.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 1, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k16_e4_s1", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.8419671058654785}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3772, "eval_loss": 1.7726597045898438, "wall_s": 20.83530330657959, "test_acc": 0.3772, "test_loss": 1.7726597045898438}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 20.790318250656128, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 20.790318250656128, "evaluation_wall_s": 0.04428529739379883}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 15648, "calibration_example_loss_evaluations": 2001408, "calibration_forward_equivalent_examples": 2063952.0, "training_forward_equivalent_examples": 2313952.0, "max_perturbation_batch_expansion": 32}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 842534400, "peak_memory_reserved_bytes": 855638016}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k16_e4_s2.json b/results/query_confirm_v1_cifar10_d20_k16_e4_s2.json new file mode 100644 index 0000000..ff0fc70 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k16_e4_s2.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 2, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k16_e4_s2", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6389660835266113}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.385, "eval_loss": 1.7715051879882813, "wall_s": 20.198477745056152, "test_acc": 0.385, "test_loss": 1.7715051879882813}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 20.15629291534424, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 20.15629291534424, "evaluation_wall_s": 0.0414736270904541}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 15648, "calibration_example_loss_evaluations": 2001408, "calibration_forward_equivalent_examples": 2063952.0, "training_forward_equivalent_examples": 2313952.0, "max_perturbation_batch_expansion": 32}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 842534400, "peak_memory_reserved_bytes": 855638016}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k16_e4_s3.json b/results/query_confirm_v1_cifar10_d20_k16_e4_s3.json new file mode 100644 index 0000000..4f2987e --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k16_e4_s3.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 3, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k16_e4_s3", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5661840438842773}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3796, "eval_loss": 1.7707836303710938, "wall_s": 20.573787689208984, "test_acc": 0.3796, "test_loss": 1.7707836303710938}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 20.531110763549805, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 20.531110763549805, "evaluation_wall_s": 0.04204201698303223}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 15648, "calibration_example_loss_evaluations": 2001408, "calibration_forward_equivalent_examples": 2063952.0, "training_forward_equivalent_examples": 2313952.0, "max_perturbation_batch_expansion": 32}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 842534400, "peak_memory_reserved_bytes": 855638016}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k16_e4_s4.json b/results/query_confirm_v1_cifar10_d20_k16_e4_s4.json new file mode 100644 index 0000000..902870b --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k16_e4_s4.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 16, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 4, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k16_e4_s4", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6019721031188965}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3902, "eval_loss": 1.7568255493164062, "wall_s": 30.985372304916382, "test_acc": 0.3902, "test_loss": 1.7568255493164062}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 30.93915557861328, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 30.93915557861328, "evaluation_wall_s": 0.04552960395812988}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 15648, "calibration_example_loss_evaluations": 2001408, "calibration_forward_equivalent_examples": 2063952.0, "training_forward_equivalent_examples": 2313952.0, "max_perturbation_batch_expansion": 32}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 842534400, "peak_memory_reserved_bytes": 855638016}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k1_e4_s0.json b/results/query_confirm_v1_cifar10_d20_k1_e4_s0.json new file mode 100644 index 0000000..ade7579 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k1_e4_s0.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 0, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k1_e4_s0", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5764718055725098}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3909, "eval_loss": 1.75774228515625, "wall_s": 21.57148265838623, "test_acc": 0.3909, "test_loss": 1.75774228515625}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 21.52017903327942, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 21.52017903327942, "evaluation_wall_s": 0.05042004585266113}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 978, "calibration_example_loss_evaluations": 125088, "calibration_forward_equivalent_examples": 187632.0, "training_forward_equivalent_examples": 437632.0, "max_perturbation_batch_expansion": 2}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k1_e4_s1.json b/results/query_confirm_v1_cifar10_d20_k1_e4_s1.json new file mode 100644 index 0000000..6a193e3 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k1_e4_s1.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 1, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k1_e4_s1", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.8419671058654785}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3901, "eval_loss": 1.7428056640625, "wall_s": 21.55368161201477, "test_acc": 0.3901, "test_loss": 1.7428056640625}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 21.47067952156067, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 21.47067952156067, "evaluation_wall_s": 0.08236002922058105}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 978, "calibration_example_loss_evaluations": 125088, "calibration_forward_equivalent_examples": 187632.0, "training_forward_equivalent_examples": 437632.0, "max_perturbation_batch_expansion": 2}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k1_e4_s2.json b/results/query_confirm_v1_cifar10_d20_k1_e4_s2.json new file mode 100644 index 0000000..19c0e42 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k1_e4_s2.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 2, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k1_e4_s2", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6389660835266113}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3864, "eval_loss": 1.75776767578125, "wall_s": 21.104275465011597, "test_acc": 0.3864, "test_loss": 1.75776767578125}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 21.05476951599121, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 21.05476951599121, "evaluation_wall_s": 0.04884195327758789}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 978, "calibration_example_loss_evaluations": 125088, "calibration_forward_equivalent_examples": 187632.0, "training_forward_equivalent_examples": 437632.0, "max_perturbation_batch_expansion": 2}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k1_e4_s3.json b/results/query_confirm_v1_cifar10_d20_k1_e4_s3.json new file mode 100644 index 0000000..082c7e5 --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k1_e4_s3.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 3, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k1_e4_s3", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.5661840438842773}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3894, "eval_loss": 1.7561597778320313, "wall_s": 20.05713963508606, "test_acc": 0.3894, "test_loss": 1.7561597778320313}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 19.998631238937378, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 19.998631238937378, "evaluation_wall_s": 0.05787491798400879}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 978, "calibration_example_loss_evaluations": 125088, "calibration_forward_equivalent_examples": 187632.0, "training_forward_equivalent_examples": 437632.0, "max_perturbation_batch_expansion": 2}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "7", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file diff --git a/results/query_confirm_v1_cifar10_d20_k1_e4_s4.json b/results/query_confirm_v1_cifar10_d20_k1_e4_s4.json new file mode 100644 index 0000000..9657d8d --- /dev/null +++ b/results/query_confirm_v1_cifar10_d20_k1_e4_s4.json @@ -0,0 +1 @@ +{"args": {"mode": "sdil", "dataset": "cifar10", "depth": 20, "width": 64, "act": "tanh", "residual": 1, "epochs": 5, "batch_size": 128, "train_examples": 0, "val_examples": 0, "split_seed": 2027, "eval_split": "test", "task_seed": 0, "task_train_examples": 50000, "task_test_examples": 10000, "task_levels": 8, "task_n_in": 128, "task_classes": 10, "teacher_depth": 8, "teacher_width": 64, "teacher_residual": 1, "eta": 0.05, "eta_A": 0.02, "eta_P": 0.002, "momentum": 0.9, "w_scale": 1.0, "a_scale": 1.0, "feedback_scale": 1.0, "pert_sigma": 0.01, "pert_every": 4, "pert_ndirs": 1, "pert_mode": "simultaneous", "use_residual": 0, "raw_scale_control": "none", "learn_A": 1, "learn_P": 0, "p_neutral": 1, "p_warmup_steps": 0, "p_warmup_eta": 0.05, "nuis_rho": 0.0, "traffic_seed": 1234, "traffic_mode": "none", "predictor_mode": "diagonal", "normalize_delta": 0, "settle_steps": 0, "kappa": 0.0, "feedback": "error", "seed": 4, "device": "cuda", "log_every": 100000, "diagnostics": "none", "eval_every": 0, "max_steps": 0, "probe_bs": 512, "outdir": "results", "tag": "query_confirm_v1_cifar10_d20_k1_e4_s4", "n_in": 3072, "n_out": 10}, "split": {"dataset": "cifar10", "split_seed": null, "validation_examples": 0, "validation_index_sha256": null, "validation_class_counts": {}, "train_examples": 50000, "test_examples": 10000, "split_from_training_only": true, "evaluation_split": "test"}, "provenance": {"git_commit": "66899949bcbb11664a63669c2d27bd4c12284955", "git_dirty": false}, "steps": [{"step": 0, "epoch": 0, "train_loss": 2.6019721031188965}, {"epoch_end": 0, "step": 391}, {"epoch_end": 1, "step": 782}, {"epoch_end": 2, "step": 1173}, {"epoch_end": 3, "step": 1564}, {"epoch_end": 4, "step": 1955}], "final": {"eval_split": "test", "eval_acc": 0.3766, "eval_loss": 1.77540078125, "wall_s": 19.809255838394165, "test_acc": 0.3766, "test_loss": 1.77540078125}, "timing": {"warmup_wall_s": 0.0, "training_loop_wall_s": 19.765904188156128, "diagnostics_wall_s": 0.0, "inline_diagnostics_wall_s": 0.0, "optimizer_wall_s_excluding_inline_diagnostics": 19.765904188156128, "evaluation_wall_s": 0.04268479347229004}, "cost": {"train_steps": 1955, "ordinary_training_forward_examples": 250000, "predictor_warmup_forward_examples": 0, "perturbation_events": 489, "calibration_batch_loss_evaluations": 978, "calibration_example_loss_evaluations": 125088, "calibration_forward_equivalent_examples": 187632.0, "training_forward_equivalent_examples": 437632.0, "max_perturbation_batch_expansion": 2}, "hardware": {"device": "cuda", "torch_version": "2.3.1+cu118", "cuda_device_name": "NVIDIA GeForce GTX 1080", "cuda_visible_devices": "5", "device_total_memory_bytes": 8507949056, "peak_memory_allocated_bytes": 775734272, "peak_memory_reserved_bytes": 801112064}}
\ No newline at end of file |
