summaryrefslogtreecommitdiff
path: root/results/babyai_shared/pickup_p2_analysis.json
diff options
context:
space:
mode:
authorYurenHao0426 <Blackhao0426@gmail.com>2026-08-10 10:45:41 -0500
committerYurenHao0426 <Blackhao0426@gmail.com>2026-08-10 10:45:41 -0500
commitbc93d2a673f5f971415715dad11c5e8baf2a6202 (patch)
treefb7adf33603be79a7bc3860a43bb322fa91214ed /results/babyai_shared/pickup_p2_analysis.json
parent7b7d7a08a5e78c3379397f01f0c9af97d5d84fbd (diff)
results: reject diagonal SDIL on PickupLoc
Diffstat (limited to 'results/babyai_shared/pickup_p2_analysis.json')
-rw-r--r--results/babyai_shared/pickup_p2_analysis.json174
1 files changed, 174 insertions, 0 deletions
diff --git a/results/babyai_shared/pickup_p2_analysis.json b/results/babyai_shared/pickup_p2_analysis.json
new file mode 100644
index 0000000..845e70c
--- /dev/null
+++ b/results/babyai_shared/pickup_p2_analysis.json
@@ -0,0 +1,174 @@
+{
+ "checks": {
+ "all_runs_finite": true,
+ "clean_kp_success_at_least_60_every_seed": true,
+ "raw_below_clean_kp_every_seed": true,
+ "sdil_above_raw_every_seed": false,
+ "sdil_nonzero_success_every_seed": false
+ },
+ "conditions": {
+ "bp": {
+ "all_finite": true,
+ "expert_action_accuracy_percent": {
+ "mean": 87.78380713263681,
+ "sample_std": 0.1078533752082175,
+ "values": [
+ 87.8108042439459,
+ 87.87559731108772,
+ 87.66501984287682
+ ]
+ },
+ "mission_lesion_rollout_success_percent": {
+ "mean": 49.333333333333336,
+ "sample_std": 1.1015141094572214,
+ "values": [
+ 48.8,
+ 50.6,
+ 48.6
+ ]
+ },
+ "rollout_success_percent": {
+ "mean": 79.33333333333333,
+ "sample_std": 5.1588112325741635,
+ "values": [
+ 80.80000000000001,
+ 83.6,
+ 73.6
+ ]
+ }
+ },
+ "clean_kp": {
+ "all_finite": true,
+ "expert_action_accuracy_percent": {
+ "mean": 86.43665127831322,
+ "sample_std": 0.3517610682148285,
+ "values": [
+ 86.13428363165141,
+ 86.8227099700332,
+ 86.35296023325503
+ ]
+ },
+ "mission_lesion_rollout_success_percent": {
+ "mean": 48.86666666666667,
+ "sample_std": 7.245228314783008,
+ "values": [
+ 49.8,
+ 55.60000000000001,
+ 41.199999999999996
+ ]
+ },
+ "rollout_success_percent": {
+ "mean": 70.86666666666667,
+ "sample_std": 5.34540300944029,
+ "values": [
+ 67.2,
+ 77.0,
+ 68.4
+ ]
+ }
+ },
+ "raw_shared": {
+ "all_finite": true,
+ "expert_action_accuracy_percent": {
+ "mean": 59.642018304041464,
+ "sample_std": 9.767595165741607,
+ "values": [
+ 49.89066169919818,
+ 69.42577144245566,
+ 59.609621770470554
+ ]
+ },
+ "mission_lesion_rollout_success_percent": {
+ "mean": 8.733333333333334,
+ "sample_std": 9.843441132720475,
+ "values": [
+ 0.0,
+ 19.400000000000002,
+ 6.800000000000001
+ ]
+ },
+ "rollout_success_percent": {
+ "mean": 10.000000000000002,
+ "sample_std": 11.92644121270046,
+ "values": [
+ 0.0,
+ 23.200000000000003,
+ 6.800000000000001
+ ]
+ }
+ },
+ "sdil": {
+ "all_finite": true,
+ "expert_action_accuracy_percent": {
+ "mean": 49.89066169919818,
+ "sample_std": 0.0,
+ "values": [
+ 49.89066169919818,
+ 49.89066169919818,
+ 49.89066169919818
+ ]
+ },
+ "mission_lesion_rollout_success_percent": {
+ "mean": 0.0,
+ "sample_std": 0.0,
+ "values": [
+ 0.0,
+ 0.0,
+ 0.0
+ ]
+ },
+ "rollout_success_percent": {
+ "mean": 0.0,
+ "sample_std": 0.0,
+ "values": [
+ 0.0,
+ 0.0,
+ 0.0
+ ]
+ }
+ }
+ },
+ "decision": "Close the diagonal per-cell predictor on PickupLoc. Raw shared feedback fails as hypothesized, but this SDIL implementation does not recover it. Screen the originally specified population predictor using neutral prediction only before another endpoint.",
+ "gate": "fail",
+ "paired_clean_kp_minus_raw_rollout_points": {
+ "mean": 60.866666666666674,
+ "sample_std": 6.730032194078519,
+ "values": [
+ 67.2,
+ 53.800000000000004,
+ 61.60000000000001
+ ]
+ },
+ "paired_sdil_minus_raw_rollout_points": {
+ "mean": -10.000000000000002,
+ "sample_std": 11.92644121270046,
+ "values": [
+ 0.0,
+ -23.200000000000003,
+ -6.800000000000001
+ ]
+ },
+ "sdil_predictor": {
+ "action_or_teaching_observations": 0,
+ "maximum_layer_residual_context_rms_ratio": {
+ "mean": 0.614041248957316,
+ "sample_std": 0.011718512673796736,
+ "values": [
+ 0.6220114827156067,
+ 0.6005861759185791,
+ 0.6195260882377625
+ ]
+ },
+ "mean_per_cell_r2": {
+ "mean": 0.30999962737162906,
+ "sample_std": 0.005533015870761776,
+ "values": [
+ 0.3146054223179817,
+ 0.3038621172308922,
+ 0.31153134256601334
+ ]
+ }
+ },
+ "stage": "babyai_pickup_p2_analysis",
+ "test_split_generated_or_read": false
+}