diff options
| author | YurenHao0426 <Blackhao0426@gmail.com> | 2026-08-10 10:45:41 -0500 |
|---|---|---|
| committer | YurenHao0426 <Blackhao0426@gmail.com> | 2026-08-10 10:45:41 -0500 |
| commit | bc93d2a673f5f971415715dad11c5e8baf2a6202 (patch) | |
| tree | fb7adf33603be79a7bc3860a43bb322fa91214ed /results/babyai_shared/pickup_p2_analysis.json | |
| parent | 7b7d7a08a5e78c3379397f01f0c9af97d5d84fbd (diff) | |
results: reject diagonal SDIL on PickupLoc
Diffstat (limited to 'results/babyai_shared/pickup_p2_analysis.json')
| -rw-r--r-- | results/babyai_shared/pickup_p2_analysis.json | 174 |
1 files changed, 174 insertions, 0 deletions
diff --git a/results/babyai_shared/pickup_p2_analysis.json b/results/babyai_shared/pickup_p2_analysis.json new file mode 100644 index 0000000..845e70c --- /dev/null +++ b/results/babyai_shared/pickup_p2_analysis.json @@ -0,0 +1,174 @@ +{ + "checks": { + "all_runs_finite": true, + "clean_kp_success_at_least_60_every_seed": true, + "raw_below_clean_kp_every_seed": true, + "sdil_above_raw_every_seed": false, + "sdil_nonzero_success_every_seed": false + }, + "conditions": { + "bp": { + "all_finite": true, + "expert_action_accuracy_percent": { + "mean": 87.78380713263681, + "sample_std": 0.1078533752082175, + "values": [ + 87.8108042439459, + 87.87559731108772, + 87.66501984287682 + ] + }, + "mission_lesion_rollout_success_percent": { + "mean": 49.333333333333336, + "sample_std": 1.1015141094572214, + "values": [ + 48.8, + 50.6, + 48.6 + ] + }, + "rollout_success_percent": { + "mean": 79.33333333333333, + "sample_std": 5.1588112325741635, + "values": [ + 80.80000000000001, + 83.6, + 73.6 + ] + } + }, + "clean_kp": { + "all_finite": true, + "expert_action_accuracy_percent": { + "mean": 86.43665127831322, + "sample_std": 0.3517610682148285, + "values": [ + 86.13428363165141, + 86.8227099700332, + 86.35296023325503 + ] + }, + "mission_lesion_rollout_success_percent": { + "mean": 48.86666666666667, + "sample_std": 7.245228314783008, + "values": [ + 49.8, + 55.60000000000001, + 41.199999999999996 + ] + }, + "rollout_success_percent": { + "mean": 70.86666666666667, + "sample_std": 5.34540300944029, + "values": [ + 67.2, + 77.0, + 68.4 + ] + } + }, + "raw_shared": { + "all_finite": true, + "expert_action_accuracy_percent": { + "mean": 59.642018304041464, + "sample_std": 9.767595165741607, + "values": [ + 49.89066169919818, + 69.42577144245566, + 59.609621770470554 + ] + }, + "mission_lesion_rollout_success_percent": { + "mean": 8.733333333333334, + "sample_std": 9.843441132720475, + "values": [ + 0.0, + 19.400000000000002, + 6.800000000000001 + ] + }, + "rollout_success_percent": { + "mean": 10.000000000000002, + "sample_std": 11.92644121270046, + "values": [ + 0.0, + 23.200000000000003, + 6.800000000000001 + ] + } + }, + "sdil": { + "all_finite": true, + "expert_action_accuracy_percent": { + "mean": 49.89066169919818, + "sample_std": 0.0, + "values": [ + 49.89066169919818, + 49.89066169919818, + 49.89066169919818 + ] + }, + "mission_lesion_rollout_success_percent": { + "mean": 0.0, + "sample_std": 0.0, + "values": [ + 0.0, + 0.0, + 0.0 + ] + }, + "rollout_success_percent": { + "mean": 0.0, + "sample_std": 0.0, + "values": [ + 0.0, + 0.0, + 0.0 + ] + } + } + }, + "decision": "Close the diagonal per-cell predictor on PickupLoc. Raw shared feedback fails as hypothesized, but this SDIL implementation does not recover it. Screen the originally specified population predictor using neutral prediction only before another endpoint.", + "gate": "fail", + "paired_clean_kp_minus_raw_rollout_points": { + "mean": 60.866666666666674, + "sample_std": 6.730032194078519, + "values": [ + 67.2, + 53.800000000000004, + 61.60000000000001 + ] + }, + "paired_sdil_minus_raw_rollout_points": { + "mean": -10.000000000000002, + "sample_std": 11.92644121270046, + "values": [ + 0.0, + -23.200000000000003, + -6.800000000000001 + ] + }, + "sdil_predictor": { + "action_or_teaching_observations": 0, + "maximum_layer_residual_context_rms_ratio": { + "mean": 0.614041248957316, + "sample_std": 0.011718512673796736, + "values": [ + 0.6220114827156067, + 0.6005861759185791, + 0.6195260882377625 + ] + }, + "mean_per_cell_r2": { + "mean": 0.30999962737162906, + "sample_std": 0.005533015870761776, + "values": [ + 0.3146054223179817, + 0.3038621172308922, + 0.31153134256601334 + ] + } + }, + "stage": "babyai_pickup_p2_analysis", + "test_split_generated_or_read": false +} |
