summaryrefslogtreecommitdiff
path: root/outputs/learning_rate_compensation/summary.json
blob: 63be9d0e9eb54533180201c98db00b24b44490c4 (plain)
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
{
  "config": {
    "depths": [
      1,
      2,
      3,
      4,
      6
    ],
    "width": 64,
    "input_dim": 16,
    "output_dim": 4,
    "train_samples": 128,
    "steps": 200,
    "base_lr": 0.001,
    "lr_grid": [
      0.00025,
      0.0005,
      0.001,
      0.002,
      0.004,
      0.008,
      0.016,
      0.032,
      0.064,
      0.128,
      0.256
    ],
    "tune_init_seeds": 4,
    "tune_feedback_seeds": 4,
    "eval_init_seeds": 6,
    "eval_feedback_seeds": 8,
    "data_seed": 4242,
    "feedback_scale": "relu",
    "stability_factor": 10.0,
    "torch_threads": 16,
    "outdir": "outputs/learning_rate_compensation"
  },
  "selected_learning_rates": {
    "1": {
      "bp_lr": 0.128,
      "fa_lr": 0.064
    },
    "2": {
      "bp_lr": 0.128,
      "fa_lr": 0.032
    },
    "3": {
      "bp_lr": 0.064,
      "fa_lr": 0.016
    },
    "4": {
      "bp_lr": 0.064,
      "fa_lr": 0.016
    },
    "6": {
      "bp_lr": 0.064,
      "fa_lr": 0.004
    }
  },
  "rows": 720,
  "regime_summary": [
    {
      "depth": 1,
      "regime": "same_lr",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.001,
      "rho_mean": 0.9610069350407984,
      "bp_loss_mean": 2.1666989888152424,
      "fa_loss_mean": 2.2257618018338,
      "gap_mean": 0.059062813018558,
      "gap_std": 0.009435428579739853,
      "gap_sem": 0.00385199758747267
    },
    {
      "depth": 1,
      "regime": "initial_compensation",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.0010407171219455268,
      "rho_mean": 0.9610069350407984,
      "bp_loss_mean": 2.1666989888152424,
      "fa_loss_mean": 2.207225477295465,
      "gap_mean": 0.04052648848022297,
      "gap_std": 0.007618800905898918,
      "gap_sem": 0.0031103624452177643
    },
    {
      "depth": 1,
      "regime": "independently_tuned",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.128,
      "fa_lr_mean": 0.064,
      "rho_mean": 0.9610069350407984,
      "bp_loss_mean": 0.294261348016096,
      "fa_loss_mean": 0.8636599107003535,
      "gap_mean": 0.5693985626842576,
      "gap_std": 0.025470956849676082,
      "gap_sem": 0.010398474590359084
    },
    {
      "depth": 2,
      "regime": "same_lr",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.001,
      "rho_mean": 0.7612398883286953,
      "bp_loss_mean": 2.0219677440519996,
      "fa_loss_mean": 2.2211329917145335,
      "gap_mean": 0.199165247662534,
      "gap_std": 0.03444824281209884,
      "gap_sem": 0.014063436237523408
    },
    {
      "depth": 2,
      "regime": "initial_compensation",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.0013168083270719375,
      "rho_mean": 0.7612398883286953,
      "bp_loss_mean": 2.0219677440519996,
      "fa_loss_mean": 2.119259691680273,
      "gap_mean": 0.09729194762827353,
      "gap_std": 0.02543136611942341,
      "gap_sem": 0.010382311742415214
    },
    {
      "depth": 2,
      "regime": "independently_tuned",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.128,
      "fa_lr_mean": 0.032,
      "rho_mean": 0.7612398883286953,
      "bp_loss_mean": 0.15235488385676207,
      "fa_loss_mean": 0.7944569102207383,
      "gap_mean": 0.6421020263639763,
      "gap_std": 0.12610115797280932,
      "gap_sem": 0.051480582167912944
    },
    {
      "depth": 3,
      "regime": "same_lr",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.001,
      "rho_mean": 0.6295068544264688,
      "bp_loss_mean": 1.847377871664352,
      "fa_loss_mean": 2.1208343429545216,
      "gap_mean": 0.2734564712901692,
      "gap_std": 0.06428969293109411,
      "gap_sem": 0.026246157233565874
    },
    {
      "depth": 3,
      "regime": "initial_compensation",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.0016066791854717785,
      "rho_mean": 0.6295068544264688,
      "bp_loss_mean": 1.847377871664352,
      "fa_loss_mean": 2.0100027235277964,
      "gap_mean": 0.1626248518634443,
      "gap_std": 0.05875562787394225,
      "gap_sem": 0.023986884634667825
    },
    {
      "depth": 3,
      "regime": "independently_tuned",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.064,
      "fa_lr_mean": 0.016,
      "rho_mean": 0.6295068544264688,
      "bp_loss_mean": 0.0855589967594977,
      "fa_loss_mean": 1.215578000751055,
      "gap_mean": 1.1300190039915574,
      "gap_std": 0.057596675687040334,
      "gap_sem": 0.023513744385635763
    },
    {
      "depth": 4,
      "regime": "same_lr",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.001,
      "rho_mean": 0.5314180794284439,
      "bp_loss_mean": 1.7554493999414322,
      "fa_loss_mean": 2.048847847137616,
      "gap_mean": 0.2933984471961841,
      "gap_std": 0.05201060249040933,
      "gap_sem": 0.021233239552705147
    },
    {
      "depth": 4,
      "regime": "initial_compensation",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.0019168307305947902,
      "rho_mean": 0.5314180794284439,
      "bp_loss_mean": 1.7554493999414322,
      "fa_loss_mean": 1.9398655534801694,
      "gap_mean": 0.18441615353873775,
      "gap_std": 0.04066007177452844,
      "gap_sem": 0.016599404792089205
    },
    {
      "depth": 4,
      "regime": "independently_tuned",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.064,
      "fa_lr_mean": 0.016,
      "rho_mean": 0.5314180794284439,
      "bp_loss_mean": 0.07042385696633152,
      "fa_loss_mean": 1.3785391365213364,
      "gap_mean": 1.3081152795550048,
      "gap_std": 0.14724117672303647,
      "gap_sem": 0.060110958683067185
    },
    {
      "depth": 6,
      "regime": "same_lr",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.001,
      "rho_mean": 0.39886513049466427,
      "bp_loss_mean": 1.6381389737072565,
      "fa_loss_mean": 2.044780538842934,
      "gap_mean": 0.40664156513567756,
      "gap_std": 0.09378365477021289,
      "gap_sem": 0.03828701673339253
    },
    {
      "depth": 6,
      "regime": "initial_compensation",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.001,
      "fa_lr_mean": 0.002590508159488245,
      "rho_mean": 0.39886513049466427,
      "bp_loss_mean": 1.6381389737072565,
      "fa_loss_mean": 1.9266386829320636,
      "gap_mean": 0.28849970922480717,
      "gap_std": 0.06681916348673785,
      "gap_sem": 0.027278809263686105
    },
    {
      "depth": 6,
      "regime": "independently_tuned",
      "rows": 48,
      "stable_rows": 48,
      "bp_lr": 0.064,
      "fa_lr_mean": 0.004,
      "rho_mean": 0.39886513049466427,
      "bp_loss_mean": 0.08353873014787917,
      "fa_loss_mean": 1.840925633337892,
      "gap_mean": 1.757386903190013,
      "gap_std": 0.06337128253452119,
      "gap_sem": 0.02587121775922074
    }
  ],
  "uncertainty": "SEM and SD are computed across forward-initialization means."
}