ChiefTheLord commited on
Commit
13ae9bf
·
verified ·
1 Parent(s): 7ae63ea

Upload folder using huggingface_hub

Browse files
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/eval_state.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3ac77a1b34a00219f2941325e39db51e9af3764e1cda97026f63d89d9bc9c22b
3
+ size 15277472
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:efb42aca8a24f33181d1d4487457c8fa9caa1619df479c2a0032e7b4ed93f938
3
+ size 13820091
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f2c2d484f771e659bef2d8981d72c8f9967eb5a8999b2e590052563a415996ac
3
+ size 14645
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:12618c8ab208a7959c31d41d88aa9332181b0bd796209e3996b198705d02de7e
3
+ size 1383
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97c95ccf96168112b15bef5a867a0320af9b38c712db8ce53a3900f61a37b6ea
3
+ size 1465
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/trainer_state.json ADDED
@@ -0,0 +1,1538 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 2048.0,
6
+ "eval_steps": 64,
7
+ "global_step": 2048,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 16.0,
14
+ "grad_norm": 3.148576259613037,
15
+ "learning_rate": 0.000234375,
16
+ "loss": 0.23784185945987701,
17
+ "step": 16
18
+ },
19
+ {
20
+ "epoch": 32.0,
21
+ "grad_norm": 5.380302906036377,
22
+ "learning_rate": 0.000484375,
23
+ "loss": 0.25058040022850037,
24
+ "step": 32
25
+ },
26
+ {
27
+ "epoch": 48.0,
28
+ "grad_norm": 4.840417385101318,
29
+ "learning_rate": 0.000734375,
30
+ "loss": 0.2624973952770233,
31
+ "step": 48
32
+ },
33
+ {
34
+ "epoch": 64.0,
35
+ "grad_norm": 7.160272598266602,
36
+ "learning_rate": 0.000984375,
37
+ "loss": 0.2839544117450714,
38
+ "step": 64
39
+ },
40
+ {
41
+ "epoch": 64.0,
42
+ "eval_bleu": 0.577453197312378,
43
+ "eval_cos_loss": 0.06502640619874,
44
+ "eval_loss": 0.27716290950775146,
45
+ "eval_mse_loss": 0.27716290950775146,
46
+ "step": 64
47
+ },
48
+ {
49
+ "epoch": 64.0,
50
+ "eval_bleu": 0.577453197312378,
51
+ "eval_cos_loss": 0.06502640619874,
52
+ "eval_loss": 0.27716290950775146,
53
+ "eval_mse_loss": 0.27716290950775146,
54
+ "eval_runtime": 1.1951,
55
+ "eval_samples_per_second": 107.107,
56
+ "eval_steps_per_second": 1.674,
57
+ "step": 64
58
+ },
59
+ {
60
+ "epoch": 80.0,
61
+ "grad_norm": 6.120606422424316,
62
+ "learning_rate": 0.0009998589677226062,
63
+ "loss": 0.28671935200691223,
64
+ "step": 80
65
+ },
66
+ {
67
+ "epoch": 96.0,
68
+ "grad_norm": 7.4773030281066895,
69
+ "learning_rate": 0.0009993977281025862,
70
+ "loss": 0.2957626283168793,
71
+ "step": 96
72
+ },
73
+ {
74
+ "epoch": 112.0,
75
+ "grad_norm": 5.387135982513428,
76
+ "learning_rate": 0.000998615950346857,
77
+ "loss": 0.31511762738227844,
78
+ "step": 112
79
+ },
80
+ {
81
+ "epoch": 128.0,
82
+ "grad_norm": 5.680504322052002,
83
+ "learning_rate": 0.0009975141362390078,
84
+ "loss": 0.2962453067302704,
85
+ "step": 128
86
+ },
87
+ {
88
+ "epoch": 128.0,
89
+ "eval_bleu": 0.48555007255420557,
90
+ "eval_cos_loss": 0.07183961942791939,
91
+ "eval_loss": 0.3057769536972046,
92
+ "eval_mse_loss": 0.3057769536972046,
93
+ "step": 128
94
+ },
95
+ {
96
+ "epoch": 128.0,
97
+ "eval_bleu": 0.48555007255420557,
98
+ "eval_cos_loss": 0.07183961942791939,
99
+ "eval_loss": 0.3057769536972046,
100
+ "eval_mse_loss": 0.3057769536972046,
101
+ "eval_runtime": 0.8745,
102
+ "eval_samples_per_second": 146.366,
103
+ "eval_steps_per_second": 2.287,
104
+ "step": 128
105
+ },
106
+ {
107
+ "epoch": 144.0,
108
+ "grad_norm": 4.385462284088135,
109
+ "learning_rate": 0.0009960929929777704,
110
+ "loss": 0.29686614871025085,
111
+ "step": 144
112
+ },
113
+ {
114
+ "epoch": 160.0,
115
+ "grad_norm": 7.011136531829834,
116
+ "learning_rate": 0.0009943534327231042,
117
+ "loss": 0.2880735695362091,
118
+ "step": 160
119
+ },
120
+ {
121
+ "epoch": 176.0,
122
+ "grad_norm": 4.367685317993164,
123
+ "learning_rate": 0.0009922965720107278,
124
+ "loss": 0.2833232879638672,
125
+ "step": 176
126
+ },
127
+ {
128
+ "epoch": 192.0,
129
+ "grad_norm": 6.261765003204346,
130
+ "learning_rate": 0.0009899237310354695,
131
+ "loss": 0.29143810272216797,
132
+ "step": 192
133
+ },
134
+ {
135
+ "epoch": 192.0,
136
+ "eval_bleu": 0.5524037807785399,
137
+ "eval_cos_loss": 0.06608359143137932,
138
+ "eval_loss": 0.2805209159851074,
139
+ "eval_mse_loss": 0.2805209159851074,
140
+ "step": 192
141
+ },
142
+ {
143
+ "epoch": 192.0,
144
+ "eval_bleu": 0.5524037807785399,
145
+ "eval_cos_loss": 0.06608359143137932,
146
+ "eval_loss": 0.2805209159851074,
147
+ "eval_mse_loss": 0.2805209159851074,
148
+ "eval_runtime": 1.1374,
149
+ "eval_samples_per_second": 112.536,
150
+ "eval_steps_per_second": 1.758,
151
+ "step": 192
152
+ },
153
+ {
154
+ "epoch": 208.0,
155
+ "grad_norm": 6.616072654724121,
156
+ "learning_rate": 0.000987236432803903,
157
+ "loss": 0.27807363867759705,
158
+ "step": 208
159
+ },
160
+ {
161
+ "epoch": 224.0,
162
+ "grad_norm": 5.070626258850098,
163
+ "learning_rate": 0.0009842364021568047,
164
+ "loss": 0.28033965826034546,
165
+ "step": 224
166
+ },
167
+ {
168
+ "epoch": 240.0,
169
+ "grad_norm": 4.556347846984863,
170
+ "learning_rate": 0.000980925564662067,
171
+ "loss": 0.2816319465637207,
172
+ "step": 240
173
+ },
174
+ {
175
+ "epoch": 256.0,
176
+ "grad_norm": 5.806378364562988,
177
+ "learning_rate": 0.000977306045378773,
178
+ "loss": 0.27801281213760376,
179
+ "step": 256
180
+ },
181
+ {
182
+ "epoch": 256.0,
183
+ "eval_bleu": 0.5841216106014171,
184
+ "eval_cos_loss": 0.06353012472391129,
185
+ "eval_loss": 0.2689193934202194,
186
+ "eval_mse_loss": 0.2689193934202194,
187
+ "step": 256
188
+ },
189
+ {
190
+ "epoch": 256.0,
191
+ "eval_bleu": 0.5841216106014171,
192
+ "eval_cos_loss": 0.06353012472391129,
193
+ "eval_loss": 0.2689193934202194,
194
+ "eval_mse_loss": 0.2689193934202194,
195
+ "eval_runtime": 0.8786,
196
+ "eval_samples_per_second": 145.682,
197
+ "eval_steps_per_second": 2.276,
198
+ "step": 256
199
+ },
200
+ {
201
+ "epoch": 272.0,
202
+ "grad_norm": 6.300445079803467,
203
+ "learning_rate": 0.0009733801674932287,
204
+ "loss": 0.2830119729042053,
205
+ "step": 272
206
+ },
207
+ {
208
+ "epoch": 288.0,
209
+ "grad_norm": 5.797390937805176,
210
+ "learning_rate": 0.0009691504508278278,
211
+ "loss": 0.2906477153301239,
212
+ "step": 288
213
+ },
214
+ {
215
+ "epoch": 304.0,
216
+ "grad_norm": 3.824460744857788,
217
+ "learning_rate": 0.0009646196102237037,
218
+ "loss": 0.2848377227783203,
219
+ "step": 304
220
+ },
221
+ {
222
+ "epoch": 320.0,
223
+ "grad_norm": 4.844005584716797,
224
+ "learning_rate": 0.0009597905537982126,
225
+ "loss": 0.3038112223148346,
226
+ "step": 320
227
+ },
228
+ {
229
+ "epoch": 320.0,
230
+ "eval_bleu": 0.50877170912826,
231
+ "eval_cos_loss": 0.06883906945586205,
232
+ "eval_loss": 0.29213041067123413,
233
+ "eval_mse_loss": 0.29213041067123413,
234
+ "step": 320
235
+ },
236
+ {
237
+ "epoch": 320.0,
238
+ "eval_bleu": 0.50877170912826,
239
+ "eval_cos_loss": 0.06883906945586205,
240
+ "eval_loss": 0.29213041067123413,
241
+ "eval_mse_loss": 0.29213041067123413,
242
+ "eval_runtime": 1.0869,
243
+ "eval_samples_per_second": 117.762,
244
+ "eval_steps_per_second": 1.84,
245
+ "step": 320
246
+ },
247
+ {
248
+ "epoch": 336.0,
249
+ "grad_norm": 4.888055801391602,
250
+ "learning_rate": 0.0009546663810783581,
251
+ "loss": 0.28091496229171753,
252
+ "step": 336
253
+ },
254
+ {
255
+ "epoch": 352.0,
256
+ "grad_norm": 4.821228504180908,
257
+ "learning_rate": 0.0009492503810113622,
258
+ "loss": 0.28097987174987793,
259
+ "step": 352
260
+ },
261
+ {
262
+ "epoch": 368.0,
263
+ "grad_norm": 4.503347873687744,
264
+ "learning_rate": 0.0009435460298536574,
265
+ "loss": 0.27521052956581116,
266
+ "step": 368
267
+ },
268
+ {
269
+ "epoch": 384.0,
270
+ "grad_norm": 3.8951001167297363,
271
+ "learning_rate": 0.000937556988939652,
272
+ "loss": 0.2731606066226959,
273
+ "step": 384
274
+ },
275
+ {
276
+ "epoch": 384.0,
277
+ "eval_bleu": 0.5467535012310109,
278
+ "eval_cos_loss": 0.06577872112393379,
279
+ "eval_loss": 0.2795831710100174,
280
+ "eval_mse_loss": 0.2795831710100174,
281
+ "step": 384
282
+ },
283
+ {
284
+ "epoch": 384.0,
285
+ "eval_bleu": 0.5467535012310109,
286
+ "eval_cos_loss": 0.06577872112393379,
287
+ "eval_loss": 0.2795831710100174,
288
+ "eval_mse_loss": 0.2795831710100174,
289
+ "eval_runtime": 0.8707,
290
+ "eval_samples_per_second": 147.005,
291
+ "eval_steps_per_second": 2.297,
292
+ "step": 384
293
+ },
294
+ {
295
+ "epoch": 400.0,
296
+ "grad_norm": 4.886165618896484,
297
+ "learning_rate": 0.0009312871023317064,
298
+ "loss": 0.27139905095100403,
299
+ "step": 400
300
+ },
301
+ {
302
+ "epoch": 416.0,
303
+ "grad_norm": 4.521392822265625,
304
+ "learning_rate": 0.0009247403943528224,
305
+ "loss": 0.2826443910598755,
306
+ "step": 416
307
+ },
308
+ {
309
+ "epoch": 432.0,
310
+ "grad_norm": 4.5247931480407715,
311
+ "learning_rate": 0.0009179210670036351,
312
+ "loss": 0.2796178162097931,
313
+ "step": 432
314
+ },
315
+ {
316
+ "epoch": 448.0,
317
+ "grad_norm": 6.002585411071777,
318
+ "learning_rate": 0.0009108334972653607,
319
+ "loss": 0.2687041163444519,
320
+ "step": 448
321
+ },
322
+ {
323
+ "epoch": 448.0,
324
+ "eval_bleu": 0.6011129343982055,
325
+ "eval_cos_loss": 0.06211286224424839,
326
+ "eval_loss": 0.26566024124622345,
327
+ "eval_mse_loss": 0.26566024124622345,
328
+ "step": 448
329
+ },
330
+ {
331
+ "epoch": 448.0,
332
+ "eval_bleu": 0.6011129343982055,
333
+ "eval_cos_loss": 0.06211286224424839,
334
+ "eval_loss": 0.26566024124622345,
335
+ "eval_mse_loss": 0.26566024124622345,
336
+ "eval_runtime": 0.8986,
337
+ "eval_samples_per_second": 142.45,
338
+ "eval_steps_per_second": 2.226,
339
+ "step": 448
340
+ },
341
+ {
342
+ "epoch": 464.0,
343
+ "grad_norm": 3.798197031021118,
344
+ "learning_rate": 0.0009034822342904337,
345
+ "loss": 0.2710013687610626,
346
+ "step": 464
347
+ },
348
+ {
349
+ "epoch": 480.0,
350
+ "grad_norm": 5.265723705291748,
351
+ "learning_rate": 0.0008958719964826361,
352
+ "loss": 0.28253716230392456,
353
+ "step": 480
354
+ },
355
+ {
356
+ "epoch": 496.0,
357
+ "grad_norm": 4.383965492248535,
358
+ "learning_rate": 0.0008880076684685934,
359
+ "loss": 0.2749737501144409,
360
+ "step": 496
361
+ },
362
+ {
363
+ "epoch": 512.0,
364
+ "grad_norm": 3.641213893890381,
365
+ "learning_rate": 0.0008798942979625785,
366
+ "loss": 0.2674626111984253,
367
+ "step": 512
368
+ },
369
+ {
370
+ "epoch": 512.0,
371
+ "eval_bleu": 0.580950657997831,
372
+ "eval_cos_loss": 0.06297661177814007,
373
+ "eval_loss": 0.2675176411867142,
374
+ "eval_mse_loss": 0.2675176411867142,
375
+ "step": 512
376
+ },
377
+ {
378
+ "epoch": 512.0,
379
+ "eval_bleu": 0.580950657997831,
380
+ "eval_cos_loss": 0.06297661177814007,
381
+ "eval_loss": 0.2675176411867142,
382
+ "eval_mse_loss": 0.2675176411867142,
383
+ "eval_runtime": 0.9024,
384
+ "eval_samples_per_second": 141.838,
385
+ "eval_steps_per_second": 2.216,
386
+ "step": 512
387
+ },
388
+ {
389
+ "epoch": 528.0,
390
+ "grad_norm": 4.270537376403809,
391
+ "learning_rate": 0.0008715370925266411,
392
+ "loss": 0.2660686671733856,
393
+ "step": 528
394
+ },
395
+ {
396
+ "epoch": 544.0,
397
+ "grad_norm": 4.056329727172852,
398
+ "learning_rate": 0.0008629414162281353,
399
+ "loss": 0.26294267177581787,
400
+ "step": 544
401
+ },
402
+ {
403
+ "epoch": 560.0,
404
+ "grad_norm": 5.651641368865967,
405
+ "learning_rate": 0.0008541127861967972,
406
+ "loss": 0.260432630777359,
407
+ "step": 560
408
+ },
409
+ {
410
+ "epoch": 576.0,
411
+ "grad_norm": 7.250360488891602,
412
+ "learning_rate": 0.0008450568690835785,
413
+ "loss": 0.27461671829223633,
414
+ "step": 576
415
+ },
416
+ {
417
+ "epoch": 576.0,
418
+ "eval_bleu": 0.5774127981545529,
419
+ "eval_cos_loss": 0.06340659596025944,
420
+ "eval_loss": 0.26926228404045105,
421
+ "eval_mse_loss": 0.26926228404045105,
422
+ "step": 576
423
+ },
424
+ {
425
+ "epoch": 576.0,
426
+ "eval_bleu": 0.5774127981545529,
427
+ "eval_cos_loss": 0.06340659596025944,
428
+ "eval_loss": 0.26926228404045105,
429
+ "eval_mse_loss": 0.26926228404045105,
430
+ "eval_runtime": 0.8733,
431
+ "eval_samples_per_second": 146.571,
432
+ "eval_steps_per_second": 2.29,
433
+ "step": 576
434
+ },
435
+ {
436
+ "epoch": 592.0,
437
+ "grad_norm": 3.2957684993743896,
438
+ "learning_rate": 0.0008357794774235093,
439
+ "loss": 0.2616701126098633,
440
+ "step": 592
441
+ },
442
+ {
443
+ "epoch": 608.0,
444
+ "grad_norm": 3.3370862007141113,
445
+ "learning_rate": 0.0008262865659049262,
446
+ "loss": 0.2559007406234741,
447
+ "step": 608
448
+ },
449
+ {
450
+ "epoch": 624.0,
451
+ "grad_norm": 4.537160396575928,
452
+ "learning_rate": 0.0008165842275474598,
453
+ "loss": 0.25834769010543823,
454
+ "step": 624
455
+ },
456
+ {
457
+ "epoch": 640.0,
458
+ "grad_norm": 6.2513580322265625,
459
+ "learning_rate": 0.0008066786897912324,
460
+ "loss": 0.2518532872200012,
461
+ "step": 640
462
+ },
463
+ {
464
+ "epoch": 640.0,
465
+ "eval_bleu": 0.6343472675167803,
466
+ "eval_cos_loss": 0.059439605101943016,
467
+ "eval_loss": 0.25308310985565186,
468
+ "eval_mse_loss": 0.25308310985565186,
469
+ "step": 640
470
+ },
471
+ {
472
+ "epoch": 640.0,
473
+ "eval_bleu": 0.6343472675167803,
474
+ "eval_cos_loss": 0.059439605101943016,
475
+ "eval_loss": 0.25308310985565186,
476
+ "eval_mse_loss": 0.25308310985565186,
477
+ "eval_runtime": 0.8725,
478
+ "eval_samples_per_second": 146.698,
479
+ "eval_steps_per_second": 2.292,
480
+ "step": 640
481
+ },
482
+ {
483
+ "epoch": 656.0,
484
+ "grad_norm": 4.446962833404541,
485
+ "learning_rate": 0.0007965763104997804,
486
+ "loss": 0.25539430975914,
487
+ "step": 656
488
+ },
489
+ {
490
+ "epoch": 672.0,
491
+ "grad_norm": 5.684469699859619,
492
+ "learning_rate": 0.0007862835738792626,
493
+ "loss": 0.2542829215526581,
494
+ "step": 672
495
+ },
496
+ {
497
+ "epoch": 688.0,
498
+ "grad_norm": 4.0447468757629395,
499
+ "learning_rate": 0.0007758070863165769,
500
+ "loss": 0.2549206018447876,
501
+ "step": 688
502
+ },
503
+ {
504
+ "epoch": 704.0,
505
+ "grad_norm": 5.396855354309082,
506
+ "learning_rate": 0.0007651535721390541,
507
+ "loss": 0.2627556622028351,
508
+ "step": 704
509
+ },
510
+ {
511
+ "epoch": 704.0,
512
+ "eval_bleu": 0.5813120020271406,
513
+ "eval_cos_loss": 0.06533811613917351,
514
+ "eval_loss": 0.27893321216106415,
515
+ "eval_mse_loss": 0.27893321216106415,
516
+ "step": 704
517
+ },
518
+ {
519
+ "epoch": 704.0,
520
+ "eval_bleu": 0.5813120020271406,
521
+ "eval_cos_loss": 0.06533811613917351,
522
+ "eval_loss": 0.27893321216106415,
523
+ "eval_mse_loss": 0.27893321216106415,
524
+ "eval_runtime": 0.8693,
525
+ "eval_samples_per_second": 147.241,
526
+ "eval_steps_per_second": 2.301,
527
+ "step": 704
528
+ },
529
+ {
530
+ "epoch": 720.0,
531
+ "grad_norm": 4.269003391265869,
532
+ "learning_rate": 0.0007543298692984531,
533
+ "loss": 0.2587549090385437,
534
+ "step": 720
535
+ },
536
+ {
537
+ "epoch": 736.0,
538
+ "grad_norm": 3.9153501987457275,
539
+ "learning_rate": 0.0007433429249820251,
540
+ "loss": 0.2565257251262665,
541
+ "step": 736
542
+ },
543
+ {
544
+ "epoch": 752.0,
545
+ "grad_norm": 5.764571666717529,
546
+ "learning_rate": 0.0007321997911534659,
547
+ "loss": 0.2554490566253662,
548
+ "step": 752
549
+ },
550
+ {
551
+ "epoch": 768.0,
552
+ "grad_norm": 4.181169509887695,
553
+ "learning_rate": 0.0007209076200266171,
554
+ "loss": 0.26280924677848816,
555
+ "step": 768
556
+ },
557
+ {
558
+ "epoch": 768.0,
559
+ "eval_bleu": 0.661364608412488,
560
+ "eval_cos_loss": 0.057915227487683296,
561
+ "eval_loss": 0.2471897453069687,
562
+ "eval_mse_loss": 0.2471897453069687,
563
+ "step": 768
564
+ },
565
+ {
566
+ "epoch": 768.0,
567
+ "eval_bleu": 0.661364608412488,
568
+ "eval_cos_loss": 0.057915227487683296,
569
+ "eval_loss": 0.2471897453069687,
570
+ "eval_mse_loss": 0.2471897453069687,
571
+ "eval_runtime": 0.9255,
572
+ "eval_samples_per_second": 138.3,
573
+ "eval_steps_per_second": 2.161,
574
+ "step": 768
575
+ },
576
+ {
577
+ "epoch": 784.0,
578
+ "grad_norm": 3.2729103565216064,
579
+ "learning_rate": 0.0007094736594748218,
580
+ "loss": 0.24987968802452087,
581
+ "step": 784
582
+ },
583
+ {
584
+ "epoch": 800.0,
585
+ "grad_norm": 3.1368510723114014,
586
+ "learning_rate": 0.0006979052483788812,
587
+ "loss": 0.24448727071285248,
588
+ "step": 800
589
+ },
590
+ {
591
+ "epoch": 816.0,
592
+ "grad_norm": 4.103678226470947,
593
+ "learning_rate": 0.0006862098119165992,
594
+ "loss": 0.2484358549118042,
595
+ "step": 816
596
+ },
597
+ {
598
+ "epoch": 832.0,
599
+ "grad_norm": 3.3490488529205322,
600
+ "learning_rate": 0.0006743948567969348,
601
+ "loss": 0.2439013123512268,
602
+ "step": 832
603
+ },
604
+ {
605
+ "epoch": 832.0,
606
+ "eval_bleu": 0.670957871478861,
607
+ "eval_cos_loss": 0.056928446516394615,
608
+ "eval_loss": 0.2426728531718254,
609
+ "eval_mse_loss": 0.2426728531718254,
610
+ "step": 832
611
+ },
612
+ {
613
+ "epoch": 832.0,
614
+ "eval_bleu": 0.670957871478861,
615
+ "eval_cos_loss": 0.056928446516394615,
616
+ "eval_loss": 0.2426728531718254,
617
+ "eval_mse_loss": 0.2426728531718254,
618
+ "eval_runtime": 0.8912,
619
+ "eval_samples_per_second": 143.626,
620
+ "eval_steps_per_second": 2.244,
621
+ "step": 832
622
+ },
623
+ {
624
+ "epoch": 848.0,
625
+ "grad_norm": 4.892444133758545,
626
+ "learning_rate": 0.0006624679664418274,
627
+ "loss": 0.2417246252298355,
628
+ "step": 848
629
+ },
630
+ {
631
+ "epoch": 864.0,
632
+ "grad_norm": 5.472821235656738,
633
+ "learning_rate": 0.0006504367961187803,
634
+ "loss": 0.24449890851974487,
635
+ "step": 864
636
+ },
637
+ {
638
+ "epoch": 880.0,
639
+ "grad_norm": 6.239707946777344,
640
+ "learning_rate": 0.0006383090680273322,
641
+ "loss": 0.2528042495250702,
642
+ "step": 880
643
+ },
644
+ {
645
+ "epoch": 896.0,
646
+ "grad_norm": 3.964495897293091,
647
+ "learning_rate": 0.000626092566342569,
648
+ "loss": 0.2635759711265564,
649
+ "step": 896
650
+ },
651
+ {
652
+ "epoch": 896.0,
653
+ "eval_bleu": 0.6793754732736595,
654
+ "eval_cos_loss": 0.05773136951029301,
655
+ "eval_loss": 0.24844638258218765,
656
+ "eval_mse_loss": 0.24844638258218765,
657
+ "step": 896
658
+ },
659
+ {
660
+ "epoch": 896.0,
661
+ "eval_bleu": 0.6793754732736595,
662
+ "eval_cos_loss": 0.05773136951029301,
663
+ "eval_loss": 0.24844638258218765,
664
+ "eval_mse_loss": 0.24844638258218765,
665
+ "eval_runtime": 1.1311,
666
+ "eval_samples_per_second": 113.16,
667
+ "eval_steps_per_second": 1.768,
668
+ "step": 896
669
+ },
670
+ {
671
+ "epoch": 912.0,
672
+ "grad_norm": 3.434793472290039,
673
+ "learning_rate": 0.0006137951322188541,
674
+ "loss": 0.2414565533399582,
675
+ "step": 912
676
+ },
677
+ {
678
+ "epoch": 928.0,
679
+ "grad_norm": 3.8701789379119873,
680
+ "learning_rate": 0.0006014246587569892,
681
+ "loss": 0.24117989838123322,
682
+ "step": 928
683
+ },
684
+ {
685
+ "epoch": 944.0,
686
+ "grad_norm": 4.297995567321777,
687
+ "learning_rate": 0.000588989085938032,
688
+ "loss": 0.2399703860282898,
689
+ "step": 944
690
+ },
691
+ {
692
+ "epoch": 960.0,
693
+ "grad_norm": 3.6679482460021973,
694
+ "learning_rate": 0.0005764963955270235,
695
+ "loss": 0.233713760972023,
696
+ "step": 960
697
+ },
698
+ {
699
+ "epoch": 960.0,
700
+ "eval_bleu": 0.696953364230658,
701
+ "eval_cos_loss": 0.054812436923384666,
702
+ "eval_loss": 0.23471949249505997,
703
+ "eval_mse_loss": 0.23471949249505997,
704
+ "step": 960
705
+ },
706
+ {
707
+ "epoch": 960.0,
708
+ "eval_bleu": 0.696953364230658,
709
+ "eval_cos_loss": 0.054812436923384666,
710
+ "eval_loss": 0.23471949249505997,
711
+ "eval_mse_loss": 0.23471949249505997,
712
+ "eval_runtime": 0.8756,
713
+ "eval_samples_per_second": 146.184,
714
+ "eval_steps_per_second": 2.284,
715
+ "step": 960
716
+ },
717
+ {
718
+ "epoch": 976.0,
719
+ "grad_norm": 4.1816887855529785,
720
+ "learning_rate": 0.0005639546059498979,
721
+ "loss": 0.2341586947441101,
722
+ "step": 976
723
+ },
724
+ {
725
+ "epoch": 992.0,
726
+ "grad_norm": 4.410841464996338,
727
+ "learning_rate": 0.0005513717671468594,
728
+ "loss": 0.23269318044185638,
729
+ "step": 992
730
+ },
731
+ {
732
+ "epoch": 1008.0,
733
+ "grad_norm": 3.832925796508789,
734
+ "learning_rate": 0.000538755955405534,
735
+ "loss": 0.2395596206188202,
736
+ "step": 1008
737
+ },
738
+ {
739
+ "epoch": 1024.0,
740
+ "grad_norm": 4.132075786590576,
741
+ "learning_rate": 0.0005261152681772086,
742
+ "loss": 0.23560243844985962,
743
+ "step": 1024
744
+ },
745
+ {
746
+ "epoch": 1024.0,
747
+ "eval_bleu": 0.7079378653405652,
748
+ "eval_cos_loss": 0.054174987599253654,
749
+ "eval_loss": 0.2315773442387581,
750
+ "eval_mse_loss": 0.2315773442387581,
751
+ "step": 1024
752
+ },
753
+ {
754
+ "epoch": 1024.0,
755
+ "eval_bleu": 0.7079378653405652,
756
+ "eval_cos_loss": 0.054174987599253654,
757
+ "eval_loss": 0.2315773442387581,
758
+ "eval_mse_loss": 0.2315773442387581,
759
+ "eval_runtime": 1.1438,
760
+ "eval_samples_per_second": 111.912,
761
+ "eval_steps_per_second": 1.749,
762
+ "step": 1024
763
+ },
764
+ {
765
+ "epoch": 1040.0,
766
+ "grad_norm": 4.8190460205078125,
767
+ "learning_rate": 0.0005134578188794861,
768
+ "loss": 0.22934700548648834,
769
+ "step": 1040
770
+ },
771
+ {
772
+ "epoch": 1056.0,
773
+ "grad_norm": 5.013860702514648,
774
+ "learning_rate": 0.0005007917316886947,
775
+ "loss": 0.23661410808563232,
776
+ "step": 1056
777
+ },
778
+ {
779
+ "epoch": 1072.0,
780
+ "grad_norm": 3.288074254989624,
781
+ "learning_rate": 0.00048812513632538816,
782
+ "loss": 0.22888951003551483,
783
+ "step": 1072
784
+ },
785
+ {
786
+ "epoch": 1088.0,
787
+ "grad_norm": 3.181110143661499,
788
+ "learning_rate": 0.000475466162836291,
789
+ "loss": 0.22868837416172028,
790
+ "step": 1088
791
+ },
792
+ {
793
+ "epoch": 1088.0,
794
+ "eval_bleu": 0.7288450225502836,
795
+ "eval_cos_loss": 0.053315335884690285,
796
+ "eval_loss": 0.2283542901277542,
797
+ "eval_mse_loss": 0.2283542901277542,
798
+ "step": 1088
799
+ },
800
+ {
801
+ "epoch": 1088.0,
802
+ "eval_bleu": 0.7288450225502836,
803
+ "eval_cos_loss": 0.053315335884690285,
804
+ "eval_loss": 0.2283542901277542,
805
+ "eval_mse_loss": 0.2283542901277542,
806
+ "eval_runtime": 0.8923,
807
+ "eval_samples_per_second": 143.456,
808
+ "eval_steps_per_second": 2.241,
809
+ "step": 1088
810
+ },
811
+ {
812
+ "epoch": 1104.0,
813
+ "grad_norm": 4.1082048416137695,
814
+ "learning_rate": 0.00046282293637603237,
815
+ "loss": 0.22575391829013824,
816
+ "step": 1104
817
+ },
818
+ {
819
+ "epoch": 1120.0,
820
+ "grad_norm": 2.8534390926361084,
821
+ "learning_rate": 0.00045020357199201976,
822
+ "loss": 0.22352606058120728,
823
+ "step": 1120
824
+ },
825
+ {
826
+ "epoch": 1136.0,
827
+ "grad_norm": 3.7242393493652344,
828
+ "learning_rate": 0.00043761616941580185,
829
+ "loss": 0.22356313467025757,
830
+ "step": 1136
831
+ },
832
+ {
833
+ "epoch": 1152.0,
834
+ "grad_norm": 3.8674352169036865,
835
+ "learning_rate": 0.0004250688078642595,
836
+ "loss": 0.22347410023212433,
837
+ "step": 1152
838
+ },
839
+ {
840
+ "epoch": 1152.0,
841
+ "eval_bleu": 0.7490331059842212,
842
+ "eval_cos_loss": 0.051677852869033813,
843
+ "eval_loss": 0.22193267196416855,
844
+ "eval_mse_loss": 0.22193267196416855,
845
+ "step": 1152
846
+ },
847
+ {
848
+ "epoch": 1152.0,
849
+ "eval_bleu": 0.7490331059842212,
850
+ "eval_cos_loss": 0.051677852869033813,
851
+ "eval_loss": 0.22193267196416855,
852
+ "eval_mse_loss": 0.22193267196416855,
853
+ "eval_runtime": 1.0773,
854
+ "eval_samples_per_second": 118.814,
855
+ "eval_steps_per_second": 1.856,
856
+ "step": 1152
857
+ },
858
+ {
859
+ "epoch": 1168.0,
860
+ "grad_norm": 4.9404144287109375,
861
+ "learning_rate": 0.0004125695408539655,
862
+ "loss": 0.22273239493370056,
863
+ "step": 1168
864
+ },
865
+ {
866
+ "epoch": 1184.0,
867
+ "grad_norm": 2.8793396949768066,
868
+ "learning_rate": 0.00040012639103204046,
869
+ "loss": 0.22370247542858124,
870
+ "step": 1184
871
+ },
872
+ {
873
+ "epoch": 1200.0,
874
+ "grad_norm": 3.381091356277466,
875
+ "learning_rate": 0.0003877473450268202,
876
+ "loss": 0.2196229100227356,
877
+ "step": 1200
878
+ },
879
+ {
880
+ "epoch": 1216.0,
881
+ "grad_norm": 3.1946024894714355,
882
+ "learning_rate": 0.0003754403483216441,
883
+ "loss": 0.2189682424068451,
884
+ "step": 1216
885
+ },
886
+ {
887
+ "epoch": 1216.0,
888
+ "eval_bleu": 0.7228057743017877,
889
+ "eval_cos_loss": 0.05280923470854759,
890
+ "eval_loss": 0.22687970846891403,
891
+ "eval_mse_loss": 0.22687970846891403,
892
+ "step": 1216
893
+ },
894
+ {
895
+ "epoch": 1216.0,
896
+ "eval_bleu": 0.7228057743017877,
897
+ "eval_cos_loss": 0.05280923470854759,
898
+ "eval_loss": 0.22687970846891403,
899
+ "eval_mse_loss": 0.22687970846891403,
900
+ "eval_runtime": 0.8713,
901
+ "eval_samples_per_second": 146.907,
902
+ "eval_steps_per_second": 2.295,
903
+ "step": 1216
904
+ },
905
+ {
906
+ "epoch": 1232.0,
907
+ "grad_norm": 2.8960962295532227,
908
+ "learning_rate": 0.0003632133001550515,
909
+ "loss": 0.21955418586730957,
910
+ "step": 1232
911
+ },
912
+ {
913
+ "epoch": 1248.0,
914
+ "grad_norm": 4.168556213378906,
915
+ "learning_rate": 0.0003510740484506588,
916
+ "loss": 0.21865320205688477,
917
+ "step": 1248
918
+ },
919
+ {
920
+ "epoch": 1264.0,
921
+ "grad_norm": 4.716127395629883,
922
+ "learning_rate": 0.0003390303847799755,
923
+ "loss": 0.22268880903720856,
924
+ "step": 1264
925
+ },
926
+ {
927
+ "epoch": 1280.0,
928
+ "grad_norm": 3.4384660720825195,
929
+ "learning_rate": 0.00032709003936138876,
930
+ "loss": 0.21789687871932983,
931
+ "step": 1280
932
+ },
933
+ {
934
+ "epoch": 1280.0,
935
+ "eval_bleu": 0.7668112675703869,
936
+ "eval_cos_loss": 0.05025000870227814,
937
+ "eval_loss": 0.21647433191537857,
938
+ "eval_mse_loss": 0.21647433191537857,
939
+ "step": 1280
940
+ },
941
+ {
942
+ "epoch": 1280.0,
943
+ "eval_bleu": 0.7668112675703869,
944
+ "eval_cos_loss": 0.05025000870227814,
945
+ "eval_loss": 0.21647433191537857,
946
+ "eval_mse_loss": 0.21647433191537857,
947
+ "eval_runtime": 0.8694,
948
+ "eval_samples_per_second": 147.223,
949
+ "eval_steps_per_second": 2.3,
950
+ "step": 1280
951
+ },
952
+ {
953
+ "epoch": 1296.0,
954
+ "grad_norm": 3.1409592628479004,
955
+ "learning_rate": 0.00031526067609852616,
956
+ "loss": 0.2181306630373001,
957
+ "step": 1296
958
+ },
959
+ {
960
+ "epoch": 1312.0,
961
+ "grad_norm": 2.3424947261810303,
962
+ "learning_rate": 0.00030354988766118513,
963
+ "loss": 0.21611051261425018,
964
+ "step": 1312
965
+ },
966
+ {
967
+ "epoch": 1328.0,
968
+ "grad_norm": 3.1680362224578857,
969
+ "learning_rate": 0.000291965190611981,
970
+ "loss": 0.2149377018213272,
971
+ "step": 1328
972
+ },
973
+ {
974
+ "epoch": 1344.0,
975
+ "grad_norm": 3.9129462242126465,
976
+ "learning_rate": 0.00028051402058184704,
977
+ "loss": 0.2180047184228897,
978
+ "step": 1344
979
+ },
980
+ {
981
+ "epoch": 1344.0,
982
+ "eval_bleu": 0.7675157336477649,
983
+ "eval_cos_loss": 0.050463948398828506,
984
+ "eval_loss": 0.21725857257843018,
985
+ "eval_mse_loss": 0.21725857257843018,
986
+ "step": 1344
987
+ },
988
+ {
989
+ "epoch": 1344.0,
990
+ "eval_bleu": 0.7675157336477649,
991
+ "eval_cos_loss": 0.050463948398828506,
992
+ "eval_loss": 0.21725857257843018,
993
+ "eval_mse_loss": 0.21725857257843018,
994
+ "eval_runtime": 0.8788,
995
+ "eval_samples_per_second": 145.656,
996
+ "eval_steps_per_second": 2.276,
997
+ "step": 1344
998
+ },
999
+ {
1000
+ "epoch": 1360.0,
1001
+ "grad_norm": 2.6250803470611572,
1002
+ "learning_rate": 0.00026920372749747766,
1003
+ "loss": 0.2142384946346283,
1004
+ "step": 1360
1005
+ },
1006
+ {
1007
+ "epoch": 1376.0,
1008
+ "grad_norm": 2.543652057647705,
1009
+ "learning_rate": 0.0002580415708637841,
1010
+ "loss": 0.2133433222770691,
1011
+ "step": 1376
1012
+ },
1013
+ {
1014
+ "epoch": 1392.0,
1015
+ "grad_norm": 3.0058720111846924,
1016
+ "learning_rate": 0.0002470347151043839,
1017
+ "loss": 0.21205700933933258,
1018
+ "step": 1392
1019
+ },
1020
+ {
1021
+ "epoch": 1408.0,
1022
+ "grad_norm": 3.2701632976531982,
1023
+ "learning_rate": 0.0002361902249631207,
1024
+ "loss": 0.21385891735553741,
1025
+ "step": 1408
1026
+ },
1027
+ {
1028
+ "epoch": 1408.0,
1029
+ "eval_bleu": 0.7880750098541518,
1030
+ "eval_cos_loss": 0.049234725534915924,
1031
+ "eval_loss": 0.21210666000843048,
1032
+ "eval_mse_loss": 0.21210666000843048,
1033
+ "step": 1408
1034
+ },
1035
+ {
1036
+ "epoch": 1408.0,
1037
+ "eval_bleu": 0.7880750098541518,
1038
+ "eval_cos_loss": 0.049234725534915924,
1039
+ "eval_loss": 0.21210666000843048,
1040
+ "eval_mse_loss": 0.21210666000843048,
1041
+ "eval_runtime": 0.8893,
1042
+ "eval_samples_per_second": 143.935,
1043
+ "eval_steps_per_second": 2.249,
1044
+ "step": 1408
1045
+ },
1046
+ {
1047
+ "epoch": 1424.0,
1048
+ "grad_norm": 3.444427967071533,
1049
+ "learning_rate": 0.00022551506096956222,
1050
+ "loss": 0.211622416973114,
1051
+ "step": 1424
1052
+ },
1053
+ {
1054
+ "epoch": 1440.0,
1055
+ "grad_norm": 2.470618963241577,
1056
+ "learning_rate": 0.0002150160749713891,
1057
+ "loss": 0.20997348427772522,
1058
+ "step": 1440
1059
+ },
1060
+ {
1061
+ "epoch": 1456.0,
1062
+ "grad_norm": 1.7038332223892212,
1063
+ "learning_rate": 0.00020470000573653973,
1064
+ "loss": 0.20952679216861725,
1065
+ "step": 1456
1066
+ },
1067
+ {
1068
+ "epoch": 1472.0,
1069
+ "grad_norm": 2.426316976547241,
1070
+ "learning_rate": 0.0001945734746279364,
1071
+ "loss": 0.21008668839931488,
1072
+ "step": 1472
1073
+ },
1074
+ {
1075
+ "epoch": 1472.0,
1076
+ "eval_bleu": 0.7873788127854696,
1077
+ "eval_cos_loss": 0.04861448146402836,
1078
+ "eval_loss": 0.2095613032579422,
1079
+ "eval_mse_loss": 0.2095613032579422,
1080
+ "step": 1472
1081
+ },
1082
+ {
1083
+ "epoch": 1472.0,
1084
+ "eval_bleu": 0.7873788127854696,
1085
+ "eval_cos_loss": 0.04861448146402836,
1086
+ "eval_loss": 0.2095613032579422,
1087
+ "eval_mse_loss": 0.2095613032579422,
1088
+ "eval_runtime": 0.877,
1089
+ "eval_samples_per_second": 145.953,
1090
+ "eval_steps_per_second": 2.281,
1091
+ "step": 1472
1092
+ },
1093
+ {
1094
+ "epoch": 1488.0,
1095
+ "grad_norm": 2.561044216156006,
1096
+ "learning_rate": 0.00018464298135356777,
1097
+ "loss": 0.2087576985359192,
1098
+ "step": 1488
1099
+ },
1100
+ {
1101
+ "epoch": 1504.0,
1102
+ "grad_norm": 2.8240408897399902,
1103
+ "learning_rate": 0.00017491489979465447,
1104
+ "loss": 0.2086133509874344,
1105
+ "step": 1504
1106
+ },
1107
+ {
1108
+ "epoch": 1520.0,
1109
+ "grad_norm": 2.6217775344848633,
1110
+ "learning_rate": 0.0001653954739145775,
1111
+ "loss": 0.20786544680595398,
1112
+ "step": 1520
1113
+ },
1114
+ {
1115
+ "epoch": 1536.0,
1116
+ "grad_norm": 2.312251091003418,
1117
+ "learning_rate": 0.00015609081375119466,
1118
+ "loss": 0.20743107795715332,
1119
+ "step": 1536
1120
+ },
1121
+ {
1122
+ "epoch": 1536.0,
1123
+ "eval_bleu": 0.8002604686170025,
1124
+ "eval_cos_loss": 0.047877587378025055,
1125
+ "eval_loss": 0.2066633701324463,
1126
+ "eval_mse_loss": 0.2066633701324463,
1127
+ "step": 1536
1128
+ },
1129
+ {
1130
+ "epoch": 1536.0,
1131
+ "eval_bleu": 0.8002604686170025,
1132
+ "eval_cos_loss": 0.047877587378025055,
1133
+ "eval_loss": 0.2066633701324463,
1134
+ "eval_mse_loss": 0.2066633701324463,
1135
+ "eval_runtime": 0.892,
1136
+ "eval_samples_per_second": 143.493,
1137
+ "eval_steps_per_second": 2.242,
1138
+ "step": 1536
1139
+ },
1140
+ {
1141
+ "epoch": 1552.0,
1142
+ "grad_norm": 2.6982738971710205,
1143
+ "learning_rate": 0.0001470068914951152,
1144
+ "loss": 0.2065943479537964,
1145
+ "step": 1552
1146
+ },
1147
+ {
1148
+ "epoch": 1568.0,
1149
+ "grad_norm": 2.9958996772766113,
1150
+ "learning_rate": 0.00013814953765645382,
1151
+ "loss": 0.20652760565280914,
1152
+ "step": 1568
1153
+ },
1154
+ {
1155
+ "epoch": 1584.0,
1156
+ "grad_norm": 1.8058233261108398,
1157
+ "learning_rate": 0.00012952443732252057,
1158
+ "loss": 0.20597848296165466,
1159
+ "step": 1584
1160
+ },
1161
+ {
1162
+ "epoch": 1600.0,
1163
+ "grad_norm": 1.8224921226501465,
1164
+ "learning_rate": 0.00012113712650885117,
1165
+ "loss": 0.20530889928340912,
1166
+ "step": 1600
1167
+ },
1168
+ {
1169
+ "epoch": 1600.0,
1170
+ "eval_bleu": 0.8031781855221607,
1171
+ "eval_cos_loss": 0.04770847223699093,
1172
+ "eval_loss": 0.20582260191440582,
1173
+ "eval_mse_loss": 0.20582260191440582,
1174
+ "step": 1600
1175
+ },
1176
+ {
1177
+ "epoch": 1600.0,
1178
+ "eval_bleu": 0.8031781855221607,
1179
+ "eval_cos_loss": 0.04770847223699093,
1180
+ "eval_loss": 0.20582260191440582,
1181
+ "eval_mse_loss": 0.20582260191440582,
1182
+ "eval_runtime": 0.9548,
1183
+ "eval_samples_per_second": 134.057,
1184
+ "eval_steps_per_second": 2.095,
1185
+ "step": 1600
1186
+ },
1187
+ {
1188
+ "epoch": 1616.0,
1189
+ "grad_norm": 2.6983439922332764,
1190
+ "learning_rate": 0.00011299298860591917,
1191
+ "loss": 0.20517539978027344,
1192
+ "step": 1616
1193
+ },
1194
+ {
1195
+ "epoch": 1632.0,
1196
+ "grad_norm": 2.2038075923919678,
1197
+ "learning_rate": 0.00010509725092380906,
1198
+ "loss": 0.2047526240348816,
1199
+ "step": 1632
1200
+ },
1201
+ {
1202
+ "epoch": 1648.0,
1203
+ "grad_norm": 1.9047884941101074,
1204
+ "learning_rate": 9.745498133707109e-05,
1205
+ "loss": 0.20422129333019257,
1206
+ "step": 1648
1207
+ },
1208
+ {
1209
+ "epoch": 1664.0,
1210
+ "grad_norm": 1.9464013576507568,
1211
+ "learning_rate": 9.007108503190864e-05,
1212
+ "loss": 0.20397356152534485,
1213
+ "step": 1664
1214
+ },
1215
+ {
1216
+ "epoch": 1664.0,
1217
+ "eval_bleu": 0.8100469239619555,
1218
+ "eval_cos_loss": 0.04725760594010353,
1219
+ "eval_loss": 0.2041708454489708,
1220
+ "eval_mse_loss": 0.2041708454489708,
1221
+ "step": 1664
1222
+ },
1223
+ {
1224
+ "epoch": 1664.0,
1225
+ "eval_bleu": 0.8100469239619555,
1226
+ "eval_cos_loss": 0.04725760594010353,
1227
+ "eval_loss": 0.2041708454489708,
1228
+ "eval_mse_loss": 0.2041708454489708,
1229
+ "eval_runtime": 0.8953,
1230
+ "eval_samples_per_second": 142.964,
1231
+ "eval_steps_per_second": 2.234,
1232
+ "step": 1664
1233
+ },
1234
+ {
1235
+ "epoch": 1680.0,
1236
+ "grad_norm": 1.9454442262649536,
1237
+ "learning_rate": 8.295030135778742e-05,
1238
+ "loss": 0.20367543399333954,
1239
+ "step": 1680
1240
+ },
1241
+ {
1242
+ "epoch": 1696.0,
1243
+ "grad_norm": 2.6915903091430664,
1244
+ "learning_rate": 7.609720078548737e-05,
1245
+ "loss": 0.2033531665802002,
1246
+ "step": 1696
1247
+ },
1248
+ {
1249
+ "epoch": 1712.0,
1250
+ "grad_norm": 1.5794174671173096,
1251
+ "learning_rate": 6.951618197354753e-05,
1252
+ "loss": 0.20306910574436188,
1253
+ "step": 1712
1254
+ },
1255
+ {
1256
+ "epoch": 1728.0,
1257
+ "grad_norm": 2.828120470046997,
1258
+ "learning_rate": 6.321146894499102e-05,
1259
+ "loss": 0.2030172348022461,
1260
+ "step": 1728
1261
+ },
1262
+ {
1263
+ "epoch": 1728.0,
1264
+ "eval_bleu": 0.8147237401837912,
1265
+ "eval_cos_loss": 0.046787988394498825,
1266
+ "eval_loss": 0.20282745361328125,
1267
+ "eval_mse_loss": 0.20282745361328125,
1268
+ "step": 1728
1269
+ },
1270
+ {
1271
+ "epoch": 1728.0,
1272
+ "eval_bleu": 0.8147237401837912,
1273
+ "eval_cos_loss": 0.046787988394498825,
1274
+ "eval_loss": 0.20282745361328125,
1275
+ "eval_mse_loss": 0.20282745361328125,
1276
+ "eval_runtime": 1.1261,
1277
+ "eval_samples_per_second": 113.666,
1278
+ "eval_steps_per_second": 1.776,
1279
+ "step": 1728
1280
+ },
1281
+ {
1282
+ "epoch": 1744.0,
1283
+ "grad_norm": 1.4509916305541992,
1284
+ "learning_rate": 5.7187108376137274e-05,
1285
+ "loss": 0.2027032971382141,
1286
+ "step": 1744
1287
+ },
1288
+ {
1289
+ "epoch": 1760.0,
1290
+ "grad_norm": 2.41015887260437,
1291
+ "learning_rate": 5.144696699924578e-05,
1292
+ "loss": 0.2023259550333023,
1293
+ "step": 1760
1294
+ },
1295
+ {
1296
+ "epoch": 1776.0,
1297
+ "grad_norm": 2.604257822036743,
1298
+ "learning_rate": 4.599472912065611e-05,
1299
+ "loss": 0.2021774798631668,
1300
+ "step": 1776
1301
+ },
1302
+ {
1303
+ "epoch": 1792.0,
1304
+ "grad_norm": 2.3466601371765137,
1305
+ "learning_rate": 4.083389425601836e-05,
1306
+ "loss": 0.20197318494319916,
1307
+ "step": 1792
1308
+ },
1309
+ {
1310
+ "epoch": 1792.0,
1311
+ "eval_bleu": 0.8147862350993915,
1312
+ "eval_cos_loss": 0.04671955108642578,
1313
+ "eval_loss": 0.20188624411821365,
1314
+ "eval_mse_loss": 0.20188624411821365,
1315
+ "step": 1792
1316
+ },
1317
+ {
1318
+ "epoch": 1792.0,
1319
+ "eval_bleu": 0.8147862350993915,
1320
+ "eval_cos_loss": 0.04671955108642578,
1321
+ "eval_loss": 0.20188624411821365,
1322
+ "eval_mse_loss": 0.20188624411821365,
1323
+ "eval_runtime": 0.878,
1324
+ "eval_samples_per_second": 145.79,
1325
+ "eval_steps_per_second": 2.278,
1326
+ "step": 1792
1327
+ },
1328
+ {
1329
+ "epoch": 1808.0,
1330
+ "grad_norm": 2.410977840423584,
1331
+ "learning_rate": 3.596777488413072e-05,
1332
+ "loss": 0.20183902978897095,
1333
+ "step": 1808
1334
+ },
1335
+ {
1336
+ "epoch": 1824.0,
1337
+ "grad_norm": 1.510903239250183,
1338
+ "learning_rate": 3.139949432082712e-05,
1339
+ "loss": 0.20134302973747253,
1340
+ "step": 1824
1341
+ },
1342
+ {
1343
+ "epoch": 1840.0,
1344
+ "grad_norm": 1.8241870403289795,
1345
+ "learning_rate": 2.7131984714278636e-05,
1346
+ "loss": 0.20113661885261536,
1347
+ "step": 1840
1348
+ },
1349
+ {
1350
+ "epoch": 1856.0,
1351
+ "grad_norm": 1.8893063068389893,
1352
+ "learning_rate": 2.316798516299623e-05,
1353
+ "loss": 0.2010827660560608,
1354
+ "step": 1856
1355
+ },
1356
+ {
1357
+ "epoch": 1856.0,
1358
+ "eval_bleu": 0.8230810373941457,
1359
+ "eval_cos_loss": 0.04663713276386261,
1360
+ "eval_loss": 0.2013688012957573,
1361
+ "eval_mse_loss": 0.2013688012957573,
1362
+ "step": 1856
1363
+ },
1364
+ {
1365
+ "epoch": 1856.0,
1366
+ "eval_bleu": 0.8230810373941457,
1367
+ "eval_cos_loss": 0.04663713276386261,
1368
+ "eval_loss": 0.2013688012957573,
1369
+ "eval_mse_loss": 0.2013688012957573,
1370
+ "eval_runtime": 1.1304,
1371
+ "eval_samples_per_second": 113.233,
1372
+ "eval_steps_per_second": 1.769,
1373
+ "step": 1856
1374
+ },
1375
+ {
1376
+ "epoch": 1872.0,
1377
+ "grad_norm": 1.3174251317977905,
1378
+ "learning_rate": 1.9510039957741866e-05,
1379
+ "loss": 0.20096558332443237,
1380
+ "step": 1872
1381
+ },
1382
+ {
1383
+ "epoch": 1888.0,
1384
+ "grad_norm": 2.0146000385284424,
1385
+ "learning_rate": 1.6160496948476877e-05,
1386
+ "loss": 0.20089873671531677,
1387
+ "step": 1888
1388
+ },
1389
+ {
1390
+ "epoch": 1904.0,
1391
+ "grad_norm": 1.5292428731918335,
1392
+ "learning_rate": 1.3121506037395925e-05,
1393
+ "loss": 0.20046915113925934,
1394
+ "step": 1904
1395
+ },
1396
+ {
1397
+ "epoch": 1920.0,
1398
+ "grad_norm": 1.2913480997085571,
1399
+ "learning_rate": 1.0395017799013529e-05,
1400
+ "loss": 0.2005997598171234,
1401
+ "step": 1920
1402
+ },
1403
+ {
1404
+ "epoch": 1920.0,
1405
+ "eval_bleu": 0.8245367073756386,
1406
+ "eval_cos_loss": 0.046230655163526535,
1407
+ "eval_loss": 0.19999407976865768,
1408
+ "eval_mse_loss": 0.19999407976865768,
1409
+ "step": 1920
1410
+ },
1411
+ {
1412
+ "epoch": 1920.0,
1413
+ "eval_bleu": 0.8245367073756386,
1414
+ "eval_cos_loss": 0.046230655163526535,
1415
+ "eval_loss": 0.19999407976865768,
1416
+ "eval_mse_loss": 0.19999407976865768,
1417
+ "eval_runtime": 0.8695,
1418
+ "eval_samples_per_second": 147.203,
1419
+ "eval_steps_per_second": 2.3,
1420
+ "step": 1920
1421
+ },
1422
+ {
1423
+ "epoch": 1936.0,
1424
+ "grad_norm": 1.2993054389953613,
1425
+ "learning_rate": 7.982782228189156e-06,
1426
+ "loss": 0.20030871033668518,
1427
+ "step": 1936
1428
+ },
1429
+ {
1430
+ "epoch": 1952.0,
1431
+ "grad_norm": 1.5305612087249756,
1432
+ "learning_rate": 5.886347616893772e-06,
1433
+ "loss": 0.2002657800912857,
1434
+ "step": 1952
1435
+ },
1436
+ {
1437
+ "epoch": 1968.0,
1438
+ "grad_norm": 1.21235990524292,
1439
+ "learning_rate": 4.107059560439718e-06,
1440
+ "loss": 0.2001296430826187,
1441
+ "step": 1968
1442
+ },
1443
+ {
1444
+ "epoch": 1984.0,
1445
+ "grad_norm": 1.1770583391189575,
1446
+ "learning_rate": 2.646060093811187e-06,
1447
+ "loss": 0.20003925263881683,
1448
+ "step": 1984
1449
+ },
1450
+ {
1451
+ "epoch": 1984.0,
1452
+ "eval_bleu": 0.8271353650064853,
1453
+ "eval_cos_loss": 0.046304671093821526,
1454
+ "eval_loss": 0.19988874346017838,
1455
+ "eval_mse_loss": 0.19988874346017838,
1456
+ "step": 1984
1457
+ },
1458
+ {
1459
+ "epoch": 1984.0,
1460
+ "eval_bleu": 0.8271353650064853,
1461
+ "eval_cos_loss": 0.046304671093821526,
1462
+ "eval_loss": 0.19988874346017838,
1463
+ "eval_mse_loss": 0.19988874346017838,
1464
+ "eval_runtime": 1.0168,
1465
+ "eval_samples_per_second": 125.883,
1466
+ "eval_steps_per_second": 1.967,
1467
+ "step": 1984
1468
+ },
1469
+ {
1470
+ "epoch": 2000.0,
1471
+ "grad_norm": 1.1745353937149048,
1472
+ "learning_rate": 1.5042869586496811e-06,
1473
+ "loss": 0.19980217516422272,
1474
+ "step": 2000
1475
+ },
1476
+ {
1477
+ "epoch": 2016.0,
1478
+ "grad_norm": 1.0710855722427368,
1479
+ "learning_rate": 6.824730013650915e-07,
1480
+ "loss": 0.19994820654392242,
1481
+ "step": 2016
1482
+ },
1483
+ {
1484
+ "epoch": 2032.0,
1485
+ "grad_norm": 0.8578296303749084,
1486
+ "learning_rate": 1.8114570275867826e-07,
1487
+ "loss": 0.1998877078294754,
1488
+ "step": 2032
1489
+ },
1490
+ {
1491
+ "epoch": 2048.0,
1492
+ "grad_norm": 0.7908188700675964,
1493
+ "learning_rate": 6.268394598385463e-10,
1494
+ "loss": 0.19961218535900116,
1495
+ "step": 2048
1496
+ },
1497
+ {
1498
+ "epoch": 2048.0,
1499
+ "eval_bleu": 0.826127241114683,
1500
+ "eval_cos_loss": 0.04609876126050949,
1501
+ "eval_loss": 0.19921576976776123,
1502
+ "eval_mse_loss": 0.19921576976776123,
1503
+ "step": 2048
1504
+ },
1505
+ {
1506
+ "epoch": 2048.0,
1507
+ "eval_bleu": 0.826127241114683,
1508
+ "eval_cos_loss": 0.04609876126050949,
1509
+ "eval_loss": 0.19921576976776123,
1510
+ "eval_mse_loss": 0.19921576976776123,
1511
+ "eval_runtime": 0.8731,
1512
+ "eval_samples_per_second": 146.603,
1513
+ "eval_steps_per_second": 2.291,
1514
+ "step": 2048
1515
+ }
1516
+ ],
1517
+ "logging_steps": 16,
1518
+ "max_steps": 2048,
1519
+ "num_input_tokens_seen": 0,
1520
+ "num_train_epochs": 2048,
1521
+ "save_steps": 256,
1522
+ "stateful_callbacks": {
1523
+ "TrainerControl": {
1524
+ "args": {
1525
+ "should_epoch_stop": false,
1526
+ "should_evaluate": false,
1527
+ "should_log": false,
1528
+ "should_save": true,
1529
+ "should_training_stop": true
1530
+ },
1531
+ "attributes": {}
1532
+ }
1533
+ },
1534
+ "total_flos": 0.0,
1535
+ "train_batch_size": 64,
1536
+ "trial_name": null,
1537
+ "trial_params": null
1538
+ }
checkpoints-v2.0a-o-discrete-conditional/checkpoint-2048/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5937d08ef509a4ce944d3b2258b2f532be998f7a8e828dbfa14fe040f2d8bf93
3
+ size 5201