KateMajzel commited on
Commit
43b8d1f
·
verified ·
1 Parent(s): d14ebe8

Upload folder using huggingface_hub

Browse files
Files changed (6) hide show
  1. README.md +138 -0
  2. config.json +35 -0
  3. generation_config.json +614 -0
  4. model.safetensors +3 -0
  5. tokenizer.json +0 -0
  6. tokenizer_config.json +9 -0
README.md CHANGED
@@ -1,3 +1,141 @@
1
  ---
 
 
2
  license: mit
 
 
 
 
 
 
 
 
3
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
+ language:
3
+ - pl
4
  license: mit
5
+ library_name: transformers
6
+ pipeline_tag: text-generation
7
+ tags:
8
+ - polish
9
+ - gpt2
10
+ - nanogpt
11
+ - tokenizer-ablation
12
+ - research
13
  ---
14
+
15
+ > **Kopia lustrzana.** Repozytorium źródłowe modelu:
16
+ > [KateMajzel/GoLLeM-45M-PL](https://huggingface.co/KateMajzel/GoLLeM-45M-PL).
17
+ > Wagi i tokenizer są identyczne. Aktualizacje karty modelu wprowadzane są najpierw
18
+ > w repozytorium źródłowym.
19
+
20
+
21
+ # GoLLeM-45M-PL
22
+
23
+ Model GPT-2 (42,5 mln parametrów) wytrenowany od zera na 2,96 GB polskiego tekstu,
24
+ z dedykowanym polskim tokenizerem BPE (32 768 pozycji).
25
+
26
+ Model jest **artefaktem eksperymentu badawczego**, nie narzędziem użytkowym.
27
+ Pytanie: *czy dedykowany tokenizer polski daje lepszy model niż tokenizer GPT-2 przy
28
+ tym samym budżecie treningowym?* Odpowiedź: **nie daje lepszego — daje porównywalny
29
+ 2,5× taniej.**
30
+
31
+ Kod, dane i pełna metodologia: https://github.com/KateMajzel/gollem-pl
32
+
33
+ ## Użycie
34
+
35
+ ```python
36
+ from transformers import pipeline
37
+
38
+ pipe = pipeline("text-generation", model="KateMajzel/GoLLeM-45M-PL")
39
+ print(pipe("W lesie mieszkał mały", max_new_tokens=50)[0]["generated_text"])
40
+ ```
41
+
42
+ Domyślne parametry generacji: `do_sample=True`, `temperature=0.8`, `top_p=0.9`,
43
+ `repetition_penalty=1.15`. Dekodowanie zachłanne wpada w pętle powtórzeń — typowe dla
44
+ modeli tej wielkości. 199 nieużywanych tokenów wypełniających (32 569–32 767)
45
+ zablokowano przez `bad_words_ids`.
46
+
47
+ ## Wyniki
48
+
49
+ BPB na prywatnym held-oucie (1 999 dokumentów, identyczne 2 767 440 bajtów dla
50
+ każdego modelu; średnie z 3 ziaren dla R1 i R2a):
51
+
52
+ | przebieg | tokenizer | budżet | BPB ↓ | sd | parametry | czas |
53
+ |---|---|---|---|---|---|---|
54
+ | **R1** (ten model) | polski, 32 768 | 2,96 GB | 1,2114 | 0,0100 | 42,5 M | **49,7 min** |
55
+ | R2a | GPT-2, 50 257 | 2,96 GB — te same bajty | 1,1946 | 0,0035 | 51,5 M | 122,4 min |
56
+ | R2b | GPT-2, 50 257 | 2 970 kroków — te same tokeny | 1,2756 | (n=1) | 51,5 M | 62,4 min |
57
+ | R3 | GPT-2 zero-shot | — | 2,9555 | (n=1) | 124 M | — |
58
+
59
+ Benchmarki zero-shot (log-likelihood z normalizacją PMI domenową):
60
+
61
+ | zadanie | R1 | R2a | GPT-2 | klasa większościowa | losowo |
62
+ |---|---|---|---|---|---|
63
+ | PolEmo2-IN | 47,2% | 43,8% | 20,8% | 40,0% | 25,0% |
64
+ | 8Tags | 31,5% | 29,8% | 17,8% | 16,5% | 12,5% |
65
+
66
+ ### Interpretacja
67
+
68
+ Cztery niezależne pomiary (BPB, PolEmo2, 8Tags, prywatny held-out) nie wykazują
69
+ istotnej przewagi żadnego tokenizera przy równym budżecie tekstu, a ich kierunki są
70
+ niespójne. Rozstrzygająca obserwacja: **różnica BPB między dwoma ziarnami tego samego
71
+ modelu (0,0186) przewyższa różnicę między modelami o odmiennych tokenizerach (0,0124).**
72
+
73
+ Przewaga leży w koszcie. Przy wyrównanym budżecie obliczeniowym (R1 vs R2b) tokenizer
74
+ polski wygrywa o 5,30% BPB — 6,4 odchylenia. Ten sam wniosek uzyskał niezależnie zespół
75
+ Bielika v3 PL na skali 11B (arXiv 2604.10799).
76
+
77
+ ### Uwaga o perplexity
78
+
79
+ PPL/token wynosi 30,7 dla R1 i 5,8 dla R2a, co sugerowałoby pięciokrotną przewagę
80
+ GPT-2. To artefakt: modele o różnych tokenizerach przewidują jednostki różnej trudności.
81
+ **Perplexity jest między nimi nieporównywalna.** Jedyną poprawną metryką jest
82
+ bits-per-byte.
83
+
84
+ ## Tokenizer
85
+
86
+ Byte-level BPE, 32 568 pozycji + 200 specjalnych. 27,9% pozycji z polskimi
87
+ diakrytykami, round-trip bezstratny, zero tokenów nieosiągalnych przez merge.
88
+
89
+ | | ten tokenizer | GPT-2 |
90
+ |---|---|---|
91
+ | bajty/token (korpus) | 4,050 | 2,066 |
92
+ | bajty/token (held-out) | 4,103 | 2,134 |
93
+ | gęstość | **1,96×** | 1,00× |
94
+
95
+ ## Dane treningowe
96
+
97
+ 2,96 GB, 803 177 dokumentów, [SpeakLeash](https://speakleash.org/): 37% encyklopedia
98
+ i literatura, 22% fora, 27% web, 11% publicystyka i nauka, 3% teksty urzędowe.
99
+
100
+ Celowo wykluczone: tłumaczenia i napisy (translationese), tekst syntetyczny, teksty
101
+ piosenek (prawa autorskie), surowy Common Crawl. Licencje zbiorów po stronie SpeakLeash.
102
+
103
+ ## Architektura
104
+
105
+ 8 warstw × 8 głowic × 512 wymiarów, kontekst 1 024 tokeny, 42,5 M parametrów
106
+ (25,7 M niezanurzeniowych), 731 mln tokenów treningowych (17,2 na parametr),
107
+ AdamW lr 1e-3 → 1e-4, bfloat16, 1 epoka, 1× RTX 5080.
108
+
109
+ ## Ograniczenia
110
+
111
+ - **Skala.** Model produkuje poprawną polszczyznę na poziomie zdania, ale halucynuje
112
+ fakty i traci spójność po kilku zdaniach. Przykład z generacji: *„wieś znalazła się
113
+ w powiecie częstochowskim, gminie Łęczna"* — obie nazwy istnieją, zestawienie jest
114
+ fałszywe.
115
+ - **Model bazowy.** Wyłącznie kontynuacja tekstu; bez dostrajania instrukcyjnego
116
+ i bez filtrowania bezpieczeństwa.
117
+ - **Dane z forów internetowych.** Model może odtwarzać obecne tam uprzedzenia i język.
118
+ Nie nadaje się do zastosowań z udziałem użytkownika końcowego — w szczególności
119
+ dzieci — bez nadzoru człowieka.
120
+ - **Jedna skala i jedna konfiguracja.** Wyniki dotyczą 42 M parametrów i 3 GB danych.
121
+ - **Rejestr zależny od miksu danych.** Przy prompcie z bajki dla dzieci model
122
+ odpowiada językiem forów lub haseł encyklopedycznych.
123
+ - Korpus zawiera windowsowe końce linii (`\r\n`), które model odtwarza.
124
+
125
+ ## Odtwarzalność
126
+
127
+ Kod, konfiguracje, skrypty ewaluacyjne i opis pięciu pułapek metodologicznych:
128
+ https://github.com/KateMajzel/gollem-pl
129
+
130
+ Bazuje na [nanoGPT](https://github.com/karpathy/nanoGPT) (MIT, Andrej Karpathy).
131
+
132
+ ## Cytowanie
133
+
134
+ ```bibtex
135
+ @misc{gollem45mpl,
136
+ title = {GoLLeM-45M-PL: ablacja tokenizera dla polskiego modelu językowego},
137
+ author = {Majzel-Pośpiech, Katarzyna},
138
+ year = {2026},
139
+ url = {https://huggingface.co/KateMajzel/GoLLeM-45M-PL}
140
+ }
141
+ ```
config.json ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "activation_function": "gelu_new",
3
+ "add_cross_attention": false,
4
+ "architectures": [
5
+ "GPT2LMHeadModel"
6
+ ],
7
+ "attn_pdrop": 0.1,
8
+ "bos_token_id": 32568,
9
+ "dtype": "float32",
10
+ "embd_pdrop": 0.1,
11
+ "eos_token_id": 32568,
12
+ "initializer_range": 0.02,
13
+ "layer_norm_epsilon": 1e-05,
14
+ "model_type": "gpt2",
15
+ "n_ctx": 1024,
16
+ "n_embd": 512,
17
+ "n_head": 8,
18
+ "n_inner": null,
19
+ "n_layer": 8,
20
+ "n_positions": 1024,
21
+ "pad_token_id": 32580,
22
+ "reorder_and_upcast_attn": false,
23
+ "resid_pdrop": 0.1,
24
+ "scale_attn_by_inverse_layer_idx": false,
25
+ "scale_attn_weights": true,
26
+ "summary_activation": null,
27
+ "summary_first_dropout": 0.1,
28
+ "summary_proj_to_labels": true,
29
+ "summary_type": "cls_index",
30
+ "summary_use_proj": true,
31
+ "tie_word_embeddings": true,
32
+ "transformers_version": "5.15.0",
33
+ "use_cache": true,
34
+ "vocab_size": 32768
35
+ }
generation_config.json ADDED
@@ -0,0 +1,614 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "_from_model_config": true,
3
+ "output_attentions": false,
4
+ "output_hidden_states": false,
5
+ "transformers_version": "5.15.0",
6
+ "use_cache": true,
7
+ "max_new_tokens": 100,
8
+ "do_sample": true,
9
+ "temperature": 0.8,
10
+ "top_p": 0.9,
11
+ "repetition_penalty": 1.15,
12
+ "bad_words_ids": [
13
+ [
14
+ 32569
15
+ ],
16
+ [
17
+ 32570
18
+ ],
19
+ [
20
+ 32571
21
+ ],
22
+ [
23
+ 32572
24
+ ],
25
+ [
26
+ 32573
27
+ ],
28
+ [
29
+ 32574
30
+ ],
31
+ [
32
+ 32575
33
+ ],
34
+ [
35
+ 32576
36
+ ],
37
+ [
38
+ 32577
39
+ ],
40
+ [
41
+ 32578
42
+ ],
43
+ [
44
+ 32579
45
+ ],
46
+ [
47
+ 32580
48
+ ],
49
+ [
50
+ 32581
51
+ ],
52
+ [
53
+ 32582
54
+ ],
55
+ [
56
+ 32583
57
+ ],
58
+ [
59
+ 32584
60
+ ],
61
+ [
62
+ 32585
63
+ ],
64
+ [
65
+ 32586
66
+ ],
67
+ [
68
+ 32587
69
+ ],
70
+ [
71
+ 32588
72
+ ],
73
+ [
74
+ 32589
75
+ ],
76
+ [
77
+ 32590
78
+ ],
79
+ [
80
+ 32591
81
+ ],
82
+ [
83
+ 32592
84
+ ],
85
+ [
86
+ 32593
87
+ ],
88
+ [
89
+ 32594
90
+ ],
91
+ [
92
+ 32595
93
+ ],
94
+ [
95
+ 32596
96
+ ],
97
+ [
98
+ 32597
99
+ ],
100
+ [
101
+ 32598
102
+ ],
103
+ [
104
+ 32599
105
+ ],
106
+ [
107
+ 32600
108
+ ],
109
+ [
110
+ 32601
111
+ ],
112
+ [
113
+ 32602
114
+ ],
115
+ [
116
+ 32603
117
+ ],
118
+ [
119
+ 32604
120
+ ],
121
+ [
122
+ 32605
123
+ ],
124
+ [
125
+ 32606
126
+ ],
127
+ [
128
+ 32607
129
+ ],
130
+ [
131
+ 32608
132
+ ],
133
+ [
134
+ 32609
135
+ ],
136
+ [
137
+ 32610
138
+ ],
139
+ [
140
+ 32611
141
+ ],
142
+ [
143
+ 32612
144
+ ],
145
+ [
146
+ 32613
147
+ ],
148
+ [
149
+ 32614
150
+ ],
151
+ [
152
+ 32615
153
+ ],
154
+ [
155
+ 32616
156
+ ],
157
+ [
158
+ 32617
159
+ ],
160
+ [
161
+ 32618
162
+ ],
163
+ [
164
+ 32619
165
+ ],
166
+ [
167
+ 32620
168
+ ],
169
+ [
170
+ 32621
171
+ ],
172
+ [
173
+ 32622
174
+ ],
175
+ [
176
+ 32623
177
+ ],
178
+ [
179
+ 32624
180
+ ],
181
+ [
182
+ 32625
183
+ ],
184
+ [
185
+ 32626
186
+ ],
187
+ [
188
+ 32627
189
+ ],
190
+ [
191
+ 32628
192
+ ],
193
+ [
194
+ 32629
195
+ ],
196
+ [
197
+ 32630
198
+ ],
199
+ [
200
+ 32631
201
+ ],
202
+ [
203
+ 32632
204
+ ],
205
+ [
206
+ 32633
207
+ ],
208
+ [
209
+ 32634
210
+ ],
211
+ [
212
+ 32635
213
+ ],
214
+ [
215
+ 32636
216
+ ],
217
+ [
218
+ 32637
219
+ ],
220
+ [
221
+ 32638
222
+ ],
223
+ [
224
+ 32639
225
+ ],
226
+ [
227
+ 32640
228
+ ],
229
+ [
230
+ 32641
231
+ ],
232
+ [
233
+ 32642
234
+ ],
235
+ [
236
+ 32643
237
+ ],
238
+ [
239
+ 32644
240
+ ],
241
+ [
242
+ 32645
243
+ ],
244
+ [
245
+ 32646
246
+ ],
247
+ [
248
+ 32647
249
+ ],
250
+ [
251
+ 32648
252
+ ],
253
+ [
254
+ 32649
255
+ ],
256
+ [
257
+ 32650
258
+ ],
259
+ [
260
+ 32651
261
+ ],
262
+ [
263
+ 32652
264
+ ],
265
+ [
266
+ 32653
267
+ ],
268
+ [
269
+ 32654
270
+ ],
271
+ [
272
+ 32655
273
+ ],
274
+ [
275
+ 32656
276
+ ],
277
+ [
278
+ 32657
279
+ ],
280
+ [
281
+ 32658
282
+ ],
283
+ [
284
+ 32659
285
+ ],
286
+ [
287
+ 32660
288
+ ],
289
+ [
290
+ 32661
291
+ ],
292
+ [
293
+ 32662
294
+ ],
295
+ [
296
+ 32663
297
+ ],
298
+ [
299
+ 32664
300
+ ],
301
+ [
302
+ 32665
303
+ ],
304
+ [
305
+ 32666
306
+ ],
307
+ [
308
+ 32667
309
+ ],
310
+ [
311
+ 32668
312
+ ],
313
+ [
314
+ 32669
315
+ ],
316
+ [
317
+ 32670
318
+ ],
319
+ [
320
+ 32671
321
+ ],
322
+ [
323
+ 32672
324
+ ],
325
+ [
326
+ 32673
327
+ ],
328
+ [
329
+ 32674
330
+ ],
331
+ [
332
+ 32675
333
+ ],
334
+ [
335
+ 32676
336
+ ],
337
+ [
338
+ 32677
339
+ ],
340
+ [
341
+ 32678
342
+ ],
343
+ [
344
+ 32679
345
+ ],
346
+ [
347
+ 32680
348
+ ],
349
+ [
350
+ 32681
351
+ ],
352
+ [
353
+ 32682
354
+ ],
355
+ [
356
+ 32683
357
+ ],
358
+ [
359
+ 32684
360
+ ],
361
+ [
362
+ 32685
363
+ ],
364
+ [
365
+ 32686
366
+ ],
367
+ [
368
+ 32687
369
+ ],
370
+ [
371
+ 32688
372
+ ],
373
+ [
374
+ 32689
375
+ ],
376
+ [
377
+ 32690
378
+ ],
379
+ [
380
+ 32691
381
+ ],
382
+ [
383
+ 32692
384
+ ],
385
+ [
386
+ 32693
387
+ ],
388
+ [
389
+ 32694
390
+ ],
391
+ [
392
+ 32695
393
+ ],
394
+ [
395
+ 32696
396
+ ],
397
+ [
398
+ 32697
399
+ ],
400
+ [
401
+ 32698
402
+ ],
403
+ [
404
+ 32699
405
+ ],
406
+ [
407
+ 32700
408
+ ],
409
+ [
410
+ 32701
411
+ ],
412
+ [
413
+ 32702
414
+ ],
415
+ [
416
+ 32703
417
+ ],
418
+ [
419
+ 32704
420
+ ],
421
+ [
422
+ 32705
423
+ ],
424
+ [
425
+ 32706
426
+ ],
427
+ [
428
+ 32707
429
+ ],
430
+ [
431
+ 32708
432
+ ],
433
+ [
434
+ 32709
435
+ ],
436
+ [
437
+ 32710
438
+ ],
439
+ [
440
+ 32711
441
+ ],
442
+ [
443
+ 32712
444
+ ],
445
+ [
446
+ 32713
447
+ ],
448
+ [
449
+ 32714
450
+ ],
451
+ [
452
+ 32715
453
+ ],
454
+ [
455
+ 32716
456
+ ],
457
+ [
458
+ 32717
459
+ ],
460
+ [
461
+ 32718
462
+ ],
463
+ [
464
+ 32719
465
+ ],
466
+ [
467
+ 32720
468
+ ],
469
+ [
470
+ 32721
471
+ ],
472
+ [
473
+ 32722
474
+ ],
475
+ [
476
+ 32723
477
+ ],
478
+ [
479
+ 32724
480
+ ],
481
+ [
482
+ 32725
483
+ ],
484
+ [
485
+ 32726
486
+ ],
487
+ [
488
+ 32727
489
+ ],
490
+ [
491
+ 32728
492
+ ],
493
+ [
494
+ 32729
495
+ ],
496
+ [
497
+ 32730
498
+ ],
499
+ [
500
+ 32731
501
+ ],
502
+ [
503
+ 32732
504
+ ],
505
+ [
506
+ 32733
507
+ ],
508
+ [
509
+ 32734
510
+ ],
511
+ [
512
+ 32735
513
+ ],
514
+ [
515
+ 32736
516
+ ],
517
+ [
518
+ 32737
519
+ ],
520
+ [
521
+ 32738
522
+ ],
523
+ [
524
+ 32739
525
+ ],
526
+ [
527
+ 32740
528
+ ],
529
+ [
530
+ 32741
531
+ ],
532
+ [
533
+ 32742
534
+ ],
535
+ [
536
+ 32743
537
+ ],
538
+ [
539
+ 32744
540
+ ],
541
+ [
542
+ 32745
543
+ ],
544
+ [
545
+ 32746
546
+ ],
547
+ [
548
+ 32747
549
+ ],
550
+ [
551
+ 32748
552
+ ],
553
+ [
554
+ 32749
555
+ ],
556
+ [
557
+ 32750
558
+ ],
559
+ [
560
+ 32751
561
+ ],
562
+ [
563
+ 32752
564
+ ],
565
+ [
566
+ 32753
567
+ ],
568
+ [
569
+ 32754
570
+ ],
571
+ [
572
+ 32755
573
+ ],
574
+ [
575
+ 32756
576
+ ],
577
+ [
578
+ 32757
579
+ ],
580
+ [
581
+ 32758
582
+ ],
583
+ [
584
+ 32759
585
+ ],
586
+ [
587
+ 32760
588
+ ],
589
+ [
590
+ 32761
591
+ ],
592
+ [
593
+ 32762
594
+ ],
595
+ [
596
+ 32763
597
+ ],
598
+ [
599
+ 32764
600
+ ],
601
+ [
602
+ 32765
603
+ ],
604
+ [
605
+ 32766
606
+ ],
607
+ [
608
+ 32767
609
+ ]
610
+ ],
611
+ "eos_token_id": 32568,
612
+ "pad_token_id": 32568,
613
+ "bos_token_id": 32568
614
+ }
model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:325198eecaed245557c794d500037f7612a44287d009c7b6471891c45377d4b3
3
+ size 170096368
tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "model_max_length": 1024,
4
+ "bos_token": "<|endoftext|>",
5
+ "eos_token": "<|endoftext|>",
6
+ "pad_token": "<|pad|>",
7
+ "unk_token": null,
8
+ "clean_up_tokenization_spaces": false
9
+ }