PythonSTB commited on
Commit
ef7e7bf
·
verified ·
1 Parent(s): 89eeb5b

Upload tokenizers/TOKENIZERS_USER_GUIDE.txt with huggingface_hub

Browse files
tokenizers/TOKENIZERS_USER_GUIDE.txt ADDED
@@ -0,0 +1,69 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ================================================================================
2
+ TOKENIZERS - USER GUIDE (Android Python STB) - Generated by RIMI
3
+ ================================================================================
4
+
5
+ WHAT IT IS
6
+ HuggingFace `tokenizers` 0.23.2 - fast Rust implementation of modern
7
+ tokenizers (BPE, WordPiece, WordLevel, Unigram) with Python bindings
8
+ (PyO3). Train vocabularies and encode/decode text at high speed.
9
+
10
+ WHEELS (STANDALONE folder)
11
+ tokenizers-0.23.2-cp312-cp312-android_24_x86_64.whl (emulator)
12
+ tokenizers-0.23.2-cp312-cp312-android_24_arm64_v8a.whl (phones)
13
+ huggingface_hub-1.30.0-py3-none-any.whl (pure-Python dep,
14
+ official PyPI wheel, unmodified)
15
+ Install the wheel matching your device arch, plus huggingface_hub.
16
+
17
+ IMPORT
18
+ from tokenizers import Tokenizer
19
+ from tokenizers.models import BPE, WordPiece, WordLevel
20
+ from tokenizers.trainers import BpeTrainer, WordPieceTrainer, WordLevelTrainer
21
+ from tokenizers.pre_tokenizers import Whitespace, WhitespaceSplit
22
+ from tokenizers.normalizers import Lowercase, NFKC
23
+ from tokenizers.processors import BertProcessing
24
+ from tokenizers.decoders import BPEDecoder
25
+ import tokenizers
26
+ print(tokenizers.__version__) # 0.23.2
27
+
28
+ QUICK EXAMPLE - BPE train + roundtrip
29
+ from tokenizers import Tokenizer
30
+ from tokenizers.models import BPE
31
+ from tokenizers.trainers import BpeTrainer
32
+ from tokenizers.pre_tokenizers import Whitespace
33
+
34
+ tok = Tokenizer(BPE(unk_token="[UNK]"))
35
+ tok.pre_tokenizer = Whitespace()
36
+ trainer = BpeTrainer(vocab_size=200, special_tokens=["[UNK]"])
37
+ tok.train(["my_corpus.txt"], trainer)
38
+ enc = tok.encode("Hello world")
39
+ print(enc.ids, enc.tokens)
40
+ print(tok.decode(enc.ids))
41
+
42
+ QUICK EXAMPLE - WordLevel
43
+ from tokenizers import Tokenizer
44
+ from tokenizers.models import WordLevel
45
+ tok = Tokenizer(WordLevel(vocab={"hello": 0, "world": 1, "[UNK]": 2},
46
+ unk_token="[UNK]"))
47
+ print(tok.encode("hello world").ids) # [0, 1]
48
+
49
+ SAVE / LOAD
50
+ tok.save("/path/tok.json")
51
+ tok2 = Tokenizer.from_file("/path/tok.json")
52
+
53
+ ANDROID NOTES
54
+ - Native extension: tokenizers/tokenizers.cpython-312.so (Rust cdylib,
55
+ 16KB page-aligned, NoRELRO, stripped, DT_NEEDED includes librimi.so
56
+ app-lock + libc++_shared + libpython3.12.so.1.0).
57
+ - Requires huggingface_hub at runtime (Requires-Dist kept in METADATA).
58
+ huggingface_hub's optional native dep hf-xet is NOT bundled and NOT
59
+ needed; the hub falls back to httpx without it.
60
+ - No network needed for train/encode/decode; only for hub downloads.
61
+
62
+ TESTED FEATURES (Test_Tokenizers.py, exit 0 = all pass)
63
+ import + __version__ 0.23.2; submodules import; BPE train on tiny
64
+ corpus; encode/decode roundtrip; encode_batch; WordLevel; save/load;
65
+ Lowercase normalizer; BertProcessing.
66
+
67
+ ================================================================================
68
+ Generated by RIMI
69
+ ================================================================================