Upload tokenizers/TOKENIZERS_USER_GUIDE.txt with huggingface_hub
Browse files
tokenizers/TOKENIZERS_USER_GUIDE.txt
ADDED
|
@@ -0,0 +1,69 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
================================================================================
|
| 2 |
+
TOKENIZERS - USER GUIDE (Android Python STB) - Generated by RIMI
|
| 3 |
+
================================================================================
|
| 4 |
+
|
| 5 |
+
WHAT IT IS
|
| 6 |
+
HuggingFace `tokenizers` 0.23.2 - fast Rust implementation of modern
|
| 7 |
+
tokenizers (BPE, WordPiece, WordLevel, Unigram) with Python bindings
|
| 8 |
+
(PyO3). Train vocabularies and encode/decode text at high speed.
|
| 9 |
+
|
| 10 |
+
WHEELS (STANDALONE folder)
|
| 11 |
+
tokenizers-0.23.2-cp312-cp312-android_24_x86_64.whl (emulator)
|
| 12 |
+
tokenizers-0.23.2-cp312-cp312-android_24_arm64_v8a.whl (phones)
|
| 13 |
+
huggingface_hub-1.30.0-py3-none-any.whl (pure-Python dep,
|
| 14 |
+
official PyPI wheel, unmodified)
|
| 15 |
+
Install the wheel matching your device arch, plus huggingface_hub.
|
| 16 |
+
|
| 17 |
+
IMPORT
|
| 18 |
+
from tokenizers import Tokenizer
|
| 19 |
+
from tokenizers.models import BPE, WordPiece, WordLevel
|
| 20 |
+
from tokenizers.trainers import BpeTrainer, WordPieceTrainer, WordLevelTrainer
|
| 21 |
+
from tokenizers.pre_tokenizers import Whitespace, WhitespaceSplit
|
| 22 |
+
from tokenizers.normalizers import Lowercase, NFKC
|
| 23 |
+
from tokenizers.processors import BertProcessing
|
| 24 |
+
from tokenizers.decoders import BPEDecoder
|
| 25 |
+
import tokenizers
|
| 26 |
+
print(tokenizers.__version__) # 0.23.2
|
| 27 |
+
|
| 28 |
+
QUICK EXAMPLE - BPE train + roundtrip
|
| 29 |
+
from tokenizers import Tokenizer
|
| 30 |
+
from tokenizers.models import BPE
|
| 31 |
+
from tokenizers.trainers import BpeTrainer
|
| 32 |
+
from tokenizers.pre_tokenizers import Whitespace
|
| 33 |
+
|
| 34 |
+
tok = Tokenizer(BPE(unk_token="[UNK]"))
|
| 35 |
+
tok.pre_tokenizer = Whitespace()
|
| 36 |
+
trainer = BpeTrainer(vocab_size=200, special_tokens=["[UNK]"])
|
| 37 |
+
tok.train(["my_corpus.txt"], trainer)
|
| 38 |
+
enc = tok.encode("Hello world")
|
| 39 |
+
print(enc.ids, enc.tokens)
|
| 40 |
+
print(tok.decode(enc.ids))
|
| 41 |
+
|
| 42 |
+
QUICK EXAMPLE - WordLevel
|
| 43 |
+
from tokenizers import Tokenizer
|
| 44 |
+
from tokenizers.models import WordLevel
|
| 45 |
+
tok = Tokenizer(WordLevel(vocab={"hello": 0, "world": 1, "[UNK]": 2},
|
| 46 |
+
unk_token="[UNK]"))
|
| 47 |
+
print(tok.encode("hello world").ids) # [0, 1]
|
| 48 |
+
|
| 49 |
+
SAVE / LOAD
|
| 50 |
+
tok.save("/path/tok.json")
|
| 51 |
+
tok2 = Tokenizer.from_file("/path/tok.json")
|
| 52 |
+
|
| 53 |
+
ANDROID NOTES
|
| 54 |
+
- Native extension: tokenizers/tokenizers.cpython-312.so (Rust cdylib,
|
| 55 |
+
16KB page-aligned, NoRELRO, stripped, DT_NEEDED includes librimi.so
|
| 56 |
+
app-lock + libc++_shared + libpython3.12.so.1.0).
|
| 57 |
+
- Requires huggingface_hub at runtime (Requires-Dist kept in METADATA).
|
| 58 |
+
huggingface_hub's optional native dep hf-xet is NOT bundled and NOT
|
| 59 |
+
needed; the hub falls back to httpx without it.
|
| 60 |
+
- No network needed for train/encode/decode; only for hub downloads.
|
| 61 |
+
|
| 62 |
+
TESTED FEATURES (Test_Tokenizers.py, exit 0 = all pass)
|
| 63 |
+
import + __version__ 0.23.2; submodules import; BPE train on tiny
|
| 64 |
+
corpus; encode/decode roundtrip; encode_batch; WordLevel; save/load;
|
| 65 |
+
Lowercase normalizer; BertProcessing.
|
| 66 |
+
|
| 67 |
+
================================================================================
|
| 68 |
+
Generated by RIMI
|
| 69 |
+
================================================================================
|