Fix tokenizer

Files changed (3) hide show

special_tokens_map.json CHANGED Viewed

+{
+  "bos_token": "<cls>",
+  "cls_token": "<cls>",
+  "eos_token": "<sep>",
+  "mask_token": {
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "pad_token": "<pad>",
+  "sep_token": "<sep>",
+  "unk_token": "<unk>"
+}

tokenizer.json CHANGED Viewed

The diff for this file is too large to render. See raw diff

tokenizer_config.json CHANGED Viewed

@@ -1,3 +1,21 @@
 {
-  "tokenizer_class": "PreTrainedTokenizerFast"
 }

 {
+  "bos_token": "<cls>",
+  "cls_token": "<cls>",
+  "do_lower_case": true,
+  "eos_token": "<sep>",
+  "keep_accents": false,
+  "mask_token": {
+    "__type": "AddedToken",
+    "content": "<mask>",
+    "lstrip": true,
+    "normalized": true,
+    "rstrip": false,
+    "single_word": false
+  },
+  "model_max_length": 512,
+  "pad_token": "<pad>",
+  "remove_space": true,
+  "sep_token": "<sep>",
+  "tokenizer_class": "RemBertTokenizer",
+  "unk_token": "<unk>"
 }