Botnoi
/

xls-r-300m-th-beta

Model card Files Files and versions Community

newknp commited on Dec 14, 2022

Commit

3af6601

•

1 Parent(s): fe2febf

Upload lm-boosted decoder

Browse files

Files changed (9) hide show

added_tokens.json +4 -0
alphabet.json +1 -0
language_model/attrs.json +1 -0
language_model/scb_med_pobpad_corpus_newmm-5gram.bin +3 -0
language_model/unigrams.txt +0 -0
preprocessor_config.json +10 -0
special_tokens_map.json +22 -0
tokenizer_config.json +14 -0
vocab.json +69 -0

added_tokens.json ADDED Viewed

	@@ -0,0 +1,4 @@

+{
+  "</s>": 68,
+  "<s>": 67
+}

alphabet.json ADDED Viewed

	@@ -0,0 +1 @@

+ {"labels": [" ", "\u0e01", "\u0e02", "\u0e04", "\u0e06", "\u0e07", "\u0e08", "\u0e09", "\u0e0a", "\u0e0b", "\u0e0c", "\u0e0d", "\u0e0e", "\u0e0f", "\u0e10", "\u0e11", "\u0e12", "\u0e13", "\u0e14", "\u0e15", "\u0e16", "\u0e17", "\u0e18", "\u0e19", "\u0e1a", "\u0e1b", "\u0e1c", "\u0e1d", "\u0e1e", "\u0e1f", "\u0e20", "\u0e21", "\u0e22", "\u0e23", "\u0e24", "\u0e25", "\u0e27", "\u0e28", "\u0e29", "\u0e2a", "\u0e2b", "\u0e2c", "\u0e2d", "\u0e2e", "\u0e30", "\u0e31", "\u0e32", "\u0e33", "\u0e34", "\u0e35", "\u0e36", "\u0e37", "\u0e38", "\u0e39", "\u0e40", "\u0e41", "\u0e42", "\u0e43", "\u0e44", "\u0e47", "\u0e48", "\u0e49", "\u0e4a", "\u0e4b", "\u0e4c", "\u2047", "", "<s>", "</s>"], "is_bpe": false}

language_model/attrs.json ADDED Viewed

	@@ -0,0 +1 @@


1	+ {"alpha": 0.5, "beta": 1.5, "unk_score_offset": -10.0, "score_boundary": true}

language_model/scb_med_pobpad_corpus_newmm-5gram.bin ADDED Viewed

	@@ -0,0 +1,3 @@

+version https://git-lfs.github.com/spec/v1
+oid sha256:b88b817998c5caae85ce44f0c4ee4edd5d8b44b72e4e994ee3b36667531c8810
+size 316448195

language_model/unigrams.txt ADDED Viewed

The diff for this file is too large to render. See raw diff

preprocessor_config.json ADDED Viewed

	@@ -0,0 +1,10 @@

+{
+  "do_normalize": true,
+  "feature_extractor_type": "Wav2Vec2FeatureExtractor",
+  "feature_size": 1,
+  "padding_side": "right",
+  "padding_value": 0.0,
+  "processor_class": "Wav2Vec2ProcessorWithLM",
+  "return_attention_mask": true,
+  "sampling_rate": 16000
+}

special_tokens_map.json ADDED Viewed

	@@ -0,0 +1,22 @@

+{
+  "additional_special_tokens": [
+    {
+      "content": "<s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    },
+    {
+      "content": "</s>",
+      "lstrip": false,
+      "normalized": true,
+      "rstrip": false,
+      "single_word": false
+    }
+  ],
+  "bos_token": "<s>",
+  "eos_token": "</s>",
+  "pad_token": "[PAD]",
+  "unk_token": "[UNK]"
+}

tokenizer_config.json ADDED Viewed

	@@ -0,0 +1,14 @@

+{
+  "bos_token": "<s>",
+  "do_lower_case": false,
+  "eos_token": "</s>",
+  "model_max_length": 1000000000000000019884624838656,
+  "name_or_path": ".",
+  "pad_token": "[PAD]",
+  "processor_class": "Wav2Vec2ProcessorWithLM",
+  "replace_word_delimiter_char": " ",
+  "special_tokens_map_file": null,
+  "tokenizer_class": "Wav2Vec2CTCTokenizer",
+  "unk_token": "[UNK]",
+  "word_delimiter_token": "|"
+}

vocab.json ADDED Viewed

	@@ -0,0 +1,69 @@

+{
+  "[PAD]": 66,
+  "[UNK]": 65,
+  "|": 0,
+  "ก": 1,
+  "ข": 2,
+  "ค": 3,
+  "ฆ": 4,
+  "ง": 5,
+  "จ": 6,
+  "ฉ": 7,
+  "ช": 8,
+  "ซ": 9,
+  "ฌ": 10,
+  "ญ": 11,
+  "ฎ": 12,
+  "ฏ": 13,
+  "ฐ": 14,
+  "ฑ": 15,
+  "ฒ": 16,
+  "ณ": 17,
+  "ด": 18,
+  "ต": 19,
+  "ถ": 20,
+  "ท": 21,
+  "ธ": 22,
+  "น": 23,
+  "บ": 24,
+  "ป": 25,
+  "ผ": 26,
+  "ฝ": 27,
+  "พ": 28,
+  "ฟ": 29,
+  "ภ": 30,
+  "ม": 31,
+  "ย": 32,
+  "ร": 33,
+  "ฤ": 34,
+  "ล": 35,
+  "ว": 36,
+  "ศ": 37,
+  "ษ": 38,
+  "ส": 39,
+  "ห": 40,
+  "ฬ": 41,
+  "อ": 42,
+  "ฮ": 43,
+  "ะ": 44,
+  "ั": 45,
+  "า": 46,
+  "ำ": 47,
+  "ิ": 48,
+  "ี": 49,
+  "ึ": 50,
+  "ื": 51,
+  "ุ": 52,
+  "ู": 53,
+  "เ": 54,
+  "แ": 55,
+  "โ": 56,
+  "ใ": 57,
+  "ไ": 58,
+  "็": 59,
+  "่": 60,
+  "้": 61,
+  "๊": 62,
+  "๋": 63,
+  "์": 64
+}