Фільтри Блума (12 бітів на слово) на 8.62 млн словоформ, приписаних мовам за відносною частотою в корпусах, плюс транслітерований шар для 11 мов. signals.json: характерні літери, закінчення й триграми, обчислені з тих самих корпусів. Джерела: ВЕСУМ (brown-uk/dict_uk), GrammarDB (Belarus/GrammarDB), корпуси Leipzig Wortschatz, дампи Вікіпедії, FrequencyWords (OpenSubtitles). Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
10 lines
391 B
JSON
10 lines
391 B
JSON
{
|
|
"name": "cyrillic-lang-data",
|
|
"version": "1.0.0",
|
|
"description": "Фільтри Блума на 8.6 млн словоформ 36 кириличних мов + таблиці літер, закінчень і триграм. Дані для ru-detector-v2.",
|
|
"type": "module",
|
|
"main": "index.js",
|
|
"license": "CC-BY-SA-4.0",
|
|
"files": ["index.js", "signals.json", "filters"]
|
|
}
|