Данные
Открытые данные на входе, открытые данные на выходе. Базу, на которой работает сайт, можно свободно скачать и использовать.
Словарная база Krumeto — это адаптация Wiktionary, Tatoeba, Open English WordNet, профилей CEFR-J и Octanove, wordfreq и CMUdict. Поскольку Wiktionary распространяется по CC BY-SA, наша собранная база опубликована по той же лицензии: Creative Commons Attribution-ShareAlike 4.0.
Скачать
Дамп создаёт команда make dump в репозитории, и он публикуется с каждым выпуском данных. Если ссылки здесь ещё нет, первый публичный выпуск ещё не загружен; напишите нам, и мы его пришлём.
Что внутри
| Статьи (лемма × часть речи) | 792 736 |
|---|---|
| Значения | 1 071 598 |
| Переводы | 997 347 |
| Словоформы | 1 038 342 |
| Предложения (все языки) | 5 577 551 |
| Позиции лемм в предложениях | 15 510 714 |
| Синсеты WordNet | 120 630 |
| Собрано | 2026-09-28 |
JSON для каждого слова
Каждое слово также доступно в формате JSON по адресу /api/word/{word}, например /api/word/decide. Число запросов ограничено, а в ответе есть уведомление о лицензии.
Как указывать авторство
“Data from Krumeto (CC BY-SA 4.0), compiled from Wiktionary, Tatoeba, Open English WordNet, CEFR-J/Octanove, wordfreq and CMUdict.”
Строка для указания авторства приведена по-английски, её можно копировать без изменений. Показывая предложения из Tatoeba, пожалуйста, сохраняйте имена их авторов.