Дані
Відкриті дані на вході, відкриті дані на виході. Базу, на якій працює сайт, можна вільно завантажити й використовувати.
Словникова база Krumeto — це адаптація Wiktionary, Tatoeba, Open English WordNet, профілів CEFR-J та Octanove, wordfreq і CMUdict. Оскільки Wiktionary поширюється за CC BY-SA, наша зібрана база опублікована за тією самою ліцензією: Creative Commons Attribution-ShareAlike 4.0.
Завантаження
Дамп створює команда make dump у репозиторії, і він публікується з кожним випуском даних. Якщо посилання тут ще немає, перший публічний випуск ще не завантажено; напишіть нам, і ми його надішлемо.
Що всередині
| Статті (лема × частина мови) | 792 736 |
|---|---|
| Значення | 1 071 598 |
| Переклади | 997 347 |
| Словоформи | 1 038 342 |
| Речення (усі мови) | 5 577 551 |
| Позиції лем у реченнях | 15 510 714 |
| Синсети WordNet | 120 630 |
| Зібрано | 2026-09-28 |
JSON для кожного слова
Кожне слово також доступне у форматі JSON за адресою /api/word/{word}, наприклад /api/word/decide. Кількість запитів обмежена, а у відповіді є повідомлення про ліцензію.
Як зазначати авторство
“Data from Krumeto (CC BY-SA 4.0), compiled from Wiktionary, Tatoeba, Open English WordNet, CEFR-J/Octanove, wordfreq and CMUdict.”
Рядок для зазначення авторства наведено англійською, його можна копіювати без змін. Показуючи речення з Tatoeba, будь ласка, зберігайте імена їхніх авторів.