NER-анотація українського корпусу
July 30, 2026 · View on GitHub
Опис даних
Це друга версія українського NER корпусу. Дані першої версії та документацію ви можете знайти тут
Корпус розмічених даних знаходиться в папці v2.0/data.
Всього в корпусі:
- 560 текстів (train: 391, test: 169)
- 21_993 сутностей NER
- 13 типів сутностей
| NashiGroshi | Bruk | Total | |
|---|---|---|---|
| ART | 319 | 316 | 635 |
| DATE | 1496 | 551 | 2047 |
| DOC | 108 | 34 | 142 |
| JOB | 1344 | 638 | 1982 |
| LOC | 1380 | 1620 | 3000 |
| MISC | 102 | 413 | 515 |
| MON | 897 | 46 | 943 |
| ORG | 4431 | 782 | 5213 |
| PCT | 186 | 77 | 263 |
| PERIOD | 341 | 255 | 596 |
| PERS | 1820 | 4415 | 6235 |
| QUANT | 276 | 106 | 382 |
| TIME | 4 | 36 | 40 |
| Total | 12704 | 9289 | 21993 |
Первинним джерелом даних є відкритий корпус українських текстів (папка bruk) та тексти видання «Наші гроші» (папка ng). Для кожного обробленого тексту з корпусу наявні два файли:
- файл з розширенням
txtмістить токенізовану версію тексту - файл з розширенням
annмістить NER-анотації до цього тексту у форматі Brat Standoff Format (кожний рядок файлу містить 3 записи, розділені табуляцією: номер анотації, початковий і кінцевий індекс в тексті — у даному випадку, токенізованому — через пробіл, текст сутності)
Анотація виконана принаймні двома анотаторами на кожний текст за наступними правилами, розбіжності в результатах виправлені третім редактором.
Для тренування і валідації моделей рекомендовано використовувати Стандартне розбиття на DEV і TEST набори.
Ми надаємо сконвертовані у формат IOB дані з використанням стандартного розбиття. Під час цієї конвертації ми прибрали вкладені теги.
Репозиторій також містить скрипти для конвертації даних у інші формати.
Як цитувати
Якщо ви використовуєте NER-UK: Ukrainian named-entity corpus, будь ласка, процитуйте статтю, а не посилання на репозиторій — це єдиний спосіб, у який внесок стає видимим у наукометрії.
Chaplynskyi, D. and Romanyshyn, M. (2024). Introducing NER-UK 2.0: A Rich Corpus of Named Entities for Ukrainian. In Proceedings of the Third Ukrainian Natural Language Processing Workshop (UNLP) @ LREC-COLING 2024, pages 23–29. ELRA and ICCL. https://doi.org/10.63317/5mqwb7ftiezv
@inproceedings{chaplynskyi-romanyshyn-2024-introducing,
title = "Introducing {NER}-{UK} 2.0: A Rich Corpus of Named Entities for {U}krainian",
author = "Chaplynskyi, Dmytro and
Romanyshyn, Mariana",
editor = "Romanyshyn, Mariana and
Romanyshyn, Nataliia and
Hlybovets, Andrii and
Ignatenko, Oleksii",
booktitle = "Proceedings of the Third Ukrainian Natural Language Processing Workshop (UNLP) @ LREC-COLING 2024",
month = may,
year = "2024",
address = "Torino, Italia",
publisher = "ELRA and ICCL",
url = "https://aclanthology.org/2024.unlp-1.4/",
doi = "10.63317/5mqwb7ftiezv",
pages = "23--29",
ISBN = "978-2-493814-43-2"
}
Ліцензія
Ці дані доступні для використання згідно умов ліцензії "Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License"

"Корпус NER-анотацій українських текстів" by lang-uk is licensed under a Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International License.
Based on a work at https://github.com/lang-uk/ner-uk.