Выпущен мультиязычный датасет на 22 языках народов России
Б@boris_againAI-инженер
1 месАвтор опубликовал датасет из 22 языков народов России, основанный на переводах книги «Маленький принц» и выверенный с помощью ИИ и носителей.
🔺 Сделал датасет
Выложил небольшой датасет на языках России.
🟢 22 языка: алтайский, башкирский, бурятский, горномарийский, дигорский, кабардино-черкесский, калмыцкий, карачаево-балкарский, коми, кубачинский, марийский (луговой), мокшанский, орокский, осетинский (иронский), русский, татарский, удмуртский, хакасский, чувашский, чукотский, эрзянский, якутский.
🟢 По 1565 предложений в каждом.
🟢 Сделан по всем редакциям Маленького принца, которые собирали последние несколько лет + 3 новые (чукотский, карачаево-балкарский и дигорский).
🟢 Выравнивалось вручную при помощи lingtrain-aligner. Выверялось и корректировалось при помощи Fable. Посмотрели несколько редакций с носителями, одобряют.
🟢 В некоторых редакциях предложений не хватало, такие предложения были допереведены Fable на основе имеющейся лексики и помечены в отдельных колонках. Также была исправлена пунктуация на концах предложений для единообразия.
Даёшь больше языковых датасетов!
👉 HF
@doomgrad
Кратко (AI)
Опубликован новый датасет, включающий тексты на 22 языках народов России, подготовленный на основе различных переводов книги «Маленький принц». Для выравнивания и проверки данных использовались инструмент lingtrain-aligner и модель Fable, а также помощь носителей языков.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖