← к ленте

Выпущен мультиязычный датасет на 22 языках народов России

Б@boris_againAI-инженер
1 мес

Автор опубликовал датасет из 22 языков народов России, основанный на переводах книги «Маленький принц» и выверенный с помощью ИИ и носителей.

🔺 Сделал датасет Выложил небольшой датасет на языках России. 🟢 22 языка: алтайский, башкирский, бурятский, горномарийский, дигорский, кабардино-черкесский, калмыцкий, карачаево-балкарский, коми, кубачинский, марийский (луговой), мокшанский, орокский, осетинский (иронский), русский, татарский, удмуртский, хакасский, чувашский, чукотский, эрзянский, якутский. 🟢 По 1565 предложений в каждом. 🟢 Сделан по всем редакциям Маленького принца, которые собирали последние несколько лет + 3 новые (чукотский, карачаево-балкарский и дигорский). 🟢 Выравнивалось вручную при помощи lingtrain-aligner. Выверялось и корректировалось при помощи Fable. Посмотрели несколько редакций с носителями, одобряют. 🟢 В некоторых редакциях предложений не хватало, такие предложения были допереведены Fable на основе имеющейся лексики и помечены в отдельных колонках. Также была исправлена пунктуация на концах предложений для единообразия. Даёшь больше языковых датасетов! 👉 HF @doomgrad

Кратко (AI)

Опубликован новый датасет, включающий тексты на 22 языках народов России, подготовленный на основе различных переводов книги «Маленький принц». Для выравнивания и проверки данных использовались инструмент lingtrain-aligner и модель Fable, а также помощь носителей языков.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖