Планы по развитию инструментов оценки перевода и моделей для языков Кавказа
̶@izolenta_mebiusaAI-инженер
1 месАвтор делится планами по созданию лидерборда FLORES+, обучению модели оценки качества перевода для WMT2026 и разработке моделей для нахско-дагестанских языков.
Очень лениво заниматься абсолютно всем. То ли я выгорел, то ли вконец офранцузился, то ли просто начинаю стареть — так или иначе, браться за любую задачу максимально влом.
Тем не менее, есть три задачи, до которых, возможно, в ближайшие пару месяцев у меня дотянуться ручки:
1) Сделать лидерборд современных моделей по FLORES+, наподобие того, что мы недавно сделали для BOUQuET — чтобы для языков, добавленных во FLORES, но не вошедших в Букет, тоже была оценка наилучших доступных моделек.
2) Попробовать обучить свою COMET-подобную модельку для оценки качества перевода (настолько мультиязычную, насколько можно) и поучаствовать с ней в WMT2026.
3) Попробовать обучить хорошую базовую модель (хотя бы для перевода, а в идеале и для других задач) для нахско-дагестанских языков (чеченского, ингушского, лезгинского, даргинского, аварского).
Буду писать, что получилось, по мере прогресса)
Если есть желание как-то в этом поучаствовать, или просто дать какой-нибудь совет или просьбу, то пишите)
Кратко (AI)
Автор поста планирует заняться тремя проектами в области NLP: созданием лидерборда моделей по бенчмарку FLORES+, разработкой собственной модели оценки качества перевода для участия в WMT2026 и созданием базовых моделей для нахско-дагестанских языков. Он приглашает сообщество к обсуждению и сотрудничеству.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖