Запуск Last Translation Benchmark для оценки качества перевода
̶@izolenta_mebiusaAI-инженер
4 днРазработчики собирают сложный бенчмарк для проверки качества машинного перевода, приглашая сообщество к участию в создании датасета.
Создание более точных инструментов для оценки качества нейросетевого перевода.
- Помогает выявить реальные пределы возможностей современных языковых моделей.
- Позволяет разработчикам лучше понимать слабые места в переводе редких или сложных языковых конструкций.
- Создает открытый стандарт для сравнения качества различных AI-систем.
Мои знакомые сейчас собирают "Last Translation Benchmark" — заведомо сложный бенчмарк задач перевода. Сложность проверяется следующим образом: каждый пример прогоняется через десяток моделей, и нужно, чтобы не более пары из них дали правильный перевод. Языки могут быть какие угодно.
Если у вас есть примеры таких сложных текстов для языков, с которыми вы работаете, предлагаю туда их загнать) Если добавить 10+ примеров в ближайшие пару недель, можно стать соавтором статьи про этот бенчмарк — ну и заодно привлечь к языку немножко внимания.
https://last-translation-benchmark.vilda.net/
Кратко (AI)
Разработчики создают Last Translation Benchmark — набор данных для тестирования нейросетей, состоящий из задач перевода, с которыми справляются не более двух моделей из десяти. Авторы приглашают специалистов присылать сложные примеры текстов, предлагая соавторство в будущей статье за вклад в развитие бенчмарка.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖