← к ленте

Запуск Last Translation Benchmark для оценки качества перевода

̶@izolenta_mebiusaAI-инженер
4 дн

Разработчики собирают сложный бенчмарк для проверки качества машинного перевода, приглашая сообщество к участию в создании датасета.

Создание более точных инструментов для оценки качества нейросетевого перевода.

  • Помогает выявить реальные пределы возможностей современных языковых моделей.
  • Позволяет разработчикам лучше понимать слабые места в переводе редких или сложных языковых конструкций.
  • Создает открытый стандарт для сравнения качества различных AI-систем.
Мои знакомые сейчас собирают "Last Translation Benchmark" — заведомо сложный бенчмарк задач перевода. Сложность проверяется следующим образом: каждый пример прогоняется через десяток моделей, и нужно, чтобы не более пары из них дали правильный перевод. Языки могут быть какие угодно. Если у вас есть примеры таких сложных текстов для языков, с которыми вы работаете, предлагаю туда их загнать) Если добавить 10+ примеров в ближайшие пару недель, можно стать соавтором статьи про этот бенчмарк — ну и заодно привлечь к языку немножко внимания. https://last-translation-benchmark.vilda.net/

Кратко (AI)

Разработчики создают Last Translation Benchmark — набор данных для тестирования нейросетей, состоящий из задач перевода, с которыми справляются не более двух моделей из десяти. Авторы приглашают специалистов присылать сложные примеры текстов, предлагая соавторство в будущей статье за вклад в развитие бенчмарка.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖