datasetСбросить фильтр ×

Разработка алгоритма для автоматического поиска фрагментов оргазма в видео

N@NeuralShitAI-инженер
6 ч

Запуск Last Translation Benchmark для оценки качества перевода

̶@izolenta_mebiusaAI-инженер
4 дн
Мои знакомые сейчас собирают "Last Translation Benchmark" — заведомо сложный бенчмарк задач перевода. Сложность проверяется следующим образом: каждый пример прогоняется через десяток моделей, и нужно, чтобы не более пары из них дали правильный перевод. Языки могут быть какие угодно. Если у вас есть примеры таких сложных текстов для языков, с которыми вы работаете, предлагаю туда их загнать) Если добавить 10+ примеров в ближайшие пару недель, можно стать соавтором статьи про этот бенчмарк — ну и заодно привлечь к языку немножко внимания. https://last-translation-benchmark.vilda.net/

В России готовят ИИ-бенчмарк на «духовность и нравственность»: Яндекс опровергает авторство концепции

В России обсуждают создание специальных тестов (бенчмаркiов) для проверки языковых моделей на соответствие духовно-нравственным ориентирам и традиционным ценностям — перед их внедрением в поисковики, образовательные сервисы и умные устройства.

По данным PRO Hi-Tech, концепцию национального датасета для такого тестирования представил «Яндекс» — правительственной рабочей группе. Однако позже, как сообщает Код.ру, «Яндекс» опроверг, что представлял эту концепцию — источники противоречат друг другу в вопросе авторства инициативы.

Полный разбор →

Т-Технологии представили на ACM KDD 2026 техрепорт о датасете T-ECD и разослали его вузам

Исследователи из Т-Технологий выступили на конференции ACM KDD 2026i (9–13 августа, Южная Корея) с техрепортом о T-ECDi — одном из крупнейших в мире открытых обезличенных датасетов пользовательских взаимодействий для рекомендательных систем. Сам датасет был выложен в открытый доступ ещё осенью прошлого года на Huggingface, а техрепорт впервые представили именно сейчас в основной программе конференции.

Прямо с конференции команда разослала датасет и гайд по работе с ним руководителям академических программ и профессорам крупнейших ИТ-вузов России. Это должно дать студентам возможность тренировать модели не на синтетических данных или устаревшем MovieLens, а на данных, приближенных к реальному бизнесу — область рекомендательных систем (рексисi) считается закрытой и труднодоступной для новичков.

135 млрдвзаимодействий в датасете T-ECD
5доменов электронной коммерции в датасете
8×H100максимальная GPU-конфигурация в гайде

Полный разбор →

Открытый корпус выразительной русской речи Dialogs принят на Interspeech 2026

Илья Латышев и Борис (автор канала «Борис опять») подготовили статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В основе статьи — открытый студийный корпус выразительной русской разговорной речи объёмом 20 часов, записанный тремя профессиональными актёрами театра с разметкой эмоций.

Особенность корпуса — актёры записывали диалоги, сидя друг напротив друга и видя мимику и жесты партнёра, хотя текст реплик был заранее подготовлен (scriptedi). Такой подход сделал речь заметно более естественной и эмоциональной по сравнению с записью дикторов по одному. Корпус предназначен в первую очередь для файнтюна моделей синтеза речи (TTSi) и распространяется по открытой лицензии для исследований.

20 часовобъём записанного корпуса
3профессиональных диктора-актёра

Полный разбор →

Выпущен мультиязычный датасет на 22 языках народов России

Б@boris_againAI-инженер
1 мес

Статья о русском речевом корпусе Dialogs принята на Interspeech 2026

Команда с Ильёй Латышевым подготовила статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В статье представлен открытый студийный корпусi выразительной русской разговорной речи, предназначенный в первую очередь для файнтюнiа моделей синтеза речи.

Особенность корпуса — способ записи диалогов: два актёра театра сидели друг напротив друга и читали заранее подготовленные реплики, видя мимику, жесты и эмоциональную реакцию собеседника, что сделало речь заметно более естественной и выразительной по сравнению с изолированной записью каждого диктора.

20 часовобъём речевого корпуса
3количество дикторов-актёров

Полный разбор →

Автор датасета поссорился с Хабром из-за претензионного письма, но после второго обращения закрыл доступ

9 июля 2026 года автор некоего датасетiа (данные, судя по всему, собраны с Хабрiа) получил претензионное письмо от площадки и публично разозлился: назвал Хабр в грубой форме, призвал не писать туда и не читать его, а также объявил, что не закроет датасет, пока ему не пришлют «нормальное письмо». Пост с этим текстом почти одновременно разошёлся по нескольким Telegram-каналам.

10 июля автор сообщил, что пришло новое, повторное письмо — на этот раз написанное юристами, вежливое и разумное по тону. После этого он полностью закрыл датасет.

Полный разбор →

Это всё на сейчас.