Запуск Last Translation Benchmark для оценки качества перевода
В России готовят ИИ-бенчмарк на «духовность и нравственность»: Яндекс опровергает авторство концепции
В России обсуждают создание специальных тестов (бенчмаркiов) для проверки языковых моделей на соответствие духовно-нравственным ориентирам и традиционным ценностям — перед их внедрением в поисковики, образовательные сервисы и умные устройства.
По данным PRO Hi-Tech, концепцию национального датасета для такого тестирования представил «Яндекс» — правительственной рабочей группе. Однако позже, как сообщает Код.ру, «Яндекс» опроверг, что представлял эту концепцию — источники противоречат друг другу в вопросе авторства инициативы.
Т-Технологии представили на ACM KDD 2026 техрепорт о датасете T-ECD и разослали его вузам
Исследователи из Т-Технологий выступили на конференции ACM KDD 2026i (9–13 августа, Южная Корея) с техрепортом о T-ECDi — одном из крупнейших в мире открытых обезличенных датасетов пользовательских взаимодействий для рекомендательных систем. Сам датасет был выложен в открытый доступ ещё осенью прошлого года на Huggingface, а техрепорт впервые представили именно сейчас в основной программе конференции.
Прямо с конференции команда разослала датасет и гайд по работе с ним руководителям академических программ и профессорам крупнейших ИТ-вузов России. Это должно дать студентам возможность тренировать модели не на синтетических данных или устаревшем MovieLens, а на данных, приближенных к реальному бизнесу — область рекомендательных систем (рексисi) считается закрытой и труднодоступной для новичков.
Открытый корпус выразительной русской речи Dialogs принят на Interspeech 2026
Илья Латышев и Борис (автор канала «Борис опять») подготовили статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В основе статьи — открытый студийный корпус выразительной русской разговорной речи объёмом 20 часов, записанный тремя профессиональными актёрами театра с разметкой эмоций.
Особенность корпуса — актёры записывали диалоги, сидя друг напротив друга и видя мимику и жесты партнёра, хотя текст реплик был заранее подготовлен (scriptedi). Такой подход сделал речь заметно более естественной и эмоциональной по сравнению с записью дикторов по одному. Корпус предназначен в первую очередь для файнтюна моделей синтеза речи (TTSi) и распространяется по открытой лицензии для исследований.
Выпущен мультиязычный датасет на 22 языках народов России
Статья о русском речевом корпусе Dialogs принята на Interspeech 2026
Команда с Ильёй Латышевым подготовила статью «Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants», которую приняли на конференцию Interspeech 2026i. В статье представлен открытый студийный корпусi выразительной русской разговорной речи, предназначенный в первую очередь для файнтюнiа моделей синтеза речи.
Особенность корпуса — способ записи диалогов: два актёра театра сидели друг напротив друга и читали заранее подготовленные реплики, видя мимику, жесты и эмоциональную реакцию собеседника, что сделало речь заметно более естественной и выразительной по сравнению с изолированной записью каждого диктора.
Автор датасета поссорился с Хабром из-за претензионного письма, но после второго обращения закрыл доступ
9 июля 2026 года автор некоего датасетiа (данные, судя по всему, собраны с Хабрiа) получил претензионное письмо от площадки и публично разозлился: назвал Хабр в грубой форме, призвал не писать туда и не читать его, а также объявил, что не закроет датасет, пока ему не пришлют «нормальное письмо». Пост с этим текстом почти одновременно разошёлся по нескольким Telegram-каналам.
10 июля автор сообщил, что пришло новое, повторное письмо — на этот раз написанное юристами, вежливое и разумное по тону. После этого он полностью закрыл датасет.
Это всё на сейчас.