Яндекс представил обновление голосового помощника Алиса AIi: теперь он умеет распознавать рукописный текст с фотографий — от студенческих конспектов до врачебных рецептов. Возможность появилась благодаря новой VLM-модели (vision-language model, модель, объединяющая распознавание изображений и текста).
Чтобы продемонстрировать возможности технологии, в Москве появились плакаты, на которых буквы «И», «ш», «л» и «м» написаны физически одинаково и слипаются в сплошную волну — различить их человеку можно только по смыслу фразы. Алиса AI при этом выдаёт с фото корректно распознанный текст даже на такой слитной скорописи.
- В Москве размещены рекламные плакаты с текстом, где буквы «И», «ш», «л» и «м» написаны одинаково и сливаются в сплошную линию — прочитать их можно только исходя из контекста фразы
- Алиса AI распознаёт такой текст с фотографии и выдаёт нормальный, читаемый результат
- Функция реализована на базе новой VLM-модели
- Заявленные сценарии использования: расшифровка конспектов лекций и рецептов от врача
- Автор одного из постов иронично предлагает протестировать функцию на реальном врачебном рецепте как более сложный челлендж
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖