rlСбросить фильтр ×

Запуск локальной студии для обучения RL-моделей

А@AGI_and_RLAI-инженер
3 дн
Запуск локальной студии для обучения RL-моделей

Проблемы train-inference mismatch в MoE моделях при RL

A@AIexTimeAI-инженер
3 дн

Перспективные направления для стартапов в сфере AI

C@chillhousetechAI-инженер
4 дн

Фазовый переход в использовании памяти: что это значит для AI

D@dealerAIAI-инженер
1 нед

Оптимизация рекомендательных систем через Reinforcement Learning

2 нед
Оптимизация рекомендательных систем через Reinforcement Learning

RE-GoT: эволюция вознаграждений через графы мыслей

T@kryak_startupAI-инженер
2 нед
RE-GoT: эволюция вознаграждений через графы мыслей

AI VK научили матричную факторизацию ALS планировать рекомендации через MCTS

Исследователи AI VK предложили добавить к классической матричной факторизации ALSi планирование на несколько шагов вперёд с помощью Monte Carlo Tree Search (MCTSi), а не просто выбирать top-K ближайших айтемов. Работа «Planning over Matrix-Factorization MDPs for Candidate Generation» принята на воркшопе Customer Journey в рамках KDD 2026.

Обычные рекомендательные системы на ALS не учитывают, как показ конкретного айтема изменит эмбеддинг пользователя и последующие выдачи. Новый подход представляет процесс рекомендаций как RL-среду и строит дерево возможных последовательностей показов, что даёт заметный прирост качества в офлайн-экспериментах на нескольких датасетах.

ВыводЗа основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK, где эмбеддинг пользователя пересчитывается после новых взаимодействий

1,5 разарост Recall@10 на VK-LSVD
4датасета в экспериментах

Полный разбор →

Релиз моделей Kimi k3 и Qwen 3.8 max: конкуренция с западными LLM

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

На рынке ИИ состоялись релизы новых китайских моделей Kimi k3 и Qwen 3.8 max. Эти разработки демонстрируют значительный прогресс в качестве генеративного ИИ, доказывая, что специализированные модели могут конкурировать с топовыми западными аналогами в решении прикладных задач.

Появление таких моделей меняет бизнес-ландшафт: компаниям больше не требуется использовать исключительно самые дорогие и мощные системы, так как качественное обучение с подкреплением (RLi) позволяет достигать высоких результатов на более доступных архитектурах.

3.8версия модели Qwen max

Полный разбор →

KnowAct-GUIClaw: инструмент для GUI-автоматизации

Н@GreenNeuralRobotsAI-инженер
1 мес
KnowAct-GUIClaw Инструмент для GUI-автоматизации с глубоким пониманием интерфейса. Решает проблему неточного клика и путаницы в динамичных UI • точная локализация элементов даже при сдвигах • действия по семантике, а не по координатам • работа с вложенными и перекрывающимися виджетами • адаптация к ресайзу и смене тем оформления Использует мультимодальное понимание экрана плюс RL-политику для выбора действий. Акцент на устойчивость к изменениям верстки. Гитхаб #computeruse #agent

Обзор методов RL: Prefix-RL, MaxRL и DR Tulu

Д@stuffyNLPAI-инженер
1 мес

Самообучение моделей через синтетические задачи: перспективы и риски

С@oulenspiegel_channelAI-инженер
1 мес

Qwen-AgentWorld: новая world model для агентных систем

D@dealerAIAI-инженер
1 мес

Это всё на сейчас.