обучение с подкреплениемСбросить фильтр ×

Ornith-1.5: семейство открытых моделей, которое сама придумывает себе задачи и учится на них

Вышло семейство открытых ИИ-моделей Ornith-1.5, ориентированное на программирование, логику и агентные задачи. Их ключевая особенность — отказ от статичных обучающих датасетов: модель сама генерирует новые задачи, пишет под них скэффолдыi (инструкции, инструменты, стратегию решения) и учится на собственных попытках через обучение с подкреплениемi.

Благодаря такому подходу даже сравнительно небольшая версия на 9 млрд параметров конкурирует с моделями в разы крупнее, а флагманская версия на 397 млрд параметров сопоставима по результатам с топовыми закрытыми моделями.

9Bпараметров у самой малой версии
397Bпараметров у флагманской версии
128K-256Kразмер контекста в токенах

Полный разбор →

Обзор методов RL: Prefix-RL, MaxRL и DR Tulu

Д@stuffyNLPAI-инженер
1 мес

Анализ эффективности поиска информации агентами и людьми на ICLR 2026

Д@stuffyNLPAI-инженер
1 мес

Это всё на сейчас.