reasoningСбросить фильтр ×

STARM: маленькая рекурсивная модель обошла LLM в тысячи раз крупнее

Разработчики (по данным канала Сергея Маркова и Mashkka про Data Science) представили STARMi — фреймворк для обучения специализированных рекурсивных reasoning-моделей. Вместо увеличения размера модели, данных и времени обучения, крошечная сеть десятки раз возвращается к собственному черновику ответа и переписывает его, пока решение не сойдётся — принцип «думать дольше, а не знать больше».

В результате модель с 13M параметров решает алгоритмические задачи, на которых ошибаются LLM в тысячи раз крупнее, при этом запускается на одной видеокарте или даже на CPU. Подход применим к любым тьюринг-полным задачам с формальной постановкой — там, где обычные декодерные трансформеры, включая работающие в режиме ризонинга, справляются плохо.

13Mпараметров у модели STARM

Полный разбор →

DeepSeek V4 Pro получил прирост производительности через J-Space

1 нед
🚀 DeepSeek V4 Pro внезапно стал заметно сильнее - без переобучения модели К DeepSeek V4 Pro 0813 подключили harness под названием J-Space, который снижает ошибки в длинных цепочках reasoning и tool use. По опубликованным результатам прирост местами очень серьёзный: * Terminal Bench: 87.9 → 90.1 * NL2Repo: 61.5 → 73.4 * CyberGym: 83.3 → 86.8 * DeepSWE: 62.7 → 72.0 * Toolathlon: 74.1 → 79.5 В ряде agentic/coding тестов такая связка якобы обходит даже Fable 5 и Opus 4.8. https://github.com/Tiger3807861189/DeepSeek-V4-J-Space-Capability-Realization-Report
DeepSeek V4 Pro получил прирост производительности через J-Space

Исследователи заподозрили Kimi в обучении на скрытых рассуждениях Claude

2 нед
Исследователи заподозрили Kimi в обучении на скрытых рассуждениях Claude

XYZ-Aquila-mini: компактная reasoning-модель для глубокого веб-поиска

1 мес
XYZ-Aquila-mini: компактная reasoning-модель для глубокого веб-поиска

Влияние 2-битной квантизации на поведение reasoning-моделей

К@quant_prune_distillAI-инженер
1 мес

Влияние квантования на логические способности моделей

К@quant_prune_distillAI-инженер
1 мес
Extreme Low-Bit Inference in Reasoning Models: Failure Modes and Targeted Recovery 📄 Статья 💻 Код Вдогонку про влияние квантизации на ризонинг. Ребята из Brain Lab выпустили интересное исследование, показывающее, как ломается ризонинг у квантизованных моделей, а также пару стратегий, помогающих предотвратить зацикливание генерации.

Обзор методов RL: Prefix-RL, MaxRL и DR Tulu

Д@stuffyNLPAI-инженер
1 мес

Исследование методов обучения reasoning-моделей

1 мес

Релиз модели Qwen3.6-34B-80L-Fable-5-Heretic

Н@GreenNeuralRobotsAI-инженер
1 мес
Qwen3.6-34B-80L-Fable-5-Heretic Продолжаем парад дистилляций Fable-5 основана на Qwen3.6-27B, снята цензура. Фокус на агентные сценарии и сложные логические цепочки • 34B параметров, 80 слоев рассуждения • дистилляция из Fable-5 Agentic Traces • дообучение на 4665 CoT-траекториях через QLoRA • формат 4-bit NF4, rank=64 GGUF #reasoning #gguf

Это всё на сейчас.