ИИ

Опыт использования Fable 5 и оркестратора soerdev

S@softwareengineervlogAI-инженер
1 мес

Исследование: LLM снижают точность ответов, но повышают уверенность пользователей

Учёные из трёх ведущих университетов провели эксперимент: участникам задавали сложные вопросы (в том числе о деталях фильмов) и разрешали в любой момент ответить «не знаю». Одной группе давали доступ к языковой модели Step 3.5 Flashi — по данным источников, она справлялась с этими вопросами хуже всех.

Результат: с помощью LLMi люди отвечали на больше вопросов, но точность резко упала, а уверенность в своих (часто неверных) ответах выросла. Модель не заполняла пробелы в знаниях, а превращала верные интуитивные догадки и восстанавливаемые из памяти ответы в ошибки.

ВыводПо данным @kyrillic: точность ответов упала с 28% до 9%, уверенность выросла с 30% до 76%

28% → 9%точность ответов без/с LLM (по @kyrillic)
30% → 76%уверенность в ответах без/с LLM
40% → 3-6%доля ответов «не знаю» без/с LLM

Полный разбор →

Квантизованные reasoning-модели «переосмысливают» ответы — и это можно вылечить занижением 50 токенов

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 1 мес назад

Команда из Meta исследовала, почему квантизованные reasoning-модели теряют в качестве сильнее, чем модели, квантизованные для обычных задач. Оказалось, что дело не только в потере точности вычислений, а в специфическом эффекте overthinkingi: модель зацикливается в рассуждениях и даже получив верный ответ на промежуточном шаге, в итоге выдаёт другой, ошибочный.

Авторы нашли простой и эффективный способ борьбы с этим: заниженные логиты для 50 вручную отобранных «overthinking-токенов» (вроде «Wait», «But», «Alternatively») одновременно сокращают длину ответа и повышают качество — важный практический результат для тех, кто использует квантизацию reasoning-моделей в проде.

ВыводРассмотрены варианты квантизации: weight-only AWQ и GPTQ в 3 и 4 бита, а также weight+activation+KV-cache квантизация в 4 и 8 бит через FlatQuant

5–15%прирост качества после занижения логитов
10–20%сокращение длины ризонинга
50число вручную отобранных overthinking-токенов

Полный разбор →

Как Алекс Либерман использует Claude для создания контента

K@karpovaventuresавтор про «startups»
1 мес

Разработчик опубликовал Claudexor — открытый инструмент для объединения Claude Code, Codex и Cursor

Автор (публикуется одинаково в каналах AbstractDL и Love. Death. Transformers., 20 июля 2026) выложил в открытый доступ Claudexor — харнесс-агностикi CLI, приложение, набор плагинов и MCPi-сервер, который объединяет в одном инструменте Claude Code, Codex и Cursor. Можно подключать произвольное число харнессов и подписок, а система сама распределяет между ними нагрузку.

Главная идея — использовать все харнессы одновременно, а не переключаться между ними вручную, когда у одного из агентов заканчиваются лимиты. За счёт объединения нескольких подписок Claude Code, Codex и Cursor автор снизил свои расходы на токены с $15k до $1200 в месяц.

$15kпрежние расходы на токены в месяц
$1200новые расходы после объединения подписок
триподписки Claude Code, Codex и Cursor у автора

Полный разбор →

Экономика frontier-моделей: почему Anthropic в уязвимой позиции

A@ai_productAI-инженер
1 мес

Особенности работы лимитов в Codex

С@seeallochnayaAI-инженер
1 мес

Moonshot AI приостановила подписки на Kimi K3 из-за нехватки GPU

Китайская Moonshot AIi временно закрыла оформление новых подписок на свою ИИ-модель Kimi K3 — спрос за двое суток исчерпал все доступные GPU-мощности компании. Уже действующие подписчики продолжают пользоваться сервисом без изменений и получают приоритет по вычислениям, а новые слоты будут открываться постепенно, по мере расширения инфраструктуры.

Случай примечателен тем, что компания отказалась от новых денег ради качества сервиса для текущих клиентов — редкий для индустрии шаг. Одновременно вокруг модели разворачивается более широкий сюжет: Kimi K3 показывает сильные результаты на бенчмарках и уже привлекла внимание на уровне регуляторов США.

48 часовза это время исчерпаны GPU-мощности
27 июлядата обещанной публикации полных весов K3

Полный разбор →

Почему стоит избегать OpenCode: проблемы с расходами и безопасностью

A@ai_productAI-инженер
1 мес

Создание анимационного подарка с помощью нейросетей

М@cgeventAI-инженер
1 мес

Главные новости ИИ и технологий за 3 дня

И@AImademydayAI-инженер
1 мес

Управление ИИ через жесты AirPods

Ч@honestmarketingмедиа / агрегатор
1 мес
Ничего необычного, просто софт, который позволяет «хлестать» ИИ с помощью AirPods. Он отслеживает движение наушника и повторяет на экране. Таким образом можно подгонять Claude и ChatGPT, когда они долго пишут код и вам скучно... 🎳

Moonshot AI планирует IPO в Гонконге

v@vcnewsмедиа / агрегатор
1 мес
Китайская Moonshot AI, разработчик модели Kimi K3, запланировала выйти на биржу в Гонконге в течение полугода, узнало Bloomberg. Пока же компания завершает раунд инвестиций при возможной оценке в $30 млрд, говорят источники vc.ru/ai/3036630

OpenAI представила GPT-5.5-Cyber для автоматизированного пентеста

C@cyberyozh_officialAI-инженер
1 мес
Ещё ↓