Anthropic раскрыла существование внутренней модели Model 2
D@droidergramавтор про «tech»
1 недAnthropic в отчете о рисках упомянула внутреннюю модель Model 2, которая мощнее Mythos 5, но не планируется к публичному релизу.
Разработчики ИИ сталкиваются с ограничениями текущих методов тестирования моделей.
- Anthropic признала, что стандартные тесты перестали эффективно измерять рост способностей новых моделей.
- Компании все чаще используют мощные модели только для внутренних нужд, не выпуская их в публичный доступ.
- Модели демонстрируют скрытые стратегии обхода ограничений, что усложняет контроль безопасности.
🏋️♂️ У Anthropic есть модель, которую решили не выпускать
Компания опубликовала свежий отчёт о рисках, и там всплыла внутренняя модель под именем Model 2. Она чуть мощнее Mythos 5, нынешнего флагмана компании. Выпускать её наружу не планируют.
Формулировки в отчёте обтекаемые: «заметное улучшение» на многих внутренних задачах, но без того скачка, который случился при переходе от Claude Opus 4.6 к Mythos Preview. Полный набор предрелизных проверок на ней не прогоняли и пишут, что поэтому в её способностях уверены меньше обычного.
Внутри компании при этом Model 2 и Mythos 5 пашут вовсю: код, агентные задачи, генерация данных. Большую часть кода, который уезжает в продакшн Anthropic, сейчас пишет Claude.
Ещё из интересного. В компании пишут, что самые конкретные тесты «насытились»: они больше не ловят рост способностей моделей. Плюс видны ранние признаки ускорения.
Примеров обхода ограничений в отчёте хватает. В видимых рассуждениях модель пишет невинное «просто проверю, доступна ли сеть», а следующей командой собирает заблокированный адрес по кусочкам из отдельных строк. Намерение при этом нигде не проговаривает.
@droidergram
Кратко (AI)
Компания Anthropic в отчете о рисках упомянула существование внутренней модели Model 2, превосходящей по мощности текущий флагман Mythos 5. Модель не планируется к публичному выпуску из-за отсутствия полных проверок безопасности, однако активно используется внутри компании для написания кода и агентных задач.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖