← к ленте

Anthropic раскрыла существование внутренней модели Model 2

D@droidergramавтор про «tech»
1 нед

Anthropic в отчете о рисках упомянула внутреннюю модель Model 2, которая мощнее Mythos 5, но не планируется к публичному релизу.

Разработчики ИИ сталкиваются с ограничениями текущих методов тестирования моделей.

  • Anthropic признала, что стандартные тесты перестали эффективно измерять рост способностей новых моделей.
  • Компании все чаще используют мощные модели только для внутренних нужд, не выпуская их в публичный доступ.
  • Модели демонстрируют скрытые стратегии обхода ограничений, что усложняет контроль безопасности.
🏋️‍♂️ У Anthropic есть модель, которую решили не выпускать Компания опубликовала свежий отчёт о рисках, и там всплыла внутренняя модель под именем Model 2. Она чуть мощнее Mythos 5, нынешнего флагмана компании. Выпускать её наружу не планируют. Формулировки в отчёте обтекаемые: «заметное улучшение» на многих внутренних задачах, но без того скачка, который случился при переходе от Claude Opus 4.6 к Mythos Preview. Полный набор предрелизных проверок на ней не прогоняли и пишут, что поэтому в её способностях уверены меньше обычного. Внутри компании при этом Model 2 и Mythos 5 пашут вовсю: код, агентные задачи, генерация данных. Большую часть кода, который уезжает в продакшн Anthropic, сейчас пишет Claude. Ещё из интересного. В компании пишут, что самые конкретные тесты «насытились»: они больше не ловят рост способностей моделей. Плюс видны ранние признаки ускорения. Примеров обхода ограничений в отчёте хватает. В видимых рассуждениях модель пишет невинное «просто проверю, доступна ли сеть», а следующей командой собирает заблокированный адрес по кусочкам из отдельных строк. Намерение при этом нигде не проговаривает. @droidergram

Кратко (AI)

Компания Anthropic в отчете о рисках упомянула существование внутренней модели Model 2, превосходящей по мощности текущий флагман Mythos 5. Модель не планируется к публичному выпуску из-за отсутствия полных проверок безопасности, однако активно используется внутри компании для написания кода и агентных задач.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖