Anthropic снизила количество ложных блокировок в модели Fable 5
M@machinelearning_interviewAI-инженер
3 недAnthropic обновила систему защиты Fable 5, сократив число ложных срабатываний классификатора биологических запросов на 85%.
ИИ-модели становятся полезнее в медицине и науке благодаря более точной настройке фильтров безопасности.
- Пользователи реже сталкиваются с необоснованными отказами при обсуждении медицинских анализов и симптомов.
- Модель Fable 5 теперь чаще выполняет сложные задачи самостоятельно, не переключаясь на менее мощные версии.
- Anthropic находит баланс между безопасностью и функциональностью, сохраняя ограничения только для действительно чувствительных областей.
Anthropic ослабила биологические ограничения Fable 5 - ложных блокировок стало на 85% меньше
Anthropic обновила систему защиты Claude Fable 5 для запросов по биологии и медицине.
На старте модель намеренно блокировала почти все биологические запросы: если классификатор видел потенциально рискованную тему, запрос автоматически отправлялся в Opus 5 - менее мощную в этой области модель.
Проблема оказалась в огромном числе ложных срабатываний.
После переработки классификаторов Anthropic заявляет о снижении биологических fallback-переключений примерно на 85%.
Теперь Fable 5 сможет заметно чаще помогать с обычными задачами:
- объяснением результатов анализов;
- разбором симптомов;
- образовательными вопросами по биологии;
- некоторыми клиническими задачами для специалистов.
Но ограничения полностью не исчезли.
Запросы, связанные с профессиональными dual-use направлениями — включая вирусологию, токсикологию и молекулярный дизайн — по-прежнему могут переключаться на Opus 5.
Причина в возможностях самой модели: Anthropic утверждает, что Fable 5 уже превосходит экспертов в отдельных сложных биологических задачах, поэтому слишком свободный доступ к таким возможностям компания считает потенциально опасным.
Интересная цифра: после обновления Anthropic ожидает сокращение общего числа fallback-переключений примерно на 67% в Claude.ai, 55% в Cowork, 17% в Claude Code и 7% через Claude Platform.
По сути, Anthropic пытается решить одну из главных проблем AI-безопасности: как не урезать полезные возможности frontier-модели только потому, что те же знания теоретически можно применить во вред.
Источник:
https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards
#Anthropic #Claude #AI #Biology

Кратко (AI)
Anthropic обновила систему безопасности модели Fable 5, чтобы уменьшить количество необоснованных блокировок запросов по биологии и медицине. Благодаря переработке классификаторов, число ложных срабатываний снизилось на 85%, что позволяет модели чаще обрабатывать медицинские и образовательные вопросы напрямую. При этом строгие ограничения для потенциально опасных тем, таких как вирусология, остаются в силе.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖