← к ленте

Anthropic признала годовой сбой в работе фильтров биоугроз

1 нед

С мая 2025 по апрель 2026 года фильтры Anthropic против биоугроз не работали для внешних подрядчиков, обучающих модели.

Крупный разработчик ИИ допустил утечку контроля над безопасностью своих моделей при обучении.

  • Внешние подрядчики имели доступ к моделям без фильтров безопасности почти год.
  • Это ставит под вопрос надежность процессов обучения ИИ, когда к работе привлекаются сторонние компании.
  • Anthropic пересматривает свои протоколы безопасности из-за роста рисков и неопределенности в развитии технологий.
✔️ Фильтр Anthropic по биоугрозам был недоступен почти год С мая 2025 по апрель 2026 года блокирующие классификаторы Anthropic не применялись к трафику внешних подрядчиков - тех, кто собирает обратную связь от людей для обучения моделей.
Эти классификаторы нужны, чтобы модель не выдавала опасных сведений о химическом и биологическом оружии.
За это время около 50 тысяч человек провели с моделями примерно 133 млн чатов. Благонадежность этих людей проверяли только сами подрядчики, а их процедуры, как признает Anthropic, часто были недостаточными. Внутреннее расследование доказательств злоупотребления не нашло. Требования к подрядчикам компания после этого ужесточила. О пробеле стало известно из свежего отчета о рисках. (стр. 148) Сам отчет оценил катастрофические риски моделей Anthropic как низкие по всем категориям, но написан заметно осторожнее предыдущего: почти везде оценки либо подняты, либо идут с оговоркой о возросшей неопределенности - из-за недавних инцидентов и ранних признаков ускорения ИИ-прогресса.
Дарио Амодеи ранее называл разработку химического и биологического оружия с помощью ИИ более серьезной угрозой, чем кибератаки.
@ai_machinelearning_big_data #news #ai #ml
Anthropic признала годовой сбой в работе фильтров биоугроз

Кратко (AI)

Компания Anthropic сообщила, что в течение почти года, с мая 2025 по апрель 2026 года, защитные фильтры против создания биологического и химического оружия не применялись к данным, поступающим от внешних подрядчиков. Несмотря на отсутствие доказательств злоупотреблений, компания ужесточила требования к проверке персонала после публикации отчета о рисках.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖