С мая 2025 по апрель 2026 года фильтры Anthropic против биоугроз не работали для внешних подрядчиков, обучающих модели.
✔️
Фильтр Anthropic по биоугрозам был недоступен почти год
С мая 2025 по апрель 2026 года блокирующие классификаторы Anthropic не применялись к трафику внешних подрядчиков - тех, кто собирает обратную связь от людей для обучения моделей.
Эти классификаторы нужны, чтобы модель не выдавала опасных сведений о химическом и биологическом оружии.
За это время около 50 тысяч человек провели с моделями примерно 133 млн чатов. Благонадежность этих людей проверяли только сами подрядчики, а их процедуры, как признает Anthropic, часто были недостаточными.
Внутреннее расследование доказательств злоупотребления не нашло. Требования к подрядчикам компания после этого ужесточила.
О пробеле стало известно из
свежего отчета о рисках. (стр. 148)
Сам отчет оценил катастрофические риски моделей Anthropic как низкие по всем категориям, но написан заметно осторожнее
предыдущего: почти везде оценки либо подняты, либо идут с оговоркой о возросшей неопределенности - из-за недавних инцидентов и ранних признаков ускорения ИИ-прогресса.
Дарио Амодеи ранее называл разработку химического и биологического оружия с помощью ИИ более серьезной угрозой, чем кибератаки.
@ai_machinelearning_big_data
#news #ai #ml
Кратко (AI)
Компания Anthropic сообщила, что в течение почти года, с мая 2025 по апрель 2026 года, защитные фильтры против создания биологического и химического оружия не применялись к данным, поступающим от внешних подрядчиков. Несмотря на отсутствие доказательств злоупотреблений, компания ужесточила требования к проверке персонала после публикации отчета о рисках.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖