✔️ Фильтр Anthropic по биоугрозам был недоступен почти год
С мая 2025 по апрель 2026 года блокирующие классификаторы Anthropic не применялись к трафику внешних подрядчиков - тех, кто собирает обратную связь от людей для обучения моделей.
За это время около 50 тысяч человек провели с моделями примерно 133 млн чатов. Благонадежность этих людей проверяли только сами подрядчики, а их процедуры, как признает Anthropic, часто были недостаточными.
Внутреннее расследование доказательств злоупотребления не нашло. Требования к подрядчикам компания после этого ужесточила.
О пробеле стало известно из свежего отчета о рисках. (стр. 148)
Сам отчет оценил катастрофические риски моделей Anthropic как низкие по всем категориям, но написан заметно осторожнее предыдущего: почти везде оценки либо подняты, либо идут с оговоркой о возросшей неопределенности - из-за недавних инцидентов и ранних признаков ускорения ИИ-прогресса.
@ai_machinelearning_big_data
#news #ai #ml
С мая 2025 по апрель 2026 года блокирующие классификаторы Anthropic не применялись к трафику внешних подрядчиков - тех, кто собирает обратную связь от людей для обучения моделей.
Эти классификаторы нужны, чтобы модель не выдавала опасных сведений о химическом и биологическом оружии.
За это время около 50 тысяч человек провели с моделями примерно 133 млн чатов. Благонадежность этих людей проверяли только сами подрядчики, а их процедуры, как признает Anthropic, часто были недостаточными.
Внутреннее расследование доказательств злоупотребления не нашло. Требования к подрядчикам компания после этого ужесточила.
О пробеле стало известно из свежего отчета о рисках. (стр. 148)
Сам отчет оценил катастрофические риски моделей Anthropic как низкие по всем категориям, но написан заметно осторожнее предыдущего: почти везде оценки либо подняты, либо идут с оговоркой о возросшей неопределенности - из-за недавних инцидентов и ранних признаков ускорения ИИ-прогресса.
Дарио Амодеи ранее называл разработку химического и биологического оружия с помощью ИИ более серьезной угрозой, чем кибератаки.
@ai_machinelearning_big_data
#news #ai #ml