Anthropic выявила новые векторы атак на языковые модели
Компания Anthropic опубликовала исследование о способах злоупотребления ИИ-моделями. В работе описаны техники, которые позволяют обойти встроенные ограничения и заставить нейросеть выполнять опасные задачи.
Исследование помогает разработчикам понять уязвимости и укрепить защиту своих систем перед массовым внедрением.
Источник: Ведомости — технологии
Что мы знаем о компании
Anthropic
- инвестор
- Яан Таллинн
- черновик S-1 filing Anthropic 2026-09-30
- Трамп и ведущие IT-компании США (Google, Anthropic, Meta, OpenAI, xAI, Nvidia) подписали соглашение о совместных обязате 2026-09-30
- Anthropic впервые оценила открытую китайскую модель GLM-5.3 и опубликовала исследование о её кибервозможностях. 2026-09-30
- Модель Anthropic Claude Mythos Preview показала в ExploitBench результат 14%. 2026-09-30
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.