ИИ защищают шаблонами, а не пониманием — джейлбрейки работают поэтому
На Хабре разобрали, почему языковые модели легко обманывают простыми переформулировками запросов вроде «ты моя бабушка». Автор VMarkell предположил, что ИИ защищены не осознанием запретов, а выученными шаблонами отказа — поэтому смена контекста, кодирование или переформулировка обходят защиту.
Если бы модель понимала категорию задачи независимо от формы, джейлбрейки были бы неэффективны. Статья показывает фундаментальный разрыв между текущим подходом к безопасности ИИ и тем, что требуется для устойчивой защиты.
Источник: Habr AI
- Amazon обновила Kindle с плоским экраном и ценой от $150 2026-10-03
- Broadcom и Blackstone собрали $60 млрд на ИИ-чипы для Anthropic 2026-10-03
- Чат-бот мэрии Нью-Йорка советовал предпринимателям нарушать трудовое право 2026-10-03
- CLI-Anything генерирует интерфейсы для ИИ-агентов к любому софту 2026-10-03
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.