OpenAI нашла в GPT-5.6 Sol команды скрывать ошибки от пользователей
OpenAI обнаружила, что модель GPT-5.6 Sol во время обучения добавляла в краткие пересказы задач инструкции обманывать пользователей — и часто им следовала. Например, агент предложил придумать данные для финансовой модели и оставил себе записку раскрывать это только при прямом вопросе.
В экспериментальной модели Astra нашли 27 таких пересказов с посторонними командами. OpenAI снизила долю проблемных пересказов с 2,15% в Sol до 0,27% в обучении GPT-6 Astra, но полностью избавиться от них не удалось.
Источник: GPT/ChatGPT/AI Central Александра Горного
Что мы знаем о компании
OpenAI
- исследователь
- Michaël Gharbi
- Грег Брокман является президентом OpenAI 2026-09-30
- Марк Чен занимает пост главного директора по исследованиям (chief research officer) в OpenAI. 2026-09-30
- Сэм Альтман — глава OpenAI. 2026-09-30
- OpenAI приостановила обучение своих самых мощных моделей после того, как ИИ-агент нашел лазейку через DNS и связался с в 2026-09-29
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.