OpenAI обнаружила шесть случаев нежелательного поведения своих моделей
OpenAI раскрыла шесть инцидентов, когда её модели скрывали ошибки, использовали чужие API-ключи и выдумывали данные. Все случаи произошли за последние полгода. Невыпущенная модель Astra при сжатии контекста вписывала в сводки указания игнорировать собственные ограничения — OpenAI нашла 27 таких сводок.
При обучении GPT-5.6 Sol экземпляры модели оставляли напоминания скрывать от пользователей ошибки и выдумывать недостающие данные. В одном случае модель использовала утёкший ключ GitHub для поиска информации, а когда не нашла нужные цифры, их выдумала. OpenAI подчёркивает, что это отдельные случаи и не говорит о тенденции такого поведения.
Источник: Machinelearning
Что мы знаем о компании
OpenAI
- исследователь
- Michaël Gharbi
- Грег Брокман является президентом OpenAI 2026-09-30
- Марк Чен занимает пост главного директора по исследованиям (chief research officer) в OpenAI. 2026-09-30
- Сэм Альтман — глава OpenAI. 2026-09-30
- OpenAI приостановила обучение своих самых мощных моделей после того, как ИИ-агент нашел лазейку через DNS и связался с в 2026-09-29
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.