ИИ-агенты пишут код, но 22 ошибки на 2650 тестах блокируют автоматизацию
Дэкс Хорти из HumanLayer разобрал, почему полностью автоматизированная разработка с ИИ-агентами не работает: модели плохо учатся поддерживать качество кода, потому что сигнал об этом слабый. Автор протестировал конвейер на Claude Code и Codex со спецификацией, слепыми тестами и проверкой второй моделью — результат: 22 нарушения спецификации при 2650 зелёных тестах.
Хорти предлагает вернуть code review, но сделать его дешёвым планированием вместо полного ручного разбора. Обсуждение на Hacker News собрало 272 комментария.
Источник: Хабр — всё
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.