BridgeMind запустил NerfBench для отслеживания деградации моделей ИИ
BridgeMind выпустили бенчмарк NerfBench, чтобы отслеживать, теряют ли языковые модели качество после релиза. Система фиксирует производительность модели в день запуска как 100%, затем периодически переоценивает качество, расход токенов и стоимость запросов. Результаты ниже 90% от исходного уровня помечаются как подозрительные — это может означать как снижение качества, так и увеличение затрат на те же задачи.
Например, Opus 5.5 показал скор 94%, что вызвало предположения о скором выходе новой версии. BridgeMind выделили $10 000 на развитие бенчмарка и планируют расширить покрытие моделей и частоту измерений.
Источник: Data Secrets
- Amazon обновила Kindle с плоским экраном и ценой от $150 2026-10-03
- Broadcom и Blackstone собрали $60 млрд на ИИ-чипы для Anthropic 2026-10-03
- Чат-бот мэрии Нью-Йорка советовал предпринимателям нарушать трудовое право 2026-10-03
- CLI-Anything генерирует интерфейсы для ИИ-агентов к любому софту 2026-10-03
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.
Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.