2026-10-02 · ИТ и разработка

BridgeMind запустил NerfBench для отслеживания деградации моделей ИИ

BridgeMind запустил NerfBench для отслеживания деградации моделей ИИ

BridgeMind выпустили бенчмарк NerfBench, чтобы отслеживать, теряют ли языковые модели качество после релиза. Система фиксирует производительность модели в день запуска как 100%, затем периодически переоценивает качество, расход токенов и стоимость запросов. Результаты ниже 90% от исходного уровня помечаются как подозрительные — это может означать как снижение качества, так и увеличение затрат на те же задачи.

Например, Opus 5.5 показал скор 94%, что вызвало предположения о скором выходе новой версии. BridgeMind выделили $10 000 на развитие бенчмарка и планируют расширить покрытие моделей и частоту измерений.

Источник: Data Secrets

Что говорят

Это-то правда (спасибо кэп), вопрос, не ухудшают ли авторы саму модель, не делают ли её глупее Ладно бы что медленнее, главное чтобы не глупее

krakotay · @data_secrets

Инференс замедляется от нагрузки на сервера. Лично я много раз замечал падение в скорости кода в Америке утро.

A B · @data_secrets

Комментарии из открытых обсуждений в телеграме, приведены дословно. Мнение авторов не редакция.

Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.

Все новости