Разработчик создал бенчмарк из 3266 вопросов про вино для тестирования LLM
Разработчик nikitahudov опубликовал на Хабре OenoBench — бенчмарк для измерения знаний языковых моделей о вине. Датасет содержит 38 104 факта из открытых источников и 3 266 вопросов с вариантами ответа, протестированы 16 моделей. Почти всю работу выполнили агенты: Claude Code писал код, пять моделей генерировали вопросы, десять агентов проверяли качество.
Разработчик выступил единственным человеком в процессе, отвечая за экспертизу в области вина. Стоимость работы с API составила около $800.
Источник: Хабр — всё
- Amazon обновила Kindle с плоским экраном и ценой от $150 2026-10-03
- Broadcom и Blackstone собрали $60 млрд на ИИ-чипы для Anthropic 2026-10-03
- Чат-бот мэрии Нью-Йорка советовал предпринимателям нарушать трудовое право 2026-10-03
- CLI-Anything генерирует интерфейсы для ИИ-агентов к любому софту 2026-10-03
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.