Разработчик собрал бенчмарк из 24 вопросов для выбора LLM
Автор koreec опубликовал руководство по тестированию языковых моделей на примере своей задачи — выбора ИИ-ассистента для электронного лабораторного журнала. Он запустил 450 прогонов через 24 вопроса по реальной работе на DeepSeek, ChatGPT и Claude с разными уровнями reasoning effort.
В материале показано, как собирали тестовые вопросы и какие результаты дали 19 комбинаций моделей и параметров. Автор делится методом, чтобы другие могли адаптировать подход под свои задачи вместо опоры на публичные рейтинги.
Источник: Habr AI
- Amazon обновила Kindle с плоским экраном и ценой от $150 2026-10-03
- Broadcom и Blackstone собрали $60 млрд на ИИ-чипы для Anthropic 2026-10-03
- Чат-бот мэрии Нью-Йорка советовал предпринимателям нарушать трудовое право 2026-10-03
- CLI-Anything генерирует интерфейсы для ИИ-агентов к любому софту 2026-10-03
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.