2026-10-03 · ИТ и разработка

Разработчик собрал бенчмарк из 24 вопросов для выбора LLM

Разработчик собрал бенчмарк из 24 вопросов для выбора LLM

Автор koreec опубликовал руководство по тестированию языковых моделей на примере своей задачи — выбора ИИ-ассистента для электронного лабораторного журнала. Он запустил 450 прогонов через 24 вопроса по реальной работе на DeepSeek, ChatGPT и Claude с разными уровнями reasoning effort.

В материале показано, как собирали тестовые вопросы и какие результаты дали 19 комбинаций моделей и параметров. Автор делится методом, чтобы другие могли адаптировать подход под свои задачи вместо опоры на публичные рейтинги.

Источник: Habr AI

Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.

Все новости