BookTrans встроил бенчмарк качества перевода для LLM
RUVDS.com встроила в опенсурсный конвейер BookTrans бенчмарк для оценки качества художественного перевода нейросетями. Бенчмарк содержит сто ловушек в одном рассказе и использует LLM-судью с ключом ответов для автоматической проверки.
На нём протестировали модели Anthropic, OpenAI и Google против китайских аналогов. Результаты показывают, насколько хорошо работают западные модели в сравнении с более дешёвыми решениями.
Источник: Хабр — всё
Что мы знаем о компании
Anthropic
- инвестор
- Яан Таллинн
- черновик S-1 filing Anthropic 2026-09-30
- Трамп и ведущие IT-компании США (Google, Anthropic, Meta, OpenAI, xAI, Nvidia) подписали соглашение о совместных обязате 2026-09-30
- Anthropic впервые оценила открытую китайскую модель GLM-5.3 и опубликовала исследование о её кибервозможностях. 2026-09-30
- Модель Anthropic Claude Mythos Preview показала в ExploitBench результат 14%. 2026-09-30
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.