Nvidia выпустила модель для разметки спикеров в аудио на 100 млн параметров
Nvidia открыла веса модели Nemotron 3 Diarization, которая размечает аудиозаписи по говорящим — определяет, кто и когда говорит, включая моменты перебивания. Модель работает на потоке, различает до восьми собеседников (вдвое больше, чем предыдущая версия) и обрабатывает записи неограниченной длины фрагментами по 80 миллисекунд.
Архитектура основана на 31-слойном трансформерном энкодере с RoPE — на выходе модель выдаёт для каждых 10 мс вероятность речи каждого участника. Метки говорящих остаются анонимными, но приложение может связать их с конкретными именами через заранее определённый список спикеров.
Источник: Machinelearning
Что мы знаем о компании
NVIDIA
- инженер
- Даниэль Хан
- NVIDIA выпустила Kumo Tabular — модели для анализа таблиц без обучения 2026-10-01
- NVIDIA и Hugging Face научили NeMo Automodel работать с диффузионными моделями 2026-09-30
- Трамп встретился с главами Meta, OpenAI, Google и Nvidia по регулированию ИИ 2026-09-29
- OpenAI тайно сотрудничает с Nvidia по безопасности ИИ 2026-09-29
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.