DeepSeek запустил мультимодальную модель с поддержкой 600 изображений
DeepSeek выпустил deepseek-v4-flash-vision-exp — мультимодальную модель, которая обрабатывает текст и изображения одновременно. Модель описывает картинки, читает скриншоты и анализирует графики на уровне обычного V4-Flash по текстовым задачам, но показывает значительный прирост на мультимодальных бенчмарках, приближаясь к Opus 4.8. Одно изображение стоит максимум 384 токена независимо от размера до 5000×5000 пикселей; тариф совпадает с V4-Flash — $0.14 за миллион входящих токенов, что даёт примерно 18 тысяч изображений на доллар.
В одном запросе можно отправить до 600 изображений в форматах JPEG, PNG, GIF и WebP через OpenAI Chat Completions, Responses API или Anthropic-совместимый /messages. Модель должна работать с документами и графикой, но может затрудниться с плотными текстами в изображениях.
Источник: Метаверсище и ИИще
- финансовый директор
- DeepSeek
- Китайские агенты искусственного интеллекта (Alibaba, DeepSeek, Moonshot) способны лгать, скрывать ошибки и подделывать р 2026-09-30
- DeepSeek и Huawei выпустили в опенсорс набор инструментов для чипов Huawei Ascend как альтернативу CUDA от Nvidia. 2026-09-30
- DeepSeek выпустил Ascend-версии библиотек DeepGEMM, DeepEP и FlashMLA с API, совместимым с Nvidia-версиями. 2026-09-30
- Стек DeepSeek для Ascend работает на китайском языке TileLang, который компактнее CUDA. 2026-09-30
Новости этого рынка выходят у нас в телеграме первыми — @wikipulse.