DeepSeek-V4-Flash-Vision-Exp API: руководство 2026
21 августа 2026 года DeepSeek запустила свою первую официальную мультимодальную API-модель deepseek-v4-flash-vision-exp. Она добавляет распознавание изображений к текстовым, логическим и агентным возможностям DeepSeek V4 Flash, поддерживает контекст 1M токенов, вывод до 384K токенов и учитывает не более 384 входных токенов на одно изображение. В прямом API DeepSeek модель тарифицируется так же, как V4 Flash.
Суффикс exp означает experimental — экспериментальная версия. Официальный API уже принимает этот маршрут, но считать его гарантированно стабильным в долгосрочной перспективе нельзя. В статье отдельно рассматриваются официальные характеристики и тесты DeepSeek, сторонние примеры и состояние маршрута на этом шлюзе. По состоянию на 22 августа 2026 года новый ID отсутствовал в публичном каталоге цен шлюза, поэтому мы не придумываем для него множитель.
Сначала проверьте маршрут: убедитесь, что
deepseek-v4-flash-vision-expпоявился в разделе цен моделей, и лишь затем откройте небольшой баланс на странице покупки API. Доступность и фактический счет на момент запроса имеют приоритет.
Основные характеристики DeepSeek-V4-Flash-Vision-Exp
| Параметр | Официально опубликованные данные |
|---|---|
| Дата запуска | 21 августа 2026 года |
| Точный ID модели | deepseek-v4-flash-vision-exp |
| Статус | Экспериментальная мультимодальная API-модель |
| Контекст | 1M токенов |
| Максимальный вывод | 384K токенов |
| Токены изображения | Зависят от размеров; не более 384 токенов на изображение |
| Максимум изображений в запросе | 600 |
| Способы ввода | Текст + изображения: base64, внешний URL или file_id Files API |
| Форматы API | Chat Completions, Anthropic Messages и Responses API |
| Вызовы инструментов | Поддерживаются |
| Режимы рассуждения | С рассуждением и без него; по умолчанию рассуждение включено |
| FIM-дополнение | Не поддерживается |
| Официальный лимит параллелизма | 2500 |

Источник: релиз DeepSeek от 21 августа 2026 года. Это опубликованные производителем оценки, а не независимое тестирование нашего сайта.
Разбор тестов: «близко к Opus-4.8» не означает победу во всем
DeepSeek заявляет о заметном скачке относительно V4 Flash в мультимодальных агентных тестах и об общей производительности, близкой к Opus-4.8. Таблица подтверждает такое позиционирование, но показывает смешанный результат, а не безоговорочную победу.
| Бенчмарк | Vision-Exp | V4-Flash-0731 | Opus-4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 83.9 | 82.7 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 69.7 |
| Cybergym | 75.3 | 76.7 | 78.3 |
| DeepSWE | 59.3 | 54.4 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 76.2 |
| DSBench-Hard | 63.6 | 59.6 | 71.7 |
| AutomationBench (Public) | 25.7 | 25.1 | 27.2 |
| ApexBench (Pass@1) | 36.5 | 26.2 | 39.4 |
| Agents' Last Exam | 27.3 | 25.2 | 25.7 |
| Chartography | 64.3 | — | 65.0 |
| ZeroBench (Pass@5) | 35.0 | — | 34.0 |
Vision-Exp превосходит показанный результат Opus-4.8 в DeepSWE, Agents' Last Exam и ZeroBench, но уступает в Terminal Bench, NL2Repo и DSBench-Hard. Из девяти строк, которые можно напрямую сопоставить с V4-Flash-0731, новая модель выше в восьми; исключение — Cybergym.
Важны и условия. Для открытых текстовых задач Code Agent DeepSeek использовала Harness Minimal Mode, максимальный лимит вывода, top_p=0.95 и temperature=1.0. В ApexBench и Agents' Last Exam текстовая V4 Flash игнорирует мультимодальные элементы, поэтому это не равноправное сравнение двух vision-моделей.
Сколько реально стоит изображение до 384 токенов?
DeepSeek масштабирует и разбивает изображение на блоки с учетом его размеров, после чего переводит результат во входные токены. 384 — верхний предел для одного изображения, а не фиксированное число. При нескольких изображениях каждое считается отдельно; общего лимита в 384 токена на запрос нет.
В прямом API Vision-Exp стоит столько же, сколько V4 Flash:
| Прямой API DeepSeek | Вне пика | В пиковое время |
|---|---|---|
| Вход при попадании в кеш / 1M токенов | $0.007 | $0.014 |
| Вход без попадания в кеш / 1M токенов | $0.22 | $0.44 |
| Вывод / 1M токенов | $0.66 | $1.32 |
В консервативном сценарии, когда каждое изображение достигает 384 токенов и считается входом без попадания в кеш, 1000 изображений стоят примерно $0.0845 вне пика или $0.169 в пик только за визуальный вход.
Китайская страница цен DeepSeek указывает региональные ставки CNY 1.50/M вне пика и CNY 3.00/M в пик для входа без кеша. Тогда расчет максимальной стоимости 1000 изображений выглядит так:
- вне пика:
384 × 1000 × CNY 1.50 / 1,000,000 = CNY 0.576; - в пик:
384 × 1000 × CNY 3.00 / 1,000,000 = CNY 1.152.
В сумму не входят текстовый ввод, вывод модели, циклы инструментов и повторные запросы. Долларовые и юаневые таблицы — региональные официальные цены, а не пересчет по текущему курсу. Мы также не повторяем стороннее утверждение о разнице в 25–50 раз: правила токенизации изображений, временные тарифы и стоимость вывода конкурентов не были сверены по одной методике.
Проверьте по реальному счету: если маршрут появился в каталоге шлюза, сделайте небольшое пополнение и протестируйте одно безопасное изображение. Запишите токены изображения и текста, вывод, задержку и фактическое списание.
Три способа передать изображение
1. Base64 внутри запроса
JPEG, PNG, GIF или WebP можно кодировать как data URL. Это удобно для небольших или временных приватных изображений. Общий размер тела такого запроса ограничен 48 MiB, одного изображения — 32 MiB.
2. Внешний URL
Можно передать общедоступный HTTP(S)-адрес. Одно изображение не должно превышать 32 MiB, а загрузка должна завершиться за 60 секунд. Ссылки с cookie, доступом к частной сети или короткоживущей подписью требуют отдельной проверки.
3. file_id из Files API
Загрузите файл один раз и повторно используйте его file_id. Официальный Files API бесплатен, принимает файлы до 64 MiB и позволяет задать срок хранения от одного часа до 30 дней. Это экономит повторную передачу одной и той же схемы, панели или страницы, но при каждом чтении моделью токены изображения все равно тарифицируются.
Пример запроса Chat Completions с изображением
Минимальный запрос к прямому OpenAI-совместимому API DeepSeek:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer YOUR_DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash-vision-exp",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Изучи скриншот страницы и перечисли основные блоки, цвета и риски адаптивной верстки."},
{"type": "image_url", "image_url": {"url": "https://example.com/page.png"}}
]
}]
}'
В Responses API изображения передаются блоками input_image, а формат Anthropic Messages доступен через https://api.deepseek.com/anthropic. Схемы контентных блоков различаются, поэтому нельзя без изменений копировать тело Chat-запроса в Responses или Messages.
Для этого шлюза сначала проверьте точный ID в текущем каталоге, затем используйте указанные в документации шлюза Base URL и способ авторизации. Запуск у DeepSeek не доказывает, что сторонний шлюз уже поддерживает передачу изображений, Files API, все протоколы и тарификацию.
Практические сценарии для мультимодальных агентов
Предоставленный китайский материал показывает два сторонних примера: восстановление сайта по скриншоту и создание B2B-презентации из общего брифа. Это не наши независимые тесты, но они иллюстрируют полезные процессы.
От скриншота к HTML
Модель должна определить сетку, иерархию, цвета, типографику и интервалы, прежде чем инструмент программирования создаст HTML, CSS и JavaScript. Проверять нужно визуальную разницу, поведение при ширине 375px, фокус клавиатуры, hover-состояния и режим уменьшенной анимации, а не только один итоговый скриншот.
Отчеты, презентации и ревью дизайна
Vision-Exp может читать диаграммы, OCR-текст, визуальный стиль и структуру страниц, а затем передавать данные инструментам работы с документами, слайдами или кодом. Качество результата зависит также от агентной среды, доступных инструментов, исходных материалов и приемочных критериев.
Визуальная приемка действий агента
Агент может анализировать скриншоты после важных действий в браузере или приложении и сравнивать увиденное с ожидаемым состоянием. Низкий потолок токенов изображения снижает стоимость повторных проверок, но вывод модели и вызовы инструментов остаются частью бюджета.
Для задач без изображений сначала сравните руководство по DeepSeek V4 Flash и Responses API. Для более сложного текстового рассуждения и программирования изучите руководство по DeepSeek-V4-Pro-0813. Экспериментальная vision-модель не обязана сразу заменять все текстовые маршруты.
Распознавание изображений — не генерация изображений
Документация определяет deepseek-v4-flash-vision-exp как модель, которая принимает текст и изображения, описывает их, читает скриншоты и анализирует графики. Она не заявлена как модель генерации изображений.
Картинки в созданном сайте или презентации могут быть взяты из запроса, фотобанка, рисующего кода, отдельного генератора или файлов агента. Наличие изображений в результате не доказывает, что их создала Vision-Exp.
Контрольный список перед использованием в продакшене
- Используйте точный ID
deepseek-v4-flash-vision-exp, не придумывая датированный псевдоним. - Убедитесь, что текущий провайдер или шлюз действительно показывает ID в живом каталоге.
- Отдельно проверьте base64, URL и Files API: поддержка шлюзов может различаться.
- Возьмите небольшую картинку без секретов, персональных данных, внутренних URL и клиентской информации.
- Записывайте число изображений, визуальные и текстовые токены, вывод, задержку и счет.
- Создайте оцениваемые тесты для OCR, диаграмм, макета и мелкого текста.
- Ограничьте права на инструменты, сеть, запись и удаление файлов, развертывание и платежи.
- Подготовьте откат к
deepseek-v4-flash,deepseek-v4-proили другой vision-модели: маршрут экспериментальный.
Главное
deepseek-v4-flash-vision-exp— работающий экспериментальный мультимодальный маршрут DeepSeek, а не генератор изображений.- Контекст составляет 1M токенов, максимальный вывод — 384K, одно изображение занимает не более 384 входных токенов.
- Поддерживаются Chat Completions, Anthropic Messages и Responses API; изображения передаются через base64, URL или Files API.
- По заявлению DeepSeek, агентная производительность близка к Opus-4.8; таблица содержит и победы, и проигрыши.
- Прямой API стоит как V4 Flash, но цену и протоколы стороннего шлюза нужно проверять отдельно.
- Перед продакшеном экспериментальный маршрут требует приемочных тестов, бюджета и резервного варианта.
Часто задаваемые вопросы
DeepSeek-V4-Flash-Vision-Exp официально доступна?
Да. DeepSeek запустила модель в официальном API 21 августа 2026 года. Это экспериментальный маршрут, а не обещание неизменного долгосрочного поведения.
Какой точный ID модели?
Используйте deepseek-v4-flash-vision-exp: строчный ID с дефисами, а не название с прописными буквами.
Каждое изображение всегда занимает 384 токена?
Нет. Число зависит от масштабирования и разбиения по размерам. 384 — максимум для одного изображения; несколько изображений считаются отдельно.
Vision-Exp умеет генерировать изображения?
DeepSeek документирует распознавание, OCR, чтение скриншотов и анализ графиков, но не собственную генерацию изображений.
Насколько она сильнее V4 Flash?
В официальной таблице Vision-Exp выше V4-Flash-0731 в восьми из девяти напрямую сравнимых строк и ниже в Cybergym. Эти тесты производителя не гарантируют улучшение каждой текстовой или репозиторной задачи.
Можно повторно использовать изображение через Files API?
Да. Загрузите его один раз и передавайте file_id в следующих запросах. Хранение и загрузка бесплатны, но обработка изображения расходует тарифицируемые токены.
Можно подключить модель к Codex?
DeepSeek подтверждает изображения в Responses API, но передача через Codex зависит от версии клиента, формата блоков и шлюза. Отдельно тестируйте текст, изображения и картинки из результатов инструментов.
Какой множитель Vision-Exp на этом шлюзе?
На 22 августа 2026 года ID не было в публичном каталоге шлюза. Не считайте его равным deepseek-v4-flash; смотрите актуальные цены моделей.
Основные источники
- DeepSeek: запуск V4 Flash Vision Exp: дата, ID, позиционирование, тесты, форматы API и Harness 0.1.1
- Руководство DeepSeek Vision: способы ввода, токены, форматы, размеры и лимиты
- Модели и цены DeepSeek: контекст 1M, вывод 384K, временные тарифы, параллелизм 2500 и функции
- DeepSeek Files API: загрузка,
file_id, размер и срок хранения - Официальное объявление DeepSeek в X: исходный анонс