DeepSeek V4 Flash для Codex: настройка Responses API
31 июля 2026 года DeepSeek запустила официальную публичную бету API DeepSeek-V4-Flash. Модель сохраняет архитектуру и размер V4-Flash Preview, но получила новое постобучение с акцентом на выполнение Agent-задач, программирование и работу с инструментами.
Главное изменение для разработчиков — нативная поддержка OpenAI Responses API и отдельная интеграция с Codex. Согласно текущей документации DeepSeek, deepseek-v4-flash пока является единственной моделью DeepSeek, которую можно напрямую подключить к Codex. Поддержка V4 Pro ожидается в одном из следующих обновлений.
На этом шлюзе deepseek-v4-flash доступна через /v1/responses для Codex и других Agent-клиентов на базе протокола Responses.
Что изменилось в DeepSeek-V4-Flash-0731
По данным DeepSeek, DeepSeek-V4-Flash-0731 использует ту же архитектуру и тот же размер модели, что и V4-Flash Preview. В релизе от 31 июля изменилось постобучение, а не базовая структура. API V4 Pro, а также модели в приложении и веб-версии DeepSeek в этом релизе не обновлялись.
| Параметр | Текущая информация |
|---|---|
| ID модели на шлюзе | deepseek-v4-flash |
| Дата релиза | 31 июля 2026 года |
| Статус | Официальная публичная бета API |
| Главное улучшение | Agent-задачи, программирование и работа с инструментами |
| Responses API | Нативная поддержка |
| Codex | Официальная адаптация |
| Контекст | 1M в каталоге шлюза |
| Множитель шлюза | 2,5x |
| Ориентировочная ставка шлюза | Около CNY 1 за 1M токенов |
| Ввод изображений | Сейчас отмечен в каталоге шлюза как неподдерживаемый |
Доступность моделей и тарифы могут меняться. Перед использованием в продакшене проверьте актуальные цены и руководство по моделям.
Официальные результаты Agent-бенчмарков
DeepSeek опубликовала для официального релиза V4 Flash следующие результаты:
| Бенчмарк | Официальный результат |
|---|---|
| Terminal Bench 2.1 | 82.7 |
| NL2Repo | 54.2 |
| Cybergym | 76.7 |
| DeepSWE | 54.4 |
| Toolathlon verified | 70.3 |
| Agent Last Exam | 25.2 |
| Automation Bench (Public) | 25.1 |
| DSBench-FullStack | 68.7 |
| DSBench-Hard | 59.6 |
Эти цифры показывают направление возможностей, но не гарантируют такую же долю успеха в вашем репозитории. DeepSeek сообщает, что для публичных Code Agent-тестов использовались еще не опубликованный минимальный DeepSeek Harness, уровень усилия max, top_p=0.95 и temperature=1.0. DSBench-FullStack и DSBench-Hard являются внутренними наборами тестов.
Для принятия решения о закупке тестируйте модель на зафиксированных репозиториях, инструментах, разрешениях и приемочных тестах. Измеряйте выполнение с первой попытки, ошибки инструментов, затраченное время, расход токенов и объем инженерной доработки.
Responses API и Chat Completions: в чем разница
Chat Completions хорошо подходит для диалогов, написания текстов, перевода, суммаризации и простых вопросов по коду. Базовый процесс состоит из списка сообщений и сгенерированного текста.
Responses API рассчитан на агентов и последовательное выполнение инструментов. Задача может включать ответ модели, вызовы функций, действия в терминале, результаты инструментов и продолжение рассуждения. Codex использует этот более насыщенный протокол, чтобы анализировать код, редактировать файлы, запускать тесты и продолжать работу после каждого результата.
| Возможность | Chat Completions | Responses API |
|---|---|---|
| Диалог и генерация текста | Подходит хорошо | Поддерживается |
| Структурированные вызовы инструментов | Доступны | Нативный workflow |
| Последовательная работа с несколькими инструментами | Управляется клиентом | Подходит лучше |
| Интеграция с Codex | Не является протоколом Codex | Обязательна |
| Структура Agent-событий | Проще | Богаче |
| Длинные инженерные процессы | Требуют дополнительной оркестрации | Основной сценарий |
Для простых массовых генераций используйте Chat Completions. Выбирайте /v1/responses, когда задаче нужны Codex, терминал, вызовы функций или многошаговая инженерная работа.
Важная граница поддержки инструментов
Прямой endpoint /v1/responses этого шлюза не предоставляет нативно размещенные инструменты MCP, file_search, code_interpreter и computer_use. Чтение и изменение файлов, Shell-команды и MCP-серверы оркестрирует клиент Codex в пределах инструментов и разрешений локальной среды.
Иными словами, совместимость с протоколом Responses не означает доступность всех инструментов, размещаемых OpenAI. При интеграции без Codex реализуйте собственные функции и цикл выполнения инструментов на стороне клиента.
Вызов DeepSeek V4 Flash через Responses API
Начните с небольшого запроса:
curl https://api.llm-token.cn/v1/responses \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"input": "Inspect this repository and propose the smallest fix for the failing tests."
}'
Проверьте Base URL, API-ключ, ID модели, HTTP-статус и структуру событий ответа, прежде чем тестировать streaming, вызовы функций, длинный контекст или задачи с интенсивной работой в терминале.
Не подставляйте в Codex другую модель DeepSeek. Сейчас DeepSeek документирует только deepseek-v4-flash как совместимую с Codex. Другие ID моделей могут приводить к ошибкам протокола, сбоям вызова инструментов, прерыванию задач или несовместимой структуре событий.
Настройка deepseek-v4-flash в Codex
Установите или обновите Codex CLI:
npm install -g @openai/codex@latest
codex --version
Добавьте Responses-провайдер в ~/.codex/config.toml:
model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"
[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true
Передавайте ключ шлюза через безопасный способ аутентификации, который поддерживает ваша версия Codex. Никогда не коммитьте реальный ключ, не вставляйте его в примеры и не выводите в логи.
Начните с задачи только для чтения:
Изучи структуру репозитория и перечисли команду сборки, команду тестов и три основных модуля. Не изменяй файлы.
Разрешайте запись файлов и выполнение Shell-команд только после проверки модели, вызовов инструментов и обработки контекста. Подробности приведены в полном руководстве по настройке Codex.
Рекомендуемые сценарии
- Анализ репозитория, диагностика ошибок и точечные исправления
- Итерации по коду после падения тестов
- Терминальные команды, поиск по коду и многошаговые инженерные задачи
- MCP-серверы, вызовы функций и оркестрация внешних сервисов клиентом Codex
- Автоматизированные тесты, code review и планирование миграций
- Разработка с контролем расходов, которой все равно нужны Agent-возможности
DeepSeek V4 Flash — не просто недорогой маршрут для чата. Главная ценность модели в том, что она переносит более низкий множитель шлюза в процессы Codex и AI-агентов. Для продакшен-агентов все равно нужны границы разрешений, таймауты, ограничения повторов, бюджеты токенов и условия передачи задачи человеку.
Чек-лист проверки для продакшена
- Скопируйте точный ID
deepseek-v4-flashиз руководства по моделям. - Укажите
https://api.llm-token.cn/v1как Base URL и установите протокол Codex вresponses. - Коротким запросом проверьте статус, структуру событий, выбранную модель и биллинг.
- Задачей только для чтения проверьте доступ к файлам, поиск и удержание контекста.
- Отдельно проверьте Shell, патчи, вызовы функций, MCP и многораундовую работу через клиент Codex.
- Явно задайте границы для файлов, баз данных, платежей, развертываний и серверов.
- При сравнении моделей зафиксируйте репозиторий, начальный commit, зависимости и приемочные команды.
- Записывайте долю завершенных задач, длительность P50/P95, типы ошибок и стоимость принятой задачи.
Частые вопросы
Поддерживает ли DeepSeek V4 Flash Codex?
Да. DeepSeek подтверждает, что официальный релиз V4 Flash нативно поддерживает Responses API и адаптирован для Codex. Сейчас deepseek-v4-flash документируется как единственная модель DeepSeek, поддерживаемая в Codex.
Какой endpoint следует использовать в Codex?
Используйте /v1/responses, а не /v1/chat/completions. На этом шлюзе задайте Base URL https://api.llm-token.cn/v1 и настройте wire_api = "responses".
Включает ли Responses API MCP, поиск файлов и исполнение кода?
Не напрямую на этом шлюзе. MCP, file_search, code_interpreter и computer_use не являются нативными инструментами endpoint. В Codex файлы, Shell и MCP исполняет и координирует клиент в рамках локальных разрешений.
Можно ли запустить DeepSeek V4 Pro в Codex?
Согласно документации DeepSeek, поддержка Codex в V4 Pro ожидается в начале августа 2026 года. Не считайте модель совместимой, пока поддержку не подтвердят официальный API и маршрут шлюза.
Сколько стоит DeepSeek V4 Flash?
В текущем каталоге шлюза указан множитель 2,5x, то есть примерно CNY 1 за 1M токенов. Актуальная страница цен и журнал списаний аккаунта являются окончательными источниками.
Responses API всегда лучше Chat Completions?
Нет. Chat Completions проще для диалогов и одноразовой генерации. Responses полезнее для Codex, вызовов инструментов и последовательных инженерных процессов.
Где купить или пополнить доступ к API?
Новые клиенты могут начать на странице покупки. Владельцы существующих API-ключей могут воспользоваться пополнением. Начинайте с небольших, обратимых задач только для чтения.
Первичные источники
- Журнал изменений DeepSeek от 31 июля 2026 года: статус релиза, Agent-бенчмарки, условия оценки, Responses API и поддержка Codex
- Руководство DeepSeek по интеграции с Codex: поддерживаемая модель и границы интеграции
- Руководство DeepSeek по Responses API: протокол и рекомендации по запросам
- Руководство по моделям шлюза: текущий ID маршрута, множитель, контекст и метки возможностей