Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Назад к блогу

DeepSeek V4 Flash для Codex: настройка Responses API

DeepSeek V4 FlashCodexResponses APIAI-агентымодель для программирования

31 июля 2026 года DeepSeek запустила официальную публичную бету API DeepSeek-V4-Flash. Модель сохраняет архитектуру и размер V4-Flash Preview, но получила новое постобучение с акцентом на выполнение Agent-задач, программирование и работу с инструментами.

Главное изменение для разработчиков — нативная поддержка OpenAI Responses API и отдельная интеграция с Codex. Согласно текущей документации DeepSeek, deepseek-v4-flash пока является единственной моделью DeepSeek, которую можно напрямую подключить к Codex. Поддержка V4 Pro ожидается в одном из следующих обновлений.

На этом шлюзе deepseek-v4-flash доступна через /v1/responses для Codex и других Agent-клиентов на базе протокола Responses.

Что изменилось в DeepSeek-V4-Flash-0731

По данным DeepSeek, DeepSeek-V4-Flash-0731 использует ту же архитектуру и тот же размер модели, что и V4-Flash Preview. В релизе от 31 июля изменилось постобучение, а не базовая структура. API V4 Pro, а также модели в приложении и веб-версии DeepSeek в этом релизе не обновлялись.

Параметр Текущая информация
ID модели на шлюзе deepseek-v4-flash
Дата релиза 31 июля 2026 года
Статус Официальная публичная бета API
Главное улучшение Agent-задачи, программирование и работа с инструментами
Responses API Нативная поддержка
Codex Официальная адаптация
Контекст 1M в каталоге шлюза
Множитель шлюза 2,5x
Ориентировочная ставка шлюза Около CNY 1 за 1M токенов
Ввод изображений Сейчас отмечен в каталоге шлюза как неподдерживаемый

Доступность моделей и тарифы могут меняться. Перед использованием в продакшене проверьте актуальные цены и руководство по моделям.

Официальные результаты Agent-бенчмарков

DeepSeek опубликовала для официального релиза V4 Flash следующие результаты:

Бенчмарк Официальный результат
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

Эти цифры показывают направление возможностей, но не гарантируют такую же долю успеха в вашем репозитории. DeepSeek сообщает, что для публичных Code Agent-тестов использовались еще не опубликованный минимальный DeepSeek Harness, уровень усилия max, top_p=0.95 и temperature=1.0. DSBench-FullStack и DSBench-Hard являются внутренними наборами тестов.

Для принятия решения о закупке тестируйте модель на зафиксированных репозиториях, инструментах, разрешениях и приемочных тестах. Измеряйте выполнение с первой попытки, ошибки инструментов, затраченное время, расход токенов и объем инженерной доработки.

Responses API и Chat Completions: в чем разница

Chat Completions хорошо подходит для диалогов, написания текстов, перевода, суммаризации и простых вопросов по коду. Базовый процесс состоит из списка сообщений и сгенерированного текста.

Responses API рассчитан на агентов и последовательное выполнение инструментов. Задача может включать ответ модели, вызовы функций, действия в терминале, результаты инструментов и продолжение рассуждения. Codex использует этот более насыщенный протокол, чтобы анализировать код, редактировать файлы, запускать тесты и продолжать работу после каждого результата.

Возможность Chat Completions Responses API
Диалог и генерация текста Подходит хорошо Поддерживается
Структурированные вызовы инструментов Доступны Нативный workflow
Последовательная работа с несколькими инструментами Управляется клиентом Подходит лучше
Интеграция с Codex Не является протоколом Codex Обязательна
Структура Agent-событий Проще Богаче
Длинные инженерные процессы Требуют дополнительной оркестрации Основной сценарий

Для простых массовых генераций используйте Chat Completions. Выбирайте /v1/responses, когда задаче нужны Codex, терминал, вызовы функций или многошаговая инженерная работа.

Важная граница поддержки инструментов

Прямой endpoint /v1/responses этого шлюза не предоставляет нативно размещенные инструменты MCP, file_search, code_interpreter и computer_use. Чтение и изменение файлов, Shell-команды и MCP-серверы оркестрирует клиент Codex в пределах инструментов и разрешений локальной среды.

Иными словами, совместимость с протоколом Responses не означает доступность всех инструментов, размещаемых OpenAI. При интеграции без Codex реализуйте собственные функции и цикл выполнения инструментов на стороне клиента.

Вызов DeepSeek V4 Flash через Responses API

Начните с небольшого запроса:

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

Проверьте Base URL, API-ключ, ID модели, HTTP-статус и структуру событий ответа, прежде чем тестировать streaming, вызовы функций, длинный контекст или задачи с интенсивной работой в терминале.

Не подставляйте в Codex другую модель DeepSeek. Сейчас DeepSeek документирует только deepseek-v4-flash как совместимую с Codex. Другие ID моделей могут приводить к ошибкам протокола, сбоям вызова инструментов, прерыванию задач или несовместимой структуре событий.

Настройка deepseek-v4-flash в Codex

Установите или обновите Codex CLI:

npm install -g @openai/codex@latest
codex --version

Добавьте Responses-провайдер в ~/.codex/config.toml:

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

Передавайте ключ шлюза через безопасный способ аутентификации, который поддерживает ваша версия Codex. Никогда не коммитьте реальный ключ, не вставляйте его в примеры и не выводите в логи.

Начните с задачи только для чтения:

Изучи структуру репозитория и перечисли команду сборки, команду тестов и три основных модуля. Не изменяй файлы.

Разрешайте запись файлов и выполнение Shell-команд только после проверки модели, вызовов инструментов и обработки контекста. Подробности приведены в полном руководстве по настройке Codex.

Рекомендуемые сценарии

  • Анализ репозитория, диагностика ошибок и точечные исправления
  • Итерации по коду после падения тестов
  • Терминальные команды, поиск по коду и многошаговые инженерные задачи
  • MCP-серверы, вызовы функций и оркестрация внешних сервисов клиентом Codex
  • Автоматизированные тесты, code review и планирование миграций
  • Разработка с контролем расходов, которой все равно нужны Agent-возможности

DeepSeek V4 Flash — не просто недорогой маршрут для чата. Главная ценность модели в том, что она переносит более низкий множитель шлюза в процессы Codex и AI-агентов. Для продакшен-агентов все равно нужны границы разрешений, таймауты, ограничения повторов, бюджеты токенов и условия передачи задачи человеку.

Чек-лист проверки для продакшена

  1. Скопируйте точный ID deepseek-v4-flash из руководства по моделям.
  2. Укажите https://api.llm-token.cn/v1 как Base URL и установите протокол Codex в responses.
  3. Коротким запросом проверьте статус, структуру событий, выбранную модель и биллинг.
  4. Задачей только для чтения проверьте доступ к файлам, поиск и удержание контекста.
  5. Отдельно проверьте Shell, патчи, вызовы функций, MCP и многораундовую работу через клиент Codex.
  6. Явно задайте границы для файлов, баз данных, платежей, развертываний и серверов.
  7. При сравнении моделей зафиксируйте репозиторий, начальный commit, зависимости и приемочные команды.
  8. Записывайте долю завершенных задач, длительность P50/P95, типы ошибок и стоимость принятой задачи.

Частые вопросы

Поддерживает ли DeepSeek V4 Flash Codex?

Да. DeepSeek подтверждает, что официальный релиз V4 Flash нативно поддерживает Responses API и адаптирован для Codex. Сейчас deepseek-v4-flash документируется как единственная модель DeepSeek, поддерживаемая в Codex.

Какой endpoint следует использовать в Codex?

Используйте /v1/responses, а не /v1/chat/completions. На этом шлюзе задайте Base URL https://api.llm-token.cn/v1 и настройте wire_api = "responses".

Включает ли Responses API MCP, поиск файлов и исполнение кода?

Не напрямую на этом шлюзе. MCP, file_search, code_interpreter и computer_use не являются нативными инструментами endpoint. В Codex файлы, Shell и MCP исполняет и координирует клиент в рамках локальных разрешений.

Можно ли запустить DeepSeek V4 Pro в Codex?

Согласно документации DeepSeek, поддержка Codex в V4 Pro ожидается в начале августа 2026 года. Не считайте модель совместимой, пока поддержку не подтвердят официальный API и маршрут шлюза.

Сколько стоит DeepSeek V4 Flash?

В текущем каталоге шлюза указан множитель 2,5x, то есть примерно CNY 1 за 1M токенов. Актуальная страница цен и журнал списаний аккаунта являются окончательными источниками.

Responses API всегда лучше Chat Completions?

Нет. Chat Completions проще для диалогов и одноразовой генерации. Responses полезнее для Codex, вызовов инструментов и последовательных инженерных процессов.

Где купить или пополнить доступ к API?

Новые клиенты могут начать на странице покупки. Владельцы существующих API-ключей могут воспользоваться пополнением. Начинайте с небольших, обратимых задач только для чтения.

Первичные источники