Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Back to blog

DeepSeek V4 Flash 정식 버전: Codex 및 Responses API 설정 가이드

DeepSeek V4 FlashCodexResponses APIAI 에이전트코딩 모델

DeepSeek는 2026년 7월 31일 DeepSeek-V4-Flash 정식 API 공개 베타를 출시했습니다. 모델 구조와 크기는 V4-Flash Preview와 같지만 에이전트 실행, 코딩, 도구 사용에 초점을 맞춰 포스트 트레이닝을 다시 진행했습니다.

개발자에게 가장 중요한 변화는 정식 deepseek-v4-flashOpenAI Responses API를 네이티브로 지원하고 Codex에 맞게 조정되었다는 점입니다. DeepSeek의 현재 문서에 따르면 Codex에 직접 연결할 수 있는 DeepSeek 모델은 현재 이 모델뿐입니다. V4 Pro의 Codex 지원은 후속 업데이트를 기다려야 합니다.

이 게이트웨이는 /v1/responses를 통해 deepseek-v4-flash를 제공하며 Codex와 Responses 프로토콜 기반 에이전트 클라이언트에서 사용할 수 있습니다.

DeepSeek-V4-Flash-0731 변경 사항

DeepSeek에 따르면 DeepSeek-V4-Flash-0731은 V4-Flash Preview와 동일한 아키텍처와 모델 크기를 사용합니다. 7월 31일 정식 버전은 기반 구조가 아니라 포스트 트레이닝을 변경했습니다. V4 Pro API, DeepSeek 앱 및 웹 모델은 이번 릴리스에서 변경되지 않았습니다.

항목 현재 정보
게이트웨이 모델 ID deepseek-v4-flash
출시일 2026년 7월 31일
출시 상태 정식 API 공개 베타
주요 개선 에이전트 실행, 코딩, 도구 사용, 복잡한 엔지니어링 작업
Responses API 네이티브 지원
Codex 공식 최적화
컨텍스트 게이트웨이 카탈로그 기준 1M
게이트웨이 배율 2.5배
참고 가격 약 CNY 1/백만 Tokens
이미지 입력 현재 게이트웨이 카탈로그에서 미지원

모델 제공 상태와 요금은 변경될 수 있습니다. 프로덕션 사용 전에 가격 페이지모델 가이드를 다시 확인하세요.

공식 에이전트 벤치마크

DeepSeek가 정식 V4 Flash에 대해 공개한 결과는 다음과 같습니다.

벤치마크 공식 결과
Terminal Bench 2.1 82.7
NL2Repo 54.2
Cybergym 76.7
DeepSWE 54.4
Toolathlon verified 70.3
Agent Last Exam 25.2
Automation Bench (Public) 25.1
DSBench-FullStack 68.7
DSBench-Hard 59.6

이 수치는 역량의 방향을 보여주지만 특정 저장소에서의 성공률을 보장하지 않습니다. DeepSeek는 공개 Code Agent 평가에 아직 공개되지 않은 최소 구성 DeepSeek Harness와 max 추론 단계, top_p=0.95, temperature=1.0을 사용했다고 설명했습니다. DSBench-FullStack과 DSBench-Hard는 내부 테스트 세트입니다.

도입을 검토할 때는 저장소, 도구, 권한, 승인 테스트를 고정하고 첫 시도 완료율, 도구 실패, 소요 시간, Token 사용량, 엔지니어 재작업 시간을 측정하세요.

Responses API와 Chat Completions의 차이

Chat Completions는 대화, 글쓰기, 번역, 요약 및 간단한 코딩 질문에 적합합니다. 기본 흐름은 메시지를 보내고 생성된 텍스트를 받는 방식입니다.

Responses API는 에이전트와 연속적인 도구 실행을 위해 설계되었습니다. 하나의 작업에 모델 출력, 함수 호출, 도구 결과 및 후속 추론을 포함할 수 있습니다. Codex는 이 프로토콜을 사용해 코드를 조사하고 파일을 수정하며 테스트를 실행한 다음 결과에 따라 작업을 계속합니다.

기능 Chat Completions Responses API
대화 및 텍스트 생성 적합 지원
구조화된 도구 호출 지원 가능 네이티브 워크플로
여러 도구의 연속 실행 클라이언트가 직접 조정 더 적합
Codex 연동 Codex 전송 프로토콜이 아님 필수
에이전트 이벤트 구조 단순함 더 풍부함
긴 엔지니어링 워크플로 추가 구현 필요 핵심 사용 사례

단순 대량 요약이나 질문에는 Chat Completions로 충분합니다. Codex, 터미널, 여러 단계의 엔지니어링 작업에는 /v1/responses를 사용하세요.

도구 기능의 경계

DeepSeek의 직접 Responses API 경로는 현재 OpenAI 호스팅 file_search, code_interpreter, computer_use 또는 MCP 도구를 네이티브로 제공하지 않습니다. 엔드포인트 이름이 /responses라고 해서 모델 제공자가 이러한 도구를 자동 실행하는 것은 아닙니다.

Codex에서 사용하는 파일 작업, Shell 명령, MCP 호출은 Codex 클라이언트가 조정하고 실행하는 기능입니다. 모델이 도구 호출을 생성하면 Codex가 로컬 또는 승인된 환경에서 도구를 실행하고 결과를 모델에 다시 전달합니다. 따라서 실제 기능은 모델뿐 아니라 Codex 버전, 도구 설정, 샌드박스, 권한 및 MCP Server에도 좌우됩니다.

Responses API로 DeepSeek V4 Flash 호출하기

작은 요청부터 시작하세요.

curl https://api.llm-token.cn/v1/responses \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect this repository and propose the smallest fix for the failing tests."
  }'

스트리밍, 함수 호출, 긴 컨텍스트 또는 터미널 중심 작업을 시험하기 전에 Base URL, API Key, 모델 ID, HTTP 상태 및 응답 이벤트 구조를 확인하세요.

Codex에서 다른 DeepSeek 모델로 바꾸지 마세요. DeepSeek의 현재 문서에서 Codex 지원을 명시한 모델은 deepseek-v4-flash뿐입니다. 다른 모델 ID는 프로토콜 오류, 도구 호출 실패, 작업 중단 또는 이벤트 형식 불일치를 일으킬 수 있습니다.

Codex에서 deepseek-v4-flash 설정하기

Codex CLI를 설치하거나 업데이트합니다.

npm install -g @openai/codex@latest
codex --version

~/.codex/config.toml에 Responses 제공자를 추가합니다.

model_provider = "llm-token"
model = "deepseek-v4-flash"
model_reasoning_effort = "high"

[model_providers.llm-token]
name = "LLM Token"
base_url = "https://api.llm-token.cn/v1"
wire_api = "responses"
requires_openai_auth = true

사용 중인 Codex 버전이 지원하는 안전한 인증 방식으로 게이트웨이 API Key를 제공하세요. 실제 키를 Git에 커밋하거나 예제 코드 또는 로그에 남기면 안 됩니다.

먼저 읽기 전용 작업을 실행하세요.

Read the repository structure and list its build command, test command, and three main modules. Do not modify files.

모델, 도구 호출, 컨텍스트 처리가 정상인지 확인한 후 파일 쓰기와 Shell 권한을 허용하세요. 설치에 대한 자세한 내용은 Codex 설정 가이드를 참고하세요.

권장 작업

  • 저장소 수준 분석, 버그 진단 및 범위가 제한된 수정
  • 테스트 실패 후 코드 조사와 반복 수정
  • 터미널 명령, 코드 검색 및 여러 단계의 엔지니어링 작업
  • MCP Server, 함수 호출 및 외부 도구 조정
  • 자동 테스트, 코드 리뷰 및 마이그레이션 계획
  • 에이전트 동작이 필요하지만 비용에 민감한 개발 작업

DeepSeek V4 Flash는 단순한 저비용 채팅 경로가 아닙니다. 낮은 게이트웨이 배율로 Codex와 에이전트 워크플로에 도입할 수 있다는 점이 핵심입니다. 프로덕션 에이전트에는 권한 경계, 시간 제한, 재시도 한도, Token 예산 및 사람에게 넘기는 조건이 필요합니다.

프로덕션 적용 전 체크리스트

  1. 모델 가이드에서 정확한 모델 ID deepseek-v4-flash를 복사하세요.
  2. Base URL은 https://api.llm-token.cn/v1, Codex 전송 프로토콜은 responses로 설정하세요.
  3. 짧은 요청으로 상태, 이벤트 구조, 선택된 모델 및 청구를 검증하세요.
  4. 읽기 전용 저장소 작업으로 파일 접근, 검색 및 컨텍스트 유지를 확인하세요.
  5. Shell, 패치, 함수 호출, MCP 및 여러 라운드의 도구 실행을 각각 테스트하세요.
  6. 파일, 데이터베이스, 결제, 배포 및 서버 작업의 권한 경계를 정의하세요.
  7. 비교용 저장소, 시작 commit, 의존성 및 승인 명령을 고정하세요.
  8. 완료율, P50/P95 소요 시간, 실패 유형 및 승인된 작업당 비용을 기록하세요.

자주 묻는 질문

DeepSeek V4 Flash는 Codex를 지원하나요?

예. DeepSeek는 정식 V4 Flash가 Responses API를 네이티브로 지원하고 Codex에 맞게 조정되었다고 밝혔습니다. 현재 공식 Codex 연동을 지원하는 DeepSeek 모델은 deepseek-v4-flash뿐입니다.

Codex에서 어떤 엔드포인트를 사용해야 하나요?

/v1/chat/completions가 아니라 /v1/responses를 사용하세요. 이 게이트웨이에서는 Base URL을 https://api.llm-token.cn/v1로 설정하고 wire_api = "responses"를 지정합니다.

Responses API가 MCP, 파일 및 Shell 도구를 직접 제공하나요?

아니요. DeepSeek 직접 Responses API는 현재 MCP, file_search, code_interpreter, computer_use를 네이티브로 제공하지 않습니다. 파일 작업, Shell, MCP는 사용자가 승인한 Codex 클라이언트가 실행하고 조정합니다.

DeepSeek V4 Pro를 Codex에서 사용할 수 있나요?

DeepSeek 문서는 V4 Pro가 2026년 8월 초 Codex를 지원할 예정이라고 설명합니다. 공식 API와 게이트웨이 경로가 지원을 확인하기 전에는 호환되는 것으로 간주하지 마세요.

DeepSeek V4 Flash 가격은 얼마인가요?

현재 게이트웨이 카탈로그의 배율은 2.5배이며 참고 가격은 약 CNY 1/백만 Tokens입니다. 최신 가격 페이지와 계정 원장이 기준입니다.

Responses API가 항상 Chat API보다 더 좋은가요?

아니요. 대화와 일회성 생성에는 Chat API가 더 단순합니다. Responses API는 Codex, 도구 사용, 연속적인 엔지니어링 워크플로에 특히 적합합니다.

API 액세스는 어디에서 구매할 수 있나요?

신규 사용자는 구매 페이지, 기존 API Key 사용자는 충전 페이지를 이용할 수 있습니다. 먼저 소액의 읽기 전용이며 되돌릴 수 있는 작업으로 시험하세요.

주요 출처