Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Back to blog

DeepSeek V4.1 Flash 공개: 552B 구조, API 가격, 마이그레이션 가이드

DeepSeek V4.1 FlashDeepSeek APIAPI 가격멀티모달 에이전트오픈 모델

DeepSeek V4.1 Flash는 2026년 9월 10일 공개되었고 모델 가중치도 오픈되었습니다. 공식 API 모델명은 deepseek-flash입니다. 텍스트와 이미지 입력을 받고 텍스트를 생성하며, 새로운 비대칭 구조를 사용합니다. 백본은 552B이고 입력 처리 시 토큰당 약 8B, 출력 생성 시 약 16B 파라미터를 활성화합니다. 자세한 내용은 DeepSeek 공식 릴리스를 참고하세요.

이번 업데이트에서 개발자가 주목할 점은 세 가지입니다. 에이전트 작업 능력 향상, 긴 컨텍스트 캐시 단가 하락, 그리고 기존 모델명 뒤의 실제 라우팅 변경입니다. 특히 deepseek-v4-pro는 DeepSeek가 2026년 9월 14일 12:00(베이징 시간) 이후, 향후 V4.1 Pro 출시 전까지 V4.1 Flash로 라우팅한다고 안내했습니다.

이 글의 이미지는 DeepSeek 공식 릴리스 원본을 사용합니다. 벤치마크 수치는 공급사가 공개한 값이며, 이 사이트가 독립적으로 재측정한 결과는 아닙니다.

DeepSeek V4.1 Flash 핵심 사양

항목 공개 정보
출시일 2026년 9월 10일
공식 API 모델명 deepseek-flash
모델 유형 네이티브 멀티모달 MoE. 텍스트/이미지 입력, 텍스트 출력
백본 파라미터 552B
입력/출력 활성 파라미터 8B / 16B
핵심 구조 Causal Encoder-Decoder, CED
컨텍스트 창 1M tokens
API 최대 출력 384K tokens
글로벌 KV Cache 890 bytes/token, 이전 V4 Flash의 약 1/4
가중치 및 저장소 라이선스 MIT

파라미터와 구조는 공식 모델 카드를 기준으로 확인해야 합니다. 컨텍스트, 출력 상한, 인터페이스 기능은 공식 가격 및 모델 사양 페이지를 기준으로 봅니다. 일부 요약은 약 550B라고 쓰지만, 이 글은 공식 표기인 552B를 사용합니다.

이 사이트를 통해 호출하려면 먼저 실시간 모델 가격을 확인하세요. DeepSeek 공식 릴리스와 서드파티 게이트웨이 동기화는 별개의 문제입니다. 설정은 현재 카탈로그의 실제 모델 ID, 응답 결과, 청구 기록을 기준으로 해야 합니다.

552B, 8B, 16B는 각각 무엇을 뜻하나

MoE 모델은 토큰을 생성할 때마다 모든 파라미터를 호출하지 않습니다. 552B는 모델 백본 규모이고, 8B와 16B는 각 계산 단계에서 토큰당 활성화되는 규모입니다. 세 값을 서로 바꿔 쓸 수 있는 “모델 크기”로 보면 안 됩니다.

V4.1 Flash의 CED 백본은 40개 층으로 구성되며, 20개 causal encoder 층과 20개 decoder 층을 사용합니다. 공식 모델 카드에 따르면 decoder의 글로벌 KV Cache는 각 decoder 층이 따로 만드는 것이 아니라 encoder의 최종 hidden state에서 projection됩니다. 이 구조 덕분에 입력 처리와 출력 생성이 서로 다른 계산 규모를 사용할 수 있습니다.

코드베이스 분석, 긴 문서 읽기, 다단계 도구 호출처럼 입력이 많고 같은 컨텍스트를 반복해서 읽는 작업에서는 입력 처리 부담을 줄이는 의미가 큽니다. 다만 활성 파라미터 수만으로 품질을 판단할 수 있다는 뜻도 아니고, 자체 배포에서 8B 가중치만 로드하면 된다는 뜻도 아닙니다.

에이전트 벤치마크: V4 Pro와 비교

아래 표는 공식 모델 카드의 비교 표를 정리한 것입니다. 변화량은 상대 비율이 아니라 점수 차이입니다.

벤치마크 V4 Pro V4.1 Flash 변화
DeepSWE v1.1 62.7 74.2 +11.5
Terminal-Bench 3.0 11.8 30.0 +18.2
AutomationBench 43.2 54.8 +11.6
CyberGym 83.3 88.1 +4.8
GPQA Diamond 92.4 90.9 −1.5

앞의 네 항목은 V4.1 Flash가 코드, 터미널, 자동화 작업에서 이전 Pro보다 강해졌다는 점을 보여줍니다. 하지만 GPQA Diamond는 V4 Pro보다 낮습니다. 따라서 정확한 결론은 에이전트 능력이 뚜렷하게 개선되었지만 모든 능력에서 전면 우위는 아니다입니다. 공식 평가 표와 테스트 조건

실행 환경도 중요합니다. 공식 Instruct 비교는 높은 추론 강도, temperature=1.0, top_p=0.95를 사용했습니다. DeepSWE v1.1의 74.2는 mini-SWE 환경 기준이며, 같은 모델은 DSH Minimal에서 72.6을 기록했습니다. 모델 버전, 작업 세트, 에이전트 프레임워크, 추론 예산이 모두 결과에 영향을 줍니다.

모델 선택 시에는 실제 업무에서 세 가지 작은 샘플을 뽑아보는 것이 좋습니다. 기존 테스트가 있는 코드 수정, 여러 명령이 필요한 터미널 작업, 스크린샷이나 차트가 포함된 자료 작업입니다. 완료율, 총 시간, 청구액을 비교하는 것이 단일 리더보드 점수보다 실무에 가깝습니다.

API 가격: 오프피크 입력 1위안, 출력 4위안 / 100만 토큰

이번 가격은 **2026년 9월 10일 12:00(베이징 시간)**부터 적용되었습니다. 아래 표는 DeepSeek 공식 직 API의 위안화 가격이며 단위는 위안 / 100만 tokens입니다. 이 사이트의 게이트웨이 가격이 아닙니다. 출처는 공식 가격 페이지입니다.

과금 항목 오프피크 피크
입력: 캐시 히트 ¥0.02 ¥0.04
입력: 캐시 미스 ¥1.00 ¥2.00
출력 ¥4.00 ¥8.00

피크 시간은 베이징 시간 월요일~금요일 09:00—12:00, 14:00—18:00입니다. 나머지 시간은 주말을 포함해 오프피크입니다. 휴일 대체근무를 추정하지 말고 이 명시된 시간대를 기준으로 판단해야 합니다.

DeepSeek V4.1 Flash 공식 위안화 API 가격 이미지: 오프피크 캐시 히트 0.02위안, 미스 1위안, 출력 4위안, 피크는 각각 0.04, 2, 8위안/100만 tokens

이미지 출처: DeepSeek 공식 릴리스. 원본 이미지를 수정하지 않았습니다. 가격은 변동될 수 있으며, 서드파티 서비스는 별도로 과금합니다.

다시 계산할 수 있는 에이전트 청구 예시

한 작업 묶음에서 캐시 히트 입력 800만 tokens, 캐시 미스 입력 200만 tokens, 출력 50만 tokens를 사용했고 모두 같은 시간대에서 과금되었다고 가정합니다.

총비용 = 히트 입력 백만 수 × 히트 단가
       + 미스 입력 백만 수 × 미스 단가
       + 출력 백만 수 × 출력 단가

오프피크: 8 × 0.02 + 2 × 1 + 0.5 × 4 = 4.16위안
피크:     8 × 0.04 + 2 × 2 + 0.5 × 8 = 8.32위안

두 입력 단가는 실제로 50배 차이가 나지만, 작업 전체가 50배 저렴해진다는 뜻은 아닙니다. 이 예시에서 오프피크 캐시 히트 입력은 0.16위안만 쓰지만, 캐시 미스 입력과 출력은 각각 2위안입니다. 최적화할 때는 캐시뿐 아니라 도구 반복 호출, 과도한 출력, 재시도도 함께 봐야 합니다.

KV Cache 축소가 긴 세션에서 중요한 이유

KV Cache는 컨텍스트의 중간 계산 결과를 저장합니다. 같은 코드베이스, 시스템 설명, 이전 대화를 반복해서 읽는 에이전트는 같은 prefix를 재사용해 중복 계산을 줄일 수 있습니다. DeepSeek는 V4.1 Flash의 글로벌 KV Cache를 890 bytes/token으로 압축했으며, 이는 V4 Flash의 약 1/4이라고 설명합니다. 공식 모델 카드의 구조 설명

DeepSeek 공식 세대별 글로벌 KV Cache 비교: V4 Flash는 토큰당 3514바이트, V4.1 Flash는 890바이트

이미지 출처: DeepSeek 공식 릴리스. 비교 대상은 토큰당 글로벌 KV Cache이며, 전체 배포 메모리가 아닙니다.

저장소 기준도 구분해야 합니다. 공식 발표의 HBM 요구량 약 1/4, SSD 요구량 약 1/8 감소는 캐시 자원에 대한 설명입니다. 전체 모델 가중치, 모든 런타임 메모리, 배포 클러스터가 같은 비율로 작아진다는 뜻은 아닙니다.

연동하는 쪽에서는 재사용 가능한 자료 prefix를 안정적으로 유지하는 것이 우선입니다. 매 턴마다 바뀌는 타임스탬프, 랜덤 번호, 재정렬된 도구 목록을 prefix에 넣지 마세요. 이후 실제 사용량 필드로 캐시 히트를 확인해야 합니다. “내용이 비슷하다”는 이유만으로 캐시 히트라고 예측하면 안 됩니다.

DeepSeek V4.1 Flash API 호출 방법

새 연동은 공식 모델명 **deepseek-flash**를 사용합니다. 아래는 DeepSeek 직 Chat Completions 엔드포인트의 텍스트 예시입니다. 터미널에서 DEEPSEEK_API_KEY를 먼저 설정한 뒤 실행하세요. 이 예시는 이 사이트의 유료 호출로 검증한 것은 아닙니다.

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-flash",
    "messages": [
      {
        "role": "user",
        "content": "Markdown 파일 일괄 이름 변경 도구의 구현 단계, 경계 조건, 검수 방법을 나열해 주세요."
      }
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high",
    "max_tokens": 2048,
    "stream": false
  }'

응답은 JSON이며 답변 텍스트는 choices[0].message.content에 있습니다. 검증할 때는 HTTP 상태, 반환 내용, usage를 함께 확인하세요. 요청이 전송되었다는 사실만으로는 충분하지 않습니다. 공식 최초 호출 안내

네이티브 비전은 이미지 이해를 의미하며 이미지 생성을 뜻하지 않습니다. 스크린샷을 처리할 때는 공식 이미지 이해 가이드에 따라 메시지에 이미지 콘텐츠 블록을 추가합니다. 순수 텍스트 요청 성공은 이미지 입력, 도구 호출, 스트리밍 반환 검증을 대체하지 않습니다.

서드파티 게이트웨이를 사용할 경우 Base URL, 모델 ID, 인증 방식, 프로토콜 지원을 함께 확인해야 합니다. 공식 주소만 바꾸면 모든 기능과 과금이 같다고 볼 수 없습니다.

기존 모델명은 계속 쓸 수 있나

현재 설정한 모델명 공식 처리 방식
deepseek-flash 새 연동 권장 이름이며 V4.1 Flash를 호출
deepseek-v4-flash 기존 모델은 종료. 이름은 일시 호환되며 V4.1 Flash로 라우팅
deepseek-v4-flash-vision-exp 기존 모델은 종료. 이름은 일시 호환되며 V4.1 Flash로 라우팅
deepseek-v4-pro 베이징 시간 2026-09-14 12:00 이후, 향후 V4.1 Pro 출시 전까지 V4.1 Flash로 라우팅하며 새 Flash 가격으로 과금

위 내용은 DeepSeek 공식 API 안내입니다. 서드파티 게이트웨이는 다른 별칭이나 전환 일정을 사용할 수 있습니다. 기존 이름을 유지한다고 해서 기존 모델이 고정되는 것은 아니며, 이전 가중치로 되돌리는 방법도 아닙니다.

마이그레이션은 세 단계가 안전합니다. 현재 모델명과 핵심 요청 샘플을 내보내고, 새 이름으로 텍스트·이미지·도구·캐시 사용량을 확인한 뒤, 클라이언트 기본 모델·작업 템플릿·청구 기록을 업데이트합니다. 재현성이 중요한 작업은 호출 날짜, 실제 공급사, 응답 정보를 모델 별칭과 함께 기록해야 합니다.

DeepSeek Harness v0.1.5 변경점

모델은 이해와 추론을 담당하고, Harness는 파일·명령·도구를 연결해 모델 출력이 실행 가능한 작업이 되도록 합니다. 이번 모델 공개와 함께 DeepSeek Harness는 v0.1.5로 업데이트되었고, 표준 모드, 프로그램식 도구 호출(PTC) 모드, 미니멀 모드에 맞게 조정되었습니다.

릴리스 자료에 따르면 새 버전은 이미지와 PDF 업로드, 워크스페이스 파일 트리, 산출물 미리보기, 긴 세션 복구와 탐색을 개선했습니다. 부모-자식 에이전트 양방향 통신, 대기열 메시지, 작업 개입도 강화되었습니다. 실험적 Agent Teams는 공유 작업 목록으로 분업할 수 있지만 기본값은 꺼져 있으며, 켤 경우 추가 토큰 사용량을 고려해야 합니다.

Node.js가 설치된 시스템에서는 공식 저장소의 안내에 따라 시작할 수 있습니다.

npx @deepseek-ai/dsh web

시작 후 Web UI에 DeepSeek API Key를 입력하고 워크스페이스를 선택한 뒤 작업을 제출합니다. 이 명령은 실행 시점에 사용 가능한 패키지를 가져오므로 v0.1.5를 고정 설치하지 않습니다. 과거 환경 재현이 필요하면 실제 버전을 따로 기록해야 합니다.

검수 가능한 작은 작업부터 시작하세요.

현재 워크스페이스의 프로젝트 설명을 읽고 Markdown 시작 가이드를 작성해 주세요.
시작 명령, 필요한 설정, 최소 검증 단계를 명확히 적어 주세요.
docs/getting-started-draft.md만 새로 만들고 업무 코드는 변경하지 마세요.
완료 후 문서에 적은 경로가 존재하는지 확인하고, 확인하지 못한 정보를 나열해 주세요.

기대 결과는 실제로 열 수 있는 Markdown 파일이지, 채팅의 “완료” 메시지만이 아닙니다. 파일 생성 여부, 경로 정확성, 명령의 출처를 확인한 뒤 작업 범위를 넓히세요. 더 많은 클라이언트 설정은 이 사이트의 튜토리얼을 참고할 수 있습니다.

일반 PC에서 자체 배포할 수 있나

“입력에서 8B만 활성화한다”는 사실만으로 “8B급 하드웨어에서 배포 가능하다”고 결론낼 수 없습니다. V4.1 Flash의 백본은 여전히 552B이며, 실제 배포는 가중치 정밀도, 런타임 지원, 캐시, 동시성, 저장소 구조에 따라 달라집니다.

모델과 가중치는 MIT 라이선스입니다. 시작점은 공식 모델 저장소기술 보고서입니다. 릴리스는 약 2,000장의 GPU와 저장소 클러스터 자원을 갖춘 팀을 대상으로 한 대규모 배포 협력을 언급합니다. 이는 협력 조건이지, 공개된 최소 배포 사양이 아닙니다.

애플리케이션 개발, 에이전트 실행, 비즈니스 효과 검증이 주요 목표라면 먼저 API로 품질과 비용 데이터를 얻고 나서 자체 배포를 평가하는 편이 보통 더 근거 있는 선택입니다.

FAQ

DeepSeek V4.1 Flash는 550B인가요, 552B인가요?

공식 릴리스 페이지와 모델 카드는 백본 파라미터를 552B로 표기합니다. 550B는 일부 소개 글의 근사 표현입니다. 사양표나 배포 평가에는 공식 표기를 사용하세요.

V4.1 Flash의 API 모델 ID는 무엇인가요?

DeepSeek 공식 권장 ID는 deepseek-flash입니다. 표시 이름을 바탕으로 deepseek-v4.1-flash를 직접 만들지 마세요. 어떤 서드파티 플랫폼이 그 별칭을 쓰더라도 공식 인터페이스명이라는 뜻은 아닙니다.

0.02위안으로 아무 토큰이나 100만 개 살 수 있나요?

아닙니다. 0.02위안 / 100만 tokens는 오프피크 캐시 히트 입력에만 적용됩니다. 캐시 미스 입력, 출력, 피크 시간은 각각 다른 가격입니다.

V4.1 Flash는 비전 이해와 이미지 생성 모두 지원하나요?

텍스트와 이미지 입력을 받고 텍스트를 생성합니다. 스크린샷 이해와 차트 분석에는 사용할 수 있지만, 공식 모델 카드는 이미지 생성 모델로 정의하지 않았습니다.

V4 Pro는 이미 완전히 종료되었나요?

이 글의 게시일인 2026년 9월 10일 기준으로, 공식 발표는 9월 14일 12:00 이후 전환 일정입니다. 그 시점 전에 이미 전면 전환되었다고 쓰면 안 됩니다. 두 개의 기존 Flash 모델은 종료되었고 이름만 일시 호환됩니다.

이 사이트도 공식 피크/오프피크 가격으로 청구하나요?

그렇게 단정하면 안 됩니다. 위 가격표는 DeepSeek 공식 직 API 기준입니다. 이 사이트의 모델 ID, 가용성, 과금은 실시간 모델 가격과 실제 청구 기록을 기준으로 확인하세요. 대상 모델을 확인한 뒤 구매 페이지에서 소액 검증을 시작할 수 있습니다.

요약: 전환 전에 작업 총비용을 먼저 확인하세요

DeepSeek V4.1 Flash는 네이티브 비전, 비대칭 계산, 더 작은 컨텍스트 캐시를 결합합니다. 긴 입력과 다단계 도구 호출을 사용하는 에이전트라면 실제 작업으로 검증해볼 가치가 있습니다. 기존 API 애플리케이션에서는 기존 별칭의 라우팅 변화와 9월 14일 V4 Pro 전환 시간을 먼저 확인해야 합니다.

실무 순서는 모델 ID 확인 → 자체 작업으로 검수 → 캐시와 출력 청구 확인 → 설정 업데이트입니다. 그래야 모델 출시 소식이 실제로 사용할 수 있고 측정 가능한 애플리케이션 업그레이드가 됩니다.

참고 출처

자료 확인일: 2026년 9월 10일. 이 글은 릴리스 정보 해설과 연동 가이드이며, 독립 성능 평가가 아닙니다.