Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Back to blog

Tencent Hy4 preview API 가이드 2026: 770B MoE, 1M 컨텍스트와 코딩 에이전트

Tencent HunyuanHy4 previewCoding AgentMoE1M 컨텍스트TokenHub

Tencent Hy4 preview 공식 로고

2026년 8월 29일, Tencent가 하루 전에 공개한 Hy4 preview를 검토했습니다. 중요한 변화는 단순히 Hy3에서 Hy4로 세대가 바뀌었다는 점이 아닙니다. Tencent는 백본을 770B 파라미터로 확장하고 컨텍스트를 1M으로 늘렸으며, CodeBuddy, WorkBuddy와 실제 엔지니어링 워크플로에서 계속 평가하고 있습니다.

한 문장으로 요약하면 Hy4 preview는 코딩, 에이전트, 오피스 분석, 게임 개발과 과학 연구를 위한 Tencent Hunyuan의 새로운 오픈 MoE 플래그십입니다. 공식 셀프호스팅 served model 이름은 hy4-preview지만 모델 ID, 가격과 사용 가능 여부는 플랫폼마다 다릅니다.

이 가이드는 Tencent의 출시 발표, 공식 저장소, Tencent Cloud TokenHub 페이지와 저장소가 인용한 1차 논문을 바탕으로 작성했습니다. 공급업체 벤치마크는 이 사이트가 독립적으로 수행한 테스트가 아닙니다. 확인 당시 이 사이트의 실시간 카탈로그에는 hy4-preview가 등록되어 있지 않았으므로 게이트웨이 라우트가 이미 개방되었다고 주장하지 않습니다.

Hy4 preview 핵심 정보

항목 확인된 공식 정보
출시일 2026년 8월 28일
공식 이름 Tencent Hy4 preview
아키텍처 Mixture-of-Experts (MoE)
백본 파라미터 총 770B, 활성 49B
네이티브 MTP 레이어 총 10B, 활성 0.7B
백본 깊이 78개 레이어
전문가 구성 라우팅 전문가 256개 + 공유 전문가 1개, 토큰당 라우팅 top-8 활성화
어텐션 / 잔차 Gated DSA + IndexCache, 4개 iHC 잔차 스트림
컨텍스트 저장소는 1M, Tencent Cloud는 최대 입력 960K·최대 출력 64K
공식 로컬 served model hy4-preview
오픈 웨이트 tencent/Hy4-preview, tencent/Hy4-preview-FP8
라이선스 Apache 2.0
Tencent Cloud 광저우 공개 가격 입력 CNY 6, 출력 CNY 18, 캐시 읽기 CNY 0.3 / 100만 토큰

최종 확인일은 2026년 8월 29일입니다. 프로덕션 도입 전에 TokenHub 콘솔, 대상 리전, 현재 가격과 실제 응답의 usage 필드를 다시 확인하세요.

Hy4 preview란 무엇이며 최종 Hy4 릴리스인가?

Hy4 preview는 Hy4의 초기 버전이며, preview 접미사가 없는 미래의 최종 릴리스와 같은 모델이 아닙니다. Tencent는 복잡한 작업에서 필요 이상으로 오래 추론하거나 자신의 결과를 과도하게 검증하는 등 알려진 문제를 공식적으로 문서화했습니다.

이 경계는 중요합니다. “플래그십 preview”라는 표현은 이미 오픈 웨이트, 추론 레시피, 파인튜닝 파이프라인과 API 진입점이 있다는 뜻입니다. 모델 동작, 가격과 서비스 수준이 영구히 고정됐다는 뜻은 아닙니다.

Tencent는 WorkBuddy, CodeBuddy, Yuanbao와 ima에서도 Hy4 preview를 제공하고 Tencent Cloud TokenHub와 OpenRouter를 통한 API 접근도 제공합니다. 평가 풀에 넣기에는 충분하지만, 중요한 프로덕션 흐름에서는 버전을 고정하고 회귀 테스트를 유지하며 대체 모델을 남겨야 합니다.

770B MoE 아키텍처에서 무엇이 바뀌었나?

Hy4 preview 백본은 78개 레이어로 구성됩니다. 첫 번째 레이어는 Dense FFN을 사용하고 나머지 77개는 MoE 레이어입니다. 각 레이어에는 라우팅 전문가 256개와 공유 전문가 1개가 있으며, 모든 토큰은 라우팅 전문가 상위 8개와 공유 전문가를 활성화합니다.

백본에는 speculative decoding을 지원하는 네이티브 MTP 레이어도 있습니다. Tencent는 백본을 총 770B·활성 49B 파라미터로 보고하며, MTP를 포함하면 총 10B·활성 0.7B가 추가됩니다. 어떤 페이지는 770B, 다른 페이지는 780B에 가깝게 표시한다면 MTP가 포함됐는지 먼저 확인하세요.

어텐션에는 Gated DeepSeek Sparse Attention (Gated DSA) 을 사용하고 IndexCache로 레이어 간 sparse index를 재사용합니다. 잔차 경로에는 4개의 identity Hyper-Connection (iHC) 스트림을 사용합니다. 이 설계들은 1M 컨텍스트와 대규모 MoE에서 계산량과 정보 흐름을 관리하기 위한 것입니다.

저장소는 어텐션 헤드 64개, 쿼리 압축 차원 2,048, 키-값 압축 차원 512, 인덱서 top-k 2,048도 명시합니다. 이 값들은 추론 프레임워크 호환성과 용량 계획에 유용하지만, 그 자체로 특정 작업 결과를 증명하지는 않습니다.

1M 컨텍스트 윈도우는 어떻게 이해해야 하나?

Tencent 저장소는 컨텍스트 길이를 1M으로 표시합니다. Tencent Cloud 제품 페이지는 호스팅 서비스 한도를 최대 입력 960K, 최대 출력 64K로 설명합니다. 모델 윈도우와 호스팅 서비스의 예약 출력, 시스템 프롬프트, 안전 여유분은 서로 다른 계산 경계를 사용하므로 두 표기는 함께 존재할 수 있습니다.

프로덕션 테스트를 100만 토큰에 가까운 요청으로 시작하지 마세요. 32K, 128K, 256K, 512K와 초장문 컨텍스트처럼 구간을 나누고 다음을 기록하세요.

  • 첫 토큰까지의 시간과 엔드투엔드 지연
  • 입력, 출력과 캐시 읽기 토큰
  • 파일 간 검색 정확도
  • 도구 호출 성공률과 재시도 횟수
  • 작업 통과율과 사람의 재작업 시간

컨텍스트 용량이 자동으로 정확성을 보장하지는 않습니다. 대규모 저장소, 재무 워크북과 연구 자료에는 여전히 검색, 권한 격리와 근거 링크가 필요합니다.

코딩과 에이전트에서 Hy4 preview는 얼마나 강한가?

Tencent의 벤치마크 부록은 소프트웨어 엔지니어링, 도구 사용과 장문 컨텍스트 작업에서 Hy3보다 폭넓은 향상을 보고합니다. 같은 공식 표에서 일부 수치를 옮기면 다음과 같습니다.

Tencent 공개 평가 Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench (with tools) 51.5 65.4

이 수치는 Tencent가 발표한 결과이며 이 사이트의 독립 테스트가 아닙니다. Tencent는 당시 사용 가능한 최고 추론 설정으로 모델을 평가했고, 별표가 붙은 일부 결과는 Tencent가 직접 실행했으며, 하네스, 토큰 예산, 샌드박스 자원과 반복 샘플링이 점수에 영향을 준다고 설명합니다.

같은 표는 높은 점수만 골라 인용하지 않도록 경고합니다. Tencent의 비교에서 Hy4 preview의 ProgramBench 점수는 17.5로 Kimi K3, GPT 5.6 Sol, Claude Opus 5보다 낮습니다. 세대가 바뀌며 성능이 향상된 것은 맞지만 Hy4가 모든 코딩 벤치마크에서 1위인 것은 아닙니다.

203개 실제 작업의 전문가 평가는 무엇을 보여 주나?

Tencent는 163명의 사내 전문가를 대상으로 203개의 실제 엔지니어링 작업을 블라인드 평가했습니다. 공개된 결과는 다음과 같습니다.

  • Hy4 preview: 평균 2.99 / 4
  • GLM 5.3: 평균 2.92 / 4, Hy4 승리 46.8%, 무승부 12.8%, 패배 40.4%
  • Kimi K3: 평균 2.94 / 4, Hy4 승리 51.2%, 무승부 7.9%, 패배 40.9%

이 결과가 중요한 이유는 작업이 공개 리더보드만이 아니라 Tencent의 소프트웨어 엔지니어링, 게임, 금융과 보안 업무에서 나왔기 때문입니다. 그러나 공개 작업 세트와 평가 기준을 갖춘 완전 재현 가능한 제3자 벤치마크는 아니며, 여전히 공급업체 내부 평가입니다.

신뢰할 수 있는 도입 방법은 자신의 저장소, 문서와 승인 명령으로 회귀 테스트를 만든 다음 기존 모델과 통과율, 지연과 총비용을 비교하는 것입니다.

Hy4 preview에 적합한 워크로드

  • 계획, 패치, 디버깅과 검증까지 수행하는 장기 코딩 에이전트
  • 코드뿐 아니라 시각적 계층과 상호작용 품질도 중요한 프론트엔드 작업
  • 문서, 스프레드시트와 프레젠테이션을 산출하는 여러 파일 기반 오피스 워크플로
  • 실행 가능한 게임 프로토타입을 만들고 여러 턴에 걸쳐 엔진 작업을 수행하는 흐름
  • 재무 모델링과 여러 파일을 다루는 데이터 분석
  • AI, 분자동역학, 응집물질물리와 수학 연구
  • 1M 컨텍스트에서 도구를 사용하는 검색과 지식 작업

프로덕션에서 쓰기 작업을 수행한다면 shell, 데이터베이스, 결제, 권한과 외부 메시지에 정책 게이트 또는 사람의 승인이 필요합니다. 더 강력한 모델이 에이전트 권한 위험을 없애 주지는 않습니다.

Hy4 preview의 공식 가격은 얼마인가?

Tencent Cloud TokenHub는 현재 광저우 리전에 대해 다음 참고 가격을 표시합니다.

과금 항목 공개 가격
입력 CNY 6 / 100만 토큰
출력 CNY 18 / 100만 토큰
캐시 읽기 CNY 0.3 / 100만 토큰

이는 특정 지역과 시점의 Tencent Cloud 직접 연결 가격이며, 모든 제3자 플랫폼에 적용되는 보편적인 가격이 아닙니다. OpenRouter, 다른 추론 공급업체와 셀프호스팅은 각자의 비용 구조를 사용하며 TokenHub 직접 가격으로 게이트웨이 배수를 추론할 수 없습니다.

2026년 8월 29일 확인 당시 이 사이트의 실시간 가격 페이지에는 hy4-preview가 등록되어 있지 않았습니다. 나중에 추가되더라도 이 글의 Tencent Cloud 직접 가격 대신 실시간 카탈로그와 요청 원장을 사용하세요.

Hy4 모델 ID를 혼용하지 마세요

접근 경로 사용해야 할 이름 / ID
공식 저장소의 로컬 served model hy4-preview
OpenRouter tencent/hy4-preview
Hugging Face BF16 웨이트 tencent/Hy4-preview
Hugging Face FP8 웨이트 tencent/Hy4-preview-FP8

일반적으로 API 게이트웨이는 Hugging Face 저장소 이름을 호스팅 모델 ID로 자동 변환하지 않습니다. 대상 플랫폼에서 정확한 식별자를 복사하고 모델 목록 호출 또는 최소 요청으로 확인하세요.

Hy4 preview를 셀프호스팅하고 호출하는 방법

Tencent는 vLLM 또는 SGLang을 권장합니다. 실행한 뒤 OpenAI 호환 Chat Completions API로 로컬 served model을 호출할 수 있습니다.

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

Tencent는 temperature=0.9와 top_p=1.0을 권장합니다. 모델의 기본값은 high reasoning입니다. 저장소의 로컬 템플릿은 직접 답변할 때 chat_template_kwargs.reasoning_effort = "no_think"를 사용해 사고 과정을 끕니다. 호스팅 공급업체가 같은 확장 필드를 제공하는지는 해당 공급업체의 문서를 따라야 합니다.

공식 vLLM 레시피는 8-way tensor parallelism, MTP speculative decoding, FLASHMLA_SPARSE 어텐션 백엔드와 hy_v4 tool/reasoning parser를 사용합니다. GPU, 드라이버, 이미지 또는 프레임워크 지원이 다른 장비에 용량 확인 없이 예시 명령을 그대로 붙여 넣지 마세요.

Hy4 preview와 Hy3 비교

차원 Hy3 Hy4 preview
공식 규모 총 295B / 활성 21B 총 770B / 활성 49B
컨텍스트 256K 1M
포지셔닝 비용 효율적인 에이전트와 생산성 코딩, 에이전트와 복잡한 생산성을 위한 새 플래그십
성숙도 preview에서 정식 릴리스로 발전 초기 Hy4 preview
셀프호스팅 비용 낮음 상당히 높음

비용, 배포 규모와 성숙도가 중요하다면 Hy3도 여전히 실용적입니다. 더 긴 컨텍스트, 강한 장기 소프트웨어 엔지니어링과 도구 실행이 필요할 때 Hy4 preview를 통제된 평가에 추가하세요. 다만 총 파라미터 수만으로 프로덕션 모델을 교체하지 마세요.

프로덕션 평가 체크리스트

  1. 대상 플랫폼에서 정확한 모델 ID를 복사하고 대소문자나 네임스페이스를 추측하지 마세요.
  2. 모델 버전, 프롬프트, 도구, 추론 강도, timeout과 최대 출력을 고정하세요.
  3. 파일, shell, 데이터베이스와 외부 부작용을 허용하기 전에 읽기 전용 작업부터 시작하세요.
  4. 채팅 인상이 아니라 실제 저장소와 승인 명령으로 통과율을 측정하세요.
  5. 32K부터 초장문 컨텍스트까지 구간별로 테스트하고 지연, 캐시 사용량과 총 과금을 기록하세요.
  6. 복잡한 작업에는 최대 턴 수, 토큰 예산과 승인 게이트를 설정하세요.
  7. 대상 공급업체에서 도구 호출, 구조화된 출력과 reasoning 필드 매핑을 검증하세요.
  8. preview 모델을 위해 회귀 테스트, 대체 경로와 빠른 롤백을 준비하세요.

핵심 요약

  • Hy4 preview는 2026년 8월 28일 출시·오픈소스화된 Tencent Hunyuan의 새로운 MoE 플래그십입니다.
  • 백본은 총 770B·활성 49B이며 네이티브 10B/0.7B MTP 레이어가 추가됩니다.
  • 저장소는 1M 컨텍스트를, Tencent Cloud는 최대 입력 960K와 최대 출력 64K를 표시합니다.
  • Tencent는 코딩, 도구 사용과 장문 컨텍스트에서 Hy3보다 큰 향상을 보고했지만 모든 벤치마크에서 앞선 것은 아닙니다.
  • hy4-preview, tencent/hy4-preview와 tencent/Hy4-preview-FP8은 플랫폼별 식별자입니다.
  • 이 글이 작성된 시점에 이 게이트웨이는 해당 라우트를 열지 않았습니다. 사용 가능 여부와 과금은 실시간 카탈로그에서 확인해야 합니다.

자주 묻는 질문

Hy4 preview는 공식 출시됐나요?

네. Tencent는 2026년 8월 28일 Hy4 preview를 출시하고 오픈소스화했으며 WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub와 OpenRouter에서 접근 경로를 제공합니다. 다만 preview이며 최종 Hy4 릴리스는 아닙니다.

Hy4 preview는 멀티모달인가요?

Tencent의 출시 저장소는 이 모델을 코딩, 에이전트와 생산성을 위한 언어 모델로 소개하며 공개 사양은 텍스트, 도구와 장문 컨텍스트에 초점을 둡니다. Hunyuan 제품군에 비전 모델이 포함된다는 이유만으로 이미지나 동영상 입력을 추정하지 말고 대상 공급업체의 기능표를 확인하세요.

Hy4 preview의 컨텍스트 길이는 얼마인가요?

저장소는 1M 컨텍스트를 명시합니다. Tencent Cloud는 호스팅 서비스에 대해 최대 입력 960K와 최대 출력 64K를 별도로 표시합니다.

Hy4 preview의 공식 API ID는 무엇인가요?

공식 저장소의 served model 이름은 hy4-preview이고 OpenRouter는 tencent/hy4-preview를 사용합니다. 셀프호스팅 웨이트는 tencent/Hy4-preview 또는 FP8 변형입니다. 최종적으로는 대상 플랫폼 콘솔의 ID를 우선하세요.

Hy4 preview는 도구 호출을 지원하나요?

Tencent의 vLLM 레시피는 hy_v4 tool parser와 자동 도구 선택을 활성화하며 벤치마크에는 Toolathlon과 MCP-Atlas가 포함됩니다. 호스팅 API의 정확한 파라미터는 공급업체 문서로 확인하세요.

Hy4 preview의 가격은 얼마인가요?

Tencent Cloud TokenHub는 현재 광저우에서 입력 CNY 6, 출력 CNY 18, 캐시 읽기 CNY 0.3 / 100만 토큰을 표시합니다. 지역, 플랫폼과 프로모션에 따라 가격은 바뀔 수 있습니다.

이 게이트웨이에서 지금 Hy4 preview를 호출할 수 있나요?

2026년 8월 29일 확인 당시 실시간 카탈로그와 활성화된 upstream에는 hy4-preview가 등록되어 있지 않았습니다. 이후 제공 여부는 실시간 가격 페이지에서 확인하세요.

Hy4 preview를 Claude Code나 다른 코딩 에이전트와 함께 사용할 수 있나요?

이 모델은 코딩과 에이전트를 대상으로 하며 로컬 OpenAI 호환 서빙 경로를 지원합니다. 실제 클라이언트 호환성은 프로토콜, 도구 호출 형식, reasoning 출력과 공급업체 호환 레이어에 따라 달라지므로 먼저 최소 요청과 도구 회귀 테스트를 수행하세요.

주요 출처