Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Kembali ke blog

Panduan Tencent Hy4 Preview 2026: MoE 770B, konteks 1M dan ejen pengekodan

Tencent HunyuanHy4 previewejen pengekodanMoEkonteks 1MTokenHub

Logo rasmi Tencent Hy4 preview

Pada 29 Ogos 2026, kami meneliti Hy4 preview, yang dilancarkan oleh Tencent sehari sebelumnya. Perubahan pentingnya bukan sekadar peralihan daripada Hy3 kepada Hy4: Tencent meningkatkan backbone kepada 770B parameter, meluaskan konteks kepada 1M, dan terus menilai model ini dalam CodeBuddy, WorkBuddy serta aliran kerja kejuruteraan sebenar.

Dalam satu ayat: Hy4 preview ialah model MoE sumber terbuka unggulan baharu Tencent Hunyuan untuk pengekodan, ejen, analisis pejabat, pembangunan permainan dan penyelidikan saintifik; nama model rasmi yang disediakan secara tempatan ialah hy4-preview, tetapi ID model, harga dan ketersediaan berbeza mengikut platform.

Panduan ini berasaskan keluaran Tencent, repositori rasmi, halaman Tencent Cloud TokenHub dan kertas kerja utama yang dipetik oleh repositori tersebut. Benchmark vendor bukan ujian bebas oleh laman ini. Pada masa pengesahan, katalog live laman ini belum menyenaraikan hy4-preview, jadi artikel ini tidak mendakwa bahawa laluan gateway sudah dibuka.

Fakta utama Hy4 preview

Perkara Maklumat rasmi yang disahkan
Tarikh keluaran 28 Ogos 2026
Nama rasmi Tencent Hy4 preview
Seni bina Mixture-of-Experts (MoE)
Parameter backbone 770B keseluruhan, 49B aktif
Lapisan MTP asli 10B keseluruhan, 0.7B aktif
Kedalaman backbone 78 lapisan
Susunan pakar 256 pakar routed + 1 pakar dikongsi; top-8 pakar routed diaktifkan bagi setiap token
Attention / residual Gated DSA + IndexCache; empat aliran residual iHC
Konteks 1M dalam repositori; Tencent Cloud menyenaraikan input maksimum 960K dan output maksimum 64K
Model rasmi yang disediakan secara tempatan hy4-preview
Weight terbuka tencent/Hy4-preview, tencent/Hy4-preview-FP8
Lesen Apache 2.0
Harga senarai awam Tencent Cloud Guangzhou Input CNY 6, output CNY 18, cache read CNY 0.3 bagi setiap 1M token

Pengesahan terakhir pada 29 Ogos 2026. Sebelum penggunaan production, semak semula konsol TokenHub, rantau sasaran, harga semasa dan medan penggunaan dalam response.

Apakah Hy4 preview, dan adakah ini keluaran akhir Hy4?

Hy4 preview ialah iterasi awal Hy4, bukannya keluaran akhir masa depan yang tidak mempunyai akhiran preview. Tencent mendokumentasikan isu yang diketahui secara jelas, termasuk mengambil masa lebih lama daripada perlu untuk membuat penaakulan tentang tugas kompleks dan terlalu banyak mengesahkan kerjanya sendiri.

Sempadan ini penting. “Preview unggulan” bermaksud model itu sudah mempunyai weight terbuka, resipi inference, pipeline fine-tuning dan akses API. Ia tidak bermaksud tingkah laku, harga atau tahap perkhidmatannya sudah ditetapkan secara kekal.

Tencent juga menyediakan Hy4 preview dalam WorkBuddy, CodeBuddy, Yuanbao dan ima, dengan akses API melalui Tencent Cloud TokenHub dan OpenRouter. Ini mencukupi untuk memulakan penilaian, namun aliran kerja kritikal masih perlu menetapkan versi, mengekalkan suite regression dan menyediakan model fallback.

Apakah perubahan pada seni bina MoE 770B?

Backbone Hy4 preview mempunyai 78 lapisan. Lapisan pertama menggunakan FFN dense; 77 lapisan yang lain ialah lapisan MoE dengan 256 pakar routed dan satu pakar dikongsi. Setiap token mengaktifkan lapan pakar routed teratas bersama pakar dikongsi tersebut.

Satu lapisan MTP asli menyokong speculative decoding. Tencent melaporkan backbone dengan 770B parameter keseluruhan dan 49B parameter aktif; apabila MTP dimasukkan, tambahan itu ialah 10B keseluruhan dan 0.7B aktif. Jika satu halaman menyatakan 770B dan halaman lain menghampiri 780B, semak sama ada MTP telah dikira.

Attention menggunakan Gated DeepSeek Sparse Attention (Gated DSA) dengan IndexCache untuk menggunakan semula sparse index merentas lapisan. Laluan residual menggunakan empat aliran identity Hyper-Connection (iHC). Secara bersama, reka bentuk ini menyasarkan pengiraan dan aliran maklumat yang boleh diurus pada konteks 1M serta skala MoE yang besar.

Repositori itu turut menyatakan 64 attention head, dimensi pemampatan query 2,048, dimensi pemampatan key-value 512 dan indexer top-k 2,048. Nilai ini membantu keserasian dengan inference framework dan perancangan kapasiti; ia tidak membuktikan hasil mana-mana tugas dengan sendirinya.

Bagaimanakah tetingkap konteks 1M patut ditafsirkan?

Repositori Tencent menyenaraikan panjang konteks 1M. Halaman produk Tencent Cloud menerangkan had hosted sebanyak input maksimum 960K dan output maksimum 64K. Kedua-duanya boleh wujud serentak kerana tetingkap model, output yang diperuntukkan oleh perkhidmatan hosted, system prompt dan margin keselamatan menggunakan sempadan pengiraan yang berbeza.

Jangan mulakan ujian production dengan permintaan yang hampir kepada satu juta token. Gunakan tahap seperti 32K, 128K, 256K, 512K dan konteks ultra-panjang, sambil merekodkan:

  • masa ke token pertama dan latency hujung ke hujung
  • token input, output dan cache-read
  • ketepatan retrieval merentas fail
  • kadar kejayaan tool call dan bilangan retry
  • kadar lulus tugas dan masa kerja semula oleh manusia

Kapasiti konteks bukan ketepatan automatik. Repositori besar, buku kerja kewangan dan korpus penyelidikan masih memerlukan retrieval, pengasingan permission dan pautan bukti.

Sejauh manakah Hy4 preview untuk Coding dan Agent?

Lampiran benchmark Tencent melaporkan peningkatan meluas berbanding Hy3 dalam kejuruteraan perisian, penggunaan alat dan tugas konteks panjang. Nilai terpilih daripada jadual rasmi yang sama adalah seperti berikut:

Penilaian yang diterbitkan Tencent Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench (dengan tools) 51.5 65.4

Ini ialah keputusan yang diterbitkan Tencent, bukan ujian bebas oleh laman ini. Tencent menyatakan bahawa model dinilai pada tetapan reasoning tertinggi yang tersedia, beberapa keputusan bertanda bintang dijalankan oleh Tencent, dan harness, bajet token, sumber sandbox serta pensampelan berulang mempengaruhi skor.

Jadual yang sama menghalang pemilihan keputusan secara berat sebelah: Hy4 preview mendapat 17.5 pada ProgramBench, lebih rendah daripada Kimi K3, GPT 5.6 Sol dan Claude Opus 5 dalam perbandingan Tencent. Peningkatan antara generasi memang nyata, tetapi Hy4 bukan peneraju bagi setiap benchmark Coding.

Apakah yang ditunjukkan oleh penilaian pakar untuk 203 tugas?

Tencent menjalankan penilaian buta dengan 163 pakar dalaman merentas 203 tugas kejuruteraan sebenar. Keputusan yang diterbitkan ialah:

  • Hy4 preview: purata 2.99 / 4
  • GLM 5.3: 2.92 / 4; Hy4 menang 46.8%, seri 12.8% dan kalah 40.4%
  • Kimi K3: 2.94 / 4; Hy4 menang 51.2%, seri 7.9% dan kalah 40.9%

Ini penting kerana tugas tersebut datang daripada kerja perisian, permainan, kewangan dan keselamatan Tencent, bukan hanya leaderboard awam. Namun, ia masih merupakan penilaian dalaman vendor, bukannya benchmark pihak ketiga yang boleh dihasilkan semula sepenuhnya dengan set tugas dan rubrik awam.

Kaedah penggunaan yang boleh dipercayai ialah membina suite regression daripada repositori, dokumen dan arahan penerimaan anda sendiri, kemudian membandingkan kadar lulus, latency dan kos keseluruhan dengan model yang sudah anda jalankan.

Apakah workload yang sesuai untuk Hy4 preview?

  • ejen pengekodan jangka panjang yang merancang, menampal, menyahpepijat dan mengesahkan
  • kerja frontend yang memerlukan kod, hierarki visual dan kualiti interaksi secara serentak
  • aliran kerja pejabat merentas fail yang menghasilkan dokumen, hamparan dan pembentangan
  • prototaip permainan yang boleh dimainkan, diikuti kerja enjin berbilang pusingan
  • pemodelan kewangan dan analisis data berbilang fail
  • penyelidikan dalam AI, dinamik molekul, fizik jirim terkondensasi dan matematik
  • carian berbantukan alat dan aliran kerja pengetahuan dengan konteks 1M

Operasi write dalam production masih memerlukan policy gate atau kelulusan manusia untuk shell, pangkalan data, pembayaran, permission dan mesej luaran. Model yang lebih kuat tidak menghapuskan risiko kebenaran ejen.

Berapakah harga rasmi Hy4 preview?

Tencent Cloud TokenHub kini memaparkan harga rujukan berikut untuk Guangzhou:

Item bil Harga awam
Input CNY 6 / 1M token
Output CNY 18 / 1M token
Cache read CNY 0.3 / 1M token

Ini ialah harga direct Tencent Cloud yang khusus kepada rantau dan masa tertentu, bukan harga sejagat untuk platform pihak ketiga. OpenRouter, penyedia inference lain dan self-hosting mempunyai ekonomi berasingan; gandaan gateway tidak boleh disimpulkan daripada harga direct TokenHub.

Pada masa pengesahan 29 Ogos 2026, halaman harga live laman ini belum menyenaraikan hy4-preview. Jika ia ditambah kemudian, gunakan katalog live dan request ledger, bukannya harga direct Tencent Cloud dalam artikel ini.

Jangan campurkan ID model Hy4 ini

Laluan akses Nama / ID yang perlu digunakan
Model rasmi yang disediakan secara tempatan dalam repositori hy4-preview
OpenRouter tencent/hy4-preview
Weight BF16 Hugging Face tencent/Hy4-preview
Weight FP8 Hugging Face tencent/Hy4-preview-FP8

Gateway API biasanya tidak menukar nama repositori Hugging Face kepada ID model hosted. Salin pengecam yang tepat daripada platform sasaran dan sahkan dengan panggilan senarai model atau permintaan minimum.

Bagaimanakah cara self-host dan memanggil Hy4 preview?

Tencent mengesyorkan vLLM atau SGLang. Selepas pelancaran, panggil model yang disediakan secara tempatan melalui API Chat Completions yang serasi dengan OpenAI:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

Tencent mengesyorkan temperature=0.9 dan top_p=1.0. Model ini menggunakan reasoning tinggi secara lalai. Template tempatan repositori menggunakan chat_template_kwargs.reasoning_effort = "no_think" untuk jawapan terus; penyedia hosted mungkin mendedahkan medan sambungan yang berbeza.

Resipi vLLM rasmi menggunakan tensor parallelism lapan hala, MTP speculative decoding, backend attention FLASHMLA_SPARSE dan parser tool serta reasoning hy_v4. Jangan tampal resipi ini pada perkakasan dengan GPU, pemacu, imej atau framework yang berbeza tanpa semakan kapasiti.

Hy4 preview berbanding Hy3

Dimensi Hy3 Hy4 preview
Skala rasmi 295B keseluruhan / 21B aktif 770B keseluruhan / 49B aktif
Konteks 256K 1M
Kedudukan ejen dan produktiviti kos efektif flagship baharu untuk pengekodan, ejen dan produktiviti kompleks
Kematangan berkembang daripada preview kepada keluaran formal Hy4 preview peringkat awal
Kos self-hosting lebih rendah jauh lebih tinggi

Hy3 masih praktikal apabila kos, skala deployment dan kematangan menjadi keutamaan. Masukkan Hy4 preview ke dalam penilaian terkawal apabila anda memerlukan konteks lebih panjang serta kejuruteraan jangka panjang atau pelaksanaan alat yang lebih kuat, tetapi jangan menggantikan model production hanya berdasarkan jumlah parameter.

Senarai semak penilaian production

  1. Salin ID model yang tepat daripada platform sasaran; jangan teka huruf besar-kecil atau namespace.
  2. Tetapkan versi model, prompt, alat, tahap reasoning, timeout dan output maksimum.
  3. Mulakan dengan tugas read-only sebelum memberikan kesan sampingan kepada fail, shell, pangkalan data atau perkhidmatan luaran.
  4. Ukur kadar lulus dengan repositori sebenar dan arahan penerimaan, bukan berdasarkan tanggapan perbualan.
  5. Uji tahap konteks daripada 32K ke atas dan rekodkan latency, penggunaan cache serta jumlah bil.
  6. Tetapkan bilangan pusingan maksimum, bajet token dan approval gate untuk tugas kompleks.
  7. Sahkan tool call, structured output dan pemetaan medan reasoning pada penyedia sasaran.
  8. Simpan suite regression, laluan fallback dan rollback pantas untuk model preview.

Kesimpulan utama

  • Hy4 preview dilancarkan dan dibuka sebagai sumber terbuka pada 28 Ogos 2026 sebagai flagship MoE baharu Tencent Hunyuan.
  • Backbone-nya mempunyai 770B parameter keseluruhan dan 49B aktif, serta lapisan MTP asli 10B/0.7B.
  • Repositori menyenaraikan konteks 1M; Tencent Cloud menyenaraikan input maksimum 960K dan output maksimum 64K.
  • Tencent melaporkan peningkatan besar berbanding Hy3 dalam Coding, penggunaan alat dan konteks panjang, tetapi bukan kepimpinan dalam setiap benchmark.
  • hy4-preview, tencent/hy4-preview dan tencent/Hy4-preview-FP8 ialah pengecam khusus platform.
  • Gateway ini belum membuka laluan tersebut pada masa penerbitan; ketersediaan dan bil perlu disahkan melalui katalog live.

Soalan lazim

Adakah Hy4 preview telah dilancarkan secara rasmi?

Ya. Tencent mengeluarkan dan membuka Hy4 preview sebagai sumber terbuka pada 28 Ogos 2026, dengan akses melalui WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub dan OpenRouter. Ia kekal sebagai preview, bukan keluaran akhir Hy4.

Adakah Hy4 preview multimodal?

Repositori pelancaran Tencent membentangkannya sebagai model bahasa untuk pengekodan, ejen dan produktiviti, dengan spesifikasi awam yang memfokuskan teks, alat dan konteks panjang. Jangan menganggap input imej atau video hanya kerana keluarga Hunyuan yang lebih luas mempunyai model visual; semak jadual keupayaan penyedia sasaran.

Berapakah panjang konteks Hy4 preview?

Repositori menyatakan konteks 1M. Tencent Cloud secara berasingan menyenaraikan input maksimum 960K dan output maksimum 64K untuk perkhidmatan hosted.

Apakah ID API rasmi Hy4 preview?

Nama model yang disediakan oleh repositori rasmi ialah hy4-preview; OpenRouter menggunakan tencent/hy4-preview; weight self-hosted menggunakan tencent/Hy4-preview atau varian FP8. ID konsol platform sasaran mempunyai keutamaan.

Adakah Hy4 preview menyokong tool calling?

Resipi vLLM Tencent mengaktifkan parser alat hy_v4 dan pemilihan alat automatik, manakala suite benchmarknya merangkumi Toolathlon dan MCP-Atlas. Sahkan parameter hosted yang tepat dengan penyedia.

Berapakah kos Hy4 preview?

Tencent Cloud TokenHub kini menunjukkan input CNY 6, output CNY 18 dan cache read CNY 0.3 bagi setiap juta token di Guangzhou. Rantau, platform dan promosi boleh mengubah harga.

Bolehkah saya memanggil Hy4 preview melalui gateway ini sekarang?

Pada masa pengesahan 29 Ogos 2026, katalog live dan upstream yang diaktifkan belum menyenaraikan hy4-preview. Semak halaman harga live untuk ketersediaan kemudian.

Bolehkah Hy4 preview digunakan dengan Claude Code atau ejen pengekodan lain?

Model ini menyasarkan pengekodan dan ejen serta menyokong laluan serving tempatan yang serasi dengan OpenAI. Keserasian klien masih bergantung pada protokol, bentuk tool call, output reasoning dan lapisan keserasian penyedia; sahkan permintaan minimum dan regression alat terlebih dahulu.

Sumber utama