Your privacy choices

Allow optional cookies for referral attribution, visit analytics, and Google Ads purchase measurement.

Zurück zum Blog

Tencent Hy4 Preview Guide 2026: 770B-MoE, 1M-Kontext und Coding-Agenten

Tencent HunyuanHy4 previewCoding-AgentMoE1M-KontextTokenHub

Offizielles Tencent-Hy4-preview-Logo

Am 29. August 2026 haben wir Hy4 preview geprüft, das Tencent einen Tag zuvor veröffentlicht hat. Die wichtige Änderung ist nicht nur der Schritt von Hy3 zu Hy4: Tencent hat das Backbone auf 770B Parameter skaliert, den Kontext auf 1M erweitert und das Modell weiter in CodeBuddy, WorkBuddy und realen Engineering-Workflows evaluiert.

Kurz gesagt: Hy4 preview ist das neue Open-Source-MoE-Flaggschiff von Tencent Hunyuan für Coding, Agenten, Office-Analysen, Spieleentwicklung und wissenschaftliche Forschung; der offizielle lokal bereitgestellte Modellname lautet hy4-preview, aber Modell-IDs, Preise und Verfügbarkeit unterscheiden sich je nach Plattform.

Dieser Leitfaden stützt sich auf die Veröffentlichung von Tencent, das offizielle Repository, die Tencent-Cloud-TokenHub-Seiten und die im Repository zitierten Primärarbeiten. Anbieter-Benchmarks sind keine unabhängigen Tests dieser Website. Zum Zeitpunkt der Prüfung führte das Live-Katalog dieser Website hy4-preview nicht; dieser Artikel behauptet daher nicht, dass die Gateway-Route bereits geöffnet ist.

Wichtige Fakten zu Hy4 preview

Punkt Verifizierte offizielle Information
Veröffentlichungsdatum 28. August 2026
Offizieller Name Tencent Hy4 preview
Architektur Mixture-of-Experts (MoE)
Backbone-Parameter 770B gesamt, 49B aktiv
Native MTP-Schicht 10B gesamt, 0.7B aktiv
Backbone-Tiefe 78 Schichten
Expertenaufbau 256 geroutete + 1 geteilter Experte; pro Token werden die Top-8 gerouteten Experten aktiviert
Attention / Residual Gated DSA + IndexCache; vier iHC-Residual-Streams
Kontext 1M im Repository; Tencent Cloud nennt maximal 960K Eingabe und 64K Ausgabe
Offizielles lokal bereitgestelltes Modell hy4-preview
Offene Gewichte tencent/Hy4-preview, tencent/Hy4-preview-FP8
Lizenz Apache 2.0
Öffentlicher Tencent-Cloud-Listenpreis für Guangzhou CNY 6 Eingabe, CNY 18 Ausgabe, CNY 0.3 Cache-Lesen pro 1M Tokens

Zuletzt geprüft am 29. August 2026. Prüfen Sie vor dem Produktionseinsatz erneut die TokenHub-Konsole, die Zielregion, den aktuellen Preis und die Nutzungsfelder in den Antwortdaten.

Was ist Hy4 preview, und ist es die finale Hy4-Version?

Hy4 preview ist eine frühe Hy4-Iteration und keine zukünftige finale Version ohne den Suffix preview. Tencent dokumentiert ausdrücklich bekannte Probleme, darunter längeres als nötiges Nachdenken bei komplexen Aufgaben und eine Tendenz, die eigene Arbeit zu stark zu verifizieren.

Diese Abgrenzung ist wichtig. „Preview-Flaggschiff“ bedeutet, dass das Modell bereits offene Gewichte, Inferenz-Rezepte, eine Fine-Tuning-Pipeline und API-Zugriff bietet. Es bedeutet nicht, dass Verhalten, Preis oder Service-Level dauerhaft festgeschrieben sind.

Tencent stellt Hy4 preview außerdem in WorkBuddy, CodeBuddy, Yuanbao und ima bereit, mit API-Zugriff über Tencent Cloud TokenHub und OpenRouter. Das rechtfertigt eine Evaluierung; für kritische Workflows sollten Sie dennoch Versionen pinnen, Regressionssuiten pflegen und ein Fallback-Modell bereithalten.

Was hat sich an der 770B-MoE-Architektur geändert?

Das Hy4-preview-Backbone hat 78 Schichten. Die erste verwendet ein dichtes FFN; die übrigen 77 sind MoE-Schichten mit 256 gerouteten Experten und einem geteilten Experten. Für jedes Token werden die Top-8 gerouteten Experten zusammen mit dem geteilten Experten aktiviert.

Eine native MTP-Schicht unterstützt spekulatives Decoding. Tencent gibt für das Backbone 770B Parameter gesamt und 49B aktive Parameter an; einschließlich MTP kommen 10B gesamt und 0.7B aktiv hinzu. Wenn eine Seite 770B und eine andere einen Wert nahe 780B nennt, prüfen Sie, ob MTP einbezogen wurde.

Die Attention verwendet Gated DeepSeek Sparse Attention (Gated DSA) mit IndexCache, um Sparse-Indizes schichtübergreifend wiederzuverwenden. Der Residual-Pfad nutzt vier identity Hyper-Connection (iHC)-Streams. Zusammen zielen diese Designs bei 1M-Kontext und großer MoE-Skalierung auf kontrollierbaren Rechenaufwand und Informationsfluss.

Das Repository nennt außerdem 64 Attention-Heads, eine Query-Kompressionsdimension von 2,048, eine Key-Value-Kompressionsdimension von 512 und ein Indexer-Top-k von 2,048. Diese Werte helfen bei der Kompatibilität mit Inferenz-Frameworks und der Kapazitätsplanung; sie beweisen für sich genommen kein bestimmtes Aufgabenergebnis.

Wie sollte man das 1M-Kontextfenster verstehen?

Das Tencent-Repository nennt eine Kontextlänge von 1M. Die Tencent-Cloud-Produktseite beschreibt gehostete Grenzen von maximal 960K Eingabe und 64K Ausgabe. Beides kann gleichzeitig gelten, weil Modellfenster, reservierte Ausgabe, System-Prompt und Sicherheitsmarge des gehosteten Dienstes unterschiedliche Abrechnungsgrenzen verwenden.

Beginnen Sie Produktionstests nicht mit einer Anfrage nahe einer Million Tokens. Verwenden Sie Stufen wie 32K, 128K, 256K, 512K und Ultra-Langkontext und erfassen Sie:

  • Zeit bis zum ersten Token und die Ende-zu-Ende-Latenz
  • Eingabe-, Ausgabe- und Cache-Lese-Tokens
  • Genauigkeit des dateiübergreifenden Abrufs
  • Erfolgsquote und Wiederholungsanzahl von Tool-Aufrufen
  • Erfolgsquote der Aufgaben und Zeit für menschliche Nacharbeit

Kontextkapazität bedeutet nicht automatisch Korrektheit. Große Repositories, Finanzarbeitsmappen und Forschungskorpora benötigen weiterhin Retrieval, Berechtigungsisolation und Beleg-Links.

Wie leistungsfähig ist Hy4 preview für Coding und Agenten?

Der Benchmark-Anhang von Tencent berichtet über breite Verbesserungen gegenüber Hy3 bei Software Engineering, Tool-Nutzung und Langkontext-Aufgaben. Einige Werte aus derselben offiziellen Tabelle:

Von Tencent veröffentlichte Evaluation Hy3 Hy4 preview
SWE-bench Multilingual 75.8 82.9
DeepSWE 28.0 64.3
SWE Atlas - Refactoring 32.9 53.3
Terminal-Bench 2.1 70.8 85.4
Toolathlon-Verified 56.2 74.1
OneMillionBench (mit Tools) 51.5 65.4

Das sind von Tencent veröffentlichte Ergebnisse und keine unabhängigen Tests dieser Website. Tencent weist darauf hin, dass die Modelle mit der jeweils höchsten verfügbaren Reasoning-Einstellung evaluiert wurden, einige mit Stern markierte Ergebnisse von Tencent ausgeführt wurden und Harnesses, Token-Budgets, Sandbox-Ressourcen sowie wiederholtes Sampling die Scores beeinflussen.

Dieselbe Tabelle verhindert Cherry-Picking: Hy4 preview erreicht 17.5 auf ProgramBench und liegt damit in Tencent's Vergleich hinter Kimi K3, GPT 5.6 Sol und Claude Opus 5. Der Fortschritt zur vorherigen Generation ist real, aber Hy4 führt nicht jeden Coding-Benchmark an.

Was zeigt die Expertenevaluation mit 203 Aufgaben?

Tencent führte mit 163 internen Experten eine Blindbewertung von 203 realen Engineering-Aufgaben durch. Das veröffentlichte Ergebnis:

  • Hy4 preview: Durchschnitt 2.99 / 4
  • GLM 5.3: 2.92 / 4; Hy4 gewann 46.8 %, lag in 12.8 % gleichauf und verlor 40.4 %
  • Kimi K3: 2.94 / 4; Hy4 gewann 51.2 %, lag in 7.9 % gleichauf und verlor 40.9 %

Das ist relevant, weil die Aufgaben aus Tencent's Software-Engineering-, Gaming-, Finanz- und Sicherheitsarbeit stammten und nicht nur aus öffentlichen Leaderboards. Es bleibt jedoch eine interne Anbieter-Evaluation und kein vollständig reproduzierbarer Drittanbieter-Benchmark mit öffentlichem Aufgabensatz und Bewertungsraster.

Die zuverlässige Einführungsmethode besteht darin, aus den eigenen Repositories, Dokumenten und Abnahmekommandos eine Regressionssuite zu erstellen und anschließend Erfolgsquote, Latenz und Gesamtkosten mit den bereits eingesetzten Modellen zu vergleichen.

Für welche Workloads eignet sich Hy4 preview?

  • Coding-Agenten mit langem Horizont, die planen, patchen, debuggen und verifizieren
  • Frontend-Arbeit, bei der Code, visuelle Hierarchie und Interaktionsqualität gemeinsam zählen
  • dateiübergreifende Office-Workflows für Dokumente, Tabellen und Präsentationen
  • spielbare Prototypen mit anschließender mehrturniger Engine-Arbeit
  • Finanzmodellierung und dateiübergreifende Datenanalyse
  • Forschung zu KI, Molekulardynamik, kondensierter Materie und Mathematik
  • Tool-gestützte Suche und Wissensarbeit über 1M-Kontext

Produktive Schreibvorgänge benötigen weiterhin Richtlinien oder menschliche Freigaben für Shell, Datenbanken, Zahlungen, Berechtigungen und externe Nachrichten. Ein stärkeres Modell beseitigt nicht das Autorisierungsrisiko eines Agenten.

Wie hoch ist der offizielle Preis von Hy4 preview?

Tencent Cloud TokenHub zeigt derzeit folgende Referenzpreise für Guangzhou:

Abrechnungselement Öffentlicher Preis
Eingabe CNY 6 / 1M Tokens
Ausgabe CNY 18 / 1M Tokens
Cache-Lesen CNY 0.3 / 1M Tokens

Das ist ein regions- und zeitabhängiger Direktpreis von Tencent Cloud und kein universeller Preis für Drittanbieterplattformen. OpenRouter, andere Inferenzanbieter und Self-Hosting haben eine eigene Kostenstruktur; ein Gateway-Multiplikator lässt sich nicht aus dem direkten TokenHub-Preis ableiten.

Zum Prüfzeitpunkt am 29. August 2026 führte die Live-Preisseite dieser Website hy4-preview nicht. Falls das Modell später hinzugefügt wird, verwenden Sie den Live-Katalog und das Request-Ledger statt des in diesem Artikel genannten direkten Tencent-Cloud-Preises.

Diese Hy4-Modell-IDs nicht vermischen

Zugangsweg Zu verwendender Name / ID
Lokal bereitgestelltes Modell des offiziellen Repositories hy4-preview
OpenRouter tencent/hy4-preview
Hugging-Face-BF16-Gewichte tencent/Hy4-preview
Hugging-Face-FP8-Gewichte tencent/Hy4-preview-FP8

Ein API-Gateway übersetzt einen Hugging-Face-Repositorienamen normalerweise nicht in eine gehostete Modell-ID. Kopieren Sie die exakte Kennung aus der Zielplattform und prüfen Sie sie mit einem Model-List-Aufruf oder einer Minimalanfrage.

Wie hostet und ruft man Hy4 preview selbst auf?

Tencent empfiehlt vLLM oder SGLang. Nach dem Start rufen Sie das lokal bereitgestellte Modell über eine OpenAI-kompatible Chat-Completions-API auf:

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:8000/v1",
    api_key="EMPTY",
)

response = client.chat.completions.create(
    model="hy4-preview",
    messages=[
        {"role": "user", "content": "Review this patch and list the highest-risk regressions."}
    ],
    temperature=0.9,
    top_p=1.0,
)

print(response.choices[0].message.content)

Tencent empfiehlt temperature=0.9 und top_p=1.0. Das Modell verwendet standardmäßig starkes Reasoning. Das lokale Template des Repositories nutzt chat_template_kwargs.reasoning_effort = "no_think" für direkte Antworten; gehostete Anbieter können andere Erweiterungsfelder anbieten.

Das offizielle vLLM-Rezept verwendet achtfaches Tensor-Parallelism, spekulatives MTP-Decoding, das Attention-Backend FLASHMLA_SPARSE sowie hy_v4-Parser für Tools und Reasoning. Übertragen Sie das Rezept nicht ohne Kapazitätsprüfung auf Hardware mit anderem GPU-, Treiber-, Image- oder Framework-Support.

Hy4 preview im Vergleich zu Hy3

Dimension Hy3 Hy4 preview
Offizielle Größenordnung 295B gesamt / 21B aktiv 770B gesamt / 49B aktiv
Kontext 256K 1M
Positionierung kosteneffiziente Agenten und Produktivität neues Flaggschiff für Coding, Agenten und komplexe Produktivität
Reifegrad von Preview zu formaler Veröffentlichung weiterentwickelt frühe Hy4 preview
Self-Hosting-Kosten niedriger deutlich höher

Hy3 bleibt sinnvoll, wenn Kosten, Deployment-Größe und Reifegrad ausschlaggebend sind. Nehmen Sie Hy4 preview in eine kontrollierte Evaluation auf, wenn Sie längeren Kontext und stärkere Engineering- oder Tool-Aufgaben mit langem Horizont benötigen; ersetzen Sie ein Produktionsmodell jedoch nicht allein aufgrund der Gesamtparameterzahl.

Checkliste für die Produktionsevaluation

  1. Kopieren Sie die exakte Modell-ID von der Zielplattform; raten Sie weder Groß-/Kleinschreibung noch Namespace.
  2. Pinnen Sie Modellversion, Prompt, Tools, Reasoning-Stufe, Timeout und maximale Ausgabe.
  3. Beginnen Sie mit Read-only-Aufgaben, bevor Sie Datei-, Shell-, Datenbank- oder externe Seiteneffekte freigeben.
  4. Messen Sie die Erfolgsquote mit realen Repositories und Abnahmekommandos, nicht anhand eines Chat-Eindrucks.
  5. Testen Sie Kontextstufen ab 32K und erfassen Sie Latenz, Cache-Nutzung und Gesamtabrechnung.
  6. Setzen Sie für komplexe Aufgaben maximale Turns, Token-Budgets und Freigabegates.
  7. Prüfen Sie Tool-Aufrufe, strukturierte Ausgabe und die Abbildung von Reasoning-Feldern beim Zielanbieter.
  8. Halten Sie für ein Preview-Modell eine Regressionssuite, eine Fallback-Route und einen schnellen Rollback bereit.

Wichtigste Erkenntnisse

  • Hy4 preview wurde am 28. August 2026 als neues MoE-Flaggschiff von Tencent Hunyuan veröffentlicht und als Open Source bereitgestellt.
  • Das Backbone hat 770B Parameter gesamt und 49B aktiv, zusätzlich eine native MTP-Schicht mit 10B/0.7B.
  • Das Repository nennt 1M-Kontext; Tencent Cloud nennt maximal 960K Eingabe und 64K Ausgabe.
  • Tencent berichtet große Fortschritte gegenüber Hy3 bei Coding, Tool-Nutzung und Langkontext, aber keine Führung in jedem Benchmark.
  • hy4-preview, tencent/hy4-preview und tencent/Hy4-preview-FP8 sind plattformspezifische Kennungen.
  • Dieses Gateway hatte die Route zum Veröffentlichungszeitpunkt nicht geöffnet; Verfügbarkeit und Abrechnung müssen im Live-Katalog geprüft werden.

Häufig gestellte Fragen

Ist Hy4 preview offiziell erschienen?

Ja. Tencent hat Hy4 preview am 28. August 2026 veröffentlicht und als Open Source bereitgestellt, mit Zugriff über WorkBuddy, CodeBuddy, Yuanbao, ima, TokenHub und OpenRouter. Es bleibt eine Preview und ist nicht die finale Hy4-Version.

Ist Hy4 preview multimodal?

Das Launch-Repository von Tencent beschreibt es als Sprachmodell für Coding, Agenten und Produktivität; die öffentlichen Spezifikationen konzentrieren sich auf Text, Tools und Langkontext. Leiten Sie Bild- oder Videoeingabe nicht allein daraus ab, dass die breitere Hunyuan-Familie visuelle Modelle umfasst; prüfen Sie die Fähigkeitstabelle des Zielanbieters.

Wie lang ist das Kontextfenster von Hy4 preview?

Das Repository nennt 1M-Kontext. Tencent Cloud nennt für den gehosteten Dienst separat maximal 960K Eingabe und 64K Ausgabe.

Wie lautet die offizielle Hy4-preview-API-ID?

Der vom offiziellen Repository bereitgestellte Modellname lautet hy4-preview; OpenRouter verwendet tencent/hy4-preview; Self-Hosting nutzt tencent/Hy4-preview oder die FP8-Variante. Die ID in der Konsole der Zielplattform hat Vorrang.

Unterstützt Hy4 preview Tool-Aufrufe?

Das vLLM-Rezept von Tencent aktiviert den hy_v4-Toolparser und die automatische Toolauswahl; die Benchmark-Suite umfasst außerdem Toolathlon und MCP-Atlas. Prüfen Sie die exakten Parameter beim Anbieter.

Was kostet Hy4 preview?

Tencent Cloud TokenHub zeigt für Guangzhou derzeit CNY 6 Eingabe, CNY 18 Ausgabe und CNY 0.3 Cache-Lesen pro Million Tokens. Region, Plattform und Aktionen können den Preis ändern.

Kann ich Hy4 preview jetzt über dieses Gateway aufrufen?

Zum Prüfzeitpunkt am 29. August 2026 führten der Live-Katalog und die aktivierten Upstreams hy4-preview nicht. Prüfen Sie die Live-Preisseite auf eine spätere Verfügbarkeit.

Funktioniert Hy4 preview mit Claude Code oder einem anderen Coding-Agenten?

Das Modell zielt auf Coding und Agenten und unterstützt einen lokalen OpenAI-kompatiblen Bereitstellungspfad. Die Client-Kompatibilität hängt jedoch weiterhin von Protokoll, Tool-Call-Format, Reasoning-Ausgabe und Kompatibilitätsschicht des Anbieters ab; validieren Sie zuerst eine Minimalanfrage und eine Tool-Regression.

Primärquellen