返回部落格列表

美團 LongCat-2.0 評測:在國產算力集群上完成訓練與推理的 Agentic Coding 大模型,值得接入嗎?

美團LongCat-2.0國產算力Agentic Coding開源大模型AI ASIC中國大模型

美團 LongCat-2.0 官方發布封面

如果你最近在搜 美團 LongCat-2.0,大概率不是想看一篇普通的「新模型發布速報」。

你真正關心的,多半是下面這幾個問題:

  • 它到底是不是在中國本土算力上把訓練和推理都跑通了
  • 它更像一個聊天模型,還是更像一個 Agentic Coding 模型
  • 它有沒有到值得企業、開發團隊和 API 整合方認真測試的程度

我把 美團 2026 年 6 月 30 日官方技術博文、LongCat-2.0 官方 GitHub README,以及 Hugging Face 官方模型卡 放在一起看了一遍,結論其實很明確:

LongCat-2.0 最值得看的地方,不只是參數大,也不只是開源,而是它把「國產算力 + 萬億參數 + 訓練與推理全流程 + Agentic Coding」這幾件事真正拼到了一起。

而且這裡有一個很重要的口徑要先講清楚:

很多人會口語化地說「國產顯卡訓練的大模型」,但美團官方更準確的表述其實是「國產算力集群」「國產晶片」以及 GitHub README 裡的 AI ASIC superpods

也就是說,這個題材如果你是拿來做採購判斷、技術評估或 SEO 文章,最好不要偷換成消費級 GPU 敘事,按官方口徑寫成 國產算力 / 國產晶片 / AI ASIC 集群 會更穩。

先說結論

  • 截至 2026 年 7 月 6 日,LongCat-2.0 最硬的一點,不是「會寫程式碼」,而是 官方明確宣稱它是在五萬卡國產算力集群上完成全流程訓練與推理的萬億參數模型
  • 從公開資料看,LongCat-2.0 的定位並不是通用聊天,而是明顯偏向 長上下文、Agentic Coding、工具調用與複雜工作流、企業級真實任務執行
  • 如果你關心的是 中國大模型、國產算力訓練、程式碼智慧體、企業 Agent、長上下文程式碼理解,LongCat-2.0 絕對值得進測試名單。
  • 如果你關心的是「它是不是已經到了可以無腦替代一切海外閉源模型」的程度,我的答案會更克制。
  1. 值得認真測
  2. 值得接入評估
  3. 尤其值得在 Coding、Agent、長任務這幾類場景裡測
  4. 但最終能不能成為你的主路由,還是要看你自己的任務集、延遲、穩定性和總成本

這次發布真正重要的,不是參數,而是「全流程」

美團官方技術博文的發布時間是 2026 年 6 月 30 日。這次公開資訊裡,最關鍵的不是「又一個大模型」,而是這幾個點被放在了一起:

  • 總參數量 1.6T
  • 平均激活約 48B
  • 動態激活範圍 33B 到 56B
  • 原生支援 1M 上下文
  • 在五萬卡國產算力集群上完成訓練與推理全流程

這幾個點疊在一起,意義就不一樣了。

因為很多模型發布,講的是:

  • 模型能力
  • 跑分
  • 開源

但 LongCat-2.0 這次更強的訊號其實是:

它在公開口徑裡同時強調了訓練工程、推理工程、長上下文架構和 Agentic Coding 任務定位。

這說明它不是一個只適合做發布會 PPT 的模型,而是在往「可以長期跑、可以穩定接、可以做複雜任務」的方向打。

國產算力這件事,到底硬在哪裡

先說最核心的事實口徑。

美團官方技術博文明確寫的是:

  • LongCat 團隊從 2023 年開始探索國產算力
  • 從千卡逐步擴到五萬卡集群
  • 攻克了算子適配、通訊優化、分散式穩定性等問題
  • 最終完成 萬億參數模型在國產算力上的穩定訓練與推理

官方還給了幾個很工程化的指標:

  • 月均日故障率降低 70% 以上
  • 訓練 MFU 提升 1.5 倍
  • 穩態日吞吐超過 1T tokens/day

如果你熟悉大模型工程,就知道這幾個指標比「模型會不會作詩」更重要。

因為這代表的不是單次 demo,而是下面這些問題被認真解掉了:

  • 大規模訓練時硬體故障怎麼扛
  • 通訊異常怎麼處理
  • 顯存和數值波動怎麼穩
  • 訓練吞吐怎麼拉起來
  • 推理階段怎麼把萬億參數 MoE 真正跑到低延遲可用

換句話說,LongCat-2.0 這次最有價值的,某種意義上不是「國產模型」四個字,而是:

它在官方公開資料裡已經把國產算力平台上的訓練工程能力和推理工程能力一起擺上檯面了。

它為什麼不是普通聊天模型,而是明顯偏 Agentic Coding

LongCat-2.0 官方公開評測圖

LongCat-2.0 在產品和架構口徑上,都不是那種「什麼都能聊一點」的通用發布文案。

相反,它的公開描述從頭到尾都在強調:

  • 程式碼理解
  • 程式碼生成
  • 自動執行
  • 工具調用
  • 真實 Agent 工作流

官方倉庫 README 甚至直接寫到,它深度適配了:

  • Claude Code
  • OpenClaw
  • Hermes

這就很說明問題了。

因為一個模型如果只是想講「通用能力」,沒必要主動把自己和這類 Agent harness 綁得這麼緊。LongCat-2.0 這麼寫,基本就是在告訴開發者:

它不是只想做聊天入口,而是想進到真實開發流和 Agent 執行流裡。

這也是為什麼我覺得,它最適合拿來測的,不是純問答,而是這些場景:

  • 倉庫級程式碼理解
  • 多檔案修改
  • 工具調用
  • 自動化任務執行
  • 長專案上下文
  • 複雜流程推理

架構上最值得看的三件事

如果只從公開資料裡提三個最值得記的技術點,我會選這三個:

1. LongCat Sparse Attention

LongCat-2.0 官方強調自己用 LongCat Sparse Attention 來把長文本處理從平方級成本往線性級方向壓。

這件事為什麼重要?

因為當上下文真的拉到 1M 時,問題已經不是「能不能塞進去」,而是:

  • 能不能穩定定位關鍵資訊
  • 能不能在長鏈任務裡不嚴重掉精度
  • 推理代價會不會高到不可用

對做 Agent、長文件和大型程式碼庫任務的人來說,這比「宣傳 1M 上下文」本身更重要。

2. 零計算專家 + 動態激活

官方給出的激活範圍是 33B~56B,平均約 48B

它想解決的不是一刀切地給每個 token 同樣算力,而是:

  • 簡單 token 少花算力
  • 複雜 token 多給算力

這個思路特別適合程式碼和工具鏈任務,因為這類任務裡不同 token 的複雜度差異本來就很大。

3. MOPD 多專家融合

LongCat-2.0 官方把專家能力拆成了三組:

  • Agent Experts
  • Reasoning Experts
  • Interaction Experts

這背後的意思也很直接:

  • 不只是會補程式碼
  • 不只是會做推理
  • 還要把工具調用、互動、糾錯這幾個執行層能力一起做好

所以它看起來更像一個 為複雜執行鏈設計的大模型,而不是單純追求某個單項 benchmark 的模型。

公開跑分能說明什麼

官方放出來的幾組成績,我覺得最值得看的不是「贏了誰」,而是它的能力輪廓:

  • Terminal-Bench 2.170.8
  • SWE-bench Pro59.5
  • SWE-bench Multilingual77.3
  • FORTE73.2
  • RWSearch78.8
  • BrowseComp79.9

這組分數給我的判斷是:

1. 它最該被當成 Coding / Agent 模型來測

尤其是 Terminal-Bench 2.1SWE-bench ProSWE-bench Multilingual 這一排,已經很明確說明:

LongCat-2.0 的核心敘事不是「文學創作」或者「閒聊體驗」,而是工程任務與智慧體任務。

2. 它不是只會寫程式碼,也在往 General Agent 方向補齊

FORTERWSearchBrowseComp 這些分數說明它也在做:

  • 搜尋
  • 檢索
  • 辦公任務
  • 多步規劃

這就意味著 LongCat-2.0 的潛在落地方向,不只是 IDE 內補全,而是:

把模型真正接進業務工作流。

真實工作場景裡,它更像「工作夥伴」還是「炫技模型」?

我對這次發布比較認可的一點,是美團官方沒有只停在 benchmark。

它們公開展示的真實任務方向包括:

  • AI SQL Agent
  • 程式碼庫遷移和舊外掛重構
  • 從一句話到完整應用開發
  • Three.js 3D 互動展示生成
  • AI 小說工廠式的多 Agent 內容流水線

這些案例當然是官方選出來的展示場景,不等於你拿到手就一定一模一樣。但它們至少說明了 LongCat-2.0 想主打的,不是「給你一個回答」,而是:

從理解、規劃、生成,到執行和交付的完整任務鏈。

所以如果你問我 LongCat-2.0 更像什麼,我會說:

它更像一個偏開發和執行的 Agent 底座模型,而不是一個只追聊天感受的消費級助手。

「國產顯卡訓練」這個說法,該怎麼寫才不容易翻車

這部分我單獨提出來,是因為它很容易被 SEO 寫手寫偏。

如果你是為了搜量,很多關鍵詞會寫成:

  • 國產顯卡訓練大模型
  • 國產 GPU 大模型
  • 中國本土顯卡訓練模型

但從我查到的官方材料看,更穩的表述應該是:

  • 國產算力集群
  • 國產晶片
  • AI ASIC superpods

為什麼要強調這個?

因為「顯卡」在很多語境裡預設會讓人聯想到通用 GPU,甚至消費級 GPU;而美團 LongCat-2.0 的官方口徑顯然更偏:

面向大規模訓練和部署的國產 AI 加速集群。

如果你寫海外站文章,這一點尤其重要。英文裡直接寫成 Chinese GPUs 很容易過度簡化,寫成:

  • domestic accelerator cluster
  • domestic AI ASIC cluster
  • Chinese domestic compute stack

會更接近官方公開材料。

誰最應該測試 LongCat-2.0

我覺得下面這幾類團隊,最應該把 LongCat-2.0 拉進實測:

1. 做程式碼智慧體和自動化開發流的團隊

如果你在測:

  • 倉庫級修改
  • 自動化修復
  • 多工具調用
  • 命令列執行鏈

LongCat-2.0 這條線非常值得測。

2. 想找中國本土大模型路線的企業

如果你的前提是:

  • 更看重中國本土算力路線
  • 更看重開源可控
  • 更想測試長上下文程式碼能力

那 LongCat-2.0 的戰略意義會比純 benchmark 分數更大。

3. 做統一閘道、路由和成本優化的整合方

如果你不是自己訓模型,而是在做:

  • API 聚合
  • 多模型路由
  • 成本控制
  • 任務分級選模

那 LongCat-2.0 值得拿來和 GLMQwenDeepSeekKimi 等中國模型一起放到統一評估池裡。

如果你想先從統一接入、定價對比和調用方式看起,可以先看這些頁面:

我的最終判斷

如果把我對 美團 LongCat-2.0 的看法壓縮成一句話,那就是:

它最重要的不是「又一個中國大模型」,而是它把國產算力上的訓練工程、推理工程、長上下文架構和 Agentic Coding 定位,做成了一個足夠值得行業認真評估的公開樣本。

它現在是不是已經等於所有頂級閉源模型?

我不會這麼寫。

但它是不是已經到了「必須進測試池」的程度?

我會。

尤其是當你的任務更偏:

  • 程式碼理解
  • 多檔案修改
  • 長鏈執行
  • 工具調用
  • 企業 Agent 工作流

LongCat-2.0 很值得被認真拉出來跑你自己的真實任務集。

FAQ

LongCat-2.0 官方到底有沒有說訓練和推理都在中國本土算力上完成?

有。美團 2026 年 6 月 30 日 官方技術博文明確寫的是,LongCat-2.0 是在 五萬卡國產算力集群上完成全流程訓練與推理 的萬億參數模型。GitHub README 裡的英文口徑則寫成了 built entirely on AI ASIC superpods

LongCat-2.0 是開源模型嗎?

是。官方發布時明確說會對外開源,GitHub 倉庫中模型權重採用 MIT License 釋出。

LongCat-2.0 更適合聊天,還是更適合 Coding 和 Agent?

從官方公開資料看,它明顯更偏 Agentic Coding、工具調用、長上下文和複雜任務執行。如果只是普通閒聊,這並不是它最值得看的地方。

官方到底說的是 GPU、顯卡,還是 ASIC?

更準確的官方口徑是 國產算力集群 / 國產晶片 / AI ASIC superpods。如果寫文章,最好不要擅自簡化成消費級「顯卡」敘事。

參考資料