美團 LongCat-2.0 開源,同步開放國產卡推理代碼 https://img.meituan.net/smartvenus/049c27aa9af5cd2d699bf1e2663cac2c62071.jpg@100w 作為業界首個在五萬卡國產算力集群上完成推理的萬億參數模型,LongCat-2.0 已全面開源。
美團 LongCat-2.0 開源,同步開放國產卡推理代碼
科技創新2026-07-06

今天,美團將萬億參數大模型 LongCat-2.0 正式開源。

LongCat-2.0 總參數 1.6T,平均激活約 48B,為真實的 Agentic Coding 任務而生,架構上創新性引入 LongCat 稀疏註意力和 N-gram Embedding,提升長上下文處理效率與 token 級表示能力的同時,結合動態激活進壹步強化了代碼理解、生成以及執行的表現。

作為業界首個在五萬卡國產算力集群上完成推理的萬億參數模型,LongCat-2.0 已全面開源。針對顯存與帶寬受限的國產算力芯片,我們在模型架構、芯片適配到部署策略上進行了深度協同優化,讓萬億參數模型在存量卡上同樣跑得穩、跑得快。我們希望以真實 Agentic Coding 任務中的穩定表現為依托,通過開源將模型能力與推理優化成果完整開放,盤活更多存量國產算力,釋放國產算力生態的長期價值。

img
請添加圖片備註(可選)

面對顯存、帶寬和互聯的多重限制,LongCat-2.0 結合國產芯片特性,從模型、芯片適配與部署三個方向逐壹突破,實現了萬億參數模型的流暢推理:

  • 模型層面:Attention 通過 absorb 計算模式、Indexer 與 MLA prolog 並行處理以及 KVP 切分 KV-cache,有效緩解了超長上下文的 I/O 與顯存壓力。ScMoE 則利用國產芯片的控核能力,讓 Dense 與 MoE 分支實現物理核心級並行執行,進壹步壓縮端到端延遲,實現了百萬上下文在國產芯片上的高效推理;
  • 芯片適配層面:通過 Super Kernel 減少算子數量以降低啟動開銷,並以 Weight Prefetch 將 I/O 延遲隱藏在前序計算中;同時基於高速片間互聯完成 layer-wise 的 KV-cache 傳輸,TP/SP/KVP 均在 scale-up 互聯域內完成,在受限的顯存和帶寬條件下將硬件利用率最大化;
  • 部署策略層面:采用 PD 分離部署兼顧 TTFT 與 TPOT:Prefill 端通過縮小 Expert-Parallel 域與序列並行分擔長序列計算壓力,Decode 端以 KV-cache 切分與高並行度降低單卡顯存占用,配合異步化 Expert-Parallel Load Balancing 解決大 EP 度下的負載不均。上述並行方案均已適配 constrained decoding、multi-step scheduling 和 MTP 等推理優化特性,實現了萬億參數模型在國產算力上的穩定服務。

LongCat-2.0 驗證了國產芯片承載復雜大模型任務的成熟能力,並希望通過開源為行業提供壹條可復現的技術路徑,推動存量算力在真實場景中的應用價值。

img
請添加圖片備註(可選)

LongCat-2.0 沿用了 LongCat-Flash 的整體設計,並圍繞 LongCat-2.0 在長上下文、代碼任務和智能體場景中的進壹步升級,做了三項關鍵優化:

img
請添加圖片備註(可選)

面向智能體任務中的長輸入場景,LongCat-2.0 引入 LongCat 稀疏註意力機制(LSA),通過流感知索引、跨層索引和層級化索引三項策略減少碎片化訪存和重復索引計算,在保持模型質量的前提下,加速百萬級長上下文的訓練與推理。

img
請添加圖片備註(可選)
img
請添加圖片備註(可選)

LongCat-2.0 在 MoE 專家之外引入 N-gram Embedding 作為新的參數擴展路徑。在 MoE 稀疏度已接近 97% 的情況下,將 135B 參數投入 N-gram Embedding 的收益遠超繼續擴充專家。該模塊占比控制在總參數 10% 以內,兼顧了參數收益與結構穩定性。

img
請添加圖片備註(可選)
img
請添加圖片備註(可選)

後訓練階段,LongCat-2.0 采用多教師在線蒸餾,將專家分為 Agent、推理和交互三類,分別聚焦自主執行、自適應推理和安全對齊等核心能力。最終通過 MOPD 架構在國產算力集群上無縫融合,使模型兼具深度推理、自主執行與精準交互的綜合表現。

img
請添加圖片備註(可選)
img
請添加圖片備註(可選)

LongCat-2.0 的開源,是壹次技術路徑的公開,也是壹次生態邀約。

本次開源同步提供 BF16、FP8 以及 INT8 等多精度版本,全面覆蓋不同算力平臺的部署需求。同時,我們深度擁抱開源社區,將針對國產算力極致優化的推理成果同步開源。這意味著,即使手上沒有最新算力,也能基於現有硬件將 LongCat-2.0 穩定跑起來。

我們希望通過這套開箱即用的推理棧,讓更多的國產卡包括老卡,都能流暢部署萬億大模型推理服務,在真實生產力場景發揮更大價值。


開源鏈接:

Tech Blog:

  • https://longcat.ai/blog/longcat-2.0/

Model Weights:

  • HuggingFace:https://huggingface.co/meituan-longcat/LongCat-2.0
  • Github:https://github.com/meituan-longcat/LongCat-2.0
  • ModelScope:https://www.modelscope.cn/collections/meituan-longcat/LongCat-20

Inference Code:

  • GPU:https://github.com/sgl-project/sglang/pull/30042
  • NPU:https://github.com/meituan-longcat/SGLang-FluentLLM/tree/npu

API Platform:

  • https://longcat.chat/platform/product
img
LongCat-2.0 發布限時福利