跳转到主要内容
Beehive
导航
Home 前沿动态 最后修订:2026.05.04 · 15 min

美团 LongCat 2.0:从视频黑马到万亿参数 MoE 智能体内核的跨代进化

美团发布 LongCat 2.0,万亿参数 MoE 大模型。统一文本+视觉+代码输入,多步推理能力首次进入万亿量级。

前沿动态

如果说 2025 年的 LongCat-Video 只是美团在视频生成领域的“小试牛刀”,那么 2026 年 4 月 24 日发布的 LongCat-2.0-Preview 则是美团真正亮出的“核武器”。

这不再是一个单一的模态模型,而是一个能够支撑起复杂智能体 (Agent) 生态的万亿级 MoE 架构内核。它的出现,标志着国产大语言模型从“追求参数规模”向“追求任务闭环”的深刻转型。

一、 开篇定调:国产大模型的“万亿 Agent”时刻

LongCat 2.0 的发布,不仅是一次版本的迭代,更是一次战略维度的跨越。在同赛道上,Wan2.7-VideoSeedance 2.0 也各有侧重。

它放弃了传统的稠密 (Dense) 架构,转向了更为高效的混合专家 (MoE) 架构。这意味着在维持推理成本可控的前提下,它拥有了比前代高出 10 倍以上的知识容量与逻辑深度。

与同赛道对比:万亿参数模型的竞争格局

LongCat 2.0 的万亿参数规模让它跻身全球顶级大模型行列,但与同赛道选手相比,定位差异明显。DeepSeek V4 同样采用 MoE 架构但走开源路线,在 SWE-Bench 评测上以低成本推理取胜;Qwen 3.6 Plus 依托阿里云生态,在中文场景和企业部署上有天然优势;Kimi K2.7 Code 专注代码生成,在 SWE-Pro 开源评测中拿下第一梯队。LongCat 2.0 的差异化在于:它是首个将视觉输入与代码推理统一在同一 MoE 框架内的万亿参数模型——这意味着它不仅能写代码,还能看图理解需求,从截图直接生成前端代码。这种跨模态能力在电商场景(商品图→详情页代码)和设计场景(原型图→实现代码)中有直接的生产力价值。

国产算力训练细节与工程挑战

万亿参数模型的训练从来不只是"堆 GPU"的问题。美团技术博客披露,LongCat 2.0 的训练使用了超过 3000 张国产算力卡,训练周期约 45 天。关键工程决策包括:MoE 路由算法采用 Top-2 专家选择以平衡负载,梯度累积步数设为 64 以适应长序列训练,混合精度策略在 BF16 基础上引入选择性 FP32 以稳定关键层的梯度传播。训练中的最大挑战不是算力不足,而是MoE 路由崩溃——某些专家在训练早期被过度激活导致负载不均,团队通过动态温度系数调整和专家冻结策略解决了这个问题。这些经验对后续万亿参数模型的训练有直接的参考价值。

应用场景展望:从代码生成到多模态 Agent

LongCat 2.0 的能力边界远不止"写代码"。美团内部已在三个场景验证了其实际价值:外卖骑手调度优化(多步推理 + 实时数据理解)、商家评论情感分析(视觉 + 文本双模态输入)、以及自动化运营报告生成(数据查询 + 图表绘制 + 文本总结)。在开源社区,LongCat 2.0 的 MoE 架构也被用于微调实验——有团队在 16B 活跃参数基础上成功蒸馏出 4B 级别的端侧模型,推理速度提升 3 倍且核心能力保留 85%。这种"大模型蒸馏小模型"的路线,可能是万亿参数模型走向消费级部署的关键路径。

二、 核心升级:MoE 架构带来的“脑容量”激增

LongCat 2.0 最大的突破在于其处理复杂任务的稳定性。

核心规格 LongCat 2.0 LongCat-Video (2025) 行业平均水平
参数规模 1,000B+ (MoE) 13.6B (DiT) 200B - 400B
上下文窗口 1,000,000 Tokens N/A 128K - 200K
激活参数量 约 150B 13.6B 全量激活
训练平台 数万张国产加速卡 千卡集群 海外算力依赖

技术亮点:国产算力的奇迹

该模型是在业内首个公开确认、完全由国产算力集群完成预训练的万亿参数模型。这不仅是算法的胜利,更是国产底层硬件与并行计算框架 (DeepSpeed-Domestic) 深度适配的里程碑。

三、 技术机制解析:100 万上下文与 BSA 演进

1. 1M 上下文:长程依赖的终极解决方案

通过改进的 RoPE 外插技术与 Block Sparse Attention (BSA) 机制,LongCat 2.0 实现了 100 万长度的上下文窗口。这让它能够一次性读取数百万行的代码库,并保持极低的召回误差。

2. MoE 路由策略的优化

LongCat 2.0 采用了“启发式 + 强化学习”的双重路由策略。这意味着当你在问它代码问题时,它能精准调动“编程专家”神经元;当你在进行视频分析时,则激活“时空感知”专家。

技术组件 作用说明 相比 1.0 的提升
Expert Router 动态分配计算资源 推理效能提升 300%
K-V Cache 压缩 优化长文本内存占用 显存消耗降低 60%
Tool-calling 算子 强化 API 调用精准度 任务成功率提升 45%

四、 基准表现:从“对话”到“执行”的质变

在 2026 年的 Agent 基准测试中,LongCat 2.0 展现出了统治级的工具调用能力。

测试维度 得分 (100 分制) 相比前代的提升
多步推理 (CoT) 92.5 +65%
工具调用精准度 98.2 +40%
代码生成 (Python) 88.7 +55%
视频叙事逻辑 85.0 +20%

LongCat 2.0 的核心价值不在于“回复了什么”,而在于它能自主地“做成什么”。

五、 竞品对比:后 Sora Legacy 时代的群雄逐鹿

在 2026 年 5 月的竞争格局中,LongCat 2.0 的定位非常独特:

维度 LongCat 2.0 GPT-5.5 Qwen-3-Plus
核心优势 Agent 执行、国产适配 逻辑推理、多模态融合 语言理解、中文生态
开放程度 API Preview (封闭测试) 订阅制 开源 + 商业 API
算力门槛 极高 (需 API 接入) 中 (支持本地化量化)
适用人群 企业开发者、具身智能团队 通用用户 国内科研机构

六、 定价与可用性(开发者指南)

目前 LongCat 2.0 仍处于限量预览阶段:

  • 接入渠道:美团 AI 开发者开放平台。
  • 费用预估:按 Token 计费,预计每百万 Token 费用在 8-15 元人民币之间(针对万亿模型,这具有极强的市场竞争力)。

白嫖建议:关注美团的开源社区项目,预计 2026 年下半年会发布 70B 规模的“青春版”开源权重。

七、 行业影响 + 写在最后

LongCat 2.0 的发布对行业有三层冲击:

1. 万亿参数模型的国产路线被验证。 此前万亿参数训练被认为只能依赖海外算力,LongCat 2.0 用国产加速卡集群完成训练,证明了中国 AI 产业链在底层算力适配上已经具备了独立闭环能力。这对后续国产万亿级模型(如 DeepSeek V4、Qwen 系列的迭代)有直接的战略价值——依赖海外算力的路径不再唯一。

2. MoE 架构成为万亿参数模型的事实标准。 LongCat 2.0、DeepSeek V4、MiniMax M3 都选择了 MoE 路线,这不是巧合。稠密模型在万亿量级下推理成本失控(全量激活意味着每次推理都要消耗万亿级算力),MoE 的稀疏激活机制在维持知识容量的同时将推理成本压到可接受范围。未来万亿级模型的竞赛不是比谁参数更多,而是比谁的路由更智能、激活更精准。

3. Agent 能力成为万亿模型的真正出口。 LongCat 2.0 的核心卖点不是"比 GPT-5.5 多几个 benchmark 点数",而是"能自主完成多步任务"。外卖骑手调度、商家运营分析、自动化报告生成——这些场景不需要模型会写诗,需要模型会做事。万亿参数的真正价值不在通用对话,而在 Agent 执行力的提升。

LongCat 2.0 的发布,标志着美团正式从"垂直视频生成"转向了"底层逻辑引擎"。它不仅为美团自身的无人配送、智能客服提供了核心大脑,也为整个国产 AI 生态提供了一个可参考的万亿级 MoE 范本。

2.0 时代的 LongCat 已经不再是那只"会做视频的长猫",它已经变成了一个拥有上帝视角的数字经理人。万亿参数不是终点,而是通往真正 Agent 智能的起点。

Beehive · 蜂巢

ORIGINAL

采用 CC BY 4.0 许可协议 · 转载请注明出处

前沿动态
文章链接已复制到剪贴板