LongCat-Video:美团开源长视频生成模型,实现分钟级连贯生成

美团LongCat团队发布开源视频生成模型LongCat-Video,支持分钟级长视频连贯生成,具备文生视频、图生视频和视频续写三大核心任务,实现高清视频生成,语义理解与视觉呈现能力达到开源SOTA级别。

9效率工具视频生成人工智能长视频美团

LongCat-Video:美团开源长视频生成模型

美团LongCat团队于10月27日发布并开源了LongCat-Video视频生成模型。该模型在文生、图生视频基础任务上达到开源SOTA水平,并依托原生视频续写任务预训练,实现分钟级长视频连贯生成,保障跨帧时序一致性与物理运动合理性。

LongCat-Video基于Diffusion Transformer(DiT)架构,通过“条件帧数量”实现任务区分,支持文生视频、图生视频和视频续写三大核心任务,无需额外模型适配。

美团发布开源 LongCat-Video 视频生成模型,可稳定输出 5 分钟级内容插图

三大核心任务介绍

  • 文生视频:可生成720p、30fps高清视频,能精准解析文本中物体、人物、场景、风格等细节指令,语义理解与视觉呈现能力达开源SOTA级别。
  • 图生视频:严格保留参考图像的主体属性、背景关系与整体风格,动态过程符合物理规律,支持详细指令、简洁描述、空指令等多类型输入,内容一致性与动态自然度表现优异。
  • 视频续写:视频续写是LongCat Video的核心差异化能力,可基于多帧条件帧续接视频内容,为长视频生成提供原生技术支撑。

依托视频续写任务预训练、Block-Causual Attention机制和GRPO后训练,LongCat-Video可稳定输出5分钟级别的长视频,且无质量损失,号称达到行业“顶尖”水平。

更多详情,请访问