
LongCat-Video:美团开源长视频生成模型,实现分钟级连贯生成
美团LongCat团队发布开源视频生成模型LongCat-Video,支持分钟级长视频连贯生成,具备文生视频、图生视频和视频续写三大核心任务,实现高清视频生成,语义理解与视觉呈现能力达到开源SOTA级别。
LongCat-Video:美团开源长视频生成模型
美团LongCat团队于10月27日发布并开源了LongCat-Video视频生成模型。该模型在文生、图生视频基础任务上达到开源SOTA水平,并依托原生视频续写任务预训练,实现分钟级长视频连贯生成,保障跨帧时序一致性与物理运动合理性。
LongCat-Video基于Diffusion Transformer(DiT)架构,通过“条件帧数量”实现任务区分,支持文生视频、图生视频和视频续写三大核心任务,无需额外模型适配。

三大核心任务介绍
- 文生视频:可生成720p、30fps高清视频,能精准解析文本中物体、人物、场景、风格等细节指令,语义理解与视觉呈现能力达开源SOTA级别。
- 图生视频:严格保留参考图像的主体属性、背景关系与整体风格,动态过程符合物理规律,支持详细指令、简洁描述、空指令等多类型输入,内容一致性与动态自然度表现优异。
- 视频续写:视频续写是LongCat Video的核心差异化能力,可基于多帧条件帧续接视频内容,为长视频生成提供原生技术支撑。
依托视频续写任务预训练、Block-Causual Attention机制和GRPO后训练,LongCat-Video可稳定输出5分钟级别的长视频,且无质量损失,号称达到行业“顶尖”水平。