美团开源 LongCat-Flash-Omni 模型:实时音视频交互,全模态能力突破

美团最新开源的 LongCat-Flash-Omni 模型,支持实时音视频交互,参数规模庞大却实现低延迟,全模态能力达到开源领先水平。

7效率工具美团开源音视频交互全模态

美团开源 LongCat-Flash-Omni 模型

美团近日正式开源 LongCat-Flash-Omni 模型,这是 LongCat-Flash 系列的最新成员。该模型基于高效架构设计,集成了多模态感知模块与语音重建模块,实现低延迟的实时音视频交互。

LongCat-Flash-Omni 的总参数达到 5600 亿,激活参数 270 亿,却能在多模态应用场景中提供高效的技术支持。

在官方介绍中,LongCat-Flash-Omni 在全模态基准测试中达到开源最先进水平(SOTA),并在多个单模态任务中展现出强大的竞争力。

美团发布并开源 LongCat-Flash-Omni 模型:支持实时音视频交互,达到 SOTA 水平插图

该模型是业界首个实现全模态覆盖、端到端架构、大参数量高效推理的开源大语言模型,解决了行业内推理延迟的问题。

查看模型示例