快手近日发布了新版多模态大模型Keye-VL-2.0-30B-A3B。作为Keye系列最新的30B级核心基座模型,这一版本最受关注的亮点在于,率先将DSA(DeepSeek Sparse Attention)机制应用到多模态理解场景中,进一步释放出256K超长上下文的深度感知能力。也就是说,在长视频理解与时序感知方面,它已经接近“几乎无损”的高质量推理表现。
更值得关注的是,这也是Keye系列首次引入Agent协作机制。在Code、Tool、Search等复杂任务场景中,该模型展现出更强的系统级协同与执行能力,不再局限于单一问答,而是能够调用工具、检索信息、运行代码,逐步具备接近真实智能体的工作方式。
DSA首次落地多模态,破解长视频理解瓶颈
视频理解的核心难题,主要集中在两个方面:一是超长视觉上下文带来的指数级计算成本,二是关键信息在长序列中容易被稀释。Keye-VL-2.0-30B-A3B在底层架构上实现了关键突破——首次在多模态大模型场景下成功落地DSA。借助稀疏注意力机制与更具针对性的特征聚合方式,模型在处理长达一小时级别的视频内容时,能够在高噪声环境中有效提炼信息,精准捕捉关键帧,并梳理复杂的时序变化规律。
这一技术升级也直接体现在长时序视频任务的实际表现上。无论是在TimeLens中进行细粒度动作锚定,还是在LongVideoBench中完成综合性的长视频解析,Keye-VL-2.0-30B-A3B都展现出对同级别乃至200B+超大参数开源基座模型的明显竞争优势。简单来说,参数规模更精简,但综合战斗力依然十分突出。

扎根业务场景,推动智能生态全面升级
技术突破的价值从来不只体现在榜单成绩上,真正的关键在于能否落地业务场景。目前,Keye-VL-2.0已经应用于内容推荐、商业化投放、内容治理等多个内部业务体系。随着视频语义理解能力的提升,推荐系统的命中效率以及广告标签抽取的准确性都得到了明显优化。与此同时,它的Video × Agent能力也在持续赋能创作者生态,视频检索、高光提取、智能剪辑、营销内容生成等自动化工作流正在逐步打通,内容生产与运营方式也因此迎来重构。
快手技术团队表示,下一阶段的发展路径已经十分清晰:将以此次30B版本的成功实践为基础,持续向真正的原生多模态(Native Multimodal)和端到端深度融合方向推进。无论是业务验证还是模型迭代,都会不断积累行业级技术优势,进一步夯实自身在多模态大模型领域的竞争壁垒。
