游乐游手机版
首页/AI热点日报/热点详情

实测首款Agent蜂群,人人可创建视频版Manus

类型:热点整理2026-07-20
实测多智能体蜂群系统,通过条件、专家与迭代智能体协同,可搭建专属AI视频流水线。支持知识科普、非遗故事、音乐MV等7大场景,一次生成9分34秒视频,消耗约3000万Tokens。当前在分镜节奏上不及传统工作流,但故事完整度与画风一致性具有优势。

首款智能体蜂群系统实测:解锁AI视频制作新高度,助你轻松打造专属视频流水线。

核心内容概览:
1. 多智能体蜂群系统架构深度解析:条件智能体、专家智能体与迭代智能体的协同工作机制
2. 从零开始搭建智能体蜂群的完整实操指南与界面操作演示
3. 系统支持的7大视频创作场景及与传统工作流程的对比分析

实测首款Agent蜂群,人人都可以造自己的视频版manus了

上上周我们刚测试完六款视频Agent,其核心逻辑是:手里攒着一堆音频、视频、剪辑、图像生成工具,由Agent自主决定调用顺序来成片。上周又测试了Manus的Wide Research,这款产品有点套娃的意味——一个主Agent可以并行启动100个子Agent,让它们同时完成搜索、总结、数据生成等任务。

那么问题来了:如果把这两个概念融合在一起,打造一个专为AI视频设计的Agent for Agents系统,究竟能一次性输出多长的视频内容?

答案是9分34秒——换算下来就是574秒,相当于115个视频片段,背后消耗了29,996,401个Tokens。

接下来,直接进入正题:手把手教你如何搭建这套「多智能体蜂群」系统,以及这个新范式制作出的视频,究竟能覆盖哪7大使用场景。

先上结论。与隔壁的Dify相比,多智能体蜂群最大的区别在于:它将迭代(while)和条件分支(if)节点重新封装成了新的智能体,而其他节点也全部用智能体来替代。

Dify界面:[图片位置]

多智能体蜂群界面:[图片位置]

与其空谈架构,不如直接从一个完整的智能体实例入手,这样理解起来更为直观。

拿放大镜凑近看看细节——

条件智能体:主要负责判断不同情况。比方说,有时候想直接生成视频片段,有时候则希望Agent先生成脚本、分镜,再落到视频片段。提示语的主体部分直接用AI优化生成,输入“/”还能引用所有上游节点的输出。

专家智能体:专职完成某一类任务,比如搭配视频类MCP来实现视频生成、音频生成和视频剪辑。目前系统支持63个大模型和44个MCP Servers,选择空间相当充裕。

不过有个问题:每次只生成10秒,1分钟的视频就得运行6次,等待时间确实有点长。

迭代智能体就是为了解决这个痛点而生的。从设计上看,它会将上一步的输入转换成二维数组——用人话翻译就是:把大段长文本切割加工成多组提示语,这些提示语可以同时生成,大幅缩短等待时间。

Agent for Agents并不意味着控制权会降低。在实际构建过程中,当流程节点增多后,很需要在中间环节实时观测模型的输出,或者给模型输入场外信息——形式可以是单选、多选,甚至是图文文件。总之,不用写超长提示语就对了。

多智能体蜂群内置了18个UI模板和组件,你可以在中间看到脚本输出后,主动选择是否重新生成。

好,现在你已经拥有了一个从零搭建出来的多Agent蜂群。

热知识:构建好的多Agent在对话过程中如果生成失败,是会退回所有积分的。这操作豪得没边儿了。

冷知识:Agent其实也有等级划分——L1是光聊天不干活;L2是单工作流智能体,流程相对固定;L3就是Manus们,推理模型加工具,模型能在各种任务上自由组合能力去完成目标;而L4,就是今天一起做的多智能体蜂群,把不同类型的L3智能体组合起来,完成更复杂的任务。

坦白说,目前多智能体蜂群制作出的视频在分镜设计和剪辑节奏上,还比不上传统工作流配合AI的效果。但它的故事完整度、画风一致性,以及在AI视频领域里实现的超长时长,已经足以让它在现阶段独立完成一些视频制作任务。更重要的是,它速度快,而且正在朝着又快又好的方向迭代。基于此,我们总结出了7个使用场景:

一、知识科普

先从简单的来。用常见的提示语让蜂群自己脑补:

“帮我生成一个科普类型的动画,要求用简笔画的漫画风格形式讲解中国古人眼里的各种山的形式,其中包括有‘峰’‘峦’‘岳’‘嶂’‘丘’‘岭’,比例是16:9,要求风格一致。”

[图片位置]

二、第一人称

也可以直接丢一个完整的故事进去,不需要指定画风。比如:

“一个写实的小橘猫的冒险故事。用橘猫的第一人称自述的形式来作为故事大纲,故事总是充满自拍,用小猫的自拍镜头来表达画面。故事如下:……‘好的,这是一个以那只猫咪为主角,带有原文语气的纯文字故事,结尾充满自由:朋友,当你看到这里的时候,我已经变成加勒比海上的一名海盗了。这里没有勾心斗角,海盗也没有理想,因为海盗的一生是放荡不羁爱自由的。那天,我正蹲在码头的木桩上晒太阳……’”

[图片位置]

三、非遗故事

结构化的提示语也能发挥作用,可以通过分段的形式指定整个视频的走向:

片名:《一尺方寸,两代春秋》
主题:在光与影之间,操纵的是皮偶,讲述的是人心,传承的是不灭的星火。
形式:采用双线叙事的温情纪录片,一条线是幕后的制作与传承,另一条线是幕前的光影传奇。

故事梗概:主角是一位年迈的皮影戏班主,和他十几岁的孙女。

幕后·雕刻(造物):阳光透过窗棂,照在老师傅布满皱纹的手上。他正在一块驴皮上雕刻新的皮影人物——孙悟空。刀尖游走,线条流畅。他一边刻,一边给旁边的孙女讲述这个人物的故事。孙女用手机记录下这一切。旁白(孙女稚嫩的声音):“爷爷说,每一刀下去,都要想着他将来要怎么打,怎么笑。这不叫刻皮子,叫给他注入魂儿。”

幕前·排演(入戏):晚上,爷孙俩在后台的白幕后排练。爷爷操纵着孙悟空,孙女操纵着白骨精。光影下,两个皮偶打得难分难解。镜头在幕前(观众视角,看到的是完整的神话故事)和幕后(爷孙俩默契的配合和投入的表情)之间切换。

现实·困境(黄昏):一场正式的乡村演出。台下观众寥寥无几,多是老人。年轻人们低头玩着手机,手机屏幕的光与幕布上的光形成讽刺的对比。演出结束,掌声稀稀拉拉。后台,爷爷默默地收拾着皮影箱,眼神落寞。孙女看着他,心里不是滋味。

传承·新光(破晓):孙女把自己用手机拍的爷爷雕刻、表演的视频,配上节奏感强的现代音乐,剪辑成了一个酷炫的短视频发布到网上。视频意外地火了,很多人留言说“太酷了”“原来皮影可以这么帅”。

[图片位置]

四、音乐MV

做音乐MV的技巧是:把画面和视频分开描述,完成单个镜头的描述,这样歌词就能跟画面一一对应上。

以《夏天的风》文艺MV分镜脚本为例:

  1. a.晨曦初照,窗外微风
    画面描述:清晨的第一缕阳光透过窗帘缝隙洒进房间,阳光柔和、温暖。窗外,翠绿的树叶在微风中轻轻摇摆,空气中弥漫着早晨的清新气息。镜头慢慢推进,焦点对准女孩的脸庞,她在睡梦中微微皱眉,似乎有些不舍离开梦境。随着她的眼睛缓缓睁开,阳光恰好照亮了她的眼眸。她轻轻地伸了个懒腰,嘴角泛起一丝微笑。她的目光穿过窗外的景色,心中浮现出某种温柔的回忆。房间里安静,时间仿佛在这一刻静止。
    视频描述:镜头从房间的一角开始,慢慢拉近女孩的床铺,阳光从窗户射入,柔和的光线打在女孩的脸上。随着镜头的推进,女孩从睡梦中醒来,动作流畅自然,缓慢的节奏给人一种温暖的感觉。光与影的交织营造出清晨的宁静氛围,女孩的眼神从迷离到清醒,带着一丝微笑,展现出她内心的平和与安宁。

[图片位置]

五、IP广告

为蜜雪冰城做一条青提系列的原创创意有趣广告视频,以蜜雪冰城的雪王IP为主,贯穿主线,表达夏日缤纷与青提、凉爽。

[图片位置]

六、图一乐类

放这个案例完全是因为——还能做出直播间的感觉。这是一个第一人称vlog视角的视频,主角是秦始皇嬴政穿越到现代城市上海,骑着北极熊在东方明珠塔下直播,一边直播一边喝着蜜雪冰城的奶茶。突然,上海的东方明珠塔尖射出一道毁灭般的激光,吓得秦始皇骑着北极熊四处逃窜。危急时刻,秦始皇骑着北极熊掏出安卓牌智能手机在东方明珠塔下自拍——快门按下的刹那,东方明珠塔突然坍塌化作一片废墟。结尾是秦始皇戴着安全帽、穿着皇帝的衣服在废墟中重新修建东方明珠塔,北极熊也戴着安全帽在工地运送砖块钢筋等建筑材料。整个画面是第一人称vlog的视角。

[图片位置]

写在最后

AI视频,尤其是最近这两个月,从模型到Agent,一波接一波地更新迭代。生成体验更舒适了,成片更快了,玩法也更多了。虽然它还远远没到“完美”的程度——即使是最喜欢的几个模型,也依然有镜头不顺、节奏感偏弱、配音发干的问题。

但心里很清楚,它们还会变强,而且会越来越强。根本没时间纠结那些瑕疵,因为版本就在一天一个样地更新:剪辑、旁白、情绪、构图、动态生成,这些都在不断改进。与其盯着哪里不好,不如多想想可以做出什么。

距离做到完美的那一天,确实没那么快。但同样确定的是——它真的在靠近了。

来源:https://www.53ai.com/news/LargeLanguageModel/2025080786574.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。