第一部分:认知篇
简短截说:AIGC 是什么?
AIGC 就是人工智能生成的内容,无论是文字、音频、图片、视频还是代码,只要是 AI 帮你做出来的,就算 AIGC
AI 通过理解的你输入的问题或者需求去理解意图,再根据意图做解释任务、最后输出给你想要的文字或图片,这个输入就是对 AI 下达的指令,有个专业名词叫 prompt(提示词),你可能会担心提示词要怎么学习,其实不需要,现在 AI 模型那么强大,只需要简单说清楚你要 AI 实现的目标和思路过程(结果 - 结构)就可以理解你的意思了
在视频生成中,提示词起到什么作用?
用最新的 seedance 2.5 和 minimax H3 视频生成模型举例,在使用它们生成视频的时候,因为足够智能,提示词发挥的作用就是导演调度(老师后面会教导演思维)
调度什么?调度的是上传的素材,素材就是 3 类:1. 上传的参考图 2. 参考视频 3. 参考音频,根据情况和需要给视频模型作为参考(参考素材的权重是很大的,参考图决定了画面和质感,参考视频决定视频里的运镜和动作怎么演,参考音频决定了人物说话的音色)
怎么算调度?逻辑是这样的
(随便举个例子)比如你的剧本设定好了,在接下来这个分镜要有要让人物在坐在工位上,看着眼前电脑一顿操作,旁边的咖啡拿起来喝一口的画面
有了剧情需要,就知道了这几秒钟的分镜该做什么内容了,那就可以把需要出场的人物和场景图 道具图放进视频模型参考
有了参考图来固定画面后,就是提示词的任务了,也就是调度
提示词在这里发挥着导演指挥的作用,需要描述这个剧情怎么拍怎么演的画面呈现,也就是负责调度摄像机、灯光师、音效师、演员等怎么干活的,导演在现场指挥剧组,这个调度可以精确到每秒钟做什么动作,出现什么台词和声音
下面用即梦官方提供的一个具体案例告诉你具体怎么用参考图来生成视频的提示词写法,简单来说就是每张图在你要做的这个分镜里干什么

案例完整提示词:“写实自然纪录片风格,电影级真实光影,清晨的薄雾中,在广阔的湿地芦苇荡 @图片 1 里,一只优雅的丹顶鹤正展翅起舞。 @图片 2 丹顶鹤羽毛洁白如雪,头顶鲜红,身姿修长挺拔,动作轻盈高贵。场景为秋季的浅水湿地,水面波光粼粼,周围长满金黄色的芦苇、浮萍与水草,虚化背景中是远处的晨雾与初升的太阳。镜头为低机位中景,轻微手持感,整体基本固定,始终保持丹顶鹤在画面中央。
0s-3s:一只丹顶鹤静立在浅水中,身姿优雅。它刚开始缓慢地展开宽大的黑白双翼,动作轻柔,水面被翅膀扇动的气流带起阵阵涟漪。晨风吹拂,阳光从地平线斜射过来,穿透薄雾形成丁达尔光效。
3s-8s:丹顶鹤在水面上轻盈跳跃,双脚交替点水,溅起晶莹的水花。它修长的颈部向后仰起,鸟喙指向天空,随后身体轻盈落地,收拢双翼恢复站立姿态,头部优雅地环顾四周,发出一声清脆的长鸣。 低机位,轻微手持感,轻微跟随丹顶鹤的跳跃轨迹上下移动。景深自然,前景的芦苇轻微虚化,丹顶鹤主体清晰,背景的晨雾与朝阳柔和虚化。自然环境音,水流声、翅膀扇动时有力的扑击声以及鹤鸣声,整体宁静、空灵、唯美。”
这个 8 秒的分镜逻辑和我们刚刚说的差不多
给情节需要的参考图:一张场景图(湿地芦苇荡)和一张主体图(丹顶鹤)
用提示词把参考图调度起来,画面主体、拍摄机位、主体所在环境、整体的环境声、景别、动作、音效、画面风格、光影、涉及人物的时候还需要表情

实操时,没有头绪去描述这些画面参数的时候,,可以给一个大概情节让 AI 帮你写调度提示词,一条捷径就是给生成文案的对话 AI 发送你要生成的情节内容 + 让它模仿上面的案例提示词和公式帮你写一条视频调度提示词(可以在 SEKO 的自由画布里开一个文案节点来生成)
上面是漫剧课程 “生视频” 生成的一个重要逻辑,视频需要分成单独的分镜生成,分镜需要有参考素材(因为参考素材生成权重高、画面声音跟着参考素材走)+ 视频提示词(提示词在扮演着导演调度的作用),以及视频提示词的案例和基础写法
需要注意的是,这只是基础的用法,进阶提升视频生成水平需要导演思维和一些专用提示词加持,在后面的课程里 老师会教授这些内容
你需要知道的 AIGC 生成的 4 类主要生成模型:文本模型、图像模型、音频模型、视频模型
文本模型,就是常用的 chat
在我们漫剧生产过程中,它常常被用来制作分镜信息、剧本、脚本、提示词、视频提示词,首尾帧提示词、分析图片风格、分析图片中色调等等内容方面的功能
如果你在画布里使用文本模型,我推荐你使用这些快速小模型节省积分
比如 GPT5.6 系列的 GPT5.6 Luna 便宜但也不差,用来帮写提示词、分镜、分析图片之类的任务也足够用
还有 Qwem3.8 flash 也不错,Qwen3.8 很聪明,它的 flash 版本也有可靠的分析能力
glm5.3flash,主打快速便宜,也有视觉能力
deepseek v4.1 flash 聪明又快
如果想要稳定又聪明,GPT5.6 Luna 是不错的选择,就是在 SEKO 里那个叫 GPT5.6L 的模型
2. 图像模型 打造漫剧资产必须会用到的
如果你想要你的漫剧能够做成连续剧集而不是玩玩,你必须用生图模型为自己打造一套资产,比如登场人物的四视图、场景资产图、关键道具图、分镜图、人物穿上新衣服的四视图、人物的表情、人物的动作参考图、用到的特效图、色卡参考图等等
这里有几个主流的生图模型推荐
1.nanobanana 系列 的 nanobanana2 和 nanobanana pro(老模型依旧能打,很多画布分享者在用它做资产图)
2.GPT image 系列的 GPT image2 和 GPT image2.5 (性价比很高,各方面均衡的王者)
3.Midjourney 8.2 (顶尖审美生图模型,可以做风格话有特点的场景和人物资产)
4. 即梦的 Seedream 5.0 pro (国产之光)
在 SEKO 平台上,我最推荐你用 GPT image2,就是那个叫 “全能图片 G2” 的画图模型,在画质 2K 中质量模式下 生成的图片质量不错,积分也最便宜,生成一张图片只要 5 积分
3. 音频模型、生成人物特点音色参考
在第一节课中,老师在课程中没有明说哪个音频模型,我个人认为字节系就是答案
在 SEKO 有豆包语音和 seed Audio 1.0,这两个音频模型都是字节的,seed Audio 1.0 更适合长文本音频博客输出,作为角色的音色参考生成效果很棒
4. 视频模型 视频效果最终呈现的生产力工具,好的模型决定下限,个人能力决定上限
有实力的话最好可以选择 seedance2.5, 当下的 SOTA 模型,其次是 seedance2 和 minimax H3,可灵的 Kling 3.0 也不错在文戏上,尤其是展示人像和环境方面质感非常好
minimax H3 最便宜,用它来生成视频有时候也有惊喜的质量
如果你是 SEKO 的免费用户,建议你在非会员模型里选择 seedance2.0mini 和可灵的 o3 mini ,因为 seedance2.0mini 15 秒只需要只需要 90 积分,支持全能参考,而且有更多的试错空间,可灵 o3mini 贵一些 要 135 积分 15 秒,但它效果对环境和人像方面的文戏质感更逼真,而且也支持全能参考,AI 味少一些,可以根据实际情况来取舍
这 4 类模型,组成了我们做 AI 漫剧的生成线核心,各司其职,缺一不可,图像模型把资产做成图片、视频模型让图片动起来、音频模型让图片有声音、文本模型把它们仨调度起来
创意与质量的核心:人主导,AI 打下手
先讲一个故事,你可能听过:
“二十世纪初,福特工厂里一台巨型发电机罢工。生产线停了,厂里的电气工程师围着它听、敲、拆,查不出毛病。亨利・福特急了,把通用电气的奇人请来 —— 查尔斯・斯坦梅茨
此人不好看:驼背、身高只有一米多,绰号却叫 “斯克内克塔迪的巫师”。交流电数学是他写的,福特的人未必看得起这个外形,但已经没别的牌可打
斯坦梅茨到厂,不要助手,只要三样东西:笔记本、铅笔、一张行 jun 床。 他在发电机旁边住了两天两夜,听机器的声音,算,再听,再算。第三天,他要了梯子、卷尺和一支粉笔,艰难地爬上去,量好位置,在外壳上画了一道粉笔印,然后下来,对半信半疑的工程师说:
打开这块盖板,从记号这儿起,把励磁线圈拆掉 16 匝。
他们照做。电机轰地转起来,像从没坏过。
福特很高兴,直到账单来了:一万美元。 当时福特最自豪的口号是 “工人日薪 5 美元”,一万美元不是小费,是天文数字。福特承认修得好,但要求明细。
斯坦梅茨回了一张著名的分项账单:
在发电机上画粉笔印 —— 1 美元 知道画在哪儿 —— 9,999 美元 合计 —— 10,000 美元
福特付了”
不论这个故事真假,它讲的是一个人的经验和判断力的价值,AI 可以替代掉人的生产流程,但还替代不了人的创意和想法,尤其是那种灵光一现的好点子,是我们人类独有的价值,在生产环节,人作为主导把关内容质量才能让 IP 持久的经营下去的灵魂,野蛮生长的时代终会过去,谁都能用 AI 做出东西,比的是谁做的更有趣、这 “有趣” 不是 AI 自动化能直出的,这就是差异,我们的眼光、判断力、创造力,就是独特价值
那些会画画的 会做分镜的 会剪辑的 会做导演的 会编剧的 还有会拍摄的,确实比我们很多没接触过视频行业里的人有优势,随着生成式模型越来越聪明,只要我们擅长使用 AI 工具,也能达到四两拨千斤的效果
第二部分:剧本与内容设计方法篇
在课程中,老师用一个漫剧的拆解案例来讲怎么写剧本,我理解的钩子的共性是预期违背,核心是借力,借观众对已有认知的预期违背,比如 70 岁的老头叫一个 30 多岁的女人妈妈,这是身份钩子和年龄钩子,一个老头叫一个年轻女人妈妈,这本事就是违背认知里年长者身份的,他的妈妈做了饭自己却不吃,其实是仿生人,这是期望钩子

实际做剧本的时候,满足这个预期违背,感觉写钩子就差不多了
老师讲的案例拆解,知识点要串起来还是有点难理解,于是我和 GPT6 一起把老师讲的拆解内容做成了通用的能和 AI 一起共创剧本的 skill,可接着做下一分钟,可重复修改迭代剧情,一个点子就可以做成 60 秒的剧本,写的越具体,内容越好
分享给你仓库地址:https://github.com/yheng0970/60-skill
老师在直播答疑的时候回答了对拆解自己爆款漫剧的分析:开场用三重反差打造黄金 5 秒钩子 (身份/年龄/亲情反差);三层戏剧冲突结构; 后续铺陈萌/爽/笑/暖点。金句:「独特视角才是核心,技术只是表达的工具
我理解做漫剧不一定每部剧都会带上亲情,老师也是用一部剧来举例子,具体怎么做,里面的变化是有门道的,和 AI 一起共创探索吧 #我在观猹学 AI