一部 AI 漫剧为什么能连做十一季:从生成模型到生产系统

目录
2026 年 8 月 15 日,AI 漫剧《万妖图录传》第十一季正式上线[1]。此前,其第十季曾荣登红果热播榜榜首,公开数据显示其热度值高达 8060 万,收藏量达到 178.5 万[2]。相比榜单上的亮眼成绩,更引人注目的是,这个系列已连续更新至第十一季。
如今,创作者利用 AI 生成一个几秒钟的精美镜头已不再罕见。真正的挑战在于围绕同一组人物和世界观实现持续更新:角色形象必须保持一致,后续内容不能与既有剧情发生冲突,场景、服装和声音需要高效复用,失败镜头更需反复生成和审核。连续更新至第十一季,至少表明团队已持续有效地解决了这些核心问题,而非每一季都从零开始。
与此同时,AI 视频的生产门槛正迅速下降。《中国新闻周刊》援引中国网络视听协会的相关资料显示,2026 年第一季度,全行业上线微短剧约 12.8 万部,其中 AI 微短剧占比约 12.2 万部[3]。然而,成本的降低并未自动转化为利润。同一报道指出,一个团队投入约 20 万元制作了 11 部 AI 漫剧,上线一个月后的总收入仅为几百元[3]。
将这些数据综合考量,引出了一个更值得深思的问题:当越来越多的人能够低成本生成视频时,为何有些项目迅速沉没,而另一些作品却能围绕同一 IP 持续更新?

仅凭模型能力无法完全解释这种差异,持续生产更需要一套稳定运行的生产系统。本文不旨在还原《万妖图录传》的内部技术架构,而是以该案例为切入点,探讨 AI 视频从单次生成迈向持续生产后,团队为何需要同时关注模型能否生成所需镜头,以及系统能否稳定交付。
AI 视频怎样从故事变成成片 #

为理解这一转变,我们可以从最简单的生成方式入手:
写一句提示词 → 视频模型 → 一部视频。
这种方式适合展示模型能力,但难以支撑几十集连续内容的制作。实际生产更接近以下链路:
故事 / IP → 剧本 → 分镜 → 角色与场景资产 → 图片和视频生成 → 配音与音乐 → 剪辑 → 发行 → 用户数据 → 下一轮生产
这条生产链表明,创作者的工作并未消失,而是其工作内容和侧重点发生了变化。
| 环节 | 人主要负责什么 | AI / 软件主要负责什么 |
|---|---|---|
| 故事 / IP | 选题、判断受众、决定改编方向 | 整理情节、生成初稿 |
| 剧本 / 分镜 | 决定叙事、镜头和节奏 | 拆章节、生成分镜和提示词草案 |
| 角色 / 场景 | 确定人物设定和视觉风格 | 批量生成参考素材 |
| 视频生成 | 判断动作、运镜和可用性 | 文生视频、图生视频 |
| 声音 | 决定角色表达和节奏 | 配音、音乐和音效生成 |
| 后期 | 控制叙事和最终节奏 | 字幕、部分自动化编辑 |
| 发行 | 选择平台、运营和投流 | 推荐分发、数据统计 |
| 迭代 | 决定继续、修改还是停产 | 汇总行为数据和效果指标 |
许多 AI 漫剧的故事源于网络小说、既有 IP 或编剧原创。大语言模型(Large Language Model, LLM)虽已能快速生成大量文字,但内容行业真正稀缺的并非“再生成五万字”的能力,而是能持续吸引观众的故事。在此流程中,LLM 更适合辅助编剧整理人物关系、拆分章节、补充对白及检查内容的连续性。若一个故事已获得可观的阅读量、收藏、评论或付费数据,至少表明该题材曾成功触达并留住观众。
文字内容接下来还需转译为视听信息。小说中或许只需描述:
姜月初穿过长安西市。街边叫卖声此起彼伏,她忽然停下脚步——檐下一串铜铃无风自响。
这段文字在小说中已足够,读者会自行在脑海中补全街市景象、人物动作及异常气氛。然而,到了视频制作阶段,团队必须明确观众首先看到什么、何时察觉异常,以及通过谁的视角获取信息。“她察觉到异常”也必须转化为观众能够直接感知(看见与听见)的具体线索。
一个简单的段落,可能被拆解为以下几个镜头:
| 镜头编号 | 叙事功能 | 画面 / 机位 | 动作与声音 | 时长 |
|---|---|---|---|---|
| 01 | 建立空间 | 长安西市,高位大全景,镜头缓慢下降并进入街道 | 人群和马车穿行,保留市井叫卖声 | 3 秒 |
| 02 | 建立人物 | 中景跟拍姜月初穿过人群 | 行人从前景掠过,她环顾两侧摊位 | 3 秒 |
| 03 | 提供异常线索 | 屋檐下的铜铃特写 | 铜铃无风轻响,其他环境声逐渐减弱 | 1.5 秒 |
| 04 | 呈现人物反应 | 姜月初近景,镜头轻微推近 | 她停下脚步,抬眼望向屋檐 | 2 秒 |
| 05 | 确认威胁 | 姜月初望向的屋顶,长焦远景 | 黑影迅速掠过,伴随短促的衣袂声 | 1.5 秒 |
这里的关键并非将一句文字平均分割为五段,而是精心安排信息释放的顺序:首先建立空间和人物,继而提供异常线索,随后呈现人物反应,最终确认威胁。景别、视线、声音和剪辑节奏共同完成了这段叙事。
这属于镜头拆解(Shot Breakdown)。若团队需通过图像呈现构图、机位和动作关系,则会进一步制作故事板(Storyboard)。无论采用文字表格还是故事板,制作团队均可使用镜头编号(Shot ID)、叙事功能、角色、场景、动作、机位、时长、提示词(Prompt)和参考资产等结构化字段来描述镜头。如此,一段故事便转化为一组可分配、执行、检查、重试及验收的生产任务。
故事转化为结构化镜头任务后,团队还需将其转换为模型可接收的输入。在生成模型中,文字提示、人物参考图、场景素材、动作视频和空间布局等信息均可作为条件输入(conditioning),用于约束生成结果。其中,利用人物图像、场景图片、参考视频或声音素材来影响生成结果,可称之为基于参考素材的生成(reference-based generation)。部分视频模型已支持多种参考输入[4][5][6]。因此,资产库不仅要保存文件本身,还需记录素材适用于哪些角色、场景和镜头,以及系统应如何将这些素材传递给模型。
创作者日常接触的通常是创作平台,其背后的基础模型负责内容生成。企业若需将生成能力接入内部系统,则可能通过应用程序接口(Application Programming Interface, API)调用一个或多个模型。下表不旨在比较模型优劣,仅说明平台、模型和企业 API 各自承担的不同角色。
| 平台 / 服务 | 模型家族 | 主要作用 |
|---|---|---|
| 即梦 AI | Seedance | 字节跳动体系的视频创作平台[4] |
| 可灵 AI | Kling | 快手的视频生成平台[5] |
| 海螺 AI | Hailuo / MiniMax | MiniMax 面向创作者的视频产品[7] |
| 阿里云 Model Studio | Wan | 视频模型及企业 API[8] |
| Google Flow / Gemini | Veo | Google DeepMind 视频生成模型[6] |
| Runway | Gen 系列 | 专业视频生成和工作流平台[9] |
部分新模型已开始在同一次生成中同时产出画面、对白和环境声音[4][6]。尽管此能力有望缩短配音和音画同步流程,但团队仍需在同一生成流程中处理声音一致性、对白修改和失败返工等问题。
网页平台已能满足许多普通创作者的需求。然而,若内容公司每天需生产数百甚至数千个镜头,员工仍需逐条复制提示词、下载并整理文件,此类重复操作将迅速成为效率瓶颈。
随着生产规模扩大,团队可能逐步将这些操作组织为以下生产链路:
剧本数据库 → 自动生成镜头任务 → 组合提示词、参考素材与其他条件输入 → 调用模型生成候选素材 → 自动检查 → 人工审核 → 失败任务重新生成 → 进入剪辑 → 保存最终资产
上述流程并非代表 AI 视频公司已普遍部署类似系统,仅阐述了一种可能的工程路径:随着规模扩大,视频模型将从独立工具逐渐演变为生产系统中的关键组件。
为什么生成一个镜头容易,连续生产十余季很难 #

单独生成一个精美镜头,如今已不再是特别困难的任务。然而,当团队需要连续生产几十集甚至十余季内容时,便会面临一组截然不同的挑战。其中最直观的问题是:同一个角色能否始终保持一致?
若团队为每个镜头单独输入“一个身着白色古装的年轻女子”,模型很可能生成各异的面部特征、服装细节乃至年龄。为减少这种“漂移”,制作团队通常会借助角色设定档案(Character Bible)、参考图和角色素材库。
从计算机系统的角度审视,团队可将这种漂移理解为一个状态管理问题:系统如何在多次模型调用之间维持角色和剧情状态?若每个镜头都彼此独立生成,模型并不会自动记住前一镜所发生的一切。用计算机系统术语来说,这种逐镜头独立生成的方式近似于无状态(stateless)调用。
这与游戏中的“世界状态”概念相似。当角色的装备、所在地点或剧情阶段发生变化后,游戏系统必须记忆这些状态变更,而非在下一帧重新开始。连续生成 AI 视频亦是如此:生成模型产出新画面,而生产系统则负责保存已发生的人物、场景和剧情变化,并将其状态传递给后续镜头。
连续剧需要维护的状态繁多,例如:
角色状态
├── 身份
├── 外貌
├── 服装
├── 声音
├── 性格
├── 当前地点
├── 人物关系
└── 剧情历史
人物在上一幕已更换服装,下一镜头便不能突然穿回旧衣;一把剑在上一集已折断,后续镜头不能因重新生成而恢复原状;两个角色若已得知某个秘密,下一集也不能让他们重新发现同一秘密。
因此,连续生产 AI 视频的难点不仅在于让单个模型生成更精美的画面,系统更需维持故事世界的叙事连续性。
模型演示还容易掩盖另一个关键问题:生成结果的可用率。商业生产并非只关注模型在最佳状态下能实现什么,团队更关注平均需要生成多少次,才能获得一个可用于成片的镜头。
假设一部短剧需要 100 个镜头,每个镜头平均生成 5 次,团队就需要调用模型约 500 次,最终仅采用 100 个结果。粗略计算,候选结果的可用率仅为 20%。此时,单次 API 调用价格已无法完整反映真实成本。团队更需关注可用镜头率,以及每获得一个合格镜头实际所需的花费。本文将后一个指标称为单个合格镜头成本。
单个合格镜头成本不仅包含模型推理费用,还涵盖失败重试、人工审核、重新编辑、等待时间及后续返工的开销。即使模型厂商将单次生成价格降低一半,只要平均重试次数未同步下降,最终成片成本也未必会相应降低。对生产团队而言,单个合格镜头成本往往比模型厂商公布的单次生成价格更具实际意义。
进入商业生产阶段后,团队亦不能仅仅比较“哪个模型生成得更快”。团队还需同时考量生成延迟(Latency)、单位时间产能(Throughput)和单个合格镜头成本。若导演正在修改一个关键镜头,生成延迟的重要性更为突出;而若团队需要在夜间批量生成 500 个普通镜头,单位时间产能和单个合格镜头成本则可能更为关键。
因此,团队不能仅限于询问“Kling 和 Veo 谁更强”,更应追问:在当前镜头、质量要求、时间及预算约束下,哪个模型最为合适? 模型选择必须服从整个生产系统的总体目标。
当流程越来越复杂,谁来决定下一步 #

机器学习系统的工程实践早已揭示出类似问题。Google 研究人员在 2015 年指出,模型代码往往仅占生产系统的一小部分,模型之外还包含数据、配置、资源管理、服务和监控等大量组件[10]。随后形成的 机器学习运维(Machine Learning Operations, MLOps) 实践进一步将版本管理、流水线、部署、元数据和监控纳入统一管理范畴[11]。
AI 视频生产虽不能直接照搬 MLOps,但随着生产规模扩大,团队也会遭遇相似问题。例如,若一个镜头半年后需要重新生成,团队便不能仅保存最终视频,还需保留完整的生成记录:
Shot #0231
Script Version: v12
Character Asset: JiangYuechu-v4
Scene Asset: ChanganStreet-v7
Prompt Version: v18
Video Model: Model-A / Version-X
Reference Images: ref-03, ref-08
Retry Count: 3
Output: candidate-17
Review Result: Accepted
这些记录使得团队能够复现镜头的生成过程。否则,团队很快便会疑惑:“这个镜头效果极佳,当时究竟是如何生成出来的?”如果模型版本、提示词、参考资产和参数均未记录,答案可能只会是“不知道”。
因此,规模化生产对版本管理、资产追踪、任务编排和运行监控提出了要求。然而,固定的工作流无法解决所有问题。团队仍需做出一些无法预先写入规则的判断:例如,人物形象出现“变脸”后,应修改提示词、替换参考图,还是改用另一个模型?预算已消耗过半,此镜头是否还值得继续尝试?
这类判断更适合由 智能体系统(Agentic System 协助处理。我倾向于将智能体理解为生产线上的调度与控制层,而非一个能够全自动完成从剧本到成片全部工作的“虚拟导演”。
| 生产环节 | 智能体可以承担的工作 | 人需要保留的判断 |
|---|---|---|
| 故事与剧本 | 整理人物关系、拆集、检查前后矛盾 | 选题、改编方向、价值判断 |
| 分镜 | 把剧本转换成结构化镜头任务、生成提示词草案 | 镜头语言、叙事节奏 |
| 资产管理 | 检索角色、场景、服装和声音资产 | 人物设定、美术风格 |
| 模型调用 | 根据任务特征选择模型、提交生成任务 | 模型策略、总体预算 |
| 质量检查 | 检测变脸、肢体异常、字幕和音画错误 | 表演是否自然、作品是否好看 |
| 返工 | 根据错误类型调整提示词、参考图或模型 | 接受、重做还是放弃 |
| 发行与迭代 | 汇总完播率、互动和投流回报 | 是否追加投资、修改或停产 |
若团队每天仅生成十个候选镜头,人工可逐一检查;但若每天生成数千甚至上万个候选结果,质量检查便会成为新的产能瓶颈。系统可先行通过自动质检筛查人物身份偏移、明显画面异常、字幕错误、音画不同步和分镜偏离等问题,再将通过初筛的结果转交人工审核。漏检将增加人工负担,若系统将可用素材误判为不合格,重新生成次数亦会增加。这两类错误均会影响单个合格镜头成本。自动质检无法替代导演判断作品是否自然、是否美观,但能显著减少人工检查明显失败结果所耗费的时间。
设计此类系统时,关键不在于部署多少个智能体,而在于明确三类职责分工:确定性规则和工作流用于处理边界明确的任务,智能体负责处理有明确约束但无法预先穷举的情况,而影响质量、成本和风险的重要决策则需由人作出。
资产查询、预算检查及“失败三次后转人工”等任务适合由确定性代码执行。智能体更适合处理输入不完全结构化、需结合上下文但仍可约束的任务,例如判断镜头失败是否源于角色一致性问题,以及下一步应更换参考图还是模型。至于是否发布作品、是否突破预算、如何处理版权风险,以及是否接受最终成片等重要决策,仍需人工审批。
为使智能体系统能够真正进入生产环境,它不能仅依赖于长对话,每个镜头都需要具备明确的结构化字段,例如:
shot_id
character_ids
scene_id
reference_assets
model
retry_count
review_status
如此,系统方能执行明确规则:例如,当 retry_count >= 3 时转交人工;当 review_status != approved 时禁止进入发布流程。
系统还需保留完整的运行追踪(Tracing)记录,记录包括:哪个智能体作出了判断、调用了哪个模型、在哪一步失败、重试了多少次,以及何时转交人工。这些记录既能帮助团队排查错误,也能用于计算可用镜头率、平均重试次数、人工介入比例和实际成本等生产指标。唯有记录结构化状态和完整运行过程,智能体系统才能超越“几个智能体互相对话协调工作”的范畴,真正成为可观察、可测量和可优化的生产控制层。
目前已有智能体框架提供了这类能力。例如,OpenAI Agents SDK 支持工具调用、结构化输出、任务转交、约束检查、人工审批和运行追踪[12]。这仅是一个实现案例,更重要的是其背后的通用设计模式,而非特定的某个 SDK。
作品上线以后,数据怎样影响下一轮生产 #

作品制作完成后,团队还需将其发布到红果、抖音或其他平台。平台不会将短剧平均展示给所有用户,推荐系统会决定谁先看到作品、作品获得多少曝光,以及平台是否继续扩大分发范围。
例如,某类“重生”短剧上线后,平台会先行给予其一部分曝光;若完播率或互动数据表现较好,平台便可能继续推荐。制作团队根据数据表现生产更多同类作品,平台也因此获得更多同类候选内容。表面上看,用户似乎越来越偏爱这类题材,但此结论需谨慎对待。
点击、观看和完播均属于隐式反馈(Implicit Feedback)。这些行为不能直接等同于用户固有的偏好,因为用户只能与自己实际获得曝光的内容进行互动。推荐系统决定哪些内容获得曝光,这一行为本身就在改变后续数据的分布,这正是**曝光偏差(Exposure Bias)**所描述的问题。
已有研究发现,“推荐—交互—再训练”形成的反馈循环可能进一步强化流行度偏差(Popularity Bias),导致已获得较多曝光的内容持续获得更多曝光,并降低推荐结果的多样性[13][14]。
在 AI 视频生产中,这种机制将形成一个新的闭环:
推荐系统发现某类内容表现较好 → 平台增加曝光 → 制作团队根据数据生产更多同类内容 → 推荐系统获得更多同类候选 → 用户进一步看到更多同类内容
该闭环虽能提高短期生产效率,但也可能推动题材、人物、剧情和视觉风格的趋同化。长此以往,平台观察到的“用户偏好”将更多地受制于平台既往的曝光分配策略,并不等同于用户在所有内容中自由选择的结果。
因此,当内容团队宣称“数据告诉我们用户喜欢什么”时,更准确的结论应是:在当前推荐和曝光机制下,这些内容获得了更好的行为反馈。
过去的推荐系统主要解决“从已有内容中应向用户展示什么”的问题。生成式 AI 的加入,使得平台数据还可能进一步影响“下一批内容应生产什么”。推荐系统因此可能不再仅仅位于内容分发的下游,而是通过数据反馈间接影响上游的生产决策。
未来,智能体系统还可能将数据分析、题材建议、小规模试制、流量测试和反馈回流有效连接起来。这目前仍只是工程推演,而非已普遍部署的行业现状。真正需要提前讨论的是:哪些指标适合自动优化,哪些反馈已受到曝光机制影响,以及哪些内容决策不能仅由短期数据决定。
当生成成本越来越低,什么会变得更稀缺 #

部分 AI 视频团队表示,制作成本正迅速下降。《中国新闻周刊》的采访中,有团队称一部 60 集 AI 漫剧的制作成本在数月间从约 8 万元降至约 2 万元;另有团队表示,部分 AI 仿真人剧的制作成本可从几十万甚至近百万元压缩到约 8 万至 10 万元[3]。
这些数字来源于具体公司的项目,“制作成本”的界定亦无统一口径,因此不能直接推广至整个行业。然而,这些案例至少说明 AI 技术能够显著降低部分项目的试错成本。
在某些项目中,制作团队过去可能需投入几十万甚至上百万元,才能验证一个故事是否有市场、有观众。如今,同样的预算可测试更多项目,更多竞争者也能以这种方式进行试错。
当生产成本下降、进入者增多,而用户每天可消费内容的时间未同步增加时,每部作品能够获得的注意力势必受到挤压。《中国新闻周刊》报道中提到一个团队每月制作约 30 部作品,最终仅有一部成为爆款,而该爆款作品恰好填补了其他 29 部作品的亏损[3]。
此案例至少说明,生成式 AI 并未使内容收益的分布更为均匀,少数爆款仍可能覆盖大量普通作品的亏损。AI 降低了试错成本,但也吸引了更多团队入场。生成能力越接近基础设施,竞争优势便越可能向模型之外迁移。
故事和 IP 依然至关重要。用户追看一部连续剧,通常关心的是人物接下来的命运走向,而非镜头究竟由 Kling、Seedance 抑或 Veo 生成。团队持续积累角色、场景和声音素材,并详细记录人物关系与故事状态。这些内容一旦沉淀为可复用的制作资产,不仅能降低后续系列内容的设计成本,也可能构筑起独有的竞争优势。
稳定的生产系统同样会成为关键的竞争优势。当所有竞争者都能调用相似模型时,差异将更多体现在可用率、返工次数、失败定位速度、模型选择及人工审核成本上。这与工业机器学习系统颇为相似:最好的模型并不自动等同于最好的系统。
此外,还有一项更容易被“数据驱动”理念所掩盖的关键能力:判断数据究竟意味着什么。完播率高,究竟是故事本身更引人入胜,还是平台将其推送给了更匹配的用户?点击率低,是市场缺乏需求,抑或封面与曝光位置存在问题?某个题材突然热门,是长期偏好发生了变化,还是推荐系统短期放大了某类内容的影响?
数据和智能体都能帮助内容生产,但成熟团队仍要判断数据支持什么结论,以及何时不能把相关性直接解释成用户需求。
当生成能力逐渐商品化后,“谁最会写提示词”的价值或许不再是最重要的。好故事、可复用资产、稳定运行的生产系统,以及对观众的真正理解,可能才更具长期价值。
未来展望 #

AI 视频下一阶段真正值得关注的,或许并非下一代模型在画面质量上又提升了多少,而是视频生成正从一种独立能力,逐步演变为内容生产基础设施的有机组成部分。
我在上一篇《生成式 AI 如何重塑推荐系统》中讨论了这一变化:过去,人们更担忧推荐系统影响“我们能看到什么”;而生成式 AI 带来的新变化是,它开始影响“我们所看到的内容究竟是怎样的”。
从生产端来看,这一变化还呈现出另一面:当生成系统与推荐系统逐渐连接后,平台不仅决定哪些内容获得曝光,用户行为也可能反过来影响下一批内容的生产。团队可能将题材选择、试制、生成、分发、反馈和再生产环节紧密连接,从而形成一个反馈速度更快的闭环。
该闭环虽能提高生产效率,但也可能导致团队日益依赖短期完播率、点击量和互动数据,进而反复复制已取得成功的题材和形式。系统或许将越来越擅长预测哪些内容容易获得反馈,但团队仍需审慎判断:哪些内容真正值得生产,哪些项目值得持续投入,以及哪些作品值得观众投入宝贵时间观看。
参考文献 #
[1] 红果短剧官方微博. 《万妖图录传》第十一季 8 月 15 日上线. 2026-08-11.
[2] 安妮特. 《红果热播榜TOP5:AI短剧霸榜,刘萧旭申请出战!》. 新浪新闻, 2026-08-12.
[3] 王诗涵. 《短剧变天:95%都是AI,赚钱却像中彩票》. 中国新闻周刊, 2026-06-16.
[4] ByteDance Seed. One-take Creation, Flexible Referencing: Introducing Seedance 2.5. 2026-07-31.
[5] Kuaishou Technology. Kuaishou Kling AI Unveils “Multi-Image Reference” Feature to Further Tackle AI Video Consistency Challenges. 2025-01-23.
[6] Google DeepMind. Veo. 访问于 2026-08-22.
[7] MiniMax. MiniMax Hailuo 2.3: A New Level of Complex Video Performance. 2025-10-28.
[8] Alibaba Cloud. Model Studio: Video Generation. 2026.
[9] Runway. Introducing Runway Gen-4.5. 2025-12-01.
[10] Sculley, D., Holt, G., Golovin, D., et al. Hidden Technical Debt in Machine Learning Systems. Advances in Neural Information Processing Systems 28, 2015.
[11] Google Cloud. MLOps: Continuous Delivery and Automation Pipelines in Machine Learning. Google Cloud Architecture Center.
[12] OpenAI. OpenAI Agents SDK Documentation: Agents, Agent Orchestration, Guardrails, Human-in-the-loop and Tracing. 访问于 2026-08-22.
[13] Mansoury, M., Abdollahpouri, H., Pechenizkiy, M., Mobasher, B., & Burke, R. Feedback Loop and Bias Amplification in Recommender Systems. CIKM 2020.
[14] Gupta, S., Wang, H., Lipton, Z., & Wang, Y. Correcting Exposure Bias for Link Recommendation. Proceedings of the 38th International Conference on Machine Learning, 2021.