今天我们来聊一聊 AI Story——利用人工智能生成一个结构完整、风格统一的短篇电影级故事。先来看整体演示效果:

故事梗概如下:两位女孩在阁楼中发现一份神秘地图,循着地图进入热带丛林,找到一座古老神庙的机关;穿过幽暗隧道后,抵达一处神秘祭坛,最终发现一本“智慧之书”。当她们翻开书页时,一道流光闪过,将她们带离了危机四伏的丛林。

这个故事虽然简洁,但具备起承转合的基本结构,是一个相对完整的视听叙事雏形。

要实现这样的作品,需重点关注三个核心要素:

  • 视觉一致性:包括人物形象、场景风格、色彩基调的高度统一;
  • 情节连贯性:故事逻辑清晰,镜头间有明确的因果与时空关联;
  • 音效统一性:配乐、环境音、拟音等需贴合画面情绪与节奏,增强沉浸感。

三者缺一不可,否则容易产生强烈的“跳出感”。

那么,制作这样一部作品是否复杂?答案是否定的。本教程将带你用一套轻量、高效的技术组合完成全流程——主要依赖以下三项工具:

  • ComfyUI:用于图生视频与音效生成的工作流编排;
  • Nano Banana:负责角色图像生成与分镜图绘制,保障人物一致性;
  • GermanMini 提示词生成器(适配 Y2.2):基于分镜脚本自动产出高质量中英文提示词。

其中,ComfyUI 承担视频与音效的合成任务;Nano Banana 专注图像生成与角色稳定性控制;GermanMini 则解决提示词工程这一关键环节。

我们在 ComfyUI 中构建了两个核心工作流,并已部署至 Runway Hub 平台:

  1. Y2.2 图生视频工作流:输入参考图+提示词,输出高质感动态镜头;
  2. Full 类音效生成工作流:基于画面内容自动匹配氛围音效,无需手动撰写提示词。

你可在 Runway Hub 搜索“有趣的80后程序员”,在其发布的工作流中找到全部实例。也可通过视频描述区的邀请链接注册账号,获得 1000 点免费额度;每日登录还可额外领取 100 点,便于反复调试与验证。

先看图生视频工作流的实际输出效果:

  • 丛林寻宝:两位主角手持地图穿行于密林;
  • 机关开启:在神庙墙壁上触发隐藏机关;
  • 甬道前行:昏暗隧道中谨慎探索;
  • 祭坛现身:抵达布满符文的古老祭坛;
  • 智书现世:翻开泛光古籍的瞬间;
  • 流光离境:强光包裹二人,画面淡出。

每个镜头均包含人物互动、运镜设计与细节表现,整体质量稳定。这背后有两个决定性因素:

  • 高质量参考图:确保角色建模准确、风格可控;
  • 精准提示词:明确描述动作、光影、构图与情绪,避免画面“平”“呆”“空”。

再看 Full 类音效工作流的表现:

  • 最后一幕未输入任何提示词,模型自动识别画面中“古籍发光+人物被牵引”的戏剧张力,生成空灵、升腾的合成音效;
  • 丛林场景中叠加了鸟鸣、风声、脚步踩叶声与轻微喘息,营造真实临场感;
  • 甬道段落加入低频嗡鸣与回响,强化压抑氛围;
  • 机关启动时刻则以清脆金属音+短促鼓点突出转折,节奏明快而不突兀。

这些音效并非简单叠加,而是与画面语义深度对齐,构成真正的多模态协同。

那么,高质量提示词从何而来?灵感来源至关重要。

本案例的创意起点,来自 Twitter 上归藏大佬分享的一则 Nano Banana 应用实践:利用单张双人图生成电影级分镜。原例输出 12 张分镜,但我们实测发现,超过 6 张后人物一致性明显下降——这是大模型注意力衰减导致的典型现象(即“记忆漂移”)。因此我们优化为生成 6 张,兼顾完整性与稳定性。

具体执行分为三步:

第一步:角色参考图生成

使用 Nano Banana 输入两张高清女性肖像(建议统一为 1024×1024),提示词为:“两位女孩半身照,纯白背景”。注意:Nano Banana 输出分辨率默认与最后一张输入图一致。为减轻模型负担、提升一致性,建议将两人合并在一张图中输入,而非分两次上传。

第二步:六格分镜图生成

将上一步生成的合照导入 Nano Banana,调整分辨率为 1920×1080(适配视频比例),使用如下提示词:

用这两个角色创作一部引人入胜的六部分故事,每部分配一张独立图像,展现一个完整场景。采用写实电影风格,故事围绕寻找宝藏展开,包含奇妙场景与惊险元素,情感跌宕起伏,结尾有精彩反转。图像保持近景视角,不出现文字或文字元素。