核心思考:用Astra搭3D场景,配合seedance2.5做视频,需要强提示词约束,否则视频生视频会继承糟糕的白膜动画
前几天,我尝试用 Seedance 2.5 制作一段具有历史厚重感的电影级短片。 剧本是这样的: 【全局真实质感与摄影控制】 真实现场实拍质感,粗砺现实主义历史电影风格,纯自然日光照明。彻底杜绝CG建模感、杜绝3D动画塑料感、杜绝磨皮修图滤镜与假光。画面具有真实胶片光学特质,具备真实世界的物理重力感、粗糙材质质感与生动细节:人物面部呈现暴晒缺水的真实粗糙皮肤、干裂起皮的嘴唇、指甲缝的污垢与汗尘泥痕;服装为真实的粗织土麻布,有磨损脱线细节;道具木料带风化干裂纹理与尖锐木刺,生铁镣铐沉重且布满暗沉锈迹;光影为真实大旱天气的白炽烈日直射,空气带热浪折射波动。人物对话口型严密同步,声音原声现场收录感。 ————————————————– [00:00 - 00:03] 镜头01|大远景|缓慢微仰向前推进 【画面】: 烈日当空下的死寂古城门。护城河已经干涸露底,形成泛白、龟裂成坚硬厚块的干涸泥壳。高耸斑驳的厚重木城门紧闭,木纹风化发白。城内主街道黄尘弥漫,两旁低矮土坯房死寂无声,空气在滚烫的地面上微微扭曲颤动,整个画面是一眼望不到头的焦渴与窒息感。 【声音/对白】: 旁白(极其沙哑、干涩粗糙的真实成熟男声,带着长期缺水的喉咙颗粒感): “城门已经封了整整四十七天。城外的护城河早已干成龟裂的死壳,城里的水井见底,绞上来的全是发臭的烂泥……” 【环境音】:干瘪枯燥的干风卷着沙尘刮过地面的呼啸声。 ————————————————– [00:03 - 00:07] 镜头02|特写|俯切镜头 【画面】: 切至破旧民居门槛。六岁的小女孩 女儿 缩在掉漆的旧木门槛边,眼窝深陷,面色枯黄,嘴唇干瘪严重起皮并布满泛红的干血口子,微弱得连呼吸都很轻。陈九 陈九 单膝重重跪在灰尘地上,粗糙黝黑满是老茧的左手托着腰间的灰褐色粗陶扁水壶,右手拔开被细麻绳系着的木塞。陈九 陈九 把壶口小心翼翼侧倾,仅存的一滴透明水珠从壶嘴缓缓渗出,挂在他粗糙开裂的食指指尖上。陈九右手极其轻柔地将这滴救命水抹在女儿 女儿 干裂的唇瓣裂口上。 【声音/细节】: 水珠湿润嘴唇极其轻微的触碰声,小女孩 女儿 喉咙里细微虚弱的喘息声。 ————————————————– [00:07 - 00:09] 镜头03|中景|平视镜头 【画面】: 陈九 陈九 把木塞严严实实塞回陶壶,挂回麻布腰带侧面,拍了拍裤腿站起身。 陈九 陈九三十五岁,面庞如风干的黄土般黝黑精瘦,眼眶通红含着泪水,但神情透着父亲的刚毅与决然。门槛上的小女儿 女儿 无力地倚着门框抬头望他。陈九嘴唇真实开合,说出临别嘱托。 【声音/对白】: 陈九 陈九 (真实唇形对齐,喉咙发紧沙哑,语气温柔而坚定): “闺女,在门槛上乖乖坐着。爹去县衙办趟差,午时前一定带干净的水和白米回来。” ————————————————– [00:09 - 00:12] 镜头04|中景|右移横移镜头 【画面】: 县衙后院回廊阴凉处。身穿半旧深绿布袍的主簿 主薄 面带冷酷戾气,将一小袋灰黄的糙米和一柄带着暗斑的生铁手铐钥匙重重拍在粗木条案上,手指厉声指向院中一辆四轮粗木囚车。木案一角整齐摆着一张盖着鲜红朱砂官印的白纸文书,以及两只封着暗红干硬泥封的粗陶大水坛。陈九 陈九 伸手接过钥匙迅速别在腰际,扛起米袋。 【声音/对白】: 主簿 主薄 (真实唇形对齐,神态傲慢凶狠,官腔冷酷): “今日午时,将城中捕获的‘旱魃’押送至东郊祭场,当众烈火焚祭以求甘霖!只要送到,县衙额外赏你两坛救命的井水!” 【环境音】:米袋重重砸在木案上的沉闷声,生铁钥匙在木桌上清脆的金属撞击声。 ———————————————–
在构思阶段,我对这个故事充满期待:背景设定在大旱之年的封闭古城,护城河干涸见底,民不聊生。主角陈九为了给病弱的小女儿换取一升干净的水和白米,不得不接下县衙的差事,押送被迷信当作“旱魃”的青衣女子前往东郊祭场焚祭。在沿途被愤怒难民砸石头的暴乱中,青衣女子不仅不怨恨,反而撕下自己的衣角递给陈九包扎血流不止的双手。陈九震撼之余,忍不住质问她为何不喊冤。
在我原本的预想中,只要把每一个镜头的画面、声音、台词和情绪严丝合缝地描述清楚,AI 就能端出一部惊艳的微电影。所以我先让GPT-Astra在blender里搭建了真实的场景,并让他输出给我标准的15s白膜视频,没有声音,也没有字幕。但是结果却让我觉得很糟糕,不仅继承了白膜视频里粗糙的环境,还继承了原视频里人物扭曲怪异的动作,我之前的prompt里从“暴晒缺水的真实粗糙皮肤、干裂起皮的嘴唇、指甲缝的污垢”,到“脱线毛边的粗织土麻布、生铁镣铐的暗沉锈迹”,再到“烈日热浪折射光影与真实唇形对齐”,几乎都没有完整的表示出来,而且最关键的问题是,主角连话都还没说完镜头就被切走了,我反思下来主要有两个问题: 1.我把文字剧本的阅读时间,误当成了视听语言的物理播放时间**。 在纸面上写下“大叔,拿这个把伤口勒紧吧。天太热,伤口要是烂了,家里人就没指望了”,我们在默读时可能只需要一两秒钟。但在真实的电影语境里,一个久未进水、喉咙干渴沙哑的虚弱女子说出这句话,中间需要有停顿、有微弱的气息喘息、有抬手递布的肢体动作配合。
这样一句话,完整表达出来至少需要 5 到 6 秒的时间。但我给这个镜头的预设时间只有 4 秒,而且在这短短 4 秒里,我还既想要特写撕布条的动作,又想要面部悲悯的神态,还想要台词与唇形完全同步。
结果就是灾难性的:模型在短短几秒的时序预算里,既要计算物理动作,又要处理面部变形,还要强行塞入过长的音频。结果是它只能粗暴地将音频掐断。 2.白膜视频的粗糙制作被完全的继承了下来 我正在思考的是像这样的小故事我真的需要一个3D搭建的白膜低质量视频才能用来抽卡生成更好的视频吗?我觉得也许不用,而且正因为我用的是视频,我需要更多更强的提示词去约束生成的结果。我在X上看到有一些专业的AI视频通过先搭建白膜再生成视频,但大多数他们都属于短小的故事,而非连续剧集。我觉得其实我应该再看看higgsfield的成功经验再自己尝试。
我现在也有一点思考吧,比如我如果想做的是这样有剧情的故事,其实该遵守**“声音先行的工程意识”**。在传统影视工业里,对白通常是在时间线上先把气口、语速确定好,剪辑点顺着声音的起承转合去切。然后我让ai把剧本改成seedance2.5生图用的prompt时也会让他再去higgsfiled的官方镜头控制指南与提示词方法论学习一遍再给我出结果。