提示词生成器是 AI追光 的总入口,把图片、视频、音乐、故事连镜四条线放在同一个界面里。它解决的是一个很具体的麻烦:AI 出片的质量,八成取决于提示词写得够不够细,但没人愿意每次都从空白框开始敲两百字。
这里的做法是把一条提示词拆成可选的维度——主体、动作、服装、光线、镜头焦段、光圈、色调、画幅、时长——每个维度给出可点选的具体值,点完自动拼成一段结构完整、顺序正确的描述句。顺序是有讲究的:曲风/主体 → 情绪 → 主要元素 → 镜头 → 质感 → 空间,模型对前面的词权重更高,随手调换会直接改变出片结果。
单镜好出,难的是十个镜头里主角还是同一个人。故事连镜模式的思路是把人物设定抽出来锁死:相貌、发型、服装、声线写一次,每个镜头只描述这一镜的动作和运镜,其余部分自动继承。这样即使分十次生成,人物描述的字面内容也是完全一致的——这是目前在没有角色参考图的情况下,能把一致性做到最高的办法。
两种情况自己写更快:一是你已经很清楚要什么,一句话能说明白的镜头,堆维度反而会引入你不想要的元素;二是抽象风格类的需求(比如"像某部片的质感"),这类靠的是参考图,不是文字维度。
还有一点要认清:提示词写得再好,也解决不了模型本身的短板。手指、复杂道具交接、精确文字,这些是模型的结构性问题,不是词的问题。遇到这类需求,与其反复调词,不如换生成方式或者后期补。
完整的上手顺序写在使用教程里。
图片、视频、音乐、故事连镜看起来是四个独立工具,实际用起来通常是一条链:先在故事连镜里把镜头拆出来,再用图片板块出每一镜的首帧,然后把首帧送进视频板块让它动起来,最后用音乐板块配一条底子。
这个顺序有个好处——每一步的输出都是下一步的输入,中间不需要你重新描述一遍场景。倒过来做(先生成视频再补图)几乎一定会返工,因为视频已经定了构图,图片再怎么改也对不上。
出来的效果不对时,人的本能是把提示词大改一遍。但这样你永远不知道是哪一处改动起了作用。更快的做法是一次只动一个变量,生成两张对比着看。看上去慢,实际上三五轮就能定位问题,比大改十轮有效。
特别是那些「玄学词」——加一个「电影感」有时候有用有时候没用,只有在其他条件都不变的情况下对比,才能判断它在你这个场景里到底起不起作用。相关的排查方法整理在脸部变形怎么修里。