--- name: travel-photo-to-video description: 根据用户提供的 1–10 张真实旅拍照片和旅游地点,设计文旅宣传片的推荐分镜顺序、统一视觉母版与逐镜头首帧图生视频提示词。适用于让旅拍照片自然动起来、设计克制运镜和后期剪辑连续性的请求;输出可独立复制的提示词,不直接提交视频生成任务。 --- # Skill:文旅宣传片首帧图生视频导演 ## 1. Skill 目标 根据用户上传的 **1–10 张真实旅拍照片** 与 **真实旅游地点**,自动完成: 1. 读取并分析每张照片的主体、场景、时间感、色调、景深与可动元素; 2. 在不破坏照片真实内容的前提下,重新规划更合理的分镜顺序; 3. 生成一套适用于整支片子的 **统一视觉母版前缀**; 4. 为每张照片分别输出一条可独立生成的 **首帧图生视频提示词**; 5. 默认按 **3–6 秒/镜头**设计,优先推荐用户逐镜头独立生成,再进入后期剪辑。 本 Skill 面向没有 AI 视频经验的用户。核心目标不是展示复杂运镜,而是让真实旅拍照片自然地“活起来”,形成统一、克制、电影感的文旅宣传片。 --- ## 2. 默认输入与推荐规格 ### 支持输入 - 照片数量:1–10 张 - 推荐数量:3–6 张 - 地点:城市、景区、街区、建筑、海岸、自然景观等真实旅游地点 - 可选信息: - 希望的总时长 - 希望的单镜头时长 - 横屏 / 竖屏 - 是否有人物 - 是否需要自然环境声 - 用户指定的照片顺序或必须保留的镜头 ### 默认值 当用户没有额外说明时: - 画幅:16:9 - 单镜头时长:4 秒 - 合理范围:3–6 秒 - 每张照片独立生成一条视频 - 全程无字幕、无背景音乐 - 默认后期使用硬切或自然匹配剪辑,不要求视频模型生成复杂转场 如果用户一次上传 7–10 张照片,仍正常处理全部照片,但提示:**3–6 张通常更容易形成节奏集中、视觉统一的短篇文旅片。** --- ## 3. 第一原则 ### 3.1 首帧决定“画面是什么”,Prompt 只决定“画面怎么动” 不要重复描述照片中已经明确存在的大量建筑、服装、景物、材质和空间细节。 提示词重点只写: - 镜头怎么运动; - 主体如何自然延续动作; - 哪些环境元素可以微动; - 哪些视觉信息必须稳定; - 希望获得什么整体情绪。 ### 3.2 内容优先,运镜辅助 文旅宣传片的核心是: **地点、人物、生活气息、自然环境和空间美感。** 运镜只是服务画面的工具。 禁止为了“看起来高级”而强行加入: - 大幅环绕; - 快速推拉; - 甩镜; - 无人机俯冲; - 希区柯克变焦; - 连续多次移焦; - 复杂变速; - 与首帧空间关系不匹配的镜头运动。 ### 3.3 一镜一个主要摄影意图 每个镜头原则上只选择: - **1 个主要运镜** - 最多 **1 个辅助技巧** 例如: - 缓慢跟拍 + 自然人物动作 - 固定镜头 + 移焦 - 缓慢横移 + 前后景视差 不要在 3–6 秒镜头内堆叠多种技巧。 ### 3.4 给视频模型留出发挥空间 除非动作节奏必须控制,否则避免逐秒编排。 优先使用: - “缓慢” - “自然” - “轻微” - “稳定” - “约 2 秒后” 避免大量: - 精确角度 - 位移百分比 - 镜头毫米数 - 复杂物理参数 - 逐帧动作描述 --- ## 3.5 真实地点与人物连续性 ### 真实地点 - 优先使用用户明确提供的城市、景点或街区名称作为文旅语境; - 只根据照片中真实可见内容设计运动,不因为知道地点名称就凭空补入新的地标、建筑、民俗元素或天气; - 如果用户只提供城市名而照片无法确认具体景点,不主动猜测具体地标; - 地点名称主要用于统一文旅语境和情绪,不承担重新设计场景的功能。 ### 同一人物 当同一人物出现在多张照片中: - 优先将相关镜头安排得更连续; - 保持人物身份、服装和整体气质一致; - 动作方向尽量形成自然承接; - 不为了“连续剧情”强行创造照片中没有依据的新动作。 ## 4. 统一视觉母版生成规则 统一母版必须基于用户的真实照片,而不是强行把所有场景改造成同一种滤镜。 ### 默认母版 > **{地点}电影级文旅宣传片,{画幅},ARRI Alexa + 35mm film look,真实自然光与物理反射,细腻自然胶片颗粒,低饱和电影调色,高级、克制、写实。统一延续输入照片中的人物、建筑、空间、天气和光线关系,缓慢稳定运镜,仅产生自然环境微动,无明显场景重构、无主体变形、无夸张CG感。全程无字幕、无背景音乐。** ### 色彩适配规则 当多数照片本身适合黄金时刻、夕阳、蓝调夜景或城市灯光时,可加入: > **暖金高光、青蓝暗部** 当照片主要是: - 正午自然景观 - 雪景 - 森林 - 阴雨城市 - 室内 - 高饱和地方文化场景 不要机械套用“暖金 × 青蓝”。 改为: > **以原照片自然色调为基底,统一低饱和电影调色与柔和高光层次。** 视觉母版的职责是“统一”,不是“覆盖”。 --- ## 5. 照片分析 对每张照片只做必要分析,内部判断以下信息: - 主体:人物 / 建筑 / 街道 / 海岸 / 山川 / 室内 / 食物 / 动物 / 夜景等 - 景别:特写 / 中景 / 全景 / 大远景 - 视觉重心:画面真正需要被观看的位置 - 空间层次:是否有明显前景、中景、远景 - 时间感:清晨 / 白天 / 黄金时刻 / 蓝调时刻 / 夜晚 / 不明确 - 主色调 - 可自然运动的内容 - 是否有人物已经处于动作途中 - 是否存在可以用于匹配剪辑的元素 - 是否适合特殊摄影技巧 分析只用于决策,不要在最终答案里写成长篇图像分析报告。 --- ## 6. 分镜排序规则 用户上传照片的顺序默认 **不等于最终剪辑顺序**。 除非用户明确要求保持原顺序,否则主动给出更合理的推荐排序。 ### 优先考虑以下四类连续性 #### A. 时间连续性 当照片具有明显时间变化时,优先考虑自然时间线: **清晨 → 白天 → 黄金时刻 → 日落 → 蓝调时刻 → 夜晚** 但不要为了时间线拆散明显属于同一动作、同一人物或同一空间的连续镜头。 #### B. 主体连续性 以下照片优先相邻: - 同一个人物 - 同一个家庭 / 同行者 - 同一个地标的不同角度 - 同一街道不同景别 - 同一动作前后关系 #### C. 视觉匹配连续性 可利用: - 相似色调 - 相似构图 - 相似运动方向 - 相似线条 - 水面 / 灯光 / 门洞 / 石阶 / 天空等视觉元素 形成简单的匹配剪辑。 #### D. 叙事节奏 没有明显时间或人物连续性时,可使用: **地点建立 → 进入空间 → 人物 / 生活 → 核心地标 / Hero Shot → 松弛呼吸 → 城市 / 夜景 / 远景收尾** 不要求每支片都完整套用。 ### 开场与结尾 优先选择: - 开场:有地点识别度、空间建立感或强前景层次的照片 - 结尾:日落、夜景、大远景、人物静止、城市天际线、海面等具有“停住”感觉的照片 --- ## 7. 单镜头时长选择 默认 4 秒,根据内容自动在 3–6 秒范围内调整。 ### 3 秒 适合: - 简单建筑 - 静态地标 - 小幅推镜 - 简单人物微动 - 快节奏短片中的过渡镜头 ### 4 秒 默认值,适合大多数旅拍照片。 ### 5–6 秒 适合: - 移焦 - 人物从静止进入行走 - 海岸横移 - 需要较长呼吸感的风景 - 延时摄影 - 轻微升格动作 不要仅仅为了延长片长,把静态照片强行设计成 6 秒复杂动作。 --- ## 8. 运镜选择库 ### 建筑 / 地标 优先: - 固定镜头 - 缓慢推近 - 缓慢横移 - 小幅侧向视差 避免大幅环绕建筑。 ### 街道 / 广场 / 步行人物 优先: - 后方缓慢跟拍 - 侧向跟拍 - 稳定缓慢推进 人物应维持真实步速和生活状态。 ### 人像 / 旅拍写真 优先: - 固定镜头 - 极慢推镜 - 轻微侧向视差 人物动作保持简单: - 眨眼 - 呼吸 - 转头 - 轻微回望 - 自然开始行走 - 头发和衣摆随风轻动 禁止让人物突然做大幅度表演。 ### 海岸 / 湖泊 / 河流 / 开阔景观 优先: - 缓慢横移 - 固定机位 - 很轻的推进 让: - 水面 - 倒影 - 船只 - 云 - 植物 承担主要动态。 ### 城市夜景 / 高处远眺 优先: - 缓慢横移 - 轻微推进 - 接近静止 适合作为结尾。 ### 室内 / 咖啡馆 / 酒店 / 博物馆 优先: - 固定镜头 - 缓慢推镜 - 小幅滑轨横移 避免凭空改变内部空间结构。 ### 食物 / 手工艺 / 局部细节 优先: - 固定近景 - 轻微滑动 - 缓慢推近 重点让蒸汽、手部、小范围材质变化自然发生。 --- ## 9. 特殊摄影技巧 特殊技巧只在照片本身具备明确条件时使用。 ### 移焦 Rack Focus 适用: - 前景与远景都存在明确主体; - 景深层次明显; - 焦点切换能够传递信息。 例如: **前景石碑 → 远处庙宇** 每个镜头原则上只进行一次移焦。 ### 前景虚化 适用: - 树叶 - 栏杆 - 门框 - 石碑 - 街边物体 本身已经形成明显前景遮挡时。 不要凭空添加前景。 ### 延时摄影 仅适用: - 云层 - 日落 - 城市灯光逐渐亮起 - 人流 - 车流 - 明确具有时间变化价值的场景 有人物近景或人物是核心主体时,默认不使用延时。 ### 升格 / 慢动作感 仅适用: - 风吹头发 - 裙摆 - 海浪 - 水花 - 鸟群 - 飘落物 - 明显具有动态美感的自然动作 普通走路和静态建筑默认不使用升格。 ### 视差 照片存在清晰前、中、后景时,可以通过轻微横移形成自然视差。 没有空间层次时不要硬加。 --- ## 10. 人物与环境动作规则 ### 人物 只延续首帧中最自然的下一步动作。 优先: - 呼吸 - 眨眼 - 轻微转头 - 继续走路 - 从静止自然开始行走 - 看向风景 - 衣物和头发随风轻动 避免: - 突然看镜头 - 突然奔跑 - 大幅挥手 - 强烈表演 - 首帧没有依据的互动 ### 环境 优先让照片中已经存在的元素产生自然微动: - 树叶 - 云 - 烟雾 - 水面 - 倒影 - 灯光 - 喷泉 - 船 - 远景行人 - 宠物 不凭空增加大量新元素。 ### 动物 保持原位置逻辑与行为逻辑。 例如: - 狗自然行走、摇尾 - 鸟轻微飞行 - 船随水面起伏 避免突然高速运动。 --- ## 11. 首帧稳定性规则 每条提示词默认要求: - 从输入照片自然开始; - 延续原人物身份、服装和姿态; - 保持建筑与空间结构; - 保持主要光源方向; - 不重新设计场景; - 不随意增加人物或物体; - 不把真实景点变成幻想建筑; - 不出现明显人物、建筑或动物形变; - 不使用夸张 CG 特效。 如果照片中有重要且清晰可读的: - 地名 - 石碑 - 店招 - 建筑牌匾 并且文字是镜头核心信息时,再额外加入: > **保持原有文字内容和位置稳定,不乱码、不变形。** 不要对每个镜头都机械加入文字锁定。 --- ## 12. Prompt 生成公式 每个分镜使用: **统一视觉母版 + 主要运镜 + 主体自然动作 + 1–2 个环境微动 + 必要的稳定要求 + 情绪** 分镜专属描述建议控制在 **2–4 句**。 不要把照片重新写成文生图提示词。 ### 推荐粒度 好的写法: > 摄影机沿海岸步道缓慢平稳横移。人物与宠物自然继续前行,海面产生细小波纹,远处船只轻轻起伏。整体安静、松弛,有当地海边生活气息。 不推荐: > 摄影机以 1.5%/s 的速度沿 X 轴向右移动 2.7 米,35mm 镜头,人物右脚在 0.8 秒迈出…… --- ## 13. 输出结构 最终只输出用户真正需要执行的内容。 ### A. 方案摘要 简短说明: - 输入照片数量 - 推荐总顺序 - 预计总片长 - 整体叙事逻辑 ### B. 推荐分镜顺序 格式: > **原图 3 → 原图 1 → 原图 4 → 原图 2** 每张图补充一个简短原因即可。 ### C. 统一视觉母版 输出一段可复制的完整前缀。 ### D. 每张照片的最终 Prompt 格式: #### 分镜 01|原图 X|4s **运镜:缓慢横移** > `{统一视觉母版}` > `该镜头专属提示词` 依次输出全部照片。 每条必须能够 **单独复制后直接用于首帧图生视频**,因此每条都需要包含统一视觉母版,不允许只写“同上”。 ### E. 简短生成建议 固定提醒: > 建议每张照片分别生成独立的 3–6 秒视频,满意后再按推荐顺序进入剪辑;不要让视频模型一次完成全部照片之间的转场。 如无特殊需要,不额外输出长篇摄影理论。 --- ## 14. 面向小白的交互规则 当用户已经提供: - 照片 - 旅游地点 就直接开始分析,不要继续追问大量专业参数。 只有以下信息会显著改变结果时才询问: - 用户明确需要竖屏但照片是横屏; - 用户要求固定总时长; - 用户要求必须保持原照片顺序; - 用户要求特定品牌 / 平台 / 视频模型格式; - 用户希望加入旁白、字幕或音乐。 否则全部使用默认值完成方案。 --- ## 15. 混合画幅处理 当输入照片比例不一致: - 默认仍以用户目标视频画幅为准; - 未指定时使用 16:9; - 如果某张照片需要大幅裁切才可适配,不在视频阶段强行改变主体构图; - 应提醒用户优先先完成扩图或重新构图,再做图生视频。 --- ## 16. 剪辑连续性 本 Skill 只负责为每张照片生成独立视频,但在排序时需考虑后期剪辑。 默认优先: - 硬切 - 动作方向匹配 - 色调匹配 - 构图匹配 - 光线匹配 不主动生成: - AI Morph - 场景溶解 - 传送门 - 镜头穿越物体 - 复杂转场特效 如果两张照片天然具有: - 同一人物动作 - 相同运动方向 - 同一地标不同景别 - 相似门洞 / 太阳 / 水面 / 建筑线条 可在排序说明中指出其适合进行匹配剪辑。 --- ## 17. 最终质量检查 输出前只检查以下问题: 1. 每张照片是否都有独立 Prompt; 2. 每条 Prompt 是否包含统一视觉母版; 3. 是否优先延续首帧而不是重构首帧; 4. 是否一镜只有一个主要摄影意图; 5. 运镜是否服务内容; 6. 人物动作是否自然; 7. 是否给环境留下足够自然发挥空间; 8. 是否存在不必要的精确参数; 9. 分镜排序是否有明确连续性; 10. 是否默认建议逐镜头独立生成。 如果某条提示词删掉一句后不影响预期结果,就优先删除。