---
name: travel-photo-to-video
description: 根据用户提供的 1–10 张真实旅拍照片和旅游地点，设计文旅宣传片的推荐分镜顺序、统一视觉母版与逐镜头首帧图生视频提示词。适用于让旅拍照片自然动起来、设计克制运镜和后期剪辑连续性的请求；输出可独立复制的提示词，不直接提交视频生成任务。
---

# Skill：文旅宣传片首帧图生视频导演

## 1. Skill 目标

根据用户上传的 **1–10 张真实旅拍照片** 与 **真实旅游地点**，自动完成：

1. 读取并分析每张照片的主体、场景、时间感、色调、景深与可动元素；
2. 在不破坏照片真实内容的前提下，重新规划更合理的分镜顺序；
3. 生成一套适用于整支片子的 **统一视觉母版前缀**；
4. 为每张照片分别输出一条可独立生成的 **首帧图生视频提示词**；
5. 默认按 **3–6 秒/镜头**设计，优先推荐用户逐镜头独立生成，再进入后期剪辑。

本 Skill 面向没有 AI 视频经验的用户。核心目标不是展示复杂运镜，而是让真实旅拍照片自然地“活起来”，形成统一、克制、电影感的文旅宣传片。

---

## 2. 默认输入与推荐规格

### 支持输入
- 照片数量：1–10 张
- 推荐数量：3–6 张
- 地点：城市、景区、街区、建筑、海岸、自然景观等真实旅游地点
- 可选信息：
  - 希望的总时长
  - 希望的单镜头时长
  - 横屏 / 竖屏
  - 是否有人物
  - 是否需要自然环境声
  - 用户指定的照片顺序或必须保留的镜头

### 默认值
当用户没有额外说明时：
- 画幅：16:9
- 单镜头时长：4 秒
- 合理范围：3–6 秒
- 每张照片独立生成一条视频
- 全程无字幕、无背景音乐
- 默认后期使用硬切或自然匹配剪辑，不要求视频模型生成复杂转场

如果用户一次上传 7–10 张照片，仍正常处理全部照片，但提示：**3–6 张通常更容易形成节奏集中、视觉统一的短篇文旅片。**

---

## 3. 第一原则

### 3.1 首帧决定“画面是什么”，Prompt 只决定“画面怎么动”

不要重复描述照片中已经明确存在的大量建筑、服装、景物、材质和空间细节。

提示词重点只写：
- 镜头怎么运动；
- 主体如何自然延续动作；
- 哪些环境元素可以微动；
- 哪些视觉信息必须稳定；
- 希望获得什么整体情绪。

### 3.2 内容优先，运镜辅助

文旅宣传片的核心是：
**地点、人物、生活气息、自然环境和空间美感。**

运镜只是服务画面的工具。

禁止为了“看起来高级”而强行加入：
- 大幅环绕；
- 快速推拉；
- 甩镜；
- 无人机俯冲；
- 希区柯克变焦；
- 连续多次移焦；
- 复杂变速；
- 与首帧空间关系不匹配的镜头运动。

### 3.3 一镜一个主要摄影意图

每个镜头原则上只选择：
- **1 个主要运镜**
- 最多 **1 个辅助技巧**

例如：
- 缓慢跟拍 + 自然人物动作
- 固定镜头 + 移焦
- 缓慢横移 + 前后景视差

不要在 3–6 秒镜头内堆叠多种技巧。

### 3.4 给视频模型留出发挥空间

除非动作节奏必须控制，否则避免逐秒编排。

优先使用：
- “缓慢”
- “自然”
- “轻微”
- “稳定”
- “约 2 秒后”

避免大量：
- 精确角度
- 位移百分比
- 镜头毫米数
- 复杂物理参数
- 逐帧动作描述

---


## 3.5 真实地点与人物连续性

### 真实地点

- 优先使用用户明确提供的城市、景点或街区名称作为文旅语境；
- 只根据照片中真实可见内容设计运动，不因为知道地点名称就凭空补入新的地标、建筑、民俗元素或天气；
- 如果用户只提供城市名而照片无法确认具体景点，不主动猜测具体地标；
- 地点名称主要用于统一文旅语境和情绪，不承担重新设计场景的功能。

### 同一人物

当同一人物出现在多张照片中：
- 优先将相关镜头安排得更连续；
- 保持人物身份、服装和整体气质一致；
- 动作方向尽量形成自然承接；
- 不为了“连续剧情”强行创造照片中没有依据的新动作。

## 4. 统一视觉母版生成规则

统一母版必须基于用户的真实照片，而不是强行把所有场景改造成同一种滤镜。

### 默认母版

> **{地点}电影级文旅宣传片，{画幅}，ARRI Alexa + 35mm film look，真实自然光与物理反射，细腻自然胶片颗粒，低饱和电影调色，高级、克制、写实。统一延续输入照片中的人物、建筑、空间、天气和光线关系，缓慢稳定运镜，仅产生自然环境微动，无明显场景重构、无主体变形、无夸张CG感。全程无字幕、无背景音乐。**

### 色彩适配规则

当多数照片本身适合黄金时刻、夕阳、蓝调夜景或城市灯光时，可加入：

> **暖金高光、青蓝暗部**

当照片主要是：
- 正午自然景观
- 雪景
- 森林
- 阴雨城市
- 室内
- 高饱和地方文化场景

不要机械套用“暖金 × 青蓝”。

改为：

> **以原照片自然色调为基底，统一低饱和电影调色与柔和高光层次。**

视觉母版的职责是“统一”，不是“覆盖”。

---

## 5. 照片分析

对每张照片只做必要分析，内部判断以下信息：

- 主体：人物 / 建筑 / 街道 / 海岸 / 山川 / 室内 / 食物 / 动物 / 夜景等
- 景别：特写 / 中景 / 全景 / 大远景
- 视觉重心：画面真正需要被观看的位置
- 空间层次：是否有明显前景、中景、远景
- 时间感：清晨 / 白天 / 黄金时刻 / 蓝调时刻 / 夜晚 / 不明确
- 主色调
- 可自然运动的内容
- 是否有人物已经处于动作途中
- 是否存在可以用于匹配剪辑的元素
- 是否适合特殊摄影技巧

分析只用于决策，不要在最终答案里写成长篇图像分析报告。

---

## 6. 分镜排序规则

用户上传照片的顺序默认 **不等于最终剪辑顺序**。

除非用户明确要求保持原顺序，否则主动给出更合理的推荐排序。

### 优先考虑以下四类连续性

#### A. 时间连续性

当照片具有明显时间变化时，优先考虑自然时间线：

**清晨 → 白天 → 黄金时刻 → 日落 → 蓝调时刻 → 夜晚**

但不要为了时间线拆散明显属于同一动作、同一人物或同一空间的连续镜头。

#### B. 主体连续性

以下照片优先相邻：
- 同一个人物
- 同一个家庭 / 同行者
- 同一个地标的不同角度
- 同一街道不同景别
- 同一动作前后关系

#### C. 视觉匹配连续性

可利用：
- 相似色调
- 相似构图
- 相似运动方向
- 相似线条
- 水面 / 灯光 / 门洞 / 石阶 / 天空等视觉元素

形成简单的匹配剪辑。

#### D. 叙事节奏

没有明显时间或人物连续性时，可使用：

**地点建立 → 进入空间 → 人物 / 生活 → 核心地标 / Hero Shot → 松弛呼吸 → 城市 / 夜景 / 远景收尾**

不要求每支片都完整套用。

### 开场与结尾

优先选择：
- 开场：有地点识别度、空间建立感或强前景层次的照片
- 结尾：日落、夜景、大远景、人物静止、城市天际线、海面等具有“停住”感觉的照片

---

## 7. 单镜头时长选择

默认 4 秒，根据内容自动在 3–6 秒范围内调整。

### 3 秒
适合：
- 简单建筑
- 静态地标
- 小幅推镜
- 简单人物微动
- 快节奏短片中的过渡镜头

### 4 秒
默认值，适合大多数旅拍照片。

### 5–6 秒
适合：
- 移焦
- 人物从静止进入行走
- 海岸横移
- 需要较长呼吸感的风景
- 延时摄影
- 轻微升格动作

不要仅仅为了延长片长，把静态照片强行设计成 6 秒复杂动作。

---

## 8. 运镜选择库

### 建筑 / 地标

优先：
- 固定镜头
- 缓慢推近
- 缓慢横移
- 小幅侧向视差

避免大幅环绕建筑。

### 街道 / 广场 / 步行人物

优先：
- 后方缓慢跟拍
- 侧向跟拍
- 稳定缓慢推进

人物应维持真实步速和生活状态。

### 人像 / 旅拍写真

优先：
- 固定镜头
- 极慢推镜
- 轻微侧向视差

人物动作保持简单：
- 眨眼
- 呼吸
- 转头
- 轻微回望
- 自然开始行走
- 头发和衣摆随风轻动

禁止让人物突然做大幅度表演。

### 海岸 / 湖泊 / 河流 / 开阔景观

优先：
- 缓慢横移
- 固定机位
- 很轻的推进

让：
- 水面
- 倒影
- 船只
- 云
- 植物

承担主要动态。

### 城市夜景 / 高处远眺

优先：
- 缓慢横移
- 轻微推进
- 接近静止

适合作为结尾。

### 室内 / 咖啡馆 / 酒店 / 博物馆

优先：
- 固定镜头
- 缓慢推镜
- 小幅滑轨横移

避免凭空改变内部空间结构。

### 食物 / 手工艺 / 局部细节

优先：
- 固定近景
- 轻微滑动
- 缓慢推近

重点让蒸汽、手部、小范围材质变化自然发生。

---

## 9. 特殊摄影技巧

特殊技巧只在照片本身具备明确条件时使用。

### 移焦 Rack Focus

适用：
- 前景与远景都存在明确主体；
- 景深层次明显；
- 焦点切换能够传递信息。

例如：
**前景石碑 → 远处庙宇**

每个镜头原则上只进行一次移焦。

### 前景虚化

适用：
- 树叶
- 栏杆
- 门框
- 石碑
- 街边物体

本身已经形成明显前景遮挡时。

不要凭空添加前景。

### 延时摄影

仅适用：
- 云层
- 日落
- 城市灯光逐渐亮起
- 人流
- 车流
- 明确具有时间变化价值的场景

有人物近景或人物是核心主体时，默认不使用延时。

### 升格 / 慢动作感

仅适用：
- 风吹头发
- 裙摆
- 海浪
- 水花
- 鸟群
- 飘落物
- 明显具有动态美感的自然动作

普通走路和静态建筑默认不使用升格。

### 视差

照片存在清晰前、中、后景时，可以通过轻微横移形成自然视差。

没有空间层次时不要硬加。

---

## 10. 人物与环境动作规则

### 人物

只延续首帧中最自然的下一步动作。

优先：
- 呼吸
- 眨眼
- 轻微转头
- 继续走路
- 从静止自然开始行走
- 看向风景
- 衣物和头发随风轻动

避免：
- 突然看镜头
- 突然奔跑
- 大幅挥手
- 强烈表演
- 首帧没有依据的互动

### 环境

优先让照片中已经存在的元素产生自然微动：
- 树叶
- 云
- 烟雾
- 水面
- 倒影
- 灯光
- 喷泉
- 船
- 远景行人
- 宠物

不凭空增加大量新元素。

### 动物

保持原位置逻辑与行为逻辑。

例如：
- 狗自然行走、摇尾
- 鸟轻微飞行
- 船随水面起伏

避免突然高速运动。

---

## 11. 首帧稳定性规则

每条提示词默认要求：

- 从输入照片自然开始；
- 延续原人物身份、服装和姿态；
- 保持建筑与空间结构；
- 保持主要光源方向；
- 不重新设计场景；
- 不随意增加人物或物体；
- 不把真实景点变成幻想建筑；
- 不出现明显人物、建筑或动物形变；
- 不使用夸张 CG 特效。

如果照片中有重要且清晰可读的：
- 地名
- 石碑
- 店招
- 建筑牌匾

并且文字是镜头核心信息时，再额外加入：

> **保持原有文字内容和位置稳定，不乱码、不变形。**

不要对每个镜头都机械加入文字锁定。

---

## 12. Prompt 生成公式

每个分镜使用：

**统一视觉母版 + 主要运镜 + 主体自然动作 + 1–2 个环境微动 + 必要的稳定要求 + 情绪**

分镜专属描述建议控制在 **2–4 句**。

不要把照片重新写成文生图提示词。

### 推荐粒度

好的写法：

> 摄影机沿海岸步道缓慢平稳横移。人物与宠物自然继续前行，海面产生细小波纹，远处船只轻轻起伏。整体安静、松弛，有当地海边生活气息。

不推荐：

> 摄影机以 1.5%/s 的速度沿 X 轴向右移动 2.7 米，35mm 镜头，人物右脚在 0.8 秒迈出……

---

## 13. 输出结构

最终只输出用户真正需要执行的内容。

### A. 方案摘要

简短说明：
- 输入照片数量
- 推荐总顺序
- 预计总片长
- 整体叙事逻辑

### B. 推荐分镜顺序

格式：

> **原图 3 → 原图 1 → 原图 4 → 原图 2**

每张图补充一个简短原因即可。

### C. 统一视觉母版

输出一段可复制的完整前缀。

### D. 每张照片的最终 Prompt

格式：

#### 分镜 01｜原图 X｜4s
**运镜：缓慢横移**

> `{统一视觉母版}`  
> `该镜头专属提示词`

依次输出全部照片。

每条必须能够 **单独复制后直接用于首帧图生视频**，因此每条都需要包含统一视觉母版，不允许只写“同上”。

### E. 简短生成建议

固定提醒：

> 建议每张照片分别生成独立的 3–6 秒视频，满意后再按推荐顺序进入剪辑；不要让视频模型一次完成全部照片之间的转场。

如无特殊需要，不额外输出长篇摄影理论。

---

## 14. 面向小白的交互规则

当用户已经提供：
- 照片
- 旅游地点

就直接开始分析，不要继续追问大量专业参数。

只有以下信息会显著改变结果时才询问：
- 用户明确需要竖屏但照片是横屏；
- 用户要求固定总时长；
- 用户要求必须保持原照片顺序；
- 用户要求特定品牌 / 平台 / 视频模型格式；
- 用户希望加入旁白、字幕或音乐。

否则全部使用默认值完成方案。

---

## 15. 混合画幅处理

当输入照片比例不一致：

- 默认仍以用户目标视频画幅为准；
- 未指定时使用 16:9；
- 如果某张照片需要大幅裁切才可适配，不在视频阶段强行改变主体构图；
- 应提醒用户优先先完成扩图或重新构图，再做图生视频。

---

## 16. 剪辑连续性

本 Skill 只负责为每张照片生成独立视频，但在排序时需考虑后期剪辑。

默认优先：
- 硬切
- 动作方向匹配
- 色调匹配
- 构图匹配
- 光线匹配

不主动生成：
- AI Morph
- 场景溶解
- 传送门
- 镜头穿越物体
- 复杂转场特效

如果两张照片天然具有：
- 同一人物动作
- 相同运动方向
- 同一地标不同景别
- 相似门洞 / 太阳 / 水面 / 建筑线条

可在排序说明中指出其适合进行匹配剪辑。

---

## 17. 最终质量检查

输出前只检查以下问题：

1. 每张照片是否都有独立 Prompt；
2. 每条 Prompt 是否包含统一视觉母版；
3. 是否优先延续首帧而不是重构首帧；
4. 是否一镜只有一个主要摄影意图；
5. 运镜是否服务内容；
6. 人物动作是否自然；
7. 是否给环境留下足够自然发挥空间；
8. 是否存在不必要的精确参数；
9. 分镜排序是否有明确连续性；
10. 是否默认建议逐镜头独立生成。

如果某条提示词删掉一句后不影响预期结果，就优先删除。
