---
title: AI 口播剪辑技巧与执行规则
version: 0.1.0
intended_consumer: ai-video-editor
language: zh-CN
source_documents: 198
source_creators:
  - 五年剪辑师乐乐
  - 剪辑师晨晨
status: extracted-and-guardrailed
---

# AI 口播剪辑技巧与执行规则

> 面向 AI 视频剪辑工具、剪辑代理和自动化工作流的工具无关知识文档。  
> 版本：0.1.0  
> 整理日期：2026-07-24  
> 经验来源：Obsidian「五年剪辑师乐乐」143 份抖音正文、「剪辑师晨晨」55 份抖音正文，以及 `majia-chatcut-koubo` 的生产护栏。  
> 文档目标：把“经验型教程”转成 AI 可以判断、计划、执行、验证和回退的规则。

---

## 0. 使用约定

### 0.1 规则强度

- **MUST / 必须**：违反即停止执行或判定未完成。
- **SHOULD / 应该**：默认执行；只有存在清楚的素材或用户理由时才能偏离。
- **MAY / 可以**：可选方案，需要根据语义、素材和平台选择。
- **BASELINE / 样片起点**：经验参数，不是跨素材常量；必须用代表性样片校准。
- **EXAMPLE / 实现示例**：来自剪映等特定软件，只表达编辑意图，不要求其他工具复制按钮路径。

### 0.2 规则优先级

冲突时按以下顺序裁决，前项可否决后项：

1. 用户明确要求、已批准设计和内容事实。
2. 隐私、版权、真实性和平台合规。
3. 实际音频、说话语义和源素材证据。
4. 字幕可读性、主音频清晰度和画面连续性。
5. 关键信息的理解效率。
6. 情绪、节奏和留存。
7. 风格、高级感、特效和新鲜感。

**总原则：技术为叙事服务。不能为了“看起来剪过”而损伤事实、语义、听感或证据。**

### 0.3 非目标

AI 剪辑工具不得：

- 替说话人编造新的观点、数字、案例或钩子。
- 用生成画面代替真实操作、数据结果、产品证据或报错截图。
- 把固定倍速、固定切换频率、固定字体或固定动效当成通用真理。
- 在字幕中凭常识猜测数字、品牌、人名、否定词或专业术语。
- 未经用户授权导出、发布、删除高风险内容或改变已验收风格。

---

## 1. AI 剪辑任务输入契约

执行前至少需要以下信息。缺少关键字段时标记 `unknown`，不得默默猜测。

```yaml
project:
  projectId: string
  timelineId: string
  timelineRevision: string
  sourceAssets:
    - assetId: string
      sourceRevision: string
      pathOrUri: string
      durationMs: integer
      fps: number
      hasAudio: boolean
      hasVideo: boolean

content:
  language: zh-CN
  contentType: talking_head | screen_recording | voice_only | interview | mixed
  topic: string
  intendedAudience: string
  intendedOutcome: understand | trust | remember | act | compare | learn
  transcriptSource: refined_script | original_asr | timeline_asr
  refinedTranscriptPath: string | null
  terminology: []

delivery:
  platform: douyin | xiaohongshu | wechat_channels | bilibili | custom
  aspectRatio: "9:16" | "16:9" | "1:1" | custom
  targetDurationMs: integer | null
  subtitleRequired: boolean
  exportAuthorized: boolean

constraints:
  contentStructureLocked: boolean
  visualBaselineLocked: boolean
  preserveSegments: []
  forbiddenEdits: []
  privacyTargets: []
  brandPalette: string | null
  accessibilityNeeds: []

capabilities:
  canReadTimeline: boolean
  canEditTimeline: boolean
  canRefreshTranscript: boolean
  canRenderFrames: boolean
  canAnalyzeAudio: boolean
  canCreateMasks: boolean
  canKeyframe: boolean
  canExport: boolean
```

### 1.1 开工阻断条件

以下任一条件成立时不得直接批量编辑：

- 不知道哪条音轨是主讲人的唯一主音频。
- 时间线与转写的 revision 不一致。
- 用户提供了精校逐字稿，但系统尚未读取。
- 不知道最终平台、画幅或是否允许改变内容结构。
- 已存在用户验收样片，却没有冻结其状态、颜色和动效行为。
- 隐私候选已发现，但没有覆盖方案。
- 无法读取或回滚编辑结果。

---

## 2. AI 必须产出的中间对象

AI 不应从“原始素材”直接跳到“批量写时间线”。至少先生成以下计划对象。

```yaml
preflightReport:
  timelineRevision: string
  mainAudioOwner: string
  duplicateAudioTracks: []
  transcriptBinding: string
  privacyCandidates: []
  unknownItems: []
  capabilityGaps: []

semanticMap:
  - segmentId: string
    sourceRange: [startMs, endMs]
    text: string
    role: hook | setup | pain | evidence | explanation | list | contrast | climax | conclusion | cta
    importance: 1-5
    emotion: neutral | curious | tense | warm | excited | serious
    visualNeed: evidence | speaker | list | data | scene | none
    uniqueInformation: []

aRollPlan:
  - candidateId: string
    range: [startMs, endMs]
    action: keep | trim | remove | move | speed | manual_confirm
    risk: low | medium | high
    reason: string
    evidenceRefs: []

visualStatePlan:
  - stateId: A | B-R | B-L | C1 | C2 | S | P
    range: [startMs, endMs]
    semanticReason: string
    screenOwner: string | null
    speakerOwner: string | null
    graphicOwners: []
    transitionIn: string | null
    transitionOut: string | null
    privacyOwner: string | null

captionPlan:
  sourceBinding: original
  pages: []
  terminologyEvidence: []
  unresolvedTerms: []

qaPlan:
  structureChecks: []
  audioChecks: []
  captionChecks: []
  pixelChecks: []
  privacyChecks: []
```

时间区间统一使用半开区间 `[startMs, endMs)` 或 `[startFrame, endFrame)`，不得混用闭区间。

---

## 3. 全流程状态机

```text
INGEST
  → PREFLIGHT
  → TRANSCRIPT_READY
  → SEMANTIC_MAP_READY
  → A_ROLL_LOCKED
  → HOOK_AND_RETENTION_LOCKED
  → CAPTIONS_LOCKED
  → VISUAL_PLAN_APPROVED
  → REPRESENTATIVE_SAMPLE_PASSED
  → TIMELINE_EDITED
  → STRUCTURE_QA_PASSED
  → AUDIO_QA_PASSED
  → PIXEL_QA_PASSED
  → EXPORT_READY
```

任一阶段失败时回到最近的已验证状态。不得带着半成品继续向下游扩散。

### 3.1 推荐执行顺序

1. 盘点素材、轨道、规格、隐私和用户约束。
2. 锁定主音频，读取精校稿或转写。
3. 通读全文，建立语义地图和内容结构。
4. 粗剪 A-roll：重说、口误、卡壳、无信息停顿。
5. 决定开头钩子、中段留存和结尾。
6. 基于最终 A-roll 刷新转写。
7. 校正文字、术语、数字，再做气口分页和字幕样式。
8. 为每个语义段选择画面任务和状态。
9. 选择真实素材、B-roll、信息块和必要动效。
10. 先完成代表性样片并验收，再批量扩展。
11. 加音乐、音效、配色和包装。
12. 做结构、字幕、音频、像素、隐私五类终验。

---

## 4. 文案与语义拆解

### 4.1 先理解，再剪辑

AI 在任何删除、重排、素材匹配或特效决策前，必须回答：

- 这条视频用一句话如何概括？
- 目标受众是谁？
- 观众看完应该知道、相信、记住或做什么？
- 哪一句承担抓注意力？
- 哪几句承担问题、证据、方案和结论？
- 哪一句是全片唯一不能丢失的信息？
- 哪些数字、名词和结论需要真实画面佐证？
- 哪一段是信息或情绪高潮？

如果无法回答，不得开始视觉包装。

### 4.2 语义角色识别

| 角色 | 识别信号 | AI 动作 |
| --- | --- | --- |
| Hook 钩子 | 结果、反直觉、问题、真实数字 | 候选开场；检查后续兑现 |
| Setup 背景 | 时间、人物、场景、上下文 | 信息流短片可压缩，长教程可保留 |
| Pain 问题 | “为什么”“最麻烦”“常见错误” | 使用问题卡、错误画面或人物强调 |
| Evidence 证据 | 数据、截图、案例、实物、操作结果 | 优先真实录屏、原图和来源明确的素材 |
| Explanation 解释 | 原因、逻辑、机制 | 人物加强或专业分栏 |
| List 列举 | 第一/第二、多个国家/型号/方法 | 使用逐项清单、并列句或卡片 |
| Contrast 对比 | 以前/现在、错误/正确、A/B | 左右或前后对比；方向必须有语义 |
| Climax 高潮 | 最重要结论、情绪爆点 | 人物加强、关键词或大数字，减少无关元素 |
| Conclusion 结论 | “所以”“核心是”“总结” | 让画面落稳，保证语义完整 |
| CTA 行动 | 收藏、评论、购买、下一步 | 仅在原素材存在且平台/用户允许时保留 |

### 4.3 AIDA 只作为分析框架

AI 可以用 `Attention → Interest → Desire → Action` 检查结构，但不得为了凑模型改写事实。实际作品可以缺少某一阶段。

推荐标注：

```yaml
scriptStructure:
  attention: [segmentIds]
  interest: [segmentIds]
  evidenceOrDesire: [segmentIds]
  action: [segmentIds]
  missingStages: []
```

### 4.4 结构先于视觉

- MUST：先确定逻辑流，再考虑字体、蒙版、卡片和动效。
- MUST：同一语义段只解决一个主要视觉任务。
- SHOULD：高信息密度段减少同时出现的装饰。
- SHOULD：密集效果后安排可理解的缓冲段。
- MUST NOT：一句话一个不同特效，导致视觉语法失控。

---

## 5. A-roll 粗剪与重说处理

### 5.1 内容真相

主音频和最终时间线是唯一内容真相。稿件只能帮助对齐，不能替代说话人实际没有说出的内容。

### 5.2 删除风险表

| 候选 | 风险 | 默认动作 | 验证 |
| --- | --- | --- | --- |
| 明确空白、开机杂音、纯卡壳 | 低 | 小批删除 | 抽听切点 |
| “嗯、啊、那个”等单个口头词 | 中 | 看节奏和人格表达决定 | 听前后语境 |
| 0.2–1 秒自然停顿 | 中 | 不机械删除 | 判断是否承担呼吸或强调 |
| 句间重复、第二遍完整 | 中 | 默认删前保后 | 检查后版覆盖全部信息 |
| 句内重启 | 中 | 只删错误或未完成片段 | 试听拼接是否自然 |
| 整句、长段、跑题 | 高 | 保留或请求确认 | 证明保留段覆盖独有信息 |
| 专业词、数字、否定词附近 | 高 | 不自动删 | 音频与上下文双证据 |
| 笑声、反应、结论后留白 | 高 | 可能是内容 | 判断情绪功能 |

### 5.3 重说决策

```text
if later_take is complete
and later_take contains all unique facts from earlier_take
and splice sounds natural:
    remove earlier_take
else:
    keep both or request confirmation
```

### 5.4 停顿决策

删除停顿前判断：

1. 是否是语法边界？
2. 是否让结论落地？
3. 是否承担情绪变化？
4. 是否对应屏幕操作等待？
5. 删除后会不会出现音节粘连或不自然吸气？

只要任一答案为“是”，就不能按普通废气口处理。

---

## 6. 气口、跳切与变速决策树

来源经验提出局部变速、短转场和重点放大三种处理。AI 应将其改写为条件决策，而不是固定动作。

### 6.1 气口处理顺序

```text
1. 先判断能否在自然停顿处直接剪。
2. 试听声音是否连续。
3. 检查人物位置、头部大小、手势和背景是否跳变。
4. 有跳变时优先使用有语义关联的 B-roll 或录屏覆盖。
5. 下句是重点时，可在切点后做克制 punch-in。
6. 只有语义边界明确且视觉仍突兀时，才用短转场。
7. 任何方案不能验证时，保留原气口或请求人工确认。
```

### 6.2 方案选择表

| 条件 | 首选 | 次选 | 禁止 |
| --- | --- | --- | --- |
| 音频自然、人物位置稳定 | 直接切 | 极短交叉声桥 | 为了“丝滑”加长转场 |
| 音频自然、人物明显跳变 | 对应 B-roll/屏幕证据 | 克制 punch-in | 无关氛围素材 |
| 下句是重点结论 | 放大 10–20% 的样片起点 + 轻量音效 | 人物加强态 | 每句都放大 |
| 有明确章节切换 | 语义化转场 | 气口直切 | 句中切换 |
| 纯音频 | 波形剪辑 + 视觉段切换 | 文档/图表/卡片换场 | 用黑屏掩盖 |

### 6.3 变速规则

- MUST：先清理口误、重说和停顿，再评估变速。
- SHOULD：从局部或小幅提速开始试听。
- BASELINE：来源中常见 1.1–1.2x；既有生产护栏可从 1.2–1.3x 试听。
- MUST NOT：把 1.2x、1.5x 或 2x 写成全片默认值。
- MUST：保持音高，并检查情绪、清晰度、字幕阅读时间和词级时间戳。
- MUST：变速后刷新剪后转写和字幕时序。
- SHOULD：情绪、案例、笑点和结论段允许比信息段更慢。

---

## 7. 开头钩子与留存

### 7.1 钩子只能从真实口述中选择

AI 可以选句、删铺垫、整体搬移完整语义单位，但不能生成说话人没说过的新句子。

### 7.2 三类钩子

| 类型 | 识别例式 | 合适场景 | 画面兑现 |
| --- | --- | --- | --- |
| 数字承诺 | 真实数字 + 可验证结果 | 干货、商业、数据、教程 | 大数字或结果画面 |
| 模式打断 | 反直觉断言、直接否定旧做法 | 观点、避坑、效率 | 关键词强调、错误/正确对比 |
| 提问开局 | 观众会代入的问题 | 教育、咨询、测评 | 问答卡，前 1/3 给答案 |

### 7.3 钩子候选评分

```yaml
hookScore:
  specificity: 0-2
  audienceRelevance: 0-2
  noveltyOrTension: 0-2
  factualSupport: 0-2
  brevity: 0-1
  payoffAvailableInFirstThird: 0-1
```

低于 6 分的候选不应仅靠包装强推为钩子。

### 7.4 开头处理

- 信息流短片 SHOULD 删除无独有信息的问候、自我介绍和泛铺垫。
- 第一有效句 SHOULD 是结果、核心论点、反直觉断言或真实问题。
- 录屏教程 MAY 先闪现约 0.3 秒结果画面，再回到步骤。
- 首帧 MUST 有人脸、动作、证据或高对比内容；禁止黑帧和转场中间帧。
- 标题页如必须存在，应与第一句同帧起声，通常不独占长时间。
- 钩子承诺 MUST 在前 1/3 内兑现；否则更换钩子或前移兑现段。

### 7.5 密度与留白

来源反复强调前三秒和高密度包装，但也明确指出“效果太密后需要喘气”。AI 应遵循：

- 高密度不等于多元素，而是单位时间内有效信息清楚。
- 密集的开场后 SHOULD 给一段稳定画面，让观众完成理解。
- 超过约 30–45 秒没有构图、语气、数据或直接交流变化时，触发复查，不自动切换。
- 专业受众、复杂教程和 B 站长视频采用慢档，不套娱乐快切频率。

---

## 8. 字幕系统

### 8.1 四层模型

```text
原始转写
  → 字幕源绑定
  → 气口与分页
  → 显示样式
```

上游错误必须在上游修，禁止用大量显示层覆盖掩盖。

### 8.2 字幕处理顺序

1. 先锁定最终 A-roll 和速度。
2. 刷新剪后时间线转写。
3. 检查字幕绑定是否为原文源。
4. 对照精校逐字稿、音频和术语表修文字。
5. 单独处理气口、标点和分页。
6. 应用样式。
7. 回读全文、时间范围和真实显示像素。

### 8.3 文本真相

- 用户精校逐字稿存在时，它是首要文本来源。
- 精校稿与实际音频冲突时，以音频实际说法为准。
- 数字、金额、日期、百分比、单位、品牌、人名、专业词、否定词必须有证据。
- 自动转写常见错误包括数字吞位、繁体混入、近音专名和方向性词误写。
- 不确定词标 `manual_confirm`，不得“根据常识”自动修正。

### 8.4 气口分卡

一张字幕卡应是一个可独立理解的气口：

- 优先切在吸气、停顿、语调落下、完整主谓宾、转折、因果和列举边界。
- 不拆定语与中心词。
- 不把上句尾和下句头拼成一张卡。
- 不按固定字数机械切割。
- 避免连续 2–5 字闪卡。

BASELINE：

- 每卡约 8–24 个汉字。
- 每卡约 0.8–3 秒。
- `<450ms` 失败；`450–800ms` 仅允许经批准的英文品牌或缩写完整卡。
- 单字卡为 0。

### 8.5 单行与可读性

- MUST：始终单行，不允许自动换行。
- MUST：字幕位于平台安全区。
- MUST：最长句、英文术语句和数字句做真实像素抽检。
- 横版 BASELINE：38–42px、每行不超过约 22 字。
- 竖版 BASELINE：84px、每行约 13 字。
- 放不下时：先重新分气口，再扩大安全宽度，最后才小幅减字号。
- 字幕底板、阴影和描边只能提升可读性，不得变成装饰主体。

### 8.6 关键词强调

关键词强调必须满足至少一项：

- 是数字、结论、专名或反直觉词。
- 是列表中的当前项。
- 是用户必须记住的动作或风险。

限制：

- 一句只突出 1–2 个焦点。
- 不同时使用颜色、放大、弹跳、发光和音效五重强调。
- 同类强调保持一致视觉语法。
- 强调词不能与底部逐字字幕重复制造双重阅读负担。

---

## 9. 画面任务与 B-roll 选择

### 9.1 画面决策优先级

```text
隐私
  > 真实证据
  > 人物表情与判断
  > 字幕阅读负载
  > 风格与新鲜感
```

### 9.2 语义到画面的路由

| 口述任务 | 首选画面 | 可选补充 | 拒绝 |
| --- | --- | --- | --- |
| 软件操作 | 当前真实录屏 | 局部放大、圈选、步骤号 | 抽象动画替代操作 |
| 数据结果 | 原始图表、结果页、截图 | 大数字、趋势说明 | 重画失真的“漂亮数据” |
| 产品证明 | 实物、真实体验、对比画面 | 参数卡、局部特写 | 泛库存素材 |
| 地点与场景 | 对应地点真实 B-roll | 地图、名称卡 | 不匹配的风景 |
| 概念与机制 | 流程、关系图、关键词块 | 人物解释 | 无任务装饰 |
| 情绪与故事 | 人物反应、相关空镜 | 音乐、克制转场 | 每句切素材 |
| 列表与并列 | 逐项卡片、图文组合 | 数字、图标 | 一次全亮 |
| A-roll 跳切 | 相关 B-roll 或克制 punch-in | 短转场 | 无关素材遮跳 |
| 纯音频 | 证据、文档、图表、场景化视觉 | 卡片与标题 | 长时间黑屏或纯装饰 |

### 9.3 B-roll 评分

```yaml
bRollScore:
  semanticMatch: 0-3
  authenticity: 0-2
  timingMatch: 0-2
  visualClarity: 0-1
  rightsConfidence: 0-1
  notRecentlyRepeated: 0-1
```

低于 7 分不应自动入片。

### 9.4 B-roll 使用规则

- MUST：素材与当前文案中的实体、动作、时间或情绪一致。
- MUST：真实操作和数据证据优先于生成素材。
- SHOULD：同一素材再次出现时承担不同任务，例如全貌 → 局部 → 结果回看。
- SHOULD：素材入场与口播关键词或气口对齐。
- MUST NOT：为了“填满画面”使用重复、泛化或语义错误素材。
- MUST NOT：B-roll 覆盖字幕、关键 UI、脸部或隐私遮挡。
- SHOULD：纯音频口播提高视觉覆盖率，但仍应保留视觉呼吸和层级，不能把“满屏”理解为“无空隙堆满”。

---

## 10. 画面状态机

适用于人物口播、录屏和混合型视频。

| 状态 | 含义 | 进入信号 | 退出信号 |
| --- | --- | --- | --- |
| A | 人物全屏 | 钩子、强转折、重大结论、情绪 | 必须看清屏幕证据 |
| B-R | 屏幕主画面 + 右侧人物窗 | 关键 UI 在左中部 | UI 移到右侧或进入解释 |
| B-L | 屏幕主画面 + 左侧人物窗 | 关键 UI 在右侧 | UI 换边或进入解释 |
| C1 | 专业分栏 | 原因、逻辑、机制，仍需屏幕上下文 | 回到操作或强结论 |
| C2 | 人物加强 | “真正重要的是”“所以结论是” | 进入细节证据 |
| S | 纯录屏 | 密集 UI、连续操作、人物遮证据 | 需要人物陪伴或结论 |
| P | 隐私覆盖 | 账号、二维码、手机号、密钥、个人数据 | 敏感内容完全离场 |

### 10.1 状态切换规则

- 切换只能落在气口、章节或清楚的语义边界。
- 人物加强应在重点句起声附近落稳，可在句前气口提前启动。
- 相邻状态间至少完成一个完整语义单元。
- 每次放大人物都要有“人物此刻比证据更重要”的理由。
- 每次缩小人物都要有“屏幕证据更重要”的理由。
- 连续两次只换边或换形状、没有语义变化，应合并。
- 时间只触发复查，不直接驱动轮播。

### 10.2 原子提交

每个状态区间的录屏、人物、框线、字幕保护区和隐私层必须作为一个逻辑事务提交。任一层失败，应回滚整个状态。

---

## 11. 信息块与排版

### 11.1 信息块类型

| 类型 | 触发信号 | 核心规则 |
| --- | --- | --- |
| 标题卡 | 钩子、章节 | 与口播同帧起，不独占长时间 |
| 大数字 | 真实数字承诺、结论 | 一屏一个主数字，保留来源 |
| 数字变化 | 增长、下降、前后对比 | 动画不超过口述时长 |
| 趋势/对比图 | 排名、占比、趋势 | 不失真，原图优先 |
| 步骤清单 | 第一、第二、第三 | 当前项逐步亮起 |
| 关键词条 | 转折、结论、风险 | 不逐字重复字幕 |
| 章节导航 | 长教程、多阶段 | 信息流短片慎用 |
| 代码/命令卡 | 真实命令、配置、报错 | 必须可运行或与原文一致 |
| 问答卡 | 真实问题与答案 | 必须兑现 |
| 行动引导 | 用户明确要求或原素材 CTA | 默认不自动添加 |

### 11.2 并列句视觉语法

来源中的 42 种并列句设计可抽象为以下规则：

| 项数 | 推荐结构 | AI 注意点 |
| ---: | --- | --- |
| 2 | 左右对照、上下对照、前后卡片 | 强调关系：并列、对比或因果 |
| 3 | 三角构图、三列、逐项堆叠 | 保持视觉重心平衡 |
| 4 | 2×2 网格、四象限、顺序列表 | 控制单项文字长度 |
| 5–6 | 分组、逐项进入、时间轴 | 不要一次全部挤在同屏 |
| 7+ | 章节化、分页或滚动 | 观众必须能跟上当前项 |
| 长段落 | 摘要 + 关键词 + 相关素材 | 不把整段字幕塞成海报 |

来源经验表明，2–4 项最适合单屏并列；实际选择必须看字数、素材数量和阅读时间。

### 11.3 长段落处理

1. 先提取中心句。
2. 把数字、专名和结论标成信息焦点。
3. 判断是否能拆成 2–4 个短语义块。
4. 有真实素材时以素材为主，文字做标签。
5. 无素材时使用摘要卡、步骤清单或分段卡。
6. 一次只突出当前正在说的部分。

### 11.4 卡片设计

- 中性色背景 + 一个主色 + 最多一个强调色。
- 圆角、边框、阴影和发光不能同时抢注意力。
- 字体层级至少区分标题、正文、辅助信息。
- 同类卡片复用结构；通过内容、位置和强调状态变化，而不是每张重新设计。
- 卡片入场错开可建立层次，但必须与口播进度同步。
- 一屏多个卡片时，应有明确当前项，不得全部同权重。

---

## 12. 人物、蒙版与合成

### 12.1 非破坏合成

人物小窗不等于把源视频永久裁成圆形。应保持：

```text
完整人物源
  → 内部取景 / reframe
  → alpha 蒙版
  → 描边或阴影
```

### 12.2 使用蒙版的语义理由

MAY 使用蒙版：

- 给关键屏幕证据让路。
- 弱化人物走神或无效动作，但保留主音频。
- 做人物聚焦或重点句加强。
- 把多个并列项组织成可读画面。
- 给长段落提供半透明文字承载区。

MUST NOT：

- 仅因为“教程里有这个效果”就使用。
- 用蒙版代替隐私遮挡。
- 裁得人物头发、肩颈或手势没有呼吸空间。
- 让框线穿过人物。

### 12.3 人物构图

- 双眼接近窗口水平中心，垂直略高于中心。
- 保留完整头发、额头呼吸位、颈肩和部分环境。
- 不逐帧追脸；按说话段落做少量平滑调整。
- 人物窗不得挡当前讲解的 UI、数字、光标和字幕。
- 任一精确帧出现黑边、透明边或 UV 拉丝，应撤销动态取景并回退稳定构图。

---

## 13. 动效与转场

### 13.1 动效必须有语义

| 动效 | 合适语义 |
| --- | --- |
| 淡入/轻上移 | 默认正文信息块 |
| 左入/右入 | 前后、来去、对比方向 |
| 缩放入 | 一次性强调数字或结论 |
| 数字滚动 | 数值真实变化 |
| 逐项进入 | 清单和并列项 |
| punch-in | 重点句、情绪或跳切缓解 |
| 直切 | 气口清楚、内容连续 |

默认禁用：

- 无意义弹跳。
- 持续漂浮。
- 闪烁。
- 每个字幕词都加动画。
- 戏剧化出场。
- 几何转场与交叉溶解双重接管。

### 13.2 端点契约

任何连续转场必须满足：

```text
transition.firstFrame == previousState.visibleFrame
transition.lastFrame  == nextState.visibleFrame
nextStableFrame       == transition.lastFrame
```

不得在最后一帧留下半透明人物、双脸、位置残差或尺寸跳变。

### 13.3 时间和帧率

- 所有动画按秒或归一化帧率编排。
- 进度使用 `localFrame / max(1, N - 1)`，保证首帧为 0、末帧为 1。
- BASELINE：信息块进场约 10–16 帧、出场约 8–12 帧（30fps）。
- BASELINE：人物窗连续形变可从约 0.3–0.7 秒样片起步。
- 实际时间线 fps 与导出 fps 可能不同；必须按真实导出验证。

---

## 14. 音频、音效与 BGM

### 14.1 主音频

- 全片只允许一个主讲人音轨作为 anchor。
- 重复音轨优先静音或禁用，不能形成双声。
- 第一有效帧应有声；结尾不得硬截最后音节。
- 每个源跳转接缝必须试听。
- 轨道参数正确不等于听感正确。

### 14.2 BGM 选择

| 内容 | 推荐方向 |
| --- | --- |
| 财经、商业、科技 | 克制、稳定、节拍清楚、少歌词 |
| 旅游、生活、母婴 | 温暖、轻快、空间感 |
| 情绪、故事 | 跟随情绪弧线，减少频繁切曲 |
| 教程、录屏 | 低存在感，不能干扰理解 |
| 悬疑、冲突 | 只在真实张力段使用，不全片紧张 |

规则：

- BGM 用来控制情绪，不是掩盖内容薄弱。
- 人声始终优先。
- 有歌词的音乐不得与密集中文口播争夺语言通道。
- 转折、结论和操作演示允许动态 ducking，但变化应平滑。

### 14.3 音效语义表

| 音效 | 触发事件 |
| --- | --- |
| click / tick | UI 点击、文字到位、列表切换 |
| whoosh | 明确方向移动或画面换位 |
| impact | 重大结论、数字落点，低频使用 |
| rise | 揭晓前的短上升 |
| page / paper | 报告、文件、资料进入 |
| soft chime | 正向提示、轻量重点 |
| heartbeat | 谨慎用于真实紧张段 |

MUST：一个可见事件对应一个音效意图。  
MUST NOT：每个素材入场都配音效，或用大音效覆盖人声。

---

## 15. 配色与字体

### 15.1 配色

- 一条视频冻结一套主题。
- 大多数口播只需要中性色 + 一个主色 + 最多一个强调色。
- 颜色角色固定：背景、卡片、正文、辅助、主色、强调、语义色。
- 数字、警告、成功、下降等语义色必须真正对应内容。
- 颜色不能成为唯一区分方式，同时使用文字、形状或位置。

对比度目标：

| 元素 | 建议目标 |
| --- | ---: |
| 字幕、正文、小标签、关键数字 | ≥ 7:1 |
| 大标题和短时大号字 | ≥ 4.5:1 |
| 有信息意义的边框、图标、数据线 | ≥ 3:1 |

### 15.2 字体

- 正文字幕优先清楚、稳定的无衬线字体。
- 同一视频字体家族通常不超过 2 套。
- 斜体、手写体、发光体和综艺字体只用于短强调。
- 文字风格必须与内容气质一致：财经不宜幼稚，母婴不宜压迫，科技不宜过度霓虹。
- 不靠阴影修复低对比度，应先调整前景、背景和底板。

---

## 16. 不同内容类型的剪辑策略

### 16.1 财经、商业与数据

- 真实数字、公司、时间和趋势优先使用原始图表、报告、新闻画面或来源明确的截图。
- 适合大数字、趋势图、时间轴、对比卡和报告卡。
- 画面可以高密度，但每个数据必须能读清。
- 禁止使用无来源数字、泛钞票素材和失真的重绘图表替代证据。
- 音效稳重，避免综艺化削弱可信度。

### 16.2 知识、教育与咨询

- 先标出问题、原因、方法、步骤和结论。
- 适合步骤清单、关键词条、问答卡和并列句。
- 当前步骤逐项亮起，不一次展示全部。
- 保留必要解释和思考停顿，不追求全片极快。

### 16.3 产品测评与种草

- 产品实拍、操作、细节和前后对比优先。
- 参数卡必须与真实型号和口述对应。
- 一屏多产品时建立清晰映射，防止型号和图片错配。
- 调色保持产品真实颜色。
- 购买结论和缺点不能被包装掩盖。

### 16.4 旅游、房产、家装与本地生活

- 地点、户型、产品和门店素材必须与口述实体匹配。
- 适合地图、场景 B-roll、前后对比和空间分区。
- 情绪空镜服务体验，不代替事实。
- 色调可温暖或明亮，但不能损失环境真实性。

### 16.5 情感、故事与人物 IP

- 让人物表情、停顿和语气承担更多信息。
- 减少卡片、花字和高频音效。
- 关键反应和笑声可能是内容，不应自动删除。
- BGM 跟随情绪弧线，不要每个转折都换曲。

### 16.6 纯音频口播

- 先按波形和语义粗剪，再生成字幕。
- 每段必须有明确视觉任务：证据、场景、文档、图表、人物、概念或过渡。
- 可以提高素材覆盖率，但不允许泛素材连播。
- 报告、文件、图表和数据可组成视觉叙事，而不是孤立贴图。
- 同一画面中的纸张、卡片或报告分层错位进入，避免全部同时出现。

### 16.7 录屏教程

- 录屏是证据主角。
- 画面根据任务在全貌、局部和结果之间切换。
- 人物窗主动避让 UI 和光标。
- 操作前可短暂展示成果，但不能跳过真实步骤。
- 密集 UI 段优先纯录屏状态。

### 16.8 访谈

- 保留说话轮次和反应。
- 字幕、姓名条和构图清楚区分说话人。
- B-roll 只在不损失反应和对话信息时覆盖。
- 删除停顿前判断是否是思考、情绪或互动。

---

## 17. 自动化与效率

AI 可以抽象迁移的效率模式：

- 源转写缓存：源文件未变化时复用。
- 剪后转写刷新：结构或速度变化后重建时间线时序。
- 字幕批量合并/分割，但每批回读。
- 样式、卡片、边框和动画使用可版本化预设。
- 同类片段复制完整属性组，不只复制单个字段。
- 素材自动替换时保持时长、裁切和语义角色。
- 长素材可用代理提高编辑性能，但最终验证用原质量。
- 自动闭合空隙后检查是否吞掉有意义留白。
- 自动踩点不能替代口播语义边界。
- 共享模板一旦修改，所有引用实例的旧证据失效。

效率的定义不是“少调用工具”，而是“少返工、可回读、可恢复”。

---

## 18. 质量门禁

### 18.1 内容门

- [ ] 未生成说话人没说过的句子。
- [ ] 高风险删除均有证据或用户批准。
- [ ] 重排只移动完整语义单位。
- [ ] 钩子承诺在前 1/3 兑现。
- [ ] 最后一句完整，默认自然结束。

### 18.2 字幕门

- [ ] 字幕绑定原文源。
- [ ] 删除、重排、变速后已刷新转写。
- [ ] 数字、专名、否定词有证据。
- [ ] 单行、无自动换行。
- [ ] 单字卡为 0。
- [ ] `<450ms` 字幕卡为 0。
- [ ] 长句、英文和数字页真实像素可读。
- [ ] 传统字和已知术语错为 0。

### 18.3 音频门

- [ ] 只有一个可听主音频。
- [ ] 开头第一有效帧有声。
- [ ] 所有剪辑接缝试听自然。
- [ ] 音效和 BGM 不压人声。
- [ ] 结尾无硬截、click 或双声。

### 18.4 视觉门

- [ ] B-roll 与文案匹配。
- [ ] 真实证据未被抽象动画替代。
- [ ] 字幕、脸、关键 UI 互不遮挡。
- [ ] 人物没有黑边、拉伸、二次裁切或边缘穿帮。
- [ ] 同一边界只有一个转场 owner。
- [ ] 过渡首尾与稳定态像素连续。
- [ ] 没有孤儿框、旧特效、测试探针或未知覆盖。
- [ ] 高密度段之后存在理解缓冲。

### 18.5 隐私门

- [ ] 全片扫描二维码、账号、手机号、密钥、地址和个人数据。
- [ ] 每个稳定态、过渡和边界帧均被完整覆盖。
- [ ] 构图裁切不作为隐私保证。
- [ ] 部分遮挡视为失败。

### 18.6 导出门

- [ ] 用户已授权导出。
- [ ] 导出 fps、帧数、时长与内容范围已核对。
- [ ] 代表性帧和过渡帧已检查。
- [ ] 无法验证的项目明确标记 `unverified`。

---

## 19. 失败、回退与停止条件

### 19.1 自动修复上限

- 最多连续三轮。
- 每轮必须有新证据、明确改动和重新验证。
- 三轮仍失败时停止，回退最近通过版本，输出人工检查点。

### 19.2 同一故障第二次出现

如果同一视觉故障在同一资产版本中第二次出现：

1. 停止逐片补丁。
2. 定位共享模板、坐标、蒙版、字幕源或媒体解码根因。
3. 修复共享根因。
4. 将旧验证标记为失效。
5. 全量回归所有引用实例。

### 19.3 能力降级

```text
完整可验证动画
  → 简化动画
  → 定帧或静态卡
  → 气口直切
  → manual_confirm
```

降级必须记录原因，不能把直切伪装成连续动画，也不能把结构通过报告成像素通过。

---

## 20. AI 决策伪代码

```python
def edit_talking_head(project):
    preflight = inspect_project(project)
    assert_preflight(preflight)

    transcript = load_refined_transcript_or_asr(project)
    semantic_map = segment_by_complete_meaning(transcript)

    aroll_plan = []
    for segment in semantic_map:
        action = classify_aroll_action(segment)
        if action.risk == "high" and not action.has_evidence:
            action.action = "manual_confirm"
        aroll_plan.append(action)

    apply_aroll_only_after_approval(aroll_plan)
    final_transcript = refresh_timeline_transcript()

    hook = select_existing_hook(final_transcript)
    assert hook.payoff_time <= final_duration / 3

    captions = build_single_line_breath_pages(final_transcript)
    validate_captions(captions)

    visual_plan = []
    for beat in semantic_map:
        task = infer_visual_task(beat)
        visual = choose_real_evidence_first(task)
        state = choose_layout_state(
            privacy=beat.privacy,
            screen_evidence=beat.screen_need,
            speaker_importance=beat.speaker_importance,
            subtitle_load=beat.subtitle_load
        )
        visual_plan.append(build_atomic_state(beat, state, visual))

    sample = render_representative_sample(visual_plan)
    require_user_or_policy_approval(sample)

    apply_visual_plan_atomically(visual_plan)
    add_audio_design_voice_first()

    evidence = run_structure_audio_caption_pixel_privacy_qa()
    if evidence.all_pass:
        return "EXPORT_READY"
    return rollback_or_manual_confirm(evidence)
```

---

## 21. 单段机器计划示例

```yaml
segmentId: seg_014
range: [18200, 24700]
text: "真正重要的是，数据必须能追溯到原始报表。"
role: conclusion
importance: 5
emotion: serious

contentDecision:
  action: keep
  risk: low
  uniqueInformation:
    - 数据可追溯
    - 原始报表

hookRelation:
  isHook: false
  isPayoff: true
  payoffFor: seg_001

visualDecision:
  primaryTask: evidence
  state: C2
  primaryAsset: original_report_screenshot
  secondaryGraphic: keyword_bar
  speakerTreatment: medium_close
  subtitleProtection: required
  privacyOwner: redact_account_id
  semanticReason: "结论需要人物判断，同时原始报表负责可信度"

motion:
  enterAtBreathBoundary: true
  transition: subtle_punch_in
  durationMs: 350
  sfx: soft_impact

validation:
  - report_value_readable
  - keyword_not_duplicate_full_caption
  - face_not_occluding_report
  - redaction_covers_entire_interval
  - sfx_below_voice
```

---

## 22. 反模式清单

AI 遇到以下行为应拒绝或改写方案：

1. 全片统一 1.2x 或更高倍速，没有试听证据。
2. 每隔固定秒数自动切构图。
3. 每句话都配不同特效。
4. 用泛 B-roll 掩盖语义不清。
5. 用生成图替代真实数据和操作结果。
6. 片头堆很多素材，但观众看不清主题。
7. 密集效果后没有缓冲。
8. 关键词和整句字幕同时重复显示。
9. 把所有列表项一次全部点亮。
10. 画面为“高级感”长期使用模糊、发光和黑底。
11. 音效比人声更响。
12. 字幕源错误，却继续在显示层手修。
13. 在专业词和数字上凭常识纠错。
14. 人物小窗挡住关键 UI。
15. 动态追脸导致黑边，再用底色掩盖。
16. 一个边界同时存在几何动画和溶解。
17. 共享模板改动后沿用旧证据。
18. 工具返回“成功”就当作成片验证完成。
19. 未授权导出或发布。
20. 不能看、不能听时仍报告“全部通过”。

---

## 23. 规则登记格式

后续把本文转入 AI 工具、RAG、规则引擎或 skill 时，建议每条规则使用以下结构：

```yaml
id: ARR-GAP-003
level: SHOULD
scope: talking_head
trigger:
  hasJumpCut: true
  nextSegmentImportance: ">=4"
action:
  - preserveMainAudioContinuity
  - tryRelevantBroll
  - elseSubtlePunchIn
forbid:
  - unrelatedAtmosphereBroll
  - fullTimelineSpeedPreset
verify:
  - audioSeamAudition
  - facePositionDeltaCheck
sourceRefs: [S03, S02]
confidence: derived
```

建议置信度枚举：

- `hard_policy`：内容真相、隐私、字幕源、用户授权等硬规则。
- `derived`：多份来源与生产经验共同支持的可泛化方法。
- `empirical_baseline`：时长、字号、倍速、频率等样片起点。
- `example_only`：剪映按钮、具体特效名或单一案例。

---

## 24. 高信号来源索引

以下 20 份是本次规则提炼的主要证据。完整 198 份清单见同目录 `obsidian-editor-source-inventory.csv`。

| ID | 日期 | 来源 | 文档 | 主要贡献 |
| --- | --- | --- | --- | --- |
| S01 | 2025-09-08 | 五年剪辑师乐乐 | 高级感口播思维训练，用留学案例口播实操演示 | 先读文案、目标受众、AIDA、关键词、高潮和素材需求 |
| S02 | 2025-11-09 | 五年剪辑师乐乐 | 十分钟拿捏高级口播剪辑！楼市口播逐帧拆解，新手也能直接抄 | 结构先行、粗剪、黄金三秒、密集后留白、全片终检 |
| S03 | 2026-05-14 | 五年剪辑师乐乐 | 高级感口播剪辑之：3种口播剪气口方法教程 | 气口跳切的变速、短转场、重点放大三路思路 |
| S04 | 2025-09-06 | 五年剪辑师乐乐 | 三天二夜大工程，一口气教会你42种口播并列句剪辑 | 并列句项数、字数、图文与纯文字的选择 |
| S05 | 2025-08-07 | 五年剪辑师乐乐 | 本期是对过去20条剪辑教程的总结 | 成片前置、节奏过快反馈、字幕安全、错字和 BGM |
| S06 | 2025-11-16 | 五年剪辑师乐乐 | 蒙版在口播剪辑中的常见应用集锦 | 素材优先、人物弱化、长段落承载和场景化蒙版 |
| S07 | 2025-11-12 | 五年剪辑师乐乐 | 高级感口播剪辑思路分享，今天详解旅游口播剪辑技巧 | 场景 B-roll、情绪空镜、人物与字幕、音量平衡 |
| S08 | 2026-07-10 | 五年剪辑师乐乐 | 今天一次性教会你提升剪辑效率的15个小技巧 | 批量、复用和剪映效率模式的抽象 |
| S09 | 2026-06-30 | 五年剪辑师乐乐 | 口播剪辑技巧之：个性字幕条设计教程 | 字幕底板、层级、阴影和配色统一 |
| S10 | 2025-10-02 | 五年剪辑师乐乐 | 高级感口播长段落排版教程 | 长段落摘要、重点数字、素材和人物层级 |
| S11 | 2025-08-14 | 五年剪辑师乐乐 | 为什么你的口播总是没有高级感 | 粗剪、字幕安全、金句、关键词与 BGM |
| S12 | 2025-09-30 | 五年剪辑师乐乐 | 今天教会你如何设计一个高密度包装口播片头 | 高密度片头的多层素材与紧张感；作为反例校准过载风险 |
| S13 | 2025-09-23 | 五年剪辑师乐乐 | 高级感财经口播完整版演示教程来啦 | 财经 B-roll、动态资料、信息可视化和对比结构 |
| S14 | 2025-08-17 | 五年剪辑师乐乐 | 口播实用技巧之蒙版处理并列句教学 | 三项并列的定格、蒙版和三角排版 |
| S15 | 2026-04-06 | 剪辑师晨晨 | 主播不入镜的音频口播怎么剪辑？ | 波形剪辑、纯音频视觉覆盖、报告和图表叙事 |
| S16 | 2026-02-14 | 剪辑师晨晨 | 内容平淡口播如何剪出高级感？完整教程来了 | 素材必须匹配文案、空画面控制、位置/形状变化和音效语义 |
| S17 | 2026-05-08 | 剪辑师晨晨 | 一口期再教你13个职业剪辑师偷偷在用的效率小技巧 | 字幕合并分割、安全区、替换素材、代理和闭合空隙 |
| S18 | 2025-12-25 | 剪辑师晨晨 | 高级感横版财经口播剪辑手把手教程来了 | 横版财经中的 B-roll、卡片、图表和层级 |
| S19 | 2026-07-08 | 剪辑师晨晨 | 一口气教会你音频口播剪辑 本视频全片23分钟 | 纯音频口播的完整制作流程 |
| S20 | 2026-01-30 | 剪辑师晨晨 | 高级感竖版财经科技科普口播剪辑全过程 | 竖版财经、图表、纯文字段、层级与音效不压人声 |

### 24.1 来源路径

```text
S01 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/高级感口播思维训练，用留学案例口播实操演示.md
S02 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/十分钟拿捏高级口播剪辑！楼市口播逐帧拆解，新手也能直接抄.md
S03 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/高级感口播剪辑之：3种口播剪气口方法教程.md
S04 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/三天二夜大工程，一口气教会你42种口播并列句剪辑 并列句剪辑教程.md
S05 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/本期是对过去20条剪辑教程的总结.md
S06 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/蒙版在口播剪辑中的常见应用集锦.md
S07 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/高级感口播剪辑思路分享，今天详解旅游口播剪辑技巧.md
S08 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/今天一次性教会你提升剪辑效率的15个小技巧.md
S09 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/口播剪辑技巧之：个性字幕条设计教程.md
S10 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/高级感口播长段落排版教程.md
S11 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/为什么你的口播总是没有高级感.md
S12 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/今天教会你如何设计一个高密度包装口播片头.md
S13 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/高级感财经口播完整版演示教程来啦.md
S14 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/五年剪辑师乐乐/口播实用技巧之蒙版处理并列句教学.md
S15 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/主播不入镜的音频口播怎么剪辑？.md
S16 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/内容平淡口播如何剪出高级感？完整教程来了.md
S17 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/一口期再教你13个职业剪辑师偷偷在用的效率小技巧.md
S18 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/高级感横版财经口播剪辑手把手教程来了.md
S19 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/一口气教会你音频口播剪辑 本视频全片23分钟.md
S20 /Users/majia/Obsidian/龙甲成长库/Get笔记/拍摄剪辑/剪辑师晨晨/一口期带你看完高级感竖版财经 科技 科普口播剪辑全过程 小伙伴们喜欢看的财经口播剪辑.md
```

---

## 25. 给 AI 工具的最小执行提示

```text
你是口播视频剪辑代理。先读取素材、最终时间线、主音频、精校稿、
平台和用户约束；先输出语义地图、A-roll 删除候选、钩子与兑现、
字幕计划、视觉状态表和 QA 计划，未经批准不要批量写入。

内容事实、隐私、真实证据、主音频和字幕可读性高于风格。
只从真实口述中选钩子，不造句；高风险删除与重排需要证据。
删除或变速后刷新剪后转写；字幕必须原文源、单行、按完整气口分页。
画面按语义选择真实证据、人物、B-roll 或信息块，不按固定秒数轮播。
一段只解决一个主要视觉任务；动效、音效和颜色只强化当前信息。
先做代表性样片，结构、字幕、音频、像素和隐私全部验证后再扩展。
无法看或听时标记 unverified，不得报告完成。
```
