一条视频出多语言版本的工作流

一支视频要发到好几个市场,真正花成本的往往不是翻译,而是同一个镜头反复重拍、同一段口播反复重录。省成本的办法,是在开拍之前就把"哪些东西一次就要拍对"和"哪些东西可以后补"分开。

一套素材产出多语言版本的工作流示意
一套主素材先拆成画面、口播、字幕三层,画面里可翻译的文字元素单独抽出,字幕由源语言识别后分别翻译到各目标语种

先区分"拍一次"和"补多次"

多语言版本省成本的核心,是让画面尽量与语言无关。

  • 一次拍对的:人物、产品、演示动作、布光、场景。这些东西换语言不重拍。
  • 可以后补的:口播文案、画面上叠加的文字、结尾的号召语、字幕本身。
  • 必须避免写死的:把价格、网址、促销文案直接拍进画面。这类信息一变,整段画面作废。

开拍前把后两类列成清单,画面里只保留"语言中立"的内容,后面每加一个语种,只需要动清单上的部分。

把画面里的文字元素拆出来

很多视频翻车在"画面上打了中文标语"。要让一条视频跑多语言,画面内的文字应该当作独立图层维护,而不是烤进视频里。

  • 标语、卖点、价格标签,用可编辑的图层或单独的图片素材
  • 口播里提到的网址、优惠码,放在描述区和字幕里,不要写在画面上
  • 需要本地化的图标(如本地支付方式 logo)单独准备,按市场替换

这样加一个语种时,不需要动视频本体,只替换文字图层与字幕。用 SRT 翻译工具 可以把源字幕分别转出各语言版本,口播对应的字幕轨道一次生成多条。

字幕层与画面层分开维护

字幕是整个流程里最容易被反复修改的一层,也应该最独立。

  • 源语言先用 SmileSub 的字幕生成能力 从视频或音频识别出来,得到一份干净的 SRT
  • 这份 SRT 作为"主字幕",所有语言版本都从它派生
  • 改文案、改术语,只动主字幕,再重新派生,避免每个语种各改一遍

识别支持的源语言包括中、英、日、韩,目标语种覆盖英、西、葡、德、日、韩等共 7 个语种,足够覆盖主要的出海市场。

哪些部分必须一次拍对

回到开头的问题:真正一次就要做对的,是画面本身和口播的节奏。

  • 演示动作要清楚,不同语言观众都能看懂,不依赖解说
  • 口播留足停顿,译成的外语通常比中文长,语速太满会挤掉字幕空间
  • 涉及文化梗、本地俚语的内容,尽量用画面或通用表达替代,减少后期重录

关于单条字幕的阅读速度,常见字幕规范建议中文不超过 9 字/秒、拉丁文不超过 20 字符/秒,单条停留 1 到 7 秒。口播节奏按这个上限倒推,后期字幕才不会塞不下。

更系统的准备,可以参考 视频出海本地化检查清单。关于字幕翻译的完整步骤,见 字幕翻译的完整流程

常见问题

一条视频做多语言,画面要拍几遍?

理想情况下只拍一遍。做法是画面保持语言中立,把所有文字、口播、字幕当作可替换层。只要开拍前规划好,新增语种通常只动字幕和文字图层。

主字幕用哪种格式最省事?

SRT 最通用,结构简单、几乎所有平台和工具都认。拿到源语言 SRT 后,用字幕工具分别派生各语言版本即可。需要挂到网页视频时再转成 VTT,用 SRT 转 VTT 工具 一步完成。

免费工具能支撑多语言派生吗?

SmileSub 的免登录工具,单个 SRT 不超过 1MB、不超过 500 条字幕,每个工具每个 IP 每天 3 次。几分钟的口播视频通常在这个范围内,按语种分别导出即可;体量更大时建议分段处理或登录使用积分额度。