一条视频出多语言版本的工作流
一支视频要发到好几个市场,真正花成本的往往不是翻译,而是同一个镜头反复重拍、同一段口播反复重录。省成本的办法,是在开拍之前就把"哪些东西一次就要拍对"和"哪些东西可以后补"分开。
先区分"拍一次"和"补多次"
多语言版本省成本的核心,是让画面尽量与语言无关。
- 一次拍对的:人物、产品、演示动作、布光、场景。这些东西换语言不重拍。
- 可以后补的:口播文案、画面上叠加的文字、结尾的号召语、字幕本身。
- 必须避免写死的:把价格、网址、促销文案直接拍进画面。这类信息一变,整段画面作废。
开拍前把后两类列成清单,画面里只保留"语言中立"的内容,后面每加一个语种,只需要动清单上的部分。
把画面里的文字元素拆出来
很多视频翻车在"画面上打了中文标语"。要让一条视频跑多语言,画面内的文字应该当作独立图层维护,而不是烤进视频里。
- 标语、卖点、价格标签,用可编辑的图层或单独的图片素材
- 口播里提到的网址、优惠码,放在描述区和字幕里,不要写在画面上
- 需要本地化的图标(如本地支付方式 logo)单独准备,按市场替换
这样加一个语种时,不需要动视频本体,只替换文字图层与字幕。用 SRT 翻译工具 可以把源字幕分别转出各语言版本,口播对应的字幕轨道一次生成多条。
字幕层与画面层分开维护
字幕是整个流程里最容易被反复修改的一层,也应该最独立。
- 源语言先用 SmileSub 的字幕生成能力 从视频或音频识别出来,得到一份干净的 SRT
- 这份 SRT 作为"主字幕",所有语言版本都从它派生
- 改文案、改术语,只动主字幕,再重新派生,避免每个语种各改一遍
识别支持的源语言包括中、英、日、韩,目标语种覆盖英、西、葡、德、日、韩等共 7 个语种,足够覆盖主要的出海市场。
哪些部分必须一次拍对
回到开头的问题:真正一次就要做对的,是画面本身和口播的节奏。
- 演示动作要清楚,不同语言观众都能看懂,不依赖解说
- 口播留足停顿,译成的外语通常比中文长,语速太满会挤掉字幕空间
- 涉及文化梗、本地俚语的内容,尽量用画面或通用表达替代,减少后期重录
关于单条字幕的阅读速度,常见字幕规范建议中文不超过 9 字/秒、拉丁文不超过 20 字符/秒,单条停留 1 到 7 秒。口播节奏按这个上限倒推,后期字幕才不会塞不下。
更系统的准备,可以参考 视频出海本地化检查清单。关于字幕翻译的完整步骤,见 字幕翻译的完整流程。
常见问题
一条视频做多语言,画面要拍几遍?
理想情况下只拍一遍。做法是画面保持语言中立,把所有文字、口播、字幕当作可替换层。只要开拍前规划好,新增语种通常只动字幕和文字图层。
主字幕用哪种格式最省事?
SRT 最通用,结构简单、几乎所有平台和工具都认。拿到源语言 SRT 后,用字幕工具分别派生各语言版本即可。需要挂到网页视频时再转成 VTT,用 SRT 转 VTT 工具 一步完成。
免费工具能支撑多语言派生吗?
SmileSub 的免登录工具,单个 SRT 不超过 1MB、不超过 500 条字幕,每个工具每个 IP 每天 3 次。几分钟的口播视频通常在这个范围内,按语种分别导出即可;体量更大时建议分段处理或登录使用积分额度。