字幕翻译的完整流程:从听译到成片交付
把一段视频做成外语字幕,大多数人以为是"翻译文字"一件事。实际交付物是带着时间轴的字幕文件,少了任何一环,最后都会在某个环节返工。把流程拆成四步,每一步都有明确的产出物,做完一步再进下一步,问题就出在明处。
第一步:听写与校对,拿到干净的源字幕
产出物是一份源语言 SRT。这一步容易出问题的是"识别准但没校对"。
- 用 SmileSub 的字幕生成能力 从视频或音频识别语音,源语言支持中、英、日、韩
- 识别结果要逐条听校:专有名词、数字、同音词是重灾区
- 顺手清掉口头禅、重复词,这些不需要进字幕
- 音频质量差时,识别会有漏句或错字,先补全文案再往后走
一份干净的源字幕,后面每一步都省力。识别完如果还有重叠或格式问题,用 字幕清理工具 先修一遍,再进入翻译。
第二步:术语统一,建立一张对照表
产出物是一份术语表:产品名、人名、单位、品牌口径,全文怎么译写。
- 同一概念全片只用一种译法,避免前后不一致
- 计量单位、日期格式按目标市场定,不要照搬源语言写法
- 文化梗和俚语决定是否本地化,还是直接删掉
- 这张表在多语种项目里尤其值钱:一份术语表喂给所有语种,避免各翻各的
这一步在批量做多语种时尤其关键,否则每个语种各翻各的,最后对不齐。关于多语言素材规划,可参考 一条视频出多语言版本的工作流。
第三步:翻译与控制行长
产出物是目标语言 SRT。这一步的坑不在"翻错",而在"翻完放不下"。
- 翻译只作用于文本,时间轴保持原样,避免口型对不上
- 控制行长:常见字幕规范建议中文单行不超过 18 字、拉丁文单行不超过 42 字符且最多 2 行
- 控制阅读速度:中文不超过 9 字/秒、拉丁文不超过 20 字符/秒,单条停留 1 到 7 秒
- 双语顺序定了就全片统一:原文在上还是译文在上,不要中途切换
译完用 SRT 翻译工具 直接产出目标语言文件;要做"原文 + 译文"并排,用 双语 SRT 生成工具。导出后可用 字幕规范检查工具 批量核对行长和速度是否越界,把要改的条目一次性列出来。
第四步:成片交付,选软字幕还是烧录
产出物是最终视频或字幕文件。根据发布平台决定交付形态。
- 平台支持 CC 轨道的,上传 SRT/VTT,观众可开关,平台也能读文本做推荐
- 社媒竖屏、需要保证所有人看到的,把字幕烧录进画面
- 需要挂到网页视频的,SRT 转 VTT 用 SRT 转 VTT 工具
- 需要字体和位置精排的,SRT 转 ASS 用 SRT 转 ASS 工具
- 时间轴整体偏移时,用 时间轴校正工具 统一平移,不必手动改每条
关于烧录与软字幕的取舍,见 字幕烧录与软字幕的区别。更完整的发布前核对,见 视频出海本地化检查清单。
常见问题
听写和翻译能合并成一步吗?
识别工具能出源字幕,翻译工具能出目标字幕,技术上可以连着做。但中间少一次人工校对,错误会一路带到成片。建议至少在校对和术语这两步各停一次。
行长控制为什么必须做?
译文的字数与源语言不同,英文通常比中文长。不控制行长,字幕会溢出安全区或被挤压成三行,阅读体验下降。规范检查工具能一次性把越界的条目列出来。
软字幕和烧录字幕要各做一份吗?
取决于发布渠道。能挂 CC 的平台保留软字幕即可;社媒和需要强提醒的场景再烧录一份。两者共用同一份 SRT 源文件,只是导出形态不同,不存在重复劳动。