字幕翻译的完整流程:从听译到成片交付

把一段视频做成外语字幕,大多数人以为是"翻译文字"一件事。实际交付物是带着时间轴的字幕文件,少了任何一环,最后都会在某个环节返工。把流程拆成四步,每一步都有明确的产出物,做完一步再进下一步,问题就出在明处。

字幕翻译从听写到成片的四步流程
源素材先识别或听写成源语言 SRT,统一术语后翻译到目标语言并控制行长,最后导出字幕或烧录成片

第一步:听写与校对,拿到干净的源字幕

产出物是一份源语言 SRT。这一步容易出问题的是"识别准但没校对"。

  • SmileSub 的字幕生成能力 从视频或音频识别语音,源语言支持中、英、日、韩
  • 识别结果要逐条听校:专有名词、数字、同音词是重灾区
  • 顺手清掉口头禅、重复词,这些不需要进字幕
  • 音频质量差时,识别会有漏句或错字,先补全文案再往后走

一份干净的源字幕,后面每一步都省力。识别完如果还有重叠或格式问题,用 字幕清理工具 先修一遍,再进入翻译。

第二步:术语统一,建立一张对照表

产出物是一份术语表:产品名、人名、单位、品牌口径,全文怎么译写。

  • 同一概念全片只用一种译法,避免前后不一致
  • 计量单位、日期格式按目标市场定,不要照搬源语言写法
  • 文化梗和俚语决定是否本地化,还是直接删掉
  • 这张表在多语种项目里尤其值钱:一份术语表喂给所有语种,避免各翻各的

这一步在批量做多语种时尤其关键,否则每个语种各翻各的,最后对不齐。关于多语言素材规划,可参考 一条视频出多语言版本的工作流

第三步:翻译与控制行长

产出物是目标语言 SRT。这一步的坑不在"翻错",而在"翻完放不下"。

  • 翻译只作用于文本,时间轴保持原样,避免口型对不上
  • 控制行长:常见字幕规范建议中文单行不超过 18 字、拉丁文单行不超过 42 字符且最多 2 行
  • 控制阅读速度:中文不超过 9 字/秒、拉丁文不超过 20 字符/秒,单条停留 1 到 7 秒
  • 双语顺序定了就全片统一:原文在上还是译文在上,不要中途切换

译完用 SRT 翻译工具 直接产出目标语言文件;要做"原文 + 译文"并排,用 双语 SRT 生成工具。导出后可用 字幕规范检查工具 批量核对行长和速度是否越界,把要改的条目一次性列出来。

第四步:成片交付,选软字幕还是烧录

产出物是最终视频或字幕文件。根据发布平台决定交付形态。

  • 平台支持 CC 轨道的,上传 SRT/VTT,观众可开关,平台也能读文本做推荐
  • 社媒竖屏、需要保证所有人看到的,把字幕烧录进画面
  • 需要挂到网页视频的,SRT 转 VTT 用 SRT 转 VTT 工具
  • 需要字体和位置精排的,SRT 转 ASS 用 SRT 转 ASS 工具
  • 时间轴整体偏移时,用 时间轴校正工具 统一平移,不必手动改每条

关于烧录与软字幕的取舍,见 字幕烧录与软字幕的区别。更完整的发布前核对,见 视频出海本地化检查清单

常见问题

听写和翻译能合并成一步吗?

识别工具能出源字幕,翻译工具能出目标字幕,技术上可以连着做。但中间少一次人工校对,错误会一路带到成片。建议至少在校对和术语这两步各停一次。

行长控制为什么必须做?

译文的字数与源语言不同,英文通常比中文长。不控制行长,字幕会溢出安全区或被挤压成三行,阅读体验下降。规范检查工具能一次性把越界的条目列出来。

软字幕和烧录字幕要各做一份吗?

取决于发布渠道。能挂 CC 的平台保留软字幕即可;社媒和需要强提醒的场景再烧录一份。两者共用同一份 SRT 源文件,只是导出形态不同,不存在重复劳动。