SRT 里的四类脏数据:表现与修法

字幕在剪辑软件、翻译工具、平台之间来回倒几遍,最容易悄悄积累"脏数据"。它们肉眼不一定看得出来,但会让播放器跳条、平台上传报错。先把四类常见问题认全,再决定怎么清。

尤其跨境出海场景,字幕往往要在剪辑软件出稿、翻译平台翻、再由分发平台上传,中间经手环节多,脏数据积累概率比单环节高不少。

SRT 常见脏数据分类
重叠、重复行、序号错乱、残留标签四类脏数据的典型表现,以及它们各自对播放与上传的影响

第一类:时间轴重叠

表现为两条字幕的时间区间有交叉——前一条还没结束,后一条已经开始。

00:00:01,000 --> 00:00:03,000
第一句
00:00:02,500 --> 00:00:04,500
第二句

成因多是手动改时间码手误,或自动识别把相邻两句边界切错。播放器遇到重叠,可能只显示一条、或两条闪跳。修法是把边界重新切齐,让相邻条首尾相接。

识别类字幕最容易出现这种边界重叠,因为模型切句本就不像人工那样干净。

第二类:重复行

同一句文本出现两次,或相邻两条内容完全一样。成因常是复制粘贴、合并片段时没去重。修法是删掉重复的那条,并补正后续时间轴。

重复行的另一个麻烦是它会让总条数虚高,后续按条数计费的环节(如某些平台的审核或翻译)会多算。清掉重复行,既是修观感,也是控成本。

第三类:序号错乱

条目序号不连续、跳跃、甚至重复。SRT 对序号其实宽容——多数播放器按时间轴而非序号排序。但部分平台上传会校验序号连续性,错乱会直接报错。修法是按出现顺序重新编 1、2、3……

第四类:残留标签

文本里夹着 <i><font color><b> 这类 HTML 式标签。它们来自某些编辑器或翻译工具,SRT 本不该有。表现是被原样显示成奇怪字符,或在严格解析时整条报错。修法是剥离这些标签,只留纯文本。

残留标签的来源五花八门:从带样式的编辑器导出时忘记"纯文本"、翻译工具把原文样式一起带过来、或人工在字幕里加了重点标记。它最隐蔽的地方在于,肉眼看字幕内容正常,但文件里其实藏着看不见的标记,直到上传某平台才暴露。

哪些会让平台直接报错

  • 序号不连续:部分平台硬性校验,直接拒收
  • 格式非法(如时间码缺箭头、毫秒位数不对):解析失败
  • 残留标签在严格模式:可能整条丢弃

重叠和重复行通常不致命,但会拉低观感。建议上传前都清一遍。

即便平台不报错,重叠和重复行也会在观感上露怯,交付前清一遍总不亏。所以交付前的自检顺序建议是:先查序号连续、再查格式合法、最后查残留标签。三者里任意一项挂掉,都可能让前功尽弃的上传直接失败,而这些问题用清理加检查两步基本都能兜住。

怎么清理

SmileSub 的字幕清理工具 为例,不用登录:

  1. 上传 SRT 文件
  2. 工具扫描重叠、重复、序号与残留标签
  3. 下载清理后的文件

免费额度为单文件不超过 1MB、不超过 500 条字幕,每个工具每个 IP 每天 3 次。清理后再用 字幕规范检查工具 复核一遍更稳妥。

清理是破坏性操作前的保险——先导出一份原文件备份,再跑清理,出问题还能回退。

如果你的字幕还要做翻译,先清理再翻,能避免标签被一起送进翻译、污染译文。相关流程可看 《SRT 翻译成英文》

常见问题

序号错了会不会影响播放?

多数播放器按时间轴排序,序号错不影响观看。但部分平台上传会校验序号连续性,错了会直接报错,所以交付前建议理顺。

残留标签不去掉会怎样?

轻则原样显示成奇怪字符,重则在严格解析模式下整条被丢弃。SRT 本不支持样式标签,最稳妥是剥离。

清理工具会改变我的译文吗?

不会。清理只处理结构层问题(重叠、重复、序号、标签),文本原样保留。译文内容不受影响。