视频字幕常见问题 20 问

做字幕的过程中,问题往往集中在几个固定的环节:格式怎么写、语音怎么识别、翻译怎么不出错、最后怎么成片。把最常见的 20 个问题按这四组归拢,遇到卡点先来这里找,大多能直接定位。这 20 问不求穷尽,只挑出现频率最高、最容易卡住新手的那部分,作为排查的第一站。

字幕从制作到成片的处理管线
字幕处理分识别、翻译、规范检查、成片几个阶段,每个阶段对应一类常见问题,排错时按阶段定位更快

一、格式类(5 问)

SRT 和 VTT 有什么区别?

SRT 是纯文本、结构最简单;VTT 在头部加了 WEBVTT 标记,支持样式与定位,主要挂在网页视频上。SRT 转 VTT 用 SRT 转 VTT 工具

一条 SRT 条目由哪几部分组成?

三部分:序号、时间轴(00:00:01,000 --> 00:00:02,500)、文本,条目之间空一行。

时间轴用什么格式?

SRT 用逗号做毫秒分隔(00:00:01,000),VTT 用点(00:00:01.000),别混用。

字幕文件该存成什么编码?

统一 UTF-8 无 BOM,换行用 LF,跨平台最稳,避免方块和问号。

ASS 和 SRT 比有什么不同?

ASS 支持字体、颜色、位置等样式,适合烧录精排;SRT 只有文本。SRT 转 ASS 用 SRT 转 ASS 工具

二、识别类(5 问)

语音识别支持哪些语言?

源语言支持中、英、日、韩,识别后转成源字幕。

识别不准怎么办?

先逐条听校,重点看专有名词和数字;再用 字幕清理工具 修重叠和格式。

噪音大的视频能识别吗?

能识别,但噪音会拉低准确率。安静环境录制、靠近麦克风,结果更稳。

上传的视频会被保存吗?

不会。SmileSub 上传的原视频在处理完成后即被删除,不做长期存储。

识别出来能直接当字幕用吗?

建议先校对再发布,尤其是术语和数字,避免错字进成片。

三、翻译类(5 问)

支持翻译哪些语种?

支持中、英、日、韩、西、葡、德 7 个语种互译。

翻译会改乱时间轴吗?

专业工具不会,时间轴单独解析、只翻译文本、最后按原轴组装。

机器翻译能直接发布吗?

信息类口播可以;专业术语、品牌口径建议人工过一遍。

怎么保证术语统一?

翻译前定一份术语表,全文同一概念只用一种译法。

双语字幕怎么做?

双语 SRT 生成工具,上传 SRT 直接产出原文 + 译文。

四、成片类(5 问)

软字幕和烧录字幕选哪个?

能挂 CC 的平台用软字幕换 SEO,社媒和广告用烧录保证触达,两者共用一份 SRT。

字幕烧录后还能改吗?

烧录进画面就固化了,要改得回到源 SRT 重新导出,所以烧前务必校对。

字幕溢出画面怎么办?

缩短行长或缩小字号,按安全区排版;规范检查能列出越界条目。

阅读速度多少合适?

中文不超过 9 字/秒、拉丁文不超过 20 字符/秒,单条停留 1 到 7 秒。

一个视频要做几种字幕?

看渠道:YouTube 类挂软字幕,社媒烧录,多市场再加各语种轨道。

更系统的成片取舍,见 字幕烧录与软字幕的区别;完整制作流程见 字幕翻译的完整流程

常见问题

上传的视频会被平台保存吗?

不会。SmileSub 处理完成后即删除原视频,不做长期存储。这一点和"文件留在服务器"的工具不同,敏感素材可以放心上传处理。

翻译会不会把时间轴改乱?

不会。翻译只作用于文本,时间轴是单独解析的数据,最后按原时间轴组装。容易改乱的是手动复制粘贴——结构化数据变成连续文本后切分没有校验。

字幕溢出画面该怎么收?

先缩短单行字数,不行再调字号,始终守住安全区。用规范检查工具一次性列出所有越界条目,比肉眼逐条找更高效。