SRT에서 순수 텍스트 추출하기

영상 편집이 끝나면 가장 완전한 내레이션 대본은 보통 SRT 안에 있습니다. 일련번호와 타임코드 같은 '레이아웃 정보'를 벗겨내면 남는 순수 텍스트는 카피 작성, 검색, 견적에 바로 쓸 수 있습니다. 핵심은 어떻게 추출하고, 추출 후 어떻게 정리하느냐입니다.

자막 속 더러운 데이터와 추출의 가치
SRT에는 텍스트 외에 일련번호·타임코드·잔여 태그가 섞여 있으며, 순수 텍스트 추출이란 이 비텍스트 정보를 벗겨내는 것입니다

SRT에는 텍스트 외에 무엇이 있나

SRT의 한 줄은 세 부분으로 구성됩니다. 일련번호·타임코드·텍스트. 순수 텍스트 추출은 세 번째 부분만 취하고 앞의 두 가지를 버리는 것입니다.

1
00:00:01,000 --> 00:00:02,500
我们今天聊三个问题

원본 파일이 여러 소프트웨어를 거쳤다면 텍스트에 <i>, <font> 같은 잔여 태그가 섞여 있을 수 있습니다. 추출할 때 함께 지우는 게 좋고, 이 사이트의 자막 정리 도구 는 이런 잔여물을 처리합니다.

용도 1: 내레이션 대본 복원으로 카피 작성

자막 텍스트는 기본적으로 영상이 무엇을 말했는지 그 자체입니다. 꺼내면 곧바로 쓸 수 있는 받아쓰기 원고가 되고, 제품 셀링포인트 카피 개고, 숏폼 스크립트 구조 정리, 팀 콘텐츠 회고에 모두 바로 쓸 수 있습니다.

새로 들으며 받아쓰는 것보다 훨씬 편합니다. 특히 다국어 해외 진출에서는 하나의 추출 원고를 여러 언어 번역의 공통 베이스로 써서, 언어별로 다시 듣고 표현이 흐트러지는 사고를 막을 수 있습니다.

용도 2: 검색과 아카이브

순수 텍스트는 검색엔진과 노트 앱이 곧바로 인덱싱합니다. 여러 영상의 자막을 추출해 두면 키워드로 '어떤 영상이 어떤 기능을 다뤘는지' 검색할 수 있고, 영상을 넘어 자주 등장하는 주제를 집계할 수도 있습니다.

제목과 기억으로 콘텐츠를 찾는 것보다 믿을 만합니다. 타임스탬프를 함께 두면 각 줄이 어느 시간대인지 복원할 수 있어 막연히 검색하는 것보다 빠르게 위치를 찾습니다.

또 하나 과소평가되는 용도: 추출 텍스트를 AI나 노트 도구에 먹여 요약시키는 것. 타임코드 노이즈가 없는 만큼 모델이 요점을 잡기 쉽고, 역으로 영상 구조를 파악해 어느 구간을 남기고 어디를 자를지 판단할 수도 있습니다. 영상을 바로 던지는 것보다 먼저 텍스트로 만들어 처리하는 편이 비용과 통제성 모두 좋습니다.

용도 3: 번역 견적

번역 공급자는 보통 글자 수나 분 수로 견적을 냅니다. 추출한 순수 텍스트의 글자 수는 가격 협상의 가장 직접적인 근거입니다. "이 영상은 대략 10분"이 아니라 "이 원고는 X자"라고 말할 수 있습니다. 글자 수는 안정적으로 비교도 되므로, 같은 영상의 버전 간 변경량도 한 번 비교로 드러납니다. 글자 수가 명확하면 견적과 일정도 정확해집니다.

추출한 텍스트를 다른 언어로 번역하려면 SRT 번역 도구 로 바로 진행하되, 업로드는 순수 텍스트가 아니라 원본 SRT여야 합니다. 그래야 타임코드가 사라지지 않습니다.

내보내기 형식: 일련번호를 넣을까

추출 시 보통 두 가지 선택이 있습니다. 일련번호 없는 순수 단락 또는 한 줄씩 나열은 읽기·검색·다른 도구 입력에 적합합니다. 일련번호를 유지하면 1, 2, 3이 남아 원본 자막과 일대일 대조하며 위치를 거슬러 찾기 쉽습니다.

기본 추천은 먼저 일련번호 없는 깨끗한 버전을 받고, 어떤 문장이 원본의 어디에 있었는지 추적할 필요가 생기면 일련번호 버전을 받는 것입니다.

팀에 고정 템플릿이 있다면(각 줄 앞에 타임스탬프 추가 등) 일련번호 버전이 스크립트로 2차 처리하기 쉽고, 순수한 읽기 용도라면 일련번호 없는 버전이 더 깔끔합니다. 둘 다 한 벌씩 남겨두면 나중에 서로 보완되어 가장 편합니다.

자막 파일 자체의 구조는 SRT 영어 번역 글의 SRT 구조 설명을 참고하세요.

추출 후 흔한 정리 작업

추출 후에는 보통 네 가지를 합니다. 중복 제거 — 인접 줄이 같은 문장을 둘로 나눈 것이면 병합. 잔여 태그 정리 — <i>, <font> 등 HTML식 태그 삭제. 의미 단위로 다시 끊어 단락화해 읽기 쉽게. 인식이 글자를 누락하거나 오타냈을 만한 곳 교정.

추출해 보니 어느 구간이 순전히 군더더기 말이나 무의미한 정적이라면 표시해서 지워두세요. 이후 번역과 검색이 모두 깨끗해집니다. 여기까지 해야 순수 텍스트가 진짜 '쓸 수 있는' 상태가 됩니다. 사소해 보이지만 이후 반복되는 재작업을 아껴주는 단계입니다. 원본 파일에 겹침이나 일련번호 뒤섞임이 있다면 먼저 자막 규격 검사 도구 를 돌린 뒤 추출하면 결과가 더 깨끗합니다.

자주 묻는 질문

추출하면 타임코드는 사라지나요?

사라집니다. 그것이 '순수 텍스트'의 의미입니다 — 무엇을 말했는지만 남기고 언제 말했는지는 남기지 않습니다. 타임코드가 필요하면 추출 후 텍스트가 아니라 SRT를 직접 처리해야 합니다.

태그가 붙은 자막은 추출 후에 잔여물이 남나요?

추출 도구가 태그를 정리하는지에 따라 다릅니다. 이 사이트의 추출은 흔한 태그를 벗겨냅니다. 원본 파일의 태그가 특히 지저분하다면 먼저 자막 정리 도구를 거친 뒤 추출하는 것을 권합니다.

추출한 텍스트를 바로 번역 원고로 쓸 수 있나요?

텍스트 자체는 번역 입력으로 쓸 수 있지만, 번역류 도구가 타임코드를 유지하려면 SRT가 필요합니다. 번역에는 추출한 순수 텍스트가 아니라 원본 SRT를 업로드하세요.