← 블로그

방법2026-08-10 · 8 읽기

AI로 십 분 만에 영상에 자막 넣기

AI로 십 분 만에 영상에 자막 넣기

완성 영상에서 가장 오래 걸리는 일은 대개 컷이 아니라, 말을 읽을 수 있는 자막으로 바꾸는 것입니다. 5분 나레이션이면 손으로 치고 타임라인을 맞추는 데 오후가 갑니다. 스튜디오에서 반복해 통과한 경로가 이것입니다. 파일을 고르고 내보내기까지, 공개할 수 있는 버전을 약 10분에 만듭니다.

먼저 ‘받아쓰기’에 맞는지 판단하세요

원음이 있고 발음이 분명하며 주변이 조용한 나레이션은 음성 인식이 맞습니다. 목소리 거의 없이 화면에 구워진 글자만 있다면, 억지로 받아쓰지 말고 하드 자막 OCR로 가세요.

업로드 후 스튜디오는 길이, 해상도, 목소리 유무를 먼저 봅니다. 검출이 끝난 뒤 기능을 고르는 편이, 처음부터 전부 켜는 것보다 한도를 아낍니다.

10분 경로

  1. 스튜디오를 열고 로컬 MP4 / MOV를 넣습니다. 소재는 브라우저에 남고 공용 풀로 가지 않습니다.
  2. 검출이 끝나면 AI 자막 생성을 켭니다. 소음이나 사투리가 심하면 중국어·영어를 잠그기보다 자동이 더 안정적인 경우가 많습니다.
  3. 인식 후 교정합니다. 오자, 한 줄을 넘는 긴 문장 나누기, 숨고르기에 인/아웃 맞추기.
  4. 자막을 구운 MP4를 내보내거나, SRT / VTT를 저장해 캡컷이나 프리미어에 넣습니다.

무료 플랜은 이 기능이 월 1회, 흐름을 익히기엔 충분합니다. 스타일, 이중 언어, 한도 설명은 기능 소개와 요금에 있습니다.

교정에서 볼 것은 세 가지뿐입니다

  • 오자: 이름, 브랜드, 숫자가 먼저 흔들립니다. 공개 전에 한 번 훑으세요.
  • 한 줄 길이: 세로 영상은 한글 14자 안팎, 가로는 조금 넓혀도 됩니다. 얼굴은 가리지 마세요.
  • 출몰: 말하기 약 0.1초 전에 나오고, 목소리가 끝나면 바로 사라지게. ‘문장 통째 붙이기’보다 입에 따라갑니다.

자주 깨지는 지점

바닥 소음, 여러 사람이 겹쳐 말하기, 세로 파일을 가로로 듣게 하면 정확도가 떨어집니다. 모델을 여러 번 돌리기보다 앞뒤 빈 컷을 먼저 자르고 인식하세요. 인식 후에도 한 번 보세요. 속도는 모델, 마지막 1km는 당신입니다.

자막 다음에 더빙이 필요하면 같은 타임라인에서 합성하세요. 절차는 AI 더빙에 있습니다. 번역은 이중 언어 자막, 커버는 2026 크리에이터 후반 작업을 보세요.

다 읽으셨나요? 한 편 만들어 보세요. 무료 할당량이 준비되어 있습니다.