
하드 자막 OCR이 자주 실패하는 이유는 모델이 ‘충분히 똑똑하지 않아서’가 아니라, 넘겨 준 화면이 틀려서입니다. 채널 로고, 시계, 장식 글자, 진행 바까지 읽을 글자로 잡힙니다. 모델을 바꾸기 전에 박스와 프레임 추출을 고치는 편이 바로 효과가 납니다.
먼저 인식 박스를 바꾸세요
기본은 화면 아래 약 40%입니다. 가로 나레이션 대부분은 이걸로 되지만, 아래에서는 막지 못합니다.
- 세로 자막이 가운데나 위에 붙어 있다
- 오른쪽 위 로고, 왼쪽 위 날짜가 박스에 들어간다
- 댓글·좋아요 애니메이션이 자막 띠를 가로지른다
원칙은 단순합니다. 박스 안에는 자막만, 밖은 전부 방해입니다. 로고, 시계, 머리 위 장식은 빼세요. 글자보다 조금 커도 됩니다. 화면 절반을 삼킬 정도로 키우지 마세요.
그다음 프레임 추출을 바꾸세요
0.5~2 fps면 보통 충분합니다. 너무 촘촘하면 한 문장이 중복 큐 여러 개로 쪼개지고, 너무 성기면 스치는 짧은 문장이 빠집니다.
이렇게 시험하세요.
- 먼저 1 fps로 돌려 빠진 문장이 많은지 본다.
- 빠짐이 많으면 2 fps. 처음부터 8 fps로 올리지 않는다.
- 한 문장이 부서지면 0.5 fps로 내리고 교정에서 합친다.
대비가 낮을 때(옅은 배경 위 노란 글자, 얇은 외곽선)는 추출을 더 촘촘하게 하기보다 소스를 밝히거나 더 깨끗한 완성본으로 바꾸는 편이 낫습니다.
교정은 건너뛸 수 없습니다
OCR은 ‘了’를 ‘子’로 읽고 영어 고유명을 쪼갭니다. 인식 후에:
- 한 문장에 속하는 큐를 합친다
- 잘못 읽은 로고와 워터마크를 지운다
- 숨고르기에 맞춰 인/아웃을 미세 조정한다
스튜디오에 올리고 하드 자막 인식을 켜면 됩니다. 영상에 깨끗한 원음이 있으면 음성 인식이 더 빠르고 안정적입니다. 절차는 10분 자막을 보세요.
다 읽으셨나요? 한 편 만들어 보세요. 무료 할당량이 준비되어 있습니다.