
字幕認識が崩れるのは、モデルが遅いからではなく入口を間違えるからです。声があるのに画面の字を追い、無音の焼き込みを無理に聞き取る。スタジオはどちらでも同じ尺を出せます。先に音と画面を見て、一つだけチェックします。両方は開かない。
先に音、それから字
アップロード後、スタジオは尺、解像度、声の有無を見ます。終わってから機能を選ぶと枠を節約できます。
- トラックに聞き取れるナレーションがある:音声認識。言語は自動の方が、中国語や英語に固定するより安定しやすい。
- ほとんど声がなく、字が焼き込まれている:画面 OCR。fps より先に枠を直す。焼き込み OCR。
- 両方ある:きれいな方を選ぶ。滑舌が良ければ聞く。画面の訳や装飾文字が必要なら OCR。一回で自動結合は期待しない。
10分の全体手順はこのガイド。スタイルと書き出しは尺ができてから。
一つだけチェックする
- スタジオの字幕を開き、ローカルの MP4 / MOV を入れる。ファイルはブラウザ内に留まる。
- 検出を待つ。声があり部屋が静かなら音声認識。ほとんど声がなければ画面 OCR。
- OCR では枠に字幕だけ。ロゴと時計は外。音声では先に空の入りと終わりを切って、無音に枠を使わない。
- 尺を先に直す:誤字、固有名詞、1行の長さ。それからスタイルか書き出し。縦の組みとSRTか焼き込み。
無料プランは字幕が月1回です。音声、OCR、枠は機能紹介と料金。
走る前に見るのは3つだけ
- 声:聞こえるなら書き起こす。ノイズや被りは先に切る。すぐ OCR にしない。
- 画面の字:焼き込みがソースで対白が使えないときだけ OCR。枠が画面の半分だとロゴまで読む。
- 枠:どちらも1回分。入口を一度決める。二回は高い。
よくある失敗
縦を横として聞くと精度が落ちる。ナレーションか字だけかを先に確認。焼き込み済みを OCR に戻すと尺が二層になる。聞くか、先に旧い字を隠す。カバーは別に出す。認識枠をカバーにしない。完成映像からカバー。
読み終わりましたか?1本作ってみましょう。無料回数の準備ができています。