
完成した動画で一番時間がかかるのは、たいていカットではなく、話し言葉を読める字幕にすることです。5分の口頭なら、手打ちとタイミング調整だけで午後が消えます。スタジオで何度も通した手順がこれです。ファイルを選んで書き出すまで、公開できる版を約10分で出します。
まず「書き起こし」向きか判断する
原音声があり、滑舌がよく、周囲が静かなら音声認識が向きます。声がほとんどなく、画面に焼き付いた文字だけなら、無理に書き起こさずハード字幕のOCRへ回してください。
アップロード後、スタジオは長さ、解像度、声の有無を先に見ます。検出が終わってから機能を選ぶ方が、最初から全部オンにするより枠を節約できます。
10分の手順
- スタジオを開き、ローカルの MP4 / MOV をドロップします。素材はブラウザ内に留まり、共有プールには入りません。
- 検出後、「AI字幕生成」にチェック。騒音や訛りが強いときは、言語を中国語や英語に固定するより「自動」の方が安定しがちです。
- 認識後に校正します。誤字、1行に収まらない長文の分割、息継ぎへのイン/アウト合わせ。
- 字幕を焼き込んだ MP4 を書き出すか、SRT / VTT を保存して CapCut や Premiere に渡します。
無料プランはこの機能が月1回。流れを覚えるには十分です。スタイル、二カ国語、枠の説明は機能紹介と料金を見てください。
校正で見るのは3つだけ
- 誤字:人名、ブランド、数字が最初にずれます。公開前に一度掃きます。
- 1行の長さ:縦動画は全角14字程度、横は少し広くて構いません。顔は隠さない。
- 出没:発話の約0.1秒前に出し、声が止まったらすぐ消す。「一文をベタ貼り」より口に追従します。
よくある失敗
底ノイズ、同時発話、縦動画を横として聴かせると精度が落ちます。モデルを何度も回すより、先に前後の空きカットを切ってから認識してください。認識後も必ず目を通す。速さはモデル、最後の一里は自分です。
字幕のあと吹き替えが必要なら、同じタイムラインで合成してください。手順はAI吹き替えにあります。翻訳は二カ国語字幕、カバーは2026年のクリエイター後工程です。
読み終わりましたか?1本作ってみましょう。無料回数の準備ができています。