
一條成片最耗時間的,往往不是剪輯,而是把說話內容變成能看清的字幕。口播五分鐘,手打加對軸就能耗掉一個下午。下面這條路徑,是我們在處理台裡反覆走通的:從選片到匯出,十分鐘內做出能發布的版本。
先判斷這條影片適不適合「聽寫」
有原聲、口齒清楚、環境不太吵的口播,最適合走語音辨識。如果軌裡幾乎沒人聲,只有燒在畫面上的字,就改走硬字幕辨識,別硬用聽寫。
上傳後處理台會先看時長、解析度和有沒有人聲。檢測結束再勾選功能,比一上來全開更省額度。
十分鐘路徑
- 打開處理台,拖入本機 MP4 / MOV。素材留在瀏覽器裡,不會進公共池。
- 等檢測結束後,勾選「AI 字幕產生」。嘈雜或口音重時,語言選「自動」往往比鎖死中文更穩。
- 辨識完成後進入審校:改錯字、拆超過一行的長句、把起止點貼到氣口上。
- 匯出燒錄字幕的 MP4,或另存 SRT / VTT 丟進剪映、Premiere。
免費版這項每月 1 次,夠你先跑通流程。樣式、雙語和額度說明見功能介紹與定價。
審校時只盯三件事
- 錯字:人名、品牌、數字最容易飄,發布前掃一遍。
- 一行長度:直式建議每行不超過 14 個漢字,橫式可以略寬,但不要擋住人臉。
- 出沒點:字幕應在開口前約 0.1 秒出現,在收聲後馬上消失,比「整句貼死」更跟嘴。
常見翻車
錄音底噪大、多人搶話,或把直式當橫式去聽,準確率都會掉。這時與其反覆重跑模型,不如先剪掉片頭片尾的空鏡,再辨識。辨識完仍要人工過一眼——模型負責快,你負責最後一公里。
做完字幕如果還要配音,按同一條軸合成,見AI 配音。翻譯見雙語字幕出海,封面可以看2026 年創作者後期。
看完不如直接做一條。免費額度即開即用。