最後の10%:機械が君のためにタイミングを取れないもの
AI 文字起こしは字幕の90%を正しくやる。最後の10% — タイミング、改行、センス — こそ、キャプションが良くなる場所。動画エディターとコンテンツクリエイターのための、字幕づくりの人間パートを覗く。
自動文字起こしは、今や本当に驚異だ。動画を最新の音声モデルに食わせれば、数秒で、ざっとタイミングのついた単語が返ってくる。十年前、それはデモがだいたい動く研究論文だった。今日では、十いくつのアプリのチェックボックスだ。だから、居心地の悪い問いを立てるのは公正だ:機械がキャプションをやるなら、人間に実際に残されているのは何なのか?
だいたい10%だ。そしてその10%こそが、「字幕がついた」と「良い」の全部の差だと分かる。
機械が本当に決めること
ロボットに敬意を払おう。SubSlap も同じ90%を出発点に使っているからだ — 僕らは文字起こしを再発明したふりはしない。
- 単語。 きれいな音声なら、最新モデルは句読点まで、ほぼ人間並みの精度で文字起こしする。
- ざっとしたタイミング。 開始と終了の時刻、追えるくらいには十分に近い。
- 一発目の分割。 読めなくもない長さに刻まれた行。
多くのカジュアルなコンテンツでは、それが仕事の全部だ。公開して次へ。厄介が始まるのは、「読めなくもない」では足りないときだ。
構造的にできないこと
どんな大きいモデルも直せない部分がここだ。知識の問題じゃないからだ — センスと文脈の問題だからだ:
- 文字数じゃなく、息継ぎで区切る。 機械は文字数で分割し、人は思考で分割する。「the best part about this / whole thing」は、一つ一つの単語は正しくても読み味が悪い。一つの考えを二行に断ち切っているからだ。
- 効果のために溜める。 話し手がオチの前に一拍おく。モデルはオチが来ることを知らない — 君は知っている。動画を見て、それが決まるのを感じたからだ。
- 声を保つ。 「gonna」は「gonna」のままか、「going to」にすべきか? これは軽やかなキャプションか、それとも格式ある字幕か? それはトーンについての編集判断で、トーンは音声の中にはない。
- カットを尊重する。 ハードカットを一単語はみ出すキャプションは、ミスに見える。モデルは君の編集を見られない。単語を聞くだけだ。
ポン・ジュノは『パラサイト』でオスカーを受け取りながら、字幕を「1インチの高さの壁」と呼んだ。その壁をうまく越えれば、観客は自分が読んでいることすら忘れる。まずく越えれば、数秒ごとに映画から引き剥がされる。その越境は、フレームごとの職人の判断だ — まさにモデルが感じられない部分だ。暗い部屋に座って見ていたことが、一度もないからだ。
なぜこれが以前より大事になったのか
二つのことが変わった。第一に、いまやほとんどのソーシャル動画はミュートで見られる。だからキャプションはアクセシビリティの気配りじゃない — パフォーマンスそのものだ。第二に、「プロっぽく見える」のバーが静かに上がった。観客がきれいなキャプションを絶えず目にしているからだ。思考の途中で折れる一行は、何かをクラッシュさせはしない。ただ、動画をわずかにアマチュアっぽく感じさせる — そして観客はたいてい、その理由を君に言えない。その「理由を言えない」が危ないところだ — 苦情として表に出ることなく、君から信頼を奪う。
実際に10%を自分のものにする方法
やるべきは、その最後の10%を、目分量で済ますものじゃなく、独立した工程として扱うことだ。実際にはこうなる:
- 書き手じゃなく観客としてキャプションを読む。 君の目はどこで止まる?
- まず改行を直す — 「なんか変」の感覚のほとんどはタイミングじゃなく改行だ。
- それからタイミングを詰める — キューを拍の上へ、カットの外へ、そっと寄せる。
- それから声を決める — 短縮形、句読点、トーン — 動画全体で一貫して。
それこそが SubSlap に Control Freak Mode が存在する丸ごとの理由だ:フレーム単位のタイミングと分割のコントロール、だからモデルの当てずっぽうを、出荷する代わりに直せる。機械は90%を正しくやる。最後の10%こそ、キャプションが良くなる場所 — そしてそれは、いまだ、見事に、君のものだ。