最后的 10%:机器没法替你对时的那部分
AI 转录能把字幕做对 90%。最后的 10% — 时间轴、断行、品味 — 才是字幕变好的地方。为视频剪辑师和内容创作者,看一看字幕里属于人的那部分。
自动转录如今真的是个奇迹了。把一段视频喂给一个现代语音模型,几秒钟它就带着文字、大致对好时回来了。十年前那还是一篇研究论文加一个大体能跑的演示;今天它是十几个应用里的一个勾选框。所以问那个让人不舒服的问题是公平的:如果机器把字幕做了,那到底还剩什么留给人做?
大约 10%。而事实证明,那 10% 就是「有字幕」和「好」之间的全部差别。
机器真正拿手的部分
咱们给机器人应得的肯定,因为 SubSlap 就是把这同一个 90% 当作起点 — 我们没在假装重新发明了转录。
- 文字。 在干净的音频上,现代模型的转录接近人类的准确度,标点也一并到位。
- 粗略的时间轴。 起止时间,足够你跟着看。
- 头一遍的断句。 把行切成大致能读的长度。
对很多随手拍的内容,那就是全部活儿了。发布,走人。麻烦从「大致能读」不够好的时候开始。
它结构上做不到的部分
这是没有哪个更大的模型能修好的部分,因为它不是一个知识问题 — 它是一个品味与语境的问题:
- 随呼吸断,而不是随字数断。 机器按字符长度切;人按意思切。「这整件事里 / 最棒的部分」读起来就是不对,哪怕每一个字都正确,因为它把一个意思劈到了两行上。
- 为效果留白。 说话的人在抖包袱前顿了一拍。模型不知道包袱要来了 — 你知道,因为你看了视频、感觉到它落地。
- 守住一种语气。 「gonna」该留成「gonna」,还是变成「going to」?这是条轻松的说明文字,还是一条正式的字幕?那是一个关于语调的编辑判断,而语调不在音频里。
- 尊重镜头切换。 一条越过硬切多留一个字的字幕看起来像个错误。模型看不见你的剪辑;它只听得见文字。
奉俊昊在为《寄生虫》领奥斯卡时,把字幕称作「那道一英寸高的障碍」。把那道障碍跨好,观众会忘了自己在读字;跨砸了,他们每隔几秒就被拽出电影。那次跨越是一个逐帧的手艺决定 — 恰恰是模型感觉不到的那部分,因为它从没坐在一间黑屋子里看过。
为什么这比过去更重要
有两件事变了。第一,如今大多数社交视频是静音观看的,所以字幕不是一件无障碍层面的贴心事 — 它就是那场演出本身。第二,「看起来专业」的门槛悄悄抬高了,因为观众时时刻刻都在看到干净的字幕。一条在意思中间断开的行不会让什么崩溃。它只是让视频感觉略微业余,而观众通常说不出为什么。那句「说不出为什么」才是危险的部分 — 它耗掉你的信任,却从不会浮现成一句抱怨。
怎样真正拿下那 10%
正解是把最后那 10% 当成它自己独立的一步,而不是一件你随眼一扫的事。具体来说,这意味着:
- 像观众那样读字幕,而不是像作者。你的目光在哪儿卡住?
- 先修断行 — 大多数「不对劲」的感觉是断行,不是时间轴。
- 然后调时间轴 — 把提示轻推到节拍上、避开镜头切换。
- 然后定语气 — 缩写、标点、语调 — 在整条视频里保持一致。
这就是 SubSlap 里存在 Control Freak Mode 的全部理由:帧级的时间轴和断句控制,好让你修正模型的猜测,而不是把它们直接发出去。机器把 90% 弄对。最后的 10% 才是字幕变好的地方 — 而那部分依然、光荣地,是你的。