← Alle Beiträge

Die letzten 10 %: was die Maschine nicht für dich timen kann

KI-Transkription bringt Untertitel zu 90 % richtig hin. Die letzten 10 % — Timing, Zeilenumbrüche, Geschmack — sind der Punkt, an dem Captions gut werden. Ein Blick auf den menschlichen Anteil am Untertiteln für Video-Editoren und Content-Creator.

Automatische Transkription ist heute wirklich ein Wunder. Füttere ein modernes Sprachmodell mit einem Video, und in Sekunden kommen die Wörter zurück, grob getimt. Vor zehn Jahren war das ein Forschungspapier mit einer Demo, die meistens funktionierte; heute ist es ein Häkchen in einem Dutzend Apps. Also ist es fair, die unbequeme Frage zu stellen: Wenn die Maschine die Captions macht, was bleibt dann eigentlich für einen Menschen zu tun?

Ungefähr 10 %. Und es stellt sich heraus, dass diese 10 % der ganze Unterschied zwischen „untertitelt” und „gut” sind.

Was die Maschine wirklich draufhat

Geben wir den Robotern, was ihnen zusteht, denn SubSlap nutzt dieselben 90 % als Ausgangspunkt — wir tun nicht so, als hätten wir die Transkription neu erfunden.

  • Die Wörter. Bei sauberem Ton transkribieren moderne Modelle mit nahezu menschlicher Genauigkeit, Zeichensetzung und alles.
  • Grobes Timing. Start- und Endzeiten, nah genug, um mitzukommen.
  • Ein erster Split. Zeilen in einigermaßen lesbare Längen zerhackt.

Für viele lockere Inhalte ist das der ganze Job. Veröffentlichen und weiterziehen. Der Ärger beginnt, wenn „einigermaßen lesbar” nicht gut genug ist.

Was sie strukturell nicht kann

Hier ist der Teil, den kein größeres Modell behebt, denn es ist kein Wissensproblem — es ist ein Geschmacks-und-Kontext-Problem:

  • Auf dem Atem umbrechen, nicht auf der Zählung. Maschinen teilen nach Zeichenlänge; Menschen teilen nach Gedanken. „das Beste an dieser / ganzen Sache” liest sich falsch, obwohl jedes einzelne Wort korrekt ist, weil es einen Gedanken über zwei Zeilen zerschneidet.
  • Für den Effekt halten. Ein Sprecher pausiert einen Schlag vor der Pointe. Das Modell weiß nicht, dass die Pointe kommt — du weißt es, weil du das Video geschaut und gespürt hast, wie sie sitzt.
  • Eine Stimme halten. Soll „gonna” „gonna” bleiben oder zu „going to” werden? Ist das eine lockere Caption oder ein förmlicher Untertitel? Das ist eine redaktionelle Entscheidung über den Ton, und Ton steckt nicht im Audio.
  • Den Schnitt respektieren. Eine Caption, die ein Wort über einen harten Schnitt hinausquillt, sieht aus wie ein Fehler. Das Modell kann deinen Schnitt nicht sehen; es hört nur die Wörter.

Bong Joon-ho nannte Untertitel bei der Entgegennahme seines Oscars für Parasite „die zweieinhalb Zentimeter hohe Barriere”. Überquere diese Barriere gut, und ein Zuschauer vergisst, dass er überhaupt liest; überquere sie schlecht, und er wird alle paar Sekunden aus dem Film gerissen. Diese Überquerung ist eine Frame-für-Frame-Handwerksentscheidung — genau der Teil, den ein Modell nicht fühlen kann, weil es nie in einem dunklen Raum saß und geschaut hat.

Warum das mehr zählt als früher

Zwei Dinge haben sich geändert. Erstens wird das meiste Social-Video jetzt stumm geschaut, also sind die Captions keine nette Zugänglichkeits-Geste — sie sind die Performance selbst. Zweitens ist die Latte für „sieht professionell aus” leise gestiegen, weil Publikum ständig saubere Captions sieht. Eine Zeile, die mitten im Gedanken umbricht, lässt nichts abstürzen. Sie lässt das Video nur ein bisschen amateurhaft wirken, und der Zuschauer kann meist nicht sagen, warum. Dieses „kann nicht sagen, warum” ist der gefährliche Teil — es kostet dich Vertrauen, ohne je als Beschwerde aufzutauchen.

Wie du die 10 % wirklich besitzt

Der richtige Zug ist, diese letzten 10 % als eigenen Schritt zu behandeln, nicht als etwas, das man über den Daumen peilt. In der Praxis heißt das:

  1. Lies die Captions wie ein Zuschauer, nicht wie der Autor. Wo stockt dein Auge?
  2. Repariere zuerst die Umbrüche — die meisten „falsch”-Gefühle sind Zeilenumbrüche, nicht Timing.
  3. Dann feile am Timing — schubs Cues auf die Schläge und weg von den Schnitten.
  4. Dann entscheide die Stimme — Kontraktionen, Zeichensetzung, Ton — konsistent über das ganze Video.

Genau dafür existiert Control Freak Mode in SubSlap: Timing und Split-Kontrolle auf Frame-Ebene, damit du die Vermutungen des Modells reparierst, statt sie auszuliefern. Die Maschine kriegt 90 % richtig. Die letzten 10 % sind der Punkt, an dem Captions gut werden — und es ist der Teil, der noch immer, herrlicherweise, dir gehört.