Zum Inhalt springen
Server in Deutschland Gateway nur zur Weiterleitung § 203 StGB · DSGVO 3-Methoden-Konsens

So entsteht Ihr Transkript

Methodik & Transparenz

Gerichtsnah, ausdrücklich nicht gerichtsfest — ein nachvollziehbares Hilfsmittel, das kein Sachverständigengutachten ersetzt. Über die Verwertbarkeit als Beweismittel entscheidet allein das Gericht im Rahmen der freien Beweiswürdigung (§ 286 ZPO). Diese Seite legt offen, wie das Transkript entsteht, woher die Konfidenz-Ampel kommt und wo die Grenzen des Verfahrens liegen.

3-Methoden-Konsens

Jede Aufnahme wird von drei architektonisch unabhängigen ASR-Engines getrennt transkribiert. Das ausgegebene Wort stammt von der Hauptengine; die beiden anderen Engines prüfen es Wort für Wort. Stimmen sie überein, steigt die Konfidenz — weichen sie ab, wird die Stelle markiert und die abweichenden Lesarten bleiben sichtbar. Uneinigkeit wird sichtbar gemacht, nicht geglättet; ein Wort wird nie still durch eine Mehrheit ersetzt.

Engine 1 — Parakeet-TDT

Primär-Transkription. In unseren Messungen auf deutschen Testaufnahmen die genaueste Engine, auch bei Flüstern und bei WhatsApp-typischer Komprimierung.

Engine 2 — Whisper (large-v3)

Architektonisch unabhängige Zweitmethode. Eigene Trainingsdaten, eigene Fehlermuster.

Engine 3 — wav2vec2

Unabhängige Drittmethode. Bestätigt oder widerspricht — Abweichungen werden sichtbar.

Wort-Abgleich

Jedes Wort der Hauptengine wird gegen die beiden anderen Engines geprüft. Daraus entsteht die Ampel; Abweichungen bleiben als Lesarten sichtbar.

Wort-Konfidenz-Ampel

Jedes Wort trägt eine Konfidenz-Farbe. Die Quelle ist die Konsens-Übereinstimmung der drei Engines — nicht der intern geschätzte Wahrscheinlichkeitswert eines einzelnen Modells. Dadurch sehen Sie auf einen Blick, wo das Transkript belastbar ist und wo Sie selbst nachhören sollten:

hoch

Alle drei Engines stimmen überein.

mittel

Zwei von drei Engines stimmen überein.

unsicher

Engines weichen ab — bitte selbst anhören und prüfen.

Beispiel-Ausschnitt · Konfidenz & Sprecher-Trennungnicht verifiziert
Rn. 1#00:00:00#S1 · Sprecher A:Wir treffen uns morgen um zehn?
Rn. 2#00:00:04#S2 · Sprecher B:Ja, passt.

Sprecher-Trennung (Diarisierung)

Das Verfahren ordnet Segmente verschiedenen Sprechern zu (S1, S2, …). Diese Diarisierung ist ein Hilfsindikator zur Lesbarkeit — keine biometrische Identifizierung und kein Nachweis, wer konkret gesprochen hat. Bei Übersprechen oder ähnlichen Stimmen kann die Zuordnung irren; sie ist eigenständig zu prüfen.

Zeitmarken

Jedes Segment trägt eine Zeitmarke (z. B. #00:00:04#) und eine stabile, fortlaufende Randnummer (Rn.). Beides erlaubt präzises, nachprüfbares Zitieren und das gezielte Nachhören der Originalstelle.

SHA-256-Beweiskette

Der SHA-256-Hash der unveränderten Quell-Audiodatei und des Transkripts wird im Bericht ausgewiesen. So lässt sich das als Augenscheinsobjekt (§ 371 ZPO) vorgelegte Original jederzeit gegen den dokumentierten Stand abgleichen — jede nachträgliche Änderung ergäbe einen anderen Hash und wäre damit erkennbar.

Grenzen des Verfahrens

Automatische Transkription kann irren. Wir machen Unsicherheit sichtbar, statt sie zu verstecken — und benennen die Grenzen offen:

Halluzination

KI-Modelle können Wörter erfinden, die nie gesprochen wurden — besonders in Stille oder Rauschen. Der Konsens reduziert das, schließt es aber nicht aus.

Undeutliche Sprache

Nuscheln, Übersprechen, schlechte Aufnahmequalität und seltene Eigennamen senken die Konfidenz. Solche Stellen werden als unsicher markiert, nicht stillschweigend geraten.

Klarstellung: Das Ergebnis ist gerichtsnah, ausdrücklich nicht gerichtsfest — ein Hilfsmittel zur Vorbereitung, das kein Sachverständigengutachten ersetzt. Es ist keine beglaubigte Übersetzung und keine forensische Echtheitsfeststellung. Bitte prüfen Sie das Transkript vor jeder Verwendung selbst; die Beweiswürdigung obliegt allein dem Gericht (§ 286 ZPO).