Datenbereinigung
In einem nächsten Schritt wurden sämtliche Inhalte in ein einheitliches, maschinenlesbares Textformat überführt, insbesondere PDF-Dokumente sowie Audio- und Videomaterialien. Video- und Audiomaterial wurde automatisiert durch ein KI-gestütztes Spracherkennungsmodell (Whisper Large v3 Turbo) transkribiert. Sofern die automatisierte Analyse (in späteren Schritten) innerhalb eines Videos für eine Prüfdimension relevante Stellen identifizierte, wurden diese händisch und qualitativ überprüft. Schwieriger zu quantifizieren waren relevante Stellen, die durch fehlerhafte Transkription in der automatisierten Suche gar nicht als solche erkannt wurden. Diese entzogen sich einer nachträglichen Evaluation. Angesichts der vergleichsweise hohen Zuverlässigkeit des Modells für deutschsprachiges Material ist jedoch davon auszugehen, dass der Anteil der auf diesem Weg verloren gegangenen Treffer in einem geringen Rahmen blieb.
Um Dokumente für die Auswertung mit KI-gestützten Verfahren vorzubereiten, wurden längere Texteinheiten — etwa mehrseitige Videotranskripte oder ungewöhnlich lange Facebook-Beiträge — in kürzere, vergleichbare Abschnitte zerlegt. Als Zielgröße wurden Einheiten mit einer Länge von rund 150 bis 250 Tokens (die kleinste Einheit, die ein Modell verarbeitet) festgelegt, was einem kurzen Absatz von wenigen Sätzen entspricht. Somit waren die analysierten Texteinheiten kurz genug, um von den eingesetzten Modellen effizient verarbeitet werden zu können, und lang genug, um eine inhaltlich sinnvolle Aussage vollständig zu umfassen.
Umgekehrt wurden sehr kurze Inhalte — etwa einzelne Tweets oder knappe Telegram-Beiträge — zu größeren, zusammenhängenden Texteinheiten von ebenfalls rund 150 bis 250 Tokens gebündelt. Auf diese Weise entstand über alle Quellen hinweg ein einheitlicher Korpus vergleichbarer Einheiten, der die Grundlage für die Indexierung und die KI-gestützte Analyse bildete, die in den folgenden Abschnitten beschrieben wird.