Zum Inhalt springen
Interaktive Ergebnisse Spenden

Indexierung und Suche

Nachdem die Daten in Text überführt, bereinigt und in einheitliche Einheiten segmentiert worden waren, wurden sie in einem weiteren Schritt für die systematische Durchsuchung aufbereitet.

Dabei wurden zwei komplementäre Zugänge kombiniert: Zum einen kam — insbesondere für die Verarbeitung der umfangreichen PDF-Bestände sowie für die integrierte Bild- und Multimedia-Analyse — das vom Data and Research Center (DARC) angebotene Produkt OpenAleph zum Einsatz, das eine bereits fertig aufgebaute Analyse-Pipeline bereitstellt: Hochgeladene PDFs werden dort automatisch in Text umgewandelt, Bilder per OCR verarbeitet und die Ergebnisse direkt für die Suche indexiert.

Zum anderen wurden Texteinheiten gemeinsam mit ihren Metadaten — etwa Veröffentlichungsdatum, Benutzername, Plattform oder bei sozialen Medien auch Informationen zu Retweets, Weiterleitungen und Reaktionen — in eine lokale OpenSearch-Instanz eingespielt. OpenSearch ist eine quelloffene Such­datenbank. Sie ist darauf spezialisiert, auch in sehr großen Textbeständen schnelle, skalierbare und präzise Volltextsuchen durchzuführen.

Für die Volltextsuche wurden für die einzelnen Untersuchungsthemen Listen mit Schlüsselbegriffen (Keyword-Sets) erstellt. Die Ergebnisse dieser Suchen wurden anschließend an die Jurist*innen und Sozialwissenschaftler*innen des Teams übergeben und von diesen qualitativ ausgewertet. Besonders effektiv erwies sich dieses Vorgehen bei der Auswertung von Parlamentsdrucksachen: Auf diesem Weg ließen sich etwa alle Anträge und Gesetzentwürfe ermitteln, in denen Schlüsselbegriffe wie „doppelte Staatsbürgerschaft” vorkommen, um sie einer detaillierten rechtlichen Bewertung zuzuführen.

Jetzt deinen Abgeordneten schreiben