Indexierung und Suche
Nachdem die Daten in Text überführt, bereinigt und in einheitliche Einheiten segmentiert worden waren, wurden sie in einem weiteren Schritt für die systematische Durchsuchung aufbereitet.
Dabei wurden zwei komplementäre Zugänge kombiniert: Zum einen kam — insbesondere für die Verarbeitung der umfangreichen PDF-Bestände sowie für die integrierte Bild- und Multimedia-Analyse — das vom Data and Research Center (DARC) angebotene Produkt OpenAleph zum Einsatz, das eine bereits fertig aufgebaute Analyse-Pipeline bereitstellt: Hochgeladene PDFs werden dort automatisch in Text umgewandelt, Bilder per OCR verarbeitet und die Ergebnisse direkt für die Suche indexiert.
Zum anderen wurden Texteinheiten gemeinsam mit ihren Metadaten — etwa Veröffentlichungsdatum, Benutzername, Plattform oder bei sozialen Medien auch Informationen zu Retweets, Weiterleitungen und Reaktionen — in eine lokale OpenSearch-Instanz eingespielt. OpenSearch ist eine quelloffene Suchdatenbank. Sie ist darauf spezialisiert, auch in sehr großen Textbeständen schnelle, skalierbare und präzise Volltextsuchen durchzuführen.
Für die Volltextsuche wurden für die einzelnen Untersuchungsthemen Listen mit Schlüsselbegriffen (Keyword-Sets) erstellt.