annibox · Datei rein, Markdown raus

Gehostet in Deutschland · Kein Sprachmodell zur Textgenerierung

Euer Dokumentenbestand wird zur gepflegten Datenquelle.

Die Akten liegen längst da – als Scan, als Word-Datei von 2011, in einem Ordner, den niemand mehr sortiert. Wir erschließen diesen Bestand und halten ihn durchsuchbar, für eure Anwendungen und für eure Leute.

Erstbestand — Sichtungsbericht → 1.284 Dateien
verarbeitet          1.198
  davon per OCR        417
Dubletten               63
nicht verarbeitbar      23

Nicht verarbeitbar, mit Grund:
  Bebauungsplan_1997.pdf
    nur Bilddaten, Auflösung zu gering
  Anlage_C.zip
    Archiv – Freigabe erforderlich
  Protokoll_alt.doc
    beschädigt, Datei nicht lesbar

Beispielhafte Darstellung. Entscheidend ist die letzte Zeile: was nicht geht, steht mit Grund im Bericht – es verschwindet nicht.

Der Unterschied

Ein leeres Ergebnis ist ein Fehler, keine leere Seite

Das ist die Falle bei Dokumentenbeständen: ein Werkzeug meldet „1.284 Dateien verarbeitet", und vierhundert davon sind leer, weil niemand gemerkt hat, dass es Scans waren. Der Bestand sieht erschlossen aus und ist es nicht. annibox behandelt ein leeres Ergebnis deshalb als Fehler mit Begründung – lieber eine sichtbare Liste mit dreiundzwanzig Problemfällen als eine stille Lücke.

Erstimport und Sichtung

Wir nehmen den Bestand entgegen, legen die Datenräume an und fahren ihn durch – mit Bericht, welche Dateien welchen Weg genommen haben.

Texterkennung, wo nötig

OCR läuft lokal und nur bei Dateien, die zu wenig Text liefern. Gemischte Dokumente behalten ihren digitalen Text; nur die eingescannten Seiten kommen dazu.

Nachlieferungen

Neue und geänderte Dateien kommen dazu, versioniert. Gleiche Bytes erzeugen eine neue Version, kein Duplikat – die Ablage wächst nicht durch Wiederholung.

Danach

Was ihr mit dem Bestand tun könnt

Suchen, mit Fundstelle

Bedeutung und Volltext zusammen: „Bebauungsplan beschlossen" findet die Stelle auch dann, wenn im Text „Satzungsbeschluss" steht – und ein Aktenzeichen findet es wörtlich. Jeder Treffer nennt Dokument und Abschnitt.

Weiterverwenden, wo ihr wollt

Der Bestand liegt als Standard-Markdown und ist über eure eigenen Schlüssel abrufbar. Welches KI-Werkzeug ihr darauf setzt, entscheidet ihr – und ihr könnt es wechseln, ohne den Bestand neu aufzubauen.

Für wen

Wer damit anfängt

Planungs- und Ingenieurbüros

Gutachten, Pläne und Stellungnahmen aus zwanzig Jahren, die bei jedem neuen Projekt wieder gesucht werden.

Kommunale Dienstleister

Niederschriften, Vorlagen und Satzungen – oft als Scan, oft die einzige Quelle.

Organisationen mit KI-Vorhaben

Die feststellen, dass das Modell nicht das Problem ist, sondern die Datenlage darunter.

Das Angebot

Erstbestand und Betreuung

Erschließung — ab 3.000 €
  • Übernahme und Sichtung des vorhandenen Bestands
  • Datenräume nach eurer Ordnung, nicht nach unserer
  • Vollständiger Bericht, inklusive der Dateien, die nicht gehen
  • Zugang für eure Leute und Schlüssel für eure Systeme
Betreuung — ab 300 € / Monat
  • Fester Umfang an Nachlieferungen je Monat
  • Nachfassen bei Dateien, die beim ersten Lauf hängen blieben
  • Tägliche Sicherung, vierzehn Tage Aufbewahrung
  • Größere Nachläufe und Sonderformate nach Aufwand
Was es heute noch nicht gibt

Einen Ordner-Anschluss, der Änderungen und Löschungen von sich aus meldet, gibt es nicht. Nachlieferungen laufen heute betreut – ihr stellt bereit, wir fahren sie durch. Der automatische Anschluss entsteht am ersten echten Bestand, weil erst dort feststeht, woran er sich orientieren muss.

Kontakt

Bestand besprechen

Schreib uns, worum es geht: ungefährer Umfang, überwiegende Formate, und ob viel eingescannt ist. Wir melden uns mit einer Einschätzung zu Aufwand und Laufzeit – und sagen es, wenn sich der Bestand nicht lohnt.

Wir speichern deine Angaben ausschließlich, um dir zu antworten – Einzelheiten in der Datenschutzerklärung.