Scovadoc Flow – Ollama Edition

VersionNeuerungen
2.08Neu
– Optionale LiteParse-Erstanalyse für PDF-Dokumente ergänzt, um strukturierte Dokumentinhalte besser für die KI-Analyse aufzubereiten
– LiteParse kann PDFs vor der KI-Auswertung in strukturierten Text bzw. Markdown umwandeln
– Bei aktivierter LiteParse-Erstanalyse (Tab Einstellungen) wird der erkannte Dokumenttext direkt und möglichst unverfälscht an die KI übergeben
– Der Vorfilter bleibt weiterhin aktiv, greift bei LiteParse jedoch nur noch begleitend als Diagnose- und Fallback-Mechanismus

Verbessert
– Genauere Analyse bei komplexeren PDF-Dokumenten, Tabellen, Formularen und stärker strukturierten Dokumentinhalten
– Reduzierung von Fehlbewertungen durch den Vorfilter, da LiteParse-Ergebnisse nicht mehr durch die normale Vorfilter-Verdichtung verändert werden
– Bessere Nachvollziehbarkeit im Logfenster durch separate Hinweise, ob LiteParse oder die Standardextraktion genutzt wurde

Technisch
– Konfiguration um LITEPARSE_ENABLED, LITEPARSE_EXE, LITEPARSE_FORMAT, LITEPARSE_SAVE_MARKDOWN, LITEPARSE_MD_OUTPUT_DIR und LITEPARSE_TIMEOUT erweitert
– PDF-Verarbeitung um run_liteparse_for_pdf ergänzt
– LiteParse-Texte werden über prepare_liteparse_text_for_model schonend gekürzt und nicht mehr durch build_analysis_text verdichtet
– Vorfilter-Auswertung bei LiteParse auf guess_document_type_details und apply_type_fallback beschränkt
– Automatischer Fallback auf die bisherige Standardextraktion ergänzt, wenn LiteParse nicht verfügbar ist, fehlschlägt oder keinen ausreichenden Text liefert
– OCR-/Text-Cache-Signatur um LiteParse-Konfiguration erweitert, damit veraltete Extraktionsergebnisse nicht erneut verwendet werden
2.07Neu
– Vorfilter um einen Confidence Score erweitert, damit die Zuverlässigkeit der erkannten Dokumentart besser bewertet werden kann
– Adaptive Seitenprüfung ergänzt, damit Leerseiten, Trennblätter sowie QR-Code- und Barcode-Seiten die KI-Analyse nicht mehr verfälschen
– Folgeseiten werden automatisch geprüft, wenn die erste PDF-Seite keine verwertbaren Dokumentinformationen enthält
– Einstellung „Seiten pro Dokument“ angepasst, sodass künftig verwertbare Dokumentseiten statt ausschließlich physischer PDF-Seiten berücksichtigt werden
– Neue Einstellungen zur Aktivierung der adaptiven Seitenprüfung und zur Begrenzung der maximal zu prüfenden physischen Seiten ergänzt

Technisch
– Vorfilter-Auswertung um einen Confidence-Wert zur Bewertung der ermittelten Dokumentart erweitert
– Erkennung nicht verwertbarer Seiten anhand von Textmenge, sinnvollen Wörtern, Wortvielfalt und typischen Trennseitenbegriffen ergänzt
– Begriffe wie Aktentrenner, Trennblatt, Trennseite, QR-Code, Barcode, Stapeltrennung und Dokumententrennung werden bei der Seitenbewertung berücksichtigt
– Nicht verwertbare Seiten werden aus dem Analyse-Text entfernt und beeinflussen weder Dokumentart noch Datum oder Dateinamen
– Adaptive Seitenlogik für PDFs mit eingebettetem Text sowie für den bestehenden OCR- und Scan-Ablauf ergänzt
– Konfiguration um ADAPTIVE_PAGE_FALLBACK_ENABLED, ADAPTIVE_PAGE_FALLBACK_LIMIT und SKIP_NON_MEANINGFUL_PAGES erweitert
– Speicherung und Wiederherstellung der neuen Einstellungen über die gui_config.json ergänzt
– Benutzeroberfläche um „Bei Leer-/Trennseite Folgeseiten prüfen“ und „Max. physische Prüfseiten“ erweitert
– Nicht verwertbare Leer-, Trenn- und Barcode-Seiten werden vor der KI-Analyse erkannt und möglichst aus dem Analyseinhalt ausgeschlossen
– Cache-Signatur der OCR- und Textextraktion um die adaptive Seitenkonfiguration erweitert, damit veraltete Ergebnisse nicht erneut verwendet werden
2.06Neu
– Vorfilter erweitert, um Dokumentarten im kommunalen und kaufmännischen Umfeld schneller und zuverlässiger zu erkennen
– Standard-Prompt überarbeitet, damit Dokumentarten neutraler bewertet und Fehlzuordnungen, z. B. Rechnung/Lieferschein, reduziert werden
– Option zur GPU-Nutzung über Ollama ergänzt, um die KI-Analyse bei unterstützter Hardware zu beschleunigen

Technisch
– DOCUMENT_TYPE_PATTERNS um zusätzliche Verwaltungs-, Kommunal-, Vergabe-, Finanz- und Belegarten erweitert
– STRONG_LINE_PATTERNS und Scoring-Logik zur besseren Gewichtung fachlich relevanter Schlüsselzeilen angepasst
– NOISE_PATTERNS erweitert, um irrelevante Kopf-, Fuß- und Kontaktzeilen besser auszublenden
– DEFAULT_PROMPT_TEXT neutralisiert und um klare Abgrenzungsregeln für Dokumentarten ergänzt
– Ollama-Konfiguration um OLLAMA_NUM_GPU ergänzt und an die API-Optionen übergeben
2.051Neu
– Scanner-Präfixe erweitert

Technisch
#, {, }, siehe unten
2.0.5Neu
– Neuer Bereich „Dateinamen-Präfixe beibehalten“ im Smart Posteingang
– Scanner-Präfixe wie Amt 10, Scan001 oder Buchhaltung_ können bei der KI-Umbenennung erhalten bleiben

Technisch
– Neuer Konfigurationswert für Präfixe ergänzt
– Präfixe werden nur übernommen, wenn sie am Dateianfang stehen und danach ein definiertes Trennzeichen folgt, z. B. Leerzeichen, _, -, ., ( oder [
– Bereits festgelegte Datums-Präfixe bleiben ebenso erhalten, aus Scanner-EG-123456789 wird somit z. B. Scanner-EG-20260515-Einführung-neuer-Dokumentenablageprozesse
2.0.4Neu
– Scovadoc Flow startet nun über einen Loader, der die Startsequenz stabilisiert und eine visuelle Rückmeldung während des Ladevorgangs bereitstellt
– Anzeige eines Startdialogs mit Fortschrittsbalken während der Initialisierung

Verbessert
– Optimierung der Startzeit-Wahrnehmung durch unmittelbares visuelles Feedback beim Programmstart
– Konsistenteres Erscheinungsbild des Startdialogs im Vergleich zur Hauptanwendung
– Stabilere Initialisierung bei langsamen Systemen oder umfangreichen Konfigurationen

Behoben
– Problem behoben, bei dem das Hauptfenster verzögert oder ohne Rückmeldung gestartet ist
– Darstellung der Steuerungsleiste nach UI-Initialisierung korrigiert

Technisch
– Einführung eines separaten Loader-Prozesses zur Entkopplung der Startlogik
– Übergabe eines Ready-Signals zwischen Loader und Hauptanwendung
– Verbesserte Fehlerbehandlung während der Initialisierungsphase
2.0.3Verbessert
– Zuverlässigere Erstinitialisierung der Anwendung
– Verbesserter Umgang mit fehlenden oder aktualisierten Bibliotheken
2.0.21– kleine Bug Fixes
2.0.2Neu
– Ereignisse können nun in einer externen Logdatei protokolliert werden
2.0.1Neu
– Einführung der Online-Lizenzprüfung für Scovadoc Flow

Verbessert
– Fehlerausgabe im Tab „Ordner“ bei ungültigen Eingaben zu den zu überwachenden Verzeichnissen
2.0.0Neu
– Codename Falcon
– Einführung eines Initialisierungsmodus beim ersten Start der Anwendung
– Integration eines Logos mit Verlinkung zur Webseite in der Benutzeroberfläche
– Einführung des Smart-Posteingangs mit Keyword-Gewichtung und AND-Logik (mehrere Keyword-Treffer)
1.0.5Neu
– Codename Radler
– Erweiterung des Smart-Posteingangs
– Import von Regelsets
– Einführung von Wortgrenzen-Matching (z. B. „rechnung“ matcht nicht mehr „rechnungsprüfung“)
– Einführung von negativem Matching (Ausschlusslogik)

Verbessert
– Transparenz durch Logfenster-Meldungen bei Regelmatches
– Optimierung des Cache-Verhaltens

Hinweis
– Beispiel für Regelverhalten:
– Enthält ein Dokument „protokoll“ und gleichzeitig „rechnung“, wird die entsprechende Regel nicht angewendet
– Enthält ein Dokument „protokoll“ ohne Ausschlussbegriffe, wird die Regel angewendet
– Enthält ein Dokument ausschließlich „rechnung“, wird die Regel ebenfalls angewendet
1.0.4Neuerungen in 1.0.5 eingearbeitet, daher gestrichen
1.0.3Neu
– Konfigurierbares Datumsformat für die Dateibenennung (z. B. vorangestellt im Dateinamen)
1.0.2Neu
– Erweiterte Einstellung zur Festlegung der minimalen Textlänge für die Analyse
1.0.1Verbessert
– Anpassung der Benutzeroberfläche: Hauptsteuerung (Start, Stop etc.) oben links positioniert
– Optimierungen für die Darstellung auf kleineren Bildschirmen
– Stabilisierung der Ordnerüberwachung (Watchdog)

Behoben
– Problem behoben, bei dem neue Dateien in seltenen Fällen nicht erkannt wurden
1.0.0Neu
– Erstveröffentlichung von Scovadoc Flow
– Automatische Analyse und Umbenennung von Dokumenten auf Basis von Inhalt und Regeln
– Überwachung von Eingangs- und Ausgangsordnern
– Regelbasierte Verarbeitung von Dokumenten
– Integration von KI-gestützter Dokumentenklassifikation
– Protokollierung von Verarbeitungsprozessen