Zum Inhalt springen
SharePoint Lösungen & Produkte

SharePoint OCR: gescannte PDFs durchsuchbar machen

Gescannte PDFs ohne Textebene findet die SharePoint-Suche nicht. Wie eine OCR-Verarbeitung beim Hochladen aufgebaut ist und was im Betrieb zu beachten ist.

Aktualisiert am
Schema: ein gescanntes PDF ohne Textebene wird per OCR durchsuchbar, ein Protokoll erhält Ablageebene und Phase, eine E-Mail ihre Kopfdaten als Metadaten

Ein Lieferschein wird auf der Baustelle gescannt und in den Projektraum gelegt. Drei Monate später sucht jemand nach der Lieferscheinnummer und findet nichts. Die Datei ist da. Sie besteht aber nur aus einem Bild, und in einem Bild findet die Suche keinen Text.

Dieser Beitrag beschreibt, wie wir für einen Kunden gescannte PDFs beim Hochladen durchsuchbar machen, und was dabei im Betrieb zu beachten ist.

Was SharePoint von sich aus findet

Die Suche in SharePoint durchsucht den Text von Dokumenten: Word, Excel, PowerPoint und PDFs, die eine Textebene haben. Ein PDF, das aus Word exportiert wurde, wird gefunden.

Ein Scan ist ein Foto in einer PDF-Hülle. Ohne Texterkennung, kurz OCR, bleibt sein Inhalt für die Suche unsichtbar. Dasselbe gilt für Fotos von Typenschildern, Lieferscheinen oder Whiteboards.

Microsoft bietet für Microsoft 365 eine Texterkennung an, die nach Verbrauch abgerechnet wird. Ob sie Ihre Dateitypen und Mengen abdeckt und was sie kostet, prüfen Sie am besten gegen die aktuelle Dokumentation. Für Organisationen mit gelegentlichen Scans kann das der einfachste Weg sein.

Bei großen Mengen und dem Wunsch, die Datei selbst durchsuchbar zu machen, lohnt ein eigener Aufbau.

Der Aufbau: reagieren, prüfen, ersetzen

1. Auf neue Dateien reagieren. Die Bibliotheken des Projektraums melden Änderungen an einen Dienst. SharePoint bietet dafür Webhooks. Sie laufen nach spätestens 180 Tagen ab und werden deshalb täglich geprüft und erneuert.

2. Sofort bestätigen, später arbeiten. Der Dienst nimmt die Meldung entgegen, legt sie in eine Warteschlange und antwortet sofort. Die eigentliche Arbeit geschieht danach. SharePoint erwartet die Bestätigung innerhalb weniger Sekunden.

3. Doppelte aussortieren. Eine Datei löst oft mehrere Meldungen aus, etwa beim Hochladen und beim Setzen der Metadaten. Eine Tabelle merkt sich, was bereits verarbeitet wurde.

4. Prüfen, ob OCR nötig ist. Der Dienst öffnet das PDF und sieht nach, ob es Text enthält. Die meisten Dateien haben eine Textebene und werden übersprungen.

5. Erkennen und ersetzen. PDFs ohne Text laufen durch die Texterkennung. Das Ergebnis ist ein PDF, das genauso aussieht, aber eine unsichtbare Textebene hat. Es ersetzt die ursprüngliche Datei. Autor und Bearbeiter bleiben erhalten.

6. Bilder anders behandeln. Bei Fotos wird die Datei nicht verändert. Der erkannte Text landet in einem Metadatenfeld und ist darüber auffindbar.

Schema der Automatik nach dem Hochladen: OCR, Ablageebene und Phase, Kopfdaten aus E-Mails

Zahlen aus dem Betrieb

Bei einem Baukonzern hat der Dienst in 30 Tagen rund zwei Millionen Dateien geprüft, etwa 68.000 am Tag. Bei 92,8 Prozent war keine Texterkennung nötig.

Daraus folgen zwei Dinge. Die Prüfung muss billig sein, denn sie läuft für jede Datei. Und die eigentliche Erkennung betrifft nur einen kleinen Teil, der aber Rechenzeit braucht. Beides getrennt zu behandeln hält die Kosten im Rahmen.

Sieben Stolpersteine

Die Schleife. Das Ersetzen der Datei ist selbst eine Änderung und löst eine neue Meldung aus. Ohne Schutz verarbeitet der Dienst seine eigenen Ergebnisse. Die Tabelle aus Schritt 3 und die Prüfung aus Schritt 4 verhindern das.

Die Versionen. Jedes Ersetzen erzeugt eine Version. Bei großen Scans verdoppelt das den Speicherbedarf der Datei. Eine Bereinigung alter Versionen gehört zum Konzept.

Wer war es? Ersetzt ein Dienst die Datei, steht ohne Vorkehrung das Dienstkonto als letzter Bearbeiter in der Bibliothek. Die Angaben zum ursprünglichen Autor müssen ausdrücklich erhalten werden.

Geschützte PDFs. Verschlüsselte und kennwortgeschützte PDFs lassen sich nicht verarbeiten. Sie werden übersprungen.

Fehler sichtbar machen. Jede Datei trägt zwei Felder: verarbeitet und Verarbeitungsfehler. Eine Ansicht zeigt, was hängen geblieben ist. Ohne sie bemerkt niemand, dass seit einer Woche nichts mehr erkannt wird.

Pläne. Großformatige Pläne mit wenig Text sind für die Texterkennung aufwendig. Es lohnt trotzdem, denn Schriftfelder und Plannummern werden so auffindbar.

Qualität des Scans. Eine Texterkennung ist so gut wie die Vorlage. Schiefe Fotos bei schlechtem Licht ergeben lückenhaften Text. Die Suche findet dann manches, aber nicht alles. Das sollten Anwender wissen.

Was derselbe Dienst noch erledigt

Wer ohnehin auf jede neue Datei reagiert, kann mehr tun als Text erkennen. Beim selben Kunden erledigt der Dienst zwei weitere Aufgaben:

  • Ablageebene und Phase. Aus dem Speicherort der Datei schreibt er Ablageebene 1 bis 3 und die aktuelle Projektphase als Metadaten. Warum das hilft, beschreibt der Beitrag zur Ordnerstruktur für Projekte.
  • E-Mails. Bei abgelegten E-Mails liest er Absender, Empfänger, Empfangsdatum und Anhänge aus und schreibt sie in Spalten. Eine Bibliothek voller E-Mails lässt sich danach sortieren und filtern.

Wann sich der Aufbau lohnt

  • Ja, wenn regelmäßig Scans in Projekträume gelangen: Lieferscheine, unterschriebene Protokolle, Bescheide, Bestandsunterlagen.
  • Ja, wenn die Dateien später weitergegeben werden und auch außerhalb von SharePoint durchsuchbar sein sollen.
  • Nein, wenn fast alle Dokumente digital entstehen. Dann ist die Textebene schon da.
  • Vielleicht, wenn es um wenige Scans geht. Dann genügt oft der Scanner selbst, der durchsuchbare PDFs erzeugen kann.

Durchsuchbare PDFs sind ein Baustein von Smarter Project Portal.

In Ihren Projekträumen liegen Scans, die niemand wiederfindet? Schreiben Sie uns, um welche Mengen und Dokumentarten es geht.

Alle Teile der Serie:

  1. SharePoint-Projektraum automatisch anlegen: Wo Vorlagen enden
  2. Ordnerstruktur für Projekte in SharePoint: Vorlage statt Kopie
  3. Teams-Vorlage mit Planner: Projektteams mit Standardaufgaben
  4. SharePoint-Berechtigungskonzept für Projekte: Rollen statt Namen
  5. Projektdaten aus ERP und SAP in SharePoint: vier Muster
  6. SharePoint OCR: gescannte PDFs durchsuchbar machen (dieser Beitrag)
  7. Planverwaltung in SharePoint: Plancode, Index und Versionen
  8. Projektphasen in SharePoint: vom Angebot bis zum Projektende
  • Smarter Project Portal
  • OCR
  • SharePoint Online
  • PDF
  • Suche

Ähnliche Beiträge

Ist SharePoint revisionssicher? Was ein DMS nachweisen
Freigabeprotokoll einer Arbeitsanweisung: je Version Prüfer, Freigeber, Gültigkeitszeitraum und Zahl der Kenntnisnahmen

Ist SharePoint revisionssicher? Was ein DMS nachweisen muss

Revisionssicherheit ist kein Schalter in SharePoint. Was der Begriff verlangt, was Versionsverlauf und Purview leisten und was ein DMS belegen muss.

Weiterlesen
Arbeitsanweisungen digital lenken: von Word zum
Schema: links die Word-Datei in der Bearbeitung, rechts das erzeugte PDF mit Deckblatt, Version, Gültigkeit und Fußzeile

Arbeitsanweisungen digital lenken: von Word zum gültigen PDF

Wie aus einer Word-Datei eine gelenkte Arbeitsanweisung wird: Nummer, Freigabe, PDF mit Deckblatt, stabiler Link am Arbeitsplatz und Prüfung auf Aktualität.

Weiterlesen
Digitale Besucherliste statt Papierliste: Besucher am
Digitale Besucherliste eines Standorts mit Kennzahlen zu geplanten, anwesenden und ausgecheckten Besuchern

Digitale Besucherliste statt Papierliste: Besucher am Empfang mit Microsoft 365 erfassen

Warum die Papierliste am Empfang nicht mehr reicht und wie eine digitale Besucherliste mit Outlook, QR-Code und Terminal in Ihrem eigenen Azure funktioniert.

Weiterlesen

Fragen zu diesem Thema?

Wir unterstützen Sie gerne bei der Umsetzung in Ihrer Umgebung.