Groups | Search | Server Info | Keyboard shortcuts | Login | Register [http] [https] [nntp] [nntps]


Groups > ger.ct > #564044

Re: Re: Fehlende Handbücher

From ram@zedat.fu-berlin.de (Stefan Ram)
Newsgroups ger.ct
Subject Re: Re: Fehlende Handbücher
Date 2022-08-12 10:40 +0000
Organization Stefan Ram
Message-ID <OCR-20220812112551@ram.dialup.fu-berlin.de> (permalink)
References (2 earlier) <jlji06F7b40U1@mid.individual.net> <0764941f-a178-5314-a50f-3fecc34f4f7b@jtewes.my-fqdn.de> <jll81uFdrpuU1@mid.individual.net> <pdf-20220812103841@ram.dialup.fu-berlin.de> <td58rl$m4vr$1@solani.org>

Show all headers | View raw


"Dr. Joachim Neudert" <neudert@5sl.org> writes:
>Ob "pdftotext" das leistet weiß ich nicht, könnte natürlich sein. 

  Nein, pdftotext setzt voraus, daß die PDF-Datei den Text
  bereits "als Text" enthält. Wenn die PDF-Datei nur Graphiken
  enthält, müßte man erst noch ein weiteres Programm anwenden,
  um mit OCR die Graphiken als Text zu interpretieren. Aber
  solche Programme findet man für Windows auch auch im Web,
  beispielsweise "Tesseract".

  Leider ist OCR selten perfekt, aber auch bei einigen
  Fehl-Erkennungen hat man zumindest eine Chance, etwas
  wiederzufinden. Hier sind fehlertolerante Suchverfahren
  vielleicht angebracht, die auch Texte finden, die sich in
  einigen wenigen Zeichen von der Suchanfrage unterscheiden.

  Ich habe für mich selber angefangen, ein Python-Programm zu
  schreiben, das in einem Verzeichnis alle Dateien in Text
  wandeln soll. Es schaut auf die Namenserweiterung. Bei einer
  HTML-Datei wird "BeautifulSoup" verwendet, um den Text zu
  extrahieren:

|if name.lower().endswith( ".html" )or name.lower().endswith( ".htm" ): 
|    soup = bs4.BeautifulSoup( get_text( file ), features="html.parser" )
...

  , bei "PDF" verwendet das Programm "pdftotext":

|elif name.lower().endswith( ".pdf" ):
|    args = [ "pdftotext.exe", '-enc', 'UTF-8', name,'-']
...

  , geplant ist auch noch, bei Bilddateien ein OCR-Programm
  aufzurufen. 

  Ich glaube, Google macht so etwas schon in seiner Bildsuche,
  so daß man damit Bilder heutzutage auch über in ihnen
  enthaltene Texte finden kann.

Back to ger.ct | Previous | Next | Find similar | Unroll thread


csiph-web