Groups | Search | Server Info | Keyboard shortcuts | Login | Register [http] [https] [nntp] [nntps]
| From | ram@zedat.fu-berlin.de (Stefan Ram) |
|---|---|
| Newsgroups | ger.ct |
| Subject | Re: Re: Fehlende Handbücher |
| Date | 2022-08-12 10:40 +0000 |
| Organization | Stefan Ram |
| Message-ID | <OCR-20220812112551@ram.dialup.fu-berlin.de> (permalink) |
| References | (2 earlier) <jlji06F7b40U1@mid.individual.net> <0764941f-a178-5314-a50f-3fecc34f4f7b@jtewes.my-fqdn.de> <jll81uFdrpuU1@mid.individual.net> <pdf-20220812103841@ram.dialup.fu-berlin.de> <td58rl$m4vr$1@solani.org> |
"Dr. Joachim Neudert" <neudert@5sl.org> writes: >Ob "pdftotext" das leistet weiß ich nicht, könnte natürlich sein. Nein, pdftotext setzt voraus, daß die PDF-Datei den Text bereits "als Text" enthält. Wenn die PDF-Datei nur Graphiken enthält, müßte man erst noch ein weiteres Programm anwenden, um mit OCR die Graphiken als Text zu interpretieren. Aber solche Programme findet man für Windows auch auch im Web, beispielsweise "Tesseract". Leider ist OCR selten perfekt, aber auch bei einigen Fehl-Erkennungen hat man zumindest eine Chance, etwas wiederzufinden. Hier sind fehlertolerante Suchverfahren vielleicht angebracht, die auch Texte finden, die sich in einigen wenigen Zeichen von der Suchanfrage unterscheiden. Ich habe für mich selber angefangen, ein Python-Programm zu schreiben, das in einem Verzeichnis alle Dateien in Text wandeln soll. Es schaut auf die Namenserweiterung. Bei einer HTML-Datei wird "BeautifulSoup" verwendet, um den Text zu extrahieren: |if name.lower().endswith( ".html" )or name.lower().endswith( ".htm" ): | soup = bs4.BeautifulSoup( get_text( file ), features="html.parser" ) ... , bei "PDF" verwendet das Programm "pdftotext": |elif name.lower().endswith( ".pdf" ): | args = [ "pdftotext.exe", '-enc', 'UTF-8', name,'-'] ... , geplant ist auch noch, bei Bilddateien ein OCR-Programm aufzurufen. Ich glaube, Google macht so etwas schon in seiner Bildsuche, so daß man damit Bilder heutzutage auch über in ihnen enthaltene Texte finden kann.
Back to ger.ct | Previous | Next | Find similar | Unroll thread
csiph-web