.TRAINEDDATA Přípona souboru
Model OCR pro Tesseract
| Vývojář | Tesseract OCR Community |
| Popularita |
4,2 | 5 hlasů |
Co je soubor TRAINEDDATA?
Soubor TRAINEDDATA je model optického rozpoznávání znaků (OCR) vytvořený nástrojem Tesseract, multiplatformním open-source OCR enginem. Obsahuje data používaná k automatickému rozpoznávání a zaznamenávání textu obsaženého v obrázcích. Každý soubor TRAINEDDATA se obvykle používá k rozpoznávání textu napsaného pouze v jednom jazyce a je pojmenován podle tohoto jazyka (např. eng.traineddata se používá k rozpoznávání anglického textu).
Další informace
Optické rozpoznávání znaků je proces převodu textu nalezeného v obrázcích na strojově kódovaný text. Tesseract je OCR engine, který původně vyvinula společnost Hewlett-Packard, ale nyní je udržován jako open-source projekt podporovaný společností Google. Vývojáři mohou Tesseract používat k vytváření OCR modelů, které se následně používají k rozpoznávání a převodu textu nalezeného v obrázcích. Tyto modely se ukládají jako soubory TRAINEDDATA.
Každý soubor TRAINEDDATA je „natrénován“ pomocí série obrázků obsahujících relevantní text. Tesseract obsahuje mnoho výchozích souborů TRAINEDDATA a vývojáři si mohou vytvářet vlastní soubory TRAINEDDATA. Tyto soubory se obvykle ukládají do adresáře ~/Tessearct-OCR/tessdata.
Jak otevřít soubor TRAINEDDATA
Soubory TRAINEDDATA nejsou určeny k otevírání. Vývojáři na soubory TRAINEDDATA odkazují v kódu, který volá Tesseract a používá ho k analýze textu obsaženého v obrázcích.