.TRAINEDDATA Extension de fichier
Modèle OCR de Tesseract
| Développeur | Tesseract OCR Community |
| Popularité |
4,2 | 5 Votes |
Qu'est-ce qu'un fichier TRAINEDDATA ?
Un fichier TRAINEDDATA est un modèle de reconnaissance optique de caractères (OCR) créé par Tesseract, un moteur OCR open source multiplateforme. Il contient les données utilisées pour reconnaître et enregistrer automatiquement le texte présent dans les images. Chaque fichier TRAINEDDATA est généralement utilisé pour reconnaître du texte écrit dans une seule langue et porte le nom de cette langue (par exemple, eng.traineddata est utilisé pour reconnaître du texte anglais).
Plus d'informations
La reconnaissance optique de caractères est le processus qui consiste à convertir le texte présent dans des images en texte encodé par une machine. Tesseract est un moteur OCR qui a été initialement développé par Hewlett-Packard, mais qui est désormais maintenu comme projet open source, avec le soutien de Google. Les développeurs peuvent utiliser Tesseract pour créer des modèles OCR, qui servent ensuite à reconnaître et convertir le texte présent dans les images. Ces modèles sont enregistrés dans des fichiers TRAINEDDATA.
Chaque fichier TRAINEDDATA a été « entraîné » à l’aide d’une série d’images contenant le texte concerné. Tesseract comprend de nombreux fichiers TRAINEDDATA par défaut, et les développeurs peuvent créer leurs propres fichiers TRAINEDDATA. Ces fichiers sont généralement stockés dans le répertoire ~/Tessearct-OCR/tessdata.
Comment ouvrir un fichier TRAINEDDATA
Les fichiers TRAINEDDATA ne sont pas destinés à être ouverts. Les développeurs font référence aux fichiers TRAINEDDATA dans le code qui appelle Tesseract et l’utilise pour analyser le texte inclus dans les images.