.TRAINEDDATA ファイル拡張子
Tesseract OCRモデル
| 開発元 | Tesseract OCR Community |
| 人気度 |
4.2 | 5 票 |
TRAINEDDATAファイルとは?
TRAINEDDATAファイルは、複数のプラットフォームに対応するオープンソースのOCRエンジンであるTesseractが作成する光学文字認識(OCR)モデルです。画像に含まれるテキストを自動的に認識して記録するために使用されるデータが含まれています。各TRAINEDDATAファイルは通常、1つの言語で書かれたテキストの認識に使用され、その言語にちなんだ名前が付けられます(例:eng.traineddataは英語のテキストの認識に使用されます)。
詳細情報
光学文字認識とは、画像内にあるテキストを、機械で扱えるテキストに変換する処理です。Tesseractは、もともとHewlett-Packardが開発したOCRエンジンですが、現在はGoogleが支援するオープンソースプロジェクトとして保守されています。開発者はTesseractを使用してOCRモデルを作成でき、それらのモデルは画像内にあるテキストの認識と変換に使用されます。これらのモデルはTRAINEDDATAファイルとして保存されます。
各TRAINEDDATAファイルは、関連するテキストを含む一連の画像を使用して「トレーニング」されています。TesseractにはデフォルトのTRAINEDDATAファイルが多数含まれており、開発者は独自のTRAINEDDATAファイルを作成できます。これらのファイルは通常、~/Tessearct-OCR/tessdataディレクトリに保存されます。
TRAINEDDATAファイルの開き方
TRAINEDDATAファイルは開くことを目的としていません。開発者は、Tesseractを呼び出して画像に含まれるテキストを分析するコードでTRAINEDDATAファイルを参照します。