Tesseract OCR

محرك OCR مفتوح المصدر (رخصة Apache-2.0) يعتمد على الشبكات العصبية LSTM، يدعم أكثر من 100 لغة ويتعرف على النصوص من الصور بصيغ PNG و JPEG و TIFF، مع إخراج بصيغ متعددة مثل PDF و hOCR و plain text، ويُستخدم كأداة سطر أوامر أو مكتبة برمجية.
المنصات: Self Hosted Linux MacOS Windows
الترخيص: مجاني بالكامل مفتوح المصدر


Detailed overview of Tesseract OCR

Tesseract هو محرك OCR (التعرف الضوئي على الحروف) مفتوح المصدر (رخصة Apache-2.0) تم تطويره في الأصل بواسطة Hewlett-Packard بين عامي 1985 و1994، ثم تم فتح مصدره في 2005 وتولت Google تطويره حتى 2017. الإصدار الرئيسي الحالي (v5) يعتمد على شبكات عصبية LSTM للتعرف على الأسطر، مع دعم للتعرف على أكثر من 100 لغة “out of the box” وunicode (UTF-8).

يدعم Tesseract تنسيقات صور متنوعة مثل PNG و JPEG و TIFF، ويُنتج مخرجات بصيغ متعددة تشمل plain text و hOCR و PDF و invisible-text-only PDF و TSV و ALTO و PAGE. يمكن تدريبه للتعرف على لغات إضافية. لا يتضمن البرنامج واجهة رسومية، بل يعمل كأداة سطر أوامر أو مكتبة برمجية (libtesseract).

Origin: دولي

Learn more about Tesseract OCR

FAQ About Tesseract OCR

هذه الأسئلة الأكثر طرحا حول Tesseract OCR
كيف يمكن تحسين دقة التعرف في Tesseract؟

لتحسين نتائج التعرف، يُنصح بتحسين جودة الصورة المدخلة (الدقة، التباين، الإضاءة)، واستخدام نموذج تدريب مناسب للغة المستهدفة، وضبط وضع المحرك (–oem) ونمط الصفحة (–psm) حسب طبيعة النص.

هل يدعم Tesseract اللغة العربية؟

نعم، يدعم Tesseract اللغة العربية عبر ملفات التدريب المتاحة في مستودع tessdata. يمكن تحميلها واستخدامها مع الأمر `tesseract` مع تحديد اللغة `ara`.

أخر الأخبار و تحديثات حول Tesseract OCR

اللغات المدعومة

الإنجليزية

أخر تحديث للصفحة 14 September، 2026