Tesseract OCR

محرك OCR مفتوح المصدر (رخصة Apache-2.0) يعتمد على الشبكات العصبية LSTM، يدعم أكثر من 100 لغة ويتعرف على النصوص من الصور بصيغ PNG و JPEG و TIFF، مع إخراج بصيغ متعددة مثل PDF و hOCR و plain text، ويُستخدم كأداة سطر أوامر أو مكتبة برمجية.
المنصات: استضافة ذاتية لينكس ماك ويندوز
الترخيص: مجاني بالكامل مفتوح المصدر


نبذة مفصلة عن Tesseract OCR

Tesseract هو محرك OCR (التعرف الضوئي على الحروف) مفتوح المصدر (رخصة Apache-2.0) تم تطويره في الأصل بواسطة Hewlett-Packard بين عامي 1985 و1994، ثم تم فتح مصدره في 2005 وتولت Google تطويره حتى 2017. الإصدار الرئيسي الحالي (v5) يعتمد على شبكات عصبية LSTM للتعرف على الأسطر، مع دعم للتعرف على أكثر من 100 لغة “out of the box” وunicode (UTF-8).

يدعم Tesseract تنسيقات صور متنوعة مثل PNG و JPEG و TIFF، ويُنتج مخرجات بصيغ متعددة تشمل plain text و hOCR و PDF و invisible-text-only PDF و TSV و ALTO و PAGE. يمكن تدريبه للتعرف على لغات إضافية. لا يتضمن البرنامج واجهة رسومية، بل يعمل كأداة سطر أوامر أو مكتبة برمجية (libtesseract).

المنشئ: دولي

تعلم أكثر عن Tesseract OCR

أسئلة شائعة عن Tesseract OCR

هذه الأسئلة الأكثر طرحا حول Tesseract OCR
كيف يمكن تحسين دقة التعرف في Tesseract؟

لتحسين نتائج التعرف، يُنصح بتحسين جودة الصورة المدخلة (الدقة، التباين، الإضاءة)، واستخدام نموذج تدريب مناسب للغة المستهدفة، وضبط وضع المحرك (–oem) ونمط الصفحة (–psm) حسب طبيعة النص.

هل يدعم Tesseract اللغة العربية؟

نعم، يدعم Tesseract اللغة العربية عبر ملفات التدريب المتاحة في مستودع tessdata. يمكن تحميلها واستخدامها مع الأمر `tesseract` مع تحديد اللغة `ara`.

أخر الأخبار و تحديثات حول Tesseract OCR

اللغات المدعومة

الإنجليزية

أخر تحديث للصفحة 14 سبتمبر، 2026