دوز مباشرة للمحتوى الرئيسي
TeleOCR

TeleOCR خدام

TeleOCR هو موديل مفتوح المصدر لتحليل الوثائق من مختبر شينغتشن التابع لـ China Telecom، مبني على معمارية خفيفة ديال الرؤية واللغة بحوالي 1.2B بارامتر. كيعالج فإطار واحد الوثائق الرقمية والوثائق المصوّرة بالكاميرا، وكيحوّل النصوص، وتخطيط الصفحات، والجداول...

TeleOCR هو موديل مفتوح المصدر لتحليل الوثائق من مختبر شينغتشن التابع لـ China Telecom، مبني على معمارية خفيفة ديال الرؤية واللغة بحوالي 1.2B بارامتر. كيعالج فإطار واحد الوثائق الرقمية والوثائق المصوّرة بالكاميرا، وكيحوّل النصوص، وتخطيط الصفحات، والجداول...

TeleOCR
الزيارات الشهرية
0
الأسعار
ما تحددش
مدرج
—
تحدّث
2026-09-24

01شنو هو TeleOCR؟

TeleOCR هو موديل مفتوح المصدر لتحليل الوثائق من مختبر شينغتشن التابع لـ China Telecom، مبني على معمارية خفيفة ديال الرؤية واللغة بحوالي 1.2B بارامتر. كيجمع فإطار واحد معالجة الوثائق الرقمية والوثائق المصوّرة بالكاميرا، وكيحوّل النصوص، وتخطيط الصفحات، والجداول، والمعادلات والرسوم العلمية لنتائج مهيكلة بحال Markdown وJSON. تصدّر TeleOCR ترتيب OmniDocBench v1.6، وربح المرتبة الأولى فـ PureDocBench وبطولة تحليل الرسوم العلمية فـ ICDAR-2026. كيدعم النشر المحلي باستعمال GPU، ومناسب لاستخراج البيانات المهيكلة من العقود، والأبحاث، والأرشيفات وغيرها.

02الوظائف الرئيسية ديال TeleOCR

التعرّف على النصوص: استخراج دقيق لمحتوى الوثائق، بدقة كتوصّل لـ 97.22 فالتعرّف على الوثائق الرقمية.
تحليل التخطيط: تحديد مواقع ومستويات النصوص، والجداول، والمعادلات والعناصر الأخرى فالصفحة.
تحليل الجداول: إعادة بناء دقيقة للجداول المعقدة اللي فيها خلايا مدموجة وصفوف وأعمدة متداخلة، مع TEDS كيوصل لـ 97.05.
تحليل المعادلات: تحليل مهيكل للمعنى والقواعد ديال المعادلات واسترجاع دقيق على مستوى الرموز، مع CDM كيوصل لـ 96.36.
تحليل الرسوم العلمية: التعرّف على عناصر الرسوم واستخراج البيانات، وتحويل الرسوم بالأعمدة فالأبحاث لجداول مهيكلة، وهي القدرة اللي جابت لقب ICDAR-2026.
معالجة الوثائق المصوّرة: معالجة مباشرة للوثائق اللي فيها تشوّه المنظور، أو تقوّس الصفحات، أو الظلال والضبابية، بلا حاجة لموديل مستقل لإزالة التشوّه.
الإخراج المهيكل: توليد النتائج بصيغ Markdown وJSON والجداول والمعادلات، باش يسهل ربطها بأنظمة البحث فالمعرفة والأنظمة المهنية.

03المبدأ التقني ديال TeleOCR

تابع WeChat وجاوب بـ“开源” باش تنضم لمجموعة مشاريع الذكاء الاصطناعي مفتوحة المصدر
معمارية موحّدة ديال الرؤية واللغة: TeleOCR كيستعمل موديل خفيف للرؤية واللغة بحوالي 1.2B بارامتر، وكيحط الوثائق الرقمية والمصوّرة بالكاميرا فإطار واحد، باش يدير تحليل التخطيط والمحتوى من البداية للنهاية. هاد الشي كيعوّض السلسلة التقليدية ديال ”كشف التخطيط ← تصحيح الصورة ← التعرّف“ وكيحدّ من تراكم الأخطاء.
النمذجة الواعية بالهندسة: لمعالجة تشوّهات الصفحات غير المنتظمة، كيدمج الموديل نمذجة واعية بالهندسة وأخذ عينات Douglas-Peucker موجّهة بالانحناء، وكيعلّم حدود الوثيقة وبنيتها المكانية بشكل صريح، باش يقدر يعالج مباشرة الصفحات المقوّسة والمطوية والمشوّهة بالمنظور.
حلقة متكاملة لهندسة البيانات: منظومة البيانات كتغطي التوليد، والتنقية، والتقييم والتحسين. كيتستعمل تصويت توافق متعدد العقد لاختيار الوسوم الزائفة عالية الثقة؛ وكيتم تركيب البيانات الواعية بالهندسة حول الدوران والتشوّه والانحناء؛ كما كتعاود آلية التحقق الذاتي من صورة لصورة تصيير نتائج التحليل ومقارنتها للتصحيح التلقائي. وكتخلّي التنقية التدريجية العينات المتوافقة بزاف تدخل لبيانات التدريب، بينما كتستعمل العينات اللي فيها اختلاف كبير لتحسين الحالات الصعبة، وبهذا كتتشكّل حلقة مغلقة ديال الاختيار بالتصويت والتدريب الذاتي للموديل.
تدريب تدريجي من أربع مراحل: كيتقدّم التدريب عبر ”مواءمة الرؤية واللغة ← تحليل الوثائق الواعي بالهندسة ← تعلّم فصل المحتوى عن البنية ← التعلم بالتعزيز“، والهدف هو الانتقال من الإدراك الأساسي للفهم الدقيق. فمهام الجداول، كيتستعمل Structure-only لتعزيز فهم بنية الصفوف والأعمدة، ومن بعد Structure+Content لتحقيق المواءمة المشتركة. وفمهام المعادلات، كيتستعمل حتى هو التعلم المنفصل لتنظيم المعنى والقواعد.

04كيفاش تستعمل TeleOCR؟

تحضير البيئة: ثبّت Python 3.10+ وتأكد من توفر بيئة GPU كتدعم CUDA.
جلب الكود: نفّذ git clone https://github.com/caipeng328/TeleOCR.git ودخل للمجلد.
إنشاء البيئة: استعمل conda لإنشاء بيئة افتراضية سميتها teleocr وفعّلها.
تثبيت الاعتماديات: شغّل pip install -e . لتثبيت اعتماديات المشروع.
تحميل الموديل: من بعد تثبيت modelscope عبر pip install modelscope، استعمل أمر modelscope لتحميل الأوزان محلياً فالمجلد ./models/TeleOCR.
تحضير المجلدات: حدّد مجلد صور الإدخال IMAGE_SUB_PATH ومجلد حفظ النتائج RESULT_SAVE_PATH.
تشغيل الاستدلال: نفّذ python infer.py، ومرّر مسار الصور، ومسار النتائج، و--use_async، و--override، ومسار الموديل ومعاملات الواجهة الخلفية.
اختيار الواجهة الخلفية: للاستعمال العادي استعمل vllm-engine، وللمعالجة الدفعية عالية التوازي تقدر تبدّل لـ vllm-async-engine.
تحديد وضع التخطيط: استعمل LAYOUT_MODE="Detection" للوثائق الرقمية، وبدّل إلى "Segmentation" للصفحات المصوّرة المقوّسة أو المتدهورة.
ضبط المعاملات: حسب الحاجة، عدّل MAX_MODEL_LEN لطول السياق، وGPU_MEMORY_UTILIZATION لاستهلاك ذاكرة GPU، وPDF_TOOLS لواجهة PDF الخلفية، وMAX_PIXELS لأقصى عدد ديال البكسلات فالصفحة.
الحصول على النتائج: قرا النتائج المهيكلة من مجلد الإخراج، بحال Markdown وJSON والجداول، وربطها بالأنظمة اللاحقة.

05المزايا الأساسية ديال TeleOCR

نتائج متقدمة فالتصنيفات: تصدّر OmniDocBench v1.6 بمجموع 96.87، متفوّقاً على موديلات متخصصة بحال MinerU2.5-Pro وPaddleOCR-VL-1.6 وOvisOCR2.
خفيف من ناحية البارامترات: غير حوالي 1.2B بارامتر، وكيخفّض عتبة النشر المحلي ومناسب للاستعمال الخاص.
إطار موحّد: الوثائق الرقمية والمصوّرة بالكاميرا كيتحللو فالموديل نفسه، بلا حاجة لنشر أنظمة متعددة حسب مصدر الوثيقة.
بلا إزالة تشوّه مسبقة: النمذجة الواعية بالهندسة كتقدر تعالج مباشرة الصفحات المقوّسة والمطوية والمشوّهة بالمنظور، وكتنقص تراكم أخطاء وحدات التصحيح المستقلة.
إخراج مهيكل: إخراج مباشر لنتائج قابلة للمعالجة بصيغ Markdown وJSON والجداول والمعادلات، باش يسهل ربطها بالبحث فالمعرفة والأتمتة المهنية.
قوة فالجداول المعقدة: الجداول اللي فيها صفوف وأعمدة متداخلة وخلايا مدموجة كتبقى فيها البنية والمواضع مضبوطة، مع TEDS كيوصل لـ 97.05.
بطل فـ تحليل الرسوم العلمية: كيتعرّف على عناصر الرسوم وكيستخرج البيانات، وربح بطولة تحدي تحليل الرسوم العلمية فـ ICDAR-2026.
حلقة بيانات فعّالة: التصويت بالتوافق بين عدة عقد وآلية التحقق الذاتي كيبنيو مخزون بيانات تدريب بمستوى عشرات الملايين، ومعظم البيانات المولّدة ما كتحتاجش لوسم يدوي.

06عنوان مشروع TeleOCR

مستودع GitHub: https://github.com/caipeng328/TeleOCR
مستودع الموديل فـ HuggingFace: https://www.modelscope.cn/models/XingChen-AGI/TeleOCR
البحث التقني فـ arXiv: https://arxiv.org/pdf/2608.12898

07مجالات استعمال TeleOCR

رقمنة العقود والأرشيفات: تحليل الجداول اللي فيها صفوف وأعمدة متداخلة وبنية التخطيط فالعقود والأرشيفات، وتحويلها لبيانات مهيكلة قابلة للبحث.
تحليل الأبحاث العلمية: استخراج المعادلات والجداول وبيانات الرسوم بالأعمدة من الأبحاث، للمساعدة فـ تحليل المراجع وبناء قواعد المعرفة.
معالجة الوثائق المالية: التعرّف على الفواتير والاستمارات والوثائق المصوّرة، مع تحمّل تشوّه المنظور والضبابية، والإدخال التلقائي للنظام المهني.
إدخال تمارين التعليم: تحويل المعادلات المطبوعة والأسئلة اللي فيها جداول فالاختبارات لصيغ قابلة للتحرير، لدعم بناء بنوك الأسئلة والتصحيح الذكي.
أتمتة تقارير الشركات: تحويل التقارير الممسوحة والاستمارات المهنية بشكل دفعِي لجداول مهيكلة، وربطها بتحليل البيانات ومسارات RPA.

© إخلاء المسؤولية: النطاقات والمحتوى المرتبط يقدرو يتبدلو مع الوقت. AIEZZ ما كيتحكمش فالمواقع التابعة لجهات أخرى. راجع المحتوى الخارجي والمخاطر بشكل مستقل.

تقييمات المستخدمين0