تخطيطات اصطناعية، تحسين التعرف الضوئي على الحروف للغة اليابانية العمودية: داخل Synth-JDoc
Based on: Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images — Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara
ضع مستنداً حكومياً يابانياً متعدد الأعمدة في نموذج لغوي بصري كبير (LVLM)، واطلب منه نسخ الصفحة، وقد يفشل بطريقة محددة جداً. في مثال من ورقة Synth-JDoc، يقرأ النموذج القسم "A1"، ويتخطى النص في العمود العمودي التالي، ويقفز مباشرة إلى "Q2."
يمكن للمستندات اليابانية أن تجمع بين النص الأفقي (yokogaki) والنص العمودي (tategaki). في النص الياباني العمودي، تتدفق الأحرف من الأعلى إلى الأسفل، وتتدفق الأسطر من اليمين إلى اليسار. تلاحظ الورقة أن الكتابة اليابانية العمودية لا تزال ممثلة تمثيلاً ناقصاً في بيانات تدريب التعرف الضوئي على الحروف (OCR)، وأن نماذج LVLM الحالية تؤدي أداءً أسوأ بكثير عليها مقارنةً بالنص الياباني الأفقي.
لمعالجة هذه الفجوة، طور Keito Sasagawa و Shuhei Kurita و Daisuke Kawahara Synth-JDoc. تصف ورقتهم، "Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images"، خط أنابيب للبيانات الاصطناعية مبني حول عرض HTML/CSS، وتوليد الصور من النص للرسوم المضمنة، وتدهور الصور.
يحتوي المجموعة النهائية من البيانات على 17,970 صورة مستند مُنقحة. في التقييمات على المستندات اليابانية المكتوبة عمودياً في العالم الحقيقي، حققت النماذج التي تم ضبطها بدقة على Synth-JDoc أفضل النتائج المبلغ عنها تحت كل من إعدادي التقييم لأربعة من عائلات النماذج الخمسة التي تم اختبارها. تم إصدار رمز المشروع مفتوح المصدر على GitHub (llm-jp/synth-jdoc)، مع استضافة المجموعة من البيانات على Hugging Face (llm-jp/Synth-JDoc).
إليك تفكيك تقني لمشكلة التعرف الضوئي على الحروف اليابانية العمودية، وكيف يبني Synth-JDoc صفحاته الاصطناعية، وما الذي تظهره تجاربه.

لماذا يمثل الياباني العمودي تحديًا للنماذج اللغوية البصرية الكبيرة (LVLMs)
يتطلب نسخ المستندات أكثر من مجرد التعرف على الأحرف الفردية. يجب على النموذج أيضًا اتباع ترتيب القراءة في الصفحة.
تضيف المستندات اليابانية العمودية تحديًا خاصًا:
- الاتجاه العمودي: تُقرأ الأحرف في السطر العمودي من الأعلى إلى الأسفل، بينما تتقدم الأسطر من اليمين إلى اليسار.
- تخطيطات الأعمدة المتعددة: يصف الورق ترتيب القراءة متعدد الأعمدة بأنه يتقدم تسلسليًا من العمود العلوي إلى السفلي.
- أنماط الكتابة المختلطة: قد تحتوي المستندات اليابانية على كتابة عمودية وأفقية في نفس الصفحة.
المثال التحفيزي في الورقة هو صفحة مستند حقيقية حيث أغفل النموذج الأصلي Qwen3-VL العمود الثاني من الأعلى. لم يقفز النموذج المُحسّن (fine-tuned) على ذلك النص. يجادل المؤلفون بأن هناك حاجة إلى مجموعة بيانات للتعرف الضوئي على الحروف (OCR) اليابانية تحتوي على نص عمودي، وتخطيطات متعددة الأعمدة، وصور مُدرَجة لتحسين هذا النوع من قراءة المستندات.
إنشاء هذه المجموعة من البيانات من مستندات حقيقية مكلف. لا يمكن توسيع نطاق التسمية اليدوية بسهولة، بينما يؤدي استخراج نص التدريب باستخدام نظام OCR إلى إدخال أخطاء في التعرف ويتطلب جمع صور المستندات المصدر. كما أن الأساليب الاصطناعية الحالية لها حدودها: يمكن لـ SynthDoG إنشاء صور مستندات يابانية لكنه ينتج تخطيطات أقل واقعية، بينما يدعم JSSODa النص العمودي والأفقي في تخطيطات تتراوح بين عمود واحد وأربعة أعمدة لكنه يستخدم نصًا أسود على خلفية بيضاء دون صور مُدرَجة.
بنية Synth-JDoc: التركيب المدفوع بالكود
تستخدم Synth-JDoc خط أنابيب من ثلاث مراحل: تحضير عناصر المستند، تركيب صورة المستند، وتطبيق الضوضاء.
+-------------------------------------------------------------------------+
| المرحلة 1: تحضير عناصر المستند |
| - مصدر النص: مجموعة بيانات JSSODa (أسماء من قاموس JUMAN -> llm-jp-3.1) |
| - تقسيم الفقرات وتوليد العناوين |
| - مطابقة الفقرات مع أماكن الصور عبر مشكلة التعيين الخطي |
| - توليد موجهات الصور (Qwen3-30B) -> Z-Image-Turbo |
| - توليد التسميات التوضيحية (Qwen3-VL-30B) بنسبة قصيرة إلى طويلة 9:1 |
+-------------------------------------------------------------------------+
|
v
+-------------------------------------------------------------------------+
| المرحلة 2: عرض المستند بصيغة HTML/CSS |
| - 8 تركيبات تخطيطية: أفقي/عمودي x 1، 2، 3، 4 أعمدة |
| - 49 خطًا يابانيًا من Google Fonts |
| - احتمال وجود عنوان بنسبة 25%؛ صور في عمود واحد أو تمتد عبر الأعمدة |
| - العرض عبر متصفح الويب |
+-------------------------------------------------------------------------+
|
v
+-------------------------------------------------------------------------+
| المرحلة 3: خط أنابيب الضوضاء (17,970 صورة مُنقحة) |
| - 40% عروض برمجية نظيفة |
| - 30% ضوضاء تشبه المسح الضوئي |
| - 30% تدهور باستخدام Augraphy |
+-------------------------------------------------------------------------+
1. تحضير عناصر المستند
يبدأ خط الأنابيب بالنصوص المستمدة من JSSODa. تم إنشاء نصوص هذه المجموعة من خلال استخراج الأسماء من قاموس JUMAN واستخدام llm-jp-3.1-13b-instruct4 لتوليد جمل تتعلق بكل اسم. تستخدم Synth-JDoc نفس النموذج لتوليد عنوان لكل نص.
بعد ذلك، يتم تقسيم النص إلى فقرات عند السطور الفارغة المزدوجة (\n\n). لإنشاء مستندات مصورة، يقوم خط الأنابيب بإدراج أماكن محجوزة للصور:
- يتم اختيار عدد الصور لكل مستند عشوائيًا، من صفر إلى نصف عدد الفقرات.
- تُدرج الأماكن المحجوزة عشوائيًا قبل أو بعد الفقرات.
- يقوم النظام بربط الأماكن المحجوزة بالفقرات من خلال تقليل مجموع المسافات المربعة بينهما عبر مشكلة التعيين الخطي.
بالنسبة لكل مكان محجوز مرتبط، يقوم Qwen3-30B-A3B-Instruct-2507 بإنتاج موجه لتوليد الصور بناءً على الفقرة المرتبطة. ثم يقوم Z-Image-Turbo بتوليد الصورة. وأخيرًا، يقوم Qwen3-VL-30B-A3B-Instruct بتوليد تسمية توضيحية للصورة. تُستخدم التسميات الموجزة والتسميات الأطول متعددة الجمل بنسبة 9:1.
2. تركيب التخطيط القائم على المتصفح
بعد تحضير النصوص والعناوين والصور والتسميات التوضيحية، تبني Synth-JDoc صفحات HTML/CSS وتعرضها كصور في متصفح ويب.
- تركيبات التخطيط: يتم توزيع المجموعة بشكل متساوٍ عبر ثمانية تركيبات: كتابة أفقية أو عمودية، مع عمود واحد إلى أربعة أعمدة.
- تنوع الطباعة: يتم اختيار الخطوط عشوائيًا من بين 49 خيارًا يابانيًا متاحًا عبر Google Fonts.
- تباين التخطيط: تظهر العناوين باحتمال 25%. في التخطيطات ذات العمودين أو أكثر، قد تبقى الصور داخل عمود واحد أو تمتد عبر جميع الأعمدة. كما يتم تعشيش أنماط تسميات الصور، بما في ذلك "الشكل N:" و"Fig. N:".
نظرًا لأن النص يُعرض مباشرةً في المستندات الاصطناعية، يتجنب خط الأنابيب أخطاء التعرف الضوئي على الحروف (OCR) التي تنشأ عند استخراج التسميات من صور المستندات الموجودة مسبقًا.
3. الضوضاء ومحاكاة الماسح الضوئي
تجمع مجموعة التدريب النهائية بين الصور الاصطناعية النظيفة، والصور المشابهة للمسح الضوئي، والصور المعالجة بواسطة Augraphy.
- العروض النظيفة (40%): مستندات اصطناعية قبل تطبيق الضوضاء.
- الضوضاء المشابهة للمسح الضوئي (30%): ضوضاء غاوسية، دوران، تحويلات منظور، ظلال عمودية وأفقية، تأثيرات الظل المحيطي، وضبابية عامة عشوائية.
- معالجة Augraphy (30%): خط أنابيب لتدهور المستند بثلاث مراحل:
- مرحلة الحبر:
InkBleedوInkMottling. - مرحلة الورق: إضافة أنماط لونية ونسيجية.
- المرحلة اللاحقة: مزيد من التدهور مثل البقع، والكتابة العشوائية، والظلال، والطي المحاكى.
- مرحلة الحبر:
بعد الفحص اليدوي للصور التي تحتوي على أخطاء في التركيب أو مخاوف محتملة بشأن حقوق النشر، تحتوي مجموعة التدريب النهائية لـ Synth-JDoc على 17,970 صورة.
النتائج التجريبية: معيار VJRODa
قام الباحثون بتقييم النماذج على مجموعة بيانات VJRODa، والتي تتكون من 100 صورة وثيقة يابانية مكتوبة عمودياً في العالم الحقيقي مع النصوص المقابلة لها. يصف الورق البحثي مجموعة VJRODa بأنها مُنشأة من صفحات PDF حقيقية؛ ويشير قسم القيود إلى أن ملفات PDF تم نشرها من قبل وكالات حكومية وهي نظيفة نسبياً.
تم ضبط خمسة نماذج لغوية-بصرية مفتوحة المصدر (LVLMs) بشكل كامل، مع تحديث جميع معاملات الوحدات:
Qwen2.5-VL-7B-InstructQwen3-VL-8B-InstructInternVL3-8B-hfInternVL3.5-VL-8B-hfGemma 3 12B IT
استخدم التدريب حجم دفعة (batch size) قدره 32، ومُحسّن AdamW، ومعدل تعلم قدره 2e-05. طلبت المطالبة (prompt) من كل نموذج إخراج جميع النصوص الموجودة في الصورة بترتيب القراءة الياباني القياسي. حافظ الورق البحثي على اتساق إعدادات التدريب وحجم بيانات التدريب عبر إعدادات الضبط الدقيق.
مقاييس التقييم ومأزق التكرار
يبلغ المؤلفون عن مقياسين:
- معدل خطأ الأحرف (CER $\downarrow$): المسافة التعديلية بين مخرجات النموذج والنص الصحيح (ground-truth)، مقسومة على عدد أحرف النص الصحيح ومضروبة في 100. كلما كان الرقم أقل كان أفضل.
- SacreBLEU (BLEU $\uparrow$): BLEU على مستوى الأحرف بعد تجزئة الأحرف. كلما كان الرقم أعلى كان أفضل.
- معالجة النصوص المسبقة: تطبيع Unicode NFKC وإزالة المسافات البيضاء قبل التقييم.
تم الإبلاغ عن النتائج تحت إعدادي إخراج:
- الإخراج الخام (Raw Output): النقاط المحسوبة على مخرجات النموذج كما تم إنشاؤها.
- إزالة التكرار (Remove Repetition): النقاط المحسوبة بعد إزالة السلاسل النصية المتكررة في النهاية.
الإعداد الثاني مهم لأن نماذج LVLM يمكن أن تكرر نفس السلسلة النصية. يستخدم الورق البحثي كلا الإعدادين لفصل التغييرات في التوليد التكراري عن التغييرات في أداء التعرف الأساسي على الأحرف.
تفصيل الأداء
| النموذج | مجموعة بيانات التدريب | CER الخام ($\downarrow$) | BLEU الخام ($\uparrow$) | CER بعد إزالة التكرار ($\downarrow$) | BLEU بعد إزالة التكرار ($\uparrow$) |
|---|---|---|---|---|---|
| Qwen2.5-VL-7B | الأساس (Zero-Shot) | 154.0 | 20.1 | 88.5 | 22.0 |
| + JSSODa | 65.1 | 51.5 | 40.5 | 61.1 | |
| + Nano Banana Pro | 161.0 | 20.9 | 135.0 | 24.4 | |
| + Synth-JDoc (خاصتنا) | 34.5 | 66.8 | 32.0 | 69.5 | |
| Qwen3-VL-8B | الأساس (Zero-Shot) | 116.0 | 32.6 | 45.6 | 52.5 |
| + JSSODa | 130.0 | 29.9 | 65.5 | 49.4 | |
| + Nano Banana Pro | 177.0 | 16.1 | 138.0 | 17.3 | |
| + Synth-JDoc (خاصتنا) | 43.9 | 57.4 | 25.0 | 70.8 | |
| InternVL3-8B | الأساس (Zero-Shot) | 121.0 | 26.0 | 66.5 | 40.8 |
| + JSSODa | 251.0 | 26.1 | 73.5 | 54.9 | |
| + Nano Banana Pro | 173.0 | 15.3 | 140.0 | 19.3 | |
| + Synth-JDoc (خاصتنا) | 70.9 | 47.8 | 38.9 | 68.1 | |
| InternVL3.5-VL-8B | الأساس (Zero-Shot) | 121.0 | 29.2 | 56.1 | 41.0 |
| + JSSODa | 57.9 | 62.3 | 37.2 | 71.9 | |
| + Nano Banana Pro | 173.0 | 15.6 | 117.0 | 18.8 | |
| + Synth-JDoc (خاصتنا) | 36.8 | 66.7 | 25.9 | 78.3 | |
| Gemma 3 12B IT | الأساس (Zero-Shot) | 125.0 | 17.5 | 67.9 | 23.3 |
| + JSSODa | 77.6 | 27.9 | 67.4 | 27.2 | |
| + Nano Banana Pro | 196.0 | 8.5 | 145.0 | 9.3 | |
| + Synth-JDoc (خاصتنا) | 128.0 | 18.7 | 96.3 | 26.5 |
بالنسبة لـ Qwen2.5-VL، وQwen3-VL، وInternVL3، وInternVL3.5، فإن صف الضبط الدقيق باستخدام Synth-JDoc يحتوي على أفضل درجات CER وBLEU تحت كل من إعدادي الإخراج الخام وإزالة التكرار.
- على نموذج Qwen3-VL-8B، انخفض معدل خطأ الأحرف بعد إزالة التكرار من 45.6 إلى 25.0، بينما ارتفع BLEU من 52.5 إلى 70.8.
- على نموذج InternVL3.5-8B، انخفض معدل خطأ الأحرف بعد إزالة التكرار من 56.1 إلى 25.9، بينما ارتفع BLEU إلى 78.3.
- أدى الضبط الدقيق على JSSODa إلى تحسين بعض النماذج ولكنه لم يحسن كل الإعدادات. على سبيل المثال، ارتفع معدل خطأ الأحرف الخام لـ Qwen3-VL من 116.0 إلى 130.0.
دراسة حالة واقعية
يستخدم المثال النوعي في الورق البحثي وثيقة تتعلق بإشعارات المعاشات الوطنية (Nenkin Tokubetsubin).
أنتج النموذج الأساسي Qwen3-VL-8B "A1" في القسم الأول، ثم تخطى النص في العمود الثاني من الأعلى قبل الاستمرار عند "Q2" في العمود الثالث. كان معدل خطأ الأحرف (CER) الخاص به 47.4. لم يتخطَ النموذج المُضبط بدقة باستخدام Synth-JDoc ذلك العمود، وكان معدل خطأ الأحرف الخاص به 3.84.
نتاج تجريبي تعليمي مزدوج
اختبر البحث أيضاً حدوداً مهمتين من نهجه.
1. خط الأساس Nano Banana Pro
قام الباحثون بإنشاء مجموعة بيانات أساسية باستخدام Nano Banana Pro (gemini-3-pro-image-preview). حددت الأوامر النصية نفس النصوص والعناوين وتسميات الأشكال واتجاه الكتابة وعدد الأعمدة المستخدمة في Synth-JDoc. وعندما كانت التسميات موجودة، طلبت الأوامر أيضاً الأشكال المقابلة.
يمكن أن تبدو الصور واقعية، مع تفاصيل مثل المكاتب الخشبية وطيحات الصفحات. لكن البحث يشير إلى عدة إخفاقات في توليد المستندات:
- تشويه الأحرف: يمكن أن تكون الأحرف اليابانية المولدة مشوهة.
- عدم تطابق النص: يمكن أن يختلف النص في الصورة عن الأمر النصي.
- فشل التخطيط العمودي: لم ينشئ النموذج مستندات متعددة الأعمدة بنص مكتوب عمودياً بشكل موثوق. في مثال واحد، أنتج أمر نصي يطلب تخطيطاً عمودياً ثنائي الأعمدة صفحتين منفصلتين مكتوبتين عمودياً بدلاً من ذلك.
عموماً، أدى ضبط Nano Banana Pro إلى تدهور النتائج مقارنة بالنماذج الأصلية. يشير البحث إلى استثناء واحد: تحسّن BLEU الخاص بـ Qwen2.5-VL قليلاً، رغم تدهور CER الخاص به بشكل كبير.
2. قيد دقة Gemma 3
لم يحسّن Synth-JDoc أداء Gemma 3. يعزو المؤلفون هذا الناتج إلى كيفية تعامل Gemma 3 مع الصور المدخلة.
تستخدم Qwen2.5-VL و Qwen3-VL الدقة الديناميكية الأصلية، بينما تستخدم InternVL3 و InternVL3.5 استراتيجية التiling الديناميكي. يمكن لهذه النهج معالجة صور بنسبة أبعاد ودقة مختلفة. بالمقابل، يشير البحث إلى أن Gemma 3 يعيد ضبط حجم الصور المدخلة إلى دقة ثابتة بنسبة 1:1.
تحتوي Synth-JDoc على صور مستندات بمجموعة من الدقات. لذلك، يفترض المؤلفون أن إعادة الضبط الثابتة في Gemma 3 منعت تعلمه بشكل فعال من مجموعة البيانات. يقدمون هذا كدليل على أن أداء التعرف الضوئي على الحروف يعتمد على تصميم مجموعة البيانات وهندسة النموذج على حد سواء.

دراسة الاستئصال: الصور والتعليقات التوضيحية
اختبر المؤلفون أيضاً تأثير الصور المضمنة وتعليقاتها التوضيحية. وقبل تطبيق الضوضاء، قاموا بإخفاء الصور أو التعليقات التوضيحية أو كليهما باستخدام لون الخلفية، ثم قاموا بتدريب نموذجي Qwen3-VL-8B وInternVL3.5-VL-8B على هذه المتغيرات.
| إعداد الاستئصال (Qwen3-VL-8B) | CER الخام ($\downarrow$) | BLEU الخام ($\uparrow$) | CER بعد إزالة التكرار ($\downarrow$) | BLEU بعد إزالة التكرار ($\uparrow$) |
|---|---|---|---|---|
| Synth-JDoc الكامل | 43.9 | 57.4 | 25.0 | 70.8 |
صور مخفية (w/o image) |
60.5 | 48.1 | 36.8 | 67.4 |
تعليقات توضيحية مخفية (w/o caption) |
120.0 | 30.2 | 51.2 | 54.5 |
كلاهما مخفي (w/o image + caption) |
55.7 | 48.9 | 39.3 | 64.8 |
| إعداد الاستئصال (InternVL3.5-8B) | CER الخام ($\downarrow$) | BLEU الخام ($\uparrow$) | CER بعد إزالة التكرار ($\downarrow$) | BLEU بعد إزالة التكرار ($\uparrow$) |
|---|---|---|---|---|
| Synth-JDoc الكامل | 36.8 | 66.7 | 25.9 | 78.3 |
صور مخفية (w/o image) |
45.5 | 58.8 | 38.6 | 65.2 |
تعليقات توضيحية مخفية (w/o caption) |
54.3 | 57.9 | 39.9 | 72.7 |
كلاهما مخفي (w/o image + caption) |
59.3 | 57.6 | 47.1 | 66.4 |
أدى إزالة كل من الصور والتعليقات التوضيحية إلى رفع مؤشر CER بعد إزالة التكرار في نموذج Qwen3-VL من 25.0 إلى 39.3. وفي نموذج InternVL3.5، ارتفع المؤشر من 25.9 إلى 47.1.
في كلا النموذجين، تفوق مجموعة بيانات Synth-JDoc الكاملة على المتغيرات التي تحتوي على صور أو تعليقات توضيحية مخفية. ويعزو المؤلفون ذلك إلى أن الصفحات الاصطناعية التي تحتوي على كلا العنصرين تمثل وثائق أكثر تنوعاً بصرياً وواقعية.
القيود والعمل المستقبلي
يحدد الورقة عدة قيود مفتوحة:
- تنوع التخطيط: يغطي Synth-JDoc التخطيطات الأفقية والعمودية مع عمود واحد إلى أربعة أعمدة، لكن المستندات الحقيقية مثل الجرائد يمكن أن يكون لها ترتيبات قراءة أكثر تعقيدًا.
- العناصر المنظمة: يحدد المؤلفون الرسوم البيانية والجداول كأهداف مستقبلية لخط الأنابيب التوليفي.
- تكرار فك التشفير: لا يزال فك التشفير الجشع ينتج مخرجات متكررة في بعض الحالات. يقترح المؤلفون أن معاملات فك التشفير الفائقة قد تساعد في كبح هذا السلوك.
- تنوع مجموعة الاختبار: تتكون VJRODa من صور PDF حكومية نظيفة نسبيًا، لذا لا يمكنها قياس قيمة تعزيز الضوضاء في خط الأنابيب بشكل كامل.
- تصفية المحتوى غير اللائق: لا يتضمن خط الأنابيب الإنشائي تصفية المحتوى غير اللائق. يلاحظ المؤلفون أنه يمكن إدخال ذلك أثناء تحضير النص، توليد المطالبات، توليد الصور، أو تسمية الصور، ويجب تصفية كل من النصوص والصور في كل مرحلة.
لماذا يهم هذا الأمر لفرق ذكاء المستندات الاصطناعي
تقدم الورقة عدة دروس قائمة على الأدلة للفرق التي تعمل على التعرف الضوئي على الحروف (OCR) للمستندات اليابانية.
1. التحكم البرمجي في التخطيط يحافظ على النص المقصود
يقوم Synth-JDoc بتصيير النص المُجهَّز مباشرةً عبر HTML وCSS. وهذا يتجنب أخطاء التسميات المشتقة من OCR ويمنح المؤلفين تحكماً صريحاً في اتجاه الكتابة، والأعمدة، والعناوين، والخطوط، ووضع الأشكال، وأنماط التسميات التوضيحية.
لا تثبت مقارنة Nano Banana Pro أن جميع طرق تحويل النص إلى صورة غير مناسبة لتوليد بيانات OCR. بل تُظهر أنه، في هذه التجربة، واجه خط الأساس عالي الأداء لتحويل النص إلى صورة صعوبة في التعامل مع الأحرف الدقيقة والتخطيطات متعددة الأعمدة المكتوبة عمودياً.
2. غيّرت الصور والتسميات التوضيحية نتيجة التدريب
وجدت دراسة الإزالة (ablation study) أن إخفاء الصور المضمنة أو التسميات التوضيحية قلل من الأداء لكل من Qwen3-VL-8B وInternVL3.5-VL-8B. في هذا مجموعة البيانات، حسّنت هذه العناصر النتائج مقارنةً بالنسخة المخفية المقابلة.
3. يتفاعل تصميم مجموعة البيانات مع بنية النموذج
نتيجة Gemma 3 في الورقة هي تحذير مفيد. يفترض المؤلفون أن تغيير حجم الصورة الثابت بنسبة 1:1 جعل من الصعب على هذا النموذج الاستفادة من دقة المستندات المتنوعة في Synth-JDoc، بينما تحسّنت النماذج ذات الدقة الديناميكية الأصلية أو البلاط الديناميكي بشكل كبير.
من خلال إصدار الكود والبيانات، يوفر ساساغاوا، وكوريتا، وكawahara مورداً عاماً لتدريب ودراسة التعرف الضوئي على الحروف على صور المستندات اليابانية المكتوبة عمودياً.
التحكم الدقيق في التخطيط عبر HTML وCSS
من الجدير بالذكر أن التحديات الخاصة باللغة العربية، مثل طبيعتها الخطية المتصلة واتجاه الكتابة من اليمين إلى اليسار مع أشكال الحروف السياقية والروابط الاختيارية، تجعل مهمة التعرف الضوئي على الحروف أكثر تعقيداً، مما يبرز أهمية الأساليب الموضحة هنا للتحكم الدقيق في توليد البيانات.