Skip to content
← Blog

सिंथेटिक लेआउट, बेहतर वर्टिकल जापानी OCR: Synth-JDoc के अंदर

Based on: Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images — Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

जापानी सरकारी दस्तावेज़ों के लिए OCR में गलतियों का विश्लेषण

एक बड़े विज़न लैंग्वेज मॉडल (LVLM) में एक बहु-स्तंभीय जापानी सरकारी दस्तावेज़ डालें, उससे पृष्ठ की ट्रांसक्रिप्शन करने के लिए कहें, और यह एक बहुत ही विशिष्ट तरीके से विफल हो सकता है। Synth-JDoc पेपर के एक उदाहरण में, एक मॉडल सेक्शन “A1” पढ़ता है, अगले ऊर्ध्वाधर स्तंभ में पाठ को छोड़ देता है, और सीधे “Q2” पर कूद जाता है।

जापानी दस्तावेज़ क्षैतिज पाठ (yokogaki) और ऊर्ध्वाधर पाठ (tategaki) को संयोजित कर सकते हैं। ऊर्ध्वाधर जापानी पाठ में, वर्ण ऊपर से नीचे की ओर और पंक्तियाँ दाएँ से बाएँ की ओर चलती हैं। पेपर में उल्लेख किया गया है कि ऊर्ध्वाधर रूप से लिखा गया जापानी पाठ OCR प्रशिक्षण डेटा में कम प्रतिनिधित्व वाला है, और वर्तमान LVLMs इस पर क्षैतिज जापानी पाठ की तुलना में काफी खराब प्रदर्शन करते हैं।

इस अंतर को पाटने के लिए, केइतो ससागावा (Keito Sasagawa), शुहेई कुरिता (Shuhei Kurita), और दैसुके कावाहारा (Daisuke Kawahara) ने Synth-JDoc विकसित किया। उनका पेपर, “Synth-JDoc: Synthesizing a Japanese Document Image Dataset for OCR with Diverse Layouts and Embedded Images”, HTML/CSS रेंडरिंग, एम्बेडेड आकृतियों के लिए टेक्स्ट-टू-इमेज जनरेशन, और इमेज डिग्रेडेशन के चारों ओर बना एक सिंथेटिक-डेटा पाइपलाइन का वर्णन करता है।

अंतिम डेटासेट में 17,970 संपादित दस्तावेज़ छवियाँ शामिल हैं। वास्तविक दुनिया के ऊर्ध्वाधर रूप से लिखे जापानी दस्तावेज़ों पर मूल्यांकन में, Synth-JDoc पर फाइन-ट्यून किए गए मॉडल ने पांच मॉडल परिवारों में से चार के लिए दोनों मूल्यांकन सेटिंग्स के तहत सर्वश्रेष्ठ रिपोर्ट किए गए स्कोर प्राप्त किए। प्रोजेक्ट का कोड GitHub (llm-jp/synth-jdoc) पर ओपन-सोर्स है, और डेटासेट Hugging Face (llm-jp/Synth-JDoc) पर होस्ट किया गया है।

यहाँ ऊर्ध्वाधर जापानी OCR समस्या का एक तकनीकी विश्लेषण, Synth-JDoc अपने सिंथेटिक पृष्ठ कैसे बनाता है, और इसके प्रयोग क्या दिखाते हैं, इसका विवरण दिया गया है।


japanese newspaper print column

LVLMs के लिए ऊर्ध्वाधर जापानी क्यों कठिन है

दस्तावेज़ अंकन (document transcription) के लिए केवल व्यक्तिगत वर्णों को पहचानना पर्याप्त नहीं है। एक मॉडल को पृष्ठ के पठन क्रम का भी पालन करना होता है।

जापानी ऊर्ध्वाधर दस्तावेज़ एक विशेष चुनौती जोड़ते हैं:

  • ऊर्ध्वाधर दिशात्मकता: ऊर्ध्वाधर पंक्ति में वर्णों को ऊपर से नीचे की ओर पढ़ा जाता है, जबकि पंक्तियाँ दाईं से बाईं ओर बढ़ती हैं।
  • बहु-स्तंभ लेआउट: कागज़ में बहु-स्तंभ पठन क्रम को सबसे ऊपर के स्तंभ से सबसे निचले स्तंभ तक क्रमिक रूप से बढ़ते हुए वर्णित किया गया है।
  • मिश्रित लेखन शैलियाँ: जापानी दस्तावेज़ों में एक ही पृष्ठ पर ऊर्ध्वाधर और क्षैतिज दोनों प्रकार का लेखन हो सकता है।

कागज़ का प्रेरणादायक उदाहरण एक वास्तविक दस्तावेज़ पृष्ठ है जहाँ मूल Qwen3-VL मॉडल ने ऊपर से दूसरे स्तंभ को छोड़ दिया था। फाइन-ट्यून्ड मॉडल ने उस पाठ को छोड़ा नहीं। लेखकों का तर्क है कि इस प्रकार के दस्तावेज़ पठन को बेहतर बनाने के लिए ऊर्ध्वाधर पाठ, बहु-स्तंभ लेआउट और सम्मिलित छवियों वाले जापानी OCR डेटासेट की आवश्यकता है।

वास्तविक दस्तावेज़ों से उस डेटासेट को बनाना महंगा है। मैन्युअल एनोटेशन आसानी से स्केल नहीं होता, जबकि OCR सिस्टम के साथ प्रशिक्षण पाठ निकालने से पहचान त्रुटियाँ आती हैं और स्रोत दस्तावेज़ छवियों का संग्रह करना आवश्यक होता है। मौजूदा सिंथेटिक दृष्टिकोणों में भी सीमाएँ हैं: SynthDoG जापानी दस्तावेज़ छवियाँ उत्पन्न कर सकता है लेकिन कम यथार्थवादी लेआउट बनाता है, जबकि JSSODa एक से चार स्तंभों वाले लेआउट में ऊर्ध्वाधर और क्षैतिज पाठ का समर्थन करता है लेकिन सम्मिलित छवियों के बिना सफेद पृष्ठभूमि पर काला पाठ उपयोग करता है।

सिंथ-जेडॉक आर्किटेक्चर: कोड-संचालित संश्लेषण

Synth-JDoc एक तीन-चरणीय पाइपलाइन का उपयोग करता है: दस्तावेज़ तत्व तैयारी, दस्तावेज़ छवि संश्लेषण, और शोर (noise) लागू करना।

+-------------------------------------------------------------------------+
| चरण 1: दस्तावेज़ तत्व तैयारी                                   |
|   - पाठ स्रोत: JSSODa कॉर्पस (JUMAN शब्दकोश संज्ञाएँ -> llm-jp-3.1) |
|   - अनुच्छेद विभाजन और शीर्षक उत्पन्न करना                         |
|   - छवि प्लेसहोल्डर्स से अनुच्छेदों के मिलान के लिए रैखिक असाइनमेंट समस्या |
|   - छवि प्रॉम्प्ट उत्पन्न करना (Qwen3-30B) -> Z-Image-Turbo               |
|   - कैप्शन उत्पन्न करना (Qwen3-VL-30B) 9:1 छोटे-से-लंबे अनुपात पर       |
+-------------------------------------------------------------------------+
                                    |
                                    v
+-------------------------------------------------------------------------+
| चरण 2: HTML/CSS दस्तावेज़ रेंडरिंग                                    |
|   - 8 लेआउट संयोजन: क्षैतिज/ऊर्ध्वाधर x 1, 2, 3, 4 कॉलम     |
|   - 49 जापानी Google Fonts                                            |
|   - 25% शीर्षक उपस्थिति प्रायिकता; एकल-कॉलम या फैलने वाली आकृतियाँ   |
|   - वेब-ब्राउज़र रेंडरिंग                                               |
+-------------------------------------------------------------------------+
                                    |
                                    v
+-------------------------------------------------------------------------+
| चरण 3: शोर पाइपलाइन (17,970 संपादित छवियाँ)                         |
|   - 40% स्वच्छ प्रोग्रामेटिक रेंडर्स                                      |
|   - 30% स्कैन-जैसा शोर                                                  |
|   - 30% Augraphy क्षरण                                            |
+-------------------------------------------------------------------------+

1. दस्तावेज़ तत्व तैयारी

पाइपलाइन JSSODa से पाठ के साथ शुरू होती है। उस डेटासेट का पाठ JUMAN शब्दकोश से संज्ञाओं (nouns) को निकालकर और प्रत्येक संज्ञा से संबंधित वाक्य उत्पन्न करने के लिए llm-jp-3.1-13b-instruct4 को प्रॉम्प्ट करके बनाया गया था। Synth-JDoc प्रत्येक पाठ के लिए शीर्षक उत्पन्न करने के लिए उसी मॉडल का उपयोग करता है।

अगले, पाठ को डबल नई पंक्तियों (\n\n) पर अनुच्छेदों में विभाजित किया जाता है। चित्रित दस्तावेज़ बनाने के लिए, पाइपलाइन छवि प्लेसहोल्डर्स को सम्मिलित करती है:

  • प्रति दस्तावेज़ छवियों की संख्या शून्य से लेकर अनुच्छेदों की संख्या के आधे तक यादृच्छिक रूप से चुनी जाती है।
  • प्लेसहोल्डर्स को अनुच्छेदों से पहले या बाद में यादृच्छिक रूप से सम्मिलित किया जाता है।
  • सिस्टम रैखिक असाइनमेंट समस्या के माध्यम से उनके बीच वर्ग दूरियों के योग को न्यूनतम करके प्लेसहोल्डर्स को अनुच्छेदों के साथ जोड़ता है।

प्रत्येक जोड़े गए प्लेसहोल्डर के लिए, Qwen3-30B-A3B-Instruct-2507 संबंधित अनुच्छेद के आधार पर एक छवि-उत्पादन प्रॉम्प्ट उत्पन्न करता है। Z-Image-Turbo तब छवि उत्पन्न करता है। अंत में, Qwen3-VL-30B-A3B-Instruct एक छवि कैप्शन उत्पन्न करता है। संक्षिप्त कैप्शन और लंबे, बहु-वाक्य कैप्शन का उपयोग 9:1 के अनुपात में किया जाता है।

2. ब्राउज़र-आधारित लेआउट संश्लेषण

पाठ, शीर्षक, छवियों और कैप्शन तैयार होने के बाद, Synth-JDoc HTML/CSS पेज बनाता है और उन्हें एक वेब ब्राउज़र में छवियों के रूप में रेंडर करता है।

  • लेआउट संयोजन: डेटासेट को आठ संयोजनों में समान रूप से वितरित किया गया है: क्षैतिज या ऊर्ध्वाधर लेखन, प्रत्येक में एक से चार कॉलम तक।
  • टाइपोग्राफिक विविधता: फ़ॉन्ट्स को Google Fonts के माध्यम से उपलब्ध 49 जापानी विकल्पों से यादृच्छिक रूप से चुना जाता है।
  • लेआउट विविधता: शीर्षक 25% प्रायिकता के साथ प्रकट होते हैं। दो या अधिक कॉलम वाले लेआउट में, छवियाँ एक कॉलम के भीतर रह सकती हैं या सभी कॉलमों में फैल सकती हैं। आकृति-कैप्शन शैलियाँ, जिसमें “Figure N:” और “Fig. N:” शामिल हैं, भी यादृच्छिक होती हैं।

चूंकि पाठ सीधे संश्लेषित दस्तावेज़ों में रेंडर किया जाता है, इसलिए पाइपलाइन उन OCR पहचान त्रुटियों से बचती है जो मौजूदा दस्तावेज़ छवियों से लेबल निकालने पर उत्पन्न होती हैं।

3. शोर और स्कैनर सिमुलेशन

अंतिम प्रशिक्षण सेट स्वच्छ संश्लेषित छवियों, स्कैन-जैसी छवियों और Augraphy-प्रसंस्कृत छवियों को जोड़ता है।

  • स्वच्छ रेंडर्स (40%): शोर लागू करने से पहले संश्लेषित दस्तावेज़।
  • स्कैन-जैसा शोर (30%): गॉसियन शोर, घूर्णन, परिप्रेक्ष्य रूपांतरण, ऊर्ध्वाधर और क्षैतिज छायाएं, विनेट प्रभाव, और कभी-कभी वैश्विक धुंधलापन।
  • Augraphy प्रसंस्करण (30%): तीन चरणों वाली दस्तावेज़-क्षरण पाइपलाइन:
    • स्याही चरण: InkBleed और InkMottling
    • कागज़ चरण: रंग और बनावट पैटर्न जोड़े गए।
    • पोस्ट चरण: दाग, चिड़चिड़ापन, छायाएं और अनुकरणित मोड़ जैसे अतिरिक्त क्षरण।

संश्लेषण त्रुटियों या संभावित कॉपीराइट चिंताओं वाली छवियों को मैन्युअल रूप से फ़िल्टर करने के बाद, अंतिम Synth-JDoc प्रशिक्षण सेट में 17,970 छवियाँ हैं।


प्रायोगिक परिणाम: VJRODa बेंचमार्क

गवेषकों ने VJRODa पर मॉडलों का मूल्यांकन किया, जो 100 वास्तविक दुनिया के ऊर्ध्वाधर लिखे जापानी दस्तावेज़ छवियों और संबंधित पाठों का एक डेटासेट है। कागज़ में VJRODa को वास्तविक PDF पृष्ठों से निर्मित बताया गया है; इसके सीमाओं वाले खंड में उल्लेख है कि PDFs सरकारी एजेंसियों द्वारा प्रकाशित किए गए थे और अपेक्षाकृत स्वच्छ हैं।

पांच ओपन-सोर्स LVLMs को पूरी तरह से फाइन-ट्यून किया गया, जिसमें सभी मॉड्यूल पैरामीटर अपडेट किए गए:

  • Qwen2.5-VL-7B-Instruct
  • Qwen3-VL-8B-Instruct
  • InternVL3-8B-hf
  • InternVL3.5-VL-8B-hf
  • Gemma 3 12B IT

प्रशिक्षण के लिए बैच साइज़ 32, AdamW ऑप्टिमाइज़र और 2e-05 का लर्निंग रेट उपयोग किया गया। प्रॉम्प्ट ने प्रत्येक मॉडल से छवि में मौजूद सभी पाठ को मानक जापानी पढ़ने के क्रम में आउटपुट करने के लिए कहा। कागज़ ने फाइन-ट्यूनिंग सेटिंग्स में प्रशिक्षण कॉन्फ़िगरेशन और प्रशिक्षण-डेटा की मात्रा को स्थिर रखा।

मूल्यांकन मेट्रिक्स और पुनरावृत्ति जाल

लेखकों ने दो मेट्रिक्स रिपोर्ट किए हैं:

  • Character Error Rate (CER $\downarrow$): मॉडल आउटपुट और ग्राउंड-ट्रूथ टेक्स्ट के बीच एडिट डिस्टेंस, जिसे ग्राउंड-ट्रूथ वर्णों की संख्या से विभाजित कर 100 से गुणा किया गया है। कम होना बेहतर है।
  • SacreBLEU (BLEU $\uparrow$): वर्ण-स्तर टोकनाइज़ेशन के बाद वर्ण-स्तर BLEU। अधिक होना बेहतर है।
  • टेक्स्ट प्रीप्रोसेसिंग: स्कोरिंग से पहले Unicode NFKC सामान्यीकरण और व्हाइटस्पेस हटाना।

परिणाम दो आउटपुट सेटिंग्स के तहत रिपोर्ट किए गए हैं:

  • Raw Output: मॉडल आउटपुट के जैसा-का-तैसा उत्पन्न होने पर गणना किए गए स्कोर।
  • Remove Repetition: अंत में आने वाले पुनरावृत्त स्ट्रिंग्स को हटाने के बाद गणना किए गए स्कोर।

दूसरी सेटिंग इसलिए महत्वपूर्ण है क्योंकि LVLMs एक ही स्ट्रिंग को दोहरा सकते हैं। कागज़ ने पुनरावृत्ति वाले जनरेशन में परिवर्तनों को मुख्य वर्ण-पहचान प्रदर्शन में परिवर्तनों से अलग करने के लिए दोनों सेटिंग्स का उपयोग किया है।

प्रदर्शन विवरण

मॉडल प्रशिक्षण डेटासेट Raw CER ($\downarrow$) Raw BLEU ($\uparrow$) Rep-Removed CER ($\downarrow$) Rep-Removed BLEU ($\uparrow$)
Qwen2.5-VL-7B Zero-Shot Base 154.0 20.1 88.5 22.0
+ JSSODa 65.1 51.5 40.5 61.1
+ Nano Banana Pro 161.0 20.9 135.0 24.4
+ Synth-JDoc (हमारा) 34.5 66.8 32.0 69.5
Qwen3-VL-8B Zero-Shot Base 116.0 32.6 45.6 52.5
+ JSSODa 130.0 29.9 65.5 49.4
+ Nano Banana Pro 177.0 16.1 138.0 17.3
+ Synth-JDoc (हमारा) 43.9 57.4 25.0 70.8
InternVL3-8B Zero-Shot Base 121.0 26.0 66.5 40.8
+ JSSODa 251.0 26.1 73.5 54.9
+ Nano Banana Pro 173.0 15.3 140.0 19.3
+ Synth-JDoc (हमारा) 70.9 47.8 38.9 68.1
InternVL3.5-VL-8B Zero-Shot Base 121.0 29.2 56.1 41.0
+ JSSODa 57.9 62.3 37.2 71.9
+ Nano Banana Pro 173.0 15.6 117.0 18.8
+ Synth-JDoc (हमारा) 36.8 66.7 25.9 78.3
Gemma 3 12B IT Zero-Shot Base 125.0 17.5 67.9 23.3
+ JSSODa 77.6 27.9 67.4 27.2
+ Nano Banana Pro 196.0 8.5 145.0 9.3
+ Synth-JDoc (हमारा) 128.0 18.7 96.3 26.5

Qwen2.5-VL, Qwen3-VL, InternVL3 और InternVL3.5 के लिए, Synth-JDoc फाइन-ट्यूनिंग पंक्ति में Raw Output और Remove Repetition दोनों के तहत सर्वश्रेष्ठ CER और BLEU स्कोर हैं।

  • Qwen3-VL-8B पर, पुनरावृत्ति-हटाए गए CER 45.6 से गिरकर 25.0 हो गया, जबकि BLEU 52.5 से बढ़कर 70.8 हो गया।
  • InternVL3.5-8B पर, पुनरावृत्ति-हटाए गए CER 56.1 से गिरकर 25.9 हो गया, जबकि BLEU 78.3 तक बढ़ा।
  • JSSODa पर फाइन-ट्यूनिंग से कुछ मॉडलों में सुधार हुआ, लेकिन हर सेटिंग में सुधार नहीं हुआ। उदाहरण के लिए, Qwen3-VL का raw CER 116.0 से बढ़कर 130.0 हो गया।

वास्तविक दुनिया की केस स्टडी

कागज़ का गुणात्मक उदाहरण राष्ट्रीय पेंशन सूचनाओं (Nenkin Tokubetsubin) से संबंधित एक दस्तावेज़ का उपयोग करता है।

बेस Qwen3-VL-8B मॉडल ने पहले खंड में “A1” उत्पन्न किया और फिर ऊपर से दूसरे कॉलम में पाठ को छोड़ दिया, जिसके बाद तीसरे कॉलम में “Q2” पर जारी रहा। इसका CER 47.4 था। Synth

दो प्रेरणादायक प्रायोगिक परिणाम

लेख में इस दृष्टिकोण की दो महत्वपूर्ण सीमाओं का भी परीक्षण किया गया है।

1. द नैनो बैनाना प्रो बेसलाइन

सोधकर्ताओं ने Nano Banana Pro (gemini-3-pro-image-preview) का उपयोग करके एक बेसलाइन डेटासेट उत्पन्न किया। प्रॉम्प्ट में Synth-JDoc के लिए उपयोग किए गए समान पाठ, शीर्षक, आकृति कैप्शन, लेखन की दिशा और स्तंभों की संख्या निर्दिष्ट की गई थी। जब कैप्शन मौजूद थे, तो प्रॉम्प्ट में संबंधित आकृतियों के लिए भी अनुरोध किया गया था।

छवियाँ यथार्थवादी लग सकती थीं, जिनमें लकड़ी के डेस्क और पन्नों की मोड़ जैसी विवरण शामिल थे। लेकिन लेख में दस्तावेज़-जनन की कई विफलताओं की रिपोर्ट की गई है:

  • विकृत वर्ण: उत्पन्न जापानी वर्ण विकृत हो सकते हैं।
  • पाठ असंगति: छवि का पाठ प्रॉम्प्ट से भिन्न हो सकता है।
  • ऊर्ध्वाधर लेआउट विफलता: मॉडल ने विश्वसनीय रूप से ऊर्ध्वाधर लिखे गए पाठ वाले बहु-स्तंभीय दस्तावेज़ नहीं बनाए। एक उदाहरण में, एक प्रॉम्प्ट जिसमें ऊर्ध्वाधर लिखे गए दो-स्तंभीय लेआउट का अनुरोध था, उसने दो अलग-अलग ऊर्ध्वाधर लिखे गए पन्ने उत्पन्न किए।

Nano Banana Pro फाइन-ट्यूनिंग सेटिंग ने मूल मॉडलों की तुलना में परिणामों को सामान्यतः खराब किया। लेख में एक अपवाद का उल्लेख किया गया है: Qwen2.5-VL का BLEU थोड़ा सुधरा, हालांकि उसका CER काफी खराब हो गया।

2. द जेम्मा 3 रिज़ॉल्यूशन बाधा

Synth-JDoc ने Gemma 3 में सुधार नहीं किया। लेखकों ने इस परिणाम को Gemma 3 द्वारा इनपुट छवियों को संभालने के तरीके से जोड़ा है।

Qwen2.5-VL और Qwen3-VL नेटिव डायनामिक रिज़ॉल्यूशन (Native Dynamic Resolution) का उपयोग करते हैं, जबकि InternVL3 और InternVL3.5 डायनामिक टाइलिंग स्ट्रैटेजी (Dynamic Tiling Strategy) का उपयोग करते हैं। ये दृष्टिकोण विभिन्न अनुपातों और रिज़ॉल्यूशन वाली छवियों को संसाधित कर सकते हैं। इसके विपरीत, लेख में कहा गया है कि Gemma 3 इनपुट छवियों को एक निश्चित 1:1 रिज़ॉल्यूशन पर रीसाइज़ करता है।

Synth-JDoc में विभिन्न रिज़ॉल्यूशन वाले दस्तावेज़ छवियाँ शामिल हैं। इसलिए, लेखकों ने यह परिकल्पना प्रस्तुत की है कि Gemma 3 की निश्चित रीसाइज़िंग ने इसे डेटासेट से प्रभावी ढंग से सीखने से रोक दिया। वे इसे इस बात के सबूत के रूप में प्रस्तुत करते हैं कि OCR प्रदर्शन डेटासेट डिज़ाइन और मॉडल आर्किटेक्चर दोनों पर निर्भर करता है।


scanned paper document archive

एब्लेशन अध्ययन: छवियाँ और कैप्शन

लेखकों ने एम्बेडेड छवियों और उनके कैप्शन के प्रभाव का भी परीक्षण किया। नॉइज़ लागू करने से पहले, उन्होंने छवियों, कैप्शन, या दोनों को बैकग्राउंड कलर से मास्क किया, फिर उन वेरिएंट्स पर Qwen3-VL-8B और InternVL3.5-VL-8B को ट्रेन किया।

एब्लेशन सेटिंग (Qwen3-VL-8B) रॉ CER ($\downarrow$) रॉ BLEU ($\uparrow$) रिप-रिMOVED CER ($\downarrow$) रिप-रिMOVED BLEU ($\uparrow$)
फुल Synth-JDoc 43.9 57.4 25.0 70.8
मास्क की गई छवियाँ (w/o image) 60.5 48.1 36.8 67.4
मास्क किए गए कैप्शन (w/o caption) 120.0 30.2 51.2 54.5
दोनों मास्क किए गए (w/o image + caption) 55.7 48.9 39.3 64.8
एब्लेशन सेटिंग (InternVL3.5-8B) रॉ CER ($\downarrow$) रॉ BLEU ($\uparrow$) रिप-रिMOVED CER ($\downarrow$) रिप-रिMOVED BLEU ($\uparrow$)
फुल Synth-JDoc 36.8 66.7 25.9 78.3
मास्क की गई छवियाँ (w/o image) 45.5 58.8 38.6 65.2
मास्क किए गए कैप्शन (w/o caption) 54.3 57.9 39.9 72.7
दोनों मास्क किए गए (w/o image + caption) 59.3 57.6 47.1 66.4

छवियों और कैप्शन दोनों को हटाने से Qwen3-VL का रिपीटिशन-रिMOVED CER 25.0 से बढ़कर 39.3 हो गया। InternVL3.5 के लिए, यह 25.9 से बढ़कर 47.1 हो गया।

दोनों मॉडल्स के लिए, फुल Synth-JDoc डेटासेट ने मास्क की गई छवियों या कैप्शन वाले वेरिएंट्स से बेहतर प्रदर्शन किया। लेखक इसे इस तथ्य के लिए जिम्मेदार मानते हैं कि दोनों तत्वों वाले सिंथेटिक पेज अधिक दृश्य रूप से विविध और यथार्थवादी दस्तावेज़ों का प्रतिनिधित्व करते हैं।

सीमाएँ और भविष्य का कार्य

लेख में कई खुली बाधाओं की पहचान की गई है:

  • लेआउट विविधता: Synth-JDoc एक से चार कॉलमों के साथ क्षैतिज और ऊर्ध्वाधर लेआउट को कवर करता है, लेकिन अखबारों जैसे वास्तविक दस्तावेज़ों में पढ़ने के क्रम अधिक जटिल हो सकते हैं।
  • संरचित तत्व: लेखकों ने ग्राफ़ और तालिकाओं को संश्लेषण पाइपलाइन के लिए भविष्य के लक्ष्यों के रूप में पहचाना है।
  • डिकोडर दोहराव: कुछ मामलों में लालची डिकोडिंग (greedy decoding) से दोहरावपूर्ण आउटपुट उत्पन्न हुआ। लेखक सुझाव देते हैं कि डिकोडिंग हाइपरपैरामीटर इस व्यवहार को दबाने में मदद कर सकते हैं।
  • टेस्ट सेट विविधता: VJRODa में अपेक्षाकृत स्वच्छ सरकारी PDF छवियाँ शामिल हैं, इसलिए यह पाइपलाइन के शोर वृद्धि (noise augmentation) के मूल्य को पूरी तरह से माप नहीं सकता।
  • NSFW फ़िल्टरिंग: निर्माण पाइपलाइन में NSFW-सामग्री फ़िल्टरिंग शामिल नहीं है। लेखक नोट करते हैं कि इसे पाठ तैयारी, प्रॉम्प्ट जनरेशन, छवि जनरेशन या छवि कैप्शनिंग के दौरान पेश किया जा सकता है, और कि प्रत्येक चरण पर पाठ और छवियों दोनों को फ़िल्टर किया जाना चाहिए।

डॉक्यूमेंट AI टीमों के लिए इसका महत्व क्यों है

जापानी डॉक्यूमेंट OCR पर काम करने वाली टीमों के लिए, यह पेपर कई सबूत-आधारित सबक प्रस्तुत करता है।

1. प्रोग्रामेटिक लेआउट नियंत्रण इच्छित पाठ को बनाए रखता है

Synth-JDoc HTML और CSS के माध्यम से तैयार पाठ को सीधे रेंडर करता है। इससे OCR-आधारित लेबल त्रुटियों से बचा जाता है और लेखकों को लिखने की दिशा, कॉलम, शीर्षक, फ़ॉन्ट, आकृति स्थान और कैप्शन शैलियों पर स्पष्ट नियंत्रण मिलता है।

Nano Banana Pro तुलना यह स्थापित नहीं करती कि सभी टेक्स्ट-टू-इमेज विधियाँ OCR-डेटा जनरेशन के लिए अनुपयुक्त हैं। यह केवल यह दर्शाता है कि इस प्रयोग में, एक उच्च-प्रदर्शन वाला टेक्स्ट-टू-इमेज बेसलाइन सटीक वर्णों और ऊर्ध्वाधर बहु-कॉलम लेआउट्स के साथ संघर्ष कर रहा था।

2. छवियों और कैप्शनों ने प्रशिक्षण परिणाम को बदल दिया

एब्लेशन अध्ययन (ablation study) ने पाया कि एम्बेडेड छवियों या कैप्शनों को मास्क करने से Qwen3-VL-8B और InternVL3.5-VL-8B दोनों का प्रदर्शन कम हो गया। इस डेटासेट में, इन तत्वों ने संबंधित मास्क किए गए वेरिएंट्स की तुलना में परिणामों में सुधार किया।

3. डेटासेट डिज़ाइन और मॉडल आर्किटेक्चर आपस में इंटरैक्ट करते हैं

पेपर का Gemma 3 परिणाम एक उपयोगी चेतावनी है। लेखक यह मानते हैं कि फिक्स्ड 1:1 इमेज रीसाइजिंग ने उस मॉडल के लिए Synth-JDoc के विविध डॉक्यूमेंट रिज़ॉल्यूशन से लाभ उठाना कठिन बना दिया, जबकि Native Dynamic Resolution या Dynamic Tiling वाले मॉडल्स में काफी सुधार हुआ।

मजबूत अंग्रेजी OCR की उपलब्धता का अर्थ यह नहीं है कि देवनागरी लिपि के लिए भी समान सटीकता प्राप्त होगी, क्योंकि देवनागरी की जटिल संयुक्त अक्षरों और शिरोरेखा संरचनाओं को संभालना तकनीकी रूप से भिन्न चुनौती है। कोड और डेटा जारी करके, Sasagawa, Kurita, और Kawahara ने ऊर्ध्वाधर लिखित जापानी डॉक्यूमेंट इमेज पर OCR के प्रशिक्षण और अध्ययन के लिए एक सार्वजनिक संसाधन प्रदान किया है।