Skip to content
← Blog

توقف عن إدخال عشرة صفحات إلى نماذج اللغة البصرية الكبيرة: نظرة داخل الاسترجاع التكيفي الخالي من التدريب في ViSAR

Based on: ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering — Adrien Mialland, Marc Plantevit, Julien Gallois, Céline Robardet

استفسر من نموذج لغوي بصري لتحديد موقع المعلومات في مستند طويل، وقد تقوم بنى استرجاع المستندات القياسية بشيء مضيّع بشكل ملحوظ. فهي تقيّم لقطة شاشة كل صفحة بشكل مستقل باستخدام مشفر بصري، وترتب القائمة، ثم تسلّم عددًا ثابتًا من الصفحات (مثل أفضل خمس أو عشر صفحات) إلى نموذج لغوي بصري كبير (LVLM) ثقيل.

إذا كانت الاستعلام بسيطًا، فقد تكون الأدلة موجودة على صفحة واحدة بينما تضيف الصفحات المسترجعة المتبقية سياقًا بصريًا غير ذي صلة. لا يزال النموذج يعالج الجداول والترويسات والتخطيطات التي قد لا تساعد في الإجابة على السؤال. وعلى العكس من ذلك، يمكن أن يؤدي الميزانية الصارمة إلى إغفال الأدلة عندما تتطلب الإجابة على سؤال معلومات من عدة صفحات.

ينبع هذا المعضلة من خيار تصميم أساسي في استرجاع المستندات البصرية الحديثة: اختيار أفضل $k$ عنصر بشكل ثابت. تقوم الأساليب الموجودة بشكل شائع باسترجاع نفس عدد الصفحات بغض النظر عن تعقيد الاستعلام، على الرغم من أن تحديد عدد الصفحات التي يحتاجها سؤال معين له تأثير مباشر على زمن الاستجابة وجودة الإجابة.

تقدم ورقة بحثية نُشرت في 2 سبتمبر 2026، من تأليف أدريان ميالاند، مارك بلانتفيت، جوليان غالوا، وسيلين روباردت (من جامعات ومعاهد INSA Lyon، CNRS، LIRIS، EPITA، وLowit) بديلاً أنيقًا: ViSAR (استرجاع التنشيط الدلالي البصري). يحدد ViSAR ديناميكيًا عدد الصفحات المراد استرجاعها وقت الاستدلال دون تدريب المشفر البصري. من خلال تحليل التفاعلات الموجودة بالفعل داخل مساحات التضمين للتفاعل المتأخر، قلل ViSAR زمن الاستجابة الكلي للإجابة على الأسئلة بنسبة تصل إلى 58.7% في التجارب المبلغ عنها مع الحفاظ على دقة الإجابة أو تحسينها.

تقرير تدقيق مالي ممسوح ضوئيًا

النقطة العمياء داخل مشفرات التفاعل المتأخر

لفهم كيفية عمل ViSAR، ابدأ أولاً بفهم كيفية عمل محركات الاسترجاع البصري للمستندات.

يتطلب الاسترجاع التقليدي القائم على النص استخدام التعرف الضوئي على الحروف (OCR) لتحويل البكسلات إلى سلاسل نصية قبل تضمينها. قد يفوت هذا العملية المحتوى البصري وتخطيط المستند المحدد. بدلاً من ذلك، تمثل محركات الاسترجاع البصرية الحديثة الخالية من OCR، بما في ذلك ColPali وColQwen2.5، لقطة شاشة للصفحة كمجموعة من التضمينات البصرية للبقع في فضاء مشترك. يتم تمثيل استعلام المستخدم بشكل مماثل بعدة تضمينات.

يتم حساب الصلة باستخدام التفاعل المتأخر، المدعوم بمؤثر MaxSim الذي قدمته ColBERT:

$$S_{Q, P^p} = \sum_{i=1}^m \max_{j \in {1, \dots, n_p}} \langle q_i, v_j^p \rangle$$

بالنسبة لكل تضمين استعلام $q_i$، يبحث المسترجع عبر تضمينات البقع البصرية $v_j^p$ على الصفحة $p$، ويأخذ أعلى تشابه، ويجمع تلك المحاذاة القصوى.

يمكن للتفاعل المتأخر تمكين مطابقة دقيقة بين الاستعلام والصفحة وتضمين الصفحات خارج الخط. ومع ذلك، لديه قيود هيكلية اثنتان:

  1. تقييم الصفحات بشكل مستقل: ينتج المسترجع درجات صلة للصفحات بشكل مستقل، دون استغلال البنية الدلالية عبر الصفحات.
  2. الوزن الدلالي الموحد: تساهم كل تضمينات الاستعلام والصفحة بشكل موحد في درجة التفاعل المتأخر القياسية.

عالج استرجاع النصوص أسئلة الوزن ذات الصلة باستخدام إحصاءات تكرار الرموز، أو تقديرات الأهمية المتعلمة، أو التمثيلات المتناثرة. لكن هذه الأساليب تعتمد على هياكل الرموز المنفصلة أو تدريب إضافي ولا تمتد مباشرة إلى التضمينات البصرية.

وبالتالي، ينتج التفاعل المتأخر قائمة مرتبة من الدرجات القياسية. اعتمدت أساليب $k$ التكيفي السابقة على خوارزميات الدرجات، مثل تحديد أكبر فجوة بين الدرجات المتتالية أو تجميع توزيعات الدرجات. يستخدم ViAR بدلاً من ذلك البنية الدلالية المشفرة في تمثيلات التفاعل المتأخر.

كيف يعمل ViSAR: فك تشفير التنشيطات الدلالية

لا يقوم ViSAR بتعديل أوزان المشفر الأساسي. بدلاً من ذلك، يحافظ على تفاعلات المتجهات المتعددة التي كانت ستُدمج في درجة قياسية (scalar score) بواسطة التفاعل المتأخر القياسي.

تتكون البنية من أربع مراحل متسلسلة: حساب أوزان الاستعلام إلى الصفحة، واستخلاص أهمية مستوى الباتش (patch)، وبناء مصفوفة تشابه الصفحات المشروطة بالاستعلام، وتقليل دالة تكلفة التقسيم التكيفي.

تمديدات الاستعلام والصفحة
         │
         ▼
[1. الاستعلام إلى الصفحة] ──► يزن دلالات الاستعلام والتنشيطات المشتركة للصفحة
         │
         ▼
[2. الصفحة إلى الاستعلام] ──► يعكس MaxSim ويستنتج أوزان مستوى الباتش
         │
         ▼
[3. الصفحة إلى الصفحة]  ──► يطابق الباتشات البصرية الموزونة عبر الصفحات (مصفوفة N x N)
         │
         ▼
[4. التكيفي-k]    ──► يقيّم التماسك والتسرب لاختيار k* الأمثل

1. ترجيح تفاعل الاستعلام إلى الصفحة

يدمج التفاعل المتأخر القياسي التفاعل بين متجه الاستعلام $q_i$ والصفحة $p$ في مجموع فوري. يحتفظ ViSAR بمصفوفة التنشيط الكاملة:

$$A_{p,i} = \max_{j} \langle q_i, v_j^p \rangle$$

يمثل هذا القيمة مدى قوة ظهور الدلالة $i$ للاستعلام في أي مكان على الصفحة $p$. يقوم ViSAR بتطبيع هذا التنشيط بالنسبة لمتوسطه عبر صفحات المستند ($\hat{A}_{p,i}$) وضربه في انحرافه المعياري المعياري بين الصفحات:

$$\tilde{A}{p,i} = \hat{A}{p,i} \cdot \hat{\sigma}_i$$

يتم تخفيض وزن تمديد الاستعلام الذي يحتوي على تنشيطات متشابهة عبر الصفحات، بينما يحصل ذلك الذي يحتوي على تنشيطات أقوى وموضعية مكانيًا على مزيد من التأكيد.

من هذه التنشيطات المعدلة، يحسب ViSAR وزنين:

  • وزن تمديد الاستعلام ($w_i$): مُصاغ كـ $w_i = \log(N / (1 + a_i))$، حيث $a_i = \sum_p \tilde{A}_{p,i}$. يعاقب هذا المحتوى الدلالي الشائع ويؤكد على التنشيطات المتناثرة.
  • وزن الصفحة ($w_p$): يقيس التنشيط الدلالي المشترك. تحصل الصفحات التي تتفاعل فيها الدلالات التمييزية للاستعلام معًا على أهمية أكبر.

2. ترجيح تفاعل الصفحة إلى الاستعلام

بعد ذلك، يعكس ViSAR اتجاه البحث. بدلاً من السؤال فقط عن مدى توافق الصفحة مع الاستعلام، فإنه يقيّم مدى صلة كل باتش بصري على الصفحة بالاستعلام.

بالنسبة لكل باتش بصري $v_j^p$، يحسب ViSAR درجة relevancy الخاصة به $r_j^p$ بأخذ أقصى محاذاة عبر متجهات الاستعلام، معدلة بأوزان الرمز والصفحة المحسوبة في الخطوة الأولى:

$$r_j^p = \max_i \left[ \langle v_j^p, q_i \rangle \cdot \tilde{A}_{p,i} \cdot \hat{w}_i \cdot \hat{w}_p \right]^2$$

ثم يركز ويعتبر العتبة (thresholds) للصلة:

$$w_j^p = \max(0, r_j^p - \text{mean}_{p,j}(r_j^p))$$

ينتج هذا التعطيل باتشات غير نشطة بوزن صفر. يمكن أن تصبح بعض الصفحات غير نشطة تمامًا، ولا تحتاج هذه الصفحات إلى المساهمة في حساب تشابه الصفحة إلى الصفحة.

3. مصفوفة تفاعل الصفحة إلى الصفحة

مع وجود باتشات موزونة، يقيس ViSAR العلاقات عبر الصفحات. بالنسبة لصفحة مصدر $P^p$ وصفحة هدف $P^{p'}$، يحسب مدى توافق الباتشات الموزونة على الصفحة $p$ مع الباتشات الموزونة على الصفحة $p'$:

$$S_j^{p \to p'} = \hat{w}j^p \cdot \max{j'} \left[ \langle v_j^p, v_{j'}^{p'} \rangle \cdot \hat{w}_{j'}^{p'} \right]$$

يقوم ViSAR بمتوسط أفضل $T=50$ تفاعل باتش ويأخذ الجذر التربيعي، مما ينتج درجة تشابه اتجاهية:

$$\text{Sim}(p, p') = \sqrt{\frac{1}{T} \sum_{j \in \mathcal{T}} S_j^{p \to p'}}$$

نظرًا لأن باتشات المصدر تبحث عن نظيراتها الأفضل بشكل مستقل في صفحة الهدف، فإن هذا التشابه هو اتجاهي: $\text{Sim}(p, p') \neq \text{Sim}(p', p)$. يخلق تجميع هذه الدرجات الزوجية مصفوفة تشابه على مستوى الصفحة بحجم $N \times N$ مشروطة باستعلام المستخدم.

4. التكيفي-k عبر التماسك والتسرب

للتحديد أين يتم قطع الاسترجاع، يصنف ViSAR الصفحات باستخدام درجة التشابه الذاتي الخاصة بها $s_p = \text{Sim}(p, p)$.

بالنسبة لكل حد تقديري مرشح $k$، يتم تقسيم المستند إلى مجموعتين: مجموعة المرشحين ذات الصلة $R_k$ التي تحتوي على أفضل $k$ صفحة، والمجموعة غير ذات الصلة $I_k$ التي تحتوي على الصفحات المتبقية.

بالنسبة لكل صفحة $p \in R_k$، يقيّم ViSAR قوتين متعارضتين:

  • التماسك الداخلي ($c_k^p$): متوسط التشابه بين الصفحة $p$ والصفحات في مجموعة المرشحين المسترجعة $R_k$.
  • التسرب الخارجي ($l_k^p$): متوسط التشابه بين الصفحة $p$ والصفحات المرفوضة في $I_k$.

يتم تقييم الجودة الإجمالية لحجم مجموعة المرشحين $k$ باستخدام دالة التكلفة $J(k)$:

$$J(k) = \sum_{p \in R_k} w_p^s \left( c_k^p - \gamma l_k^p \right)$$

هنا، $\gamma$ هو معلمة عقوبة التسرب، مضبوطة على $10^5$ في التجارب المبلغ عنها. يتطلب العثور على عدد الصفحات الأمثل $k^\star$ تقييم ما لا يزيد عن $N$ من مجموعات المرشحين بدلاً من التقييم الشامل لـ $2^N$ من المجموعات الفرعية الممكنة. كما تقيّم الطريقة ما إذا كان الحد الأدنى يتوافق مع انتقال حاد في دالة التكلفة.

ما تكشفه البيانات: مجموعات أكثر رشاقة واستدلال أسرع

قام المؤلفون بتقييم ViSAR على وحدة معالجة رسومات NVIDIA A6000 بسعة ذاكرة 48 جيجابايت عبر معيارين مرجعيين لصفحات متعددة: MMLongBench و LongDocURL. توفر كلا المجموعتين صفحات للإجابة والأدلة لتقييم ترتيب الصفحات، بالإضافة إلى سيناريوهات الإجابة على الأسئلة المستندة إلى المستندات التي تتطلب استدلالاً نصياً وبصرياً.

اختبروا ثلاثة مشفرين للتفاعل المتأخر البصري—ColQwen2.5 و ColPali و ColModernVBERT—إلى جانب مسترجع نصي يستخدم Tesseract OCR (ColBERTv2) ومسترجع بصري متجه واحد (VisRAG-Ret). استخدمت توليد الإجابات نموذج Qwen2.5-VL-7B-Instruct، بينما عمل Qwen2.5-14B-Instruct كقاضي (LLM-as-a-judge) باستخدام مخرجات هيكلية قليلة الأمثلة.

عبر المعيارين المرجعيين، تتطلب الأدلة الحقيقية في المتوسط 1.9 صفحة: الوسيط هو صفحة واحدة في MMLongBench وصفحتين في LongDocURL.

1. كفاءة الاسترجاع وضغط السياق

يوضح الجدول 1 كيفية أداء طرق الاسترجاع التكيفية مقارنةً بـ Oracle، والذي يُعرف بأنه أصناف نافذة أعلى-$k$ في الترتيب القياسي للتفاعل المتأخر الذي يحتوي على كل صفحة دليل:

المشفر الطريقة MMLongBench Mean $k^\star$ MMLongBench Median LongDocURL Mean $k^\star$ LongDocURL Median
ColQwen2.5 Oracle (Late-Int.) 8.3 2 10.7 3
Score-Cluster 18.6 8 36.6 20
Largest-Gap 15.4 2 28.7 3
ViSAR (Ours) 4.7 3 7.9 5
ColPali Oracle (Late-Int.) 8.8 2 12.4 3
Score-Cluster 18.7 8 35.8 18
Largest-Gap 16.2 3 24.7 2
ViSAR (Ours) 5.3 3 8.1 6
ColModernVBERT Oracle (Late-Int.) 10.5 2 13.0 3
Score-Cluster 23.0 12 47.4 44
Largest-Gap 20.0 4 39.3 4
ViSAR (Ours) 7.5 4 13.5 11

يُظهر Oracle أن استرجاع جميع صفحات الأدلة قد يتطلب نافذة أكبر بكثير مما قد توحي به عدد صفحات الأدلة وحدها. نظراً لأن الترتيب الأساسي للتفاعل المتأخر قد يضع صفحات غير ذات صلة أمام صفحات الأدلة، فإن تضمين جميع الأدلة قد يتطلب توسيع نافذة الاسترجاع.

بشكل عام، يسترجع Score-Cluster و Largest-Gap صفحات أكثر من ViSAR. في MMLongBench مع ColQwen2.5، يسترجع ViSAR متوسط 4.7 صفحة. لديه استرجاع (recall) أقل من Largest-Gap (75.16% مقابل 81.12%) ولكن دقة (precision) أعلى (50.37% مقابل 45.13%)، مما يفضل مجموعة مسترجعة أكثر إحكاماً.

2. دقة الإجابة على الأسئلة النهائية

تُظهر النتائج المبلغ عنها أن الاسترجاع التكيفي يمكن أن يحسن دقة الإجابات مع استخدام ميزانية مدخلات لا تتجاوز خمس أو عشر صفحات.

طريقة الاسترجاع MMLongBench Max-5 MMLongBench Max-10 LongDocURL Max-5 LongDocURL Max-10
قواعد أساسية ثابتة Top-$k$
ColBERTv2 (OCR + Text) 24.51% 24.70% 47.18% 47.70%
M3DocRAG (ColPali) 34.86% 35.08% 59.31% 58.71%
VisRAG-Ret (Single-Vector) 34.48% 35.69% 57.29% 58.02%
ColQwen2.5 (Fixed Top-$k$) 35.04% 35.69% 59.79% 59.27%
استرجاع تكيفي (ColQwen2.5)
Largest-Gap 35.79% 35.88% 61.01% 60.89%
Score-Cluster 36.25% 35.97% 60.00% 59.83%
ViSAR (Ours) 36.53% 36.63% 61.06% 60.97%

عبر 60 تكويناً يجمع بين ثلاثة مشفرين، وخمسة نماذج لغوية بصرية كبيرة (LVLMs)، وميزانيتين لعدد الصفحات، ومجموعتي بيانات، حسّن ViSAR الدقة في 24 حالة وحافظ على الدقة في الـ 36 المتبقية. لا يبلغ البحث عن أي انخفاضات ذات دلالة إحصائية. مع ColQwen2.5 و ColPali، تميل النتائج بشكل عام إلى الارتفاع، مع تحسنات ذات دلالة إحصائية في LongDocURL وفقاً لاختبار McNemar ($p < 0.05$).

ظهرت أكبر التحسنات مع نماذج LVLM التي يصفها المؤلفون بأنها أكثر حساسية للسياقات الأطول، وهو ما يتوافق مع قدرة ViSAR على تقليل كل من الصفحات المسترجعة والصفحات غير ذات الصلة.

3. عائد زمن الاستجابة

عنق الزجاجة العملي في خط الأنابيب المستند إلى المستندات البصرية المُقيَّم هو وقت توليد LVLM. يستكمل الاسترجاع الثابت Top-$k$ دائماً ميزانية مدخلات LVLM، بينما يضبط ViSAR عدد الصفحات ويستخدم الميزانية الكاملة فقط عند الحاجة.

يُقدم ViSAR عبئاً إضافياً في الاسترجاع ناتجاً عن ترجيح البقع (patch weighting) وحسابات التشابه عبر الصفحات. لكن البحث يجد أن هذا العبء الإضافي يساهم فقط بشكل هامشي في التكلفة الإجمالية لمعظم أحجام المستندات المُقيَّمة، بينما يهيمن انخفاض زمن التوليد على النتيجة النهائية من البداية إلى النهاية.

زمن الاستجابة في MMLongBench بميزانية Max-10:
ثابت top-10: [استرجاع][================ توليد ================]
ViSAR:        [خطوة استرجاع أكبر][====== توليد مُقلَّل ======]
                                      تقليل من البداية إلى النهاية: يصل إلى 58.7%

يصل تقليل زمن الاستجابة المبلغ عنه من البداية إلى النهاية إلى 58.7% في MMLongBench و 38.5% في LongDocURL بميزانية LVLM Max-10. ينمو عبء الاسترجاع في ViSAR مع حجم المستند ويصبح ملحوظاً لأطول مستند في MMLongBench، والذي يحتوي على 468 صفحة. تقترح المواد التكميلية تقريبات لمصفوفة التشابه لمثل هذه الحالات.

annotated medical case file

هندسة المصفوفات: عندما تشير التفرق إلى الإجابات الصحيحة

يتمثل أحد أهم الملاحظات المقنعة في الورقة البحثية في هيكلية مصفوفة تشابه الصفحات المشروطة بالاستعلام $\text{Sim}(p, p')$.

يوضح المؤلفان حالتين متباينتين:

  • المصفوفات المتفرقة (Sparse matrices): عندما تكون الدلالات ذات الصلة بالاستعلام مركزة، فإن عدد الصفحات التي تشارك المحتوى ذي الصلة يكون محدوداً نسبياً. تكون المصفوفة متفرقة وتتميز دالة التكلفة $J(k)$ بأدنى حد أكثر حدة، مما يدعم حد استرجاع أكثر موثوقية.
  • المصفوفات الكثيفة (Dense matrices): عندما تكون الدلالات ذات الصلة بالاستعلام موزعة عبر عدد أكبر من الصفحات، تصبح المصفوفة أكثر كثافة. يكون الأدنى المقابل في $J(k)$ أكثر سطوحاً، مما يجعل قرار التوقف أقل موثوقية.

عبر المشفرات المختبرة على MMLongBench، ومع وجود اتجاه مشابه تم الإبلاغ عنه لـ LongDocURL، يرتبط ارتفاع تفرق مصفوفة التشابه بدقة أعلى في الإجابات.

هذا اتجاه بحثي مفيد وليس نظام ثقة مكتمل. يقترح المؤلفون أن هيكلية المصفوفة يمكن أن تصبح إشارة تغذية راجعة خالية من التسميات لاستراتيجيات الاسترجاع المستقبلية، بما في ذلك تحسين الاستعلام التكراري أو اختيار الأدلة، دون الحاجة إلى نموذج إضافي أو تدريب.

تحذيرات هندسية: حدود التقليم بدون تدريب

يُعد ViSAR مساهمة خوارزمية تأتي مع عدة قيود عملية يستحق أخذها بعين الاعتبار:

  • تزداد الحسابات بين الصفحات مع حجم المستند: يبني ViSAR مصفوفة تشابه على مستوى الصفحات ويقيّم التفاعلات بين الصفحات بشكل كتلي بدلاً من كونها موترًا كثيفًا. تتجنب تحسيناته للصفحات غير النشطة الحسابات غير الضرورية، لكن الورقة البحثية تشير إلى زيادة عبء الاسترجاع مع تكبر حجم المستندات. يكون هذا العبء أكثر وضوحًا في مثال MMLongBench المكون من 468 صفحة.
  • جودة المشفر تحدد الحد الأقصى: يعتمد ViSAR على الهيكل الدلالي الذي تعلمه المشفر مسبقًا. أظهر ColQwen2.5 وColPali نتائج أقوى من ColModernVBERT. تعزى المكاسب المتواضعة نسبيًا لـ ColModernVBERT جزئيًا إلى حجمه الأصغر—250 مليون معلمة مقابل 3 مليارات—والصعوبة الناتجة عن فصل الدلالات إلى مجموعات استرجاع مدمجة.
  • تم ملاحظة عدم استقرار في الترميز: عانى ColModernVBERT من عدم استقرار عددي أثناء الترميز بنسبة 7.31% من استعلامات LongDocURL. أفاد المؤلفون بأن هذه المشكلة حدثت بشكل مستقل عن ViSAR، وتم استبعاد هذه العينات من التقييم.
  • يفضل ViSار الاسترجاع المدمج: مع زيادة حد Oracle، يسترجع ViSار عددًا أقل من الصفحات في المتوسط، مما يحد من السياق غير ذي الصلة ولكنه أيضًا يتنازل عن الاستدعاء (recall) مقابل الدقة (precision) في بعض الإعدادات. يحقق Largest-Gap أفضل درجة F1 مجمعة على LongDocURL، بينما يوفر ViSار سلوكًا تكيفيًا أكثر اتساقًا عبر قيم مختلفة لـ $k_{\text{Oracle}}$.

لماذا يهم ذلك في خطوط معالجة المستندات

بالنسبة للفرق التي تدرس الإجابة على الأسئلة المستندة إلى المستندات، يقدم ViSAR بديلاً عن التعامل مع عمق الاسترجاع كقيمة ثابتة دائمة.

تكمن فكرته المركزية في أن مسترجعات الصور متعددة المتجهات تحتوي على معلومات أكثر مما تكشفه درجة التفاعل المتأخر النهائي (late-interaction score). يستخدم ViSAR التنشيطات من الاستعلام إلى الصفحة، والأوزان على مستوى الباتش (patch-level)، والبنية الدلالية بين الصفحات لاختيار مجموعة استرجاع مخصصة للاستعلام.

تشير النتائج المبلغ عنها في الورقة إلى ثلاث آثار ملموسة:

  1. مجموعات صفحات أكثر إحكاماً: يسترجع ViSار عدداً أقل من الصفحات في المتوسط مقارنة بطرق Oracle وLargest-Gap وScore-Cluster في المقارنات المبلغ عنها.
  2. زمن استجابة كلي أقل: عند ميزانية Max-10، يقلل زمن استجابة RAG الكلي بنسبة تصل إلى 58.7% على MMLongBench و38.5% على LongDocURL.
  3. إشارة لأبحاث جودة الاسترجاع المستقبلية: تشير العلاقة بين ندرة مصفوفة التشابه ودقة الإجابة إلى إشارة تغذية راجعة محتملة لطرق الاسترجاع واختيار الأدلة اللاحقة.

إذا كانت مجموعة أدوات المستندات المرئية تستخدم بالفعل مشفر تفاعل متأخر مثل ColPali أو ColQwen2.5، فإن ViSAR يوفر طريقة بدون تدريب لاستكشاف استرجاع k التكيفي. تقترح نتائجه أن هندسة التضمين (embedding geometry) يمكن أن تساعد في تحديد متى استرجعت خط معالجة المستندات عدداً كافياً من الصفحات — دون افتراض أن كل استعلام يستحق نفس نافذة السياق الثابتة. ومن الجدير بالذكر أن طبيعة النص العربي، مع كتابته المتصلة واتجاهه من اليمين إلى اليسار وتغير أشكال الحروف حسب السياق، تجعل التعرف الضوئي على الحروف (OCR) أكثر تعقيداً، مما يعزز الحاجة إلى استراتيجيات استرجاع مرئي دقيقة مثل تلك التي يقدمها هذا النموذج.