Skip to content
← Blog

Deja de alimentar a los LLMs de visión con diez páginas: Dentro de la recuperación adaptativa sin entrenamiento de ViSAR

Based on: ViSAR: Training-Free Adaptive-$k$ Retrieval for Visual Document Question Answering — Adrien Mialland, Marc Plantevit, Julien Gallois, Céline Robardet

Pida a un modelo de lenguaje visual que localice información en un documento largo, y las arquitecturas estándar de recuperación de documentos pueden hacer algo notablemente ineficiente. Puntúan cada captura de pantalla de página de forma independiente utilizando un codificador visual, ordenan la lista y entregan un fijo top cinco o top diez de páginas a un pesado Modelo de Lenguaje-Visión Grande (LVLM).

Si la consulta es simple, la evidencia puede estar en una sola página mientras que las páginas restantes recuperadas añaden contexto visual irrelevante. El modelo sigue procesando tablas, encabezados y diseños que pueden no ayudar a responder la pregunta. Por el contrario, un presupuesto rígido puede omitir evidencia cuando una pregunta requiere información de varias páginas.

Este dilema surge de una elección de diseño fundamental en la recuperación visual moderna de documentos: selección fija de top-$k$. Los enfoques existentes comúnmente recuperan el mismo número de páginas independientemente de la complejidad de la consulta, aunque determinar cuántas páginas necesita una pregunta particular tiene un efecto directo en la latencia y la calidad de la respuesta.

Un artículo de investigación publicado el 2 de septiembre de 2026 por Adrien Mialland, Marc Plantevit, Julien Gallois y Céline Robardet (INSA Lyon, CNRS, LIRIS, EPITA y Lowit) introduce una alternativa elegante: ViSAR (Visual Semantic Activation Retrieval). ViSAR determina dinámicamente el número de páginas a recuperar en tiempo de inferencia sin entrenar el codificador visual. Al analizar interacciones ya presentes dentro de espacios de incrustación de interacción tardía, ViSAR redujo la latencia de respuesta a preguntas de extremo a extremo hasta en un 58.7% en los experimentos reportados, manteniendo o mejorando la precisión de las respuestas.

informe de auditoría financiera escaneado

El punto ciego en los codificadores de interacción tardía

Para comprender cómo funciona ViSAR, primero observe cómo operan los recuperadores visuales de documentos.

La recuperación basada en texto tradicional requiere el Reconocimiento Óptico de Caracteres (OCR) para convertir píxeles en cadenas de texto antes de incrustarlas. Ese proceso puede pasar por alto el contenido visual y la disposición específica del documento. Los recuperadores visuales modernos sin OCR, incluidos ColPali y ColQwen2.5, representan en su lugar una captura de pantalla de una página como un conjunto de incrustaciones de parches visuales en un espacio compartido. La consulta del usuario se representa de manera similar mediante múltiples incrustaciones.

La relevancia se calcula mediante interacción tardía, impulsada por el operador MaxSim introducido por ColBERT:

$$S_{Q, P^p} = \sum_{i=1}^m \max_{j \in {1, \dots, n_p}} \langle q_i, v_j^p \rangle$$

Para cada incrustación de consulta $q_i$, el recuperador busca entre las incrustaciones de parches visuales $v_j^p$ en la página $p$, toma la similitud más alta y suma esas alineaciones máximas.

La interacción tardía permite una coincidencia detallada entre la consulta y la página, así como la codificación de páginas fuera de línea. Sin embargo, tiene dos limitaciones estructurales:

  1. Evaluación independiente de páginas: El recuperador produce puntuaciones de relevancia para las páginas de forma independiente, sin aprovechar la estructura semántica entre páginas.
  2. Ponderación semántica uniforme: Cada incrustación de consulta y página contribuye de manera uniforme a la puntuación estándar de interacción tardía.

La recuperación de texto ha abordado preguntas relacionadas sobre ponderación utilizando estadísticas de frecuencia de tokens, estimaciones de importancia aprendidas o representaciones dispersas. Pero esos enfoques dependen de estructuras de tokens discretas o de entrenamiento adicional y no se extienden directamente a las incrustaciones visuales.

En consecuencia, la interacción tardía produce una lista clasificada de puntuaciones escalares. Los enfoques anteriores de $k$ adaptativo se han basado en heurísticas de puntuación, como identificar la mayor brecha entre puntuaciones consecutivas o agrupar distribuciones de puntuaciones. ViSAR, en cambio, utiliza la estructura semántica codificada en las representaciones de interacción tardía.

Cómo funciona ViSAR: Decodificando las activaciones semánticas

ViSAR no altera los pesos subyacentes del codificador. En su lugar, preserva las interacciones multivectoriales que una interacción tardía estándar colapsaría en una puntuación escalar.

La arquitectura se desglosa en cuatro etapas secuenciales: calcular los pesos de consulta a página, derivar la importancia a nivel de parche, construir una matriz de similitud de página condicionada por la consulta y minimizar una función de costo de partición adaptativa.

Embeddings de Consulta y Página
         │
         ▼
[1. Consulta a Página] ──► Pondera la semántica de la consulta y las co-activaciones de la página
         │
         ▼
[2. Página a Consulta] ──► Invierte MaxSim y deriva pesos a nivel de parche
         │
         ▼
[3. Página a Página]  ──► Coincide parches visuales ponderados entre páginas (matriz N x N)
         │
         ▼
[4. Adaptativo-k]    ──► Evalúa coherencia y filtración para elegir el k* óptimo

1. Ponderación de la interacción de consulta a página

La interacción tardía estándar colapsa la interacción entre el vector de consulta $q_i$ y la página $p$ en una suma de inmediato. ViSAR conserva la matriz de activación completa:

$$A_{p,i} = \max_{j} \langle q_i, v_j^p \rangle$$

Este valor representa con qué fuerza la semántica de consulta $i$ se manifiesta en cualquier lugar de la página $p$. ViSAR normaliza esta activación por su media a través de las páginas del documento ($\hat{A}_{p,i}$) y la escala por su desviación estándar inter-página normalizada:

$$\tilde{A}{p,i} = \hat{A}{p,i} \cdot \hat{\sigma}_i$$

Un embedding de consulta con activaciones similares en todas las páginas se despondera, mientras que uno con activaciones más fuertes y espacialmente localizadas recibe mayor énfasis.

A partir de estas activaciones moduladas, ViSAR calcula dos pesos:

  • Peso del embedding de consulta ($w_i$): Formulado como $w_i = \log(N / (1 + a_i))$, donde $a_i = \sum_p \tilde{A}_{p,i}$. Esto penaliza el contenido semántico ubicuo y enfatiza las activaciones dispersas.
  • Peso de página ($w_p$): Mide la co-activación semántica. Las páginas donde las semánticas de consulta discriminativas se activan juntas reciben mayor importancia.

2. Ponderación de la interacción de página a consulta

A continuación, ViSAR invierte la dirección de la búsqueda. En lugar de preguntar solo qué tan bien coincide una página con la consulta, evalúa qué tan relevante es cada parche visual de una página para la consulta.

Para cada parche visual $v_j^p$, ViSAR calcula su puntuación de relevancia $r_j^p$ tomando la alineación máxima a través de los vectores de consulta, modulada por los pesos de token y página calculados en el paso uno:

$$r_j^p = \max_i \left[ \langle v_j^p, q_i \rangle \cdot \tilde{A}_{p,i} \cdot \hat{w}_i \cdot \hat{w}_p \right]^2$$

Luego centra y aplica un umbral a la relevancia:

$$w_j^p = \max(0, r_j^p - \text{mean}_{p,j}(r_j^p))$$

Este umbral produce parches inactivos con peso cero. Algunas páginas pueden volverse completamente inactivas, y esas páginas no necesitan contribuir al cálculo de similitud de página a página.

3. Matriz de interacción de página a página

Con los parches ponderados en mano, ViSAR mide las relaciones entre páginas. Para una página de origen $P^p$ y una página de destino $P^{p'}$, calcula qué tan bien coinciden los parches ponderados de la página $p$ con los parches ponderados de la página $p'$:

$$S_j^{p \to p'} = \hat{w}j^p \cdot \max{j'} \left[ \langle v_j^p, v_{j'}^{p'} \rangle \cdot \hat{w}_{j'}^{p'} \right]$$

ViSAR promedia las $T=50$ interacciones de parches principales y toma la raíz cuadrada, obteniendo una puntuación de similitud direccional:

$$\text{Sim}(p, p') = \sqrt{\frac{1}{T} \sum_{j \in \mathcal{T}} S_j^{p \to p'}}$$

Dado que los parches de origen buscan sus contrapartes mejores de forma independiente en la página de destino, esta similitud es direccional: $\text{Sim}(p, p') \neq \text{Sim}(p', p)). Ensamblar estas puntuaciones por pares crea una matriz de similitud a nivel de página de $N \times N$ condicionada por la consulta del usuario.

4. Adaptativo-k mediante coherencia y filtración

Para decidir dónde cortar la recuperación, ViSAR clasifica las páginas utilizando su puntuación de auto-similitud $s_p = \text{Sim}(p, p)$.

Para cada punto de corte candidato $k$, el documento se divide en dos grupos: el conjunto candidato relevante $R_k$ que contiene las $k$ páginas principales, y el conjunto irrelevante $I_k$ que contiene las páginas restantes.

Para cada página $p \in R_k$, ViSAR evalúa dos fuerzas opuestas:

  • Coherencia interna ($c_k^p$): La similitud promedio entre la página $p$ y las páginas en el conjunto candidato recuperado $R_k$.
  • Filtración externa ($l_k^p$): La similitud promedio entre la página $p$ y las páginas descartadas en $I_k$.

La calidad general del tamaño del conjunto candidato $k$ se puntúa utilizando la función de costo $J(k)$:

$$J(k) = \sum_{p \in R_k} w_p^s \left( c_k^p - \gamma l_k^p \right)$$

Aquí, $\gamma$ es un parámetro de penalización de filtración, establecido en $10^5$ en los experimentos reportados. Encontrar el recuento óptimo de páginas $k^\star$ requiere evaluar como máximo $N$ conjuntos candidatos en lugar de evaluar exhaustivamente $2^N$ subconjuntos posibles. El método también evalúa si el mínimo corresponde a una transición abrupta en la función de costo.

Lo que muestran los datos: Conjuntos más ligeros e inferencia más rápida

Los autores evaluaron ViSAR en una GPU NVIDIA A6000 con 48 GB de memoria en dos conjuntos de referencia de múltiples páginas: MMLongBench y LongDocURL. Ambos conjuntos proporcionan páginas de evidencia-respuesta para evaluar el ranking de páginas, así como escenarios de respuesta a preguntas de documentos que requieren razonamiento textual y visual.

Probaron tres codificadores de interacción tardía visual—ColQwen2.5, ColPali y ColModernVBERT—junto con un recuperador de texto que utiliza OCR Tesseract (ColBERTv2) y un recuperador visual de vector único (VisRAG-Ret). La generación de respuestas utilizó Qwen2.5-VL-7B-Instruct, mientras que Qwen2.5-14B-Instruct sirvió como evaluador LLM-as-a-judge utilizando salida estructurada con pocos ejemplos (few-shot).

En ambos conjuntos de referencia, la evidencia de verdad fundamental requiere un promedio de 1.9 páginas: la mediana es una página en MMLongBench y dos páginas en LongDocURL.

1. Eficiencia de recuperación y compactación de contexto

La Tabla 1 muestra cómo se comportan los métodos de recuperación adaptativa en relación con el Oracle, definido como la ventana top-$k$ más pequeña en el ranking estándar de interacción tardía que contiene cada página de evidencia:

Codificador Método Media $k^\star$ MMLongBench Mediana MMLongBench Media $k^\star$ LongDocURL Mediana LongDocURL
ColQwen2.5 Oracle (Inter.-Tardía) 8.3 2 10.7 3
Score-Cluster 18.6 8 36.6 20
Largest-Gap 15.4 2 28.7 3
ViSAR (Nuestro) 4.7 3 7.9 5
ColPali Oracle (Inter.-Tardía) 8.8 2 12.4 3
Score-Cluster 18.7 8 35.8 18
Largest-Gap 16.2 3 24.7 2
ViSAR (Nuestro) 5.3 3 8.1 6
ColModernVBERT Oracle (Inter.-Tardía) 10.5 2 13.0 3
Score-Cluster 23.0 12 47.4 44
Largest-Gap 20.0 4 39.3 4
ViSAR (Nuestro) 7.5 4 13.5 11

El Oracle muestra que recuperar todas las páginas de evidencia puede requerir una ventana mucho más grande de lo que sugeriría solo el número de páginas de evidencia. Debido a que el ranking subyacente de interacción tardía puede colocar páginas irrelevantes antes de las páginas de evidencia, incluir toda la evidencia puede requerir expandir la ventana de recuperación.

Score-Cluster y Largest-Gap generalmente recuperan más páginas que ViSAR. En MMLongBench con ColQwen2.5, ViSAR recupera un promedio de 4.7 páginas. Tiene menor precisión de recuperación (recall) que Largest-Gap (75.16% frente a 81.12%) pero mayor exactitud (precision) (50.37% frente a 45.13%), favoreciendo un conjunto recuperado más compacto.

2. Precisión de respuesta a preguntas aguas abajo

Los resultados reportados muestran que la recuperación adaptativa puede mejorar la precisión de las respuestas mientras utiliza un presupuesto de entrada de como máximo cinco o diez páginas.

Método de Recuperación MMLongBench Máx-5 MMLongBench Máx-10 LongDocURL Máx-5 LongDocURL Máx-10
Líneas base Fijas Top-$k$
ColBERTv2 (OCR + Texto) 24.51% 24.70% 47.18% 47.70%
M3DocRAG (ColPali) 34.86% 35.08% 59.31% 58.71%
VisRAG-Ret (Vector Único) 34.48% 35.69% 57.29% 58.02%
ColQwen2.5 (Top-$k$ Fijo) 35.04% 35.69% 59.79% 59.27%
Recuperación Adaptativa (ColQwen2.5)
Largest-Gap 35.79% 35.88% 61.01% 60.89%
Score-Cluster 36.25% 35.97% 60.00% 59.83%
ViSAR (Nuestro) 36.53% 36.63% 61.06% 60.97%

En 60 configuraciones que combinan tres codificadores, cinco LVLMs, dos presupuestos de páginas y dos conjuntos de datos, ViSAR mejoró la precisión en 24 casos y mantuvo la precisión en los 36 restantes. El artículo no reporta disminuciones estadísticamente significativas. Con ColQwen2.5 y ColPali, los resultados generalmente tienden al alza, con mejoras estadísticamente significativas en LongDocURL según la prueba de McNemar ($p < 0.05$).

Las mayores mejoras aparecieron con LVLMs que los autores describen como más sensibles a contextos más largos, consistente con ViSAR reduciendo tanto las páginas recuperadas como las páginas irrelevantes.

3. El dividendo de latencia

El cuello de botella práctico en la tubería de documentos visuales evaluada es el tiempo de generación del LVLM. La recuperación fija top-$k$ siempre llena el presupuesto de entrada del LVLM, mientras que ViSAR ajusta el número de páginas y utiliza el presupuesto completo solo cuando es necesario.

ViSAR introduce sobrecarga de recuperación debido al ponderado de parches y a los cálculos de similitud entre páginas. Pero el artículo encuentra que esta sobrecarga contribuye solo marginalmente al costo total para la mayoría de los tamaños de documento evaluados, mientras que la reducción de latencia de generación domina el resultado de extremo a extremo.

Latencia MMLongBench con Presupuesto Máx-10:
Top-10 Fijo: [Recuperación][================ Generación ================]
ViSAR:        [Paso de recuperación más grande][====== Generación reducida ======]
                                      Reducción de extremo a extremo: hasta 58.7%

La reducción de latencia de extremo a extremo reportada alcanza el 58.7% en MMLongBench y el 38.5% en LongDocURL con un presupuesto LVLM de Máx-10. La sobrecarga de recuperación de ViSAR crece con el tamaño del documento y se vuelve notable para el documento más grande de MMLongBench, que contiene 468 páginas. El material suplementario propone aproximaciones de matrices de similitud para tales casos.

expediente médico de caso anotado

Geometría de Matrices: Cuando la Esparsidad Señala Respuestas Correctas

Una de las observaciones más convincentes del artículo reside en la estructura de la matriz de similitud de páginas condicionada por la consulta $\text{Sim}(p, p')$.

Los autores ilustran dos casos contrastantes:

  • Matrices dispersas: Cuando la semántica relevante para la consulta está localizada, relativamente pocas páginas comparten el contenido pertinente. La matriz es dispersa y la función de costo $J(k)$ presenta un mínimo más pronunciado, lo que respalda un límite de recuperación más fiable.
  • Matrices densas: Cuando la semántica relevante para la consulta se distribuye en más páginas, la matriz se vuelve más densa. El mínimo correspondiente en $J(k)$ es más superficial, lo que hace que la decisión de parada sea menos fiable.

En los codificadores evaluados en MMLongBench, y con una tendencia similar reportada para LongDocURL, una mayor esparsidad de la matriz de similitud se correlaciona con una mayor precisión en las respuestas.

Esta es una dirección de investigación útil más que un sistema de confianza terminado. Los autores sugieren que la estructura de la matriz podría convertirse en una señal de retroalimentación sin etiquetas para futuras estrategias de recuperación, incluida la refinación iterativa de consultas o la selección de evidencia, sin requerir un modelo adicional ni entrenamiento.

Advertencias de Ingeniería: Los Límites de la Poda Sin Entrenamiento

ViSAR es una contribución algorítmica con varias restricciones prácticas que vale la pena tener en cuenta:

  • El cálculo página a página crece con el tamaño del documento: ViSAR construye una matriz de similitud a nivel de página y evalúa las interacciones entre páginas de forma por bloques en lugar de como un tensor denso. Su optimización de páginas inactivas evita cálculos innecesarios, pero el artículo informa un aumento en la sobrecarga de recuperación a medida que los documentos se vuelven más grandes. La sobrecarga es más notable en su ejemplo de MMLongBench de 468 páginas.
  • La calidad del codificador establece un límite: ViSAR depende de la estructura semántica ya aprendida por el codificador. ColQwen2.5 y ColPali mostraron resultados más sólidos que ColModernVBERT. El artículo atribuye las ganancias más modestas de ColModernVBERT, en parte, a su menor tamaño: 250M de parámetros frente a 3B, y la dificultad resultante para separar la semántica en conjuntos de recuperación compactos.
  • Se observó inestabilidad en la codificación: ColModernVBERT presentó inestabilidad numérica durante la codificación para el 7.31% de las consultas de LongDocURL. Los autores informan que el problema ocurrió independientemente de ViSAR, y esas muestras fueron excluidas de la evaluación.
  • ViSAR favorece la recuperación compacta: A medida que el umbral de Oracle crece, ViSAR recupera menos páginas en promedio, lo que limita el contexto irrelevante pero también intercambia recuperación (recall) por precisión en algunos escenarios. Largest-Gap logra la mejor puntuación F1 agregada en LongDocURL, mientras que ViSAR proporciona un comportamiento adaptativo más consistente a través de diferentes valores de $k_{\text{Oracle}}$.

Por qué importa para las tuberías de documentos

Para los equipos que estudian la respuesta a preguntas sobre documentos, ViSAR ofrece una alternativa a tratar la profundidad de recuperación como una constante permanente.

Su hallazgo central es que los recuperadores visuales multivector contienen más información de la que revela una puntuación escalar final de interacción tardía. ViSAR utiliza activaciones de consulta a página, pesos a nivel de parche y estructura semántica de página a página para elegir un conjunto de recuperación adaptado a la consulta.

Los resultados reportados en el artículo apuntan a tres implicaciones concretas:

  1. Conjuntos de páginas más compactos: ViSAR recupera menos páginas en promedio que los métodos Oracle, Largest-Gap y Score-Cluster en las comparaciones reportadas.
  2. Menor latencia de extremo a extremo: Con un presupuesto de Max-10, reduce la latencia de RAG de extremo a extremo hasta en un 58.7% en MMLongBench y un 38.5% en LongDocURL.
  3. Una señal para futuras investigaciones sobre calidad de recuperación: La relación entre la esparsidad de la matriz de similitud y la precisión de las respuestas sugiere una señal de retroalimentación potencial para métodos posteriores de recuperación y selección de evidencia.

Si una pila de documentos visuales ya utiliza un codificador de interacción tardía como ColPali o ColQwen2.5, ViSAR proporciona una forma sin entrenamiento para investigar la recuperación adaptativa de $k$. Sus resultados sugieren que la geometría de los embeddings puede ayudar a decidir cuándo una tubería de documentos ha recuperado suficientes páginas, sin asumir que cada consulta merece la misma ventana de contexto fija.