Volver al blog
SearchEyes: Unificando Datos, Entorno y Recompensa para Agentes de Búsqueda Multimodal Profunda

SearchEyes: Unificando Datos, Entorno y Recompensa para Agentes de Búsqueda Multimodal Profunda

Training multimodal search agents to perform multi-hop reasoning — the kind of chained visual identification, knowledge lookup, and deductive inference that a human researcher does naturally — has remained an open problem. The core difficulty is not any single component but a structural disconnect: existing pipelines construct training data, search environments, and reward signals independently, with no shared structure binding them. Training data synthesizers discard the graph metadata that produced each question. Search environments depend on external APIs that are irreproducible and non-deterministic. Reward signals operate only at the trajectory level, making them prohibitively sparse for long-horizon multi-hop reasoning. SearchEyes, from a consortium of CUHK, THU, HKU, PKU, NTU, CASIA, ECNU, HIT, and LMU, addresses all three bottlenecks simultaneously by using a typed knowledge graph as the backbone of a simulated search world.

Entrenar agentes de búsqueda multimodal para realizar razonamiento multi-salto — el tipo de identificación visual encadenada, consulta de conocimiento e inferencia deductiva que un investigador humano hace naturalmente — ha permanecido como un problema abierto. La dificultad central no es ningún componente individual sino un desconexión estructural: los pipelines existentes construyen datos de entrenamiento, entornos de búsqueda y señales de recompensa independientemente, sin una estructura compartida que los vincule. Los sintetizadores de datos descartan los metadatos del grafo que produjo cada pregunta. Los entornos de búsqueda dependen de APIs externas irreproducibles y no deterministas. Las señales de recompensa operan solo a nivel de trayectoria, haciéndolas prohibitivamente escasas para el razonamiento multi-salto de horizonte largo. SearchEyes, de un consorcio de CUHK, THU, HKU, PKU, NTU, CASIA, ECNU, HIT y LMU, aborda los tres cuellos de botella simultáneamente usando un grafo de conocimiento tipado como columna vertebral de un mundo de búsqueda simulado.

The Structural Disconnect Problem

El Problema de la Desconexión Estructural

To understand why SearchEyes matters, you need to understand what goes wrong in existing approaches. Consider a pipeline that synthesizes multi-hop questions from a knowledge graph, trains an agent to answer them using a real search engine, and then applies reinforcement learning. The data synthesizer walks a path through the graph — entity A → relation → entity B → relation → entity C — and converts this into a natural-language question. But after synthesis, all intermediate metadata is discarded: the entity IDs, the relation types, the path structure. The training stage receives only question-answer pairs. This means the search environment has no way to know which entities the agent should find at each hop, because that structural information was thrown away.

Para entender por qué SearchEyes importa, necesitas entender qué sale mal en los enfoques existentes. Considera un pipeline que sintetiza preguntas multi-salto a partir de un grafo de conocimiento, entrena un agente para responderlas usando un motor de búsqueda real, y luego aplica aprendizaje por refuerzo. El sintetizador de datos camina un camino a través del grafo — entidad A → relación → entidad B → relación → entidad C — y lo convierte en una pregunta en lenguaje natural. Pero después de la síntesis, todos los metadatos intermedios se descartan: los IDs de entidad, los tipos de relación, la estructura del camino. La etapa de entrenamiento recibe solo pares de pregunta-respuesta. Esto significa que el entorno de búsqueda no tiene forma de saber qué entidades debería encontrar el agente en cada salto, porque esa información estructural fue descartada.

The consequences cascade. Because the environment lacks structural grounding, it must use an external search engine — introducing irreproducibility (results change over time), nondeterminism (the same query returns different results), and high API costs. And because the reward signal can only judge the final answer correct or incorrect, long-horizon trajectories — where the agent must correctly chain four or five retrieval steps — receive an almost uniformly zero reward signal. The probability of getting every step right decreases exponentially with the number of hops.

Las consecuencias se cascadan. Porque el entorno carece de fundamentación estructural, debe usar un motor de búsqueda externo — introduciendo irreproducibilidad (los resultados cambian con el tiempo), no determinismo (la misma consulta retorna diferentes resultados) y altos costos de API. Y porque la señal de recompensa solo puede juzgar la respuesta final como correcta o incorrecta, las trayectorias de horizonte largo — donde el agente debe encadenar correctamente cuatro o cinco pasos de recuperación — reciben una señal de recompensa casi uniformemente cero. La probabilidad de acertar cada paso disminuye exponencialmente con el número de saltos.

SearchEyes: The Unified Search World

SearchEyes: El Mundo de Búsqueda Unificado

SearchEyes’s key insight is that a typed knowledge graph can simultaneously serve as the structural backbone for all three components — data synthesis, environment simulation, and RL training. The graph is constructed from three complementary sources: Wikidata5M provides structured relation triples (head, predicate, tail), Wiki6M (OVEN-Wiki) provides entity-level text descriptions, and Wikipedia images provide visual grounding. After intersection and filtering (hub exclusion, predicate blacklist), the final typed graph contains approximately 1.2 million entities — of which roughly 340,000 are visual entities with quality-filtered images — connected by 5.8 million relation triples over 822 predicates across four semantic domains: Person, Work, Organization, and Geo.

La idea clave de SearchEyes es que un grafo de conocimiento tipado puede servir simultáneamente como la columna vertebral estructural para los tres componentes — síntesis de datos, simulación de entorno y entrenamiento RL. El grafo se construye a partir de tres fuentes complementarias: Wikidata5M proporciona triples de relación estructurados (cabeza, predicado, cola), Wiki6M (OVEN-Wiki) proporciona descripciones de texto a nivel de entidad, e imágenes de Wikipedia proporcionan fundamentación visual. Después de la intersección y filtrado (exclusión de hubs, lista negra de predicados), el grafo tipado final contiene aproximadamente 1.2 millones de entidades — de las cuales unas 340,000 son entidades visuales con imágenes filtradas por calidad — conectadas por 5.8 millones de triples de relación sobre 822 predicados en cuatro dominios semánticos: Persona, Obra, Organización y Geografía.

Since every document in the knowledge base corresponds to exactly one entity via its Wikidata QID, the environment establishes a bijection between documents and entities. This means the search environment can precisely track which entity the agent retrieves at each step — a capability impossible with external search engines. The retrieval engine combines dense embeddings and BM25 sparse search, fused via Reciprocal Rank Fusion. The agent is equipped with five tools: text_search, visual_search (crops a bounding box and finds visually similar entities), lookup (returns the full document for a Wikidata QID), summarize, and python_interpreter.

Dado que cada documento en la base de conocimiento corresponde exactamente a una entidad a través de su QID de Wikidata, el entorno establece una biyección entre documentos y entidades. Esto significa que el entorno de búsqueda puede rastrear con precisión qué entidad recupera el agente en cada paso — una capacidad imposible con motores de búsqueda externos. El motor de recuperación combina embeddings densos y búsqueda sparse BM25, fusionados mediante Reciprocal Rank Fusion. El agente está equipado con cinco herramientas: text_search, visual_search (recorta un cuadro delimitador y encuentra entidades visualmente similares), lookup (retorna el documento completo para un QID de Wikidata), summarize y python_interpreter.

Perception-Knowledge Chain Synthesis

Síntesis de Cadenas de Percepción-Conocimiento

The training data is generated through Perception-Knowledge Chains (PKC), a pipeline that samples constrained multi-hop paths over the visual-knowledge intersection graph. Each path alternates between Perception hops (P-hops), where the agent must identify a visual entity from an image, and Knowledge hops (K-hops), where the agent must perform text-based retrieval. The first hop is always P (the anchor entity is presented only through its image), and strict alternation is enforced with at least two P-hops per path — guaranteeing that every question exercises visual perception multiple times.

Los datos de entrenamiento se generan a través de Cadenas de Percepción-Conocimiento (PKC), un pipeline que muestrea caminos multi-salto restringidos sobre el grafo de intersección visual-conocimiento. Cada camino alterna entre saltos de Percepción (P-hops), donde el agente debe identificar una entidad visual a partir de una imagen, y saltos de Conocimiento (K-hops), donde el agente debe realizar recuperación basada en texto. El primer salto es siempre P (la entidad ancla se presenta solo a través de su imagen), y se enforce la alternancia estricta con al menos dos P-hops por camino — garantizando que cada pregunta ejercite la percepción visual múltiples veces.

Two additional constraints prevent trivial solvability. First, a disambiguation constraint ensures that at least one hop uses a one-to-one-few predicate (where multiple sibling entities exist), creating answer ambiguity that cannot be resolved by following the main chain alone. A constraint edge is attached to the answer entity such that only the correct answer — not any of its siblings — satisfies the constraint. This raises the reasoning graph’s treewidth from 1 to 2, forcing the agent to jointly satisfy both the main-chain traversal and the constraint verification. Second, semantic domain diversity is enforced: consecutive hops must use predicates from different domains, and the path must cover at least 3 of the 4 semantic domains (Person, Work, Org, Geo).

Dos restricciones adicionales previenen la resolución trivial. Primero, una restricción de desambiguación asegura que al menos un salto use un predicado one-to-few (donde existen múltiples entidades hermanas), creando ambigüedad de respuesta que no puede resolverse siguiendo solo la cadena principal. Se adjunta un borde de restricción a la entidad respuesta tal que solo la respuesta correcta — ninguna de sus hermanas — satisface la restricción. Esto eleva el treewidth del grafo de razonamiento de 1 a 2, forzando al agente a satisfacer conjuntamente tanto el recorrido de la cadena principal como la verificación de restricción. Segundo, se enforce la diversidad de dominio semántico: los saltos consecutivos deben usar predicados de diferentes dominios, y el camino debe cubrir al menos 3 de los 4 dominios semánticos (Persona, Obra, Org, Geo).

The information concealment step is critical: the generated question must not contain any entity name or alias from the path. The anchor entity is presented solely through its image, the full predicate sequence is never disclosed (only a single domain-level hint is provided), and the disambiguating entity is referred to only through partial descriptors. This forces the agent to actually perform multi-hop reasoning rather than pattern-matching entity names in the question.

El paso de ocultamiento de información es crítico: la pregunta generada no debe contener ningún nombre o alias de entidad del camino. La entidad ancla se presenta solo a través de su imagen, la secuencia completa de predicados nunca se revela (solo se proporciona una pista a nivel de dominio), y la entidad desambiguadora se referencia solo mediante descriptores parciales. Esto fuerza al agente a realizar razonamiento multi-salto real en lugar de hacer coincidencia de patrones con nombres de entidad en la pregunta.

Hop-Anchored Policy Optimization (HaPO)

Optimización de Política Anclada por Salto (HaPO)

The RL training algorithm, HaPO, is where SearchEyes makes its most technically distinctive contribution. Standard GRPO assigns a uniform trajectory-level advantage to every token in a trajectory — if the final answer is correct, every token gets a positive signal; if wrong, every token gets a negative signal. For multi-hop search agents, this is catastrophically sparse: a trajectory might make four perfect retrieval decisions and one wrong final answer, yet all five decisions receive the same negative gradient. HaPO fixes this by reusing the gold entity IDs retained from PKC synthesis as step-level semantic anchors.

El algoritmo de entrenamiento RL, HaPO, es donde SearchEyes hace su contribución técnicamente más distintiva. GRPO estándar asigna una ventaja uniforme a nivel de trayectoria a cada token en una trayectoria — si la respuesta final es correcta, cada token recibe una señal positiva; si es incorrecta, cada token recibe una señal negativa. Para agentes de búsqueda multi-salto, esto es catastróficamente escaso: una trayectoria podría tomar cuatro decisiones de recuperación perfectas y una respuesta final incorrecta, y sin embargo las cinco decisiones reciben el mismo gradiente negativo. HaPO corrige esto reutilizando los IDs de entidad dorada retenidos de la síntesis PKC como anclas semánticas a nivel de paso.

The mechanism works as follows. For a given question with gold entity sequence (v₁, v₂, …, vₖ₊₁), each trajectory is checked: did it retrieve entity v₂ at some step? Did it retrieve v₃? All trajectories that retrieved the same gold entity vₖ at their first occurrence form a hop anchor group. Within each group with at least two members and non-zero outcome variance, group-relative advantages are computed — trajectories that reached the same intermediate state but diverged in final outcome receive differentiated credit. The hop-anchored advantage is propagated from the anchor step forward to all subsequent tokens. For tokens not covered by any anchor, the standard trajectory-level advantage is used as fallback. A mixing ratio α controls the interpolation (α=0.3 was optimal in experiments).

El mecanismo funciona así. Para una pregunta dada con secuencia de entidad dorada (v₁, v₂, …, vₖ₊₁), se verifica cada trayectoria: ¿recuperó la entidad v₂ en algún paso? ¿Recuperó v₃? Todas las trayectorias que recuperaron la misma entidad dorada vₖ en su primera ocurrencia forman un grupo de ancla de salto. Dentro de cada grupo con al menos dos miembros y varianza de resultado distinta de cero, se computan ventajas relativas al grupo — las trayectorias que alcanzaron el mismo estado intermedio pero divergieron en el resultado final reciben crédito diferenciado. La ventaja anclada por salto se propaga desde el paso de ancla hacia todos los tokens subsecuentes. Para tokens no cubiertos por ninguna ancla, se usa la ventancia estándar a nivel de trayectoria como respaldo. Una proporción de mezcla α controla la interpolación (α=0.3 fue óptimo en experimentos).

HaPO also introduces two practical innovations. Fatal-aware masking detects sequences of consecutive tool errors (3 or more) and zeros out gradients from the degenerate suffix onward, while applying one-sided clamping to the valid prefix (retaining positive signals, avoiding penalizing actions that preceded an exogenous tool failure). The second innovation replaces hard clipping with a smooth sigmoid-based gating function using asymmetric temperatures — stronger damping for negative-advantage updates prevents large policy changes on undesirable actions while allowing confident exploration on positive-advantage paths.

HaPO también introduce dos innovaciones prácticas. El enmascaramiento consciente de fallos detecta secuencias de errores consecutivos de herramientas (3 o más) y pone a cero los gradientes del sufijo degenerado, mientras aplica clampado unidireccional al prefijo válido (reteniendo señales positivas, evitando penalizar acciones que precedieron a un fallo de herramienta exógeno). La segunda innovación reemplaza el clipado duro con una función de puerta suave basada en sigmoide usando temperaturas asimétricas — un amortiguamiento más fuerte para actualizaciones de ventaja negativa previene cambios grandes de política en acciones no deseables mientras permite exploración confiable en rutas de ventaja positiva.

Results: State-of-the-Art Open-Source Multimodal Search

Resultados: Vanguardia en Búsqueda Multimodal de Código Abierto

SearchEyes was evaluated on six multimodal knowledge-intensive benchmarks: SimpleVQA (factual visual QA), VDR (visual deep research), MMSearch (multimodal web search), LiveVQA (real-time visual QA), BrowseComp-VL (hard multimodal browsing comprehension), and FVQA (fact-based visual QA). The results establish clear state-of-the-art performance among open-source multimodal search agents.

SearchEyes fue evaluado en seis benchmarks multimodales intensivos en conocimiento: SimpleVQA (QA visual factual), VDR (investigación visual profunda), MMSearch (búsqueda web multimodal), LiveVQA (QA visual en tiempo real), BrowseComp-VL (comprensión de navegación multimodal difícil) y FVQA (QA visual basado en hechos). Los resultados establecen un rendimiento claro de vanguardia entre agentes de búsqueda multimodal de código abierto.

SearchEyes-27B achieves 68.1% average across all six benchmarks — a 6.2-point improvement over the strongest previous open-source baseline (OpenSearch-VL-30B at 59.8%). On SimpleVQA it scores 80.9%, on VDR 39.4%, on MMSearch 82.4%, on LiveVQA 77.3%, on BrowseComp-VL 49.3%, and on FVQA 79.1%. The model is competitive with proprietary systems like Gemini-3.1-Pro and Kimi-K2.5 on several benchmarks while remaining fully open-source.

SearchEyes-27B logra 68.1% de promedio en los seis benchmarks — una mejora de 6.2 puntos sobre la línea base de código abierto más fuerte anterior (OpenSearch-VL-30B en 59.8%). En SimpleVQA puntúa 80.9%, en VDR 39.4%, en MMSearch 82.4%, en LiveVQA 77.3%, en BrowseComp-VL 49.3% y en FVQA 79.1%. El modelo es competitivo con sistemas propietarios como Gemini-3.1-Pro y Kimi-K2.5 en varios benchmarks mientras permanece completamente de código abierto.

SearchEyes-9B achieves 59.3% average — matching 30B-scale baselines (OpenSearch-VL-30B: 59.8%) with 3.3× fewer parameters. This parameter efficiency demonstrates that the PKC synthesis and HaPO training pipeline unlock significantly better data efficiency than previous approaches. The 9B model outperforms the base Qwen3.5-9B (44.7% → 59.3%, a 14.6-point gain) and MMSearch-R1-7B (40.3%) by wide margins.

SearchEyes-9B logra 59.3% de promedio — igualando líneas base a escala 30B (OpenSearch-VL-30B: 59.8%) con 3.3× menos parámetros. Esta eficiencia en parámetros demuestra que la síntesis PKC y el pipeline de entrenamiento HaPO desbloquean una eficiencia de datos significativamente mejor que enfoques anteriores. El modelo de 9B supera al Qwen3.5-9B base (44.7% → 59.3%, una ganancia de 14.6 puntos) y a MMSearch-R1-7B (40.3%) por amplios márgenes.

Ablation Insights

Perspectivas de Ablación

The ablation studies reveal which components matter most. For PKC data synthesis, removing anti-shortcut filtering causes the largest drop: −7.7 points average, confirming that trivially solvable paths are the primary failure mode. Removing P–K alternation costs −4.2 points — the agent loses the ability to exercise cross-modal reasoning. Removing the disambiguation (treewidth) constraint costs −2.5 points, and removing information concealment costs −2.5 points — entity name leakage in questions allows shortcut answering. Removing the retrieval boost during trajectory synthesis costs −4.7 points, indicating that the privileged generation conditions are essential for producing high-quality SFT data.

Los estudios de ablación revelan qué componentes importan más. Para la síntesis de datos PKC, remover el filtrado anti-atajos causa la mayor caída: −7.7 puntos de promedio, confirmando que los caminos trivialmente resolubles son el modo de fallo principal. Remover la alternancia P–K cuesta −4.2 puntos — el agente pierde la capacidad de ejercitar razonamiento cross-modal. Remover la restricción de desambiguación (treewidth) cuesta −2.5 puntos, y remover el ocultamiento de información cuesta −2.5 puntos — la filtración de nombres de entidad en preguntas permite respuesta por atajo. Remover el impulso de recuperación durante la síntesis de trayectorias cuesta −4.7 puntos, indicando que las condiciones privilegiadas de generación son esenciales para producir datos SFT de alta calidad.

For HaPO, the full algorithm provides +4.0 points over standard GRPO. Removing the hop-anchored advantage reduces the gain to +1.3 — this single component accounts for more than two-thirds of the improvement. The smooth asymmetric gating contributes +1.3, fatal-aware masking contributes +1.9, and observation token masking contributes +1.6. Comparing α=0 (hop-only) at +3.3 versus α=1 (trajectory-only) at +1.2 shows that hop-anchored signals are far more valuable than trajectory-level signals for multi-hop reasoning. The combination of both (α=0.3) yields the best result, suggesting that trajectory-level rewards still provide useful signal for the initial hops before any anchor group forms.

Para HaPO, el algoritmo completo proporciona +4.0 puntos sobre GRPO estándar. Remover la ventancia anclada por salto reduce la ganancia a +1.3 — este componente simple representa más de dos tercios de la mejora. La puerta suave asimétrica contribuye +1.3, el enmascaramiento consciente de fallos contribuye +1.9, y el enmascaramiento de tokens de observación contribuye +1.6. Comparar α=0 (solo salto) en +3.3 versus α=1 (solo trayectoria) en +1.2 muestra que las señales ancladas por salto son mucho más valiosas que las señales a nivel de trayectoria para el razonamiento multi-salto. La combinación de ambas (α=0.3) produce el mejor resultado, sugiriendo que las recompensas a nivel de trayectoria aún proporcionan señal útil para los saltos iniciales antes de que se forme cualquier grupo de ancla.

Qualitative Behavior: Multi-Hop Agent Trajectories

Comportamiento Cualitativo: Trayectorias de Agente Multi-Salto

A detailed case study from the paper illustrates how SearchEyes agents reason. In a four-hop trajectory, the agent begins with a P-hop: it receives an image of a museum building and uses visual_search to identify it, noting that the museum network has look-alike branches designed by different architects. It then executes a K-hop: looking up the identified branch’s architect via text_search. A second P-hop verifies the city from the image background to rule out a distractor branch. The final K-hop searches for that architect’s most prestigious award, arriving at the correct answer. Two key behaviors emerge from the training: the agent actively uses visual_search to extract and disambiguate visual entities before committing to an answer, and the P–K alternation pattern emerges naturally from HaPO’s hop-anchored credit, which rewards each modality-switching decision independently.

Un estudio de caso detallado del paper ilustra cómo razonan los agentes SearchEyes. En una trayectoria de cuatro saltos, el agente comienza con un P-hop: recibe una imagen de un edificio de museo y usa visual_search para identificarlo, notando que la red de museos tiene sucursales con apariencia similar diseñadas por diferentes arquitectos. Luego ejecuta un K-hop: buscando el arquitecto de la sucursal identificada vía text_search. Un segundo P-hop verifica la ciudad del fondo de la imagen para descartar una sucursal distractora. El K-hop final busca el premio más prestigioso de ese arquitecto, llegando a la respuesta correcta. Dos comportamientos clave emergen del entrenamiento: el agente usa activamente visual_search para extraer y desambiguar entidades visuales antes de comprometerse con una respuesta, y el patrón de alternancia P–K emerge naturalmente del crédito anclado por salto de HaPO, que recompensa cada decisión de cambio de modalidad independientemente.

The Bigger Picture: Data-Environment-Algorithm Co-Design

El Panorama General: Co-Diseño de Datos-Entorno-Algoritmo

SearchEyes represents a shift in how to think about training agentic AI systems. The traditional approach treats data generation, environment design, and algorithm design as separate problems to be solved independently. SearchEyes demonstrates that unifying all three around a single structural backbone — the typed knowledge graph — produces compounding benefits. The graph metadata that PKC retains enables the search environment to track entity-level alignment, which in turn enables HaPO to compute step-level credit assignment. Each component enables the next, and none would work as well in isolation.

SearchEyes representa un cambio en cómo pensar sobre el entrenamiento de sistemas de IA agénticos. El enfoque tradicional trata la generación de datos, el diseño de entorno y el diseño de algoritmo como problemas separados a resolver independientemente. SearchEyes demuestra que unificar los tres alrededor de una sola columna vertebral estructural — el grafo de conocimiento tipado — produce beneficios acumulativos. Los metadatos del grafo que PKC retiene permiten que el entorno de búsqueda rastree la alineación a nivel de entidad, lo que a su vez permite que HaPO compute la asignación de crédito a nivel de paso. Cada componente habilita al siguiente, y ninguno funcionaría tan bien de forma aislada.

The practical implications are significant. SearchEyes-27B achieves performance competitive with proprietary frontier models while remaining fully open-source — data, code, and model weights are all released. The 9B model demonstrates that with the right training recipe, small models can match the performance of models 3× their size. The self-contained search world eliminates the reproducibility and cost problems of external search APIs. And HaPO provides a practical algorithm for step-level credit assignment in multi-turn agent tasks without requiring a separately trained process reward model — a significant simplification over approaches like PRIME or Agent-RRM.

Las implicaciones prácticas son significativas. SearchEyes-27B logra rendimiento competitivo con modelos propietarios de vanguardia mientras permanece completamente de código abierto — datos, código y pesos del modelo se liberan todos. El modelo de 9B demuestra que con la receta de entrenamiento correcta, los modelos pequeños pueden igualar el rendimiento de modelos 3× su tamaño. El mundo de búsqueda autónomo elimina los problemas de reproducibilidad y costo de APIs de búsqueda externas. Y HaPO proporciona un algoritmo práctico para la asignación de crédito a nivel de paso en tareas de agente multi-turno sin requerir un modelo de recompensa de proceso separado — una simplificación significativa sobre enfoques como PRIME o Agent-RRM.

The authors also introduce VisSearch Bench, a new benchmark for multi-hop visual search with the P–K alternating structure, designed to evaluate exactly the capabilities that SearchEyes trains. This benchmark addresses a gap in existing evaluation, which tends to test visual QA and text-based search in isolation rather than the interleaved visual-textual reasoning that real-world research demands.

Los autores también introducen VisSearch Bench, un nuevo benchmark para búsqueda visual multi-salto con la estructura alternante P–K, diseñado para evaluar exactamente las capacidades que SearchEyes entrena. Este benchmark aborda una brecha en la evaluación existente, que tiende a probar QA visual y búsqueda basada en texto de forma aislada en lugar del razonamiento visual-textual entrelazado que demanda la investigación del mundo real.


References

Referencias

  • Jiao, Z. et al. (2026). SearchEyes: Towards Frontier Multimodal Deep Search Intelligence via Search World Simulation. arXiv:2607.05943
  • Jin, H. et al. (2025). Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning. arXiv:2503.09516
  • Feng, K. et al. (2026). OpenSearch-VL: Towards Open-Source Multimodal Deep Research. arXiv:2603.13085
  • Wu, X. et al. (2026). MMSearch-R1: Toward Multimodal Search via Reinforcement Learning. arXiv:2604.14406
  • Huang, Y. et al. (2026). Vision-DeepResearch: Towards Multimodal Deep Research via Agentic RL. arXiv:2604.10685
  • Zhang, R. et al. (2026). VSearcher: Reinforcing Multimodal Search Agents via Agentic RL. arXiv:2604.12708
  • Gao, Z. et al. (2025). ASearcher: Scaling RL-based Search Agent beyond 100 Turns. arXiv:2506.07888
  • Chu, T. et al. (2026). REDSearcher: Cost-Efficient Long-Horizon Agent Training via Graph-Structured Task Synthesis. arXiv:2602.07335
  • Wang, Z. et al. (2021). KEPLER: A Unified Model for Knowledge Embedding and Pre-trained Language Representation. arXiv:1911.06136 (Wikidata5M)
  • Hu, Z. et al. (2023). Open-Vocabulary Object Retrieval. (OVEN-Wiki/KG)
  • Shao, Z. et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning. (GRPO). arXiv:2402.03300
  • Yu, Q. et al. (2025). DAPO: An Open-Source LLM Reinforcement Learning Framework. arXiv:2503.14476
  • Yao, S. et al. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv:2210.03629
  • Qwen Team (2026). Qwen3.5. qwen.ai
  • Jiao, Z. et al. (2026). SearchEyes: Hacia la Inteligencia de Búsqueda Multimodal de Frontera vía Simulación de Mundo de Búsqueda. arXiv:2607.05943
  • Jin, H. et al. (2025). Search-R1: Entrenando LLMs para Razonar y Aprovechar Motores de Búsqueda con Aprendizaje por Refuerzo. arXiv:2503.09516
  • Feng, K. et al. (2026). OpenSearch-VL: Hacia la Investigación Profunda Multimodal de Código Abierto. arXiv:2603.13085
  • Wu, X. et al. (2026). MMSearch-R1: Hacia la Búsqueda Multimodal vía Aprendizaje por Refuerzo. arXiv:2604.14406
  • Huang, Y. et al. (2026). Vision-DeepResearch: Investigación Profunda Multimodal vía RL Agéntico. arXiv:2604.10685
  • Zhang, R. et al. (2026). VSearcher: Reforzando Agentes de Búsqueda Multimodal vía RL Agéntico. arXiv:2604.12708
  • Gao, Z. et al. (2025). ASearcher: Escalando el Agente de Búsqueda RL más allá de 100 Turnos. arXiv:2506.07888
  • Chu, T. et al. (2026). REDSearcher: Entrenamiento Eficiente de Agentes de Horizonte Largo vía Síntesis de Tareas con Estructura de Grafo. arXiv:2602.07335
  • Wang, Z. et al. (2021). KEPLER: Modelo Unificado para Incrustación de Conocimiento y Representación de Lenguaje Pre-entrenado. arXiv:1911.06136 (Wikidata5M)
  • Hu, Z. et al. (2023). Recuperación de Objetos de Vocabulario Abierto. (OVEN-Wiki/KG)
  • Shao, Z. et al. (2024). DeepSeekMath: Empujando los Límites del Razonamiento Matemático. (GRPO). arXiv:2402.03300
  • Yu, Q. et al. (2025). DAPO: Un Framework de RL para LLM de Código Abierto. arXiv:2503.14476
  • Yao, S. et al. (2023). ReAct: Sintetizando Razonamiento y Acción en Modelos de Lenguaje. arXiv:2210.03629
  • Qwen Team (2026). Qwen3.5. qwen.ai
Compartir