Pith. sign in

Paper Citation Record · LEDGER

Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.21220.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2410.21220 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 6 of 6 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 6 of 6 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:57:54.119975Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-16T15:27:04.356488Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 366a2314-cb85-48de-a10c-ec5e863ee7ff · inbound

Agent-based Condition Monitoring Assistance with Multimodal Industrial Database Retrieval Augmented Generation cites this paper.

Agent-based Condition Monitoring Assistance with Multimodal Industrial Database Retrieval Augmented Generation Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-07T04:57:54.119975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:57:54.119975Z digest=sha256:40dd86603b0ea1dc7aba020fa149fd288fb9ddf89d3cfff78ad2221530b3d8e5

Observation fdd8921a-fe0a-40e5-b704-e73f448640eb · inbound

MMSearch-R1: Incentivizing LMMs to Search cites this paper.

MMSearch-R1: Incentivizing LMMs to Search Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 70

Resolution
verified exact
arxiv_id, observed 2026-05-16T15:27:04.359334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-16T15:27:04.228144Z digest=sha256:fb9e47872b35562ee5f1676adbe635d2de1a47499cf9164c3683493fb68f6340

Observation fdafa1c5-c530-4513-85cb-d8b059f3caab · inbound

Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models cites this paper.

Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T16:15:28.012224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:15:28.012224Z digest=sha256:b5e9c90b594a9ac728fc27965f8166970cd424192275940b2e89521c4acc9388

Observation 87c3752c-9c26-4dbd-a70f-c555aeab7736 · inbound

DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents cites this paper.

DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 65

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:31:07.876274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-10T03:21:30.732925Z digest=sha256:8744e08de0e5b6a777d0884d912ec35d6a740f5025a53926e673b065eceeea0f

Observation eb930070-8b28-49f4-8e0b-cc3f4616b474 · inbound

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards cites this paper.

ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:41:10.100388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T01:12:17.469552Z digest=sha256:822fb7ba50ef10b52c75533cf5c6f1b710c03acb88bee71b6b15a3204e7e9069

Observation 69f8f00b-ff32-477a-a004-e9721ce81336 · inbound

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG cites this paper.

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines

Reference 156

Resolution
unresolved
no resolver link, observed 2026-08-02T10:20:56.272120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T10:20:56.272120Z digest=sha256:ac2934c46538b98e0ba24518ba4789da867f7f8d14373165e455725441d03f20