{"as_of":"2026-08-08T20:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e14f0b2ac25b70a893bb84369556d1bd9c0cdd8394ca547ddf833f97ff122ddc","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:57:54.119975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T15:27:04.356488Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-07T04:57:54.119975Z","title":"Vision search assistant: Empower vision-language models as multimodal search engines.arXiv preprint arXiv:2410.21220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09247","last_updated":"2025-06-10T21:04:18Z","snapshot_observed_at":"2026-08-07T04:51:03.799303Z","submitted_at":"2025-06-10T21:04:18Z","title":"Agent-based Condition Monitoring Assistance with Multimodal Industrial Database Retrieval Augmented Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T04:57:54.119975Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2506.09247"},"observation_digest":"sha256:18cb90db460f24f6eb3e69344a429faaaeaded956f2c02000cc827f2f6486daf","observation_id":"366a2314-cb85-48de-a10c-ec5e863ee7ff","resolution":{"observed_at":"2026-08-07T04:57:54.119975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:8b17670980ae5fa94a5fc9e39970b5b44247dfcaae4fe349b0292edf871d6fb8","observation_id":"fdd8921a-fe0a-40e5-b704-e73f448640eb","resolution":{"observed_at":"2026-05-16T15:27:04.359334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-05T16:15:28.012224Z","title":"Vision Search Assistant: Empower Vision- Language Models as Multimodal Search Engines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18805","last_updated":"2025-08-26T08:40:22Z","snapshot_observed_at":"2026-08-08T01:12:52.353250Z","submitted_at":"2025-08-26T08:40:22Z","title":"Hidden Tail: Adversarial Image Causing Stealthy Resource Consumption in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:15:28.012224Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2508.18805"},"observation_digest":"sha256:3163cdd6b4df96482d8a35c8450df6890803179fe85ed9ec1a0c98035f298331","observation_id":"fdafa1c5-c530-4513-85cb-d8b059f3caab","resolution":{"observed_at":"2026-08-05T16:15:28.012224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2604.19264","last_updated":"2026-04-21T09:28:34Z","snapshot_observed_at":"2026-07-31T12:03:21.545054Z","submitted_at":"2026-04-21T09:28:34Z","title":"DR-MMSearchAgent: Deepening Reasoning in Multimodal Search Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-10T03:21:30.732925Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2604.19264"},"observation_digest":"sha256:540dcf8671e443958e6a46591c51fafd745664196ddd74f256caf7b1827a9cbe","observation_id":"87c3752c-9c26-4dbd-a70f-c555aeab7736","resolution":{"observed_at":"2026-05-11T12:31:07.876274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":"2410.21220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision search assistant: Em- power vision-language models as multimodal search engines","venue":null,"work_id":"b8776ac3-ff10-4830-8639-e5200cb5cb19","year":2024},"citing_paper":{"arxiv_id":"2604.20486","last_updated":"2026-04-22T12:20:46Z","snapshot_observed_at":"2026-08-06T20:38:43.258492Z","submitted_at":"2026-04-22T12:20:46Z","title":"ProMMSearchAgent: A Generalizable Multimodal Search Agent Trained with Process-Oriented Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T01:12:17.469552Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2604.20486"},"observation_digest":"sha256:6672cb2d460a87e6ff5db2afcd266a3fd793748bd8e9c6dd46d48109b591cd5e","observation_id":"eb930070-8b28-49f4-8e0b-cc3f4616b474","resolution":{"observed_at":"2026-05-11T13:41:10.100388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21220","snapshot_observed_at":"2026-08-02T10:20:56.272120Z","title":"arXiv preprint arXiv:2410.21220 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22643","last_updated":"2026-06-24T02:40:49Z","snapshot_observed_at":"2026-08-08T03:20:50.943223Z","submitted_at":"2026-06-24T02:40:49Z","title":"Reason Before You Retrieve: Agentic Planning for Multi-modal RAG","version":1},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-08-02T10:20:56.272120Z"},"links":{"cited_paper":"/paper/2410.21220","citing_paper":"/paper/2607.22643"},"observation_digest":"sha256:a8cb61fa545338ecc76f8bd3e2cdb6e1ac2ef8e7831720d2ba60b89b4107e0a0","observation_id":"69f8f00b-ff32-477a-a004-e9721ce81336","resolution":{"observed_at":"2026-08-02T10:20:56.272120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.21220/citation-record","integrity":"/paper/2410.21220/integrity","json":"/paper/2410.21220/citation-record.json","paper":"/paper/2410.21220"},"outbound":[],"paper":{"arxiv_id":"2410.21220","last_updated":"2024-10-28T17:04:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:04:18Z","title":"Vision Search Assistant: Empower Vision-Language Models as Multimodal Search Engines"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2410.21220."}