{"as_of":"2026-08-07T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2e017e0b26b27af3b1c4d30b1db0697122dd0537098de50db50e5bfe4bca8e3","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:10:08.326585Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T20:30:59.126121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T20:35:34.394180Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"cited_work":{"arxiv_id":"2508.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07493","snapshot_observed_at":"2026-07-08T20:35:34.394180Z","title":"VisR-Bench: An empirical study on visual retrieval- augmented generation for multilingual long document understanding.ArXiv preprint, abs/2508.07493","venue":"cs.CV","work_id":"9698a654-f27a-42a3-a870-d0d500daaada","year":2025},"citing_paper":{"arxiv_id":"2605.06460","last_updated":"2026-05-07T15:51:06Z","snapshot_observed_at":"2026-07-06T23:18:55.724335Z","submitted_at":"2026-05-07T15:51:06Z","title":"MINER: Mining Multimodal Internal Representation for Efficient Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:33.437364Z"},"links":{"cited_paper":"/paper/2508.07493","citing_paper":"/paper/2605.06460"},"observation_digest":"sha256:7b72da07a952f50afdf27b84ee10dfa2ddc6ef89691eaf11e28942787fc9e439","observation_id":"e0b5a8c2-a50f-4d35-8fd4-0f029e609d28","resolution":{"observed_at":"2026-05-11T19:06:10.643227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"cited_work":{"arxiv_id":"2508.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07493","snapshot_observed_at":"2026-07-08T20:35:34.394180Z","title":"VisR-Bench: An empirical study on visual retrieval- augmented generation for multilingual long document understanding.ArXiv preprint, abs/2508.07493","venue":"cs.CV","work_id":"9698a654-f27a-42a3-a870-d0d500daaada","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2508.07493","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:4da910fe67ec696c85408380c89cd348f5999ad44af61f4e403184adadb1ca71","observation_id":"5dc0e3c7-5291-48ee-a3e6-dd165098b149","resolution":{"observed_at":"2026-06-29T12:53:26.555944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"cited_work":{"arxiv_id":"2508.07493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07493","snapshot_observed_at":"2026-07-08T20:35:34.394180Z","title":"VisR-Bench: An empirical study on visual retrieval- augmented generation for multilingual long document understanding.ArXiv preprint, abs/2508.07493","venue":"cs.CV","work_id":"9698a654-f27a-42a3-a870-d0d500daaada","year":2025},"citing_paper":{"arxiv_id":"2607.05927","last_updated":"2026-07-07T07:31:05Z","snapshot_observed_at":"2026-08-05T20:33:48.132336Z","submitted_at":"2026-07-07T07:31:05Z","title":"CMDR: Contextual Multimodal Document Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T20:30:59.126121Z"},"links":{"cited_paper":"/paper/2508.07493","citing_paper":"/paper/2607.05927"},"observation_digest":"sha256:f8c43972388e5d9dd0315b777ade1b65316ce5ece33b0c47383454767b25ebb6","observation_id":"98c99682-c945-41b9-b38b-4462c8e29e6a","resolution":{"observed_at":"2026-07-08T20:35:34.395414Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07493/citation-record","integrity":"/paper/2508.07493/integrity","json":"/paper/2508.07493/citation-record.json","paper":"/paper/2508.07493"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.396220Z","title":"Ask in any modality: A comprehensive survey on multimodal retrieval-augmented generation, 2025","venue":null,"work_id":"f039439c-363f-46c0-b0be-a256e1c7f817","year":2025},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.070614Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:5016da1e09a58e804aa8fdb1794b26996b794b12af6b1f5dd3b2bdb6ec3ea888","observation_id":"cef3d718-2b83-49af-b4eb-40d8a75fdd03","resolution":{"observed_at":"2026-08-05T22:10:09.400345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-05T22:10:08.075964Z","title":"Phi-4-mini technical report: Compact yet powerful multi- modal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.075964Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:45d25396661ac2a1616370d6f8753b8af5b8e69e8116245eec999e9f4a60b692","observation_id":"49a2697d-b88d-4b04-961d-8c0987481054","resolution":{"observed_at":"2026-08-05T22:10:08.075964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.384024Z","title":"Scene text visual question answering","venue":null,"work_id":"7de14ac5-0879-4e06-8fd0-abdaf364c847","year":2019},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.080601Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:6dfabbbef4468c0e0d50e981b45cbf0a7b6940460748c2075ac17423205865ff","observation_id":"de2ffbca-14ff-4c85-b1c6-71f3de933b71","resolution":{"observed_at":"2026-08-05T22:10:09.387813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-05T22:10:08.085053Z","title":"Bge m3-embedding: Multi-lingual, multi- functionality, multi-granularity text embeddings through self- knowledge distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.085053Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:75ff212b42e40d2ec931d7a6511c701c42cf97d8f21a61a995b2583f4d7b65a1","observation_id":"236003d3-acec-4c0a-b34f-932a000559ec","resolution":{"observed_at":"2026-08-05T22:10:08.085053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14594","last_updated":"2024-08-26T19:26:50Z","snapshot_observed_at":"2026-08-06T23:46:19.155602Z","submitted_at":"2024-08-26T19:26:50Z","title":"MMR: Evaluating Reading Ability of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2408.14594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.14594","snapshot_observed_at":"2026-08-05T22:10:08.824806Z","title":"MMR: Evaluating Reading Ability of Large Multimodal Models","venue":"cs.CV","work_id":"d8538b63-0742-4fb2-a186-8b846a86970d","year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.089589Z"},"links":{"cited_paper":"/paper/2408.14594","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:1081e90671be3b06b92bd0f534446f0c88e7ded50018522e4fbf960014644f09","observation_id":"17ee1c91-bd37-4bdd-b3c7-811c5e3a18e8","resolution":{"observed_at":"2026-08-05T22:10:08.828773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01106","last_updated":"2025-03-02T22:41:37Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T02:09:01Z","title":"SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01106","snapshot_observed_at":"2026-08-05T22:10:08.093349Z","title":"Sv-rag: Lora-contextualizing adaptation of mllms for long document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.093349Z"},"links":{"cited_paper":"/paper/2411.01106","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:798057e92f338b6319a39a7c34b54342fd6ce5153fc985385b398018646fd2b9","observation_id":"427bba16-f186-4e88-8af2-fbe1d210e983","resolution":{"observed_at":"2026-08-05T22:10:08.093349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T22:10:08.097589Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.097589Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ef1fff892eb688ec3f2d3b04a1432aaabc2a942f63e835689d2d532fcd52301f","observation_id":"686aaee8-751d-4f80-adcb-3b263e763ec3","resolution":{"observed_at":"2026-08-05T22:10:08.097589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-08-05T22:10:08.101248Z","title":"M-longdoc: A benchmark for multimodal super- long document understanding and a retrieval-aware tuning framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.101248Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:a44b4e2b23b39b9f8bc00b4999b563f88e3a490692be4125d09c186e8badcacd","observation_id":"fbe50c63-4ed7-409d-a45e-8fe5940338bb","resolution":{"observed_at":"2026-08-05T22:10:08.101248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.372585Z","title":"Mmvqa: A comprehensive dataset for investigating multipage multimodal information retrieval in pdf-based visual question answering","venue":null,"work_id":"9eafa355-b3bc-4a32-b359-b6717ddbc32e","year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.104968Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:fbfd0ee7ebdb583b1bd0e33974227b210192f870be1edff3a9b20543f3504476","observation_id":"ba546d15-0083-4c4f-bd2f-46129c89b4e3","resolution":{"observed_at":"2026-08-05T22:10:09.376320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.108542Z","title":"Mmdocir: Benchmarking multi-modal retrieval for long documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.108542Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:386727fc245c06de3bfca3502cd441ad1c65816dec5acc265743713c31b547cb","observation_id":"bc034659-1053-4925-b18d-9e75c27f4a8b","resolution":{"observed_at":"2026-08-05T22:10:08.108542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-08-05T22:10:08.112765Z","title":"Pp-ocr: A practical ultra lightweight ocr system","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.112765Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:de04e35a31a04afdbd6b2438d45ec4c98db0573fd8c41935fd12b7654c9eafb6","observation_id":"7e66d650-7e94-4262-9dba-76ccc06a12bb","resolution":{"observed_at":"2026-08-05T22:10:08.112765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.360630Z","title":"Colpali: Efficient document retrieval with vision language models, 2024","venue":null,"work_id":"50551c84-1801-44d5-be06-72c81a99ebbc","year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.116239Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:f65ec9278c9a0c0887616e00b9b34fdc98a5f073528f86a2bdfad8a8f44b34be","observation_id":"eb663534-4708-4585-b950-ec34a7f6396c","resolution":{"observed_at":"2026-08-05T22:10:09.365473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.120202Z","title":"Exploring the frontier of vision-language models: A survey of current methodologies and future direc- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.120202Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:2162fc7b64b2b46b045312de50c436d95af45206533f503fce1f762952e5ea05","observation_id":"3839b108-bf82-4209-a682-6e971dacc5a3","resolution":{"observed_at":"2026-08-05T22:10:08.120202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T22:10:08.124378Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.124378Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:729e7f938a54cac4203ffafe9eb61352fdc76456a50a5bac2ff031c1517b03c4","observation_id":"67c4d1d6-05bb-4042-900a-2df0fe228000","resolution":{"observed_at":"2026-08-05T22:10:08.124378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-05T22:10:08.128979Z","title":"Financebench: A new benchmark for financial question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.128979Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:08d04dd34e79fc6a14c1880b2aa27c6a45724d042731f8c878df40b51ce44a1b","observation_id":"25facea2-f7f6-4d1d-ae90-eec21fdc58f4","resolution":{"observed_at":"2026-08-05T22:10:08.128979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T22:10:08.132923Z","title":"Mistral 7b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.132923Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:22e3bc784306e4f097f1f7946053146a5a81dc014bb6cdec6d2629cf6cccfad6","observation_id":"ce12ed8f-f79e-4f24-874a-71968cbf950d","resolution":{"observed_at":"2026-08-05T22:10:08.132923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-05T22:10:08.136811Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.136811Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ad0e4e4858d9ac00b8ac53945eba65004c418c33b04475dc3b5c510a52921c2f","observation_id":"4401a79d-ceba-45eb-bd92-96292f0a2121","resolution":{"observed_at":"2026-08-05T22:10:08.136811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.346964Z","title":"Colbert: Efficient and effective passage search via contextualized late interaction over bert","venue":null,"work_id":"c1261cc6-2559-48c6-bcad-9748baed4d59","year":2020},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.141567Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:602d886f37df4d34b999c373af18f444e4de89a3a12fee82559d33939185b937","observation_id":"8178269d-3ae0-44d5-9ba9-589d7024731a","resolution":{"observed_at":"2026-08-05T22:10:09.352324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-07-06T19:04:47.884694Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-05T22:10:08.145820Z","title":"Building and better understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.145820Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:acba231efef955639523938833e2e84c39e37e5269f2870d6c1c21531d7c1924","observation_id":"e254639f-2e33-484c-87c7-28b6ff9e545a","resolution":{"observed_at":"2026-08-05T22:10:08.145820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17428","last_updated":"2025-02-25T00:35:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-27T17:59:45Z","title":"NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17428","snapshot_observed_at":"2026-08-05T22:10:08.149428Z","title":"Nv- embed: Improved techniques for training llms as generalist embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.149428Z"},"links":{"cited_paper":"/paper/2405.17428","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:6542d808c9a4915f38322d4b3de537bde5d4c33221398e1fa42d0e4814f271ce","observation_id":"e85c21d5-6ce7-49c9-a880-20486e152a65","resolution":{"observed_at":"2026-08-05T22:10:08.149428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00045","last_updated":"2025-06-23T22:05:21Z","snapshot_observed_at":"2026-08-06T23:04:50.017490Z","submitted_at":"2025-06-23T22:05:21Z","title":"CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning","version":1},"cited_work":{"arxiv_id":"2507.00045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00045","snapshot_observed_at":"2026-08-05T22:10:08.535202Z","title":"CaughtCheating: Is Your MLLM a Good Cheating Detective? Exploring the Boundary of Visual Perception and Reasoning","venue":"cs.CV","work_id":"540546e6-8442-45b6-b39f-ebc51d192ee5","year":2025},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.153107Z"},"links":{"cited_paper":"/paper/2507.00045","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:d5c1527b743af9b292423741e07ee345fa8f4d824070a57c8272b8eb976df8ed","observation_id":"c6a6873c-73af-4d37-b112-bbf862166eb0","resolution":{"observed_at":"2026-08-05T22:10:08.541500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.156626Z","title":"Towards visual text grounding of multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.156626Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:6bde9d1d770b4421f90cababcdc1d9cef433936567ba8646d1806f1ebe9fb456","observation_id":"f41e5b77-b01d-417b-9af1-f9c64d773573","resolution":{"observed_at":"2026-08-05T22:10:08.156626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.336229Z","title":"Chatqa: Building gpt-4 level conversational qa models","venue":null,"work_id":"9b4e520c-80a9-443e-9d5a-1f0147e8bace","year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.160227Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:dc5a9ac5a898084bb8c4e4aa47facf433dabea5c7a95e10468ad4958e2590100","observation_id":"3c52f217-b39f-4eae-8729-03018f9ad76e","resolution":{"observed_at":"2026-08-05T22:10:09.340001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-05T00:28:25.127698Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-05T22:10:08.163447Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.163447Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:04808ff6f205dc0a6c228660bdd5aef1b0bdce990ce7c2d52b36e1540ca23329","observation_id":"8e2e274e-6fc6-4b8d-b793-bdaac0a7bc63","resolution":{"observed_at":"2026-08-05T22:10:08.163447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-05T22:10:08.166980Z","title":"Mmlongbench-doc: Benchmarking long-context doc- ument understanding with visualizations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.166980Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ea7c7e2a0d69ce036c43675a58dfb657e45813f68bbe620dd1d7117285c022aa","observation_id":"539bd716-b703-4f35-bd20-4a0174b3bf81","resolution":{"observed_at":"2026-08-05T22:10:08.166980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.171236Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.171236Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:0a16862d62ddad8e841b7e4d824e9f99ed5d85385116153ab57798f4a9091da2","observation_id":"7c855fdf-38c4-4dc0-989b-5f88e97bf2fe","resolution":{"observed_at":"2026-08-05T22:10:08.171236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.318467Z","title":"V Jawahar","venue":null,"work_id":"15ad993e-1687-4038-876e-b159b7dede39","year":2021},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.174784Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:51516d6448761704a36f539012ab26a728fb3cdb1468775d47ba5a126c782e8e","observation_id":"dab151a3-4749-4307-ac39-70c52a018b2e","resolution":{"observed_at":"2026-08-05T22:10:09.322398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.305024Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"e4f363ff-f9f7-431b-aa40-5d64630f4807","year":2021},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.178898Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:5b8cec9d75f65cfc94b14e67e33d72b882936846086e6f4134c427e70f6f480e","observation_id":"7d6ba0b1-06cd-4a3d-bcee-703b04a1b437","resolution":{"observed_at":"2026-08-05T22:10:09.310288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.293732Z","title":null,"venue":null,"work_id":"afa61696-d65f-4ef8-8697-309eb3c9b042","year":2021},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.182279Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:d4bc46a442207c7527d12e2317e9838624ed660f26e86b2929262ad88c363ebf","observation_id":"6a8bb147-62c3-4461-aaa6-2ede29c9886a","resolution":{"observed_at":"2026-08-05T22:10:09.297590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.283564Z","title":"Infographicvqa","venue":null,"work_id":"87716589-2983-4df0-83e4-7f3215ed7d8c","year":2022},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.185760Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:4a6da5d55978619b3fa05be59559d0328c20d1c600af7959e61baafcceb27a62","observation_id":"0991974f-67fc-4a92-8ac9-52703c17303d","resolution":{"observed_at":"2026-08-05T22:10:09.287121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.188996Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.188996Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:2b4a4591860714a80ed2105d2c508f1c86384710aec9e42547dad39ea4523fb6","observation_id":"1cbcec69-b295-4927-9eea-018fcc8cdba1","resolution":{"observed_at":"2026-08-05T22:10:08.188996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T22:10:08.192384Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.192384Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:33c3ae583b30d9b808557400505f3cce05763efd9a5e9f927aec83d80474230d","observation_id":"5a57f2eb-4f56-45bb-bff0-972b5bc44ece","resolution":{"observed_at":"2026-08-05T22:10:08.192384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.197362Z","title":"The probabilistic relevance framework: Bm25 and beyond","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.197362Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:d78332794811c37b872acd874bb9a86c76c0524344d30a0846930a7fc3c2366c","observation_id":"298f9ed9-afbc-4c2c-9288-e10c7e74780f","resolution":{"observed_at":"2026-08-05T22:10:08.197362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-05T22:10:08.200780Z","title":"Cvqa: Culturally-diverse multilingual visual ques- tion answering benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.200780Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:5cc2084337e42ea99d173ffc8d6ef1c586cb00e2ba99d2122eaddd154574872b","observation_id":"428e2e7d-8199-4a49-9c58-b2f70941b2a0","resolution":{"observed_at":"2026-08-05T22:10:08.200780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.258835Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text","venue":null,"work_id":"788773f4-4e48-4e08-8a29-ef4fd834c005","year":2021},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.204634Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:c37cb0f1f168c1df09c0848ba5f0b3143a15db97347a5adfe0f1968a4fdd705a","observation_id":"1fbde0bf-ea6f-4e3a-a360-1a19eabb338c","resolution":{"observed_at":"2026-08-05T22:10:09.263242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-05T22:10:08.208206Z","title":"Paligemma 2: A family of versatile vlms for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.208206Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:771556539f85ea73976dafdcb10f60413a8d1159136cf51df1f5a8c1db1eecb9","observation_id":"d1815816-bec4-4e11-acf0-527dac0a6236","resolution":{"observed_at":"2026-08-05T22:10:08.208206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.244845Z","title":"Slidevqa: A dataset for document visual question answering on multiple images","venue":null,"work_id":"2d4fe6de-3f35-4e5b-9ed8-dd91b15f3683","year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.212586Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:1ba11f64d65f1d0819009b3c8b6dbb169254ea0e552450cd26f27a4ce6ef18b7","observation_id":"b81e0c3e-2dac-4d10-911c-bcf57a3e07fe","resolution":{"observed_at":"2026-08-05T22:10:09.249944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.232510Z","title":"Hi- erarchical multimodal transformers for multipage docvqa","venue":null,"work_id":"1c7b81df-ffab-470e-b5cf-587e0e781174","year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.216257Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:b6abc52a74d4b6eb51bcd2ec22cf032334d5640d967d975668ac3c74a5a1acce","observation_id":"bbcbc31f-1536-48bd-b1f5-f15156d55e78","resolution":{"observed_at":"2026-08-05T22:10:09.236420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.220270Z","title":"Ccpdf: Building a high quality corpus for visually rich documents from web crawl data","venue":null,"work_id":"0fdb921b-71f9-4a04-8f6c-2f5f2a53b29f","year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.220070Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:de4838367ed867b38b3ca1461fe77fbffea8dd036db45b96f8fb1c96481faf97","observation_id":"f00acd49-5a06-4e0f-9e0a-198588d902a5","resolution":{"observed_at":"2026-08-05T22:10:09.224271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.208157Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"e6cf9f3d-18e7-4668-85ad-3518117c3f41","year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.223643Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ee19f0de750fd8ac94353cd601a0fbc39a525de8c7c8d0185838273f1117a82a","observation_id":"695fa568-86b0-4283-b7cd-fd17737a10ce","resolution":{"observed_at":"2026-08-05T22:10:09.212398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.197072Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"f79cb62f-d902-4295-94c5-54b15416b429","year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.227655Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ed56885dd3fb8b91af912766d78a97e87d7d599b85a276cc7033716db5cfa2c8","observation_id":"04ba4415-aea9-419e-be8c-4388905b652e","resolution":{"observed_at":"2026-08-05T22:10:09.200594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13478","last_updated":"2024-06-11T10:18:08Z","snapshot_observed_at":"2026-08-07T15:23:04.741153Z","submitted_at":"2024-01-24T14:23:12Z","title":"SciMMIR: Benchmarking Scientific Multi-modal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13478","snapshot_observed_at":"2026-08-05T22:10:08.231807Z","title":"Scimmir: Benchmarking scientific multi-modal information retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.231807Z"},"links":{"cited_paper":"/paper/2401.13478","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:32d677248a9f9a093c4eeac839f27b5155a03e677bafedc5c9bcee483c164073","observation_id":"062f3806-bfe6-4314-9aa3-6e8a2fea737c","resolution":{"observed_at":"2026-08-05T22:10:08.231807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07597","last_updated":"2024-09-24T03:01:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-14T10:57:50Z","title":"C-Pack: Packed Resources For General Chinese Embeddings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07597","snapshot_observed_at":"2026-08-05T22:10:08.236037Z","title":"C-pack: packaged resources to advance general chinese em- bedding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.236037Z"},"links":{"cited_paper":"/paper/2309.07597","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:a689a809f78ddff83e5c78d59030a3d144c2e5e9595bfcce8d57348a2fb28182","observation_id":"82d4f2a7-320c-4b62-802a-370574976ebb","resolution":{"observed_at":"2026-08-05T22:10:08.236037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-05T22:10:08.240158Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.240158Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:e6068e96ace3abdca9f6ccb16117b471e50b8b69b5680fc7ea409c2bb05b7c81","observation_id":"fb41c3c8-b199-4735-9d7c-a93153a199cf","resolution":{"observed_at":"2026-08-05T22:10:08.240158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.185381Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"895e0d2b-75b8-4b08-9a05-ced9b87867f0","year":2023},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.244392Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:a22305cf53dbf8b4094d14392b87c400586c163547a2ccb78add93a447a739b9","observation_id":"112787aa-b36f-40d4-8470-18808813eaa1","resolution":{"observed_at":"2026-08-05T22:10:09.190017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.247951Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.247951Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:125b7d3eb4ced556abbdce371c5e91ae740fb6bb04829fa1ee96cbcab02b4123","observation_id":"174ac9e7-7817-48c3-b7a4-a7056ac16699","resolution":{"observed_at":"2026-08-05T22:10:08.247951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-05T22:10:08.251950Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.251950Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:6c55e3bf475cd0d6954ad3a6573221c26ba77b2844395afafc9e298471109db8","observation_id":"e84236d5-00f3-42ac-ba1c-8225e3b66a8b","resolution":{"observed_at":"2026-08-05T22:10:08.251950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11072","last_updated":"2024-11-19T06:45:13Z","snapshot_observed_at":"2026-07-06T19:51:37.262377Z","submitted_at":"2024-11-17T13:21:26Z","title":"Multilingual Large Language Models: A Systematic Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11072","snapshot_observed_at":"2026-08-05T22:10:08.255901Z","title":"5” and “6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.255901Z"},"links":{"cited_paper":"/paper/2411.11072","citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:43ef81def6f3f465ebdddd84c122e1a91107199022af33473a0b9e94eb854817","observation_id":"dccb1653-7e37-4aff-8044-5805b4604376","resolution":{"observed_at":"2026-08-05T22:10:08.255901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.166146Z","title":"Figure 3","venue":null,"work_id":"b632f2e3-3faf-4da0-a2d7-8a74c584de07","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.260035Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:e4e496bfe56df1efd93d9fc787c6ae7bfd742d4e2d30b9d3b235b861160932b0","observation_id":"1d9415f7-ecb0-4587-bb78-a591530a7ddc","resolution":{"observed_at":"2026-08-05T22:10:09.170235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.154066Z","title":"• If multiple figures or tables exist, distinguish them based on their title, description, or content","venue":null,"work_id":"3d23cf5d-6a40-48ac-94b9-aeb65a3ee3a1","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.264001Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:383a85bf1b2b70c694a7d9e0c9dc6f70d2017f6429d5013fa0c62219e4b6d797","observation_id":"b9f4a5a2-f0a5-4814-9487-29d892cd3f1a","resolution":{"observed_at":"2026-08-05T22:10:09.158776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.142823Z","title":"detected_language","venue":null,"work_id":"151e7d29-c278-4ebd-a2b0-0b13dc127385","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.267582Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:f726c1a321799938b63122f079b314ea8a438434514f1fda02cf42bce2175669","observation_id":"b9ebb48a-fa49-40ae-858f-0310d05fdaa1","resolution":{"observed_at":"2026-08-05T22:10:09.146526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.130364Z","title":null,"venue":null,"work_id":"9f3db48a-52c8-403b-afbb-631d7e294028","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.271444Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:31ca7336100f42c47817a1b90228ed0331bed988e500021ee5855ec80c66a2c2","observation_id":"5d51418f-cb26-46cf-8bc7-4349fd89146d","resolution":{"observed_at":"2026-08-05T22:10:09.134902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.119714Z","title":"Now, please revise the given question pair according to these guidelines","venue":null,"work_id":"e691fc14-a6ec-443b-b476-5161a1ebaa58","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.274994Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:265ac29dab76c85a8964c8ee03c23c663b67ceb21e6f245e07a7205afeaf0fdf","observation_id":"fd00dd00-3833-40e2-bddd-9af86d00cae3","resolution":{"observed_at":"2026-08-05T22:10:09.123366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.107426Z","title":"The question should be about the subject of the page, and the answer needs to be found in the page","venue":null,"work_id":"2d62b2fc-0cb9-4d8e-8fdd-f8349d921e15","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.278528Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:2f4592db07911380922db4b011a6dd7ac24de711b84f675e942f6f460e927184","observation_id":"34021eb1-0a6a-4f6c-8f98-691c52fda117","resolution":{"observed_at":"2026-08-05T22:10:09.112226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.095632Z","title":"Generate a question that could be asked by provided infomation in the given page","venue":null,"work_id":"29dcc0e2-9204-48e8-9fe3-bca3c9a5b498","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.282492Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:1d3bd0129bd8b043e4f77c06d5ad35588715c9328115708db62405ad615af11f","observation_id":"eb5dcbb4-ca4c-4c51-97f0-c48a0e464fa9","resolution":{"observed_at":"2026-08-05T22:10:09.099368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.085038Z","title":"Please do not generate:","venue":null,"work_id":"ae8e39c7-de0f-4bf4-9ac1-7d9c4ecab14c","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.285879Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:a4101026572d9d6653c0ff0f7cb62b831d7761efb35ba7e1015177de492a97d9","observation_id":"e23b6640-6fd2-4a3b-baaa-3d32f995ec08","resolution":{"observed_at":"2026-08-05T22:10:09.088464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.962131Z","title":"What is the page number?","venue":null,"work_id":"48652a68-76fb-4136-9fe4-6c35fba4f468","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.294022Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:71c01fd468aad482bfbe8108bbf6f9ec5dbc29c219237785263a4ccf7d8b45de","observation_id":"7eec0267-3ef8-4805-a2e7-f668a91285d7","resolution":{"observed_at":"2026-08-05T22:10:08.965761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.950300Z","title":"detected_language","venue":null,"work_id":"10d16a41-d3a0-444a-8f41-f007a06297b2","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.297781Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:5f8b2e7f406668916cba91af158c466231c7f8ed4f383266ec1db0af47da97bb","observation_id":"22e9eb5a-af8e-4ac2-823f-e10107f08c61","resolution":{"observed_at":"2026-08-05T22:10:08.954615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.937853Z","title":null,"venue":null,"work_id":"00b303c6-e6d0-4a34-b32e-be0084a2d6cb","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.301458Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:9d963078d47c601760b87ec299145bc8909245917455055121747bef0c592201","observation_id":"e62c39ae-2e71-46df-9c17-3d99cbfca7c3","resolution":{"observed_at":"2026-08-05T22:10:08.942238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.922107Z","title":"How has X changed over the last five years?","venue":null,"work_id":"8b073c01-98c9-4947-a443-a086aafccdb4","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.305054Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:71faa056cd5bd1f7820926dfa6633b93ce3d717733199b186ffc05991c1d8f99","observation_id":"b18e7707-7ee6-4b3d-9796-675a1ad0538c","resolution":{"observed_at":"2026-08-05T22:10:08.927041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.909359Z","title":"The question should be about the subject of the page, and the answer needs to be found in the page","venue":null,"work_id":"4e2b63fd-5f2e-4204-98d1-2c233bac79df","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.309386Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:ea329fb2d2f2d3fe39f55e61cf7a8e3d00106ddb24cb321dbdd80d50009e50ce","observation_id":"b538a815-d213-435b-84ec-e0949ce91b60","resolution":{"observed_at":"2026-08-05T22:10:08.913564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.897020Z","title":"Generate a question that could be asked by a user without knowing the existence and the content of the corpus","venue":null,"work_id":"157cfaf3-872e-41ac-9e8d-3c3db1ab03cb","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.312602Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:575131852681698995a5bc4d5d67c8b0883e25ef35df70fae7cdcf3f0eae8ab3","observation_id":"6306bdc0-9729-4865-ac33-a4ced277e330","resolution":{"observed_at":"2026-08-05T22:10:08.901102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.885258Z","title":"And the format of the answer should be a list of words answering the question","venue":null,"work_id":"b32fa70c-1026-4059-9a00-26e28d3d6650","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.316031Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:01a59491abba0a1c48767f07663d6d6d498abb77d25ce726958b08b25b232ce7","observation_id":"264377b4-8d4b-4ea4-b12f-189f7c8d60d8","resolution":{"observed_at":"2026-08-05T22:10:08.889450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:09.074590Z","title":null,"venue":null,"work_id":"958425a3-951f-4305-b0b5-f11409438e24","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.319626Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:442624de84f34d355233bb9c06f3d77fd52cd2aece4f62473fdbf18e1ba8bd84","observation_id":"9aa26f0b-a847-42a6-8f8a-d692e855d0f6","resolution":{"observed_at":"2026-08-05T22:10:09.077964Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.871853Z","title":"What is the page number?","venue":null,"work_id":"027480bb-50dd-4686-bf6b-1c743cc302f5","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.323166Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:4f886359ddb11819ca751ed4f7a589f3155cb9664ea6e325ffe6ac30b2f67f04","observation_id":"7603cd4e-66a0-410e-9040-c94df6f0891e","resolution":{"observed_at":"2026-08-05T22:10:08.876958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:10:08.858787Z","title":"detected_language","venue":null,"work_id":"e62db1bc-4d37-456a-b776-0d84c88964d2","year":null},"citing_paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T22:10:08.326585Z"},"links":{"citing_paper":"/paper/2508.07493"},"observation_digest":"sha256:f5c0b14a4bd982ce602353bd7b021281a9b3dbe3acea6c9b57d7dc36e45c326f","observation_id":"6911ac89-10ed-4726-a925-e34863514e1a","resolution":{"observed_at":"2026-08-05T22:10:08.863023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07493","last_updated":"2025-08-25T01:29:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:43:25.893997Z","submitted_at":"2025-08-10T21:44:43Z","title":"VisR-Bench: An Empirical Study on Visual Retrieval-Augmented Generation for Multilingual Long Document Understanding"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 3 inbound Pith citation observations for arXiv:2508.07493."}