{"as_of":"2026-08-13T11:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b458f7a6bd8fbf2fef2fbc501033da435e935b6e016defa108d342735426c13","coverage":[{"denominator":199,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:43:52.590870Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10628/citation-record","integrity":"/paper/2608.10628/integrity","json":"/paper/2608.10628/citation-record.json","paper":"/paper/2608.10628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.432498Z","title":"arXiv preprint arXiv:2512.12658 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.432498Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:895226682180f401a63b1cf28d8d22b54793bd78c5d9bab6a3f03ce810b47a27","observation_id":"252d44f8-cc45-4048-927b-630f39a59135","resolution":{"observed_at":"2026-08-12T20:43:51.432498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.446345Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.446345Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:17d33ec654b3ca9b34adbdf1b3875057fd522f4b3ad24e38552ae24c83d9ad06","observation_id":"dec4f006-069d-4719-a589-2ec7b1e472fd","resolution":{"observed_at":"2026-08-12T20:43:51.446345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18600","snapshot_observed_at":"2026-08-12T20:43:51.464398Z","title":"arXiv:2602.18600 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.464398Z"},"links":{"cited_paper":"/paper/2602.18600","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:311d26e69c6be505ab7842a8d36ac4f36522143a007f9b2b7e976d73f52994be","observation_id":"b7641b32-c2c3-4da9-b257-69e33e6c7157","resolution":{"observed_at":"2026-08-12T20:43:51.464398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.477897Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.477897Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:78e343d66c2854e802f474248f688f7f7c7b34b14838332b0c2ee2fdfdac8f9b","observation_id":"40e2bddf-1586-4fc6-a2a4-7991bdd27c05","resolution":{"observed_at":"2026-08-12T20:43:51.477897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.488481Z","title":"arXiv preprint arXiv:2603.13398 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.488481Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:19545e57aa4b1e83c242338c3cd25144b921c66e28c596597196a6135b0b4041","observation_id":"1001e82e-65c3-4a1c-85a2-598cf0a73054","resolution":{"observed_at":"2026-08-12T20:43:51.488481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.498526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.498526Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:20efce09dd534df65330da1d1d5214faf03a4e5b4da6f88694b3ad51cb61f4f4","observation_id":"09b71924-4262-4f5f-a020-683a58dbc5c1","resolution":{"observed_at":"2026-08-12T20:43:51.498526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13731","last_updated":"2026-04-15T11:12:27Z","snapshot_observed_at":"2026-08-03T00:33:20.640303Z","submitted_at":"2026-04-15T11:12:27Z","title":"Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13731","snapshot_observed_at":"2026-08-12T20:43:51.507506Z","title":"arXiv preprint arXiv:2604.13731 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.507506Z"},"links":{"cited_paper":"/paper/2604.13731","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8b6180647bd10afdc5ca308f2863640a8ca996c25ed9f7c847cbdd44e1141ae1","observation_id":"5afb696d-64b0-4563-933b-4482853453ea","resolution":{"observed_at":"2026-08-12T20:43:51.507506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.518345Z","title":"2023 , publisher=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.518345Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:2b409264676f2bd1b3754f4c46a37d050cfa2d5bcd4ecbfcf67afe28ceb39859","observation_id":"cb0215e6-1f3b-450d-9188-13a785ae3ac2","resolution":{"observed_at":"2026-08-12T20:43:51.518345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.523976Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.523976Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:da39054b4e619048b024b32dd57cfda5ac77a3813ee3a2930b343b84eebbb124","observation_id":"e7719801-fd04-457f-b89a-919909a4fcc7","resolution":{"observed_at":"2026-08-12T20:43:51.523976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.539894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.539894Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8f006f42ddc71804bdf3eaaf5e7ffde9c0a73453b2bc1cdb3fc80c47bb2f2300","observation_id":"e63e6ad7-e67f-4abc-b201-f9c4b83c70ec","resolution":{"observed_at":"2026-08-12T20:43:51.539894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.546249Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.546249Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:05ecc0febe06f8cf7ae5d299bf19e7ceb90cfdc6b2d27464e200ad92a3153053","observation_id":"672bba5f-01c6-4b54-a51e-d167ed7d44f2","resolution":{"observed_at":"2026-08-12T20:43:51.546249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.553717Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.553717Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:066454ebe79c61adba71496382c51fdfd8c79a78609e9980704f3be771d00a8a","observation_id":"a38ddcfc-f673-4304-a806-f709a0117ce3","resolution":{"observed_at":"2026-08-12T20:43:51.553717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.565070Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.565070Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7e014c22a548d07819acf861e4d72400652967293710b5765abc0f38c549dcba","observation_id":"a831a54f-1b74-4fae-88c8-617e82d96a2e","resolution":{"observed_at":"2026-08-12T20:43:51.565070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08899","last_updated":"2021-07-18T03:09:51Z","snapshot_observed_at":"2026-08-10T20:40:29.904837Z","submitted_at":"2020-08-20T11:36:36Z","title":"Document Visual Question Answering Challenge 2020","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.08899","snapshot_observed_at":"2026-08-12T20:43:51.584010Z","title":"arXiv:2008.08899 , year =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.584010Z"},"links":{"cited_paper":"/paper/2008.08899","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:86e211ba803c25c3aae04266ca55e01a2a547254115a62ba3eabb53c72d60e36","observation_id":"81b7bd03-0d3a-44b1-a0fd-b37ec41857ca","resolution":{"observed_at":"2026-08-12T20:43:51.584010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.597646Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.597646Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:38efaefed5502d6aeab2815f026846a69b01a5965c2bc4eefcd74206ab206fca","observation_id":"332f52bf-d3cd-4076-85d7-c6109aacbca8","resolution":{"observed_at":"2026-08-12T20:43:51.597646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.606190Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.606190Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:c6725e5d182343340b52d68cf4fea8b2bbd86c0c9eb1f40e6c45c616edbc919d","observation_id":"f16fa77a-e750-44b9-8802-c2b5ba3dd8fd","resolution":{"observed_at":"2026-08-12T20:43:51.606190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.616664Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.616664Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:273aba28987abfd91c0af795654df3120c7375d8186a2af1fad813164fd01fa8","observation_id":"b3b492af-117b-4e90-b799-1ced3d47409d","resolution":{"observed_at":"2026-08-12T20:43:51.616664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.629863Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.629863Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:57ca6a189a90b6a9a297a32f5c51b127cf7f9d8691c64a1b5c4656a0c187d063","observation_id":"d3571ea2-8f80-46b3-9e43-e047a5a69e46","resolution":{"observed_at":"2026-08-12T20:43:51.629863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T20:43:51.639847Z","title":"arXiv:2308.12966 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.639847Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f60a584f4f1e34bbff57443078b17b78b9c46bb4b6336b2d5d7672bea8209952","observation_id":"fa56d2c8-0df5-41d6-b51b-00c56501f712","resolution":{"observed_at":"2026-08-12T20:43:51.639847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18234","last_updated":"2025-10-21T02:41:44Z","snapshot_observed_at":"2026-07-06T22:33:39.148066Z","submitted_at":"2025-10-21T02:41:44Z","title":"DeepSeek-OCR: Contexts Optical Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18234","snapshot_observed_at":"2026-08-12T20:43:51.656744Z","title":"arXiv preprint arXiv:2510.18234 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.656744Z"},"links":{"cited_paper":"/paper/2510.18234","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0748bcb54004fc32390804c2bca9c968ea6263ea6c6f7fb3fff502fa9dd6cd93","observation_id":"a451611d-030d-4062-bc27-f7ccdd8779b6","resolution":{"observed_at":"2026-08-12T20:43:51.656744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T20:43:51.667703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.667703Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:23c681b03f8e947ba88148568eec9c6d04c97fe7fbf9f867b62028234ad71bbe","observation_id":"9f58c408-ce50-4d3e-9fd7-9a1c70304ea6","resolution":{"observed_at":"2026-08-12T20:43:51.667703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T20:43:51.676451Z","title":"arXiv:2304.14178 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.676451Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4f33db0a7ff7845821681f5b8dfc0263bc851cd3800ebefafa72c7c904ff4de7","observation_id":"147fec38-9698-454a-a3db-8271b2b8dd02","resolution":{"observed_at":"2026-08-12T20:43:51.676451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.690654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.690654Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7526243c09506ce097de93a30df2401aec75f2fafd299992c8ca263836dfd6ea","observation_id":"fbf0df0f-6371-4f85-9f84-c2b6e64175cc","resolution":{"observed_at":"2026-08-12T20:43:51.690654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.697229Z","title":"2024 , publisher=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.697229Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7b98c32d13522fbaab8fb0ecc2457ef8b91f5841db1d8009b6d3f20225f3964d","observation_id":"5b0a4b09-f328-4d6a-b547-3bd3ec1ab2f6","resolution":{"observed_at":"2026-08-12T20:43:51.697229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-12T20:43:51.711511Z","title":"arXiv:2410.21276 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.711511Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:da4bb7b599e660023d6f804cf9bddd475afe55ac5d923d2cc8d33c1a8e4b9a9a","observation_id":"334a934c-fb23-4d50-a053-f89ac8a0607d","resolution":{"observed_at":"2026-08-12T20:43:51.711511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T20:43:51.722559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.722559Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:ded88fea823ac6165621e48d047df00b61bb343e5e73e766f97b8760ed8ba837","observation_id":"7fe50c9f-18cd-43e4-99f4-8e9d5ee695d0","resolution":{"observed_at":"2026-08-12T20:43:51.722559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-13T11:03:04.175844Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-12T20:43:51.739388Z","title":"arXiv:2307.02499 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.739388Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:68f1437e22557e285756bdfabca42da07853ad97dbc4b37fce98bc46c3cf7da4","observation_id":"f114d9c3-8704-4518-bafa-06da7d6b8d6d","resolution":{"observed_at":"2026-08-12T20:43:51.739388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-12T20:43:51.753530Z","title":"arXiv:2308.13418 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.753530Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a80cd48f1b6f24852ab23fe89bff5bf9c4b325215da835f40ff81f1c03e2bfcf","observation_id":"3cff5cdb-d50d-4abb-995b-38bbf7c5ed97","resolution":{"observed_at":"2026-08-12T20:43:51.753530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.776117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.776117Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e9dbbb2669e05887d908f6add19f8860b2b5441a0501412d8a546ad312109bc1","observation_id":"58b14e08-50f2-4e7f-a2f1-19610f38c248","resolution":{"observed_at":"2026-08-12T20:43:51.776117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.796757Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.796757Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8876749f3f62ef060b8f4266d72d57e8858b33d23c69f20afdd4b8f62400301a","observation_id":"d4cde66d-d70b-4884-ae35-91b6b5cea85b","resolution":{"observed_at":"2026-08-12T20:43:51.796757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-08-13T06:43:11.823135Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-12T20:43:51.809462Z","title":"arXiv:2407.01449 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.809462Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:612b45f36a981bf62cf125e4b344388907a070561d71959394d08cd794059535","observation_id":"2b366537-f7b1-421b-81b6-29c6e3e6f161","resolution":{"observed_at":"2026-08-12T20:43:51.809462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.821654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.821654Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8a7c5dd61effe518f4653c5044d6743f2963ebe3b26c57acffdb754abad4070a","observation_id":"50f2f655-2141-412a-b968-ec108dc394a7","resolution":{"observed_at":"2026-08-12T20:43:51.821654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.831411Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.831411Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:29bebe1bc973a0264c3ac86a4aeec15116129593cf86402ccbfea6b1c7583d05","observation_id":"8baf5c4c-7a9e-4886-b2cd-ae7d676bcfb7","resolution":{"observed_at":"2026-08-12T20:43:51.831411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.839257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.839257Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:03e239a37f7913b2b58eeeb9a93b667e1eb02be3ab3d6fb3661f8a9f6603ea17","observation_id":"594ed217-933b-4fe3-931b-aedc6ca9b0d6","resolution":{"observed_at":"2026-08-12T20:43:51.839257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-12T20:43:51.848796Z","title":"arXiv:2203.11171 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.848796Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4b499f0ed723c36d40a35efe5fa4883ad084621a37f8fa587a9d8a3401c203f6","observation_id":"e87d9acf-24ac-4f78-9db5-69792c0f9dbe","resolution":{"observed_at":"2026-08-12T20:43:51.848796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.861161Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.861161Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:2082abeeeed39c0e9c2348879dc20a29d08a5ea4f06c1fd43cc847332e83c793","observation_id":"8c3d5310-718a-4e53-b295-159eb60c6cfe","resolution":{"observed_at":"2026-08-12T20:43:51.861161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.868376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.868376Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:772bc5aa6c7159812755dde51d49bdc3e54a6327e49571f808ed606a60f52633","observation_id":"68ed8346-7caf-4114-b675-56c6fb8164dd","resolution":{"observed_at":"2026-08-12T20:43:51.868376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-13T05:57:08.016883Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-12T20:43:51.877474Z","title":"arXiv:2403.04473 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.877474Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:6928d34d7da085bcb79a223f771cc6944706b922db0c2250bebc82dad4f231ad","observation_id":"08328c3e-f410-4cbe-9e04-72f54d365aa2","resolution":{"observed_at":"2026-08-12T20:43:51.877474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.892832Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.892832Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:dc729b9bd6615d83d0cdd67bf7992f7212193a47ae3322db67eb1356f193f7c7","observation_id":"51f7d0b5-4b3e-41c0-b048-44cbcb258702","resolution":{"observed_at":"2026-08-12T20:43:51.892832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.901323Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.901323Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:caa958bdcbbe9c8e612f306400b978c7940672506d676d1572dc5ea55e815c05","observation_id":"51c39407-6a26-487b-a69a-25b61a98c5b3","resolution":{"observed_at":"2026-08-12T20:43:51.901323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.912951Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.912951Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fc0e134b5d7b1466be2b9bf99cf1629f0ebc46b32ba2998283773f97e78e0d80","observation_id":"7ccc012b-9775-494b-aec4-299746d5280a","resolution":{"observed_at":"2026-08-12T20:43:51.912951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-12T20:43:51.923345Z","title":"arXiv:2004.05150 , year =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.923345Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:88a44dd8c8fc68da666913cfc2c10443e3fb33967befab05bb54c7ad3293a14f","observation_id":"e8f07bd9-2f91-4841-95fa-751dee6217fb","resolution":{"observed_at":"2026-08-12T20:43:51.923345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.936290Z","title":"arXiv preprint arXiv:2511.15090 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.936290Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a32bc54b1dec23367300caf9445e72af29d4bf72c36c76c556ad8a3fe280fa9e","observation_id":"cb02520a-382b-4875-8dbe-e778b5d56851","resolution":{"observed_at":"2026-08-12T20:43:51.936290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.955421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.955421Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:49fe6c0dcd25efee2ea1678a0d6024b21279d36a8833dd3e8983818cf31349e1","observation_id":"4fe68348-2f7e-404c-8306-8e18f2d94b48","resolution":{"observed_at":"2026-08-12T20:43:51.955421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.964109Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.964109Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:862a2a7d463260eaff10c23fdbe882a158b778a89098460711281dd771cf339b","observation_id":"0ce288a3-10d3-4663-87c2-1240f5938950","resolution":{"observed_at":"2026-08-12T20:43:51.964109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.979699Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.979699Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8b40ad54b0903f7aab7b81f1eb3cc2dec6af69d34e9650bad2fdad2719962c13","observation_id":"32823e72-996a-4325-b01c-7680d623dbea","resolution":{"observed_at":"2026-08-12T20:43:51.979699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:51.989774Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:51.989774Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fc0cd6a162ec0965eec93554e4655d2a44367572ff54dcadd415d1107fd7be97","observation_id":"ca68ebc9-77f4-4d6c-8416-9538ddb84409","resolution":{"observed_at":"2026-08-12T20:43:51.989774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-08-13T08:08:03.934735Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-12T20:43:52.001229Z","title":"arXiv:2411.04952 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.001229Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3a1187a2588b970ff8d0a98d10d76e87a82e5684ee83f8854b8d253f896764b3","observation_id":"582e90d9-4098-4feb-9738-86e666dbe2ab","resolution":{"observed_at":"2026-08-12T20:43:52.001229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.014167Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.014167Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f00d9a883c809f73012ea5b4bdb82f7699ec9637425d4fcf6eeec34526531196","observation_id":"eddacfde-f445-4ce7-8af7-1e48de586922","resolution":{"observed_at":"2026-08-12T20:43:52.014167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.031137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.031137Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0db47f0ec7d0ef79f387ab920c6dd6372760555ac29e0a5a433a777b72a324b9","observation_id":"4a3bb0df-9127-4bb7-a0f3-86ab5812433a","resolution":{"observed_at":"2026-08-12T20:43:52.031137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.040519Z","title":"arXiv:2508.07313 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.040519Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4659c04eecf98602cbfaac378110dacf6239f67af72661a77fa2b24b269f892f","observation_id":"54b40d6d-f2cb-4faa-8c57-8d40aa6ff646","resolution":{"observed_at":"2026-08-12T20:43:52.040519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-12T20:43:52.052394Z","title":"arXiv:2205.10625 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.052394Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:188842ed620f5810dbe9ffeb0760629c320223af49dfd74bb5e3d1fcccbbad63","observation_id":"295cb0ab-c0f3-48ef-a834-d3d15280c5b5","resolution":{"observed_at":"2026-08-12T20:43:52.052394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-12T04:43:44.229948Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-12T20:43:52.061952Z","title":"arXiv:2410.10594 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.061952Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:ba173b1e59059b6a7cee3929d62a51aceb5c355c9813f19bbd9b8a27c8f3f9ed","observation_id":"7fec3e01-fcdd-4874-a892-5cb342055ac6","resolution":{"observed_at":"2026-08-12T20:43:52.061952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.073991Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.073991Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:224ae06171533cf40359b8c5f28ab0d89361ec7fd3f4b0bb9c77605d99e7b737","observation_id":"54b853ac-8e24-43fa-a30b-4b6a17c2d2f1","resolution":{"observed_at":"2026-08-12T20:43:52.073991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.086032Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.086032Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5003a045bc43260a1aca3896a9fdec3d40a07ea2b687ce9388aefb5ee79cb330","observation_id":"fe8023e3-0a56-4057-bc1b-0e51eda3011e","resolution":{"observed_at":"2026-08-12T20:43:52.086032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11592","last_updated":"2023-09-02T04:28:42Z","snapshot_observed_at":"2026-08-13T10:31:47.306856Z","submitted_at":"2023-08-19T17:32:34Z","title":"UniDoc: A Universal Large Multimodal Model for Simultaneous Text Detection, Recognition, Spotting and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11592","snapshot_observed_at":"2026-08-12T20:43:52.096954Z","title":"arXiv:2308.11592 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.096954Z"},"links":{"cited_paper":"/paper/2308.11592","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:88b0ca57f5d7d2bf7dd0a6e9e729dc937246cfdd2a023eae85d6430d5874b3a5","observation_id":"c9a4207f-0eb8-4053-9169-a355d190e88f","resolution":{"observed_at":"2026-08-12T20:43:52.096954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.111220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.111220Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a1d0174145224cde3ce9c373617764740cacde1f1b9d55a4336ab85dd1936180","observation_id":"4dbf4a9a-3a19-4d19-a24c-192d881e87f8","resolution":{"observed_at":"2026-08-12T20:43:52.111220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01106","last_updated":"2025-03-02T22:41:37Z","snapshot_observed_at":"2026-08-12T22:09:21.952575Z","submitted_at":"2024-11-02T02:09:01Z","title":"SV-RAG: LoRA-Contextualizing Adaptation of MLLMs for Long Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01106","snapshot_observed_at":"2026-08-12T20:43:52.118382Z","title":"arXiv:2411.01106 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.118382Z"},"links":{"cited_paper":"/paper/2411.01106","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5f16a7edcc088e8a2ebe7daba41b47c7ebd2889fa53c083bd9334a48b26aea60","observation_id":"0cc08193-108e-46a1-acfc-09c3f17b05a5","resolution":{"observed_at":"2026-08-12T20:43:52.118382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-09T08:12:02.284497Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05970","snapshot_observed_at":"2026-08-12T20:43:52.128685Z","title":"arXiv:2410.05970 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.128685Z"},"links":{"cited_paper":"/paper/2410.05970","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:73d3d71a3e0cc8465966724fedba1e2ad23fb62a2e61005171483e76495dc0ef","observation_id":"90a1a7a2-55d6-4ad7-852f-07c574e5fab6","resolution":{"observed_at":"2026-08-12T20:43:52.128685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.134624Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.134624Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3fa7b57b2de7e7ce1e1a824cb742614a1fc9e37c1b8b295b25c09948c50e777d","observation_id":"ceb2f185-f069-48cd-b013-eb4788071475","resolution":{"observed_at":"2026-08-12T20:43:52.134624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.156133Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.156133Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:dc6d099505c6695ef7a31b60dec4d95a92d624c2ca594d71534e4c8ca921c4e7","observation_id":"0cf1e0d4-ab58-48fb-ad01-d4ab983b3f6a","resolution":{"observed_at":"2026-08-12T20:43:52.156133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.166937Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.166937Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:571b224c51197de78c6ced892ad7b739f7c077bdfbce093d6bd88e81822e764c","observation_id":"5d549344-35eb-433c-9850-db0b4353fb6c","resolution":{"observed_at":"2026-08-12T20:43:52.166937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18839","snapshot_observed_at":"2026-08-12T20:43:52.180075Z","title":"arXiv:2409.18839 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.180075Z"},"links":{"cited_paper":"/paper/2409.18839","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:47bab700939ac0f380d3d82a99c8d8679a574c95adb8419bfb52fc5188505609","observation_id":"093434eb-c772-44b7-8e2b-5323a8173c7e","resolution":{"observed_at":"2026-08-12T20:43:52.180075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-13T09:33:28.035234Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14059","snapshot_observed_at":"2026-08-12T20:43:52.188447Z","title":"arXiv:2505.14059 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.188447Z"},"links":{"cited_paper":"/paper/2505.14059","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:657145229f15112d1c95f122b62a654494a3e58f64709bc3d3e3f0cf6eeef28f","observation_id":"4de26b28-e5d8-40fc-81dd-65e4981ba74b","resolution":{"observed_at":"2026-08-12T20:43:52.188447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.195971Z","title":"arXiv:2506.05218 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.195971Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8afd6bee1f8576a01fc6f89b41c7570fc8533c8db802a223d077f5f70ffcd083","observation_id":"bda85456-e951-4c62-819c-57626a064edc","resolution":{"observed_at":"2026-08-12T20:43:52.195971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.202073Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.202073Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:d6ad389f6cda58c48718906370568e59b94716654c865af36078b46e9b74f436","observation_id":"32f5821c-cfe0-4bfa-87c8-13cfe900ef64","resolution":{"observed_at":"2026-08-12T20:43:52.202073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.210849Z","title":"2008 , publisher=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.210849Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:b7e91908725c4b471c5075302c9eebfb80b55070be4fa25bec51fb06b77467be","observation_id":"9c17be92-6fe3-46e5-8489-96dd894cc27e","resolution":{"observed_at":"2026-08-12T20:43:52.210849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.224864Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.224864Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:719f17e66a0947fb3732e17a459c7ec2d0d9170db12df5eb4bbe344399526afd","observation_id":"05916129-0074-4d17-ae07-34863406c925","resolution":{"observed_at":"2026-08-12T20:43:52.224864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T20:43:52.237790Z","title":"arXiv:2010.11929 , year =","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.237790Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:471db63d23456a321ac6fba5af38f6f853070586d35b59d6d8764e788c647daa","observation_id":"1cd54eb8-bc7d-41f9-a4f7-d70c038669a2","resolution":{"observed_at":"2026-08-12T20:43:52.237790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-12T20:43:52.244477Z","title":"arXiv:2412.16720 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.244477Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fc2a987f4889e188c5daaaf6833c9839f6c81dd72281a517f051907abd0a4cc9","observation_id":"11ef51b3-6657-4e7d-b802-babdfb7a9acc","resolution":{"observed_at":"2026-08-12T20:43:52.244477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.255513Z","title":"2022 , organization=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.255513Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:c909491bdc2a000756be0ffc3fa0c6ce3477e5010bf759bd908f946b3feed599","observation_id":"15a98bb2-c84b-483d-a27b-b708d2cfc9fe","resolution":{"observed_at":"2026-08-12T20:43:52.255513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.265822Z","title":"2023 , organization=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.265822Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:96cd38520af5b3a5df0de124ddf7cae6cdb8d3c68b7521f3eda9447cd1698e7e","observation_id":"f7471e8f-8070-40c9-82c6-497abeb0f69b","resolution":{"observed_at":"2026-08-12T20:43:52.265822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-12T20:43:52.301005Z","title":"arXiv:2412.10302 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.301005Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:7df034413673373acc37b2a3791105104d4279b2a726836b8cfc96fd18fa0f51","observation_id":"b2dad576-da8d-4595-880a-e41758577613","resolution":{"observed_at":"2026-08-12T20:43:52.301005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T20:43:52.309759Z","title":"arXiv:2408.01800 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.309759Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:f3eedccf679b80c2328315321c687a9252bfefb897984bda43fe568f5b6bbeeb","observation_id":"d6f39cd2-40a8-43bd-8a7b-ee49e1bbfb20","resolution":{"observed_at":"2026-08-12T20:43:52.309759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.318718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.318718Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3ad71538246c83bfd586e7ee5eeb6153649f2f5f83bccf7c06da4ac496551c81","observation_id":"5db16b8c-6131-4920-81f8-1fcf1801cfa1","resolution":{"observed_at":"2026-08-12T20:43:52.318718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.328222Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.328222Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:0ea5e547fd0e7d2a4b484258c2710358c35a679041f9b8f2af37d081fd321c5e","observation_id":"70e9d84f-58b3-4734-8ce6-ca55f527e757","resolution":{"observed_at":"2026-08-12T20:43:52.328222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.337837Z","title":"2007 , publisher=","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.337837Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a480dcd217a2d762959b7352f5341e33be08b4986a9e9c463e944d088d99bfb1","observation_id":"098c5b73-b8f2-4df4-8250-94bca2db840e","resolution":{"observed_at":"2026-08-12T20:43:52.337837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.344851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.344851Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:acf88be345ac59c43f881ee269e3abcb993de8bfd9bac8c38bdb7272005a4cb7","observation_id":"b1a4314a-3a76-4378-bdef-1332253cd0a1","resolution":{"observed_at":"2026-08-12T20:43:52.344851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.354372Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.354372Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:17436c198721c29a82bbb7cae69b4deaf7f8fef379473a43ec7d153af6556ce3","observation_id":"e978d148-e2b9-4667-ad93-77dffdbe4146","resolution":{"observed_at":"2026-08-12T20:43:52.354372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.363451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.363451Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8fd968c94a7901a224d8b9508460354385fa84b2ac1a81f8e4801ca675288ac7","observation_id":"e4c9834c-d628-4945-bc99-3366f27411c8","resolution":{"observed_at":"2026-08-12T20:43:52.363451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-12T20:43:52.371554Z","title":"arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.371554Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:a828f6a307efe4e87660161f110fd2efcdc43ee974f3675371cac8f83e9a080c","observation_id":"fa196da2-c32a-4ada-bfea-d4677803e426","resolution":{"observed_at":"2026-08-12T20:43:52.371554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T20:43:52.382452Z","title":"arXiv:2408.03326 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.382452Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:3b58fc076552e1a5aed80d47f73e1c1d62b526e54525da7bdd426b57eccbc297","observation_id":"a4dcf1c2-3a6c-404a-bc4e-a4bfc0235cb8","resolution":{"observed_at":"2026-08-12T20:43:52.382452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.393482Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.393482Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:bf1eadd628485d7665c32bcfdf8965132784d479848f826bfec3f3e515776319","observation_id":"d91644aa-de97-4603-95b1-c07f60ea162c","resolution":{"observed_at":"2026-08-12T20:43:52.393482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-12T20:43:52.400851Z","title":"arXiv:2408.13257 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.400851Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:15c90592daeb58c66f9512fe7d4c1cb20a64ee022e457f4856afc1caa01bc0e2","observation_id":"1f2d652b-157b-4059-91d6-65f866db853b","resolution":{"observed_at":"2026-08-12T20:43:52.400851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-08-12T13:34:41.083093Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-12T20:43:52.416078Z","title":"arXiv:2411.16044 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.416078Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:705efea6fdbf318ad776b0b5388b6e82a39a9b972d0e0f15d7e6cd7ca07a11be","observation_id":"0f5c56c8-8f72-4ecc-aa61-adf9cc619201","resolution":{"observed_at":"2026-08-12T20:43:52.416078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.424324Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.424324Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:fd6c95e72d2c1de92bca2ae045073ac2dee2d616a8ab2409dd3f8b575e33fe0b","observation_id":"00f8f5af-5ac6-4ff0-8ffa-889a8f392f05","resolution":{"observed_at":"2026-08-12T20:43:52.424324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-12T20:43:52.433756Z","title":"arXiv:2505.15966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.433756Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:9e0ac2bb33fdd3d10163a233a5d9e7d83d6a1195698e64bff012c5dee45d698b","observation_id":"c0689b02-576a-49c8-a73b-6c275db32d17","resolution":{"observed_at":"2026-08-12T20:43:52.433756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-12T20:43:52.446742Z","title":"Thinking with Images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.446742Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:9c16b7937efe1019bb984a5bf2385f7b7c1e14c6503bca31fb272c7be553db4a","observation_id":"b94ef19f-1956-4e41-9bb4-dd690d9ea07e","resolution":{"observed_at":"2026-08-12T20:43:52.446742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21457","last_updated":"2026-06-08T14:20:16Z","snapshot_observed_at":"2026-08-12T21:13:07.185581Z","submitted_at":"2025-05-27T17:29:31Z","title":"ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21457","snapshot_observed_at":"2026-08-12T20:43:52.454015Z","title":"arXiv:2505.21457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.454015Z"},"links":{"cited_paper":"/paper/2505.21457","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:9b76c239641feec8df18bbc742e58984345adf39da68267deab1ad7a9412ec8a","observation_id":"ce597df7-ebfa-4f0c-8d61-2f0d1ef4599c","resolution":{"observed_at":"2026-08-12T20:43:52.454015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11991","snapshot_observed_at":"2026-08-12T20:43:52.464926Z","title":"arXiv:2506.11991 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.464926Z"},"links":{"cited_paper":"/paper/2506.11991","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4da0b8859fb2a3ac9f906ebb8fe97e0a4d83cb5ec8c52bd519d1bfb5071b6865","observation_id":"dc73571a-e47c-4e93-9eeb-110b8ae226db","resolution":{"observed_at":"2026-08-12T20:43:52.464926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.484308Z","title":"arXiv:2507.07999 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.484308Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:6e3acfccafa39fdd281f9ee7ece41674bb7ed18a1c9d498f6a289ea39ff4c798","observation_id":"ad0030cf-a42d-4ce8-8e3e-6971391a36f7","resolution":{"observed_at":"2026-08-12T20:43:52.484308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07969","last_updated":"2025-09-09T17:54:21Z","snapshot_observed_at":"2026-07-30T05:21:39.737665Z","submitted_at":"2025-09-09T17:54:21Z","title":"Mini-o3: Scaling Up Reasoning Patterns and Interaction Turns for Visual Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07969","snapshot_observed_at":"2026-08-12T20:43:52.502221Z","title":"arXiv:2509.07969 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.502221Z"},"links":{"cited_paper":"/paper/2509.07969","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:5e5a23baa936cdf950038b12e246bd1fc74e7964f1a6392721133cc899b1e205","observation_id":"1773d0c5-1a6a-4ca3-92e4-f27f34bfb18c","resolution":{"observed_at":"2026-08-12T20:43:52.502221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.510847Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.510847Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e7050c1266911b0d5ca487d4509164e21ef2825fa637a18bdc256c60853aced2","observation_id":"c5f4532a-b584-43fe-9bf3-55df8bd43554","resolution":{"observed_at":"2026-08-12T20:43:52.510847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21327","snapshot_observed_at":"2026-08-12T20:43:52.522901Z","title":"arXiv:2505.21327 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.522901Z"},"links":{"cited_paper":"/paper/2505.21327","citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:8beb40a6f2a4df6c045acf3a7f6df93fc272094004fe43bd68d451c5d64dcbb5","observation_id":"50172d97-fd2b-4138-9d31-d88b5617db15","resolution":{"observed_at":"2026-08-12T20:43:52.522901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.539447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.539447Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:96492b4425f98262f1e3baec65de6047bfcbac8ab96bc5097d69465101d6d3f7","observation_id":"ee070561-45b4-48a0-ab0d-448755b802a0","resolution":{"observed_at":"2026-08-12T20:43:52.539447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.550508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.550508Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:e1bf002d62980e7c6ce1709ac6cdfe4095f45c0aa2d8dfcddf6ed237de47bc44","observation_id":"c114a68c-6efe-4f03-8397-e2944ab09c4d","resolution":{"observed_at":"2026-08-12T20:43:52.550508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.560044Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.560044Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:ff94b09e9929607bc64a92a281b6489046172499f9aaa46d55195e0bdfbcf567","observation_id":"693d7b3f-1597-431f-99c3-1fb96dd44458","resolution":{"observed_at":"2026-08-12T20:43:52.560044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.567430Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.567430Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:911cb1946dd8eb571d0d83855d41562e74914d97b63df2d87d6e58ac62b2ec17","observation_id":"cef9870a-7f23-40af-bef9-f9708469379b","resolution":{"observed_at":"2026-08-12T20:43:52.567430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.581795Z","title":"2020 , publisher=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.581795Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:54d9b36e45508b9469747d525ac276a8973a4cbe6533baea3dc32d431dd48f43","observation_id":"b27a5fc9-5082-4fa1-bfe0-cece2763f45a","resolution":{"observed_at":"2026-08-12T20:43:52.581795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:43:52.590870Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-12T20:43:52.590870Z"},"links":{"citing_paper":"/paper/2608.10628"},"observation_digest":"sha256:4a7cdcd29e9bd2c9c4bf118a9f764f16472c530af9adefcf20acfffe7720653f","observation_id":"bcf0e47d-cbee-4d5d-9958-8fbd5c1a854e","resolution":{"observed_at":"2026-08-12T20:43:52.590870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.10628","last_updated":"2026-08-11T08:15:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:20:46.418448Z","submitted_at":"2026-08-11T08:15:16Z","title":"InSight-doc: Agentic Visual Perception for Long-Document Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":199},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 199 outbound references and 0 inbound Pith citation observations for arXiv:2608.10628."}