{"as_of":"2026-08-23T00:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a42050af5136fc0d7cb7a6f2092743cef65697ff621e5ffa80300b5325bc589e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:52:10.280261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T13:27:05.552868Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:795d0628fb960e561223116cd46a0b9ebbc5bd4b38765b94633717cb7234222f","observation_id":"d71fdbcf-0d36-4319-b658-ea545a8cba30","resolution":{"observed_at":"2026-05-12T20:58:59.153006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-08-14T02:54:31.558222Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T04:00:25.624430Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2409.18839"},"observation_digest":"sha256:f33d9701046a93e8788dd47a0541339887cdd1ace73aa568179dd8dd03f5e620","observation_id":"01e0e38b-26fe-4082-b818-ccec1f9638a5","resolution":{"observed_at":"2026-05-16T04:00:25.685643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-12T12:52:10.280261Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16856","last_updated":"2025-03-23T07:01:53Z","snapshot_observed_at":"2026-08-19T20:56:22.352625Z","submitted_at":"2024-11-25T19:00:05Z","title":"SAR3D: Autoregressive 3D Object Generation and Understanding via Multi-scale 3D VQVAE","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:52:10.280261Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2411.16856"},"observation_digest":"sha256:17023fba30d142184add80f4c6e0693d521a27689165a9812cd6057a09a3172f","observation_id":"227ab008-0fa0-484c-aa81-4b0e5b2a84ea","resolution":{"observed_at":"2026-08-12T12:52:10.280261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-12T12:34:31.768116Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17125","last_updated":"2025-08-06T10:02:43Z","snapshot_observed_at":"2026-08-22T16:26:56.862651Z","submitted_at":"2024-11-26T05:38:34Z","title":"DOGR: Towards Versatile Visual Document Grounding and Referring","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:34:31.768116Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2411.17125"},"observation_digest":"sha256:886af7b0fa24e91bc104affd9470f22e4ef596847cc8a0736f0a87f9538b50a3","observation_id":"55824c0c-9478-463f-8219-ebe694609b52","resolution":{"observed_at":"2026-08-12T12:34:31.768116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-12T11:19:33.711726Z","title":"Kosmos-2.5: A multimodal lit- erate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-19T21:16:45.185594Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.711726Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:6b8f7bef0383288bf3625dae32bd890212af879bf88fef978cc8d5f779fd2926","observation_id":"ec05580b-55f9-47b3-8f33-4751a25e6efa","resolution":{"observed_at":"2026-08-12T11:19:33.711726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-11T23:47:10.158358Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-08-19T21:55:09.283644Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:47:10.158358Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2412.02210"},"observation_digest":"sha256:e5c603cd86861baa0c2ee7ee8ed2a7e89844d9164f6cfb32668eda20e0da36cb","observation_id":"92df3bc4-0195-4ce9-bdc4-f6412729c6ed","resolution":{"observed_at":"2026-08-11T23:47:10.158358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-11T23:19:11.587776Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02611","last_updated":"2024-12-03T17:41:23Z","snapshot_observed_at":"2026-08-17T20:15:24.350046Z","submitted_at":"2024-12-03T17:41:23Z","title":"AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T23:19:11.587776Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2412.02611"},"observation_digest":"sha256:44ce5092a0d5689e7ba3d97d436f785526a189d4dd25fe7d016b127d9fa8614c","observation_id":"d14e1eef-9b97-4868-8462-b5c5073baecc","resolution":{"observed_at":"2026-08-11T23:19:11.587776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-11T16:58:03.255104Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09616","last_updated":"2024-12-13T04:58:33Z","snapshot_observed_at":"2026-08-14T18:32:28.081516Z","submitted_at":"2024-12-12T18:59:46Z","title":"V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T16:58:03.255104Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2412.09616"},"observation_digest":"sha256:5d0cb7264ad741896f9a9c72b4a7db97108b41b2edada55c4cd4a895da2cc1e4","observation_id":"6c523022-cb1e-44f8-b80a-60d4e97f94e9","resolution":{"observed_at":"2026-08-11T16:58:03.255104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-11T11:24:16.070213Z","title":"arXiv preprint arXiv:2309.11419","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15523","last_updated":"2025-01-13T10:01:56Z","snapshot_observed_at":"2026-08-17T11:11:20.343829Z","submitted_at":"2024-12-20T03:23:26Z","title":"InstructOCR: Instruction Boosting Scene Text Spotting","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:16.070213Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2412.15523"},"observation_digest":"sha256:92a172b509cf7a5b1325cd7bf78a1e2df58a5a1b47e52329e14bc7ac9b257afb","observation_id":"ee1b0aa8-656e-4374-b20a-32bffae4b191","resolution":{"observed_at":"2026-08-11T11:24:16.070213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-11T14:59:02.395890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-21T08:28:48.041857Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":285,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:02.395890Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:b37c42e0423a4d9c9ac44e48bec2d1134a117c98015189f6b56f39e71d9a82b9","observation_id":"9eca4f22-337d-46d1-8a28-0836cec76d99","resolution":{"observed_at":"2026-08-11T14:59:02.395890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-10T22:17:27.865103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.865103Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:245c184f582d42390e560f4be98b1ef8e7a05664bd94055b989d3f99dfe49977","observation_id":"46f1f4dd-0b04-4f43-867f-71dad31aed6a","resolution":{"observed_at":"2026-08-10T22:17:27.865103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-08T23:13:13.922039Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04223","last_updated":"2025-02-06T17:07:22Z","snapshot_observed_at":"2026-08-15T12:03:11.012078Z","submitted_at":"2025-02-06T17:07:22Z","title":"\\'Eclair -- Extracting Content and Layout with Integrated Reading Order for Documents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T23:13:13.922039Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2502.04223"},"observation_digest":"sha256:68312243dd5eb9824ffcc7337bc034f07b99629735abcb1ab41e6e928b5b13f2","observation_id":"f092e221-6002-4759-95c0-d245e880bfbc","resolution":{"observed_at":"2026-08-08T23:13:13.922039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-07T20:20:13.222393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09843","last_updated":"2025-02-14T01:05:51Z","snapshot_observed_at":"2026-08-16T01:39:53.162754Z","submitted_at":"2025-02-14T01:05:51Z","title":"MuDoC: An Interactive Multimodal Document-grounded Conversational AI System","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T20:20:13.222393Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2502.09843"},"observation_digest":"sha256:65eb07e3a8e276c884c7adfe8e98c00ba0ccf30744bfbdcfd8fed25bfeade0a8","observation_id":"c6d922dc-292b-4119-a33a-29d6dcdd10b1","resolution":{"observed_at":"2026-08-07T20:20:13.222393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-07T15:42:26.594364Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-19T17:28:16.492186Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:26.594364Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:fde479003e327028356ec5863f515d46560f0ab4ac973a396d78c8222a8bdf2a","observation_id":"875dff2a-34fb-4356-b4d9-97215fd81879","resolution":{"observed_at":"2026-08-07T15:42:26.594364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-06T22:22:39.299853Z","title":"Kosmos-2.5: A multimodal literate model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-11T11:40:41.776672Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:39.299853Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:03f001dc61f17c0351a69800e37b42377cf85b3e0337b18ecaf6cda52027e8f3","observation_id":"e759238f-dab3-4c82-8923-2bcb3f9e021a","resolution":{"observed_at":"2026-08-06T22:22:39.299853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-06T19:21:45.336576Z","title":"Kosmos-2.5: A multimodal literate model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05805","last_updated":"2025-07-08T09:24:07Z","snapshot_observed_at":"2026-08-08T00:42:07.626890Z","submitted_at":"2025-07-08T09:24:07Z","title":"DREAM: Document Reconstruction via End-to-end Autoregressive Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:45.336576Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2507.05805"},"observation_digest":"sha256:04e4d4be01426121724da51fc2f3b81f846fbee46c80cbe1231560eac6f23312","observation_id":"195cbc1e-4303-4036-aab0-dde0d903b056","resolution":{"observed_at":"2026-08-06T19:21:45.336576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-08-13T06:49:01.011003Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:5d717994054bae69df0fbe18fa5ec8e0b6f69c301ea0e19798133384a7b0b812","observation_id":"89cb16e3-c619-4a7a-a2b7-0f6800ab48c9","resolution":{"observed_at":"2026-05-19T04:42:04.410171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2603.19790","last_updated":"2026-04-15T01:38:03Z","snapshot_observed_at":"2026-08-12T14:27:23.399017Z","submitted_at":"2026-03-20T09:28:09Z","title":"From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T08:53:18.268970Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2603.19790"},"observation_digest":"sha256:3108c16b51792fa6da2912cc4ff3153bec913312d729e765d72f3af1e0fdf3b1","observation_id":"93b1e719-603b-4d90-b458-ff54a1b5a326","resolution":{"observed_at":"2026-05-15T08:55:19.445174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2604.23813","last_updated":"2026-04-26T17:26:06Z","snapshot_observed_at":"2026-08-11T01:23:51.796022Z","submitted_at":"2026-04-26T17:26:06Z","title":"ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T06:34:56.032634Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2604.23813"},"observation_digest":"sha256:7605633d31b988135cb73667016e147c8b2a6368504571e4980fc816b36552b8","observation_id":"ac398883-1f0d-41be-9a61-1671c3d694c7","resolution":{"observed_at":"2026-05-11T21:11:14.448490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2605.03903","last_updated":"2026-05-05T15:56:12Z","snapshot_observed_at":"2026-08-21T00:04:18.509490Z","submitted_at":"2026-05-05T15:56:12Z","title":"CC-OCR V2: Benchmarking Large Multimodal Models for Literacy in Real-world Document Processing","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-07T16:18:35.484800Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2605.03903"},"observation_digest":"sha256:ce6c15f70a767b8a3516780d4858aac5bd270bc69f48370c5adab28ea7c78bb1","observation_id":"5e2fee03-ac49-4edd-807d-a17ef55f27ec","resolution":{"observed_at":"2026-05-11T23:46:48.986357Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2606.03401","last_updated":"2026-06-02T09:42:29Z","snapshot_observed_at":"2026-07-31T19:49:58.852979Z","submitted_at":"2026-06-02T09:42:29Z","title":"Towards Characterizing Scientific Image Utility and Upgradability","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:37.254428Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2606.03401"},"observation_digest":"sha256:16c9bad668e81f34863c25e3cc2698294558b89b2288fc54ff88a3a836c7d577","observation_id":"ccfa463d-4a18-4714-8688-5414e90469d6","resolution":{"observed_at":"2026-07-02T02:06:27.869035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2606.09132","last_updated":"2026-06-08T07:30:20Z","snapshot_observed_at":"2026-08-14T20:11:57.993629Z","submitted_at":"2026-06-08T07:30:20Z","title":"Vision Language Model Helps Private Information De-Identification in Vision Data","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T16:29:33.294960Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2606.09132"},"observation_digest":"sha256:5c3ee7ce5d9b5f4a36dccd08ca1ce928d48da892af0fde2673a725cea532f908","observation_id":"c7a1dff8-f4d8-44f0-9374-2abae61392f0","resolution":{"observed_at":"2026-07-03T01:27:31.600332Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2606.29378","last_updated":"2026-06-28T13:01:54Z","snapshot_observed_at":"2026-08-14T11:04:33.138446Z","submitted_at":"2026-06-28T13:01:54Z","title":"Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T07:37:05.806389Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2606.29378"},"observation_digest":"sha256:ee054361972f70120f0a5220328da48f99b6cc57ce6c3ec9b0f3cd8d6703726c","observation_id":"7ef6317b-b9f2-48b7-93ea-d1db3b4d17dc","resolution":{"observed_at":"2026-06-30T07:44:22.134761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2607.00596","last_updated":"2026-07-01T08:19:00Z","snapshot_observed_at":"2026-08-07T16:45:17.069643Z","submitted_at":"2026-07-01T08:19:00Z","title":"Semantic-Guided Reading Order Reconstruction in Historical Armenian Newspapers with LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-02T14:47:26.322568Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.00596"},"observation_digest":"sha256:fde293414a155d2cffbd7a2a5352b41017d0c5c9c2728b7e8a3eff39a39fd0c8","observation_id":"aa2516aa-7cdf-4590-b65a-4475a4517604","resolution":{"observed_at":"2026-07-02T14:57:03.927131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-12T05:51:08.895411Z","title":"Kosmos- 2.5: A multimodal literate model.arXiv preprint arXiv:2309.11419,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02956","last_updated":"2026-07-03T04:59:12Z","snapshot_observed_at":"2026-08-14T18:47:59.009039Z","submitted_at":"2026-07-03T04:59:12Z","title":"MORE: A Multilingual Document Parsing Benchmark and Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T05:51:08.895411Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.02956"},"observation_digest":"sha256:5bb474184f489e0d8cb7958120206fdfb5dba1a8ae41254b04f57f4a3b15f748","observation_id":"a1da6840-be94-461b-babc-ab510dd557ab","resolution":{"observed_at":"2026-07-12T05:51:08.895411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":"2309.11419","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-07-10T13:27:05.552868Z","title":"Kosmos-2.5: A multimodal literate model","venue":"cs.CL","work_id":"41248ce1-bc86-4ccc-a85b-bfa7bed6f719","year":2023},"citing_paper":{"arxiv_id":"2607.08029","last_updated":"2026-07-09T01:13:18Z","snapshot_observed_at":"2026-08-05T10:26:29.110651Z","submitted_at":"2026-07-09T01:13:18Z","title":"Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T13:26:41.210163Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.08029"},"observation_digest":"sha256:5cc94391e66d67ca6a2df752a9d757647017569b4ecad0c04387925986b39721","observation_id":"9127f1fe-4245-49f1-9952-7e6a7468c280","resolution":{"observed_at":"2026-07-10T13:27:05.554903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-02T02:58:30.989588Z","title":"Kosmos-2.5: A mul- timodal literate model.arXiv preprint arXiv:2309.11419, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14041","last_updated":"2026-07-15T17:12:37Z","snapshot_observed_at":"2026-08-09T09:44:33.027135Z","submitted_at":"2026-07-15T17:12:37Z","title":"Multi-Expert Routing for Multi-Domain Low-Resource OCR: A Manchu Case Study","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:58:30.989588Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.14041"},"observation_digest":"sha256:fb42b28c72bff6bccc794f29ae645a98a3dc5a902f45a052b3633f9698a7491d","observation_id":"ad987fdd-86ef-40e7-a4a4-e14abcc0413e","resolution":{"observed_at":"2026-08-02T02:58:30.989588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-02T01:25:28.575255Z","title":"arXiv preprint arXiv:2309.11419 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.575255Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:f868505fd298b20eb72fc94cde896f5ced8052652070a869a86ac28c617204e1","observation_id":"af234a1e-faf5-40b5-8d18-930e6cf4014f","resolution":{"observed_at":"2026-08-02T01:25:28.575255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-02T14:55:38.554048Z","title":"arXiv preprint arXiv:2309.11419 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16203","last_updated":"2026-05-05T10:59:34Z","snapshot_observed_at":"2026-08-18T22:19:48.342327Z","submitted_at":"2026-05-05T10:59:34Z","title":"DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-08-02T14:55:38.554048Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.16203"},"observation_digest":"sha256:b6934ee1330b797f8b68099e1b3341dab5b51daa5d12050f977a68d5cdfc741b","observation_id":"6fcf668d-273b-4f2b-a57d-2c8e85e97bd3","resolution":{"observed_at":"2026-08-02T14:55:38.554048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-05T00:46:40.903096Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-08T09:37:16Z","snapshot_observed_at":"2026-08-18T03:20:44.814497Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:46:40.903096Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:ea05713de430b22430f6fa5b6c574ea34883b0ef8ed2b4cdd0b26e10fda20358","observation_id":"daa62925-ab67-491f-b611-66f55496c011","resolution":{"observed_at":"2026-08-05T00:46:40.903096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-07T00:59:55.351147Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00536","last_updated":"2026-08-08T09:37:16Z","snapshot_observed_at":"2026-08-18T03:20:44.814497Z","submitted_at":"2026-08-01T08:45:41Z","title":"DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:59:55.351147Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2608.00536"},"observation_digest":"sha256:05aa34051a3ca8d21b0050c3118f3a90201ffb4f72b8299f2e269d5cdbab694c","observation_id":"9f2100cf-6c2e-4745-baf1-9640a5a0ec1d","resolution":{"observed_at":"2026-08-07T00:59:55.351147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.11419/citation-record","integrity":"/paper/2309.11419/integrity","json":"/paper/2309.11419/citation-record.json","paper":"/paper/2309.11419"},"outbound":[],"paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2309.11419."}