{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3260d5b270d6b28645e75f361a95fc633aa307bbf5280d01223289ad5b84a36d","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:47:40.108730Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T17:57:52.084110Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T18:02:42.492424Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"cited_work":{"arxiv_id":"2506.21600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.21600 (2025)","venue":null,"work_id":"7f77510c-86be-4310-a431-6bec6270abbf","year":2025},"citing_paper":{"arxiv_id":"2604.05418","last_updated":"2026-04-16T09:51:53Z","snapshot_observed_at":"2026-08-03T01:38:19.340462Z","submitted_at":"2026-04-07T04:26:59Z","title":"VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T19:15:02.124035Z"},"links":{"cited_paper":"/paper/2506.21600","citing_paper":"/paper/2604.05418"},"observation_digest":"sha256:5bbfbc2267d7d1bb16a3cff3e965e2a3905a12825ea681b79c2cf95fe61c0c2a","observation_id":"7d9945e1-f706-42c4-ab82-c9d1b362c3f6","resolution":{"observed_at":"2026-05-10T23:15:50.268399Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"cited_work":{"arxiv_id":"2506.21600","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21600","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.21600 (2025)","venue":null,"work_id":"7f77510c-86be-4310-a431-6bec6270abbf","year":2025},"citing_paper":{"arxiv_id":"2605.15223","last_updated":"2026-05-13T08:36:57Z","snapshot_observed_at":"2026-08-03T00:31:17.013638Z","submitted_at":"2026-05-13T08:36:57Z","title":"GenAI-Driven Approach to RISC-V Supply Chain Exploration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T17:57:52.084110Z"},"links":{"cited_paper":"/paper/2506.21600","citing_paper":"/paper/2605.15223"},"observation_digest":"sha256:353aa3b6a7a944338148e6c09f813edbd31ae195ceae36e56038486d272db388","observation_id":"20f42834-92cd-4a98-8b25-b80d443d2d51","resolution":{"observed_at":"2026-05-19T18:02:42.493996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21600/citation-record","integrity":"/paper/2506.21600/integrity","json":"/paper/2506.21600/citation-record.json","paper":"/paper/2506.21600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T23:47:36.566350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.566350Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:e404005d8fb5ede7df402aefce01192703ce983a8400868df1eaa1af9d99878d","observation_id":"8acd3730-8961-4a10-b342-12ef1c3cf138","resolution":{"observed_at":"2026-08-06T23:47:36.566350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.450700Z","title":null,"venue":null,"work_id":"3b23be23-aa93-4131-92cc-49b5cd0e05f1","year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.657341Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:206cf222ae47fab2bd0025bdcfbc309391cb7d4b755f8c35a6743b7239bfbeda","observation_id":"30a5f94e-8089-4023-aafe-5992018c9785","resolution":{"observed_at":"2026-08-06T23:47:41.547846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:47:36.875706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:36.875706Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:ee7bf60c411dec533ba2fff2f88733808eb903bd9d50721736ee9b26b665f78f","observation_id":"0600b700-e1d4-4e72-8565-2a090f881c25","resolution":{"observed_at":"2026-08-06T23:47:36.875706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-07-06T16:21:57.649550Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-08-06T23:47:37.029513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.029513Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:59a2d7a90aef8c8a1c0e4224fbc4a8a28814a2c3df3ce1a8d48780420e9e3b6f","observation_id":"cc0b3ef1-c3a8-45bf-98d5-2e55cdffdfb5","resolution":{"observed_at":"2026-08-06T23:47:37.029513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21439","last_updated":"2024-09-25T06:14:03Z","snapshot_observed_at":"2026-07-06T18:54:54.118506Z","submitted_at":"2024-07-31T08:43:17Z","title":"MLLM Is a Strong Reranker: Advancing Multimodal Retrieval-augmented Generation via Knowledge-enhanced Reranking and Noise-injected Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21439","snapshot_observed_at":"2026-08-06T23:47:37.157188Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.157188Z"},"links":{"cited_paper":"/paper/2407.21439","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0f194f66a06d94a85a0b64c1ed841f94943e7814d3b9e205022da28e5e964e0a","observation_id":"218b0545-9730-4ecd-87a5-7850e7bc3386","resolution":{"observed_at":"2026-08-06T23:47:37.157188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:37.248482Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.248482Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:022ac057268524c8c01e53109099bae1ab87206e7687a7de35aadc85e57172e6","observation_id":"b077fc46-2dbd-4faf-b1fd-3de8e4d6d3c6","resolution":{"observed_at":"2026-08-06T23:47:37.248482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-06T23:47:37.341207Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.341207Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:76464478ea319113cd696d69c76d660ec44b2fc3c50dd23acbced5624360ece5","observation_id":"9cac0801-9dc0-44f0-8672-3fb25f9d59a4","resolution":{"observed_at":"2026-08-06T23:47:37.341207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18424","last_updated":"2025-07-15T17:55:08Z","snapshot_observed_at":"2026-07-06T20:12:45.239449Z","submitted_at":"2024-12-24T13:39:32Z","title":"LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18424","snapshot_observed_at":"2026-08-06T23:47:37.435685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.435685Z"},"links":{"cited_paper":"/paper/2412.18424","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:122c82b6efb2e07d9cabc92fe3e3dc2b738641fa43cb4d90dd34d967ca71471e","observation_id":"557e9e11-9923-40e7-ab49-7003a7901d62","resolution":{"observed_at":"2026-08-06T23:47:37.435685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.257154Z","title":null,"venue":null,"work_id":"39dacef3-17f0-4836-9cad-ed1aec424b9a","year":2022},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.571320Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:3f85dccb4c1ac99e76b5980f14f460823d29b3b8d15d51e64eee6d144af4d61a","observation_id":"c149758f-e1cf-48a9-93a7-df7ed2b5513e","resolution":{"observed_at":"2026-08-06T23:47:41.365001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:41.082068Z","title":null,"venue":null,"work_id":"b0ba74dc-ac7c-4413-8904-81058fa8bb9d","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.737502Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:f705bb7b39ddf5a14362da1c6acd5247277693ec43ad378fe821797a79b22349","observation_id":"930e6e95-fd3f-40d4-aba1-44aa6cc5134f","resolution":{"observed_at":"2026-08-06T23:47:41.188742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.881839Z","title":null,"venue":null,"work_id":"ab94d601-e247-45a0-b808-a4030d68226e","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.851387Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:b9f0a7f7659b886242a27118b402667526cc26b0122c1691b2031882de698078","observation_id":"bef3c24d-2df9-44be-96b1-744e84eb9ba4","resolution":{"observed_at":"2026-08-06T23:47:40.966549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-06T23:47:37.917233Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.917233Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:72956e113b62dba6040cf9cdbd2d64bb466809502839a644b204b3ecb43a9034","observation_id":"a3cc50d5-40d3-4842-8a6f-5866ae0646cb","resolution":{"observed_at":"2026-08-06T23:47:37.917233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13964","last_updated":"2025-03-18T06:57:21Z","snapshot_observed_at":"2026-08-07T16:55:45.055075Z","submitted_at":"2025-03-18T06:57:21Z","title":"MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13964","snapshot_observed_at":"2026-08-06T23:47:37.986765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:37.986765Z"},"links":{"cited_paper":"/paper/2503.13964","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:5f803065b67941365a8fca1e266016da049dce5313681f3a29e2adbd9cea7324","observation_id":"412043ba-676f-4dd1-b790-7765516916aa","resolution":{"observed_at":"2026-08-06T23:47:37.986765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-06T23:47:38.065585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.065585Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0ed6f10ab2caeb691788eef11316ef1bdb85dfe448a6db75f12bb3019a003c07","observation_id":"57b3f667-02d7-41d7-844d-fc169ac4be3f","resolution":{"observed_at":"2026-08-06T23:47:38.065585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15187","last_updated":"2024-10-31T10:10:28Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T14:29:39Z","title":"UDA: A Benchmark Suite for Retrieval Augmented Generation in Real-world Document Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15187","snapshot_observed_at":"2026-08-06T23:47:38.127865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.127865Z"},"links":{"cited_paper":"/paper/2406.15187","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:2b1d6b2046c3ce07a11e45e9b5a789ce09c24dd0ee9e6cec6f4d0f4b209d1aaf","observation_id":"bc40964e-1550-4d09-b463-3499dcb808a3","resolution":{"observed_at":"2026-08-06T23:47:38.127865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.192562Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.192562Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:fc8d9edd6ec6d5eee4138217cf0593e7bda02e44c33b83d42e7ba9330d5e5b14","observation_id":"239b6cb1-c075-4c1e-bba7-b8492bc6a064","resolution":{"observed_at":"2026-08-06T23:47:38.192562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.260351Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.260351Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:649ce9690e481ddeed2fcd1d6ab5cfd7b37b3765bbb1f931bb4aa1d56ce9c6a4","observation_id":"2eec2257-a166-4c77-9288-4436926707e2","resolution":{"observed_at":"2026-08-06T23:47:38.260351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-06T23:47:38.340852Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.340852Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:bde9196f3e76d745deae4711abe3fb50f20da0a2ef83f66f55b6640cfa7c73be","observation_id":"9aa53227-272b-4a98-a7e1-e2a0188a9358","resolution":{"observed_at":"2026-08-06T23:47:38.340852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.403982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.403982Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:96bae4aa7905c3ea50d4279b86a4b92de7ba9ef09a6904764867ef0d347df55a","observation_id":"ebc8cab7-81b4-492d-88e4-331a0e42a767","resolution":{"observed_at":"2026-08-06T23:47:38.403982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.468043Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.468043Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:c7bd9078f5bc0ac63fc1ca93977f0f5961aa2ce4f2c00970a3b725c3877efef6","observation_id":"2990d5ee-d5e0-4891-a994-6db0ccb3a5a5","resolution":{"observed_at":"2026-08-06T23:47:38.468043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-04T10:28:00.554323Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-06T23:47:38.535627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.535627Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:4a2de4e63d086d40b758c8bf308fea398d06d019996322ff6cf2952711a231a7","observation_id":"0a80537c-96f4-40f2-b0c5-5b88f29a12bf","resolution":{"observed_at":"2026-08-06T23:47:38.535627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14213","last_updated":"2024-08-26T04:59:05Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T06:17:23Z","title":"From Text to Pixel: Advancing Long-Context Understanding in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14213","snapshot_observed_at":"2026-08-06T23:47:38.551116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.551116Z"},"links":{"cited_paper":"/paper/2405.14213","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:b6556d89eb97e9ca9f81444b1cb39bf43fed8b1494cb7d8f34a7b3e4631aecab","observation_id":"d6017804-7895-448c-a87a-29dde3b08fba","resolution":{"observed_at":"2026-08-06T23:47:38.551116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-06T23:47:38.698127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.698127Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:e765f6a53cf952a498034a32ca035b07811958d10575076263338193c048a74b","observation_id":"79f003c5-613d-490b-919f-c1a4b29a166a","resolution":{"observed_at":"2026-08-06T23:47:38.698127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.746488Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.746488Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:167b2bcc00feac8380d9903ba5197df09632bef45e50a170c01e5370f22565c9","observation_id":"b1ca93ba-e2ea-40ef-a9fa-ae333345dcc7","resolution":{"observed_at":"2026-08-06T23:47:38.746488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:38.889106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.889106Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0fce9a2d794bc8d7bfc5ea1e6f0d29b2d2b1cccea0696ccde0a19ed7029caa77","observation_id":"d8faca11-f4e7-4fca-9394-9ae8d4b3c52c","resolution":{"observed_at":"2026-08-06T23:47:38.889106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10704","last_updated":"2025-02-11T07:05:58Z","snapshot_observed_at":"2026-08-03T18:46:19.836529Z","submitted_at":"2024-12-14T06:24:55Z","title":"VisDoM: Multi-Document QA with Visually Rich Elements Using Multimodal Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10704","snapshot_observed_at":"2026-08-06T23:47:38.950010Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:38.950010Z"},"links":{"cited_paper":"/paper/2412.10704","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:bfda55b8b6dc2b12d8cf042ec933cd45a51a8a59238e53e41f921dc8c7ee0452","observation_id":"ff12f5d0-58bc-4e1d-b5f3-148668ad2fd0","resolution":{"observed_at":"2026-08-06T23:47:38.950010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T23:47:39.053741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.053741Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:0ecb16c4ebc2c6ccbb2fbd2d64ac112f567ee0eb4c952fa69cfbdc51f5f3e10e","observation_id":"19f8b03b-c390-4246-bd4f-b382c59da653","resolution":{"observed_at":"2026-08-06T23:47:39.053741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:39.158696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.158696Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:dff4166b2679babb4c6c11e1b2b02dc86b8624fdabca9434263108e07661433a","observation_id":"b047a5f4-3c5b-48f0-ad3a-3f8577e8d406","resolution":{"observed_at":"2026-08-06T23:47:39.158696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:39.293516Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.293516Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:d920a0245197698e162f61ca8a2baa2a1847af1376e6025ea74bcd46967f869d","observation_id":"be76b27f-c18f-47c7-b5b5-5781ca506340","resolution":{"observed_at":"2026-08-06T23:47:39.293516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.685785Z","title":null,"venue":null,"work_id":"d3be8e35-bde2-47f8-be56-7631ae3f7539","year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.392380Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:a4ce382bd0f3271097f5ab3a08ad435248c2dd7423c61ab5ae324c3cca6c59ea","observation_id":"7c8db10b-9047-42fc-952b-08b260ff7073","resolution":{"observed_at":"2026-08-06T23:47:40.770888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:47:39.500538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.500538Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:7a67b3607d38a77c01f7d560cd056d8ebb527466fb03dc78958c06d658344c08","observation_id":"ec82f0cf-2614-4cab-a515-ea9b2e0d0c18","resolution":{"observed_at":"2026-08-06T23:47:39.500538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.458902Z","title":null,"venue":null,"work_id":"0aaa6bef-0eb6-4647-82d1-57406bf6c5f6","year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.580634Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:b3d6cb2f70cd0cbd50eda6d16fc0ea3017894de4652bb364d2c6945117aa1194","observation_id":"82d1ece3-d31b-495e-8403-dbc485ef6800","resolution":{"observed_at":"2026-08-06T23:47:40.560631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-06T23:47:39.656467Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.656467Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:96b11a2fefcd6ed61b5c3f49d562cc2f83793372cc7a87473446a1b13a8ced9a","observation_id":"f6d2e2b8-8e95-45c1-8ff7-cd7cace1d5df","resolution":{"observed_at":"2026-08-06T23:47:39.656467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02592","last_updated":"2025-08-30T07:10:08Z","snapshot_observed_at":"2026-08-07T19:18:09.165929Z","submitted_at":"2024-12-03T17:23:47Z","title":"OCR Hinders RAG: Evaluating the Cascading Impact of OCR on Retrieval-Augmented Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02592","snapshot_observed_at":"2026-08-06T23:47:39.775273Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.775273Z"},"links":{"cited_paper":"/paper/2412.02592","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:33cd1840827dfc3ac2b103638be532db750c41c3d5b7040ed7c57242fdf081bf","observation_id":"c30a6f23-c116-4a52-8b63-fd0d3e0629e1","resolution":{"observed_at":"2026-08-06T23:47:39.775273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-07-06T20:00:28.112838Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01818","snapshot_observed_at":"2026-08-06T23:47:39.833498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.833498Z"},"links":{"cited_paper":"/paper/2412.01818","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:04dc11efecf8bb1e85e907a68b88ff26de47fd02856fe4db120eff272b128770","observation_id":"de3b0a21-a37f-471b-b485-d88fd6c34fe7","resolution":{"observed_at":"2026-08-06T23:47:39.833498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T23:47:39.913987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:39.913987Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:ced4081f780d220fe86de5e3fcdc8cda5d3209d1492b06e1823e44cf42a7be57","observation_id":"7a4a81ef-f858-4a2b-89e4-0bbc5135869a","resolution":{"observed_at":"2026-08-06T23:47:39.913987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.022629Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:40.022629Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:9f39192e1752f728bef0825848a5f35f5a62976618e4779329ae0f99da1ade73","observation_id":"a140df1b-6ba0-4536-8ff6-00458565147a","resolution":{"observed_at":"2026-08-06T23:47:40.022629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:47:40.108730Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:47:40.108730Z"},"links":{"citing_paper":"/paper/2506.21600"},"observation_digest":"sha256:e91731442c425f3575b488fbfd102efeb7c2a76afcc3db7a4be45f9f07cafae3","observation_id":"822ab7c7-3dac-4a47-b228-fcb439828671","resolution":{"observed_at":"2026-08-06T23:47:40.108730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21600","last_updated":"2025-06-19T07:16:18Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:42:13.492339Z","submitted_at":"2025-06-19T07:16:18Z","title":"Structured Attention Matters to Multimodal LLMs in Document Understanding"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.21600."}