{"as_of":"2026-08-11T14:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:95742ac0de66d0e18de96da138ce760d7f9899e018ac7b175a94132f512b2ccd","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:17:28.096510Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:55:42.901109Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:42:04.421908Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"cited_work":{"arxiv_id":"2501.02235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02235","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyer*, L., Steiner*, A., Pinto*, A","venue":null,"work_id":"6d76d95a-8795-43bd-beb5-5fe269855f78","year":2025},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-08-11T13:29:02.180869Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2501.02235","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:4c397d748c5343220e7923183a068f7da884ef8e93accadfa9c6d330c31b01be","observation_id":"b6b6da64-0b84-489c-b57c-7971bed9bdb7","resolution":{"observed_at":"2026-05-19T04:42:04.424518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"cited_work":{"arxiv_id":"2501.02235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02235","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyer*, L., Steiner*, A., Pinto*, A","venue":null,"work_id":"6d76d95a-8795-43bd-beb5-5fe269855f78","year":2025},"citing_paper":{"arxiv_id":"2601.21262","last_updated":"2026-04-16T06:59:30Z","snapshot_observed_at":"2026-08-11T08:05:18.804557Z","submitted_at":"2026-01-29T04:47:27Z","title":"CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T10:14:15.589472Z"},"links":{"cited_paper":"/paper/2501.02235","citing_paper":"/paper/2601.21262"},"observation_digest":"sha256:60af330b3cadc6661977ebc8dac1d561b533021c60c619668088752f31149cbb","observation_id":"a011b765-b42d-4abb-b59e-16d2341360cb","resolution":{"observed_at":"2026-05-16T10:17:44.710015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02235","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2501.02235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2501.02235","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:066cc3c8e03a4054212d6d55477331e3e9ac01aed59d7fd57d01942e15566258","observation_id":"18963410-65f3-4049-80f0-aa3e7a05fe89","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02235","snapshot_observed_at":"2026-08-02T14:55:42.901109Z","title":"arXiv preprint arXiv:2501.02235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16203","last_updated":"2026-05-05T10:59:34Z","snapshot_observed_at":"2026-08-10T18:12:24.304206Z","submitted_at":"2026-05-05T10:59:34Z","title":"DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth","version":1},"reference_index":221,"source":"arxiv_source","source_observed_at":"2026-08-02T14:55:42.901109Z"},"links":{"cited_paper":"/paper/2501.02235","citing_paper":"/paper/2607.16203"},"observation_digest":"sha256:d8146ef15eec57cd7c9fc946e4fea035927477b14f4e8769547cc6b4ef617a9e","observation_id":"2a4f9d30-3599-415f-be88-369f081809d4","resolution":{"observed_at":"2026-08-02T14:55:42.901109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02235/citation-record","integrity":"/paper/2501.02235/integrity","json":"/paper/2501.02235/citation-record.json","paper":"/paper/2501.02235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.366319Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.366319Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:7a4d96a9ecb3beabf129877b852b11943e44b6963f270a9c26737968cfcdcccf","observation_id":"a87a521c-e834-4c86-8d73-1b7fc2f1b674","resolution":{"observed_at":"2026-08-10T22:17:27.366319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.374570Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.374570Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:2f4c13b5965183ea361b83921b2a5a7eb482956769bc725207dec3429b052e63","observation_id":"f97ef716-8afa-4527-ae6c-5a1e1a521ce9","resolution":{"observed_at":"2026-08-10T22:17:27.374570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08483","last_updated":"2020-10-27T16:54:17Z","snapshot_observed_at":"2026-08-10T19:59:01.451266Z","submitted_at":"2020-04-17T23:10:18Z","title":"ETC: Encoding Long and Structured Inputs in Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.08483","snapshot_observed_at":"2026-08-10T22:17:27.383485Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.383485Z"},"links":{"cited_paper":"/paper/2004.08483","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:7c200a291da86f753adf052dd57ade67aa31098b442f546a80b91ecd2aee5cb5","observation_id":"2f028033-ebc7-4af0-9d3b-00e8cafeae53","resolution":{"observed_at":"2026-08-10T22:17:27.383485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13883","last_updated":"2024-10-05T16:26:44Z","snapshot_observed_at":"2026-08-02T19:37:18.413834Z","submitted_at":"2024-10-05T16:26:44Z","title":"Transformers Utilization in Chart Understanding: A Review of Recent Advances & Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13883","snapshot_observed_at":"2026-08-10T22:17:27.390834Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.390834Z"},"links":{"cited_paper":"/paper/2410.13883","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:070353ac15edfc2237a4059545da65d8c167f7fb9fd72f503b5127c818adf932","observation_id":"b4fe70d7-730d-44ec-a9d7-0bbe43d0ba8c","resolution":{"observed_at":"2026-08-10T22:17:27.390834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T22:17:27.398595Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.398595Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:7e51f9694490885ea7aadb337f9ba773e5726066f76c88f14e3b5c25b0d083b8","observation_id":"8fdf7032-bfc8-4664-b3fa-fdda4914506e","resolution":{"observed_at":"2026-08-10T22:17:27.398595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11539","last_updated":"2021-09-20T06:12:57Z","snapshot_observed_at":"2026-07-31T03:28:57.550082Z","submitted_at":"2021-06-22T04:28:07Z","title":"DocFormer: End-to-End Transformer for Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11539","snapshot_observed_at":"2026-08-10T22:17:27.407100Z","title":"Manmatha","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.407100Z"},"links":{"cited_paper":"/paper/2106.11539","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:9f9fbb6d0ca7013672e12eab8561efeb6c4df0e7788ccea4cb9cfa04054c2410","observation_id":"b31782bb-a13f-4b1f-b46a-5df1dbbe8e02","resolution":{"observed_at":"2026-08-10T22:17:27.407100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01733","last_updated":"2023-06-02T17:58:03Z","snapshot_observed_at":"2026-08-06T19:09:03.164636Z","submitted_at":"2023-06-02T17:58:03Z","title":"DocFormerv2: Local Features for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01733","snapshot_observed_at":"2026-08-10T22:17:27.414864Z","title":"Manmatha","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.414864Z"},"links":{"cited_paper":"/paper/2306.01733","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:27bc5589b6634d2f76b742f637cda0be5e744ffc1bf077d4926339c2d20e6796","observation_id":"cc4dcb05-74b7-407e-ab3b-6b50f37df76f","resolution":{"observed_at":"2026-08-10T22:17:27.414864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:17:27.422891Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.422891Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:46380b3c76fa3088e48392bc7ed2b3467c205bdca0111bec0dd4b0cfd96a6176","observation_id":"5522fe15-c9fd-4eb3-839e-a640778e2d68","resolution":{"observed_at":"2026-08-10T22:17:27.422891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03411","last_updated":"2024-03-18T09:47:24Z","snapshot_observed_at":"2026-07-06T17:12:26.471069Z","submitted_at":"2024-01-07T08:03:06Z","title":"GRAM: Global Reasoning for Multi-Page VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03411","snapshot_observed_at":"2026-08-10T22:17:27.431622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.431622Z"},"links":{"cited_paper":"/paper/2401.03411","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:458230bd3eadc435994134ce5170da5fce443e6ea432dd0d932b5acdf3922cd5","observation_id":"9ce5017d-ae49-4033-b08b-d5fe46fbd72d","resolution":{"observed_at":"2026-08-10T22:17:27.431622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-10T22:17:27.438492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.438492Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:0bb145387d440c34ce6ef1561f5a5ed1e386c7522d52d8932e26a37e21fcb837","observation_id":"3ceb1194-763e-4333-a493-58cae499d38e","resolution":{"observed_at":"2026-08-10T22:17:27.438492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04632","last_updated":"2024-08-08T17:59:46Z","snapshot_observed_at":"2026-08-04T19:29:34.717694Z","submitted_at":"2024-08-08T17:59:46Z","title":"Arctic-TILT. Business Document Understanding at Sub-Billion Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04632","snapshot_observed_at":"2026-08-10T22:17:27.445253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.445253Z"},"links":{"cited_paper":"/paper/2408.04632","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:a1442f19bbc7e8dde6654b3a585ae3f617833bd0d1a5bb086ee7ff6210157e11","observation_id":"3e7365d8-7ece-469f-9786-363106f73bed","resolution":{"observed_at":"2026-08-10T22:17:27.445253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01131","last_updated":"2023-09-03T10:14:34Z","snapshot_observed_at":"2026-07-06T16:13:42.284158Z","submitted_at":"2023-09-03T10:14:34Z","title":"Attention Where It Matters: Rethinking Visual Document Understanding with Selective Region Concentration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01131","snapshot_observed_at":"2026-08-10T22:17:27.452347Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.452347Z"},"links":{"cited_paper":"/paper/2309.01131","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:17ab9be903ae5b7afb460065c0a6073cacf4994eacdcc7d59484d6c9955cf78c","observation_id":"1d80531d-da38-4266-b14c-f2c504a58cc2","resolution":{"observed_at":"2026-08-10T22:17:27.452347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.12872","last_updated":"2020-05-28T17:37:23Z","snapshot_observed_at":"2026-08-10T14:01:30.291640Z","submitted_at":"2020-05-26T17:06:38Z","title":"End-to-End Object Detection with Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.12872","snapshot_observed_at":"2026-08-10T22:17:27.459874Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.459874Z"},"links":{"cited_paper":"/paper/2005.12872","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ae88dacbff6e659655eb37dec57aca5589937fa3a96f6b7e9530576fa64cf6bd","observation_id":"b9ebb039-5d0e-46ed-b1b0-eaee596f8ea9","resolution":{"observed_at":"2026-08-10T22:17:27.459874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-08-10T22:17:27.466019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.466019Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c6ee562d96bcfa5ab465ea3f94c171962cd30e0d9c9f6d61a257369fe9bc8c65","observation_id":"1ce00d56-c995-4d7b-b8cc-998ca2f0ef98","resolution":{"observed_at":"2026-08-10T22:17:27.466019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-11T03:48:37.509000Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-10T22:17:27.472844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.472844Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:04073b3bff7afcdb73728650658fe42a66bc039f585364818aed168ebbe14804","observation_id":"5d19ddcd-8134-4d6a-bcfb-06d07fa22729","resolution":{"observed_at":"2026-08-10T22:17:27.472844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08698","last_updated":"2021-11-03T04:36:53Z","snapshot_observed_at":"2026-08-09T04:39:19.816497Z","submitted_at":"2021-04-18T03:44:57Z","title":"A Simple and Effective Positional Encoding for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08698","snapshot_observed_at":"2026-08-10T22:17:27.479336Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.479336Z"},"links":{"cited_paper":"/paper/2104.08698","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:a5fff155d4abb7a5c9fc10d38478e5b65c346b9eca5898048248e57672ba3a5c","observation_id":"f844ec4a-2413-4aff-b8b1-5606877cd5ca","resolution":{"observed_at":"2026-08-10T22:17:27.479336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11740","last_updated":"2020-07-17T22:19:59Z","snapshot_observed_at":"2026-08-09T19:02:25.484253Z","submitted_at":"2019-09-25T20:02:54Z","title":"UNITER: UNiversal Image-TExt Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11740","snapshot_observed_at":"2026-08-10T22:17:27.486497Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.486497Z"},"links":{"cited_paper":"/paper/1909.11740","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:a5384614b6d0883fdcc0b2af33426d7460dce1e4bab22fe3c72524b6c18dd2fd","observation_id":"671a0c85-5eee-4c68-bcdb-5b3249cb232b","resolution":{"observed_at":"2026-08-10T22:17:27.486497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-08-10T22:17:27.493239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.493239Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:e4b9c1811bee92059887e8acef830f34efa1bd7d2eac5d4cc1c5b2a46d67a8a5","observation_id":"0cc1a2e8-291e-4aa2-ab54-d3a8adb086c5","resolution":{"observed_at":"2026-08-10T22:17:27.493239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-08-11T03:20:35.146270Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-10T22:17:27.499998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.499998Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ab328ec35d923b270938d06bde97da066dc64376a2440230c9bdfb36009ee2c1","observation_id":"3d9c5f0f-aba5-42e8-8937-f1436a47afb6","resolution":{"observed_at":"2026-08-10T22:17:27.499998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.510035Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.510035Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:2d41c9e1bb41e64a4d95f534d51bb2f6cea0c66c16e014369aa0efdb269e0a8a","observation_id":"dbbd4caf-45b3-4356-a7cc-f6619b9dd0ed","resolution":{"observed_at":"2026-08-10T22:17:27.510035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16618","last_updated":"2022-06-15T19:51:01Z","snapshot_observed_at":"2026-07-06T12:54:57.705383Z","submitted_at":"2022-03-30T19:02:53Z","title":"End-to-end Document Recognition and Understanding with Dessurt","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16618","snapshot_observed_at":"2026-08-10T22:17:27.519732Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.519732Z"},"links":{"cited_paper":"/paper/2203.16618","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:68e8462768dee3f0519ae2b3fd3725e3b1b5182bab745f9a4d1141fe3f63a58b","observation_id":"1f5e7bc3-c235-4d08-a821-657d948ca559","resolution":{"observed_at":"2026-08-10T22:17:27.519732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14806","last_updated":"2020-12-03T02:47:41Z","snapshot_observed_at":"2026-08-10T12:14:59.071539Z","submitted_at":"2020-06-26T05:44:54Z","title":"TURL: Table Understanding through Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14806","snapshot_observed_at":"2026-08-10T22:17:27.527458Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.527458Z"},"links":{"cited_paper":"/paper/2006.14806","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:73fecaf73fa96282edba8ac0af400c15e8bab77b9382e1ec109c246478e4b991","observation_id":"45c1ef9c-8ae0-4295-b6c2-ab2e0237dd5a","resolution":{"observed_at":"2026-08-10T22:17:27.527458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12484","last_updated":"2023-05-01T21:09:08Z","snapshot_observed_at":"2026-07-06T15:19:35.578148Z","submitted_at":"2023-04-24T22:48:29Z","title":"DocParser: End-to-end OCR-free Information Extraction from Visually Rich Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12484","snapshot_observed_at":"2026-08-10T22:17:27.536554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.536554Z"},"links":{"cited_paper":"/paper/2304.12484","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:d41a98c4f56e1b863632c3f04afbcdff428a5a723d843ff698b94db131db7466","observation_id":"7cb73613-b01f-495c-bbd8-aa0f4b58c866","resolution":{"observed_at":"2026-08-10T22:17:27.536554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01287","last_updated":"2025-06-20T10:23:37Z","snapshot_observed_at":"2026-08-07T05:39:38.030448Z","submitted_at":"2024-08-02T14:19:34Z","title":"Deep Learning based Visually Rich Document Content Understanding: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01287","snapshot_observed_at":"2026-08-10T22:17:27.543243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.543243Z"},"links":{"cited_paper":"/paper/2408.01287","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4ec1cc24b8725a6804f3d75b8b070724c279bd6eda201adbd179be3ad96a3e84","observation_id":"aedf4986-3e8a-4395-982f-8252b9bd0f4d","resolution":{"observed_at":"2026-08-10T22:17:27.543243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.551174Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.551174Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:44ba7dd35cb540bc6677e75997f7ddcc55dd19cf77e9b78e7c0f4ae270174e96","observation_id":"2f07980a-0123-4c16-817d-08848457040d","resolution":{"observed_at":"2026-08-10T22:17:27.551174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-10T22:17:27.557702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.557702Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:8e06bd5a4656e4805ac0f226721ee035e4572932595e24718ba2d60dc2335ce3","observation_id":"08e4b647-bd1e-4562-a1c9-ced97488f4b5","resolution":{"observed_at":"2026-08-10T22:17:27.557702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-10T22:17:27.564498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.564498Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:a09cce688a2e6e9f654f945a0642cd48bae97e3a7dfed7cbef26fe5c26715f44","observation_id":"212c6106-97e8-4c8f-a7b7-e2aa6176e97a","resolution":{"observed_at":"2026-08-10T22:17:27.564498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11810","last_updated":"2024-11-25T18:17:12Z","snapshot_observed_at":"2026-08-11T01:04:14.640609Z","submitted_at":"2023-11-20T14:42:25Z","title":"DocPedia: Unleashing the Power of Large Multimodal Model in the Frequency Domain for Versatile Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11810","snapshot_observed_at":"2026-08-10T22:17:27.570746Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.570746Z"},"links":{"cited_paper":"/paper/2311.11810","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4548d475567ccacb8c74119347c43117d9aaf6d7c8abb571d487007c738bd0fa","observation_id":"6cfec1f6-86e8-4190-8d26-71614137f408","resolution":{"observed_at":"2026-08-10T22:17:27.570746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11592","last_updated":"2023-09-02T04:28:42Z","snapshot_observed_at":"2026-08-10T17:26:46.598883Z","submitted_at":"2023-08-19T17:32:34Z","title":"UniDoc: A Universal Large Multimodal Model for Simultaneous Text Detection, Recognition, Spotting and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11592","snapshot_observed_at":"2026-08-10T22:17:27.577212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.577212Z"},"links":{"cited_paper":"/paper/2308.11592","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3a63dfef5cd9a1018f6ba0c175f34023fbb6a3c4188cc5cd3097533e0d4c772a","observation_id":"933f771a-b857-4313-bd4a-d0c0c2c23601","resolution":{"observed_at":"2026-08-10T22:17:27.577212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14252","last_updated":"2024-03-21T09:25:24Z","snapshot_observed_at":"2026-08-05T14:02:48.566545Z","submitted_at":"2024-03-21T09:25:24Z","title":"LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding","version":1},"cited_work":{"arxiv_id":"2403.14252","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14252","snapshot_observed_at":"2026-08-10T22:17:30.779206Z","title":"LayoutLLM: Large Language Model Instruction Tuning for Visually Rich Document Understanding","venue":"cs.CL","work_id":"88f889ad-d9c7-4a32-b382-b99095fd66ac","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.584075Z"},"links":{"cited_paper":"/paper/2403.14252","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:bb5e3f4b1ec88a53a064c13a06c601ad8f1bbd9fd7d5bf9bfc6cefde04388449","observation_id":"cb67e5b8-9347-4fe9-a764-99d2ead83b82","resolution":{"observed_at":"2026-08-10T22:17:30.786704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.591368Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.591368Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:16bb3f3a1b3faac1201616784510706eb46f6b9ab74dbf521a571a00d8d291e7","observation_id":"0674f496-1aea-4dd0-874e-205e988f1887","resolution":{"observed_at":"2026-08-10T22:17:27.591368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03403","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:30.737801Z","title":null,"venue":null,"work_id":"eb0c2ced-f50d-4dd6-837d-7cff72f07b06","year":2025},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.599532Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ee6f9a110896b6a18fdd633d91ce435664836940527d5bc982e12d0f80f4de74","observation_id":"52252601-a075-4735-ab8b-826497012417","resolution":{"observed_at":"2026-08-10T22:17:30.750564Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06881","last_updated":"2022-12-08T12:34:16Z","snapshot_observed_at":"2026-08-07T05:49:25.435910Z","submitted_at":"2022-07-14T13:00:22Z","title":"Recurrent Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06881","snapshot_observed_at":"2026-08-10T22:17:27.607101Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.607101Z"},"links":{"cited_paper":"/paper/2207.06881","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4ff0092fc71242646d551883e6e644c3f84dc1348ca20ee7ce2a0542fc08f249","observation_id":"6c25711d-786e-48b7-8621-cfa1da1a74b2","resolution":{"observed_at":"2026-08-10T22:17:27.607101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:17:27.615379Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.615379Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c635129989ec971c12ef49d2a52c2c694044bc38a45af1fb7bbd171e3207f276","observation_id":"67d31d31-fe16-4d7f-9b15-afaae4507a37","resolution":{"observed_at":"2026-08-10T22:17:27.615379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04539","last_updated":"2022-04-05T13:51:47Z","snapshot_observed_at":"2026-08-06T19:51:46.730173Z","submitted_at":"2021-08-10T09:30:23Z","title":"BROS: A Pre-trained Language Model Focusing on Text and Layout for Better Key Information Extraction from Documents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.04539","snapshot_observed_at":"2026-08-10T22:17:27.622203Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.622203Z"},"links":{"cited_paper":"/paper/2108.04539","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:f44c7687af8906d56188fc26c4803c6c03d31480505f57e507f5f22fd2def597","observation_id":"4841cf7d-fd52-4d7c-9dd1-52dbefd08ce2","resolution":{"observed_at":"2026-08-10T22:17:27.622203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-10T22:17:27.630693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.630693Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:844b8e5ea5de56093c6d75633fd5eb491ac3af9110a0ce94f0cc16651a8bf241","observation_id":"217d370a-9e1e-4a49-8939-8182104f7c3c","resolution":{"observed_at":"2026-08-10T22:17:27.630693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-10T22:17:27.639579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.639579Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:6471889f7594eb2c71990ee3df19c99cf68ab788b8aaf4db60f12140e108ebe3","observation_id":"293a213d-5bfb-4193-a461-b7e04c19e7f7","resolution":{"observed_at":"2026-08-10T22:17:27.639579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-10T00:01:53.009712Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-10T22:17:27.645608Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.645608Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3ac98c0fbd9b86554901a0447f01f83a2d12c063b5db6d87d36e55986291a9ea","observation_id":"2130ea05-3bd0-4f24-b5f2-f834062031b3","resolution":{"observed_at":"2026-08-10T22:17:27.645608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11887","last_updated":"2025-02-10T07:31:35Z","snapshot_observed_at":"2026-07-06T19:17:32.745266Z","submitted_at":"2024-09-18T11:34:28Z","title":"DocMamba: Efficient Document Pre-training with State Space Model","version":2},"cited_work":{"arxiv_id":"2409.11887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.11887","snapshot_observed_at":"2026-08-10T22:17:30.416235Z","title":"DocMamba: Efficient Document Pre-training with State Space Model","venue":"cs.CL","work_id":"49e531a2-63a1-4121-932f-aab6dfd33e59","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.653498Z"},"links":{"cited_paper":"/paper/2409.11887","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:504ed6cc883f6bababd2b0fcee07b7e548f8cfcfe442006451bb26d5418349ab","observation_id":"473e2b7f-a936-4fdf-a9d9-8f2cc0945bfd","resolution":{"observed_at":"2026-08-10T22:17:30.424784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.668883Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.668883Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:993cea2e5e0f23a9351af2cff813558303d0e85fa0cf153878aefa160c711d74","observation_id":"bb04131f-41b7-41b4-b2cb-fe9ee3b324ac","resolution":{"observed_at":"2026-08-10T22:17:27.668883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08387","last_updated":"2022-07-19T06:41:15Z","snapshot_observed_at":"2026-08-08T01:32:57.338110Z","submitted_at":"2022-04-18T16:19:52Z","title":"LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08387","snapshot_observed_at":"2026-08-10T22:17:27.678099Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.678099Z"},"links":{"cited_paper":"/paper/2204.08387","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:0dd4315a57e5b23b3b107e82e9b522ac859c4047dd2d87079a5d324d05686ad3","observation_id":"921d78d4-9d5c-4ed5-af6c-1612d4efa661","resolution":{"observed_at":"2026-08-10T22:17:27.678099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-06T10:03:36.325862Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-10T22:17:27.686894Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.686894Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3bafa2c708230c55fc8d37694213b6318a3f0b6dbb73bb88b6c2201db4d98147","observation_id":"9be746ae-776c-4683-94bf-deb8101e035e","resolution":{"observed_at":"2026-08-10T22:17:27.686894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08455","last_updated":"2023-09-11T10:36:41Z","snapshot_observed_at":"2026-08-09T23:11:24.173697Z","submitted_at":"2023-05-15T08:54:32Z","title":"Document Understanding Dataset and Evaluation (DUDE)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08455","snapshot_observed_at":"2026-08-10T22:17:27.698732Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.698732Z"},"links":{"cited_paper":"/paper/2305.08455","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4001cb54f1f043d226054d080105386042658114f87864e7811fce43e6f85b9d","observation_id":"3d07c202-f27d-46ba-9984-8437a160391e","resolution":{"observed_at":"2026-08-10T22:17:27.698732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-10T22:17:27.705612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.705612Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:e58e47fd361b222f8c40a81b07af8bdc8ecf5659ab3cd72f6f6d3c9fec3cc13b","observation_id":"fa021069-4a9b-48bb-9cf6-9aebacad6cc4","resolution":{"observed_at":"2026-08-10T22:17:27.705612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08411","last_updated":"2022-03-24T00:17:27Z","snapshot_observed_at":"2026-08-03T10:00:55.617159Z","submitted_at":"2022-03-16T06:02:02Z","title":"FormNet: Structural Encoding beyond Sequential Modeling in Form Document Information Extraction","version":2},"cited_work":{"arxiv_id":"2203.08411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08411","snapshot_observed_at":"2026-08-10T22:17:30.237330Z","title":"FormNet: Structural Encoding beyond Sequential Modeling in Form Document Information Extraction","venue":"cs.CL","work_id":"3eb869e0-4c70-4025-9e16-701464534ca6","year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.714235Z"},"links":{"cited_paper":"/paper/2203.08411","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:53712a7c32b357adfb119587c124cc2d60f4ee5231f898761a888cff9264a0ae","observation_id":"aff5fb33-c7ed-4ee1-a598-68b3bff6e210","resolution":{"observed_at":"2026-08-10T22:17:30.247387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03347","last_updated":"2023-06-15T21:34:23Z","snapshot_observed_at":"2026-08-07T17:46:06.262385Z","submitted_at":"2022-10-07T06:42:06Z","title":"Pix2Struct: Screenshot Parsing as Pretraining for Visual Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03347","snapshot_observed_at":"2026-08-10T22:17:27.721321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.721321Z"},"links":{"cited_paper":"/paper/2210.03347","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:bc13b6e0b78a837f42498eebb950809b33186d790943230ff5eeee2b3774739d","observation_id":"d343a2fb-2145-4c82-ab37-cec424bc1cec","resolution":{"observed_at":"2026-08-10T22:17:27.721321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11401","last_updated":"2021-04-12T15:42:18Z","snapshot_observed_at":"2026-08-07T05:44:30.677502Z","submitted_at":"2020-05-22T21:34:34Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11401","snapshot_observed_at":"2026-08-10T22:17:27.727769Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.727769Z"},"links":{"cited_paper":"/paper/2005.11401","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:00cc971886c7c8fda92cc2bb9f995af590b4a5c0963208b60a627f67399334ed","observation_id":"2a7c3aee-0a59-4cdb-b524-4588676e8914","resolution":{"observed_at":"2026-08-10T22:17:27.727769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11210","last_updated":"2021-05-24T11:33:20Z","snapshot_observed_at":"2026-08-05T02:44:53.546917Z","submitted_at":"2021-05-24T11:33:20Z","title":"StructuralLM: Structural Pre-training for Form Understanding","version":1},"cited_work":{"arxiv_id":"2105.11210","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.11210","snapshot_observed_at":"2026-08-10T22:17:30.141479Z","title":"StructuralLM: Structural Pre-training for Form Understanding","venue":"cs.CL","work_id":"ff5e0c5a-ee86-4b32-a7b5-e7a340dd96d8","year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.734958Z"},"links":{"cited_paper":"/paper/2105.11210","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c104c8c89e33bc1016f4a2677b5991afeb35c3be7e09a97bb57dc2d8db80859a","observation_id":"a276cd64-bbde-48a1-914f-20e41eea28b8","resolution":{"observed_at":"2026-08-10T22:17:30.150455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19700","last_updated":"2024-10-18T10:15:29Z","snapshot_observed_at":"2026-07-06T19:24:08.391909Z","submitted_at":"2024-09-29T13:16:37Z","title":"2D-TPE: Two-Dimensional Positional Encoding Enhances Table Understanding for Large Language Models","version":3},"cited_work":{"arxiv_id":"2409.19700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.19700","snapshot_observed_at":"2026-08-10T22:17:30.093133Z","title":"2D-TPE: Two-Dimensional Positional Encoding Enhances Table Understanding for Large Language Models","venue":"cs.CL","work_id":"b8b7ac76-42e9-432d-be81-424e1030123c","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.742135Z"},"links":{"cited_paper":"/paper/2409.19700","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:45d1ab87f33e0fc20cef9ee51b83b6169877b1a8bc71760a1a094d13a7f42f78","observation_id":"8090ed47-0e84-4d48-bbbd-307b8dd3ceb1","resolution":{"observed_at":"2026-08-10T22:17:30.102896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02378","last_updated":"2022-07-19T04:15:51Z","snapshot_observed_at":"2026-08-10T08:45:22.878252Z","submitted_at":"2022-03-04T15:34:46Z","title":"DiT: Self-supervised Pre-training for Document Image Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02378","snapshot_observed_at":"2026-08-10T22:17:27.749896Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.749896Z"},"links":{"cited_paper":"/paper/2203.02378","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:f08bb74945ac726accbb95db5aa259da7798a84ed1600fe08f46a131d1686c63","observation_id":"940e10ee-762a-4aff-93d6-79c8f2f618d9","resolution":{"observed_at":"2026-08-10T22:17:27.749896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-10T22:17:27.757395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.757395Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:e8a7e8db1cc52bb6845248b966cd101ca929aa02a3e6c6737d57021c71122b68","observation_id":"78e5d51d-411e-48f0-8235-6f0ef20d85f5","resolution":{"observed_at":"2026-08-10T22:17:27.757395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03331","last_updated":"2021-06-07T04:19:49Z","snapshot_observed_at":"2026-08-11T02:31:38.989741Z","submitted_at":"2021-06-07T04:19:49Z","title":"SelfDoc: Self-Supervised Document Representation Learning","version":1},"cited_work":{"arxiv_id":"2106.03331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.03331","snapshot_observed_at":"2026-08-10T22:17:29.983133Z","title":"SelfDoc: Self-Supervised Document Representation Learning","venue":"cs.CV","work_id":"ebfe8f62-0c8b-4538-8aa9-9dfe19197077","year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.763901Z"},"links":{"cited_paper":"/paper/2106.03331","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:11d3e982f4b23c3a0f6236fe03fca5dc67dc06ea68545d115223ad83b27a553a","observation_id":"4ca0d8ba-6634-4cc8-b16f-9c3b3959f829","resolution":{"observed_at":"2026-08-10T22:17:29.990042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-10T22:17:27.769861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.769861Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:867d235c0811efdd89f6e2d0d36a861517ff3ff99ad6239c7ee0bcd0d5f1a401","observation_id":"71909ff6-8976-435a-8fde-f3e3fed2aac0","resolution":{"observed_at":"2026-08-10T22:17:27.769861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.776999Z","title":"Li, Xiantao Cai, Bo Du, and Hai Zhao","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.776999Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:91c14cd473210619f57f564c117557a8028600d896416246fbc3066e24d22c18","observation_id":"04c89e9c-8933-49ab-be6e-bb6d86d622ff","resolution":{"observed_at":"2026-08-10T22:17:27.776999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T22:17:27.783705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.783705Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:891dc45def91d11ff712801c25e6bb679dcbe25680e8f71715206a2293ddc1c9","observation_id":"7933008f-4111-4d9d-b21e-4b86bde448c7","resolution":{"observed_at":"2026-08-10T22:17:27.783705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-10T22:17:27.790703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.790703Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:430ffdf995544acb4bf12de026502071d9d1f09d4e5690696902e4fa43809b50","observation_id":"42c0552b-b785-414c-8216-a17b76ff1262","resolution":{"observed_at":"2026-08-10T22:17:27.790703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07929","last_updated":"2023-07-16T02:59:30Z","snapshot_observed_at":"2026-07-06T15:54:28.831510Z","submitted_at":"2023-07-16T02:59:30Z","title":"DocTr: Document Transformer for Structured Information Extraction in Documents","version":1},"cited_work":{"arxiv_id":"2307.07929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.07929","snapshot_observed_at":"2026-08-10T22:17:29.871281Z","title":"DocTr: Document Transformer for Structured Information Extraction in Documents","venue":"cs.CV","work_id":"3ccbeea5-f41d-46ce-b06a-a55762a9bb44","year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.796840Z"},"links":{"cited_paper":"/paper/2307.07929","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:f9743aa7956e93cddaf71dbbc98db605666c2457d6b4c2b6280a77228128affd","observation_id":"017efb57-c07a-4094-9927-3e3876af7e55","resolution":{"observed_at":"2026-08-10T22:17:29.877415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15045","last_updated":"2025-03-19T10:05:04Z","snapshot_observed_at":"2026-08-06T18:59:22.667732Z","submitted_at":"2024-08-27T13:13:38Z","title":"DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15045","snapshot_observed_at":"2026-08-10T22:17:27.802900Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.802900Z"},"links":{"cited_paper":"/paper/2408.15045","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:fbb7905485001415cf8f6c25f99ee38b6839dbe2e663c6b7c6521ea982902ec0","observation_id":"195cf54e-b498-4da7-9066-a0ab28b3dd3f","resolution":{"observed_at":"2026-08-10T22:17:27.802900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-10T22:17:27.808805Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.808805Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:21b9155b653b306b1c4a6c14c4b706bb6cf63951a2bbaef2e09fd3fe0f8d80c8","observation_id":"678ba77d-103b-4b67-9a82-425fee3c4328","resolution":{"observed_at":"2026-08-10T22:17:27.808805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06918","last_updated":"2024-04-10T11:10:50Z","snapshot_observed_at":"2026-07-06T17:58:12.766206Z","submitted_at":"2024-04-10T11:10:50Z","title":"HRVDA: High-Resolution Visual Document Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06918","snapshot_observed_at":"2026-08-10T22:17:27.815410Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.815410Z"},"links":{"cited_paper":"/paper/2404.06918","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:351b3d3ff305f9a3135fd2b38e1dc38229145e0c2b8fedb9a00310ae5492a9e2","observation_id":"8278004f-44fd-44d6-b2b9-f1d83de8f5ca","resolution":{"observed_at":"2026-08-10T22:17:27.815410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10505","last_updated":"2023-05-23T18:28:39Z","snapshot_observed_at":"2026-08-10T23:31:23.661876Z","submitted_at":"2022-12-20T18:20:50Z","title":"DePlot: One-shot visual language reasoning by plot-to-table translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10505","snapshot_observed_at":"2026-08-10T22:17:27.822404Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.822404Z"},"links":{"cited_paper":"/paper/2212.10505","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:1d8aa471725c177d621d41086cdde3955898248f70c0ceadf2e48bfb3683e066","observation_id":"86a8ca76-d402-4570-861e-7ce36df88bbb","resolution":{"observed_at":"2026-08-10T22:17:27.822404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08227","last_updated":"2022-04-18T09:22:55Z","snapshot_observed_at":"2026-07-06T13:01:16.149096Z","submitted_at":"2022-04-18T09:22:55Z","title":"The Devil is in the Frequency: Geminated Gestalt Autoencoder for Self-Supervised Visual Pre-Training","version":1},"cited_work":{"arxiv_id":"2204.08227","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.08227","snapshot_observed_at":"2026-08-10T22:17:29.739998Z","title":"The Devil is in the Frequency: Geminated Gestalt Autoencoder for Self-Supervised Visual Pre-Training","venue":"cs.CV","work_id":"e65877e8-e593-497d-907e-036e236f1be6","year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.828435Z"},"links":{"cited_paper":"/paper/2204.08227","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:e5bdbdccee993d2378af5789c828054f9e713de248adac271890a87d297b375b","observation_id":"4df51213-601d-4b76-9bcd-678678c3e131","resolution":{"observed_at":"2026-08-10T22:17:29.746407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-10T22:17:27.834093Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.834093Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:254febd52c77f818fc850c789779497b33574eb3e0879f8c36bbc30bf29fbcdd","observation_id":"b40beacd-a01f-4471-96be-11bfc57346a6","resolution":{"observed_at":"2026-08-10T22:17:27.834093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09883","last_updated":"2022-04-11T16:03:17Z","snapshot_observed_at":"2026-08-09T14:31:05.781911Z","submitted_at":"2021-11-18T18:59:33Z","title":"Swin Transformer V2: Scaling Up Capacity and Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09883","snapshot_observed_at":"2026-08-10T22:17:27.840714Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.840714Z"},"links":{"cited_paper":"/paper/2111.09883","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:2c131b945bf7749c10829ceb3f0641401ebfde10a2491268265f1eb96810b590","observation_id":"6c1a6122-37c8-4037-813a-31867920994a","resolution":{"observed_at":"2026-08-10T22:17:27.840714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14030","last_updated":"2021-08-17T16:41:34Z","snapshot_observed_at":"2026-08-07T00:32:15.123562Z","submitted_at":"2021-03-25T17:59:31Z","title":"Swin Transformer: Hierarchical Vision Transformer using Shifted Windows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14030","snapshot_observed_at":"2026-08-10T22:17:27.846947Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.846947Z"},"links":{"cited_paper":"/paper/2103.14030","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3d1845a987d325d225aea838a8888fb1dde5b3119b3175dcdcc31982faf4cf7f","observation_id":"42d20a12-8dbd-4391-a271-9cee8c121a02","resolution":{"observed_at":"2026-08-10T22:17:27.846947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05278","last_updated":"2024-04-12T10:26:01Z","snapshot_observed_at":"2026-08-05T05:02:51.320588Z","submitted_at":"2023-12-08T09:02:45Z","title":"Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05278","snapshot_observed_at":"2026-08-10T22:17:27.852506Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.852506Z"},"links":{"cited_paper":"/paper/2312.05278","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:0ddb8508d0478e913d2457c1c36e5433e35c4a3c31275d48c08af83a703ca781","observation_id":"6cbfde75-2dbb-48b7-94af-bed52354636e","resolution":{"observed_at":"2026-08-10T22:17:27.852506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-10T11:40:09.342794Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-10T22:17:27.859474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.859474Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:37125484cb31c458719a14a9ab29e52eb88b88c08a3a9e4806faf6c16fa4cd7f","observation_id":"2e5db2af-59d7-494f-b743-b43cde59b289","resolution":{"observed_at":"2026-08-10T22:17:27.859474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-02T15:31:34.622625Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-10T22:17:27.865103Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.865103Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:02178e03dc06f485115abd1d5c0b939ee408f3e6e9b101d6fbcad69076d48e01","observation_id":"46f1f4dd-0b04-4f43-867f-71dad31aed6a","resolution":{"observed_at":"2026-08-10T22:17:27.865103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11795","last_updated":"2025-04-06T18:52:08Z","snapshot_observed_at":"2026-08-04T05:24:14.383678Z","submitted_at":"2024-08-21T17:36:37Z","title":"EE-MLLM: A Data-Efficient and Compute-Efficient Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11795","snapshot_observed_at":"2026-08-10T22:17:27.871393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.871393Z"},"links":{"cited_paper":"/paper/2408.11795","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:0c934951bd4370f52de769d515cc0c78032c517482757c4a123b4c566d10a7ef","observation_id":"059369a6-f95f-460d-a178-cdab4bdbbb61","resolution":{"observed_at":"2026-08-10T22:17:27.871393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-05T00:28:25.127698Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-08-10T22:17:27.878444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.878444Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ee3eb24eb72a4d52ad8660b56ca293449244bff05deff5c7884a3f38b0e46259","observation_id":"52ff63e4-f94b-4245-9fff-2ff617cce2dc","resolution":{"observed_at":"2026-08-10T22:17:27.878444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01523","last_updated":"2024-11-12T04:37:44Z","snapshot_observed_at":"2026-08-06T08:51:10.907429Z","submitted_at":"2024-07-01T17:59:26Z","title":"MMLongBench-Doc: Benchmarking Long-context Document Understanding with Visualizations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01523","snapshot_observed_at":"2026-08-10T22:17:27.885274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.885274Z"},"links":{"cited_paper":"/paper/2407.01523","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3fa0e59126d2dabae751cb13e57b0547d65b177ab04f24e2492683bf6ea1ff36","observation_id":"efecb521-6231-4109-a8cc-985719cd36f6","resolution":{"observed_at":"2026-08-10T22:17:27.885274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16516","last_updated":"2024-03-27T12:32:31Z","snapshot_observed_at":"2026-08-01T12:49:02.859470Z","submitted_at":"2024-03-25T08:00:43Z","title":"Visually Guided Generative Text-Layout Pre-training for Document Intelligence","version":2},"cited_work":{"arxiv_id":"2403.16516","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16516","snapshot_observed_at":"2026-08-10T22:17:29.484803Z","title":"Visually Guided Generative Text-Layout Pre-training for Document Intelligence","venue":"cs.CL","work_id":"5ce0a6b5-df2d-461a-9247-41330aac79c8","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.893056Z"},"links":{"cited_paper":"/paper/2403.16516","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:1025b8bf4e2fb6bfa3996923a72ddc1b5a904a2b827d79629f5a409914431ff4","observation_id":"14cde736-0904-48f8-873d-b081ece20785","resolution":{"observed_at":"2026-08-10T22:17:29.491922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-07T00:33:28.890965Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-10T22:17:27.900588Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.900588Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:f9a8ec7ee52f1a28124b7bf8386f4076e5bb261ba33c3f751e5e166e253cb2a6","observation_id":"cbbfbcab-553b-455a-a67e-1aded7501099","resolution":{"observed_at":"2026-08-10T22:17:27.900588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-10T22:17:27.907885Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.907885Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:dfacff08372bb70df7501edb2d55e1865a619bcf6aeb1395a39bae3cff384b5c","observation_id":"40a4441b-ee2c-4614-a220-41721203a39b","resolution":{"observed_at":"2026-08-10T22:17:27.907885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19024","last_updated":"2024-04-29T18:07:47Z","snapshot_observed_at":"2026-08-06T01:28:33.649223Z","submitted_at":"2024-04-29T18:07:47Z","title":"Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism","version":1},"cited_work":{"arxiv_id":"2404.19024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.19024","snapshot_observed_at":"2026-08-10T22:17:29.397997Z","title":"Multi-Page Document Visual Question Answering using Self-Attention Scoring Mechanism","venue":"cs.CV","work_id":"6d1393bc-7857-4187-8aac-aa10754e7c5b","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.916380Z"},"links":{"cited_paper":"/paper/2404.19024","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:fd57adc63ac206501d51f885c614672732a30d44bcf2cb38e88ee44547c5bb5c","observation_id":"98f4addf-03e1-4410-a769-b221d0fe2b0b","resolution":{"observed_at":"2026-08-10T22:17:29.405359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06155","last_updated":"2022-10-14T06:54:17Z","snapshot_observed_at":"2026-07-06T14:04:08.977512Z","submitted_at":"2022-10-12T12:59:24Z","title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","version":2},"cited_work":{"arxiv_id":"2210.06155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.06155","snapshot_observed_at":"2026-08-10T22:17:29.359668Z","title":"ERNIE-Layout: Layout Knowledge Enhanced Pre-training for Visually-rich Document Understanding","venue":"cs.CL","work_id":"f55efb51-01ce-4919-bcd3-21742e2b7b18","year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.925083Z"},"links":{"cited_paper":"/paper/2210.06155","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:4da6554f1894ccafbe004492fd3ed220ad4c33e94f88938239b761b19d44d895","observation_id":"9951ccd0-0ec7-44b1-912b-eb258b88f30f","resolution":{"observed_at":"2026-08-10T22:17:29.371687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09550","last_updated":"2021-07-12T09:31:31Z","snapshot_observed_at":"2026-08-09T05:54:52.826958Z","submitted_at":"2021-02-18T18:51:47Z","title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09550","snapshot_observed_at":"2026-08-10T22:17:27.933208Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.933208Z"},"links":{"cited_paper":"/paper/2102.09550","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:664e7cf31b107204079efd505dfb8cac07ee660506b35ef13d5a485c71380814","observation_id":"e3ecd4bf-a7a8-41e4-8219-0997b3b4dea3","resolution":{"observed_at":"2026-08-10T22:17:27.933208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14457","last_updated":"2022-01-05T11:37:22Z","snapshot_observed_at":"2026-08-10T10:09:20.072973Z","submitted_at":"2020-09-30T05:39:04Z","title":"Towards a Multi-modal, Multi-task Learning based Pre-training Framework for Document Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14457","snapshot_observed_at":"2026-08-10T22:17:27.940081Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.940081Z"},"links":{"cited_paper":"/paper/2009.14457","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:b7a6b2b33e7aa07d9fdc0285c99c30e7ebf9e91074d754896580e9c7b9cccb8b","observation_id":"ab7febd7-dad6-4552-99d3-6312fd4e8aba","resolution":{"observed_at":"2026-08-10T22:17:27.940081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-10T22:17:27.947845Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.947845Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:644442c9f7348d53b0fbf7658c714dc20b46cf5e4552381b81dbc64241fb422b","observation_id":"f38f74c5-ecdf-4564-8cea-abeb30d608d6","resolution":{"observed_at":"2026-08-10T22:17:27.947845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-10T22:17:27.955092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.955092Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:5efbf015f7bdea6587eabeabd9e028db3ac43ba67d3ca3770e7249270f63a790","observation_id":"9a6f2ecf-7b9b-4cc9-9406-567752ae3855","resolution":{"observed_at":"2026-08-10T22:17:27.955092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-07-06T04:19:53.343717Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-10T22:17:27.962879Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.962879Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:6a32b0700b5cb0798a95e2b6335ac75a71d5c50ae89dc774a136c1e2675c5b17","observation_id":"b20da880-08c3-4c1b-a77d-e83546f01594","resolution":{"observed_at":"2026-08-10T22:17:27.962879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06611","last_updated":"2020-11-04T15:28:24Z","snapshot_observed_at":"2026-07-06T08:29:34.087644Z","submitted_at":"2019-10-15T09:19:55Z","title":"Enhancing the Transformer with Explicit Relational Encoding for Math Problem Solving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.06611","snapshot_observed_at":"2026-08-10T22:17:27.968681Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.968681Z"},"links":{"cited_paper":"/paper/1910.06611","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:267899f41e3e60b984420fdd07fe5350f97c16de20a5e9a87d13c4eba1d84dbd","observation_id":"bf7d0f5b-b5ea-4b20-9ba1-b6849bfa5cff","resolution":{"observed_at":"2026-08-10T22:17:27.968681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:27.974773Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.974773Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ffc16e03192ba5ab5019e50e243d24e682f4553b4f09a84dd535643ef3e9ebc6","observation_id":"90a7c3ed-5353-4cde-af76-5b8a6d5426db","resolution":{"observed_at":"2026-08-10T22:17:27.974773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-10T22:17:27.980598Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.980598Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:716339a774fc38cbb67acdda820141b76c53377e6490e6852306c9257959c14c","observation_id":"14d7e133-ac42-42e1-a486-6c9174a5d576","resolution":{"observed_at":"2026-08-10T22:17:27.980598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13313","last_updated":"2024-01-24T09:09:37Z","snapshot_observed_at":"2026-08-07T13:19:06.623424Z","submitted_at":"2024-01-24T09:09:37Z","title":"InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions","version":1},"cited_work":{"arxiv_id":"2401.13313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.13313","snapshot_observed_at":"2026-08-10T22:17:28.980524Z","title":"InstructDoc: A Dataset for Zero-Shot Generalization of Visual Document Understanding with Instructions","venue":"cs.CV","work_id":"728eaece-d3a6-4459-a579-1027b3695945","year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.987623Z"},"links":{"cited_paper":"/paper/2401.13313","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:db45adb89a51db2602cc687023eaf75a0372e85dd826249d9167df2d5e662d3c","observation_id":"9677bfae-716b-49be-a318-1b2a5fb6300c","resolution":{"observed_at":"2026-08-10T22:17:28.993328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04883","last_updated":"2023-01-12T09:00:42Z","snapshot_observed_at":"2026-08-09T04:52:49.249457Z","submitted_at":"2023-01-12T09:00:42Z","title":"SlideVQA: A Dataset for Document Visual Question Answering on Multiple Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04883","snapshot_observed_at":"2026-08-10T22:17:27.994465Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.994465Z"},"links":{"cited_paper":"/paper/2301.04883","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:292e42b91b4b24fdb3afd79dddea94d94f6398e7e92554610fd0075e89c5849e","observation_id":"cdb31871-084f-40e8-b7a7-650e2162565d","resolution":{"observed_at":"2026-08-10T22:17:27.994465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.11272","last_updated":"2021-05-10T08:13:26Z","snapshot_observed_at":"2026-08-04T22:54:27.583870Z","submitted_at":"2021-01-27T09:03:06Z","title":"VisualMRC: Machine Reading Comprehension on Document Images","version":2},"cited_work":{"arxiv_id":"2101.11272","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.11272","snapshot_observed_at":"2026-08-10T22:17:28.907464Z","title":"VisualMRC: Machine Reading Comprehension on Document Images","venue":"cs.CL","work_id":"e492001e-ccba-45d9-a9cf-77b188a2a039","year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.001024Z"},"links":{"cited_paper":"/paper/2101.11272","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:db7b5e97d9ad439306428e97197a7cf9db347d55935adf2ec7c70ee94fae766a","observation_id":"445f9482-1cdc-4302-9486-6527b0ef5b59","resolution":{"observed_at":"2026-08-10T22:17:28.919060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12803","last_updated":"2025-06-11T03:20:44Z","snapshot_observed_at":"2026-08-05T02:34:05.403776Z","submitted_at":"2024-04-19T11:38:08Z","title":"TextSquare: Scaling up Text-Centric Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12803","snapshot_observed_at":"2026-08-10T22:17:28.008819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.008819Z"},"links":{"cited_paper":"/paper/2404.12803","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c2deaca6b5442e81bf0dc534d20a7e674a3185e35936b35b8afa34c33b3e01f2","observation_id":"57dc6faa-2bb4-4db8-87f5-71ffba39ffa9","resolution":{"observed_at":"2026-08-10T22:17:28.008819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02623","last_updated":"2023-03-13T17:42:44Z","snapshot_observed_at":"2026-08-10T22:08:13.683381Z","submitted_at":"2022-12-05T22:14:49Z","title":"Unifying Vision, Text, and Layout for Universal Document Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02623","snapshot_observed_at":"2026-08-10T22:17:28.015612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.015612Z"},"links":{"cited_paper":"/paper/2212.02623","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:31c2686f544a980e1ca4ce49c609c2aace5d863a58867ea1945381abba9f691d","observation_id":"b6d8a585-a1e6-483d-b932-cf459dcb0afb","resolution":{"observed_at":"2026-08-10T22:17:28.015612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05935","last_updated":"2023-04-01T10:00:35Z","snapshot_observed_at":"2026-08-07T11:26:39.139402Z","submitted_at":"2022-12-07T10:09:49Z","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05935","snapshot_observed_at":"2026-08-10T22:17:28.023249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.023249Z"},"links":{"cited_paper":"/paper/2212.05935","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:fc94ed3df05ec078743653e3e5486974f83d3f9cdb8bdb727a156f660dee1211","observation_id":"a378fd44-d891-4df3-b5a1-949fee1ebd35","resolution":{"observed_at":"2026-08-10T22:17:28.023249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14958","last_updated":"2022-11-27T22:47:37Z","snapshot_observed_at":"2026-07-06T14:23:39.298472Z","submitted_at":"2022-11-27T22:47:37Z","title":"MGDoc: Pre-training with Multi-granular Hierarchy for Document Image Understanding","version":1},"cited_work":{"arxiv_id":"2211.14958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.14958","snapshot_observed_at":"2026-08-10T22:17:28.776230Z","title":"MGDoc: Pre-training with Multi-granular Hierarchy for Document Image Understanding","venue":"cs.CV","work_id":"39d05ce0-8365-4c58-ab4c-883e8d9b029c","year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.029907Z"},"links":{"cited_paper":"/paper/2211.14958","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:a82c09da7d66b1a4e4d2e23c455b2a9af6e1c2a896025265ebaf73c334a728d8","observation_id":"53799283-9fef-4ff8-93b2-826388d0ad77","resolution":{"observed_at":"2026-08-10T22:17:28.787114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-10T22:17:28.037171Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.037171Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:22f6b787801d45581118144fccbd2fae7bbd792c7b3487bf77953fbde901e167","observation_id":"0e74542a-568d-4e1c-8f20-96874b93fa0a","resolution":{"observed_at":"2026-08-10T22:17:28.037171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-09T08:12:02.284497Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05970","snapshot_observed_at":"2026-08-10T22:17:28.044901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.044901Z"},"links":{"cited_paper":"/paper/2410.05970","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:cdfc41e96adf8bcfec3ca63f99c089e145713fa77e468758155382dbae96ac2c","observation_id":"31be4889-c881-4221-b3df-9f70fc11967f","resolution":{"observed_at":"2026-08-10T22:17:28.044901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-10T22:17:28.060042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.060042Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:5b34f811b02ece350222e8326ec36884fb0c48c8bb658c45422f529c96c6a04e","observation_id":"6bfcd838-d87c-49f2-bbd7-cf1f88539ebb","resolution":{"observed_at":"2026-08-10T22:17:28.060042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-08-10T07:22:17.598918Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-10T22:17:28.065837Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.065837Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:62ea1f640fa056cf96452d9bd882967a857d3dc279c4d7e24ff3c5875c33231e","observation_id":"c0501f79-02b3-4fef-b600-b3d363282b86","resolution":{"observed_at":"2026-08-10T22:17:28.065837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:17:28.071941Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.071941Z"},"links":{"citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c3f21d4ebb0f1e1b9e7a91412f97778581432ae52ec6c9a4ef1cf6abd669733c","observation_id":"5dc0dc13-f1e2-433b-a0d7-11645661b412","resolution":{"observed_at":"2026-08-10T22:17:28.071941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-10T22:17:28.078298Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.078298Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:94be848f79243e939e6cfd3cfb94bb2d0d36565c9c5c8e3721e431c6c2226462","observation_id":"beead3ab-b136-44b2-b759-f9101ed01b89","resolution":{"observed_at":"2026-08-10T22:17:28.078298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-11T01:12:48.131694Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T22:17:28.084106Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.084106Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:8cf6019e46bf2757c86f9c0bdaad5850e40550fdf020588d6a7fc05f362ac97c","observation_id":"defa629e-8143-497f-8995-6a7095da0f6b","resolution":{"observed_at":"2026-08-10T22:17:28.084106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-10T22:17:28.090077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.090077Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:db7b69c54f01daced0dd6632a72e9781cd540fe7916a0e84e30cbedac69fdf7b","observation_id":"375c2eee-b73a-4cbc-8f92-e376e4caa9b2","resolution":{"observed_at":"2026-08-10T22:17:28.090077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08314","last_updated":"2020-05-17T17:26:40Z","snapshot_observed_at":"2026-08-10T12:14:33.431052Z","submitted_at":"2020-05-17T17:26:40Z","title":"TaBERT: Pretraining for Joint Understanding of Textual and Tabular Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08314","snapshot_observed_at":"2026-08-10T22:17:28.096510Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.096510Z"},"links":{"cited_paper":"/paper/2005.08314","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:998b57226b306924b1abb12b6a76603af4980076ef3e2a29c64fd093889c3e8e","observation_id":"609e6b1e-9562-442f-b398-b04fa4296387","resolution":{"observed_at":"2026-08-10T22:17:28.096510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":85,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 4 inbound Pith citation observations for arXiv:2501.02235."}