{"as_of":"2026-08-08T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:037e09921e4735f9e43ed44b78e8ac34904fdc18100dfb7b504c901e6462542f","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:10.777750Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T04:38:49.512293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:42:04.436599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"cited_work":{"arxiv_id":"2506.01388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01388","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"272468d1-e25f-4763-beb4-e1a0256228ef","year":2025},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2506.01388","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:5ed9daaf72e512ed0ac286e3debd67891882101aea5e572e5657bd53e406afd4","observation_id":"6e2022bd-1519-4e72-9d7a-8af56266ec37","resolution":{"observed_at":"2026-05-19T04:42:04.439042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01388/citation-record","integrity":"/paper/2506.01388/integrity","json":"/paper/2506.01388/citation-record.json","paper":"/paper/2506.01388"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.782050Z","title":"Form-nlu: Dataset for the form natural language understanding","venue":null,"work_id":"5c0ae19d-355e-402b-a869-b01a63839c22","year":2023},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.059090Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:4980bd10a3421c41549b2769932f2e575a567f555b2110479ac8b127f52d87b1","observation_id":"66858e4b-f5bc-4c16-86b1-5e9300c60366","resolution":{"observed_at":"2026-08-07T11:49:13.861693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17983","last_updated":"2024-07-26T06:46:19Z","snapshot_observed_at":"2026-07-06T17:36:32.068270Z","submitted_at":"2024-02-28T01:56:00Z","title":"3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding","version":3},"cited_work":{"arxiv_id":"2402.17983","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17983","snapshot_observed_at":"2026-08-07T11:49:11.071419Z","title":"3MVRD: Multimodal Multi-task Multi-teacher Visually-Rich Form Document Understanding","venue":"cs.CL","work_id":"64ea7614-6887-41fa-bc77-949bd173d5cd","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.445020Z"},"links":{"cited_paper":"/paper/2402.17983","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:f86e38f3aa3905f292eabf7fce33349eab067cb4754740b520477d30b1e16c11","observation_id":"ea21328d-8faa-4527-b7cd-6c93d3d69b14","resolution":{"observed_at":"2026-08-07T11:49:11.108695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.618867Z","title":"Mask r-cnn","venue":null,"work_id":"1be63f68-0bb1-4c15-884d-bff8441311c5","year":2017},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.645933Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:fd332c2f30f384e3d5acf71832ec338a6acc9728635917f380a887dd04daad5e","observation_id":"4ddf283f-3cd7-4135-9c16-1951ac6b46f3","resolution":{"observed_at":"2026-08-07T11:49:13.694463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.776081Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36,","venue":null,"work_id":"befe308e-5ae2-4f2f-a456-1f400862b39e","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.475403Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:13dd606b7ad32a932cd737199ee0b125350b85ca198b2870bf5c31711bfe7499","observation_id":"d4a62393-152b-4421-88f4-980b42b1b12c","resolution":{"observed_at":"2026-08-07T11:49:12.886130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:09.628609Z","title":"Hello gpt-4o","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.628609Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:3e6c0a5b7abfce38072d73d1735f15f164dcaa200a2bc2d5251fbc80c145ca13","observation_id":"dea4200a-6c0e-4ec7-b2fd-21b27c72125a","resolution":{"observed_at":"2026-08-07T11:49:09.628609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.535970Z","title":"Cord: a consolidated receipt dataset for post-ocr pars- ing","venue":null,"work_id":"e2cca682-1086-4788-94b1-f5d70023c21f","year":2019},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.707416Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:5465c69098afa5f2f19dc886287949bb4f69b110e7efea7eaa74b448346b8a59","observation_id":"cc5cc385-1a0a-4151-a9f2-c55e03706a25","resolution":{"observed_at":"2026-08-07T11:49:12.630089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.299243Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":"e0d24ded-013a-4ecc-b7f8-4d917e9efa60","year":2016},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.842186Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:39a1416a5526edb4f37993909237b88f77e7cd689f2e50e4e4ce87afc75a14dc","observation_id":"53d1255f-7b73-44f8-a7b1-695661a9ab82","resolution":{"observed_at":"2026-08-07T11:49:12.402963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.594272Z","title":"Towards robust visual information extraction in real world: New dataset and novel solution","venue":null,"work_id":"d5755216-b30a-46fc-9bd9-1186a15f8365","year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.340936Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:c4fe0ac1995dfff1004b4396e222b8ed52b1b5bd13169d82bb5681debc61e0b2","observation_id":"543dd6a1-9e1e-436f-ab5a-916c46b4e8d3","resolution":{"observed_at":"2026-08-07T11:49:11.711186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-07T11:49:10.488825Z","title":"Layoutxlm: Multimodal pre-training for multilin- gual visually-rich document understanding.arXiv preprint arXiv:2104.08836,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.488825Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:a412269c7106984fda8d2706ab589031278a74bede7c69d801bdf144701a0d73","observation_id":"8337f539-ca88-4a94-ac26-752cbbdbf8a1","resolution":{"observed_at":"2026-08-07T11:49:10.488825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:10.632836Z","title":"xgen-mm (blip-3): A family of open large multimodal models.arXiv preprint arXiv:2408.08872,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.632836Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:3f7198597cf11d45bf05d23d539d2dbeb882a4324a62ddcccfe5673fc7fff282","observation_id":"ed0ceba4-9e7c-4f19-95d3-5f1362107066","resolution":{"observed_at":"2026-08-07T11:49:10.632836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.324716Z","title":"Detrs beat yolos on real-time object de- tection","venue":null,"work_id":"0ddefd73-5bd0-4f31-b2d6-26c6d8dc1a7e","year":2024},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.777750Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:5c82f9114e92fbd8c6b871b4b63519964692c864e87ed6431e483aa6a4d0b129","observation_id":"66ac4e59-5f8b-464d-ad6b-1c3e5a998a2b","resolution":{"observed_at":"2026-08-07T11:49:11.441845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:12.025010Z","title":"Kleister: key information extraction datasets involving long documents with complex layouts","venue":null,"work_id":"50457d40-8126-4566-b47e-2d663881fedb","year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.104836Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:8e0254648ac77fc068fd3f78dd9b509a96578aa93457e575125ba0197197cbf7","observation_id":"b44f0f5e-c3a8-4266-a7e9-e3cddaa59010","resolution":{"observed_at":"2026-08-07T11:49:12.141867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:09.961206Z","title":"Faster r-cnn: Towards real-time ob- ject detection with region proposal networks.Advances in neural information processing systems, 28,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.961206Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:8f5e9dc535c1e7a10e8e6a82f91072590495797e1b399bcbc60922b342304b97","observation_id":"57ef1854-b6c7-403c-a274-757055004725","resolution":{"observed_at":"2026-08-07T11:49:09.961206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.484467Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"cc1c17fa-fdd0-4b57-899d-cd7e9208bcbf","year":2019},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.842306Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:e1cc19d74e3468da7cd50ea882f4697b68ccbf3a2950f7efe5aa80656b8f0644","observation_id":"a6a21c81-ceae-488b-adf1-bccb94a64354","resolution":{"observed_at":"2026-08-07T11:49:13.536986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.245345Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"bf34d481-c959-4688-b203-1262cee1e8f6","year":2022},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.987749Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:dc66099eff1d3c39eb372aab6da69b0bd5b627ca6e7d81279da244ec520593c3","observation_id":"27088a13-a74f-44e8-89d0-052d6c690446","resolution":{"observed_at":"2026-08-07T11:49:13.374992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:11.821717Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"8247b1b6-5de8-4654-a1da-9c0544e58bd2","year":2023},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.233981Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:43eb4f4a4d30be3885c549a73d2c02601d723bf3670e248318634f1f3b23608c","observation_id":"f1697ce6-a1d4-4c7d-abb0-a4bcab3d657b","resolution":{"observed_at":"2026-08-07T11:49:11.928334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:13.034542Z","title":"Dit: Self-supervised pre- training for document image transformer","venue":null,"work_id":"9b624424-9b47-4f74-abaf-9785c6efc290","year":2022},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:09.141603Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:c4fe0365ad977b35f527b7ac6e84c33bd26989f509172e703a59198e63893959","observation_id":"d13bf1e7-d242-4def-87fb-9122e04bcc48","resolution":{"observed_at":"2026-08-07T11:49:13.125103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:49:08.221446Z","title":"David: Domain adap- tive visually-rich document understanding with synthetic insights.arXiv preprint arXiv:2410.01609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.221446Z"},"links":{"citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:3877f8ac0bc2394ee6bc7c85f7b9b26375f0049ad1045f8fbb43affcd92ad96c","observation_id":"29675e18-bc61-4d54-a1b8-bd3c025bcad1","resolution":{"observed_at":"2026-08-07T11:49:08.221446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12720","last_updated":"2024-04-19T09:00:05Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T09:00:05Z","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12720","snapshot_observed_at":"2026-08-07T11:49:08.346682Z","title":"Mvqa: A dataset for multimodal information retrieval in pdf- based visual question answering.arXiv preprint arXiv:2404.12720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:08.346682Z"},"links":{"cited_paper":"/paper/2404.12720","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:71d686ed9980ca1ee4129c2e86677aad0abe4895ae8d8f387e85cdc5f3f8aba8","observation_id":"11227b6e-6f49-4fa6-9d1c-ed6ce3a5b060","resolution":{"observed_at":"2026-08-07T11:49:08.346682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 1 inbound Pith citation observation for arXiv:2506.01388."}