{"as_of":"2026-08-08T18:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e93e195a0faa0d9daaabb06536e185631bc5f630ac22d7dd0f91bb7e9b609f4d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:49:10.488825Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":49,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-07T11:49:10.488825Z","title":"Layoutxlm: Multimodal pre-training for multilin- gual visually-rich document understanding.arXiv preprint arXiv:2104.08836,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01388","last_updated":"2025-06-02T07:28:28Z","snapshot_observed_at":"2026-08-07T11:41:21.287437Z","submitted_at":"2025-06-02T07:28:28Z","title":"VRD-IU: Lessons from Visually Rich Document Intelligence and Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:49:10.488825Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.01388"},"observation_digest":"sha256:a412269c7106984fda8d2706ab589031278a74bede7c69d801bdf144701a0d73","observation_id":"8337f539-ca88-4a94-ac26-752cbbdbf8a1","resolution":{"observed_at":"2026-08-07T11:49:10.488825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T22:38:50.217063Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding.arXiv preprint arXiv:2104.08836, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.217063Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3d7f4f60d8618a7e1674e575e1c7bef6c7db8ca4aebf7e4ce4735ca1df289979","observation_id":"6b26cf17-dd66-49f4-9a30-dd7cdb7bedb3","resolution":{"observed_at":"2026-08-06T22:38:50.217063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T20:04:12.416233Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.416233Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:493e95b990598975810c2847d68e7403ee13f8718cfe63968519c0e33d3b74fa","observation_id":"3a9ecb96-d720-4380-80fc-6464a625a2d8","resolution":{"observed_at":"2026-08-06T20:04:12.416233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":"2104.08836","doi":"10.48550/arxiv.2104.08836","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":"arXiv (Cornell University)","work_id":"82082c36-2eaf-4b35-bccd-81307e8acd65","year":null},"citing_paper":{"arxiv_id":"2605.12623","last_updated":"2026-05-21T05:33:02Z","snapshot_observed_at":"2026-08-06T19:38:37.895679Z","submitted_at":"2026-05-12T18:09:38Z","title":"DocAtlas: Multilingual Document Understanding Across 80+ Languages","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-14T21:02:45.148167Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2605.12623"},"observation_digest":"sha256:88c2a89b952ff38a409bb60dd3efa446aefc7bffd254690509a75b78f03cc5f4","observation_id":"fbe55ef9-db8f-493e-9335-0a30d1e6dcba","resolution":{"observed_at":"2026-05-14T21:02:58.734028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":"2104.08836","doi":"10.48550/arxiv.2104.08836","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":"arXiv (Cornell University)","work_id":"82082c36-2eaf-4b35-bccd-81307e8acd65","year":null},"citing_paper":{"arxiv_id":"2605.12623","last_updated":"2026-05-21T05:33:02Z","snapshot_observed_at":"2026-08-06T19:38:37.895679Z","submitted_at":"2026-05-12T18:09:38Z","title":"DocAtlas: Multilingual Document Understanding Across 80+ Languages","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-22T09:51:40.160096Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2605.12623"},"observation_digest":"sha256:a79ff10b039512d801522dcc87e789031d29dd29be9cec86c421db62c115cb55","observation_id":"3f8caf51-951e-477d-8cdd-291a7febda20","resolution":{"observed_at":"2026-05-22T09:54:47.199784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":"2104.08836","doi":"10.48550/arxiv.2104.08836","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":"arXiv (Cornell University)","work_id":"82082c36-2eaf-4b35-bccd-81307e8acd65","year":null},"citing_paper":{"arxiv_id":"2606.28796","last_updated":"2026-06-27T08:07:44Z","snapshot_observed_at":"2026-07-07T00:02:52.539331Z","submitted_at":"2026-06-27T08:07:44Z","title":"Structure-Preserving Document Translation via Multi-Stage LLM Pipeline: A Case Study in Marathi","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-30T09:59:20.602618Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2606.28796"},"observation_digest":"sha256:6451218197f03352a81902fc874c031460f973aae70490bc3c45483e887ea58f","observation_id":"026fdcd2-56b7-4718-b537-aead829ab103","resolution":{"observed_at":"2026-06-30T10:04:35.259844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:864bec32621bcb3961027d03c93e59b1dfd7113f1fba4690dc74aaf0664ed88e","observation_id":"f5ae56c4-d086-4170-8f15-54d0b6499a65","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-02T14:55:27.594513Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16203","last_updated":"2026-05-05T10:59:34Z","snapshot_observed_at":"2026-08-04T21:09:24.743822Z","submitted_at":"2026-05-05T10:59:34Z","title":"DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T14:55:27.594513Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2607.16203"},"observation_digest":"sha256:475b0b1029095900ca6dc150f0a0bfdc5d45bcb8059bc9dd474c47b76b602e9e","observation_id":"5dcfbe36-82b8-4b24-ac73-fc7f24181e1b","resolution":{"observed_at":"2026-08-02T14:55:27.594513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-01T11:59:19.585721Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-07T16:28:41.681456Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.585721Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:b5fb0a0ce7fe052288b43493a3561ebcb50b876273d09fb4f5c10f980748185b","observation_id":"4e8b07bc-dab5-48a4-a47c-0954e3c08d2e","resolution":{"observed_at":"2026-08-01T11:59:19.585721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.08836/citation-record","integrity":"/paper/2104.08836/integrity","json":"/paper/2104.08836/citation-record.json","paper":"/paper/2104.08836"},"outbound":[],"paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2104.08836."}