{"as_of":"2026-08-11T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dde02ebd056cf20e3de28bf99c68ec24f8f412f01b087c7d52af4ab339bee27e","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T16:02:00.920066Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04636/citation-record","integrity":"/paper/2607.04636/integrity","json":"/paper/2607.04636/citation-record.json","paper":"/paper/2607.04636"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.07038","last_updated":"2026-04-24T04:43:19Z","snapshot_observed_at":"2026-08-08T04:20:37.457117Z","submitted_at":"2026-02-03T12:04:56Z","title":"UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07038","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2602.07038 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2602.07038","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:72b6943438cdcec857f54151aac0505d8e20154ce57d1185c794a2ce332963f5","observation_id":"06d27319-2041-4dea-9113-3b50573c4fe3","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 2: Short Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:9d431938822b54ead55e461ce02dc66cf9fb028af7bb93287d67d3ef00d2a8ce","observation_id":"280541b3-5625-42a8-b733-cb1285de1ec7","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 14th ACM international conference on Information and knowledge management , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:cf5135d323a90936161b5217b0a663a7d9f6ec440ad05c506059fbc8b37077eb","observation_id":"621d4859-753b-49e9-9882-b07955f8714f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"ACM Computing Surveys , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:252a1fdc4831f023c459c141ac3f3e085d6ad3de54a2b187b59f5ed492ade0df","observation_id":"223b5939-5f87-46c7-9651-d6eda948ddb0","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Artificial Intelligence Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8b66c83ede33127e8f308820903d77e5caa7be413f2142fbbf7ae3ba8e963fe9","observation_id":"9956dcd8-1188-40af-a70b-3e3b7750ffd0","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14470","last_updated":"2021-03-26T13:46:00Z","snapshot_observed_at":"2026-07-06T10:53:40.529751Z","submitted_at":"2021-03-26T13:46:00Z","title":"Spatial Dual-Modality Graph Reasoning for Key Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14470","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2103.14470 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2103.14470","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:b7b6e5c3d6c4f1fd406c1cb391c151be0bd1cd178cd2f6a5e7c769eaa50f1984","observation_id":"f5ac9e35-cfa7-4522-98f5-dc6b98b0a828","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:46cc23fdc8555616ac333bb8e6fbc32e12b903f2aa24701c4ebb8ea8e7d4902d","observation_id":"413b357d-4933-4422-bd3a-4d74dee709b1","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"2019 International Conference on Document Analysis and Recognition , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:5599bd738f6714b948abba297087a25b21efc39e22d5d469d4c4fdb9860c3330","observation_id":"eed51a40-4270-40f3-9e1d-745b7f50d52f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02235","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2501.02235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2501.02235","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:066cc3c8e03a4054212d6d55477331e3e9ac01aed59d7fd57d01942e15566258","observation_id":"18963410-65f3-4049-80f0-aa3e7a05fe89","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 30th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:ab056a9fa1efba036e8d439b3d03c03f10298ba0378049e645e75a6ff7e31e9b","observation_id":"33bb58e6-3d5e-4a29-ab02-125053bb9ebd","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8cc6be0380bae32aac6fcd3d25f884ab2cf8a47f0bab87b5514edc9426a60507","observation_id":"63dcfff2-98eb-46d7-951a-29dfa9d5e82e","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Artificial Intelligence Review , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:6113f1f5615e12960ee13ab4ee95f6c352652685b3a0ee2e43c547ce26c456b4","observation_id":"603affde-05ca-4a17-94e3-92d081d62d26","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"2020 25th International conference on pattern recognition (ICPR) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:cfd55fbad8f1962cf4ae87c8ac76b74aae37bf1c6eada413c4995d038e843d4d","observation_id":"71d01a8c-8c17-4286-a810-793821e7ce03","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13235","last_updated":"2026-04-09T07:22:29Z","snapshot_observed_at":"2026-08-11T09:51:06.913435Z","submitted_at":"2026-01-29T14:44:54Z","title":"Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13235","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2602.13235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2602.13235","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:0c7969770bd8263460975f7acf7014b923672f40363845ba94a86c17d54d7bef","observation_id":"134ccc23-5d5d-47e3-8fa8-2638f88e134d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:1b1ee4b81c6a0e5ae3d700d835d7ad4c56178bdc887f79f89782cb698ffcce8f","observation_id":"38891b53-678b-4dd5-b109-8fa058a86bfe","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13964","last_updated":"2025-03-18T06:57:21Z","snapshot_observed_at":"2026-08-07T16:55:45.055075Z","submitted_at":"2025-03-18T06:57:21Z","title":"MDocAgent: A Multi-Modal Multi-Agent Framework for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13964","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2503.13964 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2503.13964","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:24b777d19fc6fa572264ff503600dfcfae56c6603b05cf6e265ec925153e3c68","observation_id":"8f4d180f-4297-4370-86a0-2ba6247cd0a9","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22019","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2505.22019 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2505.22019","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:1f00a6123a56310d654599d7eb91024a63573e2e59d61d686aff7c46338d6627","observation_id":"bb841e23-0e1c-448e-9519-cdee7432d478","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 30th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8742b5fe610f6425e9c06098bce36d8c8550d3d27a07cb59a7457e5c7826c4f0","observation_id":"61b58683-faff-46e7-95fe-8c7f347cf367","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:616f0daa9d734f6e03ebf1a65394af6005b37736f7b750e8ef3da2ca10d80a84","observation_id":"d4f3cdf5-27c1-4949-a424-d004e54ce2d5","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:ec408e91fcbfc1a487b8312d4bd9299fb37e2f035908660481294e0fb17b1230","observation_id":"9f70ea1f-30b4-475a-a974-03ea6c2751a7","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"5-VL Technical Report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:6407bdb6adcad5c7bb37218abc6228a16bf63b911a2c8168023a83e781fdf557","observation_id":"66d38330-e94f-4b95-bc86-05e12f800d78","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:62c356ac3154d08d6f5663c8919b139677599927d6abfc8bd9f9a65d15668088","observation_id":"3121aab9-e59d-4b4c-90c1-044f41bc10be","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2024 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:81abcfea3861f6c07059c13404d0d6c50918568a73be8512d076bd50d9a61f1b","observation_id":"1c1c0523-36c4-4316-8999-261c0eefe40f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer , booktitle =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:32c3df880607c55a6332ad79a42ed82143c125489b1a0b2b0ecb9195fcee7baf","observation_id":"8058a3e9-3cae-47c6-b388-6c65a2872a1f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:d0762db145341c8f793cbbf1b2540c243a0860fe572e74fdfb915b98ef6e0e16","observation_id":"493c7f8b-5557-4012-a4b9-2ed035e1cc38","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:c4883467938c1c36f4fc7a01c2f0eec98fc228ac41ae50429bebc0add3423da9","observation_id":"f70dc14e-c0be-47ba-8d0b-2673a20e556e","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:d8664cdacf729310bd6d9d750c26060164b8d7ee915125bff4ce333c03ca4657","observation_id":"7cc4a75e-4de3-402c-91f5-74a6f119ffdd","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:e82f498914da743f6c22db547f4be5067f291b5f2b80882f756c01657a024bf2","observation_id":"f874afa0-3754-46cb-baf0-d41c07837246","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:b7c9b69b95281f286d14da3dfe3640870e5a32262a808a1c15fd7656e8799cde","observation_id":"f47cf745-683e-4aeb-885e-26686afa4415","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:f88c8d1d74854856c862d9b76898808d559fb44cf59ef972f056f48cb5897d5d","observation_id":"3349c432-dd51-4aec-8b49-d46246e7641e","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"What is the value of templates?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:4a9fe5e1a9064a9973ab5100f940443a992dbc5e991a83798009719e0234d0f9","observation_id":"617aa287-d0c1-4577-8c7c-cf697a74090d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:b2bcd2c3bd2aeeed18c0d5b24ecab7a1e336dfef17c554988a7f5192bf11b07b","observation_id":"e096066f-35a8-42d0-acc9-f6365e740d76","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14295","last_updated":"2024-05-23T08:15:49Z","snapshot_observed_at":"2026-08-08T11:06:53.281288Z","submitted_at":"2024-05-23T08:15:49Z","title":"Focus Anywhere for Fine-grained Multi-page Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14295","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2405.14295 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2405.14295","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:64db3ce622578dee26bad04273914bf08b92416eac0eeffeb700c9f2c677bd48","observation_id":"0a0b6f79-f7de-4eb5-a1c7-1a7a563765ab","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:b563ee2dc42f2aff3377f726002b2709aaad028979d966474b342d675642c10d","observation_id":"39446f5e-caf7-45f2-aa57-bfa51104db5b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:b16a40f06ca7f4875aefb40b43938adadbc22f753cda2e37e5639671a21a7420","observation_id":"ab9818dd-9e45-4d69-97e6-bea0d7c99a2b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-09T08:12:02.284497Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05970","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2410.05970 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2410.05970","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:4d8babae9b6506fdd98ffa96828ebaeae888603209a643865779d849530e9cec","observation_id":"f98e27b1-3b68-4450-b015-796f12fdaf20","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21169","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2410.21169 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2410.21169","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:4365b80860c5ef5d76083ddc9d56d97a0232185d00414a50b4dcddc64ac8b6b0","observation_id":"7a8c586f-4968-4739-9513-665768efc30f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"ACM Transactions on Information Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:7557cfb7c711e3cc4c134522cb0172ae4d23cc6660cb08f2e4e07bf8ee32ff9b","observation_id":"0c2e35bb-ceda-4876-9000-5ee155ec70e5","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:caf691f7ad485ab31ee72f77c13327f0a644043ecbc57b03cee590a75147a785","observation_id":"ebc4903d-7c39-4c93-8029-f1dd11cf11de","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:61a8ab613c862118b50bfd38914f800c47d4f2297feba02da4ae4bbba3332e7b","observation_id":"39dfd1b2-5311-4f44-9747-3c1e16c3412d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:98753532926f7a98aee826e9c05ef90f185a2d91b891c6f0349a76836959410f","observation_id":"3c3fcf04-7ac1-4163-b3c5-6a284f37f954","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Neurocomputing , pages=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:9a66c167fb79565cb428499a5afd98a0aee57260f377816a7db9099d4da8e18e","observation_id":"5ee13aa9-d741-4473-b09c-e8cecc6c92a0","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:a8a7a4c13fd185a0b8488e5f46b25ab2b3849fe8611e2cc60762292ae5821f55","observation_id":"9fd0cc8f-eb94-4236-b34e-e085fcfb0a4d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:6947d63649a020cc18929eac0aa7089e53078d17dcddce0934ed21916b0b55d1","observation_id":"d9bbcf12-fca7-4257-8deb-b1fafe75e9ac","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2603.02789 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8b900caf63afb68032a614d8533ef8ea0d7b97588d9ecc55531d9a19a0d89bf6","observation_id":"1858c4f1-d680-4c94-9da8-e312a78c829b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2104.08836 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:864bec32621bcb3961027d03c93e59b1dfd7113f1fba4690dc74aaf0664ed88e","observation_id":"f5ae56c4-d086-4170-8f15-54d0b6499a65","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:f9e62473bca4cbc4a5def534f63395c00b58b386df535b4c783fdb9fa9761134","observation_id":"a3d02ead-cb32-43d5-a40a-9d398a885f1b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 31st International Conference on Computational Linguistics: Industry Track , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:cfefa430c8ee58a5fd28c91e9f007b67beaaaee829e3f8333775da5253a0eb9e","observation_id":"da2978a3-9010-44a8-a288-eb37c5ab59e7","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8dc5abeb2928745999dfe91b0d8b0b554c776727f588f1a0f448106762a9718d","observation_id":"c5ce143a-9bbc-498e-9314-6309e84a9d51","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2022 , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:7d5f8a46b47245f3a1cb818320f048869c59daa3f6eaddd211aed5a2a3e6f8b9","observation_id":"7f213cfe-e56b-4b8e-9a4c-bae28eeec14e","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:67b5068e10ef3e9591e2303754bfacadf8c5eb90ac773926a5fdad568f4c3f66","observation_id":"27a59bed-e4b7-4dc1-9436-f8313f2ea1f7","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:405a5285b77535d569836e9258a1fa483a161b7aa14135ae5c7f93299e92f54b","observation_id":"3a93b484-37be-4d36-8508-c37503183b53","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:52acb69425addfb8388a494148b4ccc5f3aab6ba5b09f0395c2daac2391a7ad8","observation_id":"9bc0b35d-3d41-4456-a97f-82808d6a7688","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 29th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:ab2a1cffdec33f36896abc3f214208218146b803e7ad3c8f8903c416b1bba050","observation_id":"14e1b65e-6702-46bd-a881-e1522b53810a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:fd75e27842f82f2727fd08186a8b3f70f82ac7de51c2fb1c505dc1ec5cbd94c3","observation_id":"061a7170-8950-414a-b9aa-6f0c3db2d18a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:9fbe6ef7a1d3104b49e94c54d12d4874a0e671693b03d79283d14e356f8bcccd","observation_id":"50c72099-510a-4ce6-8a79-ddcab52b9d24","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"International Conference of the Cross-Language Evaluation Forum for European Languages , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:fa58032c7a43327578ef6c1bd9e7770cd9a28e8bfdfee61e322eb55517814b3a","observation_id":"721ae9f2-287b-40ef-97b0-1ccda520ce2e","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 28th ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:c8f88e80721406fc8ee92d5f52be28c1f2e7590bc7d6fc1d567e58870a847259","observation_id":"574db71b-915d-4116-8bca-c02c3615638a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:69f4b0da0ec18f862fe962effcb0c187f47dad58ef9dfdcc2d6db6736bdd2e29","observation_id":"49d3d45c-2b53-4677-b1ed-39fe38c06088","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:267592a31fb4d21ac5499f3994e5248d2ece20f2c8015939233eeacffce9aab8","observation_id":"7929a79c-a7b2-431a-8876-70ec2b407549","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"2017 14th IAPR International Conference on Document Analysis and Recognition (ICDAR) , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:83a613a10bd03e7e62abb8bc74057fe55f5996567cfc27aa18a46ef88445347e","observation_id":"21b2f045-e8d7-46e9-bf68-28a254ea589a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08609","last_updated":"2021-11-16T16:43:07Z","snapshot_observed_at":"2026-07-06T12:09:08.635616Z","submitted_at":"2021-11-16T16:43:07Z","title":"Document AI: Benchmarks, Models and Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08609","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2111.08609 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2111.08609","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:e3c3490fbcf95336e3563b683ad85515500933a8340d7b986df5c769f9eae664","observation_id":"5e94695e-e322-4c66-9669-c3e1a6881d4b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2010 ACM SIGMOD International Conference on Management of data , pages=","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:a81a77c06e409f3d920a1b1eb0c0da0bb55adb2ae26652fbec5b19c253fd4c89","observation_id":"fd1d6e38-e3eb-4d3f-b386-7b889e8d2535","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:78019b8350ec6ba01f082823f39ec2edd88e00fab5d21f85719f3142bf162463","observation_id":"9ae07564-4d51-4af9-ac07-407a1c013a86","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:c6a7764962edb159b4384b78bba52537d74bff37d24ea7ff32a256971a42b566","observation_id":"0ee47245-4372-4cd8-ad73-9736739c4b8a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2503.19786 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:30135bb4c598ab2c105c8cf2b5f03ec99b424d3eabf09d605dac220c569c36b2","observation_id":"f97b6b3f-7211-40cc-8c80-e08592c4dda4","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 2 (Industry Papers) , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:3b4a508815d01ac5ceb12d8fb432a89a340b0de3bf38582e136c91f1f070b65f","observation_id":"3bedee8f-71a7-4441-89a7-50208326a777","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Knowledge and Information Systems , volume=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:a63ac2dbbf06c804d9d2030f3bb0fda9c4348fe2e1fcbfcb4ae5c03320734b69","observation_id":"1d9315d9-99ba-434e-97ae-f6e63a56742d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"International summer school on information extraction , pages=","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:60de577999d3c8ccac5783c4e369f0d6c71c30f5d7e5d652b4471bce76bc6ecd","observation_id":"3fd51263-f79e-4719-92f8-854b1a890db9","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2406.20094 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:0a8a0927aba8d5ac4db75af50f8f82acd732683cc237d38aa0324eff5248a311","observation_id":"2a438e36-0e83-4d7c-8070-751240fcdc1f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2504.05299 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:c76b26405ad74a1f6f5046bd1544419b7e51f3c01d171ef4eb3247d57fb25f48","observation_id":"b5804c0e-2c5b-4c75-a234-8e016fbdd720","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-11T12:20:54.589956Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2601.08584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:ebfede4db06d3ac00239735722b8f9ddb3af73178a38c7b9f2ab89d72212c182","observation_id":"06b41558-71e1-4941-8da9-1bcf0e6f2b8b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2601.10611 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:f74c9ea84ed52e1d8fcbe3e636e65a9122d7a20d9e801dfa9c2e3d1417414cd7","observation_id":"97cce45f-4119-4c8b-930a-ea8867f2d211","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11737","last_updated":"2025-08-15T17:01:08Z","snapshot_observed_at":"2026-07-06T22:13:37.150049Z","submitted_at":"2025-08-15T17:01:08Z","title":"Ovis2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11737","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"5 technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2508.11737","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:cc90807be9b2c0a9657dc9f55a746576186ab7107b3fc9ee5945d6eb36fe0b4a","observation_id":"b7922922-8c34-402f-a0c2-46c49115aad3","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:f23a5f85a0d7b749d60bf059ab43a52e091d95796c6ca44fdc277aec04717b5e","observation_id":"0b978ad5-3159-474f-a6c1-7a0e74e04f8b","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2503.01743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:c7f8a11aea130379b88e89e3e907efb674a84fb7d0f63a0c971818720452e351","observation_id":"d75b02fd-d8ad-4683-a33d-658a27bf25e1","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.18154","last_updated":"2025-09-16T19:41:48Z","snapshot_observed_at":"2026-08-09T11:10:24.301223Z","submitted_at":"2025-09-16T19:41:48Z","title":"MiniCPM-V 4.5: Cooking Efficient MLLMs via Architecture, Data, and Training Recipe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.18154","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2509.18154 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2509.18154","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:2805b5380b2bb97a04fa8c175231ed36559aaffa43895b383de940e9881b8855","observation_id":"45dcfd5a-c49d-4bb1-b805-1baccebc06cb","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:30df6900131a890489bbe913f2d653f0ba339d94ba2c29b01d1d5128136638bf","observation_id":"73a63745-09c4-41f7-82a3-190adfbab1c9","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"5: Advancing open-source multimodal models in versatility, reasoning, and efficiency , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:a643746c152a7f2d77abc01cb920a1f9a35e7f79d35f955bb94c4153ad55f535","observation_id":"7f95a342-630d-439e-a2d3-761865503734","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:f24d3512de864f2e133fda6490b82599087757c03a5567d9a66f5d63b49e546a","observation_id":"177c8529-0cf6-41d0-8df9-73ecd4283e13","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Journal of Pathology Informatics , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8580a0b3fc9e247ad50fe0dd88590bbb471e936db3e7f78d50bd3eefa4f5b719","observation_id":"9d589030-9f6a-4dbe-b3e4-0323bc62c9eb","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06268","last_updated":"2021-11-08T21:23:22Z","snapshot_observed_at":"2026-08-10T18:46:16.434957Z","submitted_at":"2021-03-10T18:59:34Z","title":"CUAD: An Expert-Annotated NLP Dataset for Legal Contract Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06268","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2103.06268 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2103.06268","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:d81dcfbab6d1effc61c82267e5d3a41a8f44cc9c06d72676364216ac92d61692","observation_id":"3512e7eb-727d-4cd3-a658-5fa24d3f93dd","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Findings of the association for computational linguistics: ACL 2022 , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:5f70058bde37e2539cce68e14b8fea1d5d3029410c0b1c620287168613cd59c0","observation_id":"46bd0a45-2bba-4652-864a-47c828d10b57","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"International Conference on Document Analysis and Recognition , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:bbd30aa1dc48b80266405a2e99695db01987cf8eeb558ec11bd28f963bd27f2a","observation_id":"124af223-04e4-4b4e-89fa-723d0d2eef33","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Workshop on Document Intelligence at NeurIPS 2019 , year=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:d386c48339badfe34cf51f7b34e93b3a1ed81d7a8ee36b3e088abe82bf1f78fd","observation_id":"97fdfa06-0c64-4e70-bd86-28b2249fe0c2","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:a8e54ec14786b0ee5aa99a4bc4e642dc1b8a4a67745b343ae53cc6915c5d82fc","observation_id":"c9693407-6e6c-4aa3-b561-3ce0e37890d5","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T21:55:43.371585Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2506.06122 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:bd51f9f6e27fc3eb224dc54607f0dc4120ce3cc09cfe00f721ff8d6eda4e616b","observation_id":"cc362501-73a8-4172-b17c-eddfad69ac7d","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2510.19817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:1298891053514a0c0dcb7d6ae43e979b86b55825000620cc94d782bb9066b18b","observation_id":"e18c5deb-f0e2-4abf-85f8-f618d039274a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:5a3d27e19da315cd889d28741f930d3019e7a1af1bb3172f88d1f16bfa48117e","observation_id":"60305a1d-27b9-434a-8d52-3db4582ce57f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"2018 IEEE International Conference on Cloud Engineering , pages =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:5521edbbc08dbb4f3e6b553f9a3bc16d51e7c4f47bbdc17636b6697092098664","observation_id":"853aebbd-9bce-4d20-a075-9f4988e918ad","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"Proceedings of the Twenty-Second International Conference on Architectural Support for Programming Languages and Operating Systems , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:2581637762549b1eb59ab77ec137b06f95a254842136e87c0414ceacd6662bb5","observation_id":"a6a4146e-2871-480d-a0b6-75f64e2e9633","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14624","last_updated":"2021-06-09T16:12:21Z","snapshot_observed_at":"2026-08-10T20:47:43.274858Z","submitted_at":"2021-06-09T16:12:21Z","title":"Key Information Extraction From Documents: Evaluation And Generator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14624","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2106.14624 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2106.14624","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:0a77b564bc18e8924074a21709e0d5d6c59b877365ac65d25520e29acfe37c28","observation_id":"eeac0cbd-e93e-4932-a5fa-0cef14505ce1","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05658","last_updated":"2023-05-03T16:24:58Z","snapshot_observed_at":"2026-07-06T14:50:44.713808Z","submitted_at":"2023-02-11T11:32:10Z","title":"DocILE Benchmark for Document Information Localization and Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05658","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2302.05658","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:9e2c29a4e488a862e9b5c7d54e85835c418f83ec065a8cd7a2496f6c91a53d75","observation_id":"5dc9a41b-5099-442e-8556-3bb6023f390a","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"2025 , address =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:dc950b31f76e259b84309e25374b014fdca477e29739ed89ae68eba0af97c0a8","observation_id":"44b164d9-fe27-4182-b946-20d0e1c30eaa","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07608","last_updated":"2025-06-05T11:49:09Z","snapshot_observed_at":"2026-08-07T15:47:50.795694Z","submitted_at":"2025-05-12T14:30:11Z","title":"MiMo: Unlocking the Reasoning Potential of Language Model -- From Pretraining to Posttraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07608","snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"arXiv preprint arXiv:2505.07608 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"cited_paper":"/paper/2505.07608","citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:8806641bc034f23d3b733682e4b6bbb1a3e43ed3d2c98380865cdaa53c1dc524","observation_id":"cc60c917-5587-41fc-9b2b-bc38eeb90a4f","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T16:02:00.920066Z","title":"ChatGLM: A Family of Large Language Models from","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-07-11T16:02:00.920066Z"},"links":{"citing_paper":"/paper/2607.04636"},"observation_digest":"sha256:6aaccb440e825e77935e0609c10e348df81acaded680902b94cb999d60260c9f","observation_id":"eb800356-a325-42de-aa51-2fc6318ca1ff","resolution":{"observed_at":"2026-07-11T16:02:00.920066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04636","last_updated":"2026-07-06T03:39:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T12:41:38.313154Z","submitted_at":"2026-07-06T03:39:08Z","title":"Enhancing Large Multimodal Models in Key Information Extraction via Scene-Aware Document Synthesis"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2607.04636."}