{"as_of":"2026-08-09T22:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6226957753afdb4b7fcabc3fcd41f4d83b8f78625b13c239a3f0e676edda38db","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T21:39:21.842719Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:13:15.344020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2410.05970","last_updated":"2026-04-27T13:16:40Z","snapshot_observed_at":"2026-08-09T08:12:02.284497Z","submitted_at":"2024-10-08T12:17:42Z","title":"PDF-WuKong: A Large Multimodal Model for Efficient Long PDF Reading with End-to-End Sparse Sampling","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-23T19:39:35.147671Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2410.05970"},"observation_digest":"sha256:b06c47be63123e22615468d8657c4cba3bb6681dcd8b6dbd1710959af027ea67","observation_id":"03c3bda6-d15d-4433-b521-9eefbf563a73","resolution":{"observed_at":"2026-05-23T19:43:23.684066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-09T21:39:21.842719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-09T21:30:43.809551Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.842719Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:255d927e044affde6df11e4745b4f99c977851a4cf0f7c8696caccfa21bb3775","observation_id":"5f4d8a90-9c17-4568-987c-dd50b5a74b1f","resolution":{"observed_at":"2026-08-09T21:39:21.842719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-07T15:42:30.992620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-08T07:54:09.757528Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:30.992620Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:0d8719dc76c4292f7aceea627cf0b6988d324afe56bf136184a998fac987290d","observation_id":"bab3b555-d38c-47f6-afe0-f98bd8f69ca1","resolution":{"observed_at":"2026-08-07T15:42:30.992620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-07T00:48:33.913826Z","title":"Texthawk: Exploring efficient fine-grained perception of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-08T19:09:10.101000Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.913826Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:52969330fee99a402e695ec4dbf5e39d6f0bc188ce92b97eba6fa390e783ddc8","observation_id":"bd675666-0726-40a7-ada7-dcd14b2e0ccb","resolution":{"observed_at":"2026-08-07T00:48:33.913826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-06T18:43:21.184881Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-09T20:40:39.623259Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:21.184881Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:c04a0e0fb2e6a9ced8a255f04057e4e7dbb7bc38bdabb89d79ee094d3f6cc75c","observation_id":"da945551-70eb-4509-a555-6964945401cb","resolution":{"observed_at":"2026-08-06T18:43:21.184881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-06T18:28:13.949209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08309","last_updated":"2025-07-11T05:02:06Z","snapshot_observed_at":"2026-08-09T20:40:52.731098Z","submitted_at":"2025-07-11T05:02:06Z","title":"Improving MLLM's Document Image Machine Translation via Synchronously Self-reviewing Its OCR Proficiency","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:28:13.949209Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2507.08309"},"observation_digest":"sha256:34a7a1c50f96fe8b836a520dc549e014994a5a83849c73feec44c2fb0ba453b6","observation_id":"bf2c4e41-add8-435f-831c-2cee03d3ce58","resolution":{"observed_at":"2026-08-06T18:28:13.949209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:ffbe382f378b0c3eeea8f509cf2056416112a73281786be400a3639131d53ec7","observation_id":"45ded1b3-bba6-442c-9ca4-9370fca55ed5","resolution":{"observed_at":"2026-05-19T04:42:04.336814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2603.18472","last_updated":"2026-04-09T02:35:56Z","snapshot_observed_at":"2026-07-06T22:49:37.944352Z","submitted_at":"2026-03-19T04:08:20Z","title":"Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T09:11:31.870441Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2603.18472"},"observation_digest":"sha256:56fe03465c4ab02f4b0df4eea8b56106af25f48d3f059076aee04486505d329d","observation_id":"d4dd574f-1f6e-4058-a219-a9e9662bea66","resolution":{"observed_at":"2026-05-15T09:15:21.061230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2603.19790","last_updated":"2026-04-15T01:38:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-20T09:28:09Z","title":"From Plausibility to Verifiability: Risk-Controlled Generative OCR with Vision-Language Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T08:53:18.268970Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2603.19790"},"observation_digest":"sha256:61ff9b54bbf3e800272dfc53511fb87534d9421bb1cb53f0a9e548ad6b7fad1a","observation_id":"b5d9ef0d-62c2-4bed-9758-5cc8ab1a50a9","resolution":{"observed_at":"2026-05-15T08:55:19.397669Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2604.07419","last_updated":"2026-04-08T14:47:27Z","snapshot_observed_at":"2026-08-02T16:37:23.824907Z","submitted_at":"2026-04-08T14:47:27Z","title":"ReAlign: Optimizing the Visual Document Retriever with Reasoning-Guided Fine-Grained Alignment","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T17:43:15.630570Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2604.07419"},"observation_digest":"sha256:362a779311dd8c2fbced54dec9c9f915bbe6ec5d5cb533d20767993f6ad6a610","observation_id":"f2017440-6d04-4e6e-98ab-582e3ae656eb","resolution":{"observed_at":"2026-05-11T06:15:58.167006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:c7c2fbf602547ab9184e6f3be26ba8cfee706dbdbec9c8a27cf5f20b04b62a52","observation_id":"c1e3a305-7ffb-4e9a-9c0a-8ffd881c53d2","resolution":{"observed_at":"2026-05-20T07:13:06.655691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.09204","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-06-29T08:13:15.344020Z","title":"Texthawk: Exploring efficient fine- grained perception of multimodal large language models","venue":null,"work_id":"069d74fb-98e3-4699-9ea8-65eb2bafce0e","year":2024},"citing_paper":{"arxiv_id":"2605.30307","last_updated":"2026-05-28T17:51:38Z","snapshot_observed_at":"2026-08-02T22:39:52.853482Z","submitted_at":"2026-05-28T17:51:38Z","title":"Grounded 3D-Aware Spatial Vision-Language Modeling","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-06-29T08:08:36.012761Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2605.30307"},"observation_digest":"sha256:ee20c107f26285a312e417cfe0af66e89cfdc76980f948ecacdf497c5e1b08f2","observation_id":"619ea8c1-1590-46c9-a539-750845217293","resolution":{"observed_at":"2026-06-29T08:13:15.353661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.09204/citation-record","integrity":"/paper/2404.09204/integrity","json":"/paper/2404.09204/citation-record.json","paper":"/paper/2404.09204"},"outbound":[],"paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2404.09204."}