{"as_of":"2026-08-14T22:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48f0f0d49b36964161b6d9a075df8dbf60054b7d3b3f4a404d89b778d1dfa6c6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:17:27.900588Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:18.047840Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:d7885a5fe091a292eff1fcea01eb504edda27c0dda9f3b9df267e10d7af6df5b","observation_id":"c16c13f3-b74c-486a-8ff6-11fc527d18b9","resolution":{"observed_at":"2026-05-17T20:33:26.875269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-10T22:17:27.900588Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.900588Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:ea86b3e13e44acb277881180ada938f8725afad34f4c640ca7ab39eda494378b","observation_id":"cbbfbcab-553b-455a-a67e-1aded7501099","resolution":{"observed_at":"2026-08-10T22:17:27.900588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2504.09925","last_updated":"2026-04-29T06:12:36Z","snapshot_observed_at":"2026-08-02T07:57:37.201421Z","submitted_at":"2025-04-14T06:33:29Z","title":"FLARE: Fully Integration of Vision-Language Representations for Deep Cross-Modal Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T19:49:00.961388Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2504.09925"},"observation_digest":"sha256:f44ecd501d1e5755ee69fe861fda26627849c590c1b36a81581b79d39dafb346","observation_id":"81917d7c-899a-4039-8374-d040546404e5","resolution":{"observed_at":"2026-05-22T19:52:01.886765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-08-13T17:51:12.532194Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:7609d422f07d907ce8de21005b721be2d05f074a6bb928f6b792449c1afc5e85","observation_id":"27d21c87-cfb0-4cf0-9ce8-3a1f3b7b226f","resolution":{"observed_at":"2026-05-22T14:21:39.835811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-04T08:15:55.113951Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-13T02:25:37.938690Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:55.113951Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:942e157182f9eb912e03d67eff96f9b5f856f409f2f8d68e2fa707a378b4797d","observation_id":"ec357329-5c77-4802-9e4d-91fd25aa5219","resolution":{"observed_at":"2026-08-04T08:15:55.113951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-03T12:06:36.929511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.04498","last_updated":"2026-06-08T02:50:24Z","snapshot_observed_at":"2026-08-04T01:49:38.336615Z","submitted_at":"2026-01-08T02:06:53Z","title":"IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T12:06:36.929511Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2601.04498"},"observation_digest":"sha256:2476607601c3f8294c297148c52367584c17d258d83c2c0af14d7dbd4f654947","observation_id":"dc315a0f-de32-4254-b33f-c504ef33e642","resolution":{"observed_at":"2026-08-03T12:06:36.929511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:a09bb51c895680fc22b5d1b9fd26c29e8ce38478c33549798477f5b54a53b231","observation_id":"1a8f2ebf-1202-40bd-8ece-d5a17c6b85cd","resolution":{"observed_at":"2026-05-10T16:09:05.339546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-08-02T19:41:33.549591Z","title":"V Jawahar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:33.549591Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:67230cca269465b5b976e556b39944308be4ebd9c045cc4413306fb9dd719e3d","observation_id":"060bf5c0-ab02-4e9d-8812-72eed8a0eecd","resolution":{"observed_at":"2026-08-02T19:41:33.549591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.03157","last_updated":"2026-04-03T16:28:03Z","snapshot_observed_at":"2026-08-11T16:39:26.200882Z","submitted_at":"2026-04-03T16:28:03Z","title":"Chart-RL: Policy Optimization Reinforcement Learning for Enhanced Visual Reasoning in Chart Question Answering with Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T20:02:44.124502Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.03157"},"observation_digest":"sha256:3771bbbf416e0754e909851c0b5cf96946822f97dba38cec50c3637662ea5cd6","observation_id":"6977d310-e376-4565-881f-16f8d8fec6cc","resolution":{"observed_at":"2026-05-13T20:03:12.121069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.08212","last_updated":"2026-04-09T13:11:30Z","snapshot_observed_at":"2026-07-06T22:57:22.475588Z","submitted_at":"2026-04-09T13:11:30Z","title":"Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:39.410040Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.08212"},"observation_digest":"sha256:7f070bedfc4a0a1905e85f599f98d91d1883ffdca264de11d809f8a60a6b99c4","observation_id":"3a7fc88e-2bdf-4c7c-ab6e-45ca67073d3d","resolution":{"observed_at":"2026-05-11T06:41:22.806700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-08-11T03:43:39.621933Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:7599f8cd292a65f5509e6101f0a97e1bb32d45e4cb12eea7b7b63f4361722005","observation_id":"a517b7d4-85fb-4cae-84c7-cb1cc995c878","resolution":{"observed_at":"2026-05-11T07:16:10.969368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.03410","last_updated":"2026-06-02T09:54:03Z","snapshot_observed_at":"2026-08-11T20:33:33.572938Z","submitted_at":"2026-06-02T09:54:03Z","title":"Enginuity: A Dataset and Benchmark for Vision-Language Understanding of Engineering Diagrams","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T10:59:51.980559Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.03410"},"observation_digest":"sha256:ea8befaf4e29604bc4b9caa28573793879aa669e510317955490235f241bdf96","observation_id":"b10619f3-6942-44e7-afb2-1f900912b75c","resolution":{"observed_at":"2026-07-02T02:26:26.239047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.17118","last_updated":"2026-06-15T10:59:11Z","snapshot_observed_at":"2026-08-01T22:00:49.016479Z","submitted_at":"2026-06-15T10:59:11Z","title":"MODE: Modality-Decomposed Expert-Level Mixed-Precision Quantization for MoE Multimodal LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T04:32:04.918645Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.17118"},"observation_digest":"sha256:1d8ef0a927dcdc5984646c21119fa9f3a7a89526118c885b87da9a966829c6a6","observation_id":"2a552759-cfe3-49c6-a22b-78088ce85eb0","resolution":{"observed_at":"2026-07-03T17:08:43.719131Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:4479260bfd19f7d401109655f62633b0a259b64f04551cab8acf06553df258e4","observation_id":"5a9c32be-0c02-4617-93f7-9729fd6f1cfb","resolution":{"observed_at":"2026-07-04T00:49:18.049881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":"2104.12756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-04T00:49:18.047840Z","title":"V Jawahar","venue":null,"work_id":"2064c4d0-c940-422d-80d0-6449f03217c0","year":2021},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:41938070389f54eb2688ff50ffe09b6ffe08a6b3c7e5a04bcec808ec50b72f2b","observation_id":"c35469fc-3a31-4e53-a0a4-01e99de5bbe6","resolution":{"observed_at":"2026-07-03T14:48:32.359688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.12756","snapshot_observed_at":"2026-07-31T06:20:14.121564Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-14T07:27:05.336280Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:14.121564Z"},"links":{"cited_paper":"/paper/2104.12756","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:04c0169269941e56099e8d0c7e33aed664ee7d2e5a90ab386c51ff9a22e7e064","observation_id":"42c284ec-8a14-49c4-8d1a-f6c3308df46d","resolution":{"observed_at":"2026-07-31T06:20:14.121564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.12756/citation-record","integrity":"/paper/2104.12756/integrity","json":"/paper/2104.12756/citation-record.json","paper":"/paper/2104.12756"},"outbound":[],"paper":{"arxiv_id":"2104.12756","last_updated":"2021-08-22T04:27:56Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T08:37:36.595311Z","submitted_at":"2021-04-26T17:45:54Z","title":"InfographicVQA"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2104.12756."}