{"as_of":"2026-08-07T15:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d921c1ce39a62511ce708a3ab7a6bf3bf52122f2f5ade2aebd78f95ccdc83c0","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:07:54.402782Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.12490/citation-record","integrity":"/paper/2507.12490/integrity","json":"/paper/2507.12490/citation-record.json","paper":"/paper/2507.12490"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.766419Z","title":"In: Proceedin gs of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"4f2812ce-cf91-48e1-9483-2d6f143b12c5","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.422420Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:61ba75dce686f5f5640295035f8426b20eafb6235b1e5b865732857b709b9982","observation_id":"0f40e080-bd1d-4602-a9a9-299172ff8252","resolution":{"observed_at":"2026-08-06T17:07:56.878906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:52.513301Z","title":"4290–4300","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.513301Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:98fcc0a6b32eedbcb2b72845702e0fac5eafcd3c402a0dc3faaf076264684c96","observation_id":"49e34a29-2d3c-479a-9316-6c6c8e621f93","resolution":{"observed_at":"2026-08-06T17:07:52.513301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patrec.2021.06.026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.473657Z","title":"Pattern Recognition Letters 150, 242–249 (2021)","venue":null,"work_id":"272880c3-8997-4508-bb99-677a9a7f3e6c","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.593231Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:233c786b5be470c348bfc14d99c84493b6ad306aad5f1c545a1cd03a3f5e1c18","observation_id":"792ca61a-d574-44fc-bbd4-8aa07850e039","resolution":{"observed_at":"2026-08-06T17:07:54.543867Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-06T15:58:29.524516Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-06T17:07:52.666510Z","title":", Huang, F., Zhou, J.: mplug-docowl2: High-resolution compressing for ocr-f ree multi-page document understanding (2024), https://arxiv.org/abs/2409.03420","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.666510Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:31eac5212c534a419fd4e2e661a6eb40b8583c30a0a82346954dd4970291cbfa","observation_id":"1e4266db-48e4-4e6e-90ed-a8f540d82797","resolution":{"observed_at":"2026-08-06T17:07:52.666510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:52.747544Z","title":"In: 2020 IEEE/CVF Conference on Computer Vision and Pattern Recog- nition (CVPR)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.747544Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:6644e7fdc02f058576750ff271c5c3aefd8b1e749e2d7a00498ec991ef61ab17","observation_id":"57f7fc36-5dae-4faa-aa87-e576c9420f82","resolution":{"observed_at":"2026-08-06T17:07:52.747544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.562290Z","title":", Le, Q., Sung, Y.H., Li, Z., Duerig, T.: Scaling up visual and vision-langu age representation learning with noisy text supervision","venue":null,"work_id":"1c22f255-6545-4ab7-a093-8dac57864b3c","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.849169Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:7ab0b2be15b8be3429bd5e2525860a04ce0ccd1fc4ef3c8746e93adeda415832","observation_id":"6b80b483-998d-4af9-8f1a-fd14e141652a","resolution":{"observed_at":"2026-08-06T17:07:56.649166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.450375Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"c989ccca-90b8-48af-909c-c141dde36cbb","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:52.991227Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:7d0c3380dfbd224cfb52a6d737661399daaf56c93cd4718790c4d90cbf85bcc2","observation_id":"fe155ab4-0f54-40be-aba1-65d4068bdd88","resolution":{"observed_at":"2026-08-06T17:07:56.509448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.324308Z","title":"In: Krause, A., Brunskill, E., Cho, K., Engelhardt, B., Sabato, S., Scarlet t, J","venue":null,"work_id":"966999b2-274f-443e-8201-2bc63502283b","year":2023},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.076926Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:ac3384d45f1af473f5c77e419461557c127623279df1178b172b94a446abaa6d","observation_id":"2033bde0-f91e-484d-80fe-e51dd8abe144","resolution":{"observed_at":"2026-08-06T17:07:56.395421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.186357Z","title":"In: Chaudhuri, K., Jegelka, S., Song, L., Szepesvari, C., Niu, G., Sabato, S","venue":null,"work_id":"4af288ae-103d-4a40-8cc2-b1f7089c177a","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.150218Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:415769f534554e95b1ff564309f655ccc611902186faf62f785be1786e5a96da","observation_id":"63e3231a-10b2-406a-aa7c-06d68f5fc3de","resolution":{"observed_at":"2026-08-06T17:07:56.258565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03896","last_updated":"2025-06-10T09:20:36Z","snapshot_observed_at":"2026-07-06T17:26:10.790336Z","submitted_at":"2024-02-06T11:07:05Z","title":"Multimodal Rationales for Explainable Visual Question Answering","version":3},"cited_work":{"arxiv_id":"2402.03896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03896","snapshot_observed_at":"2026-08-06T17:07:54.880932Z","title":"Multimodal Rationales for Explainable Visual Question Answering","venue":"cs.CV","work_id":"917d561e-423b-4b49-b3e2-7e48bc86a6bc","year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.224963Z"},"links":{"cited_paper":"/paper/2402.03896","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:17972ae60bbfbdf861d3a4b78f4faf4575f9e6cbc03ff973b1d0d29feee110db","observation_id":"64518d66-6287-431b-bb90-c0e23b7515cb","resolution":{"observed_at":"2026-08-06T17:07:54.956540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:56.044828Z","title":"In: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M","venue":null,"work_id":"c61ae4b7-dab4-4e3f-bded-6614791eb36a","year":2023},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.317817Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:11be6a56350c5eb1b34df13862e70937e1fb135aba2e1c6209e4855cf61303d6","observation_id":"43fea144-a5dd-4d2c-8b09-ac79d5b0b30b","resolution":{"observed_at":"2026-08-06T17:07:56.118590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.920434Z","title":"In: Proceedings of the IEEE/CVF winter conference o n applications of computer vision","venue":null,"work_id":"6f2b96a4-0e60-4b98-84c0-8d18cc2c958a","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.417551Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:8ceca8a3bbaf054bceb5ea5ac0664ee45a1c78e11595507da1bc1807f6d70b1e","observation_id":"604c8031-6688-4ef7-9f19-cd35ea01d861","resolution":{"observed_at":"2026-08-06T17:07:55.976919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-06T17:07:53.544005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.544005Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:49d6449afcba30ba8ce76901fd24dd05b2e56d80d411fe702dbac2fe3253e9de","observation_id":"b8fcff72-8148-4bbc-8735-301968efb62e","resolution":{"observed_at":"2026-08-06T17:07:53.544005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.806327Z","title":", Pietruszka, M., Pałka, G.: Going full-tilt boogie on document understanding with t ext-image-layout trans- former","venue":null,"work_id":"b18073a9-e5c5-41a2-9e68-f557282df588","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.639104Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:936b9cb095ce953494b50c0cc5347a7d42151e58aab4e4327ad868f73cafaca8","observation_id":"f32de7c0-4fbb-423c-8390-52f65fd8c9d4","resolution":{"observed_at":"2026-08-06T17:07:55.852534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.518007Z","title":"In: Meila , M., Zhang, T","venue":null,"work_id":"c86ee21e-8954-4690-b3cf-f4efe3c780d1","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.830975Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:09e7754be954f10d991700071a66af95abf7bbfe00e920c6c89f526a06a82325","observation_id":"75f70c2c-573a-45c4-aa15-8ff741b25099","resolution":{"observed_at":"2026-08-06T17:07:55.576413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.673066Z","title":null,"venue":null,"work_id":"3ac81d11-da25-4835-830d-e068223d36bc","year":2021},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.707881Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:961c2c580e6913ff1d4adbab45fa509b61918bd57e3b9ac4b4bb9c393cb450b6","observation_id":"f96db652-053a-411e-b546-c39eb88f723c","resolution":{"observed_at":"2026-08-06T17:07:55.747430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:53.924438Z","title":"In: 2019 IEEE/CVF Conference on Computer Vi sion and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.924438Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:ad205732578eaea4c8d581d021e3e6d19464368fc1c349b9aeac51cbcbd58505","observation_id":"6b65e2db-c640-4bb8-8cb1-04bb8cdf930f","resolution":{"observed_at":"2026-08-06T17:07:53.924438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.350781Z","title":"I n: International Confer- ence on Document Analysis and Recognition","venue":null,"work_id":"39afe280-a7dc-4275-b596-eadc219f152d","year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.023790Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:c57f03d85d84aea2942ccac99436598c9b529f777c44aee6ba1a82ec73430c41","observation_id":"e0075ca2-de6a-4548-8926-de07ac41acc3","resolution":{"observed_at":"2026-08-06T17:07:55.448109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.117543Z","title":"In: 2017 IEEE International Conference on Computer Vision (ICC V)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.117543Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:4bf7b4ab4ee25e34bf87f92993d5346e1eac2e633a892f95ef771ec2c4e33676","observation_id":"41c2d7c5-b59b-4419-b8d9-31c5b137352a","resolution":{"observed_at":"2026-08-06T17:07:54.117543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.246311Z","title":"In: 2022 IEEE/CVF Conference on Computer Vision and Pattern Recogni tion (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.246311Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:3d164e03fdfd1852728be462cde3fbc0a41966cda9d8df680fa4ff35e646ca6d","observation_id":"60e6df6a-3035-4fc7-ae12-9fe0bf21b657","resolution":{"observed_at":"2026-08-06T17:07:54.246311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:54.339787Z","title":"In: Proceedings of the 26th ACM SIGKDD International Confer - ence on Knowledge Discovery & Data Mining","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.339787Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:d5b2874c5623516035dfef88d67f652d94295396dad5a883e88c31a626104776","observation_id":"45eb9f88-24a5-4f21-9c0a-c4f896218a83","resolution":{"observed_at":"2026-08-06T17:07:54.339787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:07:55.206449Z","title":"In: The E leventh International Conference on Learning Representations (2022)","venue":null,"work_id":"be2e6055-f9ee-45cf-a1bd-8ebcdd9a1de5","year":2022},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:54.402782Z"},"links":{"citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:beac713dea241dc15616a72d383b0494a9bc1c42c87ff180663426e0cdb0d2e3","observation_id":"1cf8540d-5b29-4241-8ae6-4ecb408f8a18","resolution":{"observed_at":"2026-08-06T17:07:55.243516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:01:45.452626Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2507.12490."}