{"as_of":"2026-08-20T21:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fb895eb7c0009b884bc4627d4e911dcbbf11b45b04064131188056e0ad7f24d","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:46:03.748195Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:59:19.379119Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2506.18985","doi":"10.48550/arxiv.2506.18985","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Glimpse: Gradient-layer importance map- ping for prompted visual saliency explanation for generative lvlms","venue":"arXiv (Cornell University)","work_id":"08744abf-7943-4e81-9dd3-04867dd3067a","year":2025},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-08-13T02:16:47.977396Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2506.18985","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:9d39e1748475a0784659a31ef3f4a0d9aa8c7168ca22f3332c3d575e1220fe63","observation_id":"2bfed174-41f7-409f-974f-a06262405880","resolution":{"observed_at":"2026-05-10T22:20:47.749240Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2506.18985","doi":"10.48550/arxiv.2506.18985","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Glimpse: Gradient-layer importance map- ping for prompted visual saliency explanation for generative lvlms","venue":"arXiv (Cornell University)","work_id":"08744abf-7943-4e81-9dd3-04867dd3067a","year":2025},"citing_paper":{"arxiv_id":"2604.09368","last_updated":"2026-04-10T14:38:45Z","snapshot_observed_at":"2026-08-13T21:46:53.991165Z","submitted_at":"2026-04-10T14:38:45Z","title":"Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:21:47.577839Z"},"links":{"cited_paper":"/paper/2506.18985","citing_paper":"/paper/2604.09368"},"observation_digest":"sha256:692a913b81d45bfd36491b99401bc392ac13eb37b520f6680880f258a03c0982","observation_id":"79adc347-769b-4532-bf89-f49ad36076e7","resolution":{"observed_at":"2026-05-10T21:35:47.332353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18985/citation-record","integrity":"/paper/2506.18985/integrity","json":"/paper/2506.18985/citation-record.json","paper":"/paper/2506.18985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.114100Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"864dd677-fca8-4cf3-bfe8-24e3cb072e5c","year":2020},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.639483Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:c4016fc390148a19d2a2f55d06bc7d4738d74dd6acb696adef491b40d285285c","observation_id":"9368b046-2675-46dd-b26f-c9dd94caf847","resolution":{"observed_at":"2026-08-15T18:46:04.117975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05602","last_updated":"2024-06-10T09:58:55Z","snapshot_observed_at":"2026-08-17T01:11:29.065448Z","submitted_at":"2024-02-08T12:01:24Z","title":"AttnLRP: Attention-Aware Layer-Wise Relevance Propagation for Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05602","snapshot_observed_at":"2026-08-15T18:46:03.643989Z","title":"Attention-aware layer-wise relevance propagation for transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.643989Z"},"links":{"cited_paper":"/paper/2402.05602","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:55f651158f15966c68d400daba370e06ba8e68c59e14d17992f6f0866e188c28","observation_id":"dad3ad63-80a2-480c-a477-43c140ab9e35","resolution":{"observed_at":"2026-08-15T18:46:03.643989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.101935Z","title":"XAI for trans- formers: better explanations through conservative propaga- tion","venue":null,"work_id":"dda5bf8e-51c2-4af3-a55d-d6aff4bc4b0a","year":2022},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.648241Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:da50ccc16b1f1c766bd1c137fa475be1e62e3341debea7e315bf1a4a575fc7ab","observation_id":"bfce766f-b504-4d1e-ac24-49f90eba467d","resolution":{"observed_at":"2026-08-15T18:46:04.105967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.089728Z","title":"On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation","venue":null,"work_id":"56f27554-d780-46e2-aba0-a5c99d88ee47","year":2015},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.652167Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:9eea07abba1f1f5dc7524c3ec7b34e7c93a21e6be6b916e928e55da912b7ba85","observation_id":"c302c794-ca24-4bc0-8f2d-7ee72c1b7db3","resolution":{"observed_at":"2026-08-15T18:46:04.093686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T18:46:03.656596Z","title":"Qwen2.5-VL: A multimodal large language model with en- hanced vision-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.656596Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:bd7be51582234029c119b0bc8f4fc890cf7679a4fa5815ecd1b7d427cc74c293","observation_id":"cc955556-c5c7-42e0-b57a-da82e4a71a53","resolution":{"observed_at":"2026-08-15T18:46:03.656596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.078745Z","title":null,"venue":null,"work_id":"9ce35bf1-13f8-45b2-a4dc-8ca1851d04fa","year":2017},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.660515Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:0555dcad45ce4734e8325afe9661dbe255d55dc15ee380e385a5442c625bb0e4","observation_id":"f17b3e68-7802-453c-93ee-23e3b4df9b09","resolution":{"observed_at":"2026-08-15T18:46:04.082390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18585","last_updated":"2023-10-28T04:30:16Z","snapshot_observed_at":"2026-08-16T14:48:06.242482Z","submitted_at":"2023-10-28T04:30:16Z","title":"Visual Explanations via Iterated Integrated Attributions","version":1},"cited_work":{"arxiv_id":"2310.18585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18585","snapshot_observed_at":"2026-08-15T18:46:03.904748Z","title":"Visual Explanations via Iterated Integrated Attributions","venue":"cs.CV","work_id":"33c094f8-7b61-4bfd-bea6-8273c6d930ae","year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.664989Z"},"links":{"cited_paper":"/paper/2310.18585","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:74189f2dba291c1b5377eab70b1d16bd3071351f79f5c2419941334f9505a71f","observation_id":"b3a63cf5-3d53-471f-bc0b-0ce2f469bbae","resolution":{"observed_at":"2026-08-15T18:46:03.908685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.067415Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":"45ec72c6-e7eb-43a7-bcfc-c95330c94d84","year":2021},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.669555Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:a5957a2836ed1ef8f44c923e72be59c1727c40380176f97b34a9bedb1a6dbbbf","observation_id":"1eedf591-3e3b-409f-b668-3ac954c14642","resolution":{"observed_at":"2026-08-15T18:46:04.071386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.056339Z","title":"Human attention in visual question answer- ing: do humans and deep networks look at the same regions? In Proc","venue":null,"work_id":"9334d0de-11fe-46af-9cb1-7fd94f330ff4","year":2016},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.673042Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:c28c6c3baf88e2ddc2910c8842a77dfd2f00bcafa821c2eeed617a0028e0c192","observation_id":"8a60b89c-3f04-4ab7-bed2-be1f59881448","resolution":{"observed_at":"2026-08-15T18:46:04.060196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08110","last_updated":"2025-01-07T17:26:26Z","snapshot_observed_at":"2026-08-16T16:01:23.462322Z","submitted_at":"2023-01-19T15:01:00Z","title":"AtMan: Understanding Transformer Predictions Through Memory Efficient Attention Manipulation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08110","snapshot_observed_at":"2026-08-15T18:46:03.676556Z","title":"AtMan: understanding transformer predictions through memory-efficient attention manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.676556Z"},"links":{"cited_paper":"/paper/2301.08110","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:b367ee883b3d20de8f4f481024dbdc741ed7528a208de9618db725e102453e65","observation_id":"3698a970-62c3-4bf5-bbd6-1a3a5a009400","resolution":{"observed_at":"2026-08-15T18:46:03.676556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01911","last_updated":"2024-03-04T10:19:03Z","snapshot_observed_at":"2026-08-16T14:13:09.619086Z","submitted_at":"2024-03-04T10:19:03Z","title":"Turtles, Hats and Spectres: Aperiodic structures on a Rhombic tiling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01911","snapshot_observed_at":"2026-08-15T18:46:03.680944Z","title":"OWL-grounded LVLMs: bounding-box-aligned decoding for image–text models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.680944Z"},"links":{"cited_paper":"/paper/2403.01911","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:fe6a90ed256b718bb5b70279c873c694e0f14be4d6efffd755c5b2af7f515799","observation_id":"3b3c9461-e966-43be-ac55-28178f7d9727","resolution":{"observed_at":"2026-08-15T18:46:03.680944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.045145Z","title":"iGOS++: inte- grated gradient optimized saliency by bilateral perturbations","venue":null,"work_id":"73065b60-7cae-4d2d-a0e9-b940d41939b8","year":2021},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.684905Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:346b73785a22c2c3dd5c742875cdc4b50a12cf533cbab63c6a2e09317876c1c9","observation_id":"49838183-700a-4569-8e91-10c49ea97e7d","resolution":{"observed_at":"2026-08-15T18:46:04.048896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.034066Z","title":"From representa- tion to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"224bb19a-7aa1-4cbe-af0f-949a5108762d","year":2022},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.688639Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:49016291c36417bb61d067d80f2fb5f63601498e734156a12bf5c5367eee1a01","observation_id":"4948d703-030d-414c-8f24-d2cee8ca793c","resolution":{"observed_at":"2026-08-15T18:46:04.037962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T18:46:03.692170Z","title":"Visual instruction tuning (LLaV A).arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.692170Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:bd4d082c4c935f20d33f9c20a6e0c5d84aacf80a241c1dd83f0df3e9d23df637","observation_id":"0925e4f2-94ce-49c2-a15e-37135eb8dbfb","resolution":{"observed_at":"2026-08-15T18:46:03.692170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.023015Z","title":"Lundberg and Su-In Lee","venue":null,"work_id":"6eed850a-c157-44f1-9169-c9a138f2c927","year":2017},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.696219Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:e1d555248a930d7daeb20a1183f553f42f81166589919a12897067732692437d","observation_id":"b30bf151-85f1-44f2-9379-fe6a621791d2","resolution":{"observed_at":"2026-08-15T18:46:04.026785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15943","last_updated":"2023-05-25T11:29:16Z","snapshot_observed_at":"2026-08-16T15:29:47.074502Z","submitted_at":"2023-05-25T11:29:16Z","title":"Mortality Forecasting using Variational Inference","version":1},"cited_work":{"arxiv_id":"2305.15943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15943","snapshot_observed_at":"2026-08-15T18:46:03.856785Z","title":"Mortality Forecasting using Variational Inference","venue":"stat.AP","work_id":"541d2b64-50cc-412e-ba39-cd5e6f058288","year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.700734Z"},"links":{"cited_paper":"/paper/2305.15943","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:11396b59f7837229fad4a40c143395b9686a895fb2ea22165a7be442b132afd5","observation_id":"6f305ed1-19a6-4792-aff2-1ffc1df838cc","resolution":{"observed_at":"2026-08-15T18:46:03.860984Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:04.010951Z","title":"Exploring human-like attention supervision in visual question answer- ing","venue":null,"work_id":"bb3423e4-4846-40b6-af35-c426ba048404","year":2018},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.705261Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:e2bbf1d9c83cb6e7516b799566f5a077ca4198a7c13879e02ebc59c2e13d3ea5","observation_id":"8625d7cc-78aa-4e18-9c69-5d185cb40c03","resolution":{"observed_at":"2026-08-15T18:46:04.015322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T18:46:03.708856Z","title":"Qwen-VL: a versatile vision-language model with in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.708856Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:5ae55a300310ff52281b977d09479087e714a2a94d975b735e16d69c3ca27c54","observation_id":"8e4f297d-0d47-4626-af6e-e971c00aff3c","resolution":{"observed_at":"2026-08-15T18:46:03.708856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09245","last_updated":"2024-05-17T08:05:18Z","snapshot_observed_at":"2026-08-16T14:26:46.132985Z","submitted_at":"2024-01-17T14:47:26Z","title":"Uncertainty estimates for semantic segmentation: providing enhanced reliability for automated motor claims handling","version":2},"cited_work":{"arxiv_id":"2401.09245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09245","snapshot_observed_at":"2026-08-15T18:46:03.828974Z","title":"Uncertainty estimates for semantic segmentation: providing enhanced reliability for automated motor claims handling","venue":"cs.CV","work_id":"4f0c87f9-dffb-4b9c-8489-19dd785bf08a","year":2024},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.712921Z"},"links":{"cited_paper":"/paper/2401.09245","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:9df19728c4759614d95bfe7212c6cc478c2d317f874163496451320a964ff3e9","observation_id":"85c84dc7-508d-4685-8e72-1e1ea0405777","resolution":{"observed_at":"2026-08-15T18:46:03.833662Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.998232Z","title":"Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":"8ec27fce-889c-443a-9789-af002ea3322a","year":2017},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.716980Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:374580df8ff0dfe7a349c1c5dd7d355f724fb3e3f80d0baf8f12fe5f8978f996","observation_id":"4810cd64-9b2c-47a6-a56f-ca0ebda08dab","resolution":{"observed_at":"2026-08-15T18:46:04.002676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.985227Z","title":"Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Ba- tra","venue":null,"work_id":"232dfdd4-f08f-456b-9510-33842f205feb","year":2019},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.722298Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:68ff118164fc733d6d8f3f272ffebdaed20c402ad862e6812887978b527e2abf","observation_id":"ab0d3a7d-9336-465e-83f1-0972c0f63b06","resolution":{"observed_at":"2026-08-15T18:46:03.989684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.972124Z","title":"Deep inside convolutional networks: visualising image clas- sification models and saliency maps","venue":null,"work_id":"675624e5-6d12-42c5-ae35-78161fa4bb9c","year":2014},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.725942Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:c277b061e72a39ac294899eeb8e96a36749c72769ebf4ce759d6627fccf6277b","observation_id":"13db61c4-7aed-41f1-821b-af02a44434df","resolution":{"observed_at":"2026-08-15T18:46:03.976671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00997","last_updated":"2023-05-30T15:22:09Z","snapshot_observed_at":"2026-08-16T15:28:16.560250Z","submitted_at":"2023-05-30T15:22:09Z","title":"On numerical solutions of the time-dependent Schr\\\"odinger equation","version":1},"cited_work":{"arxiv_id":"2306.00997","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00997","snapshot_observed_at":"2026-08-15T18:46:03.810197Z","title":"On numerical solutions of the time-dependent Schr\\\"odinger equation","venue":"physics.comp-ph","work_id":"8fef06ff-cffa-439b-9187-b64be42189c3","year":2023},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.729572Z"},"links":{"cited_paper":"/paper/2306.00997","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:ed25f3b85c95f917f8e3b499acbaf8a9f0e7b5c8dc8082c4b1818d18c07f7f18","observation_id":"d3968f7e-926d-4681-8dc7-aa014e420dcc","resolution":{"observed_at":"2026-08-15T18:46:03.814922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03118","last_updated":"2024-06-24T22:45:20Z","snapshot_observed_at":"2026-08-20T14:56:32.169214Z","submitted_at":"2024-04-03T23:57:34Z","title":"LVLM-Interpret: An Interpretability Tool for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03118","snapshot_observed_at":"2026-08-15T18:46:03.733512Z","title":"Rohekar, Yaniv Gurwicz, Nisim Harel, Lior Wolf, and Gal Chechik","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.733512Z"},"links":{"cited_paper":"/paper/2404.03118","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:bd1893d9dfa9ba95851799240be7334673ef80d0712ac132bca4fc3765535029","observation_id":"01581318-b063-4710-9727-44e317e01030","resolution":{"observed_at":"2026-08-15T18:46:03.733512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.960346Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":"42bfcd81-2159-4346-9ce0-f6dd0d0c50e6","year":2017},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.737200Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:e928d39195ca100f0955d76d03f810ea0e3401adc292d30420da5c2022061a19","observation_id":"ef6f40f4-bdf6-47ab-8fde-1911bff2fc9b","resolution":{"observed_at":"2026-08-15T18:46:03.964230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06670","last_updated":"2025-03-09T15:43:55Z","snapshot_observed_at":"2026-08-16T12:51:46.238012Z","submitted_at":"2025-03-09T15:43:55Z","title":"Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On","version":1},"cited_work":{"arxiv_id":"2503.06670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06670","snapshot_observed_at":"2026-08-15T18:46:03.779290Z","title":"Attention, Please! PixelSHAP Reveals What Vision-Language Models Actually Focus On","venue":"cs.CV","work_id":"a21f1d11-6318-4965-aea1-37f03411eed9","year":2025},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.740939Z"},"links":{"cited_paper":"/paper/2503.06670","citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:c6cca05a5a078c505c9a3d0c2e839e8a319bedce95c134ed452f2fe0cf91c5d9","observation_id":"5c4d78c7-4ea7-4683-866c-3774b2dd847d","resolution":{"observed_at":"2026-08-15T18:46:03.785591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.948724Z","title":"VQA-MHUG: human gaze supervision for visual question answering","venue":null,"work_id":"2937da21-586c-458e-a407-0a61742c5d46","year":2022},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.744697Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:feb88214c378e6ba5515c0849b740c6418bf193342f0e7544d9e75276dcfebb2","observation_id":"9758877d-3a24-40fc-b4b4-0f5d28450645","resolution":{"observed_at":"2026-08-15T18:46:03.952722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:46:03.936643Z","title":"What if the tv was off? examining counterfactual reasoning abilities of vision-language models","venue":null,"work_id":"15880882-9c97-400d-8471-454649c5e64d","year":2024},"citing_paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:46:03.748195Z"},"links":{"citing_paper":"/paper/2506.18985"},"observation_digest":"sha256:58df6c3cf66980087e360e467ce18f0190cb9d401c976eeec506ad5142fcba54","observation_id":"b27832b6-71d2-45dd-9a4b-b6ff578538dc","resolution":{"observed_at":"2026-08-15T18:46:03.940691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18985","last_updated":"2025-07-29T17:59:59Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T07:15:50.558756Z","submitted_at":"2025-06-23T18:00:04Z","title":"GLIMPSE: Holistic Cross-Modal Explainability for Large Vision-Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 2 inbound Pith citation observations for arXiv:2506.18985."}