{"as_of":"2026-08-09T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60642aefe3e710f6821a775f906fa34d93afeefd93ec7bb8972eb64d33ecaffb","coverage":[{"denominator":251,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:59:11.105981Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05258/citation-record","integrity":"/paper/2608.05258/integrity","json":"/paper/2608.05258/citation-record.json","paper":"/paper/2608.05258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.556089Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.556089Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bd34aabb27a2a58101732478fbf1d7cff8e62edef3c57fc7f0a5f70947ef3e04","observation_id":"d11799d7-cbac-4c50-a9c6-c44c89d41f55","resolution":{"observed_at":"2026-08-08T16:59:10.556089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.561346Z","title":"Representation learning and na- ture encoded fusion for heterogeneous sensor networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.561346Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:15f445eec05a066c0825c576f33fef4905d7301ecc7e813f308f8ac70f5448a8","observation_id":"6f4bef24-111c-4059-9ebc-51ec3ae2795f","resolution":{"observed_at":"2026-08-08T16:59:10.561346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.565742Z","title":"Congestion aware dynamic user association in heterogeneous cellular network: A stochastic decision approach,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.565742Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:a67bee370c0ef1f9ac1f872c5981b83d75239b58350093efc63367b72015b84b","observation_id":"0e2d9a63-413d-4eb4-9378-4d3f3b328dee","resolution":{"observed_at":"2026-08-08T16:59:10.565742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.570437Z","title":"Enhanced robustness by symmetry enforcement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.570437Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d26864ad2d45ee1dd113f80013c84159f37428f6950c63fc766e4c3d893a107d","observation_id":"165e5521-1a09-4255-b96d-1b3629368d1d","resolution":{"observed_at":"2026-08-08T16:59:10.570437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.575167Z","title":"Partial interference alignment for heterogeneous cellular networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.575167Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:a038d4078f1d4a034e8dcd3667ff153c87e8c7dec5e297e85249120ec51d8b93","observation_id":"0a432fff-c026-428e-b74b-259d3a45497a","resolution":{"observed_at":"2026-08-08T16:59:10.575167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.580043Z","title":"Optimization for user centric massive mimo cell free networks via large system analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.580043Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9747e6fdcf066495cb8435cee1a262f818ce620b7d5d85a8a50b82ea0d697575","observation_id":"d61ebdc0-a3e0-4c47-9539-b20da33af6c3","resolution":{"observed_at":"2026-08-08T16:59:10.580043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.589472Z","title":"Exploration vs exploitation for distributed channel access in cognitive radio networks: A multi-user case study,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.589472Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:df14ca17e9731a2eecfa8e53d6795f37d35a9070b64efef2545fc46e7ffe23c3","observation_id":"2ee2b689-e79e-4419-9d9c-87ebb4c5be66","resolution":{"observed_at":"2026-08-08T16:59:10.589472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.593676Z","title":"Deep reinforcement learning based computation offloading for mobility-aware edge computing,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.593676Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:cd190a1936afa06dc0b34a361cd437dcb058eb89034a63d0455e7c09d7924bf0","observation_id":"9fa2d7cb-02eb-49cc-9232-b08d59763459","resolution":{"observed_at":"2026-08-08T16:59:10.593676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.598216Z","title":"Performance analysis of co- operative multicell precoding with global csi and local individual csi in the large dimensional regime,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.598216Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c47b98ddf6daebf33c7700b0b5bceda8706ff2b0e2e9ade3f7da7769243d375e","observation_id":"e4dffcba-d670-4690-a55a-66053719d781","resolution":{"observed_at":"2026-08-08T16:59:10.598216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.602562Z","title":"Low complexity optimization for user centric cel- lular networks via large dimensional analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.602562Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c4cdb3b4bca34299090efecf540e53d26ac224543bb2abf553029725679f2330","observation_id":"436732dc-d1bc-4b90-83ff-e0eb42420b21","resolution":{"observed_at":"2026-08-08T16:59:10.602562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.607014Z","title":"Improving robustness of deep neural networks via large-difference transformation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.607014Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0c96b20ce3b99697e9763be06afacf9f577097615b0d093c6772c48a99116ec2","observation_id":"080326ea-9f1c-40ed-a3a6-f66ce1a212ab","resolution":{"observed_at":"2026-08-08T16:59:10.607014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.611370Z","title":"Looking beyond content: Modeling and detection of fake news from a social context perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.611370Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d11c0d0d51691493e25168ac4c652cdef4ec7415fe031563a2eb13f0ff73e87d","observation_id":"c0a28969-e207-40c6-b238-b9141d7a21a9","resolution":{"observed_at":"2026-08-08T16:59:10.611370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.615627Z","title":"Large system analysis for densification of cellular networks with massive mimo,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.615627Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8f63cd0bb7a15202ea7b86bfda57b6a32904f897d6e4f02d1068c8ebcd529709","observation_id":"b70425f5-9a7f-40fa-a5f3-fc1c4fc27c6d","resolution":{"observed_at":"2026-08-08T16:59:10.615627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.620148Z","title":"Collabora- tive spectrum sharing based on information pooling for cognitive radio networks with channel heterogeneity,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.620148Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:b2b54f2e43f7bc94ea745dfb4fb84a5978d3b53ef70743850c2570ce2c64ba2c","observation_id":"a73bec4b-fc33-4bd0-ae8e-aa38cba8ae2e","resolution":{"observed_at":"2026-08-08T16:59:10.620148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07022","last_updated":"2024-12-09T22:09:13Z","snapshot_observed_at":"2026-08-07T21:27:10.375359Z","submitted_at":"2024-12-09T22:09:13Z","title":"Dense Cross-Connected Ensemble Convolutional Neural Networks for Enhanced Model Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07022","snapshot_observed_at":"2026-08-08T16:59:10.624519Z","title":"Dense cross-connected ensemble convolutional neural networks for enhanced model robustness,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.624519Z"},"links":{"cited_paper":"/paper/2412.07022","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:71c7f303545dd9d6cedf96dd9d61dd0096273d8b885a8fbb6224c616c414f337","observation_id":"4187ea7e-2c05-4ca1-aa10-17fbc28ccd8d","resolution":{"observed_at":"2026-08-08T16:59:10.624519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.629428Z","title":"Information theory and represen- tation learning inspired multimodal data fusion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.629428Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0f156c8e8c3660dc54291943f79328a483364a22944e966c51bf7054215e6cab","observation_id":"8a2fd787-2e48-4a4b-9cd7-e89decb85427","resolution":{"observed_at":"2026-08-08T16:59:10.629428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19747","last_updated":"2024-12-27T17:14:52Z","snapshot_observed_at":"2026-08-07T07:17:12.623382Z","submitted_at":"2024-12-27T17:14:52Z","title":"Enhancing Adversarial Robustness of Deep Neural Networks Through Supervised Contrastive Learning","version":1},"cited_work":{"arxiv_id":"2412.19747","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19747","snapshot_observed_at":"2026-08-08T16:59:12.281657Z","title":"Enhancing Adversarial Robustness of Deep Neural Networks Through Supervised Contrastive Learning","venue":"cs.LG","work_id":"aae96f56-4ea0-4f74-ae2c-9853be91aaf7","year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.638625Z"},"links":{"cited_paper":"/paper/2412.19747","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d812feb4338d75e95ffdda6c422e5f4e05d1d8f058d2622ea0a7079e1cc2e2df","observation_id":"560e8a2e-44dc-4470-a3d9-6adbcdc5c858","resolution":{"observed_at":"2026-08-08T16:59:12.286699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.647891Z","title":"Multi-scale unrectified push-pull with channel attention for enhanced corruption robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.647891Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:adbbac7583e0e37b8c1b617c2f9cee90db1ebd4d36dc18378648d8348a359f87","observation_id":"5bf5c5cb-b07f-465f-b50e-d916ce2e0b23","resolution":{"observed_at":"2026-08-08T16:59:10.647891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.652271Z","title":"Expert-guided ex- plainable few-shot learning for medical image diagnosis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.652271Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3d2cb533473e32802f68084d9c7a73ea0843ed40811b72276cbe67725bc9cc02","observation_id":"fa094813-9e56-4e25-adf3-58b74e9fbf87","resolution":{"observed_at":"2026-08-08T16:59:10.652271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04682","last_updated":"2026-06-10T18:21:11Z","snapshot_observed_at":"2026-08-07T21:27:04.727006Z","submitted_at":"2025-09-04T22:03:05Z","title":"GetNetUPAM: Ecologically Informed Nested Cross-Validation and Noise-Robust Attention for Marine Bioacoustic Monitoring","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04682","snapshot_observed_at":"2026-08-08T16:59:10.656692Z","title":"Ecologically valid benchmarking and adaptive attention: Scalable marine bioacoustic monitoring,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.656692Z"},"links":{"cited_paper":"/paper/2509.04682","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:68ee5ad2a38c1bcc8d18d3cffab3f38c82be8fc5c253750fb2ac588baa5eacc2","observation_id":"ebb2d243-fe70-4e43-9158-7b3e6fd6f25b","resolution":{"observed_at":"2026-08-08T16:59:10.656692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.661437Z","title":"Shape-aware thoracic edge map chest x- ray representation for pulmonary abnormality screening,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.661437Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ab5e72b41ce10a36d0a835e72c59f4434fb22c1d28a47ca6c9cd99cacfd65547","observation_id":"0a9a379b-e784-4fb8-8ece-6d18600a778f","resolution":{"observed_at":"2026-08-08T16:59:10.661437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.665772Z","title":"Expert-guided ex- plainable few-shot learning with active sample selection for medical image analysis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.665772Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:bb0245a95e1e45331fbc4cfabd3d2bd8614ae93fb54f3f3f53e97c6b5494f592","observation_id":"2c2acf1c-776b-434b-ae53-208c6063aa2d","resolution":{"observed_at":"2026-08-08T16:59:10.665772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08959","last_updated":"2025-09-10T19:43:16Z","snapshot_observed_at":"2026-08-04T19:58:18.232862Z","submitted_at":"2025-09-10T19:43:16Z","title":"CoSwin: Convolution Enhanced Hierarchical Shifted Window Attention For Small-Scale Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08959","snapshot_observed_at":"2026-08-08T16:59:10.670721Z","title":"Coswin: Convolution enhanced hierarchical shifted win- dow attention for small-scale vision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.670721Z"},"links":{"cited_paper":"/paper/2509.08959","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e399b082e94bf317a75279a6730dc4418e9cf7c3dedce4d0b6ec34811d6dfa12","observation_id":"17e6e87b-f390-4c29-88ef-d4a356b0cd8e","resolution":{"observed_at":"2026-08-08T16:59:10.670721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.679820Z","title":"Channel-selected stratified nested cross- validation for clinically relevant eeg-based parkinson’s disease detection,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.679820Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:aa896cb9c4662665ce470a9c0f3d588e02804ae9863000fad1f7f42c2b23ff18","observation_id":"308bf2a7-06f6-41e5-b35c-9e8d88885f42","resolution":{"observed_at":"2026-08-08T16:59:10.679820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.688548Z","title":"Promoting shape bias in cnns: Frequency-based and contrastive regularization for corruption robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.688548Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:db5b9b93abd767224ccf2c24a1c9cac46681faac57bf6cba42be8561ab8978ee","observation_id":"5a839a49-aa0d-45fb-a851-9a253daada16","resolution":{"observed_at":"2026-08-08T16:59:10.688548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.692920Z","title":"Learning to select like humans: Explainable active learning for medical imaging,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.692920Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:abdd4260fb949aee615fc7448b08b4719eac5774a3ea6d71b25c489c50150b20","observation_id":"68879a51-1b9a-4caf-99e1-89967ab390f8","resolution":{"observed_at":"2026-08-08T16:59:10.692920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04548","last_updated":"2026-07-05T23:36:36Z","snapshot_observed_at":"2026-08-08T03:02:23.476662Z","submitted_at":"2026-07-05T23:36:36Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","version":1},"cited_work":{"arxiv_id":"2607.04548","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04548","snapshot_observed_at":"2026-08-08T16:59:12.215878Z","title":"Explainable Novel Category Discovery in Semantic Concept Space","venue":"cs.CV","work_id":"fa0e86a2-f5ec-4368-8899-4b72ebf79b48","year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.697321Z"},"links":{"cited_paper":"/paper/2607.04548","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:97a8c4a015c8007ca546bb2702378dae8ceb07b2b849f0fce95ee9e1cf9945c7","observation_id":"5e0d7a4c-b915-49b8-803f-988056107507","resolution":{"observed_at":"2026-08-08T16:59:12.233533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07903","last_updated":"2026-07-08T20:31:06Z","snapshot_observed_at":"2026-08-07T02:48:01.295589Z","submitted_at":"2026-07-08T20:31:06Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","version":1},"cited_work":{"arxiv_id":"2607.07903","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07903","snapshot_observed_at":"2026-08-08T16:59:12.165147Z","title":"Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs","venue":"cs.CR","work_id":"1526e676-be47-4a0d-9a5d-a3e6b900ba11","year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.702144Z"},"links":{"cited_paper":"/paper/2607.07903","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:619e5bcc3c5f930d9e5aa795def8f68ca676fa2370d16c18f155d5665a17e992","observation_id":"1887b201-8937-4113-8006-45742510055d","resolution":{"observed_at":"2026-08-08T16:59:12.188293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.706882Z","title":"Frequency-aware contrastive learning for robust shape- biased convolutional neural networks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.706882Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2b0f5954bf42aaf7ee5f6fd6405bf75941be9f95519c00bfb08c4b62a9afd19c","observation_id":"785d0c0a-8fd3-48d4-8273-6b16a02a5c28","resolution":{"observed_at":"2026-08-08T16:59:10.706882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.715737Z","title":"Large dimensional analysis of cooperative multicell precoding with local individual csi,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.715737Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:55e456b77c2babd70180ebf3756b1713150d586ab9305488fb949ed407e13a7f","observation_id":"0eb09aea-aa89-4ab3-912a-63997d1f0ec2","resolution":{"observed_at":"2026-08-08T16:59:10.715737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.720161Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.720161Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ecd5863f94f6c281aa672b21493e388ad7d1838836f6deea01671b6efc8cda29","observation_id":"76993563-aada-40e3-8a68-19ca3b42c1ad","resolution":{"observed_at":"2026-08-08T16:59:10.720161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.724493Z","title":"Pytorch library for cam methods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.724493Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d1a25b85e58fa9516a5b6d042ee53919070c481636a85c65bcccc379742c67ee","observation_id":"c152891f-6aea-4391-9770-f81c10223d9d","resolution":{"observed_at":"2026-08-08T16:59:10.724493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.729099Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.729099Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9de4d7f86386fa6dbaeda9044a5c010c97bc5d0d6215cc3dbe5724d5575015f3","observation_id":"abf010bf-e3a3-4d15-b72c-98b4ee4e40eb","resolution":{"observed_at":"2026-08-08T16:59:10.729099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.733515Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.733515Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f96c6f5f0194312a99b409ddcd149e3f341cacd3e74b2dd46fc566954a7d5ff3","observation_id":"dee03cc4-5b09-42d9-a478-cde19bd6ed33","resolution":{"observed_at":"2026-08-08T16:59:10.733515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.746918Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.746918Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:4ef3dfc9d5764e040f965c8b8e386b04bc7491fba909148b7b7ce7feeab6ac6b","observation_id":"b840d73a-bd35-41ba-b90e-c89e2322738a","resolution":{"observed_at":"2026-08-08T16:59:10.746918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.751469Z","title":"Training data-efficient image trans- formers &; distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.751469Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3ffc59147fd7b53c109f855d7ddf191ac7e5a778ac015dca29910e353580734c","observation_id":"a6c68623-1328-45ae-ab66-0afe03014e9f","resolution":{"observed_at":"2026-08-08T16:59:10.751469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.755770Z","title":"Grad-CAM++: Generalized Gradient- Based Visual Explanations for Deep Convolutional Net- works ,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.755770Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:329ad7e2df06feeac0a33ec41994b11404ecce0e6f0c47f9d662114eaef610b9","observation_id":"696a8e51-6cb3-42bd-88a1-ce695928b7bc","resolution":{"observed_at":"2026-08-08T16:59:10.755770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.773034Z","title":"Ablation-CAM: Visual Explanations for Deep Convolutional Network via Gradient-free Localization ,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.773034Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:cbe21733c1bc2c5fb06fb6bdeadaa36e62da3e1b627a5f2b3722fdcf6b0e68e9","observation_id":"6414c085-63b4-4f74-8954-2810626e624f","resolution":{"observed_at":"2026-08-08T16:59:10.773034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.777847Z","title":"Full-gradient representation 18 for neural network visualization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.777847Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7cfed82a7ba455d18411724434e72533995caa7ee5fd901b292a4ef7fc03ea66","observation_id":"82ef59c6-4706-47f0-a4d7-7dba82f80efd","resolution":{"observed_at":"2026-08-08T16:59:10.777847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.782410Z","title":"Axiom-based grad-cam: Towards accurate visualization and explanation of cnns,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.782410Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:dfd73a464186ff4dbbf9ac25b5da3b77c36c1e96ff9df0374da279e37ebba143","observation_id":"5fed5e13-e4f3-403a-b455-b126fd1519d5","resolution":{"observed_at":"2026-08-08T16:59:10.782410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.786756Z","title":"Learning Deep Features for Discriminative Lo- calization ,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.786756Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:dd87908ff7900eb4e9406aef93d58ada6b0640c80e076852c1d3826ded5d4572","observation_id":"cd3ccd1c-3dec-4a3a-9b36-2839533aabb0","resolution":{"observed_at":"2026-08-08T16:59:10.786756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.808587Z","title":"Boosting the transferability of adversarial attack on vision transformer with adaptive token tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.808587Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:aa58306d93eee6b4c4bdcfd2539e548272b0bb37cfef98f378bc594567ffaf2a","observation_id":"e5ef305a-6724-4d60-857d-ce9c68ff429a","resolution":{"observed_at":"2026-08-08T16:59:10.808587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.826360Z","title":"Emergent open-vocabulary semantic segmentation from off-the- shelf vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.826360Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3bcf510a7632feffb4ac1b988eed76a54421f371bf828f97bce96da0bb5cb011","observation_id":"16c8297c-2f6b-4232-8c4e-fbe9ed8eba55","resolution":{"observed_at":"2026-08-08T16:59:10.826360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.843724Z","title":"Enhancing prompt generation with adaptive refinement for camouflaged object detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.843724Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:97b6f1b146cb343c0ff7fc14f799ec63a28623b9d5674948ae602c6862b7b59d","observation_id":"56931160-3718-46e4-a740-1a38aa352710","resolution":{"observed_at":"2026-08-08T16:59:10.843724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.848312Z","title":"Quantifying attention flow in transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.848312Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7934014a5ca70e9d896ce8697297b364250a70cca9f28257bc162c4261cddaee","observation_id":"be5f9b4b-445c-4075-b715-e6e5f63cc018","resolution":{"observed_at":"2026-08-08T16:59:10.848312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.854375Z","title":"Unlike attention-map adaptations, the method operates on feature activations from the MLP in the final transformer blocks and uses the true-label class score as the gradient target","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.854375Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:4cecaa7082650039c7c0fed842ff211c40c1e871859bb8dca016ca6ce91bfb96","observation_id":"66fc7b3d-3284-4d49-90a0-16d4df5bba58","resolution":{"observed_at":"2026-08-08T16:59:10.854375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.859102Z","title":"the best way we found to apply GradCAM was to treat the last attention layer’s [CLS] token as the designated feature map,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.859102Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:6dafc7c2fd3c7bab8d3d71b1504f47a77c1a7618b63338ad848069e41fcaf661","observation_id":"e7d02dc3-01c1-42c1-8479-e6d76c39c4dd","resolution":{"observed_at":"2026-08-08T16:59:10.859102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.863825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.863825Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f04a93a6fe68a7e9dd050572a9e6ddb5d0ae5140652c26b1a7ba2b3e1e8a6b33","observation_id":"11f0496e-6463-4aa2-8fbc-b70039ffd91b","resolution":{"observed_at":"2026-08-08T16:59:10.863825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.868882Z","title":"Rather than using an attention map as the attribution representation, the method operates on token-level feature activations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.868882Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9db27d68ec1ab400040936b23084e5b9dc1cee77d3acebf0b101240e530d27bf","observation_id":"b3a3ab5f-8b3b-4e34-9e52-235dae4b36c1","resolution":{"observed_at":"2026-08-08T16:59:10.868882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.873765Z","title":"Rather than operating on attention maps, it fuses gradients and intermediate ViT features from a selected transformer layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.873765Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e153141167200f7f784c380933e2797115e9c3c24fbdf3162e31572f8691b09b","observation_id":"df55f346-798b-46c6-84f3-1a175cd1ff09","resolution":{"observed_at":"2026-08-08T16:59:10.873765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.879223Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.879223Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8ade9f9e7ab691e94bde2212f25d278f8079c4eeb372e48da8463a9ac576b1a2","observation_id":"03d04be6-ae68-4e9e-96cd-af6d03164695","resolution":{"observed_at":"2026-08-08T16:59:10.879223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.884275Z","title":"Align before Fuse: Vision and Language Representation Learning with Momentum Distillation [11]is best charac- terized as an attention-map-based attribution method","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.884275Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2a6cfee4e9e2e8db97d2fb9466343d276b05fe3e025ce44c8521301890729275","observation_id":"a7d66fd2-ced5-4a14-9c46-570c15028ffe","resolution":{"observed_at":"2026-08-08T16:59:10.884275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.889056Z","title":"matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.889056Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3de347f14ecf6ed3f88876b7257ba4a071e35fbf30fd80eeea17509a537f2878","observation_id":"ea63f919-8c90-4164-b286-bae2091db538","resolution":{"observed_at":"2026-08-08T16:59:10.889056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.893576Z","title":"A dog on a white bed","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.893576Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0481baa76f792d2f737bd1522bbcf25d27b88f4a5b9eb3c972e70bb0b27a7d14","observation_id":"896927b2-4c58-4e89-bab1-255af39476c8","resolution":{"observed_at":"2026-08-08T16:59:10.893576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.897806Z","title":"Grad-cam: Visual explana- tions from deep networks via gradient-based localiza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.897806Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:0e4b8d8fe9755863b1a106b0f4aa7613f34e51f324572b5f51a63dee0561917c","observation_id":"89e53fb0-a68d-40e6-9a66-da144f0ab390","resolution":{"observed_at":"2026-08-08T16:59:10.897806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.901874Z","title":"BLIP: Bootstrap- ping language-image pre-training for unified vision- language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.901874Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:26117b0b0883cfee2f04b6beaa7c0f267b99ee7d96e87f5b4bc3cd945c686075","observation_id":"54a8e770-36e0-4c28-96ff-64fa6d237f88","resolution":{"observed_at":"2026-08-08T16:59:10.901874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.906013Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.906013Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:554e568824e13215aeea06b75c6b0f85e458045175c640f60dda17c31636dbc2","observation_id":"d76fc51a-f104-4dbe-b7ad-4d69d5bbb578","resolution":{"observed_at":"2026-08-08T16:59:10.906013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.910505Z","title":"Transformer in- terpretability beyond attention visualization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.910505Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:15ae8f8a8d533677c8c80908ca7db64f5aa8e33204cde91de28a1e0e3a169f79","observation_id":"bcd781eb-9620-480d-9bd2-343bcd340632","resolution":{"observed_at":"2026-08-08T16:59:10.910505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.914869Z","title":"Transreid: Transformer-based object re-identification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.914869Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8c48f098bebf01331908e69a922c47d12e18fe9d179718257f3fc39880356861","observation_id":"348bd8db-0aa6-4056-a8e9-124e79fe93b7","resolution":{"observed_at":"2026-08-08T16:59:10.914869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.918840Z","title":"Generic attentiemer- gent on-model explainability for interpreting bi-modal and encoder-decoder transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.918840Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ce799296ad56c82d47cd76317d57c0cbe8bae2e669ea45ff00c86b062a2a846d","observation_id":"e30f169d-cf73-4ba5-a336-278ebc76c72e","resolution":{"observed_at":"2026-08-08T16:59:10.918840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.923344Z","title":"Ia-redˆ2: Interpretability-aware redundancy reduction for vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.923344Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:f3db226ba5b0ba2f243dab12443baf25e712dfdc98d2bb4018510a0d871a5b63","observation_id":"572b76d5-12af-4075-b5b9-679acd5c8875","resolution":{"observed_at":"2026-08-08T16:59:10.923344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.927583Z","title":"Analogous to evolutionary algorithm: Designing a unified sequence model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.927583Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ffde972c131aa8283c4c83923d361a048719a21e6468da342e4d391135d0bfa8","observation_id":"529da6a4-e53c-4da3-b876-01c18d88157d","resolution":{"observed_at":"2026-08-08T16:59:10.927583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.932385Z","title":"Passive attention in artificial neural networks predicts human visual selectivity,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.932385Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:77d5e7665baa1820e18080e88e1cb0bd39d1bc3bef16aee636448b86d7174080","observation_id":"3332e09e-68ef-453d-974c-e65a0d2ab1b4","resolution":{"observed_at":"2026-08-08T16:59:10.932385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.936914Z","title":"Vitae: Vision transformer advanced by exploring intrinsic inductive bias,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.936914Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e27d0703b154a74126e8dec7cf47ede34eb2f9e3db28acf2fc1248d3d2dcf956","observation_id":"f616e9ae-43fe-4b85-9ff3-fcc8cee7ec56","resolution":{"observed_at":"2026-08-08T16:59:10.936914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.941698Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.941698Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:7d2c763c26a5121b8664a2a4e3735dec73557f6d88c3bebad475251b5ca60d46","observation_id":"7a6cbe1b-3acb-4ea5-aedd-678e82902f72","resolution":{"observed_at":"2026-08-08T16:59:10.941698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09374","last_updated":"2022-08-19T14:39:18Z","snapshot_observed_at":"2026-07-06T13:43:32.141581Z","submitted_at":"2022-08-19T14:39:18Z","title":"VLMAE: Vision-Language Masked Autoencoder","version":1},"cited_work":{"arxiv_id":"2208.09374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.09374","snapshot_observed_at":"2026-08-08T16:59:12.106060Z","title":"VLMAE: Vision-Language Masked Autoencoder","venue":"cs.CV","work_id":"d3833444-1ae8-4185-b487-a9a2572b8fbd","year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.946360Z"},"links":{"cited_paper":"/paper/2208.09374","citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2a1a29ecf6600c84db063ca8e9daf675145b22083ee69ddd5fcea5b298f7df38","observation_id":"7d534b61-812d-4bd6-8096-e1accd4878e1","resolution":{"observed_at":"2026-08-08T16:59:12.128574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.951037Z","title":"A compre- hensive study of image classification model sensitivity to foregrounds, backgrounds, and visual attributes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.951037Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ec4ce8d1bde3eeed4be2d19df167bdce6215a3e7a979f2ec05b7b8b127815543","observation_id":"e90b8372-757a-4350-af5f-4898e7a6a024","resolution":{"observed_at":"2026-08-08T16:59:10.951037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.955330Z","title":"A challenging benchmark of anime style recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.955330Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:2f2f17a9c90dc2b82b7495a8ba1979dea35d0967122bf9e820c990aa0b92e706","observation_id":"d0d4f501-0a2b-4007-83e3-1ccef1a65f85","resolution":{"observed_at":"2026-08-08T16:59:10.955330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.960419Z","title":"Metaformer is actually what you need for vision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.960419Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ee8484dc1e2c7f609fb981e50ab4e3e64f3337179796b14dd9bb72659187fb4d","observation_id":"7ec2ad21-43de-4333-99d6-ba9ecface9a1","resolution":{"observed_at":"2026-08-08T16:59:10.960419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.965280Z","title":"Delving deep into the generalization of vision transformers under distribution shifts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.965280Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3e57a8443e511aa33fa5ddb7ac2cc69741694ec0386d83235b8d096cdc993fc7","observation_id":"0869e2ca-474f-46aa-bf2b-667d754c1d32","resolution":{"observed_at":"2026-08-08T16:59:10.965280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.970138Z","title":"General facial representation learning in a visual- linguistic manner,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.970138Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:8051d7be6c5cf131d514a6e5132e3409c60d91039603db7a4c90cf093c90c39e","observation_id":"3992634d-9567-458d-893d-75ca64e133cb","resolution":{"observed_at":"2026-08-08T16:59:10.970138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.974492Z","title":"Multi-modal alignment using representa- tion codebook,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.974492Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c430bb18a0fe7b1f243757600ba8fd69f3b621878eccc11f9a571d2de1c33adc","observation_id":"ce334212-4a11-43ec-bcb4-c49ea2364d55","resolution":{"observed_at":"2026-08-08T16:59:10.974492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.979504Z","title":"Plug-and-play VQA: Zero-shot VQA by conjoining large pretrained models with zero training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.979504Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ed30c4e0704fbadcf2b1b6766fc725ed96059c6d2c7841bb2ea2d9e56fe8deab","observation_id":"136ae6d9-9f8c-473a-9a0c-572f10a23b29","resolution":{"observed_at":"2026-08-08T16:59:10.979504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.983594Z","title":"Inception transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.983594Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:10b73e0c3a853c43c88891a9dd45585612585f1f6a4629c7d361bf043ae6b69b","observation_id":"16f7963a-715b-4d2f-800a-927664864f8c","resolution":{"observed_at":"2026-08-08T16:59:10.983594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.988241Z","title":"Delving into sequential patches for deep- fake detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.988241Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:3ab56f483b3932fd795a4dbd5b6924d71bd19f12662642d145d5d67c94c477bb","observation_id":"e6bb17c9-8e60-480f-b346-9f91e16eba1c","resolution":{"observed_at":"2026-08-08T16:59:10.988241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.992974Z","title":"Adversarial normalization: I can visualize everything (ice),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.992974Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:90a14f03830c1860e91275c3e2f4f1a6db127ee2490b320d1462f40226343fec","observation_id":"221817f8-c088-4d15-a179-8aac556bfc75","resolution":{"observed_at":"2026-08-08T16:59:10.992974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:10.997910Z","title":"A new benchmark: On the utility of synthetic data with blender for bare supervised learning and downstream domain adaptation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:10.997910Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:aaf9131eed3607c4cb09083e21ad10d29ccc6758bfbfec32aee23a023f018eea","observation_id":"435411ee-05f4-4aa7-b21d-b796ff46f1e4","resolution":{"observed_at":"2026-08-08T16:59:10.997910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.002177Z","title":"Selfme: Self-supervised motion learning for micro- expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.002177Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:1a6a2009f4e2a1f52ba1fe397a2979a31e19a44b5e1efb7346e4da6e08f3e2a0","observation_id":"578198fe-54c4-47d8-8a41-bb65e2d10af6","resolution":{"observed_at":"2026-08-08T16:59:11.002177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.006873Z","title":"Marlin: Masked autoencoder for facial video representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.006873Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c49b604092d67a258f622912189c7b5362b9b8991f1941cccb8d2da4b3c1c820","observation_id":"2eb616b1-5ff8-4cde-9aa5-a6fcc5828b3b","resolution":{"observed_at":"2026-08-08T16:59:11.006873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.011351Z","title":"Blackvip: Black-box visual prompting for robust transfer learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.011351Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:4c19c364f9b2a9657e86fba145affcc6f9a363cf0cbc28726a5cbbf76cdd6f42","observation_id":"00360c11-ac10-4e8c-a3e0-a892efc24898","resolution":{"observed_at":"2026-08-08T16:59:11.011351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.015441Z","title":"To- kenhpe: Learning orientation tokens for efficient head pose estimation via transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.015441Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:9866999b76a26a424619715fe28e771c9e976324e9e39a91d1bd2695122081ae","observation_id":"b51f83f7-e2d6-43a8-b78d-3ca76bfc2530","resolution":{"observed_at":"2026-08-08T16:59:11.015441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.019933Z","title":"Boost vision trans- former with gpu-friendly sparsity and quantization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.019933Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:66ce5462f295ba6a88861872c45589992eb8466c28548399bffb50371ec2a664","observation_id":"50068a82-55d8-46f2-befa-fd67dd965d89","resolution":{"observed_at":"2026-08-08T16:59:11.019933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.024488Z","title":"Vision diffmask: Faithful interpretation of vision transformers with differentiable patch masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.024488Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:d491ae506c2ec080ea71bea2eb553d4177f8776ff8f12629e6c1aaec05d3010a","observation_id":"829603f1-bf1b-4491-b10e-32f38c1bceec","resolution":{"observed_at":"2026-08-08T16:59:11.024488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.029301Z","title":"Pha: Patch-wise high-frequency augmentation for transformer-based person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.029301Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:66c4daf254253a420e7c9a1e82b395493d152033273ddb77bdbd6759e8467c2f","observation_id":"f313bd3d-1844-4a9a-bd85-3d2672d52b36","resolution":{"observed_at":"2026-08-08T16:59:11.029301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.034092Z","title":"Vision trans- formers with mixed-resolution tokenization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.034092Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:050e246fae8f28d4f038e3b552f02a45b33fc56fed3163ce2657d1e469fec369","observation_id":"04a60b94-805b-4d54-98f9-74f3c0d9738b","resolution":{"observed_at":"2026-08-08T16:59:11.034092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.039180Z","title":"D3former: Debiased dual distilled transformer for incremental learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.039180Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:143b3c6a9717b3f113d14d6603bbdeb0498623432060bfc1ca35c47e491aa473","observation_id":"bf297aea-97c5-4447-9571-90ed5b5de311","resolution":{"observed_at":"2026-08-08T16:59:11.039180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.043469Z","title":"Shared inter- est...sometimes: Understanding the alignment between human perception, vision architectures, and saliency map techniques,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.043469Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:19db54f5712183d7521b384ccc413506130c4730206def4359decf7d8e68dda1","observation_id":"6c8475f5-969f-4ffa-9351-3c69d53c8376","resolution":{"observed_at":"2026-08-08T16:59:11.043469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.047846Z","title":"Semicvt: Semi- supervised convolutional vision transformer for seman- tic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.047846Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:57d81963ca0bda6beb98d09ef3e33be381f6413b96102e68613a7dc3c195cb0b","observation_id":"55df5f88-0300-4922-b572-9723c58761fc","resolution":{"observed_at":"2026-08-08T16:59:11.047846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.052256Z","title":"Masked autoencoding does not help natural language supervision at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.052256Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:6491b9c69b21f8973609c19ec6c77c12a3baefc81e9bddedad462da1d3a27a18","observation_id":"ceba726d-42b0-4a9d-8219-f66a38dffa55","resolution":{"observed_at":"2026-08-08T16:59:11.052256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.057254Z","title":"Vilem: Visual- language error modeling for image-text retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.057254Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:c1ecb88f327b80476d85e751d918efe07a9e70ff5ffa53ee3117e5ffe074da85","observation_id":"c2bc21db-f7a6-4764-8f71-0d34ef5184d3","resolution":{"observed_at":"2026-08-08T16:59:11.057254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.061757Z","title":"Fashionsap: Symbols and attributes prompt for fine-grained fashion vision-language pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.061757Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:a43c86d7c1018f36c0f44c524f04802a663cc50e5e0e1cc3967b943b4285906f","observation_id":"2da5988c-6dde-40e8-9825-d48802689472","resolution":{"observed_at":"2026-08-08T16:59:11.061757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.068004Z","title":"Zero-shot referring image segmentation with global-local context features,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.068004Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ac61a79b2eeb393c9a10f31d9b3d727864f65a46c596130e44963fc6849b7c08","observation_id":"a62b514b-987f-4434-bd4f-ac0f10068217","resolution":{"observed_at":"2026-08-08T16:59:11.068004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.072944Z","title":"Improving visual grounding by encouraging consistent gradient-based explanations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.072944Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:5b74182d1bbe85b949e808dafaf2f299b3cdcea6b9f348d9e02b86a1f57df2ca","observation_id":"c32fa6b7-ffff-4f1e-8ccc-54d1715fb53a","resolution":{"observed_at":"2026-08-08T16:59:11.072944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.077543Z","title":"Clip is also an efficient segmenter: A text-driven approach for weakly supervised semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.077543Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:e77fa4dfff1e610eddc77184beadc11ea33f91d8374912be43be3b327e380c18","observation_id":"7b42af4c-c1e8-401f-b212-beadef5ce0a3","resolution":{"observed_at":"2026-08-08T16:59:11.077543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.082156Z","title":"Multi-modal representation learn- ing with text-driven soft masks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.082156Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:eccc0064fb304fc530490b8a14fb084a5c2730c9a931cefc96b50b3ca77d4a20","observation_id":"e73f4ac9-9245-4cf8-8ac6-abe073ded2e0","resolution":{"observed_at":"2026-08-08T16:59:11.082156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.086478Z","title":"From images to textual prompts: Zero-shot visual question answering with frozen large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.086478Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:92f4940fd0162316075bfccfa1c5a4c486e52e37a3e7c4496e83fda7ce95021e","observation_id":"095db75f-298b-4a0f-98ad-8b46602f274c","resolution":{"observed_at":"2026-08-08T16:59:11.086478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.091386Z","title":"Sparse multi- modal vision transformer for weakly supervised seman- tic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.091386Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:525b33043ef4c323855edbde5523e9d691c4547e4b71bfae0b389e2eab39062c","observation_id":"5c5c3970-f154-4a40-aaf0-cbb4ac470c61","resolution":{"observed_at":"2026-08-08T16:59:11.091386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.095850Z","title":"Semantic information in contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.095850Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:ca0a2e3fdaf16e1ce0ad5459ec7af8e744657353b5ea01286a07ecd01517381f","observation_id":"ee4af320-2763-4d38-ae43-a9043e532d59","resolution":{"observed_at":"2026-08-08T16:59:11.095850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.100616Z","title":"Smmix: Self-motivated image mixing for vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.100616Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:5f19abe9629ce34f1a90956c0f8de806bbc6926349fdf925c8296edc5fc9c450","observation_id":"fe2cf79a-731b-4777-9221-70e8dabcd219","resolution":{"observed_at":"2026-08-08T16:59:11.100616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:59:11.105981Z","title":"Cose: A consistency- sensitivity metric for saliency on image classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI","version":1},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-08-08T16:59:11.105981Z"},"links":{"citing_paper":"/paper/2608.05258"},"observation_digest":"sha256:95c94bb4317fa513900bfba183fa3f2826f68d6a4a0b75ab5186349ad5d23cd2","observation_id":"0257e80a-6b6a-4220-a954-846725895a96","resolution":{"observed_at":"2026-08-08T16:59:11.105981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05258","last_updated":"2026-08-05T16:36:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:10:24.468400Z","submitted_at":"2026-08-05T16:36:06Z","title":"Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":96,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":251},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 251 outbound references and 0 inbound Pith citation observations for arXiv:2608.05258."}