{"as_of":"2026-08-20T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17674ceacc0e2b175e3685c18f2b4a24c3fe77c0bb908907babc9724e2db482b","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:10:16.073663Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:33:24.363074Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:09:15.243898Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"cited_work":{"arxiv_id":"2501.09333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09333","snapshot_observed_at":"2026-07-04T00:09:15.243898Z","title":"Prompt-cam: A simpler interpretable transformer for fine-grained analysis","venue":null,"work_id":"e7871945-1bb4-4991-b57f-88054a5b1062","year":2025},"citing_paper":{"arxiv_id":"2506.09082","last_updated":"2026-05-03T04:37:38Z","snapshot_observed_at":"2026-08-18T09:58:59.618504Z","submitted_at":"2025-06-10T05:43:34Z","title":"AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T11:12:41.130806Z"},"links":{"cited_paper":"/paper/2501.09333","citing_paper":"/paper/2506.09082"},"observation_digest":"sha256:5c7be51b15dc891817e36ee5763380d5aa666cef705418dbebd56d5a0a3cf11b","observation_id":"e04d3eea-4b88-4095-b940-aa224aff8e83","resolution":{"observed_at":"2026-05-19T11:13:02.882874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09333","snapshot_observed_at":"2026-08-15T18:33:24.363074Z","title":"Prompt-CAM: A simpler interpretable transformer for fine-grained analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19708","last_updated":"2025-06-24T15:15:15Z","snapshot_observed_at":"2026-08-17T21:05:01.309881Z","submitted_at":"2025-06-24T15:15:15Z","title":"Uncovering Conceptual Blindspots in Generative Image Models Using Sparse Autoencoders","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T18:33:24.363074Z"},"links":{"cited_paper":"/paper/2501.09333","citing_paper":"/paper/2506.19708"},"observation_digest":"sha256:dff842b09533c112bbb4b9080fae48a4fe143af5c452551a3c0da4b0a2fccd6d","observation_id":"0f28e8aa-6510-4f27-a9e4-ccec007d8cbc","resolution":{"observed_at":"2026-08-15T18:33:24.363074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"cited_work":{"arxiv_id":"2501.09333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09333","snapshot_observed_at":"2026-07-04T00:09:15.243898Z","title":"Prompt-cam: A simpler interpretable transformer for fine-grained analysis","venue":null,"work_id":"e7871945-1bb4-4991-b57f-88054a5b1062","year":2025},"citing_paper":{"arxiv_id":"2507.14787","last_updated":"2026-04-25T07:16:50Z","snapshot_observed_at":"2026-08-16T18:44:16.687614Z","submitted_at":"2025-07-20T02:08:23Z","title":"FOCUS: Fused Observation of Channels for Unveiling Spectra","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T03:51:41.228126Z"},"links":{"cited_paper":"/paper/2501.09333","citing_paper":"/paper/2507.14787"},"observation_digest":"sha256:68fa1ced522fb7b708b4e6e5781ee16ab46d1a73fd23c7bc1269829c8f0648f5","observation_id":"f1de9331-8d32-4f08-971f-444609384738","resolution":{"observed_at":"2026-05-19T03:52:01.433948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"cited_work":{"arxiv_id":"2501.09333","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09333","snapshot_observed_at":"2026-07-04T00:09:15.243898Z","title":"Prompt-cam: A simpler interpretable transformer for fine-grained analysis","venue":null,"work_id":"e7871945-1bb4-4991-b57f-88054a5b1062","year":2025},"citing_paper":{"arxiv_id":"2606.18885","last_updated":"2026-06-17T10:00:33Z","snapshot_observed_at":"2026-08-04T13:33:45.473188Z","submitted_at":"2026-06-17T10:00:33Z","title":"LARE: Low-Attention Region Encoding for Text-Image Retrieval","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T21:25:12.373068Z"},"links":{"cited_paper":"/paper/2501.09333","citing_paper":"/paper/2606.18885"},"observation_digest":"sha256:e92fe508c727d38f2dde6914aacc4323ea83c0183887ca9950faa418c668c7a6","observation_id":"ec2429a4-bf09-4f52-b0e8-aedb18196f58","resolution":{"observed_at":"2026-07-04T00:09:15.246000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09333/citation-record","integrity":"/paper/2501.09333/integrity","json":"/paper/2501.09333/citation-record.json","paper":"/paper/2501.09333"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2005.00928","last_updated":"2020-05-31T16:59:40Z","snapshot_observed_at":"2026-08-14T07:01:16.499526Z","submitted_at":"2020-05-02T21:45:27Z","title":"Quantifying Attention Flow in Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00928","snapshot_observed_at":"2026-08-10T20:10:15.873719Z","title":"Quantifying atten- tion flow in transformers","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.873719Z"},"links":{"cited_paper":"/paper/2005.00928","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:4cb9b98fefd0dd86a64017e1cbaf5e7a2edd8245163619089deb302d6053a54b","observation_id":"2268e2c9-c735-4f74-9afa-17992bc685a3","resolution":{"observed_at":"2026-08-10T20:10:15.873719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.679975Z","title":"Food-101–mining discriminative components with random forests","venue":null,"work_id":"8542d2ed-fa7e-44ba-98c4-0413330afce3","year":2014},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.878395Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:d9804e9126691d69b715f5b519f5fe3764ad633e1870bf690e8218a195ffa0d5","observation_id":"2ca86b9f-5188-45a8-abb9-175f2034c96b","resolution":{"observed_at":"2026-08-10T20:10:16.683855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.669260Z","title":null,"venue":null,"work_id":"f7d7ed77-6ede-4274-88fa-e8e15b2b3486","year":2020},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.882264Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:edbb0ac0f97c2415c024d0c8f88579e6e9ff76b159a5b84601697acaa0a83419","observation_id":"f5236ac9-f886-4587-9da3-09a37b7acd31","resolution":{"observed_at":"2026-08-10T20:10:16.673060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.658536Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c880dc8d-c255-4557-a9d1-ebe3d21ac9ee","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.886131Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:8cc1c35bc63b5072fa92585da89afc0757dfbc120ba1f71ea32947311a87f72f","observation_id":"3fbb4bb8-4a25-4fb4-86a6-3588893610a6","resolution":{"observed_at":"2026-08-10T20:10:16.662160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.649009Z","title":"Transformer inter- pretability beyond attention visualization","venue":null,"work_id":"807801d6-3ed2-4d5e-aab2-189e4d447eb5","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.890395Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:d3f7f24a7e801b9070b9ffeb168cd8f8a12fa7e2944624e452985db8e94c176e","observation_id":"3557f26f-479c-4a2a-bf7e-189d8eb9284e","resolution":{"observed_at":"2026-08-10T20:10:16.652474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.638598Z","title":"This looks like that: deep learn- ing for interpretable image recognition","venue":null,"work_id":"96efb6f1-4b74-4629-b141-a4d04b0f8723","year":2019},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.894418Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:1ac45657ab1eab591524d69f5b526323d8e3f35d67845343b9ea207753c2b5f9","observation_id":"5f8b911f-b79e-4efb-9129-8baa87aa0872","resolution":{"observed_at":"2026-08-10T20:10:16.642468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:15.898391Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.898391Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:d5cb5d0b32ecee7461f47d62b40cc820372adb4a24f5958d54ee566c3372f25b","observation_id":"399e65e6-9365-48f2-96e3-681a34723dec","resolution":{"observed_at":"2026-08-10T20:10:15.898391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.623251Z","title":"Robust learning with progressive data expansion against spurious correlation","venue":null,"work_id":"b9beed12-c742-4964-bbf1-9dbc8e3aa6ac","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.902231Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:dd125e18939d8d791da6ee53119f19cafcfeda17c0e22730eef03ef6a2410f47","observation_id":"24b80250-c229-4a6a-b793-d00083e5a457","resolution":{"observed_at":"2026-08-10T20:10:16.626881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.613702Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"f146caf1-ee6a-4d8a-8a6f-e5bfdd048354","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.905830Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:79049b9f12aaec61d5372a673055467d565e9b4901b505d809badae3cee23afb","observation_id":"c35317f9-595d-4168-8676-bbf10563d4a0","resolution":{"observed_at":"2026-08-10T20:10:16.617567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.604208Z","title":"Transfg: A trans- former architecture for fine-grained recognition","venue":null,"work_id":"5fb591a6-825a-4e32-9f6b-d0be2a941e10","year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.909806Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:72ba3bf70527074158cbcf6685cfed05a2c37c14716ebc336448d97cc3210222","observation_id":"9defa35b-2a0e-41aa-ab18-5efe3afe01c5","resolution":{"observed_at":"2026-08-10T20:10:16.607863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.594715Z","title":"The spectre of ‘spurious’ correlations","venue":null,"work_id":"2ede8fa2-8ee5-410e-98ea-0919ce4cc7c8","year":1991},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.913347Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:d545178f83d6bfff96c907169595f9985a7e319ccf0d481873ded2956ebf1128","observation_id":"73c4393e-d591-4301-bf48-dcb875ed3b7f","resolution":{"observed_at":"2026-08-10T20:10:16.598025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.583685Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"1fdccdd9-a619-4343-98fe-2b72f0b76957","year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.916716Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:5a90415196ac15ffd731b9e3fafa387a6d392abd280307323f31a9129400d145","observation_id":"18db51fe-fa9d-4e42-b4f9-5107a54c9ce2","resolution":{"observed_at":"2026-08-10T20:10:16.587646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.574154Z","title":"Layercam: Exploring hierarchical class activation maps for localization","venue":null,"work_id":"2a9ab3af-0a64-4e56-aa81-ce8858adc8f4","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.920545Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:6d9cf573f0ce185c201444472d7631eb2e7acf7c15aab19688283b43090f783d","observation_id":"ce0b415f-10c6-4c94-8943-f8818abcd0a6","resolution":{"observed_at":"2026-08-10T20:10:16.577768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06786","last_updated":"2023-11-12T09:23:40Z","snapshot_observed_at":"2026-08-19T11:48:22.253253Z","submitted_at":"2023-11-12T09:23:40Z","title":"Explainability of Vision Transformers: A Comprehensive Review and New Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06786","snapshot_observed_at":"2026-08-10T20:10:15.924417Z","title":"Explainability of vision transform- ers: A comprehensive review and new perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.924417Z"},"links":{"cited_paper":"/paper/2311.06786","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:e8605cca4fbb7749a243850205d3f6e3d68f13917c7ce51e14649169fc5d58ec","observation_id":"89af43d9-aaff-4db8-b708-25ca1bad80cc","resolution":{"observed_at":"2026-08-10T20:10:15.924417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.563375Z","title":"Novel dataset for fine-grained image categorization: Stanford dogs","venue":null,"work_id":"b51933ce-f690-4cd1-88a5-2a397adefbd0","year":2011},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.928544Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:06517f6f436e1d9fb340fbdfedbc1dd52b9956083333fa704958aa57c64be30e","observation_id":"970e2297-cb85-4f5e-9ded-3ee97f142c53","resolution":{"observed_at":"2026-08-10T20:10:16.567210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.554335Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"2d77a8cb-b26c-4af2-a955-c28ecc0dbd6d","year":2013},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.932329Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:6e4a07b3e062493bade86a9e2dfefcccde7cfd1c9d7f257e6d29d28abb898afb","observation_id":"38e83efd-8b7b-446c-a85d-c42c12357e00","resolution":{"observed_at":"2026-08-10T20:10:16.557775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.543328Z","title":"Transcam: Transformer attention-based cam refinement for weakly supervised semantic segmentation","venue":null,"work_id":"7365a44e-c790-4f02-b118-48f5dfbae572","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.935767Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:0fef4f4c52f1692b9e565fabe5d1b4fcd417354d0f28a34385a6ba10b5fb5d67","observation_id":"29500658-adba-4498-8726-0e199f10bf8d","resolution":{"observed_at":"2026-08-10T20:10:16.547906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.532727Z","title":"Re- moteclip: A vision language foundation model for remote sensing","venue":null,"work_id":"36ea6542-4b01-4560-93ce-4b74bef946a3","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.939388Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:7df8c9db4c3c9dfee1c459bb4a26f9e4abfc00c2777ea6103b469463c3781f87","observation_id":"af972742-7029-435c-8cc7-bf5444b73348","resolution":{"observed_at":"2026-08-10T20:10:16.536778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.522165Z","title":"Visual instruction tuning","venue":null,"work_id":"0de6214d-99be-433a-964d-eb11f8781ab6","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.942599Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:e5ab247d737d98b9746f7e9abccb90de3a2226757dfac859394601d428904ef7","observation_id":"6501b9e0-4ae2-462a-8973-29c4e513f7fe","resolution":{"observed_at":"2026-08-10T20:10:16.525626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.10834","last_updated":"2021-07-22T17:49:25Z","snapshot_observed_at":"2026-08-19T11:48:21.724838Z","submitted_at":"2021-07-22T17:49:25Z","title":"Query2Label: A Simple Transformer Way to Multi-Label Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.10834","snapshot_observed_at":"2026-08-10T20:10:15.946186Z","title":"Query2label: A simple transformer way to multi-label clas- sification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.946186Z"},"links":{"cited_paper":"/paper/2107.10834","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:30b60addf67ac1f6fff86c3f729319cbcb803092bea886cba38be104e37d5d5c","observation_id":"17d475df-23e9-4b69-9ae1-0210cb196eee","resolution":{"observed_at":"2026-08-10T20:10:15.946186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.512472Z","title":"This looks like those: Illuminating prototypical con- cepts using multiple visualizations","venue":null,"work_id":"2cd87b02-b103-4796-9779-1e164b929115","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.950569Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:a0505e77fea18b7af552361ddaa03d58186b83248d911f89aaaf123abef1ab4b","observation_id":"26a80dcd-f9a1-47d5-96de-2aa13218302e","resolution":{"observed_at":"2026-08-10T20:10:16.516177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.500220Z","title":"Fine-tuning is fine, if cal- ibrated","venue":null,"work_id":"a629a7a3-c35f-47de-9be5-5d53a68653f9","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.954022Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:daabd527555d7c44ed8eb8afbba39bd3edf346839e958725d7dd37ca452f6847","observation_id":"dd887520-4dd7-488f-aef3-36cf17788793","resolution":{"observed_at":"2026-08-10T20:10:16.504971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16434","last_updated":"2025-03-25T02:07:28Z","snapshot_observed_at":"2026-08-19T11:48:19.690543Z","submitted_at":"2024-09-24T19:57:40Z","title":"Lessons and Insights from a Unifying Study of Parameter-Efficient Fine-Tuning (PEFT) in Visual Recognition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16434","snapshot_observed_at":"2026-08-10T20:10:15.957259Z","title":"Lessons learned from a unifying empirical study of parameter-efficient transfer learning (petl) in visual recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.957259Z"},"links":{"cited_paper":"/paper/2409.16434","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:f32e50a632c54e46258817b5aaa74c429e9dba1d6aa0b74b2ce3d7e4f889af03","observation_id":"fcee0785-9ef6-47d0-b506-b3d0bd789cfc","resolution":{"observed_at":"2026-08-10T20:10:15.957259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08027","last_updated":"2025-02-27T07:06:50Z","snapshot_observed_at":"2026-08-19T11:48:23.302681Z","submitted_at":"2024-07-10T20:10:56Z","title":"Fish-Vista: A Multi-Purpose Dataset for Understanding & Identification of Traits from Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08027","snapshot_observed_at":"2026-08-10T20:10:15.961084Z","title":"Fish-vista: A multi-purpose dataset for understanding & identification of traits from images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.961084Z"},"links":{"cited_paper":"/paper/2407.08027","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:683521742ca095b2e8e78b176d44a1e2388dcc03049da0a87fdf9be49632d212","observation_id":"5c7de643-d897-4068-8324-21be3606eb80","resolution":{"observed_at":"2026-08-10T20:10:15.961084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.488491Z","title":"Eigen-cam: Class activation map using principal compo- nents","venue":null,"work_id":"239aa46b-1de9-4fff-a2a6-0da91228b6d7","year":2020},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.965485Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:7f8f130c330b640b1d826b6961a1cacf45759f66d752840f0d49d1b3afec9f63","observation_id":"2f7042d9-8eee-4169-8bb1-db8fcda74603","resolution":{"observed_at":"2026-08-10T20:10:16.493203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.477420Z","title":"Neural prototype trees for interpretable fine-grained image recogni- tion","venue":null,"work_id":"dfce9300-8dec-4b7f-8cff-5fe7a6d7fc40","year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.969290Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:47fca14a6c83cdcfe2748dd962478b86231fa6a5ce6e1278f67c32a21c01ee25","observation_id":"010eb740-5a50-403c-8880-1fee1ed65b96","resolution":{"observed_at":"2026-08-10T20:10:16.481226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15477","last_updated":"2023-11-27T01:24:31Z","snapshot_observed_at":"2026-08-19T11:48:19.030130Z","submitted_at":"2023-11-27T01:24:31Z","title":"DreamCreature: Crafting Photorealistic Virtual Creatures from Imagination","version":1},"cited_work":{"arxiv_id":"2311.15477","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15477","snapshot_observed_at":"2026-08-10T20:10:16.183691Z","title":"DreamCreature: Crafting Photorealistic Virtual Creatures from Imagination","venue":"cs.CV","work_id":"22286eda-3d13-43b7-a926-750e77abd8c5","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.973279Z"},"links":{"cited_paper":"/paper/2311.15477","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:8215ae7d5858271d23dd13a184408a256b22ddd6e044f11e0c739c09ee8b0e91","observation_id":"e0306879-2720-4da7-ae47-247b2a81c299","resolution":{"observed_at":"2026-08-10T20:10:16.190730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.466453Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"398035ed-9e0d-4183-a581-8f00857680de","year":2008},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.976845Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:86651db792c653e99f8ed0f9dcee3e2d3a6382c36a0bbf49eedc2358e6b311f8","observation_id":"60f856a2-70d7-4c36-bd30-520993c395d7","resolution":{"observed_at":"2026-08-10T20:10:16.469971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.456338Z","title":null,"venue":null,"work_id":"a5b28490-adae-40ce-842c-1c564ae88f6d","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.981183Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:fd0e8fabeeea29a12f5ed892bed91b59159b3bb84f69f75f9b64efdc1d65e0cd","observation_id":"bdab913b-af02-4ade-a102-e16978b0cc83","resolution":{"observed_at":"2026-08-10T20:10:16.460014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.445131Z","title":"Cats and dogs","venue":null,"work_id":"adc8d1df-9f59-49b5-9588-a89a35d71efb","year":2012},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.984354Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:b2909ba885dbbc1d83a33037ca45ea97f6b6a3f924e885a415fd89d63317dbca","observation_id":"1ed44771-402f-4e7c-9803-0d53bcbbad77","resolution":{"observed_at":"2026-08-10T20:10:16.449673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.434302Z","title":"A simple interpretable transformer for fine-grained image classifica- tion and analysis","venue":null,"work_id":"26ac2790-1b5a-476a-bebc-6a4faf4d3c42","year":2024},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.988466Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:627c71244291806848ee89dee6fb798d226cd52b58fc3c00eb6fc34dd8686d87","observation_id":"a9f82811-1340-4b8e-b0fe-109dceab0527","resolution":{"observed_at":"2026-08-10T20:10:16.438259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-08-16T23:44:59.708767Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-10T20:10:15.992555Z","title":"Rise: Randomized input sampling for explanation of black-box models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.992555Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:6c88d96b820b5210930e8d53830c5e439ec662466d31bdfbb481a6c5e0c4f269","observation_id":"499ac09b-ba9e-4fb0-84bd-c3fcb4510810","resolution":{"observed_at":"2026-08-10T20:10:15.992555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:15.996460Z","title":"Birds 525 species - image classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:15.996460Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:97f9cfc243a19e6b3a838b88b7ef36bd7d0aa9d20380c75d5c1cc3dadb87b7cc","observation_id":"d92274c6-e366-43c4-9d54-289434d54cb3","resolution":{"observed_at":"2026-08-10T20:10:15.996460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.415825Z","title":"Attention-based interpretabil- ity with concept transformers","venue":null,"work_id":"e300a8d3-b240-44d2-81c1-6f1238b9479a","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.000478Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:fe76701ce2bb34b327ad125ce264d00164a749e6030b34600be3236cb37fd186","observation_id":"4232d726-bccc-46a4-a61d-3f5862c123dc","resolution":{"observed_at":"2026-08-10T20:10:16.420128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.004090Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.004090Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:0de85d3356f83363de12678807b9d84704ad6325d9400c99a1ae2d06c75c32b0","observation_id":"31c3fb64-7099-49ea-b677-577162609d82","resolution":{"observed_at":"2026-08-10T20:10:16.004090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.397918Z","title":"Medicinal Leaf Dataset, 2020","venue":null,"work_id":"d2a30d51-2c21-4ec3-bc09-bab4b945d691","year":2020},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.007769Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:1690ab9df1137431a228fb2d84625920c7e575a7d2267538df9f9b11277138d5","observation_id":"5c336002-e323-4816-94c7-94d7a83f1f79","resolution":{"observed_at":"2026-08-10T20:10:16.401606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.011432Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.011432Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:71400742f11c514cf9f5770974372195bdcfa7fdc3383d85713c7a4b0a70ea86","observation_id":"928cb033-00f7-40bb-8ac8-3a7a893d1733","resolution":{"observed_at":"2026-08-10T20:10:16.011432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.015163Z","title":"Bioclip: A vision foundation model for the tree of life","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.015163Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:33d260c9cec667199ce553bf0aaba53a9baaaa847cacf2ca248ef8cea8532498","observation_id":"56324902-cec1-407b-b449-0458371093f1","resolution":{"observed_at":"2026-08-10T20:10:16.015163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.018698Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.018698Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:bc18a554f0021fc68fed11bc0082ae3340233e68c447bfcafde6083d0f5e2511","observation_id":"4679a7b4-c73c-4368-90c5-8b04d06e97d9","resolution":{"observed_at":"2026-08-10T20:10:16.018698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.368409Z","title":"Weakly supervised posture mining for fine-grained classi- fication","venue":null,"work_id":"1d327f3a-f2e0-4f72-b818-214e23deb7e1","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.022169Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:88046ab5c9a758445af26383e3282c934c094f7e555cb8819d2c694b7df1f3c3","observation_id":"8aebf9c2-ba63-4aae-88ea-26d719747670","resolution":{"observed_at":"2026-08-10T20:10:16.372326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.358043Z","title":"Rare Species Dataset, 2023","venue":null,"work_id":"10506b01-546c-4a92-9753-7f22a7ef2ed8","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.025636Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:6442f57a29aeed54888f74bd1534840745160fd4a14fe75ff91b2b92856551a8","observation_id":"3eae5a2d-61a4-4ada-bdcd-5b886da7f397","resolution":{"observed_at":"2026-08-10T20:10:16.361915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.348082Z","title":"Visual query tuning: Towards effective usage of intermediate representa- tions for parameter and memory efficient transfer learning","venue":null,"work_id":"4a70db4c-59d4-47d5-bde0-6e9a93d27efd","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.029205Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:7ea0443e0476c55552ffeb9608fbca99478c43ba8fb226e69598f30703b1c7bc","observation_id":"ee9cae14-9076-4674-b68b-65d742a458bc","resolution":{"observed_at":"2026-08-10T20:10:16.351670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.337968Z","title":"Benchmarking rep- resentation learning for natural world image collections","venue":null,"work_id":"68e455ae-9c91-4b02-9066-319633bd38cd","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.032829Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:d597e0b1703e959a47f8089efbe616de4f460cdbbceb91246783eef5a03f4d50","observation_id":"c082f65b-4a07-42e5-8a04-8faba44d19a6","resolution":{"observed_at":"2026-08-10T20:10:16.341695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.327262Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"65a1da3e-66da-44d0-b920-747f697f5e70","year":2017},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.036527Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:f1d9d110dcae0f4d296d4378c3c42a2c7d4e7badf0e90abc899ab34a337ee7e7","observation_id":"6bd0a666-b008-4529-ac7d-509b205d3e49","resolution":{"observed_at":"2026-08-10T20:10:16.330889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.040383Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.040383Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:47927cc2037f51c55ff5ffc43ff9a34a8adb4a1f0c7a7fae697ab3664f7678f7","observation_id":"44303bf9-0e90-43e7-bbe3-df94410b8ca4","resolution":{"observed_at":"2026-08-10T20:10:16.040383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.309562Z","title":"Score-cam: Score-weighted visual explanations for convolutional neural networks","venue":null,"work_id":"6cd13382-7e11-44af-91a9-86459fc169b1","year":2020},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.043907Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:c4414f9d4f46b64e1e2ecc6434dd917a25a33f2565a8ea162a4a4b58cb5ac549","observation_id":"45b81d56-26cc-4454-a1b8-18de9c25e403","resolution":{"observed_at":"2026-08-10T20:10:16.313526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.297849Z","title":"Interpretable image recognition by constructing transparent embedding space","venue":null,"work_id":"09d8f351-4462-46e7-9572-ec89960f101e","year":2021},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.047411Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:3b42db1ee106e759be9358b57c46899cc07c3f53f43a24bca7bb7d88ddd6c733","observation_id":"5c8f6bb7-d5ef-44c1-957b-99ce7ad5defe","resolution":{"observed_at":"2026-08-10T20:10:16.302754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.286335Z","title":"Open-set fine-grained retrieval via prompting vision-language evaluator","venue":null,"work_id":"303fcc87-b728-47a3-ba49-9715a53b24ad","year":2023},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.050772Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:fee04ec5875735c491fa644dae436425608db42c7388ee3c29128b4538cbaddb","observation_id":"996b3568-3d06-405a-83fa-639e8bc4048c","resolution":{"observed_at":"2026-08-10T20:10:16.291080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.274834Z","title":"Ip102: A large-scale benchmark dataset for insect pest recognition","venue":null,"work_id":"86bfbb86-c6e3-4aab-86b4-03d8c3027483","year":2019},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.054208Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:f2b6e24c154d738aab4a10093ecc30b76cfaf49e8d987448603e87e2e708f5b6","observation_id":"8c0e7262-4893-46fa-b3b5-9249d9f781d5","resolution":{"observed_at":"2026-08-10T20:10:16.279382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.263508Z","title":"Multi-class token transformer for weakly supervised semantic segmentation","venue":null,"work_id":"b5d814c6-2f8f-4598-9826-55c240342bed","year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.058530Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:eab654693708c7a5062d83b2f156be0b0b0c9174c9b4f17d10e2e3321ccc7ec3","observation_id":"b21e6fbf-d9d4-490f-a884-911875b45852","resolution":{"observed_at":"2026-08-10T20:10:16.267511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.062194Z","title":"Protopformer: Concentrating on prototypical parts in vision transform- ers for interpretable image recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.062194Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:225a1233b6af8500db132f886813ed4bdc0df4604b11a13446581a3fb4ae173a","observation_id":"7a56b345-0a10-4d28-8011-d4fb9552e896","resolution":{"observed_at":"2026-08-10T20:10:16.062194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.065373Z","title":"Learning deep features for discrimina- tive localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.065373Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:34bccbc727bdfbcbd5b9b89b712b1c567399c7794c5453caa912406aac5ada6c","observation_id":"d845818d-7353-4a61-a383-0719f61ea048","resolution":{"observed_at":"2026-08-10T20:10:16.065373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.069934Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.069934Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:4b70254fae3b8794a6e2e92acaf999a228d916d03aa5a13eb8f42d75801d3c29","observation_id":"998fd4f1-8d1c-4f32-ad38-870c649a6313","resolution":{"observed_at":"2026-08-10T20:10:16.069934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:16.242515Z","title":"learnable prototypes","venue":null,"work_id":"708a056d-efd8-4c9a-ac1b-05502ab9b3d2","year":2022},"citing_paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:16.073663Z"},"links":{"citing_paper":"/paper/2501.09333"},"observation_digest":"sha256:393caadf3ac19c48708484c7c03cce861f6eb671b394a2cd226375ddff5913be","observation_id":"6c44ce53-6213-4373-a651-a496de9d9d84","resolution":{"observed_at":"2026-08-10T20:10:16.245765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09333","last_updated":"2025-04-07T18:03:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T11:38:48.274197Z","submitted_at":"2025-01-16T07:07:41Z","title":"Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 4 inbound Pith citation observations for arXiv:2501.09333."}