{"as_of":"2026-08-08T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7dffc69f74e169066810c9fc6a206d08191917ade3256dc478b7337278ea291","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:52:29.407583Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:58:38.554863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T01:45:52.034775Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23270","snapshot_observed_at":"2026-08-04T14:58:38.554863Z","title":"Token activation map to visually explain multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.554863Z"},"links":{"cited_paper":"/paper/2506.23270","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:b84a9941f66a7f92aefc82b38672f4703655dd77f046beb0b5adbb404daa6cc0","observation_id":"ee607a6c-424c-4103-8a9b-d5ac4adba379","resolution":{"observed_at":"2026-08-04T14:58:38.554863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2506.23270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23270","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.23270 , year=","venue":null,"work_id":"15e0c027-d501-48ac-b02e-79ef998aaa49","year":2025},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-07-30T06:32:02.248567Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2506.23270","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:2068c5897644f26cf2d6e5f2d018540d96707bfb4ab9ae71cf6f6d1639708997","observation_id":"61037376-a873-45fb-a438-086e6355c419","resolution":{"observed_at":"2026-05-10T22:20:47.892061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"cited_work":{"arxiv_id":"2506.23270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23270","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.23270 , year=","venue":null,"work_id":"15e0c027-d501-48ac-b02e-79ef998aaa49","year":2025},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2506.23270","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:26a5b250f1eedc4c4b0ed4854a518c6ff28e7d1e8fb437ebf041556db68f6426","observation_id":"68b4e094-aaed-4176-9567-dc7d2db5ea9d","resolution":{"observed_at":"2026-05-11T01:45:52.037170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23270/citation-record","integrity":"/paper/2506.23270/integrity","json":"/paper/2506.23270/citation-record.json","paper":"/paper/2506.23270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:39.222305Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":"d9d1f7aa-190d-44b1-a60e-dd2ecef7cbcf","year":2020},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.828224Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:a1439e0fec8a9a9857f7cabea5166c0f935d54a84a6ce739e6f9e78174917753","observation_id":"d4de39f2-8367-4a38-bd53-b02dca29f34c","resolution":{"observed_at":"2026-08-06T21:52:39.315954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:38.897300Z","title":"Attnlrp: Attention- aware layer-wise relevance propagation for transformers","venue":null,"work_id":"cc6b23ea-f32c-4d2f-b28c-c842a1b85ef3","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.908507Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:57295648df2434387eb487bec5fa2399f0658b155d3a01e274791c04a22a0238","observation_id":"ebc98010-930a-4a15-834f-258ab58ade04","resolution":{"observed_at":"2026-08-06T21:52:39.029975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:38.338056Z","title":"Vl-interpret: An interactive visualization tool for interpreting vision-language transformers","venue":null,"work_id":"8d08f270-475f-48b1-8dfc-2b84c515fdd5","year":2022},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.138905Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:5d5a107ff2a682427f8e032e688d7f5ce5669a30e9a6619a2e54622ff227a0ba","observation_id":"bffa45d5-158c-4fba-819a-1a9fed0a37c3","resolution":{"observed_at":"2026-08-06T21:52:38.481689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.200165Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.200165Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:9b09623f06d6d6bb2fbf9bc258d1867d1c0960d07e548671287d3c396c6d87b3","observation_id":"021db75b-a6aa-45f6-8a2f-df56eea62a9b","resolution":{"observed_at":"2026-08-06T21:52:23.200165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:37.982011Z","title":"Xai for trans- formers: Better explanations through conservative propa- gation","venue":null,"work_id":"78961d1c-e514-448b-a08e-94230756a457","year":2022},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.291980Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:e1c2d7e426dc98deff2beb6ee9c05db83d61317ddc561990dbd16b9b16fb9c16","observation_id":"e28f49e7-adc0-47b5-b63b-7b1ae3ee0216","resolution":{"observed_at":"2026-08-06T21:52:38.145550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:37.641925Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"5a29702e-803c-4ff9-bb4b-77cf4457580e","year":2022},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.383073Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:c206cced0dc110e78fe3bc20568bbc6aa0ced040fb0fd6821c88c7d40ea3757c","observation_id":"818ccc59-2c78-4235-9a49-8d9538a00479","resolution":{"observed_at":"2026-08-06T21:52:37.802003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:37.251328Z","title":"Lvlm-intrepret: An interpretability tool for large vision-language models","venue":null,"work_id":"1a658511-0fbc-4910-bdb1-b70271cfb5f6","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.464253Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:4e87fc5e2aa3f85980d07e1e964fa58f00d70d1c029bc13af0ff6a1c22d38f78","observation_id":"3aa7372b-2964-43cc-8255-0946c3531fbe","resolution":{"observed_at":"2026-08-06T21:52:37.419141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:37.041615Z","title":"An adaptive median filter for image denoising","venue":null,"work_id":"0968ec07-1569-4014-85ab-3cd8477d6345","year":2008},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.579543Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:fa8cfa92390b8c73b2e661681130eb1a75c9eb45f5f8e76fac7ae8fc39b0ea16","observation_id":"56241116-b3c1-4dd0-826a-56f3dc54d316","resolution":{"observed_at":"2026-08-06T21:52:37.138362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.673939Z","title":"Grad-cam++: General- ized gradient-based visual explanations for deep convolu- tional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.673939Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:85c9f5f7c7280fa798a38d9f66ccc6fb726d8a9df92eb1cd251c26ec1d106dd2","observation_id":"e807e267-b14c-43a4-9570-7995aaa5a0f0","resolution":{"observed_at":"2026-08-06T21:52:23.673939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.743484Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.743484Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:f1dbeebf02accb0a53f473c043b91c3df81a3c9bd7f69e9e0b20b6b178b12435","observation_id":"387ed1b8-79d1-4255-ad4f-234b5fe8ea23","resolution":{"observed_at":"2026-08-06T21:52:23.743484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.898307Z","title":"Transformer inter- pretability beyond attention visualization","venue":null,"work_id":"14e4f942-fb17-4f4b-84b5-3d1e0ba63129","year":2021},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.851689Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:db5aaf747d23856389f8340d76b6717afdfe8b38cdb4d83120bda9422192e368","observation_id":"f3551c4f-decd-459b-9d8c-447cd54b6c89","resolution":{"observed_at":"2026-08-06T21:52:36.945210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.715595Z","title":"Less is more: Fewer interpretable region via submodular subset selection","venue":null,"work_id":"bc102d59-f9ca-457a-a446-31df3a1cabea","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.942557Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:3fdbaaedea2d27b2bad7977a4ca9b78099c5dbaca3ae348c6185e45477d2dc62","observation_id":"b092b981-a4fe-4711-b9ed-7c5fca5c3b20","resolution":{"observed_at":"2026-08-06T21:52:36.796077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T21:52:24.065434Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.065434Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:384038f6ac417f47aa323854163531b0b1ece14716243222bfa83cd2e2123dc1","observation_id":"acc9bf12-e418-4552-8424-9ffd90af11f8","resolution":{"observed_at":"2026-08-06T21:52:24.065434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.540031Z","title":"Clip-ad: A language-guided staged dual-path model for zero-shot anomaly detection","venue":null,"work_id":"ecf56cc1-78ae-4d79-9c05-2c0a58ee7305","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.182522Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:8d27533049def2e298dae0aa104ddf4b2c4bcc0c11a88587f3f343c85604076d","observation_id":"afb0bd74-59d4-4c8c-af1c-87319c0c7084","resolution":{"observed_at":"2026-08-06T21:52:36.619683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:52:24.270466Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.270466Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:131914aaa72c23693595b03bfd690a1bff82382e30ece3b7faa5f52c71bf44b7","observation_id":"60315eb3-3ff5-45aa-adee-6f7db657e89f","resolution":{"observed_at":"2026-08-06T21:52:24.270466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.365610Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"37a59827-07e4-4a52-94cc-c4323601c695","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.355777Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:9b0f096b4ac7edd335b09c1de2c1d24736bd5598994e4331acd4d9f7d1d8bc97","observation_id":"6b8b3449-02d5-490e-b819-49d285b05ae2","resolution":{"observed_at":"2026-08-06T21:52:36.447607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.189467Z","title":"A survey on multimodal large lan- guage models for autonomous driving","venue":null,"work_id":"67dfccd2-c345-4cf9-b95e-c9374902171c","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.418757Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:63408546b5f00d16d014c4cca2bcd2db70f3307899327eb7e5dff3f07d4a195f","observation_id":"d83c952b-6c0e-4d7f-9b64-d0d02c398361","resolution":{"observed_at":"2026-08-06T21:52:36.265238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:36.068939Z","title":"Flashattention: Fast and memory-efficient exact at- tention with io-awareness","venue":null,"work_id":"bfe3b508-3d3c-409d-aa2b-b4c46c597bf6","year":2022},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.485401Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:992f0117bbedde0e2fa0009b51c02e2efb579e29c52111df22f389954ba25235","observation_id":"55e032c7-68f7-43e4-83e8-000f889c35f2","resolution":{"observed_at":"2026-08-06T21:52:36.123765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.946835Z","title":"Vision transformers need registers","venue":null,"work_id":"eeb80052-61ae-49ff-a667-ef124ed07454","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.557594Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:b2158976fce00e4b16b67d0345c4115149cbd6186ba6fdc14a7994de0a0950e0","observation_id":"562b6886-6ac5-4d32-9905-332e33589d3e","resolution":{"observed_at":"2026-08-06T21:52:36.001289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.628249Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.628249Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:5dfcd8769c1e1d8ca0760897fb3163e6cfe9ca1ec93337ae52a68fceb89bacf9","observation_id":"9e0a0169-afc6-4f6d-9d91-4bc9b4618612","resolution":{"observed_at":"2026-08-06T21:52:24.628249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.766880Z","title":"Hia: Towards chinese multimodal llms for comparative high-resolution joint diagnosis","venue":null,"work_id":"7f9fe4f0-697d-493e-8ea7-49aea8de1118","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.672164Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:b2cda8b2243e8f67bd3c73ee7f5114e6b8492b5dd418c509b126458a73791406","observation_id":"e29031a5-45de-4ba7-a704-248d703c7195","resolution":{"observed_at":"2026-08-06T21:52:35.848320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.617594Z","title":"Holistic autonomous driving un- derstanding by bird’view injected multi-modal large models","venue":null,"work_id":"4ca7e104-f931-4c49-be01-4dd0bb32fe40","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.721249Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:d4db66a71cdb735efe532c2b2d6d2b15cff68c5be830a6e56f2920415cf0f833","observation_id":"30eddce3-f46c-4af8-93d8-03533192b924","resolution":{"observed_at":"2026-08-06T21:52:35.696589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.489834Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":"99c7443e-fd45-43ca-9297-11530660ddcc","year":2020},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.800458Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:33717dcc5f07abb9180c46eba71869424af8629ec963d756f21a42866ee2d406","observation_id":"06b09a51-da1c-4187-8bbb-77138383df40","resolution":{"observed_at":"2026-08-06T21:52:35.560451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.313472Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"ac36f047-6bb1-4b1f-8b5e-13cf4188d04b","year":2016},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.853813Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:c33ebe9b0394f02db2cc7260338d59417501af31d04d3f2d734b04d53bf36ace","observation_id":"0c3f78d9-6d9e-4956-ab1c-2079b9b30237","resolution":{"observed_at":"2026-08-06T21:52:35.398468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:52:24.893909Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.893909Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:3575e5d8a15a01e420aca9e311a91dd3f1456f59e3f703794adc2786a6cbd83c","observation_id":"fceaabdb-ae1f-4e8c-a0e0-329b2a3b56d9","resolution":{"observed_at":"2026-08-06T21:52:24.893909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:35.150586Z","title":"Layercam: Exploring hierarchical class activation maps for localization","venue":null,"work_id":"c97121b2-4427-47f4-bc30-a303039583c2","year":2021},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:24.962731Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:e350c0c6ec9ebb59e6f90c9c22cff127ece3a5fdf1afb8cd69dbe842213172aa","observation_id":"f3350316-b32e-4812-8ffb-e3e32ae89606","resolution":{"observed_at":"2026-08-06T21:52:35.237320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.969641Z","title":"Causal inference meets deep learning: A compre- hensive survey","venue":null,"work_id":"f54b7c97-8962-448e-a108-a5be196673ca","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.019347Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:6840b389e0bb2fe9e621a520d98b14fa8db15070691426cfa3c35f026fcd740f","observation_id":"138f9eb9-5bc3-4bc4-98d9-eaf078fd15b0","resolution":{"observed_at":"2026-08-06T21:52:35.053887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.799451Z","title":"Unmasking clever hans predictors and as- sessing what machines really learn","venue":null,"work_id":"3bae9497-d2cc-4068-8f9d-c35411a9d787","year":2019},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.064591Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:dededc9f3a245ecb4c173a8c55841f9d749b07cd3a4854e95241611dd66bede0","observation_id":"755369e1-7dd3-4e7d-ae27-6c9169819545","resolution":{"observed_at":"2026-08-06T21:52:34.884300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.619167Z","title":"Llava-docent: Instruction tuning with multimodal large lan- guage model to support art appreciation education","venue":null,"work_id":"82d813cf-6ab9-4ad5-9d62-ed878554dc62","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.118755Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:e07cd7ffe1898face30eb746f285832c71010c84a694af934ec7d24ab197cec5","observation_id":"f96de966-94a9-40fb-a609-1d9f5bb8c4c6","resolution":{"observed_at":"2026-08-06T21:52:34.688437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.423400Z","title":"Manipllm: Embodied multimodal large language model for object-centric robotic manipulation","venue":null,"work_id":"8dbfda5b-c065-432f-987d-f3aa5690f865","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.203550Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:a4ee4ca2e29863bf60db184c333960c0de8053585d3232287b0f81eb8e2ef054","observation_id":"2da65a26-37a5-417a-ba21-7ff09e4f63ff","resolution":{"observed_at":"2026-08-06T21:52:34.487383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07046","last_updated":"2022-11-27T01:07:52Z","snapshot_observed_at":"2026-08-06T08:10:01.084004Z","submitted_at":"2022-09-15T05:01:03Z","title":"Exploring Visual Interpretability for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07046","snapshot_observed_at":"2026-08-06T21:52:25.254347Z","title":"Exploring visual interpretability for con- trastive language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.254347Z"},"links":{"cited_paper":"/paper/2209.07046","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:3346f2e8c38f46c5d725e7ff9880b2309d4a6e14dab4a0ff520e58508267fb8f","observation_id":"591122c2-d792-48f2-9ef0-af9ae5158136","resolution":{"observed_at":"2026-08-06T21:52:25.254347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.265596Z","title":"A closer look at the explainability of con- trastive language-image pre-training","venue":null,"work_id":"6866b11f-c4e7-4c7d-bff6-32ac372b4cdf","year":2025},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.315356Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:c8200b4c2505537dbbb0b88f588b054660e384b162281601ca3551528e76e0f8","observation_id":"67b51a60-2297-48fb-a314-4198d1beea9a","resolution":{"observed_at":"2026-08-06T21:52:34.338754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.381037Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.381037Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:6c71e35b5a753e3c81eb296da0877cca2b70289af88081b94966209b61c49382","observation_id":"0889dc48-50f3-439e-8bd1-2a2762db6951","resolution":{"observed_at":"2026-08-06T21:52:25.381037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:34.091934Z","title":"A medical multimodal large language model for future pandemics","venue":null,"work_id":"7a5ff920-9974-4c93-9652-8ce26ea7db01","year":2023},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.446880Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:443cb5a4efc1e9accfa23b89dc7211e23fc035dd248808dd6e728649c2089b07","observation_id":"8732b887-ceae-4a94-a807-544e0a93460e","resolution":{"observed_at":"2026-08-06T21:52:34.156408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:33.943765Z","title":"Visual instruction tuning","venue":null,"work_id":"9a5d0e72-0df6-4f09-a5f9-de3432a13fa9","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.514680Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:ec58565a654274bda8076f231f89062419d31f90240682ac663d3128407946c0","observation_id":"36fd000f-a697-4568-b524-23d0242845e7","resolution":{"observed_at":"2026-08-06T21:52:34.016402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:33.690522Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":"3a1af9f0-8af7-4b56-a1fe-e3bd5a8f5235","year":2017},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.583129Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:327aa578db1c09b7ee6e90bd4ba62dc66253cc1a565de0f15becbcb59f11cdde","observation_id":"3ed8483e-c879-4098-a0e1-200d1baa53ad","resolution":{"observed_at":"2026-08-06T21:52:33.817131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:33.473397Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"7d57201c-f0c4-435f-b205-a5930d1890a2","year":2019},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.635669Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:5500829bbc6ef195b1d05910721629d06122e96392029f955cdc198b3d2c56bc","observation_id":"443a3d6b-8434-4fc5-9679-3d49fcda9473","resolution":{"observed_at":"2026-08-06T21:52:33.554791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.01224","last_updated":"2019-08-03T20:09:40Z","snapshot_observed_at":"2026-08-05T15:56:21.095271Z","submitted_at":"2019-08-03T20:09:40Z","title":"Smooth Grad-CAM++: An Enhanced Inference Level Visualization Technique for Deep Convolutional Neural Network Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.01224","snapshot_observed_at":"2026-08-06T21:52:25.702588Z","title":"Smooth grad-cam++: An en- hanced inference level visualization technique for deep convolutional neural network models","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.702588Z"},"links":{"cited_paper":"/paper/1908.01224","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:7a8a56a075dcf71b7e1c0167a1c307e6e07dda3e63de58e743e432d7416c4cda","observation_id":"01780bf3-78f0-4ac8-b323-3af92010a72c","resolution":{"observed_at":"2026-08-06T21:52:25.702588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:33.308035Z","title":"Towards vision-language mechanistic interpretabil- ity: A causal tracing tool for blip","venue":null,"work_id":"af85634d-f445-4134-a82b-a71d702b83fe","year":2023},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.707466Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:5343de27d5623a39db2ac6149c170e09cb8b8a3c5a8b5aeb60418be11ac0718c","observation_id":"2fdfa9fa-56af-4347-9d35-47813276b48a","resolution":{"observed_at":"2026-08-06T21:52:33.356930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.778705Z","title":"Causality","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.778705Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:d85bf057ab30cbf7bd0b7b67413486aa4aaf2e6c2fbffcaac3e774bd29846b79","observation_id":"57c3a70d-810f-4ae9-8b7c-fb8d406672dc","resolution":{"observed_at":"2026-08-06T21:52:25.778705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:33.082464Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"192a8cfc-2a36-450b-9e3c-bec46af7718f","year":2021},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:25.999812Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:1abaf38770ab378e0720a64066401071d7cc251a1e4d83bcece9e26edf1e29e1","observation_id":"5da96631-5200-416d-a009-0ce47338e1df","resolution":{"observed_at":"2026-08-06T21:52:33.222645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:32.908851Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"91522425-c025-41fc-97ad-cd2dcfb47497","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.204832Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:60c4b3ca2348eb97af1efbe6a810c61061717290cf21ca76870050e572bb8aff","observation_id":"6fae3910-a117-40af-a75a-4eb733df3128","resolution":{"observed_at":"2026-08-06T21:52:32.993373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:32.726151Z","title":"” why should i trust you?” explaining the predictions of any classifier","venue":null,"work_id":"0cbdd0c8-3d5f-4461-abce-b5f6aea123f5","year":2016},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.369433Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:3675eb43133e1af5721f7d05d0e1ee0a4c32074f5e6c44f0b9b54baa56985a71","observation_id":"5687849b-dc4f-402c-88d4-74696d16da54","resolution":{"observed_at":"2026-08-06T21:52:32.802753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:32.538328Z","title":"Causal interpretation of self-attention in pre-trained trans- formers","venue":null,"work_id":"43cd8876-64b3-4157-800e-a97c12819388","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.613931Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:071f869ec88d35552ad873744ac40ea78c76497dbee6c3250ea02b7c87b4d6f2","observation_id":"05a57b0f-e59c-410c-a9bb-cfb97897fd94","resolution":{"observed_at":"2026-08-06T21:52:32.626574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.849975Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:26.849975Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:ea06e17e50057438fc4962de5cffa203374c4170798b580aa077469d8ee34e68","observation_id":"196618f3-66a4-4c43-aee8-be7d529c1fed","resolution":{"observed_at":"2026-08-06T21:52:26.849975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:32.182209Z","title":"Training- free object counting with prompts","venue":null,"work_id":"309b79b4-b378-4291-839f-6ff38251aec1","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.179429Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:f3273b39dcc4445463233024f07347622b0b4356f49093e2feb33ec25031d2a1","observation_id":"67ed4cc3-904b-4d83-a56e-cd116cc1d3a2","resolution":{"observed_at":"2026-08-06T21:52:32.256509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:52:27.282270Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.282270Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:f50878821ca474a37acb3e52faee74dfa987cdabc6b3b42a1941cc0d160db508","observation_id":"1a7d0272-266c-4853-b2cc-4f7fc734a287","resolution":{"observed_at":"2026-08-06T21:52:27.282270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.998593Z","title":"Understanding how vision-language models rea- son when solving visual math problems","venue":null,"work_id":"3d726521-dbe8-42dc-9956-55bacfb24ce8","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.416113Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:f2d1159da712b5bfe4d11fc52d0f50c0d869cbef9b2e170dc10477720b7ab8a3","observation_id":"6150cd2f-2db5-48e3-bbb1-95b8b2d7738d","resolution":{"observed_at":"2026-08-06T21:52:32.082031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.832644Z","title":"Attention is all you need","venue":null,"work_id":"e1a6a402-db4a-4ee1-8a3c-db266a55a447","year":2017},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.564729Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:78c3b4b399cd709f2b4a276f627868734fd4034adf2626eff1b9aeb72a2b7d68","observation_id":"7a765326-b36b-454a-9900-2259ac8c7c62","resolution":{"observed_at":"2026-08-06T21:52:31.920473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.629660Z","title":"Interpretable bilin- gual multimodal large language model for diverse biomed- ical tasks","venue":null,"work_id":"ced09b4b-1716-4591-b9ef-2804990d9ec4","year":2025},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.740841Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:9177b00bf25e2137cf66999902db4d4d246d115561daba41b7b755b8c36a571c","observation_id":"c69c4e1c-7ea3-477a-827b-b814833df753","resolution":{"observed_at":"2026-08-06T21:52:31.726790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T21:52:27.901257Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.901257Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:193e211021ddeb8771cb659981bea2a433cba4e33b7637f9aad81873406adcbc","observation_id":"f3bf8d0d-6f75-4ecd-baf9-b4b3a078a944","resolution":{"observed_at":"2026-08-06T21:52:27.901257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.422903Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":"fcf574d2-adc3-48b7-870e-a2731135e78c","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.031705Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:945b879701b0d4f6c0aee76f8b65125a8b75c1dac8acc6301b8fdb47c3bca360","observation_id":"1593e6e8-1fc5-4776-a1c7-7620dcf83565","resolution":{"observed_at":"2026-08-06T21:52:31.519512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.222108Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"210dc6f7-1be3-4261-af2e-de30637b7f26","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.184907Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:db1ed2937584812ba9595fe70044f3a7ea706fe114561aec9dbe4e91a5bf57e5","observation_id":"1e49da6f-40ab-42a7-aeb0-a8ae0eeb2f01","resolution":{"observed_at":"2026-08-06T21:52:31.306564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:31.034737Z","title":"A survey on causal inference","venue":null,"work_id":"f0d568db-e4de-4f79-81fb-6e145ec76811","year":2021},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.331544Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:20f5c1655bac68928fc14ba8a659de7d6d1d3c0a63606bbb6c535fecd3ff5f4d","observation_id":"84be4017-1d5c-4212-b382-2eb7d37008b0","resolution":{"observed_at":"2026-08-06T21:52:31.119616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.860707Z","title":"From redundancy to relevance: Enhancing explainability in multimodal large language mod- els","venue":null,"work_id":"193c5593-91c0-46e0-a75d-91b5864c09cc","year":2025},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.453431Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:37b57e00aa176cb6e6c5c62b4bce332062f64f804a057e031227e21d0a456ef8","observation_id":"0e52b13d-beb8-43b3-8e25-e2980e367942","resolution":{"observed_at":"2026-08-06T21:52:30.950021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:28.534320Z","title":"Learning deep features for discrimina- tive localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.534320Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:0a8aae025357e88a72fbd6148c176ddb7fd511c4d4fb57178e6bb25a25828965","observation_id":"0ec2ab28-29f7-4ab3-8a1a-d02842692370","resolution":{"observed_at":"2026-08-06T21:52:28.534320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.547492Z","title":"with” and the punctuation mark “","venue":null,"work_id":"d3fb7c54-71fc-4135-831c-835b67bfdbd5","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.788264Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:1325d69831028024f8f08c4d0378f30d06892e7518b2ebab93c64f1f33695e30","observation_id":"9278089c-6546-41d2-b914-a25a9151eebb","resolution":{"observed_at":"2026-08-06T21:52:30.630735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.361465Z","title":null,"venue":null,"work_id":"b89a7f33-c4a0-4bcd-acb5-6547128d7ede","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.941451Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:beecf3d69d2d28f42aa529345745db0724648129c4c6213c7e909f38a4f8753d","observation_id":"6bf0e808-16c8-4475-b27e-9a9e1a53e8d0","resolution":{"observed_at":"2026-08-06T21:52:30.447211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.177393Z","title":"living wall","venue":null,"work_id":"aca1ed12-b04e-448d-a515-0e5299a85a11","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:29.101599Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:5e493c208621ece439f56abebc5202427a92abb60e87e6c7d33bba3b3204cbb2","observation_id":"34a50edb-53d1-4e84-b268-dc2130cfdc34","resolution":{"observed_at":"2026-08-06T21:52:30.265472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.998765Z","title":"living wall","venue":null,"work_id":"ad13e3f2-c13b-44d0-9e79-6aadae65211d","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:29.230235Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:3548a8ea7688dd194564fd1658c8c9995ac2f1c0e324fc425b9046448b9e1df6","observation_id":"cad3c0e3-9e47-4c87-b66d-b1722867a254","resolution":{"observed_at":"2026-08-06T21:52:30.081243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.862676Z","title":"Object-determined","venue":null,"work_id":"66b0b146-c217-447c-99aa-dae30f21f7c4","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:29.318102Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:2252596feca9bc2c23a863c3b44ee5c6d4e64233a2f4ada20106c4b7442dec21","observation_id":"0ec197a3-1b0d-48b1-85b4-bda3adb45db0","resolution":{"observed_at":"2026-08-06T21:52:29.923294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:29.691295Z","title":"Missing arrows led to erroneous reasoning","venue":null,"work_id":"4e9d671b-d2d3-4b66-af6b-e181bbddb7e2","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:29.407583Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:dd015cbada58366ddf05a878a1d9b782e388dca747470139b10d5f10d6ac1b7b","observation_id":"42bfa086-e8c6-463a-8d82-7eb6d2113a8c","resolution":{"observed_at":"2026-08-06T21:52:29.760939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:38.613159Z","title":"2, 5, 6, 7, 14, 15","venue":null,"work_id":"d5b8247d-0a6e-42a7-92ba-49b68357f431","year":2024},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:23.026379Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:84607255968bc5115db4a670d15259ef49a98541970b84e669c866b2d39dd635","observation_id":"fa6da81a-05a1-4059-a00b-26a19f33bfe0","resolution":{"observed_at":"2026-08-06T21:52:38.764893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:30.702487Z","title":null,"venue":null,"work_id":"c31807fe-3ba0-482f-834b-a62f5a2fc2e8","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:28.664380Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:e927696b6a00ea11ee74d3988a0d91f79596172bbfd6106f16691844902d8406","observation_id":"c8836885-99c1-429f-8b6c-71ada12ddd70","resolution":{"observed_at":"2026-08-06T21:52:30.757393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:32.364665Z","title":null,"venue":null,"work_id":"3e71de7c-cb78-4dad-9df8-eb1988cc4299","year":null},"citing_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:27.014153Z"},"links":{"citing_paper":"/paper/2506.23270"},"observation_digest":"sha256:a82e7d46a536efc027ad69a19a3d04d11603abfb14a6f228e5a3f3b51e1eba94","observation_id":"ea323d48-56d5-4c18-97cd-36edf6b02d54","resolution":{"observed_at":"2026-08-06T21:52:32.418675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:45:06.908819Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2506.23270."}