{"as_of":"2026-08-13T04:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1797633a1ed9c2f7ff648a40bcdaf9d430c4eb5d73952c4c27dfea5081fdd3e6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:08:51.431988Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-12T12:08:51.431988Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17491","last_updated":"2024-11-26T14:59:06Z","snapshot_observed_at":"2026-08-12T17:30:02.979007Z","submitted_at":"2024-11-26T14:59:06Z","title":"What's in the Image? A Deep-Dive into the Vision of Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:08:51.431988Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2411.17491"},"observation_digest":"sha256:5e6708ca6f2e5b02ef0c4e03687b482a53e24218522a66b732393d866088c597","observation_id":"73d73144-6432-4148-9f8a-c10b50ba680b","resolution":{"observed_at":"2026-08-12T12:08:51.431988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-12T11:06:10.086378Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18620","last_updated":"2025-03-25T18:59:50Z","snapshot_observed_at":"2026-08-12T10:57:44.673291Z","submitted_at":"2024-11-27T18:59:26Z","title":"Cross-modal Information Flow in Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:06:10.086378Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2411.18620"},"observation_digest":"sha256:5ea906b6b8315b39a7d94e53b16aca9fa3e5c28cd823b35d99149f1d42c14017","observation_id":"df9fd07c-8bed-4973-9504-cd4d08f1ae97","resolution":{"observed_at":"2026-08-12T11:06:10.086378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-11T23:54:23.795441Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-12T00:49:07.041510Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-08-11T23:54:23.795441Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2412.02104"},"observation_digest":"sha256:7b6fb0b16f7d0560367568fd5445616ed9e2be7ff73cc64d99cd5a9a1457402e","observation_id":"0fc8e35a-5d9c-44e2-bb8b-e7841be52e34","resolution":{"observed_at":"2026-08-11T23:54:23.795441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T14:52:07.702315Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-12T00:08:23.091413Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.702315Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:57fda30da9f9a391e93772b25cb11ba49d7af2d19218d7eaafa269352c51547b","observation_id":"d5c0e1f4-08fa-4fae-a4d5-f324eebe1557","resolution":{"observed_at":"2026-08-07T14:52:07.702315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T10:28:45.549978Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-09T05:46:01.132153Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.549978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ee0e24f95e2e3af41e5702839e075316a958880054406d2a4e7e874985923de9","observation_id":"29447404-6719-40ec-9937-d267fb413939","resolution":{"observed_at":"2026-08-07T10:28:45.549978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T01:06:07.506978Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-11T20:33:04.146508Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.506978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:2b1e17931d4460fd9a4c8538c803fa5ca54071dc23dcf688d882b418d105623c","observation_id":"92687b32-7c75-438b-814d-b08c34cffdf8","resolution":{"observed_at":"2026-08-07T01:06:07.506978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-06T12:40:05.418595Z","title":"In The Thirteenth International Conference on Learning Representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21637","last_updated":"2025-07-29T09:48:57Z","snapshot_observed_at":"2026-08-07T14:28:15.638129Z","submitted_at":"2025-07-29T09:48:57Z","title":"Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T12:40:05.418595Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2507.21637"},"observation_digest":"sha256:c717e153b1387ce666bcaa6e88234a4e399b6d962e8c1c4097d53a31a652f7ac","observation_id":"7ddbf9bc-4e04-43db-921b-85cfde575da9","resolution":{"observed_at":"2026-08-06T12:40:05.418595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-06T10:55:18.265684Z","title":"arXiv preprint arXiv:2410.07149 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23362","last_updated":"2025-07-31T09:17:53Z","snapshot_observed_at":"2026-08-08T14:50:30.917971Z","submitted_at":"2025-07-31T09:17:53Z","title":"Short-LVLM: Compressing and Accelerating Large Vision-Language Models by Pruning Redundant Layers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T10:55:18.265684Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2507.23362"},"observation_digest":"sha256:a2bc9af1b29b4e25d82aea6fe4a370686ae69788b42e518f86be5e16fbd8dca4","observation_id":"c3146891-ea2f-4e93-8e4b-87ba1a9705b5","resolution":{"observed_at":"2026-08-06T10:55:18.265684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2509.14837","last_updated":"2026-04-27T11:07:26Z","snapshot_observed_at":"2026-07-06T22:30:11.897367Z","submitted_at":"2025-09-18T10:58:34Z","title":"V-SEAM: Visual Semantic Editing and Attention Modulating for Causal Interpretability of Vision-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T16:21:20.463222Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2509.14837"},"observation_digest":"sha256:4cef134efc7700fad41f9d7fcd1ce610381812585c7da456158170f39baf4b6e","observation_id":"ee6278d9-e751-480a-bd78-6275ac512c91","resolution":{"observed_at":"2026-05-18T16:21:36.505496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T19:51:04.983299Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:d6c7e1b3e6ca5db860c8eaeb2380f8d843967e5aa0a0ebbc703aa888d7ca37a4","observation_id":"9db6822a-5dc7-42e8-9434-9404e800ddfa","resolution":{"observed_at":"2026-05-21T19:54:20.225280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-03T21:44:01.204287Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14159","last_updated":"2026-07-17T15:39:00Z","snapshot_observed_at":"2026-08-03T21:43:56.189055Z","submitted_at":"2025-11-18T05:48:08Z","title":"MVI-Bench: A Comprehensive Benchmark for Evaluating Robustness to Misleading Visual Inputs in LVLMs","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T21:44:01.204287Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2511.14159"},"observation_digest":"sha256:4caaac4979b2f74dcac0a28e5cd402798c26da7ac5be74e20c4a457a27970c98","observation_id":"717efe28-5b72-47bd-bf19-0bad70126141","resolution":{"observed_at":"2026-08-03T21:44:01.204287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2511.17699","last_updated":"2026-04-20T12:27:33Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T18:48:22Z","title":"Understanding Counting Mechanisms in Large Language and Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T20:10:01.277804Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2511.17699"},"observation_digest":"sha256:117d7d1d858f78223c9e1a450aedd8c21d1e375ca613dd7508e94d7be11373e9","observation_id":"cf2ea59a-fbbf-48d8-802f-148a6447860b","resolution":{"observed_at":"2026-05-17T20:10:10.860465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-08-04T17:24:30Z","snapshot_observed_at":"2026-08-11T10:39:22.741285Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:c7a359c2b2e4b6bf061828039e17c42cdd1ad5d2af8bd313e9ccf7aacad23ab1","observation_id":"371aaf5a-e7ce-4e94-a9bb-1f0b438d264e","resolution":{"observed_at":"2026-05-13T21:58:19.838229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-07-13T13:35:02.428552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03042","last_updated":"2026-06-04T11:31:33Z","snapshot_observed_at":"2026-08-05T20:36:40.496423Z","submitted_at":"2026-04-03T13:51:23Z","title":"Enhancing Multi-Robot Exploration Using Probabilistic Frontier Prioritization with Dirichlet Process Gaussian Mixtures","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T13:35:02.428552Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.03042"},"observation_digest":"sha256:02f860098cb1f4c3db978a136291f5abb768d8fb84a75da13df178c7d5c97558","observation_id":"9aa4b899-48da-4581-9a2f-e6b10bf84ba4","resolution":{"observed_at":"2026-07-13T13:35:02.428552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2604.03045","last_updated":"2026-04-03T13:52:57Z","snapshot_observed_at":"2026-08-12T06:28:41.016190Z","submitted_at":"2026-04-03T13:52:57Z","title":"STEAR: Layer-Aware Spatiotemporal Evidence Intervention for Hallucination Mitigation in Video Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T20:16:04.999705Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.03045"},"observation_digest":"sha256:caeff605fc0317abf42a4b1a46353eef97925e65a466161e0add2e2b752a3366","observation_id":"28a85ea9-cd1f-439c-9754-bb0421b9952c","resolution":{"observed_at":"2026-05-13T20:18:13.340068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2604.17941","last_updated":"2026-04-20T08:21:06Z","snapshot_observed_at":"2026-08-11T14:34:01.812396Z","submitted_at":"2026-04-20T08:21:06Z","title":"From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-10T05:44:37.891638Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.17941"},"observation_digest":"sha256:f86b9ee4a19a829bd45f9becb33ddfc3a091ee7e896591780f2fd78bc6d9c4e3","observation_id":"9848131b-30e0-4c93-b74f-d04e365c6f55","resolution":{"observed_at":"2026-05-10T05:46:09.413561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2604.19083","last_updated":"2026-04-21T04:52:38Z","snapshot_observed_at":"2026-08-11T14:30:07.776382Z","submitted_at":"2026-04-21T04:52:38Z","title":"ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-05-10T03:00:34.862711Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.19083"},"observation_digest":"sha256:7f8d332cb44f6440f9c0245cb83e305a271fc8cd61c2fbf1a60f8f13986f20c7","observation_id":"239a9c1e-f70f-4130-9e2c-6435248a535f","resolution":{"observed_at":"2026-05-11T12:46:07.405883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2605.04641","last_updated":"2026-07-29T07:14:27Z","snapshot_observed_at":"2026-08-11T12:03:57.511892Z","submitted_at":"2026-05-06T08:32:30Z","title":"CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T18:05:38.705480Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2605.04641"},"observation_digest":"sha256:3114c495309b9d0c74219318266188d77f0fdcb5c51c31510a3a39c27fb42b42","observation_id":"579842ef-2b0c-442d-97d9-624e1a4f720a","resolution":{"observed_at":"2026-05-09T06:50:40.259446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-11T16:17:26.308825Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:06.234399Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:115fd0d262c1a740258a957fcf5963bc440ed4e6218156cc6445a56a4050d702","observation_id":"9a32b2f3-01dc-4369-9ac7-7c58ef86ddb0","resolution":{"observed_at":"2026-05-12T00:51:15.370550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-11T16:17:26.308825Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:21:37.185232Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:4af1be857587537e66c8199706a41fb702802eb126cf20d358a6988811a9fb88","observation_id":"ad01c324-f8e8-476a-b0de-ec2af77c28f0","resolution":{"observed_at":"2026-05-14T21:22:58.935136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-11T16:17:26.308825Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T17:06:03.483247Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:265c126109bfd6cbff536393f7a7df961c1f3233e759c4ad6fa78b7ca9a46621","observation_id":"9932344f-2eed-4ff6-9ede-0014877bf3e7","resolution":{"observed_at":"2026-05-19T17:07:41.681980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2605.08245","last_updated":"2026-06-23T03:14:15Z","snapshot_observed_at":"2026-08-11T16:17:26.308825Z","submitted_at":"2026-05-07T10:09:18Z","title":"When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T23:41:36.199099Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2605.08245"},"observation_digest":"sha256:3a81fddd3d6abd5b31cad346e0d4c72b2ebef97cc88afae1d3e9b3c1386c06f9","observation_id":"bf977a50-5e78-4230-8871-31a7ff610c00","resolution":{"observed_at":"2026-06-30T23:45:08.071648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:3fc911c5a5a47fbbff64489e83dd75cdde7a76f48c72d0cff851e5e3cb0f1e3a","observation_id":"a1edef2e-eb6e-4a7a-8bde-a95d2843d7a7","resolution":{"observed_at":"2026-07-03T01:57:32.301867Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-06-18T10:52:49Z","snapshot_observed_at":"2026-08-04T07:49:21.370818Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:f770ae6badcdfe36828e87c372b01e1239f738b5ebd59bad8537e0213d7686ac","observation_id":"8b6fdc94-6d06-4c8b-8f12-f84a2980c7f9","resolution":{"observed_at":"2026-07-04T03:29:29.216583Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2606.28273","last_updated":"2026-06-26T17:16:04Z","snapshot_observed_at":"2026-07-07T00:02:24.342539Z","submitted_at":"2026-06-26T17:16:04Z","title":"Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T03:53:04.984303Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2606.28273"},"observation_digest":"sha256:fa7f4694011cc23bb07aabd16f37781e1fd37e53a2421c2a93761d82f5ee9898","observation_id":"d467b29d-18e8-4c35-a1db-0cbb5acc4098","resolution":{"observed_at":"2026-07-01T17:15:51.998943Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2607.06445","last_updated":"2026-07-07T16:11:13Z","snapshot_observed_at":"2026-08-07T18:51:57.165048Z","submitted_at":"2026-07-07T16:11:13Z","title":"Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T05:49:25.572256Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2607.06445"},"observation_digest":"sha256:273416c152c5cb2be8654af1fcc7e0a44f41b086a47bc30bd33510bed40251db","observation_id":"1e7fcd8f-d830-4ffa-ad08-ca62f0b97579","resolution":{"observed_at":"2026-07-08T05:54:33.570640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-07-14T15:15:45.858365Z","title":"arXiv preprint arXiv:2410.07149 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09827","last_updated":"2026-07-10T11:47:55Z","snapshot_observed_at":"2026-08-08T18:43:24.859462Z","submitted_at":"2026-07-10T11:47:55Z","title":"TDSal: Task-Based Top-Down Saliency Prediction Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T15:15:45.858365Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2607.09827"},"observation_digest":"sha256:80acb14c924909fb485b470b90363a7ea9b3d3d36d447fb9d5083aea083f27fc","observation_id":"6b873ae6-e746-4faa-87db-ac947f96e8ca","resolution":{"observed_at":"2026-07-14T15:15:45.858365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-01T23:00:47.642822Z","title":"13th International Conference on Learning Representations, ICLR 2025 pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15565","last_updated":"2026-07-17T02:16:46Z","snapshot_observed_at":"2026-08-07T16:34:25.573962Z","submitted_at":"2026-07-17T02:16:46Z","title":"Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:00:47.642822Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2607.15565"},"observation_digest":"sha256:8624ed8bb7a3d5128a344a8b188b796fdb420eac7c6ba833debdc51c521a016c","observation_id":"8fa7922b-835c-4dc3-a5e8-cb48569b5b14","resolution":{"observed_at":"2026-08-01T23:00:47.642822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-01T21:26:11.993187Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16094","last_updated":"2026-07-17T16:25:03Z","snapshot_observed_at":"2026-08-08T03:29:38.707478Z","submitted_at":"2026-07-17T16:25:03Z","title":"How Do VLMs Fail? Vision-Operation Misalignment in Compositional VQA","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:26:11.993187Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2607.16094"},"observation_digest":"sha256:2b43afc7478f3f4ff2bf380ef712b9435658f2b9ba4b5e1b1f208af7417c9e05","observation_id":"287e32b1-9179-496c-a116-d6747c979a3e","resolution":{"observed_at":"2026-08-01T21:26:11.993187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-11T04:17:56.032176Z","title":"To- wards interpreting visual information processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09928","last_updated":"2026-08-10T17:59:30Z","snapshot_observed_at":"2026-08-13T03:17:09.582020Z","submitted_at":"2026-08-10T17:59:30Z","title":"Multimodal Model Diffing for Feature Discovery and Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:17:56.032176Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2608.09928"},"observation_digest":"sha256:06bc3fa428c97888168a620d3edf5df27799df417b242cd0eeb3acd038164543","observation_id":"cdd46c79-02f1-4c4e-86bb-b856ba020424","resolution":{"observed_at":"2026-08-11T04:17:56.032176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.07149/citation-record","integrity":"/paper/2410.07149/integrity","json":"/paper/2410.07149/citation-record.json","paper":"/paper/2410.07149"},"outbound":[],"paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T22:26:59.285652Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 30 inbound Pith citation observations for arXiv:2410.07149."}