{"as_of":"2026-08-15T19:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b593008076772b4f0e42f3321745db5a020382051f044d8c49003aa8694f31a3","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:58:41.930696Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T13:51:30.008232Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:17:26.204542Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22415","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2509.22415 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-15T10:30:17.445130Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2509.22415","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:a3424e65d055e133b0215b304bb65056dc59a20f71a99b20de5f1e20c04bae52","observation_id":"3ba56f85-3d55-4672-bfb4-ae7e7e20a6c9","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2509.22415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22415","snapshot_observed_at":"2026-07-15T02:21:03.503340Z","title":"arXiv preprint arXiv:2509.22415 , year=","venue":null,"work_id":"2178ad90-e8bf-42ca-b9d1-850c4e31c2c4","year":2025},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-11T18:46:22.698604Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2509.22415","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:8aed8e35df17467754f20ecf37a8579d148cbced6eb7df5599a5a95f6a7146a2","observation_id":"38d1b9c1-92c1-4c09-9345-f8178441dbba","resolution":{"observed_at":"2026-07-15T02:21:03.503340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2509.22415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22415","snapshot_observed_at":"2026-07-15T02:21:03.503340Z","title":"arXiv preprint arXiv:2509.22415 , year=","venue":null,"work_id":"2178ad90-e8bf-42ca-b9d1-850c4e31c2c4","year":2025},"citing_paper":{"arxiv_id":"2606.05843","last_updated":"2026-06-04T08:18:31Z","snapshot_observed_at":"2026-08-14T20:01:41.153918Z","submitted_at":"2026-06-04T08:18:31Z","title":"Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T01:54:13.927736Z"},"links":{"cited_paper":"/paper/2509.22415","citing_paper":"/paper/2606.05843"},"observation_digest":"sha256:92e1f7673843ab8f78d9a70014a9eba19466a9e2fa7a9275d5109da7a333fda4","observation_id":"d5e45228-c43b-4eda-941e-6e2dfb7ef000","resolution":{"observed_at":"2026-07-15T02:21:03.503340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2509.22415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.22415","snapshot_observed_at":"2026-07-15T02:21:03.503340Z","title":"arXiv preprint arXiv:2509.22415 , year=","venue":null,"work_id":"2178ad90-e8bf-42ca-b9d1-850c4e31c2c4","year":2025},"citing_paper":{"arxiv_id":"2606.08394","last_updated":"2026-06-07T01:11:36Z","snapshot_observed_at":"2026-08-15T10:24:14.510087Z","submitted_at":"2026-06-07T01:11:36Z","title":"When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T19:02:12.613002Z"},"links":{"cited_paper":"/paper/2509.22415","citing_paper":"/paper/2606.08394"},"observation_digest":"sha256:ef054fefb2b49af04d537ca22ef9a30e141065af2cc7982a01800924709437d5","observation_id":"db50e166-6b9e-46ab-ba4c-0ff270c67d5c","resolution":{"observed_at":"2026-07-15T02:21:03.503340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.22415/citation-record","integrity":"/paper/2509.22415/integrity","json":"/paper/2509.22415/citation-record.json","paper":"/paper/2509.22415"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:36.640029Z","title":"Quantifying attention flow in transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:36.640029Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:2724d719557bdee8f12427baa11837aeb1969ffa733b3b6075292b89af0f4c0b","observation_id":"edd6808e-8f03-42ae-bb2d-ad4d16c8f989","resolution":{"observed_at":"2026-08-04T14:58:36.640029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:36.714273Z","title":"Attnlrp: Attention-aware layer-wise relevance propagation for transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:36.714273Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:89533e5aed0ad2a8425ae8c1a7fce4541bae805b15b866d62842ece4aadcabed","observation_id":"abfb8110-11d4-4276-bc08-6fd88d795953","resolution":{"observed_at":"2026-08-04T14:58:36.714273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:36.864905Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:36.864905Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:b56c64eeaeb2ac889798a08e4e89083cddd06220a1895d93adde4e428ac9ca2b","observation_id":"bf34d5b2-f9b4-42e3-b99c-e2632bd4d4b8","resolution":{"observed_at":"2026-08-04T14:58:36.864905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:36.984919Z","title":"Xai for transformers: Better explanations through conservative propagation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:36.984919Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:fee3a440d27c10fbf4de3b8eac611faab18a5d26a6fc010e7222e5b3230094f8","observation_id":"152e38f3-4ebf-4464-9efb-ac784ddef259","resolution":{"observed_at":"2026-08-04T14:58:36.984919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:37.085767Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.085767Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:e46be2f052eb689bed20fbf8061ed9dd2fabcfbf2434cf3ead39e0b490fdaeac","observation_id":"c2485d37-b6f7-4ad2-b452-8ba701e091dc","resolution":{"observed_at":"2026-08-04T14:58:37.085767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:37.164745Z","title":"Lvlm-intrepret: An interpretability tool for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.164745Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:074ce11d5fadc2e7924136a153e8eb8492cb4a05a3572173b2c8b30feed3085e","observation_id":"7f217119-0866-4247-8a30-cbc057680002","resolution":{"observed_at":"2026-08-04T14:58:37.164745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:37.305848Z","title":"Grad-cam++: Generalized gradient-based visual explanations for deep convolutional networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.305848Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:e960f9ead0de6e6c763387d65acdddd4753e0ebff8d29e00d323447e49dbc5d7","observation_id":"d7655173-a537-48d3-9a1e-5fea2d13798b","resolution":{"observed_at":"2026-08-04T14:58:37.305848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-04T14:58:37.449797Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.449797Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:9aa9a6838d1b12ca3c326d7871c7a5fd13c889629bee4dda5680f7d9bbeaaab6","observation_id":"cfdadec1-1bae-4b93-9db0-91c600144b44","resolution":{"observed_at":"2026-08-04T14:58:37.449797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T14:58:37.574822Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.574822Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:ea4dd6322184ce8402525693d65969bfc98eacb731e121054ba8cebf024643d3","observation_id":"01efeb9c-10ad-498d-8f54-d83ab0cefec8","resolution":{"observed_at":"2026-08-04T14:58:37.574822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:37.784819Z","title":"A comprehensive survey of deep learning for image captioning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.784819Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:5df9aa547ba080cee59af202ae24cd51844b800ba8a9aaf6129b737e2ba7ba68","observation_id":"f2811cf3-8a57-4d68-a82a-fc95994ed473","resolution":{"observed_at":"2026-08-04T14:58:37.784819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-08-12T22:31:21.822818Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-04T14:58:37.914746Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:37.914746Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:dc79bb27ae3386232ce435b673556cf33eb49a828bbde6756f6426ffe51d5d4d","observation_id":"ba9802a2-c408-4e9b-9f1a-1e1e868b4c31","resolution":{"observed_at":"2026-08-04T14:58:37.914746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:38.126706Z","title":"Layercam: Exploring hierarchical class activation maps for localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.126706Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:ab5508ed89b19f3d4618b9ead24e486d1451912226c7c5e236a6e400c4803720","observation_id":"bac4670a-8c94-4185-91c6-65176859b581","resolution":{"observed_at":"2026-08-04T14:58:38.126706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:38.253254Z","title":"a ldchen, Alexander Binder, Gr \\'e goire Montavon, Wojciech Samek, and Klaus-Robert M \\","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.253254Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:84f7f8db2361645292b8cfb8b28269a96f42350e2d180dbaf2b5c00ead0d0f1b","observation_id":"c4c87463-6172-4101-ba6b-fc14b2d04af0","resolution":{"observed_at":"2026-08-04T14:58:38.253254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23270","last_updated":"2025-06-29T14:50:45Z","snapshot_observed_at":"2026-08-14T17:32:03.154565Z","submitted_at":"2025-06-29T14:50:45Z","title":"Token Activation Map to Visually Explain Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23270","snapshot_observed_at":"2026-08-04T14:58:38.554863Z","title":"Token activation map to visually explain multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.554863Z"},"links":{"cited_paper":"/paper/2506.23270","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:ca8e6cbf224f67b2f5eae3174f1917a1120b6f792b3074a307482611fcb5e076","observation_id":"ee607a6c-424c-4103-8a9b-d5ac4adba379","resolution":{"observed_at":"2026-08-04T14:58:38.554863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:38.704820Z","title":"A closer look at the explainability of contrastive language-image pre-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.704820Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:1c2e7f69256943e7c16349dc8d62c3114403c26b700ac989f5447f154ac40c4b","observation_id":"42ed0f55-deae-4c2d-ad9e-6ee029756c0f","resolution":{"observed_at":"2026-08-04T14:58:38.704820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:38.834822Z","title":"Imitated detectors: Stealing knowledge of black-box object detectors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.834822Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:50543b37544976e6a322db40dac6bdc2f9a301331567954bf422fad81cb3f976","observation_id":"45708298-6f54-4636-bef6-1ec0ff012a26","resolution":{"observed_at":"2026-08-04T14:58:38.834822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12075","last_updated":"2024-03-04T13:59:22Z","snapshot_observed_at":"2026-08-13T05:22:14.442954Z","submitted_at":"2023-11-20T02:21:49Z","title":"BadCLIP: Dual-Embedding Guided Backdoor Attack on Multimodal Contrastive Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12075","snapshot_observed_at":"2026-08-04T14:58:38.944873Z","title":"Badclip: Dual-embedding guided backdoor attack on multimodal contrastive learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:38.944873Z"},"links":{"cited_paper":"/paper/2311.12075","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:5e9aab16058061b8cef209b65066d2d4a849e1532341fbb9db48f562c8515dfd","observation_id":"c0aa5596-2fd7-4009-8a55-59bc2d54052f","resolution":{"observed_at":"2026-08-04T14:58:38.944873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.095066Z","title":"Revisiting backdoor attacks against large vision-language models from domain shift","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.095066Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:717c06b5efa15b8dfe46c41555991cd36ba2f888d48c919136bf0be9bb7cbb7f","observation_id":"4cedad88-ca80-4441-81fb-87b8e8d359a2","resolution":{"observed_at":"2026-08-04T14:58:39.095066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15512","last_updated":"2025-04-26T16:17:55Z","snapshot_observed_at":"2026-08-07T16:00:24.594893Z","submitted_at":"2025-04-22T01:18:42Z","title":"T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15512","snapshot_observed_at":"2026-08-04T14:58:39.157286Z","title":"T2vshield: Model-agnostic jailbreak defense for text-to-video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.157286Z"},"links":{"cited_paper":"/paper/2504.15512","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:367ed058d5f97ba354e3efa41218fd94203d7ee86bb8849734b6cdc47b8cc124","observation_id":"359f2b2a-fd58-49fc-bdf2-aa81da3cc33d","resolution":{"observed_at":"2026-08-04T14:58:39.157286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.244816Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.244816Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:72fc02b5ed8f752dd4003b9e73e21d9acd951bdf7eda3df4f9282fc222f843d4","observation_id":"a9e50e97-3454-424f-80e5-4548b1b2298d","resolution":{"observed_at":"2026-08-04T14:58:39.244816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.514777Z","title":"Agentsafe: Benchmarking the safety of embodied agents on hazardous instructions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.514777Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:17392e01b2d402d1793879f5440bd764751ba6319570bc13a024d05649f82e30","observation_id":"d4a11e8d-3a6c-4e97-bb1c-91bcaf86be32","resolution":{"observed_at":"2026-08-04T14:58:39.514777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.632162Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.632162Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:ef410036b3b8ea31f090568653a5b561244bba6484ca5f35f4e964863fc790af","observation_id":"420c2142-2f54-48d9-9f5f-0f11eea76121","resolution":{"observed_at":"2026-08-04T14:58:39.632162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.774940Z","title":"Introducing mpt-7b: A new standard for open-source, commercially usable llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.774940Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:2711cdee0242a46fa57819849ea72479924943af19df7a2fcd9dab752e235b36","observation_id":"f486202e-5d79-49fa-ab5e-508403e590c0","resolution":{"observed_at":"2026-08-04T14:58:39.774940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:39.894820Z","title":"Interpreting GPT : The logit lens","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:39.894820Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:f4bd582ff2569da2d396c7d3db09989b9c585aa5467394907de65a81f2e449e6","observation_id":"bd5ab252-c52e-4191-a1e6-36781453d342","resolution":{"observed_at":"2026-08-04T14:58:39.894820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:40.044812Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.044812Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:1d075f6b64d515f189804481f5ff264d17de3159fa55df01bff943904fd0ad77","observation_id":"6ab32022-082f-4766-b351-7c12071380f5","resolution":{"observed_at":"2026-08-04T14:58:40.044812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:40.135308Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.135308Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:8301b61ec36a301054167f869029cf86dacf601e42a66a15511a749d85dbc3d7","observation_id":"368a8580-d972-4a70-87af-c473db46328f","resolution":{"observed_at":"2026-08-04T14:58:40.135308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:40.248234Z","title":"Releasing 3b and 7b redpajama-incite family of models including base, instruction-tuned & chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.248234Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:8ae1e9b118dc9a4404bd2ef274b4cf7e8ab4807d8c517be3427a4722a38f9912","observation_id":"ceedae73-1b4e-40e9-a871-c839a53dec35","resolution":{"observed_at":"2026-08-04T14:58:40.248234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T14:58:40.334874Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.334874Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:06fb45de861a1df3e2cc03cf44479a0da374b209438963f36d6376366e1faf1e","observation_id":"cd6462a4-3d92-42cf-968f-a224d15b9ba4","resolution":{"observed_at":"2026-08-04T14:58:40.334874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:40.406592Z","title":"A similarity measure for indefinite rankings","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.406592Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:4274936d86c410d2313f38e85e293712b45abec446896c336b3e85dabc826d6a","observation_id":"b2b598e6-7327-4aec-9ee9-1d55d4d98312","resolution":{"observed_at":"2026-08-04T14:58:40.406592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00600","last_updated":"2024-06-30T05:55:15Z","snapshot_observed_at":"2026-08-12T23:32:00.864238Z","submitted_at":"2024-06-30T05:55:15Z","title":"GenderBias-\\emph{VL}: Benchmarking Gender Bias in Vision Language Models via Counterfactual Probing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00600","snapshot_observed_at":"2026-08-04T14:58:40.532601Z","title":"Genderbias- emph \\ VL \\ : Benchmarking gender bias in vision language models via counterfactual probing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.532601Z"},"links":{"cited_paper":"/paper/2407.00600","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:c0010d4f9e9a110a121f4b2bfddefbdbfca525be01975bc05efe3ded7cc686d5","observation_id":"8ac6b1a9-183a-4331-a43f-a5ca14aefe4a","resolution":{"observed_at":"2026-08-04T14:58:40.532601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07787","last_updated":"2025-04-10T14:23:06Z","snapshot_observed_at":"2026-08-07T16:06:50.458789Z","submitted_at":"2025-04-10T14:23:06Z","title":"Fairness Mediator: Neutralize Stereotype Associations to Mitigate Bias in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07787","snapshot_observed_at":"2026-08-04T14:58:40.684840Z","title":"Fairness mediator: Neutralize stereotype associations to mitigate bias in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.684840Z"},"links":{"cited_paper":"/paper/2504.07787","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:af6f08baeda14e7b42253dfe3ba7a5831ee106a1f77956a343ed4ad7be518d26","observation_id":"ded2961a-f7f7-4119-b76f-1ff743a4f816","resolution":{"observed_at":"2026-08-04T14:58:40.684840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18927","last_updated":"2024-10-24T17:14:40Z","snapshot_observed_at":"2026-08-12T22:15:43.393808Z","submitted_at":"2024-10-24T17:14:40Z","title":"SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18927","snapshot_observed_at":"2026-08-04T14:58:40.772114Z","title":"Safebench: A safety evaluation framework for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.772114Z"},"links":{"cited_paper":"/paper/2410.18927","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:e341aae9989de87a3b01f784ec86390f9ccd5452abc3c000fb03a4fe3d452d90","observation_id":"d5b73532-6df5-4685-854b-badf749082d0","resolution":{"observed_at":"2026-08-04T14:58:40.772114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04031","last_updated":"2024-07-01T14:25:23Z","snapshot_observed_at":"2026-08-12T23:48:48.833189Z","submitted_at":"2024-06-06T13:00:42Z","title":"Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04031","snapshot_observed_at":"2026-08-04T14:58:40.894740Z","title":"Jailbreak vision language models via bi-modal adversarial prompt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.894740Z"},"links":{"cited_paper":"/paper/2406.04031","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:6e9141fc012cbb2010175352e31e0057c9217479e55ef6a5f090e8dd964b45c6","observation_id":"e4b34017-fd2e-46ab-84b7-de38e5014b22","resolution":{"observed_at":"2026-08-04T14:58:40.894740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12430","last_updated":"2025-07-11T02:01:54Z","snapshot_observed_at":"2026-08-09T20:22:46.693664Z","submitted_at":"2025-06-14T10:03:17Z","title":"Pushing the Limits of Safety: A Technical Report on the ATLAS Challenge 2025","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12430","snapshot_observed_at":"2026-08-04T14:58:40.973955Z","title":"Pushing the limits of safety: A technical report on the atlas challenge 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:40.973955Z"},"links":{"cited_paper":"/paper/2506.12430","citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:010750001bfd1c8108bf3659166f90ef2bb3385ef2dd999498701edff26d6f1d","observation_id":"d959c428-ffb2-4b39-a8e2-ed0d461d1b1f","resolution":{"observed_at":"2026-08-04T14:58:40.973955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.085453Z","title":"From redundancy to relevance: Enhancing explainability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.085453Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:df42cf0d9695d45efc6feeb052ee51ff90c77e612a4b2e804157091c31c9c247","observation_id":"0412c0fb-1f5f-4c58-a4d5-59aa5729db60","resolution":{"observed_at":"2026-08-04T14:58:41.085453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.170192Z","title":"Learning deep features for discriminative localization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.170192Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:421b29ddbe0f0f44e7f5d5527de985b9c8b89ae137e47fc760fc6fb39eb0cdb8","observation_id":"b10d9ec3-a928-4483-9b21-64edc7ea1b33","resolution":{"observed_at":"2026-08-04T14:58:41.170192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.290378Z","title":"Openpsg: Open-set panoptic scene graph generation via large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.290378Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:cbab16e029d7e0c53f2aaab8058c0e436310104467e4fb8b5066f5c7ff4c5d7c","observation_id":"c66b70d3-e0d2-417b-8d63-80fab847d6ae","resolution":{"observed_at":"2026-08-04T14:58:41.290378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.464746Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.464746Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:ff91ced3d99d5720d5d8cbb87d4b0ed6e694860c7ae641d9d822e8717693c80d","observation_id":"d7a4f2f8-c28f-4a83-9b35-8a9e401b1bc9","resolution":{"observed_at":"2026-08-04T14:58:41.464746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.727878Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.727878Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:76c067f80f2514cca2a7bc8d9d928f900d9b88d173f73c6116f2eb9dc66b84db","observation_id":"b0a9a974-ade6-4253-bb97-88e46c13800d","resolution":{"observed_at":"2026-08-04T14:58:41.727878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.864889Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.864889Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:c1f6969aece30971e0e077b53c5f3bd1984a1c1195dd499fa6fc707d9876b49f","observation_id":"70b12ab8-4a0d-4e4b-8ffa-f9c2195fede1","resolution":{"observed_at":"2026-08-04T14:58:41.864889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:58:41.930696Z","title":"traffic\" and","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T14:58:41.930696Z"},"links":{"citing_paper":"/paper/2509.22415"},"observation_digest":"sha256:35433a7ad84ed1f956f849fb540e656e3d951e1bf5dca12c1de2132c24b9d6bd","observation_id":"0a43367e-89d0-4626-b19a-29e5544aabe5","resolution":{"observed_at":"2026-08-04T14:58:41.930696Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22415","last_updated":"2026-07-15T06:42:59Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:02:30.220130Z","submitted_at":"2025-09-26T14:39:13Z","title":"Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 4 inbound Pith citation observations for arXiv:2509.22415."}