{"as_of":"2026-08-08T23:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f21850a024eb18287a2558867b78ba11930ec83c12c7d798e4863f6fdc8eea8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:45:19.868976Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T06:17:42.481821Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-07T19:45:19.868976Z","title":"Safeguarding vision-language models against patched visual prompt injec- tors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:19.868976Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:ef269214d15246452aa57eb0153b5a74c0cec0535d4810070b9a0db612bd4d1f","observation_id":"39c2234b-993c-4dc9-968a-602b60e1a764","resolution":{"observed_at":"2026-08-07T19:45:19.868976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-07T13:22:02.650913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.650913Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:4ba218c40c9874925d1a789320a468dad76bd69268b550b79e0a6b90c3a927bd","observation_id":"2695b31c-6fb7-47be-871f-bf585facd308","resolution":{"observed_at":"2026-08-07T13:22:02.650913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-06T23:01:04.671789Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00052","last_updated":"2025-06-25T02:56:38Z","snapshot_observed_at":"2026-08-08T22:10:18.231261Z","submitted_at":"2025-06-25T02:56:38Z","title":"VSF-Med:A Vulnerability Scoring Framework for Medical Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:01:04.671789Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2507.00052"},"observation_digest":"sha256:7d4f7d8fe8b7972094366ab427e273bc92959ca2ea8c9ec851bcc68c3efd4ee6","observation_id":"892363c9-d243-47b9-904e-b23eb3085f1a","resolution":{"observed_at":"2026-08-06T23:01:04.671789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-06T11:54:43.097851Z","title":"”Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors” arXiv preprint arXiv:2405.10529 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22304","last_updated":"2025-07-30T00:34:20Z","snapshot_observed_at":"2026-08-07T22:27:04.322645Z","submitted_at":"2025-07-30T00:34:20Z","title":"Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:43.097851Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2507.22304"},"observation_digest":"sha256:81de0a54b09e9733810a8a455196063b66a93d494680e28653796e0cbe4b5928","observation_id":"ff24a6f7-1b78-4c9c-961c-100377eb7315","resolution":{"observed_at":"2026-08-06T11:54:43.097851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":"2405.10529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-03T06:17:42.481821Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529","venue":null,"work_id":"719dcb88-3dcb-4d94-aff5-5e1aa97700cc","year":2024},"citing_paper":{"arxiv_id":"2604.03995","last_updated":"2026-04-05T06:32:08Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:32:08Z","title":"A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T17:34:10.089555Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2604.03995"},"observation_digest":"sha256:2411d92bbcaa904c40591711ceb01ffc9b745e0d05fb716f0121f39916cd2350","observation_id":"4b733e4f-4090-402c-90a4-f64066d06207","resolution":{"observed_at":"2026-05-13T17:38:02.909348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":"2405.10529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-03T06:17:42.481821Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529","venue":null,"work_id":"719dcb88-3dcb-4d94-aff5-5e1aa97700cc","year":2024},"citing_paper":{"arxiv_id":"2604.25562","last_updated":"2026-04-28T12:32:21Z","snapshot_observed_at":"2026-07-06T23:11:25.757664Z","submitted_at":"2026-04-28T12:32:21Z","title":"SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T15:48:28.869796Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2604.25562"},"observation_digest":"sha256:431cb397853e77a202f5132ac7575c82061685f20504a80bc053aa9023dd95a9","observation_id":"e3ca8679-fb0e-4de2-a6b0-3df3bc05be76","resolution":{"observed_at":"2026-05-12T00:06:17.742460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":"2405.10529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-03T06:17:42.481821Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529","venue":null,"work_id":"719dcb88-3dcb-4d94-aff5-5e1aa97700cc","year":2024},"citing_paper":{"arxiv_id":"2605.16090","last_updated":"2026-05-15T15:47:41Z","snapshot_observed_at":"2026-08-08T23:04:25.950675Z","submitted_at":"2026-05-15T15:47:41Z","title":"A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T17:20:54.445007Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2605.16090"},"observation_digest":"sha256:6280d62f3c4c349ff19c1694a63dc7caf465c0a691ae5611e58fa9318d908ee5","observation_id":"22083a23-42a6-4d7a-ad66-b8fb85b64c4c","resolution":{"observed_at":"2026-05-20T17:23:36.801915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":"2405.10529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-03T06:17:42.481821Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529","venue":null,"work_id":"719dcb88-3dcb-4d94-aff5-5e1aa97700cc","year":2024},"citing_paper":{"arxiv_id":"2606.09125","last_updated":"2026-06-08T07:19:42Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T07:19:42Z","title":"Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-27T16:33:28.848573Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2606.09125"},"observation_digest":"sha256:0660e8b421f11fda032c79614967be4854f1927d488b2ff6018141eef950c810","observation_id":"8daca7ca-4232-4be0-8396-010f66b2c9cd","resolution":{"observed_at":"2026-07-03T01:27:31.082224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":"2405.10529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-03T06:17:42.481821Z","title":"Safe- guarding vision-language models against patched visual prompt injectors.arXiv preprint arXiv:2405.10529","venue":null,"work_id":"719dcb88-3dcb-4d94-aff5-5e1aa97700cc","year":2024},"citing_paper":{"arxiv_id":"2606.10904","last_updated":"2026-07-16T08:23:49Z","snapshot_observed_at":"2026-08-05T14:18:44.309610Z","submitted_at":"2026-06-09T14:13:54Z","title":"Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T12:44:15.097414Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2606.10904"},"observation_digest":"sha256:02796c43652df327fc517cf8fb1ce6dc905b8b960dd1cc4ba6a85da3994d8af2","observation_id":"1e2f8ced-afc5-44d0-82b9-d651ab57bf92","resolution":{"observed_at":"2026-07-03T06:17:42.483246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-15T10:53:29.444919Z","title":"arXiv preprint arXiv:2405.10529 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10904","last_updated":"2026-07-16T08:23:49Z","snapshot_observed_at":"2026-08-05T14:18:44.309610Z","submitted_at":"2026-06-09T14:13:54Z","title":"Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T10:53:29.444919Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2606.10904"},"observation_digest":"sha256:2bdfe075c9802ac980241daf5f95ad74b53ab71daa3739fc1d860e54d7f5b84e","observation_id":"dce3be7f-8d56-444b-bdfd-0d8ff1669e31","resolution":{"observed_at":"2026-07-15T10:53:29.444919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-02T11:57:02.205247Z","title":"arXiv preprint arXiv:2405.10529 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10904","last_updated":"2026-07-16T08:23:49Z","snapshot_observed_at":"2026-08-05T14:18:44.309610Z","submitted_at":"2026-06-09T14:13:54Z","title":"Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:02.205247Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2606.10904"},"observation_digest":"sha256:21189d094c7c0a10ba92a5dcd531a19b401e3e57053023306f8f8a764d49c2c2","observation_id":"b2778dff-66b4-47cf-9601-805d9831e2c5","resolution":{"observed_at":"2026-08-02T11:57:02.205247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-07-14T13:02:42.673767Z","title":"2024.Safeguarding vision-language models against patched visual prompt injectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10269","last_updated":"2026-07-11T11:56:05Z","snapshot_observed_at":"2026-08-06T13:53:30.569509Z","submitted_at":"2026-07-11T11:56:05Z","title":"Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T13:02:42.673767Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2607.10269"},"observation_digest":"sha256:b56caa9553ce0bfc873c6105c80b048d9ea0b914b4382708a6ed919e9e84639c","observation_id":"148ef1f2-5f47-4045-8f32-343e0f194c93","resolution":{"observed_at":"2026-07-14T13:02:42.673767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.10529/citation-record","integrity":"/paper/2405.10529/integrity","json":"/paper/2405.10529/citation-record.json","paper":"/paper/2405.10529"},"outbound":[],"paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2405.10529."}