{"as_of":"2026-08-07T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f9d871ff54d7b2d2dd462a4d360e73af4bad1576431f5d2e79f715968f06cfa","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:22:03.315478Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:36:35.008744Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"cited_work":{"arxiv_id":"2505.21967","doi":"10.48550/arxiv.2505.21967","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2505.21967(2025).https://doi.org/ 10.48550/ARXIV.2505.21967,https://doi.org/10.48550/arXiv.2505.21967","venue":"ArXiv.org","work_id":"b32e6d94-ae80-4ef1-abec-f77ec8fcc507","year":2025},"citing_paper":{"arxiv_id":"2605.10764","last_updated":"2026-06-29T08:36:15Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T15:59:02Z","title":"Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:37:02.206788Z"},"links":{"cited_paper":"/paper/2505.21967","citing_paper":"/paper/2605.10764"},"observation_digest":"sha256:ea3e1dfce5a2e28ba6e8b95c37d37688096286d691ea9f3e4f41ddec1ad1426e","observation_id":"f60e2885-fcfa-4e92-965f-45e4e2c9b8e8","resolution":{"observed_at":"2026-05-12T03:51:21.142226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"cited_work":{"arxiv_id":"2505.21967","doi":"10.48550/arxiv.2505.21967","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2505.21967(2025).https://doi.org/ 10.48550/ARXIV.2505.21967,https://doi.org/10.48550/arXiv.2505.21967","venue":"ArXiv.org","work_id":"b32e6d94-ae80-4ef1-abec-f77ec8fcc507","year":2025},"citing_paper":{"arxiv_id":"2605.10764","last_updated":"2026-06-29T08:36:15Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T15:59:02Z","title":"Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T22:36:35.008744Z"},"links":{"cited_paper":"/paper/2505.21967","citing_paper":"/paper/2605.10764"},"observation_digest":"sha256:bfd5409fa0c6abf00f4cd40ba5f1f6683c25485a07a77f13820878c9f04478c5","observation_id":"6f56305f-00ec-4234-8302-71e500584cca","resolution":{"observed_at":"2026-06-30T22:45:06.840605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21967/citation-record","integrity":"/paper/2505.21967/integrity","json":"/paper/2505.21967/citation-record.json","paper":"/paper/2505.21967"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:59.997430Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:21:59.997430Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:458c0fb02313e72850076dfad37e46ccd81389c179c37941ba197065dab90dda","observation_id":"d19d6d1c-9902-40bf-86c3-3486ab3c69af","resolution":{"observed_at":"2026-08-07T13:21:59.997430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.083452Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.083452Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:d4d9ee8b1ee2e9a2df4088bd1ce35b54eeea98d62d887225d6c0299b953c90af","observation_id":"8d57f9d3-34a8-44a3-96a8-dd0bfd9aa116","resolution":{"observed_at":"2026-08-07T13:22:00.083452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.910059Z","title":null,"venue":null,"work_id":"811dceaf-4cc8-4134-b106-6b1ef9986c45","year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.188628Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:0a22cb2d0d9a426a45e04a03cc0e27edf464490e603fd60c8ae6b07f75075b74","observation_id":"4306a273-91d8-4e0f-bef0-f8bbdf768d8e","resolution":{"observed_at":"2026-08-07T13:22:04.973791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:22:00.280789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.280789Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:713e9a3420922bb790bb286bf6c0e9c46e317d90822aaeac3b72384a2df266a5","observation_id":"eca866ee-afb6-4d8d-9af3-01bfed357942","resolution":{"observed_at":"2026-08-07T13:22:00.280789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15447","last_updated":"2024-05-06T06:36:24Z","snapshot_observed_at":"2026-08-03T21:29:11.660688Z","submitted_at":"2023-06-26T17:18:44Z","title":"Are aligned neural networks adversarially aligned?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15447","snapshot_observed_at":"2026-08-07T13:22:00.372780Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.372780Z"},"links":{"cited_paper":"/paper/2306.15447","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:2a131326f5398b99dd83d47b1e08778474b8f4337b675526c5f0ab6b97b63108","observation_id":"553ad8f8-e473-4063-af66-0fd1741979ea","resolution":{"observed_at":"2026-08-07T13:22:00.372780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.763235Z","title":null,"venue":null,"work_id":"36353502-65a7-4d40-8433-0c1146efef11","year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.472931Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:060925fb2fd527a2f4c79526d900968e148a0579b34d10db4487df4ea4824456","observation_id":"08a26a18-0ea7-4d56-8163-881621a560ad","resolution":{"observed_at":"2026-08-07T13:22:04.826249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T13:22:00.577809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.577809Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:a7c70a3b782e8811a5f120628d802414227e733e25e188010ed618bed981932c","observation_id":"71c06227-c851-4b21-a88d-dc330c50fe68","resolution":{"observed_at":"2026-08-07T13:22:00.577809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2501.18533","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.183621Z","title":null,"venue":null,"work_id":"1a90921c-0138-414c-87d9-570e89819d18","year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.668623Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:94435731e15ec6f7ca8f3883ab45e1bed54d0cb343155dd00281b82f3ce594db","observation_id":"a75ab97f-f187-4f3f-9c6c-c72661c2fe55","resolution":{"observed_at":"2026-08-07T13:22:04.260322Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T13:22:00.808067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.808067Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:55530e4ea2ee66838e1029994ad2d4e8cf6cabf8f0bc87b6316e3bf03dac2f8b","observation_id":"154a0da8-bb06-4901-b630-d98a7539b344","resolution":{"observed_at":"2026-08-07T13:22:00.808067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09572","last_updated":"2024-10-15T04:55:36Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T17:03:04Z","title":"Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09572","snapshot_observed_at":"2026-08-07T13:22:00.937985Z","title":"Kwok, and Yu Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.937985Z"},"links":{"cited_paper":"/paper/2403.09572","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:4948debd98d9c5104d2684847d9cf970cd8dcae4d78b6f56867a2a2a6e8fc45c","observation_id":"5610b33f-03d5-463d-a71f-065bddc96ba1","resolution":{"observed_at":"2026-08-07T13:22:00.937985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08410","last_updated":"2025-03-06T01:45:26Z","snapshot_observed_at":"2026-07-06T19:49:34.518432Z","submitted_at":"2024-11-13T07:57:19Z","title":"The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08410","snapshot_observed_at":"2026-08-07T13:22:01.083283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.083283Z"},"links":{"cited_paper":"/paper/2411.08410","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:c8ed0ede80076b70a4d422d7e22be2df5a6360cbe91127f7e3bb2cbd1658b6ff","observation_id":"6238b638-3e4c-4bf3-beb4-1af93b5b1163","resolution":{"observed_at":"2026-08-07T13:22:01.083283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-07T13:22:01.209865Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.209865Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:bed4ea08dcbded9202da4d2c1cd126bc4748bde7625cbec7aa4550d9887c7764","observation_id":"5f2bf4b8-33ce-41c4-8b52-cbe9f76ad5f9","resolution":{"observed_at":"2026-08-07T13:22:01.209865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09792","last_updated":"2025-01-13T03:30:37Z","snapshot_observed_at":"2026-07-06T17:44:54.095160Z","submitted_at":"2024-03-14T18:24:55Z","title":"Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09792","snapshot_observed_at":"2026-08-07T13:22:01.312248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.312248Z"},"links":{"cited_paper":"/paper/2403.09792","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:3e8c29e23ab790c2944ae7298c0e2d9f8d1711bfe0f0b6d40c4ac8566c8e5467","observation_id":"2a43af3d-bcb8-4cfb-9482-2b6cd603c2ae","resolution":{"observed_at":"2026-08-07T13:22:01.312248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.409051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.409051Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:6781fd5dd4177ef75fee3657edec477775e0fca7981cc1afca1a4a4f9e07b2f2","observation_id":"191a6725-f006-4205-9b9b-2dbb1cddb02c","resolution":{"observed_at":"2026-08-07T13:22:01.409051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T13:22:01.498183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.498183Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ed9764325366f5de12c1391f60e084d002990d0b0987cf6173e505285d2f89aa","observation_id":"2b50626b-3742-48af-97b5-1c12fe9a4428","resolution":{"observed_at":"2026-08-07T13:22:01.498183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17600","last_updated":"2024-06-19T08:32:14Z","snapshot_observed_at":"2026-07-06T16:54:22.039181Z","submitted_at":"2023-11-29T12:49:45Z","title":"MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17600","snapshot_observed_at":"2026-08-07T13:22:01.628548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.628548Z"},"links":{"cited_paper":"/paper/2311.17600","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:0e67b30d6bb92e98223a52a338615b49d55a61e949905bf9c3e854df03949072","observation_id":"372b9fad-d7ae-415b-8e5c-2fa6374a698b","resolution":{"observed_at":"2026-08-07T13:22:01.628548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-07T13:22:01.713276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.713276Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:299712c98a984d5672bd8ec3336a4bcbf456719ee8c8954735f62388f4aa50aa","observation_id":"14a7de28-2358-4d2e-a772-e43b6ba251de","resolution":{"observed_at":"2026-08-07T13:22:01.713276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20773","last_updated":"2024-06-12T07:13:48Z","snapshot_observed_at":"2026-07-06T18:23:15.098065Z","submitted_at":"2024-05-25T17:17:18Z","title":"Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20773","snapshot_observed_at":"2026-08-07T13:22:01.801888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.801888Z"},"links":{"cited_paper":"/paper/2405.20773","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:3fa95e04c8a4776f24beb7d00d905ccc95910ee9543e74fed63934803968d0cc","observation_id":"175db9d6-728f-4140-a7eb-cb7830d3e6b1","resolution":{"observed_at":"2026-08-07T13:22:01.801888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.587144Z","title":null,"venue":null,"work_id":"35b73cd8-c8da-4d0a-bbca-030038174e40","year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.862758Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:a08ca6baab3841ec108714c66b99cebeb3499a314e21ad612b59fc1a5e668dfa","observation_id":"bc0c3f8e-dab5-4a54-a16f-4c8b6da1a3c5","resolution":{"observed_at":"2026-08-07T13:22:04.658281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.457016Z","title":null,"venue":null,"work_id":"74668426-196c-4631-9e48-c3b918ab6b96","year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.979525Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:d0f97a5a701ad2b117ba9ee91d655227835c658a333c34712efef7133a5f9b61","observation_id":"7e7c3462-64c6-4026-a5e5-68bae8996c5f","resolution":{"observed_at":"2026-08-07T13:22:04.512101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T13:22:02.114092Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.114092Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:2d0137b0b5b96e326900aa3329b4b1db553aab3f4cc7ab540def32dce77a66c4","observation_id":"1ec2665d-f663-457b-b69e-de22614a81c1","resolution":{"observed_at":"2026-08-07T13:22:02.114092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-07-06T15:45:47.517122Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-07T13:22:02.206932Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.206932Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:44539b7bafc2178ef19bd78206d45166f6fdf38f5885e2b813a4f9a77023c81f","observation_id":"b8bad99f-9b0a-4851-beef-152ef6c85924","resolution":{"observed_at":"2026-08-07T13:22:02.206932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-07T13:22:02.264836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.264836Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ba72fafac43fb6c07df89b677c47d51865362da367c1642f8e1c85d4c00fef9f","observation_id":"c8c52f74-861c-4210-8aff-3a9380812a78","resolution":{"observed_at":"2026-08-07T13:22:02.264836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T13:22:02.361804Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.361804Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:aac1cf22ff6a1084529f64cfa955d0c416c2f1de7ec84abd823c34702229d093","observation_id":"6c78856d-3fd0-4a59-9047-c400e615f3c3","resolution":{"observed_at":"2026-08-07T13:22:02.361804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:22:02.468108Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.468108Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:a5afc5a2b7d9c2c1d67a1ff30f0d1ee78eb8aca00ebacd5b8056febb1b0f1f0d","observation_id":"6dcc71f0-4f11-464c-91e1-7b1e3cfb7638","resolution":{"observed_at":"2026-08-07T13:22:02.468108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14539","last_updated":"2023-10-10T22:17:17Z","snapshot_observed_at":"2026-07-06T15:59:03.095461Z","submitted_at":"2023-07-26T23:11:15Z","title":"Jailbreak in pieces: Compositional Adversarial Attacks on Multi-Modal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14539","snapshot_observed_at":"2026-08-07T13:22:02.564374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.564374Z"},"links":{"cited_paper":"/paper/2307.14539","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:6d0cd0d14be3ed3fbdf959c8b3bf7ce856cead742df4113238126947b0258c8f","observation_id":"640678cd-a03e-41a8-b33a-01dfcf983ed4","resolution":{"observed_at":"2026-08-07T13:22:02.564374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-07T13:22:02.650913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.650913Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:31a1e75768e2a92a19d14c23200e8b1913c8429aa244ac9b4a0f7e0bcb32e1d1","observation_id":"2695b31c-6fb7-47be-871f-bf585facd308","resolution":{"observed_at":"2026-08-07T13:22:02.650913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-03T17:57:32.495715Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T13:22:02.762002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.762002Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:0214aa466b3736767895287d67890519168a638022d1256ffe376aed3b635647","observation_id":"d9418b88-1f0e-4957-9ca1-fd398b28f113","resolution":{"observed_at":"2026-08-07T13:22:02.762002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09513","last_updated":"2024-03-14T15:57:13Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T15:57:13Z","title":"AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09513","snapshot_observed_at":"2026-08-07T13:22:02.837913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.837913Z"},"links":{"cited_paper":"/paper/2403.09513","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:a3e3c7a11c8185b3b50c248c89d211e8efa6b3535443788201c043c39bf076d0","observation_id":"7c17b61d-0b4d-4798-9adc-1d39b89c96a8","resolution":{"observed_at":"2026-08-07T13:22:02.837913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08464","last_updated":"2024-10-22T02:01:16Z","snapshot_observed_at":"2026-08-06T17:47:27.255106Z","submitted_at":"2024-08-16T00:18:23Z","title":"$\\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08464","snapshot_observed_at":"2026-08-07T13:22:02.930271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.930271Z"},"links":{"cited_paper":"/paper/2408.08464","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:00a04bcbb35ad940d873279f852026b31c8f1957487775548c8da8c4e0e5dabc","observation_id":"a689702f-811f-42a2-956b-4bcb5dd45768","resolution":{"observed_at":"2026-08-07T13:22:02.930271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-05T06:50:37.512438Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T13:22:02.983754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.983754Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ef30a82e6a424053ae78828bd2ea2be1bfaa69a13e391a3203bd3272df4a8130","observation_id":"66eaf8e9-4a0e-441f-bf8c-28a6b5c608d6","resolution":{"observed_at":"2026-08-07T13:22:02.983754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20971","last_updated":"2025-02-12T05:52:11Z","snapshot_observed_at":"2026-08-06T01:39:45.456581Z","submitted_at":"2024-10-28T12:43:47Z","title":"BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20971","snapshot_observed_at":"2026-08-07T13:22:03.045502Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.045502Z"},"links":{"cited_paper":"/paper/2410.20971","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:99f9e2bfd5bd54e205659c558de05ed1fbce67081414ebfae211ea5fe765bc68","observation_id":"704c3b50-ed54-4bfa-821b-53c6d7106ce8","resolution":{"observed_at":"2026-08-07T13:22:03.045502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-07-06T19:29:51.449372Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-07T13:22:03.133709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.133709Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:56512c88a5d5024e404806cababf70096ca0406d2ef3302a999da4723d86c3e8","observation_id":"7ca0153f-f489-4660-824d-dca44f119fae","resolution":{"observed_at":"2026-08-07T13:22:03.133709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-07T10:51:37.619464Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-07T13:22:03.217330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.217330Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:077dc368cdde4774b20aebe613d80575166c8499c1a874c8ca1173c61078a6fe","observation_id":"d7030a2a-6b04-40d9-aa36-666ba7ecdcdf","resolution":{"observed_at":"2026-08-07T13:22:03.217330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02534","last_updated":"2024-08-26T22:56:28Z","snapshot_observed_at":"2026-07-06T18:40:31.586903Z","submitted_at":"2024-07-01T16:58:55Z","title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02534","snapshot_observed_at":"2026-08-07T13:22:03.315478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.315478Z"},"links":{"cited_paper":"/paper/2407.02534","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:920f21436ccea9d320ea15cba9cc8ac6ed6e699cc1d970598b7cfe593b03786f","observation_id":"223155c9-a9f7-4614-b43b-90df379ffc4a","resolution":{"observed_at":"2026-08-07T13:22:03.315478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:16:16.017208Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2505.21967."}