{"as_of":"2026-08-08T04:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e542269e25ac44ad1ac324d3e70e83213d9eeca1cd90c37e9f851176e86ad6b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:08:01.411183Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:46:52.070071Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T14:48:23.261637Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"cited_work":{"arxiv_id":"2506.00548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00548","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"T., Nakov, P., and Gurevych, I","venue":null,"work_id":"025f2ed7-7bf8-4c34-b74b-57905720e85f","year":null},"citing_paper":{"arxiv_id":"2605.17128","last_updated":"2026-05-16T19:22:54Z","snapshot_observed_at":"2026-08-02T02:37:40.373827Z","submitted_at":"2026-05-16T19:22:54Z","title":"New Wide-Net-Casting Jailbreak Attacks Risk Large Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T14:46:52.070071Z"},"links":{"cited_paper":"/paper/2506.00548","citing_paper":"/paper/2605.17128"},"observation_digest":"sha256:c2653941953f168196618fae8032a9fddfc90e4696b17adb762923a355004593","observation_id":"70f892a0-c216-4f7b-bed9-7cf6f9b57923","resolution":{"observed_at":"2026-05-20T14:48:23.263188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00548/citation-record","integrity":"/paper/2506.00548/integrity","json":"/paper/2506.00548/citation-record.json","paper":"/paper/2506.00548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:07:57.985841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:57.985841Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:83b41f40c734076afeeaf175d5911e51cdd5bb9ca7ac49337a6acc1826ebf35b","observation_id":"668fd8a5-7bb3-48dd-a48e-732dfcab98fc","resolution":{"observed_at":"2026-08-07T12:07:57.985841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10490","last_updated":"2023-10-03T17:03:10Z","snapshot_observed_at":"2026-08-04T02:19:57.679295Z","submitted_at":"2023-07-19T23:03:20Z","title":"Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10490","snapshot_observed_at":"2026-08-07T12:07:58.079163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.079163Z"},"links":{"cited_paper":"/paper/2307.10490","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:251bd763d212d0101c816784256a534cf6682b883594f8800f1534f7eeec7304","observation_id":"e45d494d-1e18-483f-80c2-3892c392dc02","resolution":{"observed_at":"2026-08-07T12:07:58.079163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T12:07:58.191086Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.191086Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:bca32c66577f0cc9dec240262812150b100cc9693c1d7921791e0b5cd17ab6ca","observation_id":"918d8786-856c-44f0-9877-fc448dccb352","resolution":{"observed_at":"2026-08-07T12:07:58.191086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00236","last_updated":"2024-09-17T19:56:09Z","snapshot_observed_at":"2026-08-06T06:17:45.496933Z","submitted_at":"2023-09-01T03:53:40Z","title":"Image Hijacks: Adversarial Images can Control Generative Models at Runtime","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00236","snapshot_observed_at":"2026-08-07T12:07:58.302229Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.302229Z"},"links":{"cited_paper":"/paper/2309.00236","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:6f9546f618ccd1679b408c3d8404639eb09ff18b34480566000812ffe7399600","observation_id":"2b5915c6-681e-41a8-81d0-73865e04c1f5","resolution":{"observed_at":"2026-08-07T12:07:58.302229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:04.141135Z","title":null,"venue":null,"work_id":"b03d60f3-2007-4f9f-86f0-b6f55d1f0362","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.406573Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:d06774c799374524fd60355dbd873660f2c11c0b45026a3777ea2b0c2d2ff3f3","observation_id":"bf9db7b5-2b2b-4349-92dc-c682e659f22d","resolution":{"observed_at":"2026-08-07T12:08:04.167676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:58.505183Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.505183Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:939fa63c4fadb8583a926265693520d90b2804d753bea6013ea447770ca14c62","observation_id":"bcbdb15b-d5d1-4d4e-b65c-d5f42b7c1478","resolution":{"observed_at":"2026-08-07T12:07:58.505183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T12:07:58.606775Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.606775Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:6383d568a44d922e3de6a9bdbd7786eb5d32c1ff457d21faf9254d99d508f3aa","observation_id":"f0b44c36-2a93-4f62-8371-844350562b12","resolution":{"observed_at":"2026-08-07T12:07:58.606775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-02T21:47:41.540245Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-07T12:07:58.704370Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.704370Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:891fce3ddf394c4b651a99b2fe19c6529a73b6a0ee72a98e30e8e10d5b63303f","observation_id":"d5086852-280e-487f-be1b-9cfb95f22b1e","resolution":{"observed_at":"2026-08-07T12:07:58.704370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"file/4956247","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:02.301194Z","title":null,"venue":null,"work_id":"40a790b0-2d3b-4913-bbcb-9f45d9e40dc7","year":2020},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.817971Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:150f4a94c6ac0163de0e526f9f866a80881e60c9927d3a8b9744e0e35fe35607","observation_id":"d5b44c31-34e4-44be-a78c-dfcda1868867","resolution":{"observed_at":"2026-08-07T12:08:02.382583Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-07T12:07:58.929188Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:58.929188Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:753108082a0d6b38a9e88caf882f9472ee6750c491f766cb32ae574ad3bbf5f6","observation_id":"954456f8-4bf4-48d7-8406-c4d614839bae","resolution":{"observed_at":"2026-08-07T12:07:58.929188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20362","last_updated":"2025-05-26T09:01:46Z","snapshot_observed_at":"2026-08-07T14:05:21.829543Z","submitted_at":"2025-05-26T09:01:46Z","title":"VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20362","snapshot_observed_at":"2026-08-07T12:07:59.063691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.063691Z"},"links":{"cited_paper":"/paper/2505.20362","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:776141c0f8032de11bd1930e6ed9dd038101b4225bb6f30e4431a24c1b1b58eb","observation_id":"8ea633dd-8b0e-4bc4-b856-61d281d5cb07","resolution":{"observed_at":"2026-08-07T12:07:59.063691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:07:59.166840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.166840Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:8f1f23ceb90dd897d33e55d532f5a03217c12b936c7c98bc336f1df1bd83b2aa","observation_id":"dacb2f80-318f-4ac3-bbe4-bcd682011472","resolution":{"observed_at":"2026-08-07T12:07:59.166840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.925222Z","title":null,"venue":null,"work_id":"7f47bf2f-2a5f-4d08-b31c-de018a8f7313","year":2025},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.271539Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:91311fa71c225cb76a76315b8281850e0e13b61fe8d8a22abd6131db9ad2c417","observation_id":"ad61aacc-e04c-4467-b7bc-20484df55abc","resolution":{"observed_at":"2026-08-07T12:08:04.030424Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-07T12:07:59.394540Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.394540Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:a7c60b588378e8db6793de854925aeaf5b22a427f375dbd0751606c00682625c","observation_id":"3bf6bcac-375c-47b1-a898-025e275b64d8","resolution":{"observed_at":"2026-08-07T12:07:59.394540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:59.467007Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.467007Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:aaf52108e2053d7462fa019e305b51edeb2967ae7a490b3425a0ac8900e4dd87","observation_id":"b6ad0214-da61-4faf-9418-79d49ed2806d","resolution":{"observed_at":"2026-08-07T12:07:59.467007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:59.540769Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.540769Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:cecf8183d8a6d66d07aa92f0fb2d12b8692a4d07c65b3391a846f1a7d170620f","observation_id":"18052033-7682-4734-bb57-7241064fbeeb","resolution":{"observed_at":"2026-08-07T12:07:59.540769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.758542Z","title":null,"venue":null,"work_id":"71fdbe64-8273-40db-aa42-fc59420c5526","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.623628Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:93374acd4f25ad7468aaafcd3c165eba7c0dd837df1efffbba3e47b32dd869ae","observation_id":"61896e90-9697-487d-97c9-d41d067afb22","resolution":{"observed_at":"2026-08-07T12:08:03.828294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.616086Z","title":null,"venue":null,"work_id":"8d83f21d-1c67-418b-a663-839724c0bade","year":2025},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.672766Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:887a0476c418699afae5bd8ac511e62d633d74a8a304a7177b9130422f4bdd2a","observation_id":"24c6b23a-9412-43a3-9f46-c68f6c612a63","resolution":{"observed_at":"2026-08-07T12:08:03.672537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.473655Z","title":null,"venue":null,"work_id":"694b3047-0be2-4794-8998-b3d251c5f332","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.805451Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:a781087b7d90cbf849b06f658dd5c7a77bfc9ff34e70a78f378b344422e5c245","observation_id":"4706da89-891a-4ef9-96a2-1b119785f543","resolution":{"observed_at":"2026-08-07T12:08:03.534510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.302869Z","title":null,"venue":null,"work_id":"9a2e3400-0df6-4c04-8953-039b94d24524","year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.894197Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:6ec70355a12d0482d080f7e46931f45e71e7568a8c3b2339f8a3714c730eaaff","observation_id":"773f9717-8acf-4036-812e-db42a33c5dbe","resolution":{"observed_at":"2026-08-07T12:08:03.382972Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:59.969474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.969474Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:9053bae627fdc92bb3b86717a8846fd70b4dd9390c624e6df113e8f9c3272b38","observation_id":"d6b9eb2a-688e-42fb-86e3-4432d33c29a2","resolution":{"observed_at":"2026-08-07T12:07:59.969474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-07T07:47:20.838090Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-07T12:08:00.063288Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.063288Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:b21959f632438e4ea8f25376cd18de2e6012b9d4471f3db9640f4c81abe99798","observation_id":"b63719bd-e60e-4d8c-8b9e-fc5079bdf55a","resolution":{"observed_at":"2026-08-07T12:08:00.063288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.205293Z","title":null,"venue":null,"work_id":"c695de3e-c6bd-47b3-8320-ddd2618a1f11","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.158998Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:9f9b18d344f9399c0ff37de89d72370c91fa452631186656ea3bdf98126b3b8c","observation_id":"b1da87ad-cb78-4c6a-9a46-9b2070bb7952","resolution":{"observed_at":"2026-08-07T12:08:03.246576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:03.068801Z","title":null,"venue":null,"work_id":"e14df4eb-1cfb-4170-a715-e968b4b13395","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.261718Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:60392ff9fc7ea4dc2e4b0c68b2310b4b06dc7b2c7fc38f5dbcfd6a87c379e704","observation_id":"250f4292-1aaa-468b-a357-df2d3a13ba2a","resolution":{"observed_at":"2026-08-07T12:08:03.132168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04482","last_updated":"2024-10-11T17:21:40Z","snapshot_observed_at":"2026-07-06T18:41:57.207738Z","submitted_at":"2024-07-05T13:04:31Z","title":"Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models","version":2},"cited_work":{"arxiv_id":"2407.04482","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04482","snapshot_observed_at":"2026-08-07T12:08:01.993584Z","title":"Controlling Whisper: Universal Acoustic Adversarial Attacks to Control Speech Foundation Models","venue":"cs.SD","work_id":"df60ba1c-7855-440f-a777-281d952046a3","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.354125Z"},"links":{"cited_paper":"/paper/2407.04482","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:e75b83674f616a70c114f7fda39187545b5a590fb3cf6dfe46169e065c98c57a","observation_id":"17532a42-0e7b-4c3f-b799-2eeae2f51478","resolution":{"observed_at":"2026-08-07T12:08:02.097925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-07T12:08:00.473611Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.473611Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:6f126af5816f72a05dfd85e5ab998b6dfc20f18efe8c2147c8c9c174e7bfea97","observation_id":"21a7957e-c661-4c15-9b71-8bf8442eeff4","resolution":{"observed_at":"2026-08-07T12:08:00.473611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:00.549823Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.549823Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:a37eb8191a1448c1f6f8469a28b8a467feb789544b93ca303f00eab5360ed054","observation_id":"1b231f7f-0ceb-4ee9-9267-943d30c1d320","resolution":{"observed_at":"2026-08-07T12:08:00.549823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:02.881000Z","title":null,"venue":null,"work_id":"35dd8f40-51c7-4a4e-b8c9-37bb081501f9","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.638978Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:7b9d927000ddd9496d24dc62a1f3ba8f8e521543d369b59ae26b80d4abf6a039","observation_id":"2ecc5970-7bc2-4fbf-9a5b-bfbb1ef7cc39","resolution":{"observed_at":"2026-08-07T12:08:02.955052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10260","last_updated":"2024-08-27T03:32:47Z","snapshot_observed_at":"2026-08-04T21:32:35.483431Z","submitted_at":"2024-02-15T18:58:09Z","title":"A StrongREJECT for Empty Jailbreaks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10260","snapshot_observed_at":"2026-08-07T12:08:00.711015Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.711015Z"},"links":{"cited_paper":"/paper/2402.10260","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:5d73f520b3be4640d088916109f2f6ebd314628700f8d820ac3bd9767c451240","observation_id":"5828d487-26ed-4a7c-8d5e-e22c57919b19","resolution":{"observed_at":"2026-08-07T12:08:00.711015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:00.806008Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.806008Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:105240b08bde9331d0248c5f03b5cd63adfbf14e1f7e587b3c0b1e910b03f970","observation_id":"aa713c1a-2c6d-4dff-88f3-d7e2ad255d43","resolution":{"observed_at":"2026-08-07T12:08:00.806008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:00.879017Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.879017Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:eb3826801867c4072037644d8ad21569b614fdaee1bc55b0acd7ddec35ef961e","observation_id":"2ee29963-929a-482e-9b7c-c49704ecbde1","resolution":{"observed_at":"2026-08-07T12:08:00.879017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:02.727463Z","title":null,"venue":null,"work_id":"d412ee8f-5be2-455d-bf42-3a998dd160ad","year":2008},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:00.960733Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:d05dda4e3ddacd6aec4334586e218bc35ea1bf8ccaed0542b6999dd4cd9b1ffd","observation_id":"4eed4580-7064-4eb6-ad56-239254d5fca0","resolution":{"observed_at":"2026-08-07T12:08:02.789674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08464","last_updated":"2024-10-22T02:01:16Z","snapshot_observed_at":"2026-08-06T17:47:27.255106Z","submitted_at":"2024-08-16T00:18:23Z","title":"$\\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08464","snapshot_observed_at":"2026-08-07T12:08:01.063214Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:01.063214Z"},"links":{"cited_paper":"/paper/2408.08464","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:e01bcef26f6db6d9ed42f6f1eba83eed0d53338cdf3f2a0b7554298e9bf22044","observation_id":"b0392158-6983-49ac-a913-3a2e50c02009","resolution":{"observed_at":"2026-08-07T12:08:01.063214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:02.613536Z","title":null,"venue":null,"work_id":"e0ddf9d8-26f9-4d44-8820-27415f8828eb","year":2024},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:01.178583Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:a34e567e94ff9c748dccc6f72892e1aa762a6ebbf2eb7a0aedbf44a614496274","observation_id":"533b588a-dc9f-4e1b-8067-5e1a181356c8","resolution":{"observed_at":"2026-08-07T12:08:02.654199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T12:08:01.270169Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:01.270169Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:0e81acc21862cf6cd4f8bfc33bb56db62a7db60f7445152b948b48c175809980","observation_id":"86a9542d-5d9c-4fca-905f-6735b5b3a238","resolution":{"observed_at":"2026-08-07T12:08:01.270169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:01.337660Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:01.337660Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:b09f4317de0a0fef0a37ce0166333c8fbf1c1fcb6e75f4398b6196165f2d188b","observation_id":"05aed257-3e04-46bc-bc0d-3b90eefcd4ac","resolution":{"observed_at":"2026-08-07T12:08:01.337660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:01.411183Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:08:01.411183Z"},"links":{"citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:09293cf43e0db03bc04970c875d13a46d426d4ea9d6617279e941c59d055eda8","observation_id":"bdc45ecb-57f9-4e26-a6fd-13d499bd92a5","resolution":{"observed_at":"2026-08-07T12:08:01.411183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T12:00:39.929483Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.00548."}