{"as_of":"2026-08-07T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eab91bb5e748752ed1070bb04dab8917106317f62b6e4859e33b263cabac87f5","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:51:33.211141Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:04:46.426969Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:30:51.277126Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.01307","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01307","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4565402-55b5-4c38-ba4e-6e06ba518dfc","year":null},"citing_paper":{"arxiv_id":"2604.06247","last_updated":"2026-04-06T16:29:05Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-06T16:29:05Z","title":"SALLIE: Safeguarding Against Latent Language & Image Exploits","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T19:04:46.426969Z"},"links":{"cited_paper":"/paper/2506.01307","citing_paper":"/paper/2604.06247"},"observation_digest":"sha256:b88f9ef31d35a9a456623f3a179a7381a275b352405fa5a7cb075eb45a0aa277","observation_id":"92a8316e-aa44-4442-94a5-6ce1c411ff39","resolution":{"observed_at":"2026-05-10T23:30:51.279710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01307/citation-record","integrity":"/paper/2506.01307/integrity","json":"/paper/2506.01307/citation-record.json","paper":"/paper/2506.01307"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:51:30.472465Z","title":"Gpt-4 technical report. arxiv 2303.08774,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.472465Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:e6523b073baa0398d4b21773cac8ee4cae4ac5994ba08a8599e4f358be547b46","observation_id":"1fb9bb94-5321-44bf-9cbb-be3ed3dcdf9c","resolution":{"observed_at":"2026-08-07T11:51:30.472465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:51:30.525374Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.525374Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:094c6cb17807f7d74cbfde44818908014db5d8f3c725339509156b12dc9910f6","observation_id":"e72e39d2-d951-4d67-b0e7-71f5f40a6948","resolution":{"observed_at":"2026-08-07T11:51:30.525374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T11:51:30.594092Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.594092Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:ec4eeefde4ee2ef080e961cfd28c9cd4b44055b13f5ac55f095d28997c803dab","observation_id":"ef0946de-ab69-4161-a9d6-0138554acc8e","resolution":{"observed_at":"2026-08-07T11:51:30.594092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:30.654714Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.654714Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:4408acedfd40462375a6d28457823dc1b56883e9de38404e51d518582741d52e","observation_id":"82887369-20a4-46cc-866f-d1f7955af88a","resolution":{"observed_at":"2026-08-07T11:51:30.654714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T11:51:30.708631Z","title":"Videochat: Chat-centric video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.708631Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:09c214562e3cc6d621a6e2cb78f0f81f142f6095bc9b2f9732c9aa02494958c7","observation_id":"fc6bae13-b3ab-420e-981c-09a913f748a7","resolution":{"observed_at":"2026-08-07T11:51:30.708631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:30.759161Z","title":"Pengi: An audio language model for audio tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.759161Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:931ad68f840e8422af60ebbd6f7c915247ba2a281938497d8413b72fbcca41ad","observation_id":"e94737b0-a031-499f-b7a7-4779385e11b0","resolution":{"observed_at":"2026-08-07T11:51:30.759161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:35.495074Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":"5dfb69b2-9bc9-4bad-8843-b590964642ac","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.826744Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:aa4b82ebec18763bc7174d12a3ddc2c37ce662a60578566ccf37311364ab2f0f","observation_id":"b140f10b-8e32-48a6-b77f-5fb694fbd27c","resolution":{"observed_at":"2026-08-07T11:51:35.538329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T11:51:30.892052Z","title":"Universal and transferable adversarial attacks on aligned language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.892052Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:ef5606fd6b6987b76b3c3fd72cce3ccbbbbfed9f9d01b41f514aab4af3f4f741","observation_id":"d294cd55-61f5-4fe2-b256-a9bc23193f35","resolution":{"observed_at":"2026-08-07T11:51:30.892052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06463","last_updated":"2024-03-26T04:23:12Z","snapshot_observed_at":"2026-07-06T16:05:31.757410Z","submitted_at":"2023-08-12T04:05:57Z","title":"GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06463","snapshot_observed_at":"2026-08-07T11:51:30.970995Z","title":"Gpt- 4 is too smart to be safe: Stealthy chat with llms via cipher,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.970995Z"},"links":{"cited_paper":"/paper/2308.06463","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:2015a473f8ad2757576d660f4381ccc9b5a2aff0b5b35a4a339dcc9c0c9ed3c2","observation_id":"85f15e9a-2344-4c10-ad7f-c18cdf49a089","resolution":{"observed_at":"2026-08-07T11:51:30.970995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-07T11:51:31.034488Z","title":"Jailbreaking black box large language models in twenty queries,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.034488Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:fe9fda2209344e752eeb85e6c5d6bcd9f16d4e9dc049ef43c66b503b804f0087","observation_id":"44e84603-c99d-4013-b29f-afa15ba7b79e","resolution":{"observed_at":"2026-08-07T11:51:31.034488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:35.380652Z","title":"Visual adversarial examples jailbreak aligned large language models,","venue":null,"work_id":"fb7e7c91-022e-4ccb-b550-dfb5b89a8349","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.080590Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:c8bb23ac41ff775b5e9e9069b1e1128548092cf65590c588d4faaf0d935a6645","observation_id":"71dff876-f268-4db8-90a7-05b02771e398","resolution":{"observed_at":"2026-08-07T11:51:35.427322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:31.127775Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.127775Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:73750512f8cf3dcc498c1aa411b723eb3c2bfecd2238a8483e741e64adbe3183","observation_id":"9ae543c5-0770-4eb5-b2cb-bf6ea664a28b","resolution":{"observed_at":"2026-08-07T11:51:31.127775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:35.256574Z","title":"Yi: Open foundation models by 01.ai,","venue":null,"work_id":"88d2b914-201c-4deb-a3bb-9e9631494fcf","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.210881Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:8694e6c375120439f6a798166e00e59ac6ca8ae5f7e567afd21606955722464f","observation_id":"57ac1d65-0182-4a1d-9dac-fd127fb32722","resolution":{"observed_at":"2026-08-07T11:51:35.326526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T11:51:31.266316Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.266316Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:36b71dea25fa1c91e38486b92b7bea5062511f5df06a4577eb0698e20b479af5","observation_id":"fc9a1c67-4e3c-4534-bfaf-65ac5aa04ea5","resolution":{"observed_at":"2026-08-07T11:51:31.266316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T11:51:31.323529Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.323529Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:ee57283984ba27a9ff99dc4ed4d0a03bc3cd6e04acf3e6e7e01b0a2223a5bfb8","observation_id":"3b4e1997-ed96-4122-a888-6bcd1297b8db","resolution":{"observed_at":"2026-08-07T11:51:31.323529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:35.119064Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning,","venue":null,"work_id":"44b6a827-8756-4e54-bce2-e3651ba99548","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.355865Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:45a1146fb89b92edbaa0a303656de69ef564adf38525f460f463e5d1c4a5cc99","observation_id":"a5a0e50a-313f-495a-8d1e-a3a49a8cab13","resolution":{"observed_at":"2026-08-07T11:51:35.196949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:51:31.406556Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.406556Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:6de769cec9b0d9474683568b8e71186e7a7a0ecf05b3064d52972afccb134a0b","observation_id":"808cb02a-cd49-405e-999e-1fb1ab3722af","resolution":{"observed_at":"2026-08-07T11:51:31.406556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:35.012617Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":"37b928f9-a4a9-4652-9f30-a97a96049a2e","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.439571Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:d3880409e765c1f86636536e9352d9e32932e267e2d8de4d1578e19f09c99457","observation_id":"14a3b5fe-c5da-424c-bd2e-786547a8abcd","resolution":{"observed_at":"2026-08-07T11:51:35.043145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T11:51:31.473616Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.473616Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:26ab2f5940f895bb0f596109295c26fe47d95a17c3b88a123d871df778fd4615","observation_id":"0ebd9d24-a5ce-477f-ba5d-7558ca94cb4d","resolution":{"observed_at":"2026-08-07T11:51:31.473616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T11:51:31.525668Z","title":"Cogvlm: Visual expert for pretrained language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.525668Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:d7234035f3203efcb369e095d6fe08a12400eb3d2a484cee71c5b38198bb7793","observation_id":"80c65fb0-056e-4ca7-9709-2649b5f5fc6d","resolution":{"observed_at":"2026-08-07T11:51:31.525668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-07-06T17:29:39.117068Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-07T11:51:31.581115Z","title":"Cold-attack: Jail- breaking llms with stealthiness and controllability,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.581115Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:b26c698b18c8275b91d56d825d95f8775734d381cee43a88f3b386956e76c78e","observation_id":"644770f6-f978-49a1-8c07-841eeb5244af","resolution":{"observed_at":"2026-08-07T11:51:31.581115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-07T07:47:20.838090Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-07T11:51:31.629125Z","title":"Jailbreaking attack against multimodal large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.629125Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:3ec623c5c1b514706f02962b55dc8c387f313210a221474815fc3654d121e135","observation_id":"63fcc7da-0de8-450c-9094-c3e55489aac6","resolution":{"observed_at":"2026-08-07T11:51:31.629125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.904820Z","title":"Cross-shaped adversarial patch attack,","venue":null,"work_id":"7e49df1d-5bd8-4fd2-a321-cd2644c118ad","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.648158Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:a7e2c596d3fa30692575002813484ff74fac84c88c051e28b1e0131e69261ca4","observation_id":"ee961af7-a279-4c2c-9283-c6f26bbd0a01","resolution":{"observed_at":"2026-08-07T11:51:34.956625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.837939Z","title":"Targeted adversarial attack against deep cross-modal hashing retrieval,","venue":null,"work_id":"8615379a-70f6-46a6-8649-049a5cad21b1","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.697495Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:4c74e2223a55793f746d9add6a91c9e3c4e90f3f6080f4c8c0e3aad2af39a981","observation_id":"1a24ef4f-6ac7-454f-90bf-1019ecc4704b","resolution":{"observed_at":"2026-08-07T11:51:34.882627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.704025Z","title":"Dynamics-aware adversarial attack of adaptive neural networks,","venue":null,"work_id":"42ed62bd-8f65-4f97-8b85-527deb1ac7e7","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.762048Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:37b897b1473fbdbd00f9014a619667d662d3797ef000d03ed71123e0592ad463","observation_id":"53e32251-37cf-495c-971e-3e243982e2dc","resolution":{"observed_at":"2026-08-07T11:51:34.777603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.575611Z","title":"Iterative adversarial attack on image- guided story ending generation,","venue":null,"work_id":"b24d0998-c763-4061-a584-8b16d2696899","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.818425Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:6594d5b4d91c77ed79e8d11948c3af13b9aaa517197483ce27bce8db17059b5b","observation_id":"dbfd7b8c-da2e-4b6e-9dac-2336b4cfa51f","resolution":{"observed_at":"2026-08-07T11:51:34.620955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.390490Z","title":"Toward robust neural image compression: Adver- sarial attack and model finetuning,","venue":null,"work_id":"8d3876d3-257b-4780-94d7-3c5880370758","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.888309Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:fe46f8ef1796ae38fd2bc347d4cb0d1c3a0284a00ca6d5174f352fca51cd3da7","observation_id":"9e9df887-7064-4106-8bd4-e12dafd4ba22","resolution":{"observed_at":"2026-08-07T11:51:34.458925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.222769Z","title":"Towards adversarial attack on vision- language pre-training models,","venue":null,"work_id":"1c3b50f3-6f3b-4ce0-a434-b4060a5cfbbb","year":2022},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:31.950339Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:52380242cacdf46f7ab7c04f89604b9d908d208375d620fda38b2f43d9ea468c","observation_id":"16740d72-5656-4a95-8111-043ba3356ee1","resolution":{"observed_at":"2026-08-07T11:51:34.301714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12636","last_updated":"2025-06-02T08:14:09Z","snapshot_observed_at":"2026-07-06T16:09:51.953140Z","submitted_at":"2023-08-24T08:22:21Z","title":"Exploring Transferability of Multimodal Adversarial Samples for Vision-Language Pre-training Models with Contrastive Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12636","snapshot_observed_at":"2026-08-07T11:51:32.003169Z","title":"Exploring transferability of multimodal adversarial samples for vision-language pre-training models with contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.003169Z"},"links":{"cited_paper":"/paper/2308.12636","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:a2cea6ac1dd8cf37acb80431e2e937ea4523fc8f73c99ff62544bd0905ee2be5","observation_id":"a6fead6f-3ab2-4daa-9c6e-e8d303eb6951","resolution":{"observed_at":"2026-08-07T11:51:32.003169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:34.091149Z","title":"Scalable universal adversarial watermark defending against fa- cial forgery,","venue":null,"work_id":"8d0f51ed-7202-42c9-b9df-d690b66b1aa9","year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.061863Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:4f50c5e1fa2da961da24db648e8ca1f75ee5c0a2ba601cdc553fbf7ee40a2d28","observation_id":"039539f4-a146-4f94-afa1-83b8d23ab22f","resolution":{"observed_at":"2026-08-07T11:51:34.148747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:33.972885Z","title":"An unforgeable publicly verifiable watermark for large language models,","venue":null,"work_id":"9ce7f62c-380f-4705-bf2d-07ccc393eead","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.132317Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:81f5023eb3bcace161188e249e7ce7383fecd3a53a53c16c10cb0137a30d9559","observation_id":"c3142e28-7d08-4ff6-8aaf-64c719910493","resolution":{"observed_at":"2026-08-07T11:51:34.031982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:33.836642Z","title":"A novel model watermarking for protecting generative adversarial network,","venue":null,"work_id":"162c1006-607d-4f15-9305-e60edf4a88be","year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.221165Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:2699ad232d874dcbe6eb6bb29fbffdf931585f380ea4512044d6a900231f8d84","observation_id":"1cff7bda-554f-4ec0-8768-57ec9584f7c0","resolution":{"observed_at":"2026-08-07T11:51:33.891576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07057","last_updated":"2024-12-06T14:21:06Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T08:38:13Z","title":"MultiTrust: A Comprehensive Benchmark Towards Trustworthy Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07057","snapshot_observed_at":"2026-08-07T11:51:32.292682Z","title":"Benchmarking trustworthiness of multimodal large language models: A comprehensive study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.292682Z"},"links":{"cited_paper":"/paper/2406.07057","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:1e2d0dd6d384a9e78c76d2833e4ee9f547f8678cdb59359eafe7789afd66a470","observation_id":"02b16ad3-6cfc-4111-8bcc-7a358ee07963","resolution":{"observed_at":"2026-08-07T11:51:32.292682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2211.01671","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:33.435532Z","title":"Visually adversarial attacks and defenses in the physical world: A survey,","venue":null,"work_id":"22529124-b552-4bf7-aa75-6079e69370a6","year":2022},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.375525Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:a7ba48b5558932686c5716b6e516d07abce61ce0a074b6b7e6b9b5e180e71d7f","observation_id":"b81d3f36-170a-408b-8194-6c093c191ddd","resolution":{"observed_at":"2026-08-07T11:51:33.486716Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07594","last_updated":"2025-01-08T02:33:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-10T09:51:24Z","title":"How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07594","snapshot_observed_at":"2026-08-07T11:51:32.442812Z","title":"How to bridge the gap between modalities: A comprehensive survey on multimodal large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.442812Z"},"links":{"cited_paper":"/paper/2311.07594","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:e3b5acb38e543caee095acaba773464514beba2ad3afc8ca4ba4b4dfa869727d","observation_id":"215ff0cf-0c24-48e6-ae3d-3b778e38bf4b","resolution":{"observed_at":"2026-08-07T11:51:32.442812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-07T11:51:32.503010Z","title":"Towards deep learning models resistant to adversarial attacks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.503010Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:488d201cef0e399989dcfcaf444e7d77211da8d8592446bbec7b5d2f60ec8947","observation_id":"e1c4d96c-2bd5-4fbe-b6be-214a7bb7eaa5","resolution":{"observed_at":"2026-08-07T11:51:32.503010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:32.593150Z","title":"Visual adversarial examples jailbreak aligned large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.593150Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:24ff42972b4ad6fb649ca3d8005d6597a484c7d50339dea2227ba42ce7c6fa4c","observation_id":"e078d193-ea6c-4d38-a95e-710c97cdccab","resolution":{"observed_at":"2026-08-07T11:51:32.593150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:33.711606Z","title":"Enhancing the transferability of adversarial attacks through variance tuning,","venue":null,"work_id":"d79c47f0-4e8c-4bdd-a689-6ba1eaa1ea37","year":2021},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.655871Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:1245b50f694df1c52a145bba58ce48c5ced4ff09b40e50c58ccbbd21034495a6","observation_id":"c386dfdb-b3cc-4bfc-beec-60afe310ec2c","resolution":{"observed_at":"2026-08-07T11:51:33.749670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:32.738478Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.738478Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:8ab14f20aae23d2f7202bafec8fc756ad560db4db6131b65a09379d0eefe936b","observation_id":"810c9d6f-f753-4bba-a412-6bafc1d7d107","resolution":{"observed_at":"2026-08-07T11:51:32.738478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:51:32.812440Z","title":"Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.812440Z"},"links":{"citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:bca475e111f6ce105c6487878c4a0610ce3e2834b1b8782de0d30db6eaa2927f","observation_id":"6b7c214f-b5e7-4092-9def-6fdc3742f280","resolution":{"observed_at":"2026-08-07T11:51:32.812440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04031","last_updated":"2024-07-01T14:25:23Z","snapshot_observed_at":"2026-08-05T18:40:45.767406Z","submitted_at":"2024-06-06T13:00:42Z","title":"Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04031","snapshot_observed_at":"2026-08-07T11:51:32.894561Z","title":"Jailbreak vision language models via bi-modal adversarial prompt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.894561Z"},"links":{"cited_paper":"/paper/2406.04031","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:f8f8c6b5f40bad059c99e3428dade84714e5587435b1d53bb3d91dfcd1fb17b0","observation_id":"22298515-bd24-4400-84c9-790d5dad6e67","resolution":{"observed_at":"2026-08-07T11:51:32.894561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-07T11:51:32.972848Z","title":"Smoothllm: Defending large language models against jailbreaking attacks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:32.972848Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:f10bf14ff8c99ca726e672c537d90bca989741cb923ea7bd4e84a6837839d529","observation_id":"cc92866a-6aa5-44dc-a637-714a814ed871","resolution":{"observed_at":"2026-08-07T11:51:32.972848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15851","last_updated":"2024-03-22T10:02:11Z","snapshot_observed_at":"2026-07-06T16:37:50.485332Z","submitted_at":"2023-10-24T14:08:26Z","title":"Self-Guard: Empower the LLM to Safeguard Itself","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15851","snapshot_observed_at":"2026-08-07T11:51:33.051132Z","title":"Self-guard: Empower the llm to safeguard itself,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:33.051132Z"},"links":{"cited_paper":"/paper/2310.15851","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:fca4abbb6e97b51bc9139e2a8a877ab5070d5ce0be20f54c1b75cff853727fc0","observation_id":"3bb0ae46-7edd-488f-a05a-11b2cfd86068","resolution":{"observed_at":"2026-08-07T11:51:33.051132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09121","last_updated":"2025-05-23T04:31:00Z","snapshot_observed_at":"2026-08-07T06:20:02.075920Z","submitted_at":"2024-07-12T09:36:33Z","title":"Refuse Whenever You Feel Unsafe: Improving Safety in LLMs via Decoupled Refusal Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09121","snapshot_observed_at":"2026-08-07T11:51:33.126948Z","title":"Refuse whenever you feel unsafe: Improving safety in llms via decoupled refusal training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:33.126948Z"},"links":{"cited_paper":"/paper/2407.09121","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:a1ad3eefa0f8646ecafdaf1db3c92f676a9392e093bd85056cd6e4099a0f66aa","observation_id":"24f406f7-dac3-4aae-af34-04176296cb90","resolution":{"observed_at":"2026-08-07T11:51:33.126948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15589","last_updated":"2024-11-01T16:39:36Z","snapshot_observed_at":"2026-08-05T10:26:07.839736Z","submitted_at":"2024-05-24T14:20:09Z","title":"Efficient Adversarial Training in LLMs with Continuous Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15589","snapshot_observed_at":"2026-08-07T11:51:33.211141Z","title":"Efficient adversarial training in llms with continuous attacks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:33.211141Z"},"links":{"cited_paper":"/paper/2405.15589","citing_paper":"/paper/2506.01307"},"observation_digest":"sha256:8e9f98e41e6b79dd4f121c60b3c402fcb4e17993dcebaf9ad43cb06548de40f4","observation_id":"2033bf75-41f1-4ab5-8e01-a3f3876b678b","resolution":{"observed_at":"2026-08-07T11:51:33.211141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01307","last_updated":"2025-06-02T04:33:56Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-07T11:42:31.717394Z","submitted_at":"2025-06-02T04:33:56Z","title":"Align is not Enough: Multimodal Universal Jailbreak Attack against Multimodal Large Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2506.01307."}