{"as_of":"2026-08-05T20:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a2c40dcf20b0631831319c7a68f34b6143fee56d8bad5cfea80b08b45af02ed","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:19:11.536555Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.18915/citation-record","integrity":"/paper/2605.18915/integrity","json":"/paper/2605.18915/citation-record.json","paper":"/paper/2605.18915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.350337Z","title":"Aho and Jeffrey D","venue":null,"work_id":"b1f5cb43-a3c7-4ea0-85e7-9ccc9dfe1588","year":1972},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:a8946c06598ca740ccb8069c743ca7fdf194a9cda91aba9e5e3108cf227cf3a6","observation_id":"ec833870-3cea-4bcd-b075-dd15f1e6cad4","resolution":{"observed_at":"2026-05-20T10:23:26.492539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.146752Z","title":null,"venue":null,"work_id":"aca2b566-99e0-4ebb-9c7a-a81219531259","year":1983},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:f20df494d0354a14413f3765b1706bd70e81c64e1c78b00c6a7dad749897de61","observation_id":"79193c3b-ac5d-4b9d-8bad-39b0d1d0ab3f","resolution":{"observed_at":"2026-05-20T10:23:26.494054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2234.322243","doi":"10.1145/322234.322243","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chandra and Dexter C","venue":"Journal of the ACM","work_id":"c3270592-bd69-4213-95e1-4aaf8312be9b","year":1981},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:65aa29f6555a8b3763250887fed5b23d28ce54eec794794c5cdfc103ae7bed81","observation_id":"7113f324-37e9-4df1-bf07-caade71fa203","resolution":{"observed_at":"2026-05-20T10:23:11.772475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:12.175602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.206662Z","title":"Scalable training of","venue":null,"work_id":"aef70eae-f816-4598-84ec-429a2c09f5fc","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:cf68081199264255ce4544fe48017fa396e24d72ec78e8eb047850050e85d352","observation_id":"7a000a03-929b-480b-9106-aa00d1765cc9","resolution":{"observed_at":"2026-05-20T10:23:26.484520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.062642Z","title":null,"venue":null,"work_id":"852d89f5-1e7b-4296-b4f2-71e578b5e9f6","year":1997},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:aa6e2986308bb7f2c2ac9d6a83ed507fed82dd3f52043d7138cf63c32b9129c4","observation_id":"52f4efe5-2e0e-44e4-9039-5d78165c0bc8","resolution":{"observed_at":"2026-05-20T10:23:26.486261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.089088Z","title":"Tetreault , title =","venue":null,"work_id":"75f57f43-cb6d-44a9-9cc5-9b8cfc702ea3","year":2015},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:f70d367967ee90b11f55e674852b2b93bab198a6eedb8488f9e8c2a63fd80f8a","observation_id":"42cdbe90-f3a1-4148-a81a-1ef4c8c075c6","resolution":{"observed_at":"2026-05-20T10:23:26.487906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:52.117121Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":"6d196829-7173-4c45-aa5c-d0ee30947345","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:dca2f046b8a679f4d621c20674af3a7084b97c281c63f502269c391cb977492d","observation_id":"1ca387f9-ec6b-4b47-901f-563039bbf318","resolution":{"observed_at":"2026-05-20T10:23:26.479027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"5310f921-f794-4023-9cd9-c87f9f02f040","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:5f60b5a40cd99c757bd705f58d874fef88c7b2e164fc9899830957abab8b737f","observation_id":"212d290f-e352-44ea-9aee-2d9925cbe0e8","resolution":{"observed_at":"2026-05-20T10:23:26.482455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"edf8cd6f-ff48-45d6-a7a9-58e2ca8ae8e2","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:af3e3b899128d9def5e82d59d1f090f71f331d64e2f082d67f9ce64290f52723","observation_id":"6c68bde5-bab7-4b3d-ad4b-84e531927faa","resolution":{"observed_at":"2026-05-20T10:23:26.474055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"1ac1a1b7-9658-4f01-b72b-45aad8458061","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:15c0806c3e850949fcba88f952c768461a38e636bab1156bc90043df18f5353f","observation_id":"daf6d30b-753e-41e6-b334-f49604270399","resolution":{"observed_at":"2026-05-20T10:23:26.470072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"71a192ac-4147-470f-9fd9-9b889a52afce","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:0fa7a5f57ded63bc43e30adbcb833ce20f3c1623879d776300d15cfa7afa5680","observation_id":"3a5cbc8b-f5ab-4f1c-b380-655d531801a5","resolution":{"observed_at":"2026-05-20T10:23:26.468557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , month =","venue":null,"work_id":"b982064c-c7f6-45cb-9b86-0ffd1930b753","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:5f97795bdfc7f65bd140f7b47b45d32b60756837baeb76b48ead210b49308434","observation_id":"04c9ff00-c8ed-4208-a287-2a1745b32ba8","resolution":{"observed_at":"2026-05-20T10:23:26.472007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T11:23:43.352707Z","title":"2024 , eprint=","venue":null,"work_id":"a2fe15cd-a520-413c-b29e-a7183c7f33a8","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:f8bd4cde62ebb8edbd82b60b83feffb1dfd56d15be6a6688847ac7f540c586d3","observation_id":"92027816-29b2-425e-a9be-d6d4accd744d","resolution":{"observed_at":"2026-05-20T10:23:26.475725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T22:54:10.792208Z","title":"2025 , month =","venue":null,"work_id":"e74e75bb-bc67-4fe0-b4da-0421ff36b54a","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:78b9a267d368718878e72d1ad8fcce9836c6ad92e6c261f82639b06ea3dd8ab3","observation_id":"f0a59ca5-6f6e-424e-b750-3ba847213ff2","resolution":{"observed_at":"2026-05-20T10:23:26.477414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:04:52.402360Z","title":"2025 , month =","venue":null,"work_id":"febabd0d-bc47-4cee-be90-938845863c58","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:0d67398c42b859b458adf87c7fd8947bef9b869c6988e477ed3633f7ec2f25c5","observation_id":"af47920a-c85e-42cf-b6f6-f306a79dfb90","resolution":{"observed_at":"2026-05-20T10:23:26.480651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:56:19.350765Z","title":"2025 , eprint=","venue":null,"work_id":"b932b976-e2ea-48ac-951d-3236490ebc9c","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:854cec85b813910684f4c69c1206ea2ca585ee12b3ddf024e21711291eadf66e","observation_id":"28ebeb4e-5a43-4ca4-bd6e-ae73a9e45f1b","resolution":{"observed_at":"2026-05-20T10:23:26.491024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d96af8a0-5cad-493a-a107-3939e3d939ba","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:356ff81683e3a96ad0a962044163d57738e7bdcb8d0976c1e788b38460cd5fb7","observation_id":"0b76c8ce-da19-4d0d-9cb7-70696faf3f7b","resolution":{"observed_at":"2026-05-20T10:23:26.465231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:22:59.193966Z","title":"2025 , eprint=","venue":null,"work_id":"a8b22021-ce04-4268-a391-cf5c14365ab6","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:e84ce891250247f20cd1ec967195abe8b6914794edd86f90f763e26c9909b261","observation_id":"1dd29265-ae95-4de3-9c6f-ccb23be7c4d5","resolution":{"observed_at":"2026-05-20T10:23:26.466899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.488352Z","title":"2025 , eprint=","venue":null,"work_id":"8fb5d482-cf5e-4141-b15a-3f607aa09f83","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:36b4b6de874f4ef032d0d9a84f250f500d86a7e8b2807eb92039f0459b828447","observation_id":"e156e8d7-d72e-4eae-9600-cf251c9f10cb","resolution":{"observed_at":"2026-05-20T10:23:26.463626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:27:32.561811Z","title":null,"venue":null,"work_id":"48a06fba-cfc0-4db3-9a8d-e2a4d8c69eb9","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:48eaadc09be111428ee16cf46ab2b2db2c977a37bf7d5413f9971d4be18dd724","observation_id":"4af692b8-4571-4308-89e7-5ff4b6bb7a29","resolution":{"observed_at":"2026-05-20T10:23:26.458661Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , month = aug, day =","venue":null,"work_id":"7cd5c596-1bbe-4ace-aa77-b0498ecd7787","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:ee64e17512037ac9047bc0a3ff3f6f6f57795a1ce688126123542f049e7ce591","observation_id":"0c1cbece-d06e-49a4-8c8f-254417c90bcd","resolution":{"observed_at":"2026-05-20T10:23:26.457131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:9afaedd9d3966871fd703fe3363d93f30bff207b4dca0884bcf77f57f540eab4","observation_id":"7736e1a6-da99-473e-a1ce-e4c42e9f474a","resolution":{"observed_at":"2026-05-20T10:23:12.287037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":"487dab12-3c76-4a37-b737-c9ab81ee95ae","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:912cd7693ebf7c20a8b8c4bc5777aed260740f72d058cef9043193eb272da7d6","observation_id":"172da944-bb0b-4d54-9c68-878d13a3ba2c","resolution":{"observed_at":"2026-05-20T10:23:26.460405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.21189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2510.21189 , year=","venue":null,"work_id":"7e73d816-6b24-4e1b-a915-49aa1b44012c","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:dc526b86229e06ae8ce765a705c89c8b26e922269c33e4e1d493d829ac257bcb","observation_id":"14433505-a26b-4f64-99d2-177b355a984e","resolution":{"observed_at":"2026-05-20T10:23:12.292585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: NAACL 2024 , pages=","venue":null,"work_id":"6233af76-2083-4a96-8fbb-4d0d90bf43d4","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:029f05786a4f7005c93e085d441897101a656b22d85cbe71888d75760872ba2d","observation_id":"46ada190-3360-477b-86f0-b3d9dd9fe1b3","resolution":{"observed_at":"2026-05-20T10:23:26.461924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:e7c4f0f45a32e928851269df014a4ee7dd5f624fb3d9fd3fbb42234bab718f6a","observation_id":"a00bb4cf-63c8-4ece-8365-61c517e9644d","resolution":{"observed_at":"2026-05-20T10:23:12.295195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"e95e50a4-fb4c-4664-a880-b652955df3bc","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:41e02d5fe7bb8047d56ede44e9d27a7eb31d96c775c7d4726a9018a613120b24","observation_id":"a416fb78-2955-4b81-9a74-ef8c8306ecb8","resolution":{"observed_at":"2026-05-20T10:23:26.489504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07957","last_updated":"2025-04-27T07:20:02Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:59:12Z","title":"MM-IFEngine: Towards Multimodal Instruction Following","version":2},"cited_work":{"arxiv_id":"2504.07957","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07957","snapshot_observed_at":"2026-07-03T06:07:41.277547Z","title":"arXiv preprint arXiv:2504.07957 , year=","venue":null,"work_id":"5016a520-189a-4ec2-b330-60f78cec98b4","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2504.07957","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:b4d8a31b6e111e73ebdbac17ed8d14601d564d7c127808c662a4d07787658716","observation_id":"55178eb6-937d-4822-ace7-c49303eddfbd","resolution":{"observed_at":"2026-05-20T10:23:12.304574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":"ea6f3113-13ce-410b-bc64-285ff172b963","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:5bd02b784ef409e9f6a22c4c36d425a4d2574dd84b727e89c86728a801adfa28","observation_id":"069e2bdd-8ea7-4940-b7da-cbd77e4a7fda","resolution":{"observed_at":"2026-05-20T10:23:26.453784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:06:40.315552Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"964146c6-eb63-465f-b10a-18b87a8f88f4","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:0fc6d425b33e6d2e174ddade03033ae8e94204cc369a156ce9797dac7aeae9cd","observation_id":"c7a24a65-7923-4420-99d3-eb68ec015f9c","resolution":{"observed_at":"2026-05-20T10:23:26.433081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":"9ee176db-0c29-4f35-8c70-f7991dd8a76c","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3e9e23e38ff8df421e3702aad375596494bc7e01e92d13ee38183a349c42f4f4","observation_id":"4119c6b9-bb63-4279-9663-ac275fbb2cad","resolution":{"observed_at":"2026-05-20T10:23:26.448322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06989","last_updated":"2025-08-28T08:43:31Z","snapshot_observed_at":"2026-07-06T20:49:41.870804Z","submitted_at":"2025-03-10T07:10:38Z","title":"Probabilistic Modeling of Jailbreak on Multimodal LLMs: From Quantification to Application","version":4},"cited_work":{"arxiv_id":"2503.06989","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06989","snapshot_observed_at":"2026-06-30T07:04:20.796245Z","title":"arXiv preprint arXiv:2503.06989 , year=","venue":null,"work_id":"b14b4175-b4b6-4a94-ab4e-0ddaf102c3a4","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2503.06989","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:d230ae8e8b7abea2d56142baf87bdbeac0eae1f80120d0f0a69d2c765527bdf7","observation_id":"a8ac6898-9b60-4ea8-b1be-d6300fa42d62","resolution":{"observed_at":"2026-05-20T10:23:12.298703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-02T21:47:41.540245Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":"2309.11751","doi":"10.48550/arxiv.2309.11751","metadata_source":"pith","pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How robust is Google’s Bard to adversarial image attacks?","venue":"cs.CV","work_id":"0808b24c-a08e-44cf-8998-346530bebb32","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:6eddeb3234357163c02134cedb8a68412cf355c243e844dedb86ad456cac1f9a","observation_id":"6236a050-80fa-44b6-9f30-d0e05e6c610c","resolution":{"observed_at":"2026-05-20T10:23:12.313384Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-07-06T18:49:42.663028Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2407.15211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15211 , year=","venue":null,"work_id":"f3d9a128-d8fc-4003-ae18-c58c50864b31","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:a9f76e5b9a15588c762ba273bc7fdb42ed77790724fbfb5b126f298a9a0c97c9","observation_id":"83612874-f71e-43c7-9cd0-1cb2b5c6d125","resolution":{"observed_at":"2026-05-20T10:23:12.310429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"565a4449-e198-49be-ad2f-e6a101955f7d","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:70abbd4dee21eea836e15858b25541a44bc87d7acbd29a6ff19c862ca271577b","observation_id":"58f560d1-2eab-4fe6-bb87-4b2c4ffd9ba4","resolution":{"observed_at":"2026-05-20T10:23:26.451734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":"28438d76-4a1f-462c-bab6-09d6ef105adb","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3ef8c48a99857c16005ed05bae17c3c1f432c12554451cb390443bea2ed3592d","observation_id":"c3241354-9dcd-4cb9-81f6-bfd51bc4c788","resolution":{"observed_at":"2026-05-20T10:23:26.437261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint=","venue":null,"work_id":"58777de1-bcab-41ed-ba77-c02a44a63544","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:e865d8cc31750ce1616e643093e651174af46bf6617b4176272273508bd4fe64","observation_id":"62af2491-9e3f-4975-8a7a-ab3780282637","resolution":{"observed_at":"2026-05-20T10:23:26.444321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":"b3a7bd0b-6b1b-46a9-b321-022d7adf6f3c","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3912a31fc9a3fa34440017f93307415d8f4590a674e25ae7c2c96eb7f5150c7d","observation_id":"31bea0db-a6ee-4716-8b81-a6b91ef6f6bd","resolution":{"observed_at":"2026-05-20T10:23:26.435256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"0ec15794-d970-4902-859f-5f62d268415c","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3b9da9935bae15afd7c19e6583409435c24a1cbc8b6974990642de43cb70879f","observation_id":"aeeb9844-7185-43fb-b4b5-24c50cd4e172","resolution":{"observed_at":"2026-05-20T10:23:26.442533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21659","last_updated":"2024-10-17T03:49:20Z","snapshot_observed_at":"2026-07-06T18:55:07.177656Z","submitted_at":"2024-07-31T15:02:46Z","title":"Cross-modality Information Check for Detecting Jailbreaking in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2407.21659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.21659","snapshot_observed_at":"2026-07-02T17:37:14.851300Z","title":"arXiv preprint arXiv:2407.21659 , year=","venue":null,"work_id":"9761ef96-41c3-4de8-a7ad-58be4e11ed98","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2407.21659","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:32086216035e3ac68d4063e11eab331b87c7fa4b9a8f2b2e9db0b1d27db171a8","observation_id":"74047749-9f99-49f8-8f4e-14b8bd379560","resolution":{"observed_at":"2026-05-20T10:23:12.301594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"511e62c6-e3db-45c5-bbb8-2de95e057dee","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:590e721c46ee5c3382c97ce0db795973bb9641bbbd80e70210d488ef02979e91","observation_id":"ba7d8269-1b89-4eed-a1cd-3046e7b1f719","resolution":{"observed_at":"2026-05-20T10:23:26.446538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10414","last_updated":"2024-11-15T18:34:07Z","snapshot_observed_at":"2026-07-06T19:51:05.604758Z","submitted_at":"2024-11-15T18:34:07Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","version":1},"cited_work":{"arxiv_id":"2411.10414","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.10414","snapshot_observed_at":"2026-07-05T10:30:59.155257Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","venue":"cs.CV","work_id":"de29c7ee-383e-4c28-89ea-de06000701c4","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2411.10414","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:c4c8bc9f6ced6d99a2468f9d54efdd234d0f9c1fdea90b5f34ecd1b8e7d717e3","observation_id":"6b7f2b4c-9b57-4904-94dd-a40f890aade3","resolution":{"observed_at":"2026-05-20T10:23:12.307541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , title =","venue":null,"work_id":"8fcb16a9-7d8b-4b81-bfdf-12862c7a4beb","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3e7f9900d47721f11011ee54ee6a2089a1a06484b18b199f8a2fe1856c8eafab","observation_id":"ef3c8ebb-ef83-4c58-b83e-1c68aab78042","resolution":{"observed_at":"2026-05-20T10:23:26.450101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICLR 2025 Workshop on Building Trust in Language Models and Applications , year=","venue":null,"work_id":"85b83e90-dfb3-4320-ae3c-46cdde009525","year":2025},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:b98ffef46d0cc909f93cdec4483a1ff758557f48bc22c0d57ba2e104d141c0e2","observation_id":"f87a275c-6094-44fc-8311-e358333ca8c8","resolution":{"observed_at":"2026-05-20T10:23:26.455529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NeurIPS 2024 Competition Track , year=","venue":null,"work_id":"70b44e7a-55b2-4f0c-af17-99d7fe4a829e","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:368b1ebac3ca79a9f4bc61bef818bea511c9197a6a376455d5431e669ef7eddd","observation_id":"5f17f2ca-6e54-4d39-a36a-65c712a641c4","resolution":{"observed_at":"2026-05-20T10:23:26.431023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":"2310.03693","doi":"10.48550/arxiv.2310.03693","metadata_source":"pith","pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","venue":"cs.CL","work_id":"8b07137a-7175-4dd1-a8d9-570493d3f404","year":2023},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:41443381ed416181af1108405bef5aae8f23658a80deca3c00b55161d3a4765d","observation_id":"25a0cf93-1aaa-4371-8f00-38b4c56b6602","resolution":{"observed_at":"2026-05-20T10:23:12.289767Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.700327Z","title":"2024 , eprint=","venue":null,"work_id":"94860f33-c1e9-46de-b7ef-cdfde74468a5","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:83d4b23b66c1628828f57b084580f2697c9f9053b81d62050874f95ae11668c6","observation_id":"81e2419d-e454-4b14-ab8e-973c3f3c8c01","resolution":{"observed_at":"2026-05-20T10:23:26.440673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"d7681cb7-72eb-448d-a442-b028d2db906a","year":null},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:6a0155dfe601dcfde6d7fadd2c0f0bbb385961dc2a3c3786ab45c35c11ee6263","observation_id":"15d80182-900f-4972-b9d4-6e8afbc0906b","resolution":{"observed_at":"2026-05-20T10:23:26.438966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":1,"unresolved":3,"verified_exact":6,"verified_fuzzy":33},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2605.18915."}