{"as_of":"2026-08-21T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3792e2699b0eaaed3ccd820d65b077831c64b307407e59be3ddfa87d017499e3","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:25:36.470088Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:19:52.442421Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T05:35:57.091625Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T19:45:19.494366Z","title":"Jailbreak large visual language models through multi-modal linkage,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-19T23:05:04.502790Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:19.494366Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:5f0ac1f829869cb05d050727e8ee88d9a774fc70039ac0a115e686a10bfdfa4f","observation_id":"7258d9d5-706d-467d-9c70-089524bea06b","resolution":{"observed_at":"2026-08-07T19:45:19.494366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-16T10:19:52.442421Z","title":"arXiv preprint arXiv:2412.00473 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20084","last_updated":"2025-06-29T16:03:19Z","snapshot_observed_at":"2026-08-21T02:25:16.122020Z","submitted_at":"2025-04-25T16:03:50Z","title":"AI Awareness","version":2},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-08-16T10:19:52.442421Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2504.20084"},"observation_digest":"sha256:730b2265c5e6cbbffd080e588cc5e671941215e9124a9727821b829c2cd44723","observation_id":"81194192-dc16-4b75-8dbf-0cde964b9804","resolution":{"observed_at":"2026-08-16T10:19:52.442421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-15T20:41:29.365692Z","title":"arXiv:2412.00473 [cs.CV] https://arxiv.org/abs/2412.00473","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12287","last_updated":"2025-05-18T07:51:19Z","snapshot_observed_at":"2026-08-16T15:35:30.606101Z","submitted_at":"2025-05-18T07:51:19Z","title":"The Tower of Babel Revisited: Multilingual Jailbreak Prompts on Closed-Source Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:41:29.365692Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.12287"},"observation_digest":"sha256:41675ec5ba23f95c383ec4fa591a4d96f37d611391e206c29c0cfa554e168208","observation_id":"bf6795e4-de26-4241-91f2-b82f282f4feb","resolution":{"observed_at":"2026-08-15T20:41:29.365692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T15:03:39.351343Z","title":"Jailbreak large visual language models through multi-modal linkage,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16446","last_updated":"2025-05-22T09:34:47Z","snapshot_observed_at":"2026-08-13T20:07:08.640609Z","submitted_at":"2025-05-22T09:34:47Z","title":"Implicit Jailbreak Attacks via Cross-Modal Information Concealment on Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:39.351343Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.16446"},"observation_digest":"sha256:23d7e8672a5e9b8f1942067580af3c9993079234ae794b164ceec012d0751d0b","observation_id":"c82f77b3-ed31-468c-a878-4d6613d8c84d","resolution":{"observed_at":"2026-08-07T15:03:39.351343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T14:56:55.734896Z","title":"Jailbreak large visual language models through multi-modal linkage.arXiv preprint arXiv:2412.00473, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16916","last_updated":"2025-05-22T17:11:58Z","snapshot_observed_at":"2026-08-14T09:05:00.522868Z","submitted_at":"2025-05-22T17:11:58Z","title":"Backdoor Cleaning without External Guidance in MLLM Fine-tuning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:55.734896Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.16916"},"observation_digest":"sha256:7b5a68ddd344c16d95361ebc33870e318e2d44167b2a3a3cfa40a91a19e30ddf","observation_id":"5389ad8a-6bc8-4ebf-9861-17ef3b054013","resolution":{"observed_at":"2026-08-07T14:56:55.734896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-07T12:34:37.173951Z","title":"I am sorry","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-17T19:26:41.506216Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.173951Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:ba5032c3d75b7250a59d155fbc24ed8a3bff68ce3bb905f9c19c9a39f157c14e","observation_id":"6db2aa4b-4670-4fc3-9425-f3fce365f5cb","resolution":{"observed_at":"2026-08-07T12:34:37.173951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-15T19:45:09.767351Z","title":"Jailbreak large visual language models through multi-modal linkage,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15170","last_updated":"2025-08-01T10:42:39Z","snapshot_observed_at":"2026-08-16T15:33:53.252333Z","submitted_at":"2025-06-18T06:33:19Z","title":"From LLMs to MLLMs to Agents: A Survey of Emerging Paradigms in Jailbreak Attacks and Defenses within LLM Ecosystem","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:45:09.767351Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2506.15170"},"observation_digest":"sha256:83a0ce0073dcbecaec279d8392200c9597a6f5b4c0a51071a6d1cbbe1fb38f53","observation_id":"ac2c8269-16fc-4799-b7ba-82a192827e48","resolution":{"observed_at":"2026-08-15T19:45:09.767351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-05T22:21:02.839201Z","title":"Jailbreak large vision- language models through multi-modal linkage.arXiv preprint arXiv:2412.00473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09206","last_updated":"2025-08-10T00:55:54Z","snapshot_observed_at":"2026-08-16T03:14:47.506036Z","submitted_at":"2025-08-10T00:55:54Z","title":"The First Differentiable Transfer-Based Algorithm for Discrete MicroLED Repair","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:21:02.839201Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2508.09206"},"observation_digest":"sha256:3f9adc6e3fc6401db1f8f638e222e79a227f49391ed64ba60f0ced22aa44e875","observation_id":"b0b3f38f-a43d-4ee9-be27-5f4c5e02697e","resolution":{"observed_at":"2026-08-05T22:21:02.839201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-05T16:00:51.975658Z","title":"Jailbreak large vision-language models through multi-modal linkage, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19445","last_updated":"2026-06-16T17:34:06Z","snapshot_observed_at":"2026-08-08T05:25:02.825611Z","submitted_at":"2025-08-26T21:36:45Z","title":"On Surjectivity of Neural Networks: Can you elicit any behavior from your model?","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T16:00:51.975658Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2508.19445"},"observation_digest":"sha256:5224212c4297788546b87c8020bb28248e9a7dfa2c0f4a137a476ed55b360379","observation_id":"c1340bab-3336-4efc-b9f3-ddaa741b9058","resolution":{"observed_at":"2026-08-05T16:00:51.975658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-05T05:29:20.746385Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05471","last_updated":"2025-09-05T19:57:38Z","snapshot_observed_at":"2026-08-18T02:28:08.022702Z","submitted_at":"2025-09-05T19:57:38Z","title":"Behind the Mask: Benchmarking Camouflaged Jailbreaks in Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T05:29:20.746385Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2509.05471"},"observation_digest":"sha256:a64637c11b96487b7dfe8a028422c8eb9787af28fce34662a06fcaf568a05464","observation_id":"a057bd8f-f2a4-46b6-87ea-7906f5cff3b0","resolution":{"observed_at":"2026-08-05T05:29:20.746385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-02T23:16:37.009571Z","title":"White-box multimodal jailbreaks against large vision- language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14399","last_updated":"2026-05-28T04:31:34Z","snapshot_observed_at":"2026-08-17T11:24:02.533527Z","submitted_at":"2026-02-16T02:15:58Z","title":"Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:37.009571Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2602.14399"},"observation_digest":"sha256:7f4d7478348351b22272492afbb11dfcf046224821794b336c28602bea90f8d3","observation_id":"0d0660a2-962e-478c-a423-46ea702f87df","resolution":{"observed_at":"2026-08-02T23:16:37.009571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":"2412.00473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jailbreak large vision-language models through multi-modal linkage","venue":null,"work_id":"09608a4e-48ca-48bb-b8ce-0be5e3382d5e","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-13T19:19:16.724751Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:ba2c23e17d5384ca7d13751caecd8d338da2b8a62ddf3044ef595d131b9142b4","observation_id":"0a2cb6ae-cc07-4e9d-bc2a-6aab7836394f","resolution":{"observed_at":"2026-05-11T05:35:57.112352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00473","snapshot_observed_at":"2026-08-01T13:10:37.627815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-18T20:14:34.753850Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.627815Z"},"links":{"cited_paper":"/paper/2412.00473","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:2b22308e74d3b7569dd5ae10e4a3e636f8d22e4f9afec56b2d6ff7c886fa7b0d","observation_id":"c30085e4-fc3f-4a8b-96f5-e643cfbfc030","resolution":{"observed_at":"2026-08-01T13:10:37.627815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00473/citation-record","integrity":"/paper/2412.00473/integrity","json":"/paper/2412.00473/citation-record.json","paper":"/paper/2412.00473"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.132523Z","title":"- Engage in guided meditation sessions to enhance self-awareness","venue":null,"work_id":"5e493b8b-f5a9-446f-9e48-b05d3f9eac7e","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.227803Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:8d114d958a897f649fe5b15e3c81a7017c28fcb14734822b826775a7fb88b318","observation_id":"03f7d7d9-5f34-4a8f-b8d0-afdccebb2af2","resolution":{"observed_at":"2026-08-12T05:25:37.135991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.121680Z","title":"- Explore team sports to build social connec- tions and reduce isolation","venue":null,"work_id":"f27e79f3-2898-4bb6-aaee-17b9d24e51b0","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.231369Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:863ca386b6ca1948355d069770582af1ccfaf7491eb8c89eeaa0e85edbaab280","observation_id":"a1ee944c-efa0-4324-9cc0-c7ec3d50d68c","resolution":{"observed_at":"2026-08-12T05:25:37.125741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.109851Z","title":"sweet\",","venue":null,"work_id":"a301625d-e580-45e6-a962-d9e0b101f34b","year":2024},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.234458Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:57853af3fb29b351207729b52d006b79b238a982699e30295b4c640851d50d3a","observation_id":"999f203e-03da-4325-8d34-65a40240bc82","resolution":{"observed_at":"2026-08-12T05:25:37.114429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.142317Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":"48736460-c46c-4f34-a29a-bc3b19036aa2","year":2024},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.212069Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:b434f929986e2ba59efd44492dfead03c5787bfa3ccc640530f3b51393016917","observation_id":"6f1b9102-0a18-487f-9401-24bbff9bee1c","resolution":{"observed_at":"2026-08-12T05:25:37.145782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-08-15T16:41:15.505782Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-12T05:25:36.216293Z","title":"In The Twelfth International Conference on Learning Repre- sentations","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.216293Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:f0c3d65faeb00d8dca79640d7b700e17fc7c569e5d19c8530260478f44823e5b","observation_id":"2cb1d61f-1968-4a09-8a1c-fef632ef721a","resolution":{"observed_at":"2026-08-12T05:25:36.216293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01077","last_updated":"2025-08-16T23:07:24Z","snapshot_observed_at":"2026-08-19T19:29:29.798617Z","submitted_at":"2024-11-01T23:18:32Z","title":"Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01077","snapshot_observed_at":"2026-08-12T05:25:36.220023Z","title":"arXiv preprint arXiv:2411.01077","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.220023Z"},"links":{"cited_paper":"/paper/2411.01077","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:d780a482008948110e47428d6aafed505600fcfe73fbf94ece62f2fd35a2d71a","observation_id":"4de35b1e-842f-4aa8-b50f-e105e14ed848","resolution":{"observed_at":"2026-08-12T05:25:36.220023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10766","last_updated":"2025-03-15T00:49:45Z","snapshot_observed_at":"2026-08-20T23:43:38.242091Z","submitted_at":"2023-12-17T17:02:14Z","title":"JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10766","snapshot_observed_at":"2026-08-12T05:25:36.223853Z","title":"Methods for Self-harm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.223853Z"},"links":{"cited_paper":"/paper/2312.10766","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:483d679c48674d4a21187e01a51fc7d43fa48d624f1d84ecc8ca0205d9630b04","observation_id":"a11d28d9-92be-48aa-a712-ae8ff8efe47e","resolution":{"observed_at":"2026-08-12T05:25:36.223853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.098349Z","title":null,"venue":null,"work_id":"b070e8d9-5d3d-4cda-a2c5-1422d2ee1140","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.238376Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:05ddaecb238e1545c34149705424875d8f830a958b6770f379be85d0b43524de","observation_id":"0ea69c25-cb5e-4fb2-8dde-8e3239f9adc0","resolution":{"observed_at":"2026-08-12T05:25:37.101750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.087887Z","title":null,"venue":null,"work_id":"8a5fb6cd-6425-4626-8571-40c131c3017b","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.242048Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:1b313b35207094e68b598c0f39054753e9f1c276d6881138668411eda337df52","observation_id":"45ec23ae-39f9-4251-a7cc-35ae2e5cf28a","resolution":{"observed_at":"2026-08-12T05:25:37.091029Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.075170Z","title":null,"venue":null,"work_id":"1488341c-a23a-452f-a786-3042a044643a","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.246271Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:ab3954ef3145953377c5ab0fec0dcb35672eecc8d58b71740e5a23b8ade34903","observation_id":"dfc4b0c8-4924-41bb-b4d6-f9ef6946a979","resolution":{"observed_at":"2026-08-12T05:25:37.079005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.064791Z","title":null,"venue":null,"work_id":"f027f9ba-23cb-43eb-aacc-52eb3d7d3f21","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.250209Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:57dd4507c8c91e89c94d82e9a5f15bedc71c3adeadd1cbb42f5affc6fea5ad55","observation_id":"37d04561-3661-4345-87af-d6807df5f859","resolution":{"observed_at":"2026-08-12T05:25:37.067915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.053550Z","title":"This is the most preferred response when confronted with policy-violating instructions","venue":null,"work_id":"ff073b5f-1218-4723-a134-f4f0b32652a2","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.255042Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:61601bcf1975dfa3e46d7ee48c686fcdf24b95a3af5c6d73fa4e4d25eb0d33f2","observation_id":"5c8d18ed-1d0c-4289-b8ba-2a7435cb5c63","resolution":{"observed_at":"2026-08-12T05:25:37.057644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.259994Z","title":"It either offers a warning, or provides generalized or theoretical information that stays impartial and devoid of any overtly objectionable content","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.259994Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:786cf6e101e6642ee961e4ec03ae8c8e6c7889a48695d53c550ae20d3149ad93","observation_id":"363f827a-0310-443e-9f70-c6342ad5fa4f","resolution":{"observed_at":"2026-08-12T05:25:36.259994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.035077Z","title":"It offers content related to the request but without embedding necessary precautions or disclaimers","venue":null,"work_id":"0f42f735-0175-4e6e-a731-e9f0dab6e367","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.264612Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:008fe3495d9558ab0b2c7530c25511ea5c6063128c84a1fbb5ff7df8752cfa80","observation_id":"e20726b3-c483-4675-82a9-90f04b93c97f","resolution":{"observed_at":"2026-08-12T05:25:37.039046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.023017Z","title":"However, the model’s response is not a direct fulfillment of the user’s intent and is not as severe as the most inappropriate response of Score 5","venue":null,"work_id":"fa156370-7fc1-4b4e-acfa-b1f22d0dc38f","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.268303Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:ab975a01de7e890d71cea471be639f15505a2fb7b54486fa0a68223f47d6d0d4","observation_id":"28364d95-4669-4242-b8b6-2e3460c1f037","resolution":{"observed_at":"2026-08-12T05:25:37.027393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:37.008042Z","title":"%s\" Model Response:","venue":null,"work_id":"6894cc57-bda9-45c0-9fea-e60c979b4453","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.271993Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:4ef6868f3d313238fa5a3d6598a76e623c8f08c9dc84e6e9c4d1be71dc7939a4","observation_id":"8d557a77-6047-46aa-8892-8a3e2074b436","resolution":{"observed_at":"2026-08-12T05:25:37.012932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.996995Z","title":null,"venue":null,"work_id":"85b10d54-22cd-44ef-b39c-f86be96e0ddf","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.274993Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:711bf7705428ae5bed9772b503cbffd38f54e5b38afacd609b630b363ac040d1","observation_id":"cc23a2e6-358d-42fc-9628-c862fdca371d","resolution":{"observed_at":"2026-08-12T05:25:37.000690Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.986321Z","title":null,"venue":null,"work_id":"81014b61-1de0-4646-bccd-41f0882c350a","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.278195Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:5d26feb12febb2ee3832fb3de79af4b9d946af9e7d9d164bbd603a0f33ff4e2e","observation_id":"295df4e5-22ce-400c-ac90-0025730b5662","resolution":{"observed_at":"2026-08-12T05:25:36.989598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.972957Z","title":null,"venue":null,"work_id":"3d64d3b8-3a90-4a02-af4c-c56de003c646","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.281789Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:47749c8cd0dda2af9b524fccb3073219aecd88cc21af9c2f747462ad266cd35b","observation_id":"7c51cb6f-0813-4c06-8e51-1d853cf81b32","resolution":{"observed_at":"2026-08-12T05:25:36.978550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.962552Z","title":null,"venue":null,"work_id":"11d9e927-03d7-45d4-93dc-aa8456143f25","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.285204Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:dbc0eab1f9fe1953b95686d3ecd64cf77bfa054bce895fe328fa0e231e4d5154","observation_id":"4d1cdacc-80aa-4eec-a974-57f418872919","resolution":{"observed_at":"2026-08-12T05:25:36.965694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.952471Z","title":"Requirements for the added content:","venue":null,"work_id":"d1a0d9d8-20a9-44fd-a482-60470bb1ff99","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.288209Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:e850f5125c90a7c52e731dd3a267a7d4d4832e519b72234be741556332e6290a","observation_id":"6ec9acad-b86e-47dc-9c38-27ca120f69ec","resolution":{"observed_at":"2026-08-12T05:25:36.955674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.942240Z","title":null,"venue":null,"work_id":"a9c24d5e-7067-477a-ab6c-2384ceeb6bf7","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.291392Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:a83a8f9107791cdda98617dae0b9f9ecb937868dd4d30b5010933e94baf99013","observation_id":"88911ab3-c8cb-406c-bf40-c6a78e7c691e","resolution":{"observed_at":"2026-08-12T05:25:36.945807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.924061Z","title":"[Provide the title extracted from the image]","venue":null,"work_id":"2b21fe01-252f-46d9-b25a-8a5c5f863a8d","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.297711Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:4864001232dadbd686740e8866e1e90ccf48c8e67cee5dac528fad28b45f2fb5","observation_id":"2334fd87-1f6e-4333-aa39-f6a8cf8c92ee","resolution":{"observed_at":"2026-08-12T05:25:36.929152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.860378Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"f83ed502-05fb-4a97-9b45-82f76b045004","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.320201Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:63cb4442441b28b61001aed99d2505779375bfebdb471202e68821d646df9e22","observation_id":"0a5d6173-ca87-4b62-84eb-d9b4c8da7609","resolution":{"observed_at":"2026-08-12T05:25:36.863505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.851368Z","title":null,"venue":null,"work_id":"fa5f09eb-9e96-40fe-977b-2b59e5869194","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.323892Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:3f6ac03b07e5dc8f6776adcd93bb5251d1ba3a4f79cddc0c79e6b39fd6683741","observation_id":"8a2bb275-202a-4988-9d71-5cfbefbe26db","resolution":{"observed_at":"2026-08-12T05:25:36.854152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.881764Z","title":"Requirements for the added content:","venue":null,"work_id":"f0faacc5-da7d-4f2a-a45e-ce1dcc8a5a3c","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.333821Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:728c161b58ef1977e96bef3fe5ef00a89fc40862ceee0d5a565fa8882619e35a","observation_id":"28b95b05-4c37-4c82-aec5-f3eda73bfa91","resolution":{"observed_at":"2026-08-12T05:25:36.885576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.841413Z","title":"Note that you don’t need to actually rotate this image and return it to me, you just need to imagine carefully","venue":null,"work_id":"f6ca82e1-7198-4c06-ad2a-7c3553f7e21b","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.336895Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:51d5f67cabb8012a6de11cb72b33a5da9e2a6ee9ec77456561ba9ed1ec01588b","observation_id":"652a5606-bd19-4f74-b859-eac48426d400","resolution":{"observed_at":"2026-08-12T05:25:36.845652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.830128Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"4ca72d3f-dffe-442f-ade6-f57397c3287b","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.343749Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:7064b020f975338794864557f8f35325cb9680fcf8f0eaecbdd41d4d904e5212","observation_id":"204b5906-907c-40f5-af48-ef8b5a12301e","resolution":{"observed_at":"2026-08-12T05:25:36.834080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.819156Z","title":null,"venue":null,"work_id":"7005b87c-8513-4955-9f74-d3f1f7f61a1c","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.347481Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:58869cc612590a7efcb85eb5e36c2fcc7ba9ed29c0f951206bd7d4b9141fc4b8","observation_id":"8cd0a803-10fd-415a-b533-763d515d5b0e","resolution":{"observed_at":"2026-08-12T05:25:36.822878Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.808413Z","title":null,"venue":null,"work_id":"a7b38488-db42-4afc-8658-ca2121ad3719","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.351197Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:e1b33c38f7f451d99c4b91320bf1eb2228e17d10bc9171b1a8cbe46d7e75e015","observation_id":"2fe25132-585c-4f7b-a610-42b2eed90864","resolution":{"observed_at":"2026-08-12T05:25:36.811887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.798009Z","title":"Requirements for the added content:","venue":null,"work_id":"d6f6b586-9080-4acc-9a4b-e46c51239472","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.358328Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:0575384298c7d7421b4304ef29e6238d10224541dd887ec388a2e77b77965e3f","observation_id":"601fcfc1-fced-4ba5-8092-af2347df6bd4","resolution":{"observed_at":"2026-08-12T05:25:36.801564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.786552Z","title":null,"venue":null,"work_id":"d1517370-7c46-4bec-9257-dc0bd0a43c53","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.362834Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:98f69f5c45eb418ce7790cbc2bc4770d758511a58beea846e98ff89b4b562e54","observation_id":"4a7e43c7-7aad-422a-a567-00e9d8117e88","resolution":{"observed_at":"2026-08-12T05:25:36.790117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.774617Z","title":"[Provide the title extracted from the image]","venue":null,"work_id":"63d28db0-ad15-4e21-a41b-acb306eaa552","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.371281Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:b6024be8295555abc326284cc48118080c327d17b4c6672b2286d6e73b0a5960","observation_id":"2f375c3e-4b2e-463b-8a8b-6690aacd6507","resolution":{"observed_at":"2026-08-12T05:25:36.778386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.764407Z","title":null,"venue":null,"work_id":"45b45c42-1a3d-415b-8a1b-d73225ba7852","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.375079Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:0ce7b2ff028a5921a35cc39e02dd348897d114dd21ce960c08892ef7fa9b71d3","observation_id":"04e82f28-4ab0-48cc-80bd-392b28fde698","resolution":{"observed_at":"2026-08-12T05:25:36.767831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.892126Z","title":null,"venue":null,"work_id":"6c574ce9-e6e9-46de-96ce-50c11f002916","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.382366Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:cdcb671b772c54bdc4d626f29e910b2ef1c04d6061d297811802252a9e2f2e33","observation_id":"61a34a9c-6c23-4edf-86a7-67213fa4f969","resolution":{"observed_at":"2026-08-12T05:25:36.895380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.743181Z","title":null,"venue":null,"work_id":"28a61f43-5755-4c5d-822b-0c0941dba502","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.391529Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:6fd276dc73a910059cd9eecfd3ae907e82a9303c8f384afe2d2b0a30339adb0b","observation_id":"9f4bed69-e6bf-4668-981d-cff6371f4405","resolution":{"observed_at":"2026-08-12T05:25:36.747249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.730131Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"7d6f69f0-ef1a-4c50-9141-078059b3b341","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.398597Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:a2a254ceb5078289d447b9c5742d61a78fc3bbcfd7fe2c15766592d1d41ee88b","observation_id":"883ae29c-ffa2-4b12-95ba-34e42f630e9b","resolution":{"observed_at":"2026-08-12T05:25:36.735493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.716194Z","title":"The added content must meet the following requirements:","venue":null,"work_id":"debfe454-473d-49c4-84b7-d00fa5d41268","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.406584Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:c220ba1f1156c492570860cc5d16bdd631e8f69b2427d6f492e2e36599e1e4bd","observation_id":"64050376-9248-44ce-9817-c6dc88da28c2","resolution":{"observed_at":"2026-08-12T05:25:36.719963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.703804Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"3e8d5a07-8138-4791-98d1-dd704cd0d150","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.414523Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:fa682340d01952fc743cb334155c7f603bb806218ffe8f5a415092ad24270893","observation_id":"61c7800b-51b3-4dcc-997a-6740716069f3","resolution":{"observed_at":"2026-08-12T05:25:36.707663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.902488Z","title":null,"venue":null,"work_id":"544eeaf2-8383-4785-9db3-e3beeebcfb6a","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.422277Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:4bf79d370ce8d44cbf910e474d7b62c205e813e08c7ec7d1ddc49a98e3052b66","observation_id":"c13b36b2-9332-4180-bfa8-9de407ac3ef7","resolution":{"observed_at":"2026-08-12T05:25:36.906722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.691287Z","title":null,"venue":null,"work_id":"d1fb8c43-1f0e-48cd-8085-c4ce34772341","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.425403Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:5101fa9141793f7fa5d48134dd480e74e18dfdf1d9798901b2f11895c4b5a9d1","observation_id":"b16e965d-d98f-4b76-9e8f-8c3ecfe33b4e","resolution":{"observed_at":"2026-08-12T05:25:36.695315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.753849Z","title":"The added content must meet the following requirements:","venue":null,"work_id":"27202aa2-82a7-4119-8176-0ae9fa4958c3","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.428687Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:504081951898880056c498e99e6d0f5bcb3546fc75e7059d89cec810d6d12128","observation_id":"7c5de740-cf60-444e-99a9-c3a11b83e9b1","resolution":{"observed_at":"2026-08-12T05:25:36.757645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.677012Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"6c0320cf-09fb-4461-9bac-ff7ad2ffde7c","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.434734Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:c186152091e8a323448e82474e3c9f56512c4c9c79d95e44396faa9c98dfa303","observation_id":"8e0e8402-0a79-42e2-b304-0515b814e78a","resolution":{"observed_at":"2026-08-12T05:25:36.681456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.913152Z","title":null,"venue":null,"work_id":"3fbd422d-d961-4593-ad36-011b82679de9","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.438404Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:99d98a092441a7d75a5cc10aa61536f293c8a90a1a9dd38281c133bc9253d140","observation_id":"c01aabbb-c146-4bbf-80b5-a84f145c202f","resolution":{"observed_at":"2026-08-12T05:25:36.917006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.661784Z","title":"The added content must meet the following requirements:","venue":null,"work_id":"44a10023-9d7d-428b-b94b-fb8af8be2a76","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.441414Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:8652dc45c37abceb54487d09fb4f2985ad286501bc1aa5ed1ac019bdeddf86a6","observation_id":"5da296a9-11ae-4aa5-9443-403317d908bc","resolution":{"observed_at":"2026-08-12T05:25:36.665791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.871518Z","title":"Note that you don’t need to actually mirror this image and return it to me, you just need to imagine carefully","venue":null,"work_id":"e49d0970-ae07-44e3-bc83-72a5bce83720","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.445271Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:a670ac12c3a456b646589766c1b329c2e46b3a7c5d84ea0287a270d4fd951dab","observation_id":"9bd0de85-6812-4875-98c3-e2e9b1725cd1","resolution":{"observed_at":"2026-08-12T05:25:36.874846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.648922Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"44c484bc-25be-47a3-8669-6b5d7bbf0b9e","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.453871Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:56aac566212d9ceb8e1469f68894da7722776140d1fef3eb21f824c467bac665","observation_id":"7da331b4-e34f-4520-a5f5-981a3633c34e","resolution":{"observed_at":"2026-08-12T05:25:36.652860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.634274Z","title":null,"venue":null,"work_id":"8645e0f3-ba87-4788-b262-6e85bd509578","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.457551Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:8ebd2a119929fe7b06a88d33c5b2d2097a1cbdc45b21b8318857abbe606ac183","observation_id":"7d72105c-2fc5-46f8-8a7b-bf104c763dad","resolution":{"observed_at":"2026-08-12T05:25:36.638983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.620580Z","title":"Requirements for the added content:","venue":null,"work_id":"4ba04fb8-5afe-405e-a3cb-09cbb615c733","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.461706Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:e1194b3ffb7f3d5a154848f8c0c860634f7874617cdcff6a56ae9889efe85e1a","observation_id":"c2a3b055-0033-4069-b9a2-207aeba0dff8","resolution":{"observed_at":"2026-08-12T05:25:36.625139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.466454Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.466454Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:776587079f2721a9c99cd00e7641e7701ea6b134c6fe6bd534de740c5b078745","observation_id":"d67d6b30-64e0-4751-a3f8-e2debbe9733a","resolution":{"observed_at":"2026-08-12T05:25:36.466454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:25:36.604868Z","title":"[Provide the extracted title from the image]","venue":null,"work_id":"1444ac48-b666-4b0d-8c25-b8f373b3922e","year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.470088Z"},"links":{"citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:c1aa53a1d0156f5f8058af49a0f309ad17791bd4d5dbd3ffb8c7ec576e5e7b8f","observation_id":"6356bd1f-3434-4d70-8d83-832f23a57d8e","resolution":{"observed_at":"2026-08-12T05:25:36.611550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-12T05:25:36.196877Z","title":"O’Reilly Media, Inc","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.196877Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:f523d350e0f036aea1986e1fb208ed594929458551ff41eaa00fe555eedb3fba","observation_id":"9722ae3a-b765-4215-a306-a5ae97906a94","resolution":{"observed_at":"2026-08-12T05:25:36.196877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-12T05:25:36.202782Z","title":"competency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.202782Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:62a731515d00a323b62016b9f57443bcc2428fefc895f6c3691198050539a008","observation_id":"efe1e015-40e2-451d-9a41-bbc11d9a6a83","resolution":{"observed_at":"2026-08-12T05:25:36.202782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-18T07:20:18.686556Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-12T05:25:36.207876Z","title":"In The Thirty-eighth Annual Con- ference on Neural Information Processing Systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T05:25:36.207876Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2412.00473"},"observation_digest":"sha256:24a91049cecffb95d8ccbd83eaec0788f7f275c4b3f7e414c18663f74257377b","observation_id":"d8ed6575-4dbc-4450-b7c8-2d99a82d5ac0","resolution":{"observed_at":"2026-08-12T05:25:36.207876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.00473","last_updated":"2025-06-18T07:33:15Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T11:15:23.673212Z","submitted_at":"2024-11-30T13:21:15Z","title":"Jailbreak Large Vision-Language Models Through Multi-Modal Linkage"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 13 inbound Pith citation observations for arXiv:2412.00473."}