{"as_of":"2026-08-10T18:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b28cab47209c664c568cf09b3da8d646ae6c2323edb8d8aaa4cdb23091dc5fb7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:05:52.354966Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:23:12.308774Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-09T18:05:52.354966Z","title":"Failures to find transferable image jailbreaks between vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00718","last_updated":"2025-07-10T14:44:44Z","snapshot_observed_at":"2026-08-09T21:15:27.675893Z","submitted_at":"2025-02-02T08:36:23Z","title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T18:05:52.354966Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2502.00718"},"observation_digest":"sha256:e46534c6de3c151261f8c55c5a2ae4e2a89c740ffc5bfef832d82b4b1128ffac","observation_id":"36d4c59f-dd61-4521-8fdc-2b4ebb0ac5d1","resolution":{"observed_at":"2026-08-09T18:05:52.354966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-04T13:45:27.114819Z","title":"Failures to find transferable image jailbreaks between vision-language models.arXiv preprint arXiv:2407.15211,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25533","last_updated":"2026-07-06T05:00:34Z","snapshot_observed_at":"2026-08-10T11:14:27.448339Z","submitted_at":"2025-09-29T21:43:18Z","title":"VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:45:27.114819Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2509.25533"},"observation_digest":"sha256:e4baacf2d978eb2fb58c8f28878ca893ed30e21ba344e6b30ee8227e6607ff31","observation_id":"aef1dfde-7d44-4d8d-a5e6-2aa53e5b74fe","resolution":{"observed_at":"2026-08-04T13:45:27.114819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-03T10:32:33.775264Z","title":"Anish Athalye, Logan Engstrom, Andrew Ilyas, and Kevin Kwok","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.09923","last_updated":"2026-06-04T15:38:02Z","snapshot_observed_at":"2026-08-06T13:01:48.994450Z","submitted_at":"2026-01-14T23:06:35Z","title":"CaMeLs Can Use Computers Too: System-level Security for Computer Use Agents","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T10:32:33.775264Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2601.09923"},"observation_digest":"sha256:d06e94a04b5b1d1c752b85ccc35915cebdce67a8e52e673844d99b2c3cd6a477","observation_id":"5e034e08-a87c-4bfa-9ae4-9e05406b5b02","resolution":{"observed_at":"2026-08-03T10:32:33.775264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-02T21:46:44.291852Z","title":"Failures to find transferable image jailbreaks be- tween vision-language models.arXiv preprint arXiv:2407.15211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19149","last_updated":"2026-07-25T04:40:07Z","snapshot_observed_at":"2026-08-08T05:16:44.664773Z","submitted_at":"2026-02-22T12:30:01Z","title":"ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:44.291852Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2602.19149"},"observation_digest":"sha256:d85566cd9a7ae2805c2afaaf736cc3f5749b00f913d3079df2a0dbcb01ca8802","observation_id":"d2521e6b-1ba6-4f1f-aa2a-d80c49d14117","resolution":{"observed_at":"2026-08-02T21:46:44.291852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2407.15211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15211 , year=","venue":null,"work_id":"f3d9a128-d8fc-4003-ae18-c58c50864b31","year":2024},"citing_paper":{"arxiv_id":"2604.24082","last_updated":"2026-04-27T06:12:43Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T06:12:43Z","title":"Jailbreaking Frontier Foundation Models Through Intention Deception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T03:17:51.039062Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2604.24082"},"observation_digest":"sha256:5d0f2043c82dcd625c550f0ddb6835d352f2e97c4a2d9651185af5f8c9dbf134","observation_id":"336b7d83-3bbe-41cd-a29c-cbb19d39f070","resolution":{"observed_at":"2026-05-11T22:11:14.086224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2407.15211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15211 , year=","venue":null,"work_id":"f3d9a128-d8fc-4003-ae18-c58c50864b31","year":2024},"citing_paper":{"arxiv_id":"2605.04261","last_updated":"2026-05-05T19:55:28Z","snapshot_observed_at":"2026-07-06T23:17:04.200299Z","submitted_at":"2026-05-05T19:55:28Z","title":"Laundering AI Authority with Adversarial Examples","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T17:19:38.662062Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2605.04261"},"observation_digest":"sha256:8c970ac0e2f3e76bb3a57248858a38d287dfab078bfa7b2aa0a0ff47f39f1b14","observation_id":"058a5a55-4642-42a7-8bb9-cd86bff5fd8e","resolution":{"observed_at":"2026-05-11T17:41:08.037939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2407.15211","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.15211 , year=","venue":null,"work_id":"f3d9a128-d8fc-4003-ae18-c58c50864b31","year":2024},"citing_paper":{"arxiv_id":"2605.18915","last_updated":"2026-05-18T03:23:58Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-18T03:23:58Z","title":"DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-20T10:19:11.536555Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2605.18915"},"observation_digest":"sha256:3707b4f6a7990732cc31f7fd87614d0cdf8d1c164ff58f486d5a6df7aec1e708","observation_id":"83612874-f71e-43c7-9cd0-1cb2b5c6d125","resolution":{"observed_at":"2026-05-20T10:23:12.310429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-01T13:10:37.563253Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.563253Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:1c200365b938c6e532063f991caf44b9b897c3e0521a14c3330aff3236168909","observation_id":"fd1391b8-55b9-4688-8fef-69af2bb737e6","resolution":{"observed_at":"2026-08-01T13:10:37.563253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.15211/citation-record","integrity":"/paper/2407.15211/integrity","json":"/paper/2407.15211/citation-record.json","paper":"/paper/2407.15211"},"outbound":[],"paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T03:32:44.618631Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2407.15211."}