{"as_of":"2026-08-18T04:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7419f93f463e20dcc54fb33a6a0a749d848fd7e108d09ee0bfdfb3aab514c5d","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:36:01.163570Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:16:36.682289Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T22:11:14.069836Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04673","snapshot_observed_at":"2026-08-02T23:16:36.682289Z","title":"and Deshpande, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14399","last_updated":"2026-05-28T04:31:34Z","snapshot_observed_at":"2026-08-17T11:24:02.533527Z","submitted_at":"2026-02-16T02:15:58Z","title":"Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T23:16:36.682289Z"},"links":{"cited_paper":"/paper/2505.04673","citing_paper":"/paper/2602.14399"},"observation_digest":"sha256:7349eba65bd4780033f994e0ad173810249c9d7308c60668e126c2a3b4d90279","observation_id":"1173e618-490e-49e9-90bd-8aa57e633551","resolution":{"observed_at":"2026-08-02T23:16:36.682289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"cited_work":{"arxiv_id":"2505.04673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reveal: Multi- turn evaluation of image-input harms for vision llm","venue":null,"work_id":"7b837d53-7381-4067-9660-b5f40d493154","year":2025},"citing_paper":{"arxiv_id":"2604.24082","last_updated":"2026-04-27T06:12:43Z","snapshot_observed_at":"2026-08-14T05:15:12.069533Z","submitted_at":"2026-04-27T06:12:43Z","title":"Jailbreaking Frontier Foundation Models Through Intention Deception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:17:51.039062Z"},"links":{"cited_paper":"/paper/2505.04673","citing_paper":"/paper/2604.24082"},"observation_digest":"sha256:be5b5e40ea834b78484ba8b43530a035b18c2937b37b3834436658d8c11c7de8","observation_id":"44b637bf-86dd-49d5-ad06-3f37d12b7ea1","resolution":{"observed_at":"2026-05-11T22:11:14.077456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04673/citation-record","integrity":"/paper/2505.04673/integrity","json":"/paper/2505.04673/citation-record.json","paper":"/paper/2505.04673"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:00.936939Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.936939Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:1c83e9589b5224cf71fccd3c17e0c06575bf5b43e9d031ebe7561191faece858","observation_id":"2372d5ee-7081-44f0-8df0-f25d95aa2df6","resolution":{"observed_at":"2026-08-15T23:36:00.936939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10490","last_updated":"2023-10-03T17:03:10Z","snapshot_observed_at":"2026-08-16T15:14:51.324768Z","submitted_at":"2023-07-19T23:03:20Z","title":"Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10490","snapshot_observed_at":"2026-08-15T23:36:00.941054Z","title":"( A b) using images and sounds for indirect instruction injection in multi-modal LLM s","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.941054Z"},"links":{"cited_paper":"/paper/2307.10490","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5c61ac9e36ec0748c512693e57f15e08348604962cd3e353996403a88841d71a","observation_id":"48a516ca-e40e-497c-89ed-d4fa57b437c1","resolution":{"observed_at":"2026-08-15T23:36:00.941054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.902369Z","title":"Image H ijacks: Adversarial images can control generative models at runtime","venue":null,"work_id":"21ac8ac0-4a25-4842-aed3-1e35823a6d50","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.944987Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:e157a684788cf45ef5f762f2a007e4a716278103cac7c09f3ae0035948585f42","observation_id":"47a98ffb-9fb4-433b-a014-9e1c0adcd38e","resolution":{"observed_at":"2026-08-15T23:36:01.906104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.892310Z","title":"The dark side of language models: Exploring the potential of LLM s in multimedia disinformation generation and dissemination","venue":null,"work_id":"f1f09c9f-8a3e-45f1-b227-893960e3f77e","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.948624Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:7a5873836c124d900ccf58d26085feeea776904c53081eeb2dfae40f719b076f","observation_id":"5550279d-2f90-48d5-9708-77d1ac0536e8","resolution":{"observed_at":"2026-08-15T23:36:01.895796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.882420Z","title":"Easily accessible text-to-image generation amplifies demographic stereotypes at large scale","venue":null,"work_id":"eeec62fb-5894-4f8a-95ba-4303c2f64520","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.951788Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:65b9400ed5f8f5b7fda7f1980d7b5967ecc88aaba10419956de52cd8ba31567f","observation_id":"bdb41b61-e870-47a6-8159-099eb3e5142d","resolution":{"observed_at":"2026-08-15T23:36:01.885792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.872510Z","title":"Distilling adversarial prompts from safety benchmarks: Report for the A dversarial N ibbler C hallenge","venue":null,"work_id":"1b6010f7-1860-4e2f-8153-ae7d867bace7","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.955506Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:d31c7747bd511fbb2d996042647bc218d76aa1f8d16725949f5f1394b498b84a","observation_id":"87a81ea1-e6e3-4302-947d-adb633e63310","resolution":{"observed_at":"2026-08-15T23:36:01.875981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.862637Z","title":"Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems , 36, 2023","venue":null,"work_id":"e2c0b365-4138-41e4-abfa-3a2d1a954b0f","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.959238Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:e003640aaa305e6a187cd291ca4cc6496327dba54f216f2cf2e954878cc8b622","observation_id":"2c8229d2-d390-4361-8ffd-d3a3ebe5047b","resolution":{"observed_at":"2026-08-15T23:36:01.866330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.852357Z","title":"A survey on adversarial attacks and defences","venue":null,"work_id":"a5a5eb3e-a278-43bb-80b3-bcf707b0a4ea","year":2021},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.962648Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:6b9a50d0f6b986c6e128909540428ba5cfcee798defefbeca56fd8349c4d4911","observation_id":"b25722db-b863-4da2-85d8-4a4e2557be9a","resolution":{"observed_at":"2026-08-15T23:36:01.856119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03411","last_updated":"2024-12-15T20:50:51Z","snapshot_observed_at":"2026-08-16T14:03:39.515956Z","submitted_at":"2024-04-04T12:38:14Z","title":"Red Teaming GPT-4V: Are GPT-4V Safe Against Uni/Multi-Modal Jailbreak Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03411","snapshot_observed_at":"2026-08-15T23:36:00.966127Z","title":"Red teaming GPT -4v: Are GPT -4v safe against uni/multi-modal jailbreak attacks? arXiv preprint arXiv:2404.03411 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.966127Z"},"links":{"cited_paper":"/paper/2404.03411","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:004b1fa3802c31acd9950f3842a4c3abf972f32a450864c6b12b8e2ae0e19315","observation_id":"83808a87-d0ed-46a9-bf71-4f808a0b41a3","resolution":{"observed_at":"2026-08-15T23:36:00.966127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.842115Z","title":"Leveraging the context through multi-round interactions for jailbreaking attacks, 2024","venue":null,"work_id":"47693c0f-2a31-4899-a3f0-4ad353f2ac08","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.969752Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:430d4d233e33731717d646d4e5fc9f10f66d50e334ad897e9ed386ba8ccfb5be","observation_id":"aad88ebe-9bd5-4d67-a113-0c3931a5c8dc","resolution":{"observed_at":"2026-08-15T23:36:01.845505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.832338Z","title":"Dall- E val: Probing the reasoning skills and social biases of text-to-image generation models","venue":null,"work_id":"349cd471-6480-4da4-8b1e-6acfc1fdcec4","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.973097Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:8fa84061848c857e3cf0aff133d2916a51d23e1a6f6e56caf204db9d6266a51d","observation_id":"d4397a30-703e-47c1-a722-72d383601818","resolution":{"observed_at":"2026-08-15T23:36:01.835852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.821709Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":"b20bb23e-46b2-4662-bf0a-19c60781924d","year":2021},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.976722Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:98b50f069e77202a7f4d105086fc69d0af5e19a9e2425fb2c09a797d97d5b2bd","observation_id":"e085f569-71fc-4b7e-b728-73d2c5e34292","resolution":{"observed_at":"2026-08-15T23:36:01.825556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.810879Z","title":"Towards safer generative language models: A survey on safety risks, evaluations, and improvements, 2023","venue":null,"work_id":"4b99a673-f68a-4767-a8e0-08185e99b83a","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.980548Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:e7d51b2dca41023584c52faa12ba71fa54ab31130dc9639bf390cc9739dbf5cf","observation_id":"4ace2c42-49cf-4d13-89e1-ad431fcdb04a","resolution":{"observed_at":"2026-08-15T23:36:01.814848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-16T14:58:55.951885Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-15T23:36:00.984114Z","title":"How robust is G oogle's B ard to adversarial image attacks? arXiv preprint arXiv:2309.11751 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.984114Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:db1b5059b0156714216baa13d94250f1cbb4e1aaf9b813fa87823c2b5fb191f6","observation_id":"9fe23c88-b7dd-4b71-9535-8c925f49685c","resolution":{"observed_at":"2026-08-15T23:36:00.984114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.800106Z","title":"Attacks, defenses and evaluations for LLM conversation safety: A survey","venue":null,"work_id":"f842243d-35f1-4520-8826-f8f3b74397ee","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.987827Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:9b85913b0b3c14ae1e6643b0d82dfa2d5af7cd29034afe5b8c036ee2b7c9ec70","observation_id":"d9973e3f-764d-4c42-9752-982c0cbd4bd6","resolution":{"observed_at":"2026-08-15T23:36:01.803679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.789452Z","title":"ROBBIE : Robust bias evaluation of large generative language models","venue":null,"work_id":"b210e196-7fae-47a0-b755-2d992b4be1c2","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.991514Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:0dd892aeab0e0d7877b7b6bf0e7d1a85ba4902b8865d9df24a1c86fd12fbe4c3","observation_id":"b51987b6-11e6-4841-b5ec-5e8289c5b633","resolution":{"observed_at":"2026-08-15T23:36:01.792981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-16T14:44:33.111232Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-15T23:36:00.995456Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.995456Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:36497c177c1b4002ed56e4fc40edd733179092cafc7f642aec02343d3ec6f2dc","observation_id":"1d9547d3-307b-4888-9c84-c4832b70f0ad","resolution":{"observed_at":"2026-08-15T23:36:00.995456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.779205Z","title":"[Online; accessed 05-October-2024]","venue":null,"work_id":"6833ee61-5e95-4f9b-a859-e51cafab44b3","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:00.999289Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:238a176680adb8c515a7921c533816bbd1b2fc8af5d5b4d7c7b4fe71b541fee6","observation_id":"aea58e4f-8da1-4351-9eab-4a85a2103550","resolution":{"observed_at":"2026-08-15T23:36:01.782681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.768790Z","title":"MLLMG uard: A multi-dimensional safety evaluation suite for multimodal large language models, 2024","venue":null,"work_id":"a1be98b0-a7ea-4732-a094-d99b64106fc4","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.002992Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5e6a8b6f61c8733dcd294df983a8270a42dfa89d85cca29cc50773c67b66761c","observation_id":"02a18049-04bc-43a2-9aaa-e8992ccd1e1b","resolution":{"observed_at":"2026-08-15T23:36:01.772435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01787","last_updated":"2024-08-15T23:36:42Z","snapshot_observed_at":"2026-08-16T14:22:18.882239Z","submitted_at":"2024-02-01T23:12:57Z","title":"Harm Amplification in Text-to-Image Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01787","snapshot_observed_at":"2026-08-15T23:36:01.006640Z","title":"Harm amplification in text-to-image models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.006640Z"},"links":{"cited_paper":"/paper/2402.01787","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:e027ad87264c05b90182802663ddd71924f5c44566507fcef4d31980c45ba4ca","observation_id":"cd1f4572-39f2-43cb-bf5a-500c313d6112","resolution":{"observed_at":"2026-08-15T23:36:01.006640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.758340Z","title":"Evil P rompt F uzzer: generating inappropriate content based on text-to-image models","venue":null,"work_id":"87e1dec2-3009-4f76-97bb-1702e5166d65","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.010581Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:6aa8e5e22cedfd30e5df41411839a031fb60c7350f8e792522d71d186ba9528f","observation_id":"396f1031-cb72-4e8b-8f1d-9a8403c78231","resolution":{"observed_at":"2026-08-15T23:36:01.761906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19939","last_updated":"2025-05-17T15:14:14Z","snapshot_observed_at":"2026-08-17T19:34:58.995686Z","submitted_at":"2024-11-29T18:56:37Z","title":"VLSBench: Unveiling Visual Leakage in Multimodal Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19939","snapshot_observed_at":"2026-08-15T23:36:01.014139Z","title":"VLSB ench: Unveiling visual leakage in multimodal safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.014139Z"},"links":{"cited_paper":"/paper/2411.19939","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:1b22713833498411451badad2e8c1ad17579588276f70bbaba6d548cc5155be8","observation_id":"5dc5bbcb-2efd-416f-ae5f-1332e53c2f77","resolution":{"observed_at":"2026-08-15T23:36:01.014139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.748060Z","title":"Cornwell, Nicole S","venue":null,"work_id":"1316e7f2-d9ce-4bec-b053-5677fbb8bf2f","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.017982Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:08b2e60028b2c8e5bffeb77516fa41804ec3163e580e8b089b17108934642cff","observation_id":"41fe0290-f5e6-450d-b575-5f2c41672e41","resolution":{"observed_at":"2026-08-15T23:36:01.751565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.737242Z","title":"LLM defenses are not robust to multi-turn human jailbreaks yet, 2024","venue":null,"work_id":"b898d6c2-ce89-4960-b7ea-5dfbcf83898b","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.022436Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:058a8a945c094c757e4f21509b9da81403892e0cb427e53b060edfb22367c133","observation_id":"4b2c054c-5e2b-415d-820b-f8314af59631","resolution":{"observed_at":"2026-08-15T23:36:01.741267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.725894Z","title":"Images are A chilles' heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models, 2024","venue":null,"work_id":"99e92a87-55ec-4fe4-b7a0-30a42e606d3a","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.026067Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:ea7224f2243c4e5b646ac1a063843bf39709f5e046845277d693b1144db8d53b","observation_id":"295c2b7b-39a2-4492-8f95-db11a3c980c9","resolution":{"observed_at":"2026-08-15T23:36:01.729610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.715239Z","title":"Holistic evaluation of language models","venue":null,"work_id":"133a5f26-d26e-45eb-b0bc-0e8271cda9b7","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.030461Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:c786bd3693708263dfb3af787f6dd4dcea34a6c522b478e77df33e528a3b0a21","observation_id":"ff1ed617-cf5c-44bc-a4c0-27f671e016a5","resolution":{"observed_at":"2026-08-15T23:36:01.719137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13851","last_updated":"2024-02-21T14:54:30Z","snapshot_observed_at":"2026-08-16T14:16:34.445544Z","submitted_at":"2024-02-21T14:54:30Z","title":"VL-Trojan: Multimodal Instruction Backdoor Attacks against Autoregressive Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13851","snapshot_observed_at":"2026-08-15T23:36:01.034418Z","title":"VL -trojan: Multimodal instruction backdoor attacks against autoregressive visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.034418Z"},"links":{"cited_paper":"/paper/2402.13851","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5b8592fecdb4cf04e3718e781ef9ad90f5f3ba5ce1b8cc117cd5d81db8b9df98","observation_id":"850ad2b9-03f8-4803-bbc3-0aaf1d9a6ecc","resolution":{"observed_at":"2026-08-15T23:36:01.034418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.704613Z","title":"Delving into transferable adversarial examples and black-box attacks","venue":null,"work_id":"e65fa7b5-f65c-45ab-a0da-74825de0a914","year":2017},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.038652Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:922de3c4eb0adff1c13b7735ebaa103fbaef5d82c1cdfe9c2dc8fd18a0766e62","observation_id":"d1ef7b5b-9ecc-4401-a847-952e7c867919","resolution":{"observed_at":"2026-08-15T23:36:01.708281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.693801Z","title":"A survey of attacks on large vision-language models: Resources, advances, and future trends, 2024","venue":null,"work_id":"2f806ba2-7c9e-4436-b42c-19f02847cc82","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.042084Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:1b449215fd8a4e8a386ebb425568a2e7c66cbf747e0da2ee51bc63c80b48bd2f","observation_id":"4150a70b-a954-4d94-a51a-053aae5247e3","resolution":{"observed_at":"2026-08-15T23:36:01.697902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.682990Z","title":"Safety of multimodal large language models on images and text","venue":null,"work_id":"dffabaa7-38a4-4325-ae3d-e2fb575c28e8","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.045504Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:192fcade61770ee275f0d9c9cc43b891563b965e2081b90e22839844a09edcee","observation_id":"2223b08f-5ea8-4a2a-86b6-e711f21453a9","resolution":{"observed_at":"2026-08-15T23:36:01.686545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.671945Z","title":null,"venue":null,"work_id":"dae0b340-3881-4c1d-abe1-dc72ec0d8d38","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.048984Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:f3474eca064c0eca1574a0627133393131d49e32adb8a4de1c3b351146fe829d","observation_id":"ba83cc34-a509-4fa1-a232-fa15bae9940a","resolution":{"observed_at":"2026-08-15T23:36:01.675464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.660925Z","title":"MM - S afetybench: A benchmark for safety evaluation of multimodal large language models","venue":null,"work_id":"3987f41c-fb92-4d12-a519-b1d661b2e780","year":2025},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.052383Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:cff9029860ed5f772dcc48968967dfe7df53a780e25cc3804ede1a2b57858fdb","observation_id":"85e058f3-da95-4bbc-ad77-53495dfcf1d9","resolution":{"observed_at":"2026-08-15T23:36:01.665063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.649790Z","title":"[Online; accessed 31-December-2024]","venue":null,"work_id":"6c7bd5b3-2cd5-49ec-8552-9a59e53a06b6","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.055820Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:cd42cbab89f47afdc7fc26f8ee06d1239fe92d068af5eb85fbb0bb40c82b5817","observation_id":"2f441fce-e5c0-4540-ad47-130bd4c51eb9","resolution":{"observed_at":"2026-08-15T23:36:01.653672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-16T14:03:50.278504Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-15T23:36:01.059479Z","title":"Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.059479Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:3268b76576f3842a630bc62c0da6fc981a00b184980ec419498a894d53b81500","observation_id":"08fd376c-700e-4510-b3f5-15ee6f6cd599","resolution":{"observed_at":"2026-08-15T23:36:01.059479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20773","last_updated":"2024-06-12T07:13:48Z","snapshot_observed_at":"2026-08-17T15:14:45.354691Z","submitted_at":"2024-05-25T17:17:18Z","title":"Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20773","snapshot_observed_at":"2026-08-15T23:36:01.063482Z","title":"Visual-roleplay: Universal jailbreak attack on multimodal large language models via role-playing image character","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.063482Z"},"links":{"cited_paper":"/paper/2405.20773","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:9eaff1d8b1148f0b3182e36fb52dec2b42ea76f0f12912323e601469666b8ba8","observation_id":"df17114a-f348-44cf-b49b-b5e5fe0b8f6b","resolution":{"observed_at":"2026-08-15T23:36:01.063482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.637430Z","title":"Announcing microsoft copilot, your everyday ai companion - the official microsoft blog, 11 2023","venue":null,"work_id":"3b54d64b-0647-48df-ba64-a8d95b193f86","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.067549Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:cf2cac68c7b44a3c73b92eca488a4b19cc3bb655f324743585a8fa48393e5182","observation_id":"24d95985-8c56-41a4-9153-91cac18dfdbf","resolution":{"observed_at":"2026-08-15T23:36:01.642044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-16T14:21:47.913147Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-15T23:36:01.071174Z","title":"Jailbreaking attack against multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.071174Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:d2d8b4654d3a82a2daaf1c27c372f3c4c2089d9f3f7428745f6fe85279d86295","observation_id":"343593da-3519-4c35-aee5-64fa2e339303","resolution":{"observed_at":"2026-08-15T23:36:01.071174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05421","last_updated":"2023-10-09T05:35:10Z","snapshot_observed_at":"2026-08-17T23:27:52.983715Z","submitted_at":"2023-10-09T05:35:10Z","title":"Automating Customer Service using LangChain: Building custom open-source GPT Chatbot for organizations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05421","snapshot_observed_at":"2026-08-15T23:36:01.075183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.075183Z"},"links":{"cited_paper":"/paper/2310.05421","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:ed3aa8840216ad057400522be55cf6ce019e1f6c3a0f1c21bf4d7cb8dbcfed06","observation_id":"d9cf6cd2-5163-4e40-bcb4-2255d29aadbf","resolution":{"observed_at":"2026-08-15T23:36:01.075183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.625218Z","title":"[Online; accessed 05-January-2025]","venue":null,"work_id":"e281f795-37b5-4ac6-8f77-ae3289df7256","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.079208Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:4be19ef349ae44c97d2830c1e551d347ed11343e975904686456526a363529bc","observation_id":"bae6b810-12aa-41a6-b283-86d77f970c80","resolution":{"observed_at":"2026-08-15T23:36:01.628971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.613646Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"c24a0e72-10f5-4d09-9403-e468c7c38f3c","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.082903Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:cc0f4eb5c17f862d56d790cfacca203cc9867f08017aa6280fc63febf72d7b09","observation_id":"38dfb18d-45e2-45e5-889d-462ea2233bf6","resolution":{"observed_at":"2026-08-15T23:36:01.617473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.601888Z","title":"Unsafe diffusion: On the generation of unsafe images and hateful memes from text-to-image models","venue":null,"work_id":"686fe399-a98f-47af-95e7-b4b1a1c8e61a","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.086609Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:2194a954d66eed8737f05b0ff30059841e57310fe744489e36811ccb4a83dba4","observation_id":"e64c1b0a-1fa3-440e-879f-c31e1c13123c","resolution":{"observed_at":"2026-08-15T23:36:01.605744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.590380Z","title":"Adversarial N ibbler: An open red-teaming method for identifying diverse harms in text-to-image generation","venue":null,"work_id":"d4788e54-c198-4df7-b551-c48ea0e70e8c","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.090169Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:ab0b4372287efe5138528e47ff8e4973f752a6511f4530d075c885b3c94143f1","observation_id":"5e6a4370-cbf8-4977-98f5-08c30578c994","resolution":{"observed_at":"2026-08-15T23:36:01.594532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.577459Z","title":"Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models","venue":null,"work_id":"81a8ef1c-7384-417d-a4cd-857c743f1743","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.095201Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:ed23bb553599c256c8d0fadcc402e79e109b3d465e4b210b7c0b8915e6b4a82e","observation_id":"505a22bf-59bc-4e97-90e0-069b3bb34dd2","resolution":{"observed_at":"2026-08-15T23:36:01.581711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17830","last_updated":"2024-03-26T16:10:21Z","snapshot_observed_at":"2026-08-16T14:06:12.253576Z","submitted_at":"2024-03-26T16:10:21Z","title":"Assessment of Multimodal Large Language Models in Alignment with Human Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17830","snapshot_observed_at":"2026-08-15T23:36:01.099181Z","title":"Assessment of multimodal large language models in alignment with human values","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.099181Z"},"links":{"cited_paper":"/paper/2403.17830","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:99855ccd90883d06c95bae44bf1ce617aa9a870c1caaa1e43b8f3fa5f841c9f3","observation_id":"01ac96f5-a074-4c35-92ce-a22bc80d5f0f","resolution":{"observed_at":"2026-08-15T23:36:01.099181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.103397Z","title":"Imgtrojan: Jailbreaking vision-language models with ONE image","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.103397Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:56d4288c6c0b85ff0db21396a4c4cd6b2f865e1c98a86d871ccc533fa2d5ea1c","observation_id":"0e91b285-e53d-416b-8fa0-571fd765f467","resolution":{"observed_at":"2026-08-15T23:36:01.103397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.107340Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.107340Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:2ee96aa18a76cac0a40a182447c9793cab594601e0c92afa0c19985a4c5445ab","observation_id":"dc49285e-9cfd-4a96-b0f4-82a6dcd0cb4f","resolution":{"observed_at":"2026-08-15T23:36:01.107340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.558355Z","title":"ALERT : A comprehensive benchmark for assessing large language models' safety through red teaming, 2024","venue":null,"work_id":"8601741e-b2a3-46b4-a908-974d374dfdf3","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.111291Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:ca9508572627ababfa5870d154400bd8e35e49b4ae1b544b7abce47e0a748633","observation_id":"c05b9d81-11c6-4893-9f33-3733c3f174f7","resolution":{"observed_at":"2026-08-15T23:36:01.563108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16101","last_updated":"2023-11-27T18:59:42Z","snapshot_observed_at":"2026-08-16T14:39:55.490746Z","submitted_at":"2023-11-27T18:59:42Z","title":"How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16101","snapshot_observed_at":"2026-08-15T23:36:01.115189Z","title":"How many unicorns are in this image? A safety evaluation benchmark for vision LLM s","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.115189Z"},"links":{"cited_paper":"/paper/2311.16101","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5452bff016b532eebd42a801fbc6ff3b8bf5cce33c0f3be5e21fa21a3b0cfde3","observation_id":"f40b87ec-6283-4cc3-8247-c58d55d65103","resolution":{"observed_at":"2026-08-15T23:36:01.115189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11523","last_updated":"2023-12-13T08:25:07Z","snapshot_observed_at":"2026-08-16T14:35:12.435053Z","submitted_at":"2023-12-13T08:25:07Z","title":"ToViLaG: Your Visual-Language Generative Model is Also An Evildoer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11523","snapshot_observed_at":"2026-08-15T23:36:01.120073Z","title":"T o V i L a G : Your visual-language generative model is also an evildoer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.120073Z"},"links":{"cited_paper":"/paper/2312.11523","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:97a10c0dfc7de6dcf6c4fc54b7743569edb0fa9eef94192d9f01ff5b9cd2bd1c","observation_id":"75456340-9d0d-413b-8d49-5c5e808aeab2","resolution":{"observed_at":"2026-08-15T23:36:01.120073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T23:36:01.124050Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.124050Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:51166652207185242b110a683bf46dfb3b340e66a0b32394512f36cede2b116c","observation_id":"55f0483d-f863-4091-8bab-74a92c058ab2","resolution":{"observed_at":"2026-08-15T23:36:01.124050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.546032Z","title":"Sociotechnical safety evaluation of generative AI systems, 2023","venue":null,"work_id":"0b4b8e2d-d169-40f0-b86b-f53e581b2466","year":2023},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.128221Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5d9c0504d6c6d45e53e55036a521e4fc8ddd6bdb44668fec490d47a46bc6fa5c","observation_id":"faf74bb5-3383-4e00-b762-3e72e7682dd1","resolution":{"observed_at":"2026-08-15T23:36:01.550377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.533824Z","title":"Vision-Language Models: Unlocking the future of multimodal AI , 12 2024","venue":null,"work_id":"ecd7b31c-d370-4867-a7c0-3ff54a79441d","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.131691Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:5817b3f0f223674c00de2e1420e704cb811c694044d3ce1a7a78bb65235597ae","observation_id":"e9945fb7-48dc-416e-b608-1f4c2cbc526d","resolution":{"observed_at":"2026-08-15T23:36:01.538169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.521710Z","title":"Adversarial attacks and defenses in images, graphs and text: A review","venue":null,"work_id":"67f0c761-b729-4f69-9638-344ef670f660","year":2020},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.135055Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:422b7c386398e695930e5af3be0073da7b5852be95867567d7e4f85fcdfdea55","observation_id":"4fe39c17-d9e7-4e30-817f-f419e3633f83","resolution":{"observed_at":"2026-08-15T23:36:01.525866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.509867Z","title":"Viassist: Adapting multi-modal large language models for users with visual impairments, 2024","venue":null,"work_id":"3b63e9e0-c7f6-4745-b9c3-0eb635fbe029","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.138742Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:f27ef7435c85fcfbb7da5d3935d7edb36370e37b954bc0d4adb90e732b59d58a","observation_id":"f1b9bbe3-33fc-4e7a-b605-36c0cb05519d","resolution":{"observed_at":"2026-08-15T23:36:01.513952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.497592Z","title":"Chain of attack: a semantic-driven contextual multi-turn attacker for LLM , 2024","venue":null,"work_id":"49a44256-c173-4a54-85ed-46331b553851","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.141844Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:befb61c05905dce0ddb948f051a3934723c6031064339ea2b0c1ab32abe6cda5","observation_id":"036e7825-fc34-46d0-bf73-6f22e4389baa","resolution":{"observed_at":"2026-08-15T23:36:01.501981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.485655Z","title":"Sneakyprompt: Jailbreaking text-to-image generative models","venue":null,"work_id":"02508431-33bc-440a-935c-18339d357344","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.145783Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:9d7fda5786e3d09f1c9f83a6111372f2a27f370e48a2f86a51e8453d7b45d07f","observation_id":"d62abf6c-e3a1-4a8c-8a7c-c4f1eca6f15a","resolution":{"observed_at":"2026-08-15T23:36:01.489543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04031","last_updated":"2024-07-01T14:25:23Z","snapshot_observed_at":"2026-08-17T07:16:08.436720Z","submitted_at":"2024-06-06T13:00:42Z","title":"Jailbreak Vision Language Models via Bi-Modal Adversarial Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04031","snapshot_observed_at":"2026-08-15T23:36:01.148983Z","title":"Jailbreak vision language models via bi-modal adversarial prompt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.148983Z"},"links":{"cited_paper":"/paper/2406.04031","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:2299999c4441b7ca0dc443ce9dc0c80349cf9b575058334dafc8df41a0b420e9","observation_id":"c46a4fdc-382a-4cba-9e48-9af2e9b7f6be","resolution":{"observed_at":"2026-08-15T23:36:01.148983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06302","last_updated":"2024-07-03T00:51:21Z","snapshot_observed_at":"2026-08-16T13:44:32.850419Z","submitted_at":"2024-06-10T14:18:56Z","title":"Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06302","snapshot_observed_at":"2026-08-15T23:36:01.152471Z","title":"Unveiling the safety of GPT -4o: An empirical study using jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.152471Z"},"links":{"cited_paper":"/paper/2406.06302","citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:10ebe26b022449453b42b49a19cc53ef28fb14ad56e9c1e7a8f7436b30b34893","observation_id":"88c7ec34-432e-40ac-a724-9ade7997f920","resolution":{"observed_at":"2026-08-15T23:36:01.152471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.156013Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.156013Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:15501ce243655132e4c6796d19ce037710b3f84b60e5e304c6912a29d5b01479","observation_id":"11317825-d672-4d24-bda2-2901ae2e76c4","resolution":{"observed_at":"2026-08-15T23:36:01.156013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.463861Z","title":"Speak out of turn: Safety vulnerability of large language models in multi-turn dialogue, 2024","venue":null,"work_id":"020c88a1-7fe4-4ab6-a02a-881806f0a22c","year":2024},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.160398Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:bfd42c5afd47774cc0d340020572ffe0980e9e607a866449eb4bd5626d31b226","observation_id":"41966232-8d32-41d4-8b75-b14f35606361","resolution":{"observed_at":"2026-08-15T23:36:01.470271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:36:01.163570Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T23:36:01.163570Z"},"links":{"citing_paper":"/paper/2505.04673"},"observation_digest":"sha256:746ae33b6f0b9d9f3d82f11562f486cce6b4602fcf9ef0a662b467f492413f60","observation_id":"0842f708-8c28-4f6f-a1d5-0a74301cfa04","resolution":{"observed_at":"2026-08-15T23:36:01.163570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.04673","last_updated":"2025-05-07T10:09:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T04:15:02.081138Z","submitted_at":"2025-05-07T10:09:55Z","title":"REVEAL: Multi-turn Evaluation of Image-Input Harms for Vision LLM"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2505.04673."}