{"as_of":"2026-08-07T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d041efeb4e58e4c2bc13505e623e350a8ec69a0f8b3714bd474268557372ded","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:09:24.884191Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11968/citation-record","integrity":"/paper/2507.11968/integrity","json":"/paper/2507.11968/citation-record.json","paper":"/paper/2507.11968"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:20.019458Z","title":"Reference-guided ver- dict: Llms-as-judges in automatic evaluation of free-form text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.019458Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:c52de9b55dcf98ff2524d786a788fcb9fa79c68ef65ec4058b4ab430659ecb98","observation_id":"0ff6a5f7-d099-43b7-993d-ac873a99dab8","resolution":{"observed_at":"2026-08-06T17:09:20.019458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T17:09:20.108626Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.108626Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:9c19dfb2cb4c6ebefcdd73ca87d192133fb2019a7ba0bfba9326f4f7e46c7844","observation_id":"e16c073f-8f7d-44a4-b9f4-20b48050c655","resolution":{"observed_at":"2026-08-06T17:09:20.108626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:20.210391Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.210391Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:d2f5917990c2a0d05a97aaf364778db49746ed9df14cee4c0d641e8b9157b28b","observation_id":"8ed9183b-c458-4eff-943c-aeab1b085286","resolution":{"observed_at":"2026-08-06T17:09:20.210391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:31.382356Z","title":"Mind the trojan horse: Image prompt adapter enabling scalable and decep- tive jailbreaking","venue":null,"work_id":"1e97cc1b-0d0c-4d71-bd5a-08ed49846463","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.360131Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:8ebdad93fdd9237e1f12ab29f33977b759c406809ef7e460f75204b5b202f1e5","observation_id":"d28aeb4f-a308-4d4c-aa2b-d3965368af78","resolution":{"observed_at":"2026-08-06T17:09:31.439134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:31.257324Z","title":"Cross-modal causal relation alignment for video question grounding","venue":null,"work_id":"fd50d28f-5322-4ee1-beb7-b23da2ee7853","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.453573Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:2cc98b8c2fe2b223082ae8fa914453ab0251c45c96984de2b0338abd842a8e6a","observation_id":"66c0c188-e221-428c-89c6-419e70695c42","resolution":{"observed_at":"2026-08-06T17:09:31.311137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00735","last_updated":"2025-05-18T07:29:41Z","snapshot_observed_at":"2026-07-06T20:29:45.369233Z","submitted_at":"2025-02-02T10:05:08Z","title":"`Do as I say not as I do': A Semi-Automated Approach for Jailbreak Prompt Attack against Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00735","snapshot_observed_at":"2026-08-06T17:09:20.679512Z","title":"From compliance to exploitation: Jailbreak prompt attacks on multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.679512Z"},"links":{"cited_paper":"/paper/2502.00735","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:b34413c7a64baa781f2618966eabca8943ff7644fbbb45d0aae625458dce30cc","observation_id":"291eba03-f8ca-4e32-8383-290a1468cd14","resolution":{"observed_at":"2026-08-06T17:09:20.679512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:31.065431Z","title":"Automated hate speech detection and the prob- lem of offensive language","venue":null,"work_id":"66a0cb8a-2e0a-4d90-983b-f46c71eb170a","year":2017},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.802326Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:34225936d61d5177276900769f8d8e6cf9b27daed416debd648de21a46ecdece","observation_id":"ddb8e526-1796-4dcb-b0bc-df01372b2d6c","resolution":{"observed_at":"2026-08-06T17:09:31.155231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:30.897032Z","title":"Adversaflow: Visual red team- ing for large language models with multi-level adversarial flow","venue":null,"work_id":"ea4c5a14-c329-4b4b-9c0e-96a80ecfa64f","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:20.986593Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:bd1f107d9e700a5a083b3f0017ce21c36403e766d068f2853cb1bbaf98e52bab","observation_id":"b73647cf-4c09-453c-a52e-b06da2025cfb","resolution":{"observed_at":"2026-08-06T17:09:30.943692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:21.129340Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.129340Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:f6516fad108744315190a237037bd406f316a6c569b6ac0cd57e98ac0091def0","observation_id":"5dd2071b-9d0f-4494-a9da-7fb14055249b","resolution":{"observed_at":"2026-08-06T17:09:21.129340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:30.679778Z","title":"Figstep: Jailbreaking large vision-language models via typo- graphic visual prompts","venue":null,"work_id":"98d43b13-545c-4550-a801-9ece5f21b9e7","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.237058Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:ff1f4d03d3c8aa8c4e467e972d2cf30f0ab1dc33d6ab08a74df1641b739ea3a2","observation_id":"1d0e4511-6370-4ab8-b552-78b526a0fc98","resolution":{"observed_at":"2026-08-06T17:09:30.762839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:30.470852Z","title":"Agent smith: a single image can jailbreak one million multimodal llm agents exponentially fast","venue":null,"work_id":"91cea3fa-b09a-4c6f-b6cc-f7a949cdc3f7","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.381323Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:1be1103bd8812086ebc786c9a4dca3962c807f133fa57638bc868304ad3f4e23","observation_id":"03018278-1c7c-4639-adce-5a6329ee0fcc","resolution":{"observed_at":"2026-08-06T17:09:30.596842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18000","last_updated":"2024-11-28T02:19:55Z","snapshot_observed_at":"2026-07-06T19:57:41.881817Z","submitted_at":"2024-11-27T02:40:29Z","title":"Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2411.18000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18000","snapshot_observed_at":"2026-08-06T17:09:26.128562Z","title":"Exploring Visual Vulnerabilities via Multi-Loss Adversarial Search for Jailbreaking Vision-Language Models","venue":"cs.CV","work_id":"28b221b8-34cf-46fd-b155-516ffbb877f1","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.503096Z"},"links":{"cited_paper":"/paper/2411.18000","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:0492d47c6d0d710bc3949bf8b273e4db948f3f4c41d0a7d7037048f2df10cc26","observation_id":"3226d307-bc2f-41c6-8b47-466275d0936c","resolution":{"observed_at":"2026-08-06T17:09:26.210420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11972","last_updated":"2026-05-29T09:22:41Z","snapshot_observed_at":"2026-07-06T21:10:18.015145Z","submitted_at":"2025-04-16T11:08:46Z","title":"Reassessing Extractive QA Datasets at Scale: LLM-as-a-Judge and In-Depth Analyses","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11972","snapshot_observed_at":"2026-08-06T17:09:21.645814Z","title":"Llm-as-a-judge: Reassessing the performance of llms in ex- tractive qa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.645814Z"},"links":{"cited_paper":"/paper/2504.11972","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:c14031479b1a5baffdddea63ca8807951fdd1b87a15691e775f82b8602af51af","observation_id":"85cf70de-8463-44ab-83dd-6938be8f6a6d","resolution":{"observed_at":"2026-08-06T17:09:21.645814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-04T22:49:54.802240Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-06T17:09:21.745442Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.745442Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:48eab9192d7012526cb62ab30dddbf33d7240e4bae21e624f6d76bc7ca01bb63","observation_id":"f7ff1dbd-f1a1-4405-ac42-2ef80dee1729","resolution":{"observed_at":"2026-08-06T17:09:21.745442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:30.231943Z","title":"Videojail: Exploiting video-modality vulnerabilities for jail- break attacks on multimodal large language models","venue":null,"work_id":"7f0c4e4e-2465-4d40-9a7b-60e4b13ea9c1","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.813983Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:3632b179ddcd7238ca804d13dfcd992091584e0ec8d52ab8ae10aeb40cf56a5e","observation_id":"3799aeeb-ca05-4bfd-aff4-9d4345b8f798","resolution":{"observed_at":"2026-08-06T17:09:30.321298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T17:09:21.874258Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.874258Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:db95e2bb21a17c36ec858b1958a60a961742af6b2f1d69e70606038ef4ef9898","observation_id":"f3453251-37a2-4b02-bc7c-43a2825fee6f","resolution":{"observed_at":"2026-08-06T17:09:21.874258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:30.022247Z","title":"Playing the fool: Jailbreaking llms and multimodal llms with out-of-distribution strategy","venue":null,"work_id":"19aae268-640c-4e42-8807-91c46c15d472","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:21.954102Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:a45dfa356b27ba39605e2f95c68a6a36df4cdef9d40801c7053ff7e0a3736c94","observation_id":"143932b7-7b54-4fbe-a676-f6a160177086","resolution":{"observed_at":"2026-08-06T17:09:30.122424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:29.776624Z","title":null,"venue":null,"work_id":"c8a36eac-5ca4-4d63-8bdb-12c2c8b60d5a","year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.063009Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:0fa2f9315e258eae64a766343e9b2ffc8d4d9450ba762091cb20c2b6f7f33e30","observation_id":"77f3739a-8d88-483a-adf3-2f34ef7daae7","resolution":{"observed_at":"2026-08-06T17:09:29.886185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T17:09:22.151616Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.151616Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:f76cbd565f0bb05686d4b6f1a8cb0d70c6a9bfe6e069405ac7fb993947375871","observation_id":"ab245714-1a27-4a3d-95bc-c4c9376f8cd0","resolution":{"observed_at":"2026-08-06T17:09:22.151616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18370","last_updated":"2024-07-25T20:04:59Z","snapshot_observed_at":"2026-07-06T18:52:07.765911Z","submitted_at":"2024-07-25T20:04:59Z","title":"Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18370","snapshot_observed_at":"2026-08-06T17:09:22.262209Z","title":"Trust or esca- late: Llm judges with provable guarantees for human agree- ment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.262209Z"},"links":{"cited_paper":"/paper/2407.18370","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:425e9c8fc4c809ac258228d08403f621d2fa0620e5041425ea68333858c25d8b","observation_id":"23bfdaf8-b932-4062-b746-684a6ff46bce","resolution":{"observed_at":"2026-08-06T17:09:22.262209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:29.516843Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"83efff70-8542-455d-bddb-2b686fb513b1","year":2020},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.481992Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:3ada4ac41eb029d30ad302a2445362f6e5b23c935abfa60eeedf791e7b611807","observation_id":"c4fd354b-7b66-47ce-8fce-1aa561f06e9f","resolution":{"observed_at":"2026-08-06T17:09:29.633249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18540","last_updated":"2025-02-28T14:49:25Z","snapshot_observed_at":"2026-08-07T03:50:11.725849Z","submitted_at":"2024-05-28T19:16:17Z","title":"Learning diverse attacks on large language models for robust red-teaming and safety tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18540","snapshot_observed_at":"2026-08-06T17:09:22.585003Z","title":"Learning diverse at- tacks on large language models for robust red-teaming and safety tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.585003Z"},"links":{"cited_paper":"/paper/2405.18540","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:15491500a60d5973f9f4b64095b938547d156bb900087b7425c9dbe8eab406be","observation_id":"26fcdc41-bd95-4bb1-b0d9-aef4fda1bea2","resolution":{"observed_at":"2026-08-06T17:09:22.585003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13507","last_updated":"2024-03-21T08:54:27Z","snapshot_observed_at":"2026-07-06T17:47:38.508384Z","submitted_at":"2024-03-20T11:05:07Z","title":"FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs","version":2},"cited_work":{"arxiv_id":"2403.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13507","snapshot_observed_at":"2026-08-06T17:09:25.651602Z","title":"FMM-Attack: A Flow-based Multi-modal Adversarial Attack on Video-based LLMs","venue":"cs.CV","work_id":"98a32090-4c91-4ac6-a9d9-3cb1e17cd58a","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.681672Z"},"links":{"cited_paper":"/paper/2403.13507","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:98be8b79b8015e2bfbef6ab19183142b7295744241588d21b4c630f700736c7b","observation_id":"59d4164c-800a-4cb4-80c1-86a6a3160165","resolution":{"observed_at":"2026-08-06T17:09:25.713243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12915","last_updated":"2024-01-23T17:07:18Z","snapshot_observed_at":"2026-07-06T17:19:31.847730Z","submitted_at":"2024-01-23T17:07:18Z","title":"Red Teaming Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12915","snapshot_observed_at":"2026-08-06T17:09:22.747756Z","title":"Red teaming visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.747756Z"},"links":{"cited_paper":"/paper/2401.12915","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:cc693c7cb798f29b12ab711780f8a9edee678eae0b4394f638ed228e6f80a80d","observation_id":"f6c3f2bb-6f94-4c4c-9ce0-9d04a072b29f","resolution":{"observed_at":"2026-08-06T17:09:22.747756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:29.307025Z","title":"Images are achilles’ heel of alignment: Exploit- ing visual vulnerabilities for jailbreaking multimodal large language models","venue":null,"work_id":"034a4f03-2d1c-4375-b8db-7f5b9b35c21a","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.819473Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:de0e9e00a417eb1bcefd916817f4a165f4686be420aba500ee62b28da81e4b4e","observation_id":"33ef3c8a-7a3e-4d2a-bca0-a74912568c55","resolution":{"observed_at":"2026-08-06T17:09:29.412453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:29.087923Z","title":"GroundingGPT: Language en- hanced multi-modal grounding model","venue":null,"work_id":"d4faf647-5b62-421f-870c-8d480537de12","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:22.889336Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:cca4dae3dc9bc0e5393a7d8613a1921d834811c8b1508e5ce5bfa3609642fc19","observation_id":"d0329f0b-e3b1-4d21-85ae-fa4993207658","resolution":{"observed_at":"2026-08-06T17:09:29.191945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T17:09:23.005461Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.005461Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:b69a131c5d5236ace8675248ddf7d795642ae1af45ec2643e56a6782fcf63ced","observation_id":"c7154d59-2136-4e09-a0b6-26e205f80d7e","resolution":{"observed_at":"2026-08-06T17:09:23.005461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:28.759737Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"18aebf6b-1423-4fff-b443-78e8fc19f904","year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.166951Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:3ffc8d76a592e335cd0b3dc75e60c23b14fb374a046f4535667249c882eaf27e","observation_id":"d9571e64-afe9-4fd3-a968-abaea2c7befa","resolution":{"observed_at":"2026-08-06T17:09:28.904324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05499","last_updated":"2025-12-29T02:25:27Z","snapshot_observed_at":"2026-07-06T15:40:27.639368Z","submitted_at":"2023-06-08T18:43:11Z","title":"Prompt Injection attack against LLM-integrated Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05499","snapshot_observed_at":"2026-08-06T17:09:23.315417Z","title":"Prompt injection attack against llm- integrated applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.315417Z"},"links":{"cited_paper":"/paper/2306.05499","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:165343c7037a1814852d9a40557dfacbeac731b0c27f5c533f2590a6d21f4f04","observation_id":"ea1be7ab-bb2f-4614-a63e-0968bef7222a","resolution":{"observed_at":"2026-08-06T17:09:23.315417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:28.544303Z","title":"Arondight: Red teaming large vision language models with auto-generated multi-modal jailbreak prompts","venue":null,"work_id":"8432d01a-7996-4b30-b0d2-351fd762de36","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.404182Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:98d02a96a8b016b86a4fc1f7693c035d99dbac45ef7e22c4a9a45ca202d51ea3","observation_id":"018af706-99bd-4699-bd4c-474e63673e0f","resolution":{"observed_at":"2026-08-06T17:09:28.643297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:28.369046Z","title":"LLaMA 4: Advancing Multimodal Intelli- gence","venue":null,"work_id":"f7b50bb1-a86a-4220-ae5b-c6f050b1000c","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.520377Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:317f84ae1d7f42913160763d775856dadc392c7df9069592670d97833a3109bc","observation_id":"b6e18b6e-9118-4450-bd3c-723107c9b59d","resolution":{"observed_at":"2026-08-06T17:09:28.459147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-07T07:47:20.838090Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-06T17:09:23.717332Z","title":"Jailbreaking attack against multimodal large lan- guage model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.717332Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:dab72422840150a841527b0d7f095219e5c168c55c786df0206d1a8a3a47d2de","observation_id":"531a2f32-3929-4b2e-9217-77d748f5e1b7","resolution":{"observed_at":"2026-08-06T17:09:23.717332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:28.120998Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"fdf0a65c-9a23-45e1-8402-d4d42a6fe03b","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.877523Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:030eb613dbe75af8d9d17771dd963a3a3c0598b1efa02f4324413695775555af","observation_id":"fcdc0549-e95f-4248-831d-5d17c73f418d","resolution":{"observed_at":"2026-08-06T17:09:28.219937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:27.843484Z","title":"Cross-modal attention congruence regularization for vision-language relation align- ment","venue":null,"work_id":"3e522c21-6a6b-4a7b-b1eb-1e4ab94dd1cd","year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:23.970611Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:f83ccf9a2d1cd50c391e7454384d562a5d29bbd5d4959a7910dd646637afd73b","observation_id":"6b7e1439-2684-4bc1-9960-364cf76dbbd1","resolution":{"observed_at":"2026-08-06T17:09:27.964083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00626","last_updated":"2025-02-13T03:11:20Z","snapshot_observed_at":"2026-07-06T17:23:43.676786Z","submitted_at":"2024-02-01T14:41:20Z","title":"Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00626","snapshot_observed_at":"2026-08-06T17:09:24.061030Z","title":"Vision-llms can fool themselves with self-generated typographic attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.061030Z"},"links":{"cited_paper":"/paper/2402.00626","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:f9492b330a52874160701eebcdeb20a62210fc67feebeaafeda7205309a6d57b","observation_id":"fac8730f-908b-48c4-93c5-9c6ed93363b0","resolution":{"observed_at":"2026-08-06T17:09:24.061030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:27.624744Z","title":"On the adversarial robustness of multi-modal foundation models","venue":null,"work_id":"0ca2eb5d-926e-41fd-a661-25c61df3114b","year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.135215Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:9de888dff81bec92f78e7132e94b1d45eb4db6344c5192f4cc236fcbac649edf","observation_id":"5539a05b-bf7b-4e23-96a9-bcf4dc4462f3","resolution":{"observed_at":"2026-08-06T17:09:27.713195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:27.396764Z","title":"Gemini: A family of highly capable multi- modal models, 2025","venue":null,"work_id":"cf7bc0af-d414-4b48-864f-4edd05d0e1c0","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.223768Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:640112c810fe85473db7949f03ea54fa8e1db0abd0452856ea17dc97ebb96ebe","observation_id":"19ad089f-5c2d-4bb0-a906-1e0c1954c34e","resolution":{"observed_at":"2026-08-06T17:09:27.507691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:27.202938Z","title":"Gemma 3 technical report, 2025","venue":null,"work_id":"111ca56a-5c9b-4e98-ab92-2a85981e55a7","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.302682Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:bfe4642c6ba681e0ba374337e1822a8538211708c61aa8260884853c73d8c6ba","observation_id":"738711b2-8710-4033-9fec-60cc76de8881","resolution":{"observed_at":"2026-08-06T17:09:27.281820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:09:24.373479Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.373479Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:de8a2792c25a8010273f5c4fe5375e46cd988d138247dd0df496bbd9b0c401e8","observation_id":"ce20cddb-4b6f-4e99-9e13-e06abfd1f244","resolution":{"observed_at":"2026-08-06T17:09:24.373479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:26.996931Z","title":"Stop reasoning! when multimodal llm with chain-of-thought rea- soning meets adversarial image, 2024","venue":null,"work_id":"3843b6e7-bc3d-4112-bd76-446bd11dd71a","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.470625Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:9f9da88f9a9fb7fa90d37ceed9b20c3fc56a226a8bbc9d5289f973751b6314fc","observation_id":"807d9dd6-23a9-47e5-8aa9-fa257b9aedaf","resolution":{"observed_at":"2026-08-06T17:09:27.092656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23861","last_updated":"2024-10-31T12:11:17Z","snapshot_observed_at":"2026-07-06T19:42:51.617598Z","submitted_at":"2024-10-31T12:11:17Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2410.23861","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23861","snapshot_observed_at":"2026-08-06T17:09:25.132736Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models","venue":"cs.CL","work_id":"58c84d6c-d7b7-4cf1-9119-8276727fd17d","year":2024},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.580550Z"},"links":{"cited_paper":"/paper/2410.23861","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:e16c4c970fa3940fffee6d040ccc8114bd230c30044b264a9a428b80274910c9","observation_id":"8c0cf09f-e4bb-4809-83e5-b7bffefece4f","resolution":{"observed_at":"2026-08-06T17:09:25.245696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:26.632767Z","title":"Distraction is all you need for multimodal large language model jailbreaking","venue":null,"work_id":"a9f12203-a746-4d37-aacd-de780c6ed62a","year":2025},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.672129Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:5fa4250d253002b66de8de515ee816774542c66ea8d64369b32c9b3e281444e3","observation_id":"07a803cf-9713-49e5-ae02-241870041023","resolution":{"observed_at":"2026-08-06T17:09:26.829247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-06T17:09:24.745035Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.745035Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:95bb945a4a01723dfb813c0a4d0239c07da5de3b39320e7a389791a331e6505e","observation_id":"8bdb0029-ddc9-4f19-9bd5-1ce547d883c3","resolution":{"observed_at":"2026-08-06T17:09:24.745035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:09:24.806832Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.806832Z"},"links":{"citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:46c6d32eb224251ed60dfef34cfae5464d4624b5b5b4412a1ce6b9ef98284776","observation_id":"23f244aa-ebae-4ab8-ac21-295c9395e1d8","resolution":{"observed_at":"2026-08-06T17:09:24.806832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:09:24.884191Z","title":"Universal and transferable adversarial attacks on aligned lan- guage models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:09:24.884191Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11968"},"observation_digest":"sha256:417f7162aeb5d4a7530a2647796655a9b14609aca38d069b8dbb65fb34d3c5a4","observation_id":"1612cb63-f7b3-4493-b43e-c44ffd16bb53","resolution":{"observed_at":"2026-08-06T17:09:24.884191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11968","last_updated":"2025-07-16T07:02:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:48:36.747502Z","submitted_at":"2025-07-16T07:02:15Z","title":"Watch, Listen, Understand, Mislead: Tri-modal Adversarial Attacks on Short Videos for Content Appropriateness Evaluation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":21},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.11968."}