{"as_of":"2026-08-09T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bdc9fe9ab7aa1bdfe47a4a05c2b2c9198a59c1c8a51f537b031df64e7a602c14","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:04.010212Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:01:29.101657Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T13:59:52.814698Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2505.14226","last_updated":"2026-04-07T12:14:38Z","snapshot_observed_at":"2026-08-08T04:00:07.253604Z","submitted_at":"2025-05-20T11:35:25Z","title":"Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T14:40:58.506345Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2505.14226"},"observation_digest":"sha256:f9d8adf11366c5c77c516dd2e27bc6a9ffd93dff29ddfc44565e76477871f15c","observation_id":"b787ab99-1793-48c0-a3fd-44975853b2ca","resolution":{"observed_at":"2026-05-22T14:41:41.447184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-08-06T20:01:29.101657Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.101657Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:795cce67120014f26541db0959fccc4c47e5193b2720f0a144b0becdf96cd6ae","observation_id":"3c24cbcf-69cf-4df7-b40a-5d88ccaa7dba","resolution":{"observed_at":"2026-08-06T20:01:29.101657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-08-03T11:56:08.058417Z","title":"Zhe Sun, Yujun Cai, Jiayu Yao, and Yiwei Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04876","last_updated":"2026-05-27T05:39:51Z","snapshot_observed_at":"2026-08-06T04:16:05.142007Z","submitted_at":"2026-01-08T12:21:09Z","title":"ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:56:08.058417Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2601.04876"},"observation_digest":"sha256:4e5ad68958e1cc33d2b01a056d6996c2b399fe08e2bc58b9116cccab17c9ec4f","observation_id":"84f927ca-2991-4e01-859c-5bddd2c27880","resolution":{"observed_at":"2026-08-03T11:56:08.058417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-13T22:11:30.473038Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.19127","last_updated":"2026-06-30T17:07:30Z","snapshot_observed_at":"2026-08-06T12:05:32.506945Z","submitted_at":"2026-03-19T16:48:28Z","title":"On Optimizing Multimodal Jailbreaks for Spoken Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T22:11:30.473038Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2603.19127"},"observation_digest":"sha256:54654ec61fab9cca76c26d91a7ba4545c449efa40e200af3c1f98cf83d95c9f7","observation_id":"3e1e3656-2c13-429e-a0a0-dbb558ce4d48","resolution":{"observed_at":"2026-07-13T22:11:30.473038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.17225","last_updated":"2026-05-17T02:13:58Z","snapshot_observed_at":"2026-08-07T09:09:04.903896Z","submitted_at":"2026-05-17T02:13:58Z","title":"Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-19T23:17:08.124240Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.17225"},"observation_digest":"sha256:1962b838a7ba6fa86fc638ad45faf4692e500fc23e106e0c2b63eb115330343b","observation_id":"331b3224-b194-4b0d-9d77-e0a96c6b3ba4","resolution":{"observed_at":"2026-05-19T23:17:57.425254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.18168","last_updated":"2026-05-18T10:10:31Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:10:31Z","title":"Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-20T09:48:43.319804Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.18168"},"observation_digest":"sha256:a76f9dc56d6c66ec084806d3e2c10dfc59d197d9f57378d9ca5e8ca3eef9fca9","observation_id":"637a9c5e-df3b-4e98-a5ad-415e0865c6ba","resolution":{"observed_at":"2026-05-20T09:53:15.969331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:fa1a22a9d59d99ddf5dddff8c01cd6bf413b3a7a22b1b37b177bfa0182d37633","observation_id":"52be56bc-4ee2-46cd-b658-70a0c890bf95","resolution":{"observed_at":"2026-05-21T07:39:48.840914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2606.10581","last_updated":"2026-06-09T08:45:52Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:45:52Z","title":"ParaBridge: Bridging Paralinguistic Perception and Dialogue Behavior in Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:05.518547Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2606.10581"},"observation_digest":"sha256:e552f340ce25279b9266db85b7f48671d2a02d03d117cf548756c1e8119aa30e","observation_id":"dc537d9d-b741-4ec1-9695-aaa12fbc4006","resolution":{"observed_at":"2026-07-03T05:07:39.459073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":"2505.15406","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15406","snapshot_observed_at":"2026-07-04T13:59:52.814698Z","title":"Audio jailbreak: An open comprehensive benchmark for jailbreaking large audio-language models.arXiv preprint arXiv:2505.15406","venue":null,"work_id":"43412438-3994-4bfe-a161-ea073f4dcebc","year":2025},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-07-31T01:20:28.481331Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":154,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2505.15406","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:ce3d22ba666599c8039908afccbd29ff7133b5f74ed2a3a970289455e409762a","observation_id":"13948d62-8a8e-4d9a-a12d-b2b46744b58b","resolution":{"observed_at":"2026-07-04T13:59:52.816236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15406/citation-record","integrity":"/paper/2505.15406/integrity","json":"/paper/2505.15406/citation-record.json","paper":"/paper/2505.15406"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:23:00.520353Z","title":"Gpt-4 technical report // arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.520353Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:3841d1232033958892a0fd8e38925da17ac19dc75e15eb43621babac7f663c2f","observation_id":"7598b741-b824-4372-a081-aa55a75e3ada","resolution":{"observed_at":"2026-08-07T15:23:00.520353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-07T15:23:00.586445Z","title":"Audiolm: a language modeling approach to audio generation.(2022) // arXiv preprint arXiv:2209.03143","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.586445Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:933ba6a3a50c763ef1be8fcc33fa7fd802e9000def32d83f4fcdb11af0c454c5","observation_id":"878317e2-89bc-4850-b524-fdd36535fa17","resolution":{"observed_at":"2026-08-07T15:23:00.586445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.753222Z","title":"Benchlmm: Benchmarking cross-style visual capability of large multimodal models // European Conference on Computer Vision","venue":null,"work_id":"23827700-0667-4c02-9055-90f9ab16397e","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.637202Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:72358c8c1012677b98d267d98bff2eae05054f2866b4c092cc3d19e4c8ea86f4","observation_id":"149ccc71-aab0-48e9-a4c3-b1047fe010c8","resolution":{"observed_at":"2026-08-07T15:23:06.813430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-02T14:59:12.115203Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-07T15:23:00.686245Z","title":"Jailbreakbench: An open robustness benchmark for jailbreaking large language models // arXiv preprint arXiv:2404.01318","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.686245Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:f8dd6ce9f0c8464b90be7a42527d6d9d1ff1fd766031b99bd28295b4460198db","observation_id":"7cf5262a-a842-46bc-8240-26f4af2c54c2","resolution":{"observed_at":"2026-08-07T15:23:00.686245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-07T15:23:00.732479Z","title":"X-llm: Bootstrapping advanced large language models by treating multi-modalities as foreign languages // arXiv preprint arXiv:2305.04160","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.732479Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:077176b8a0587d95945b067379861b0880a67de4dcb72e7f5872d2909d435546","observation_id":"b3046cd1-3de4-4f34-ada3-738dfcacd11d","resolution":{"observed_at":"2026-08-07T15:23:00.732479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.621296Z","title":"Unveiling the power of language models in chemical research question answering // Communications Chemistry","venue":null,"work_id":"97e830ec-26cd-4a53-96ec-c2c4fca21d7c","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.834983Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:4ca895de85cda2f7c9734e4347625a2bb34c7f47585cc9725da4460bfca9d145","observation_id":"403523a6-1fd5-48cb-bf77-2241df91c196","resolution":{"observed_at":"2026-08-07T15:23:06.667549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T15:23:00.899140Z","title":"Qwen2-audio technical report // arXiv preprint arXiv:2407.10759","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.899140Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:baa5c75278b6e0375403dccc18a875f4621d42fb2fb71c2545436b66be04b12d","observation_id":"7b87d514-3853-4a4a-8c59-a37e0dbd56f6","resolution":{"observed_at":"2026-08-07T15:23:00.899140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:23:00.937688Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models // arXiv preprint arXiv:2311.07919","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.937688Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:75f41f874b483c9b4b7b9edf7e24ffd25c635e7c3d2d43bddf25c7956c5ec40c","observation_id":"49e1752a-0443-4a6d-af31-1f3d106648b0","resolution":{"observed_at":"2026-08-07T15:23:00.937688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.489870Z","title":"Pengi: An audio language model for audio tasks // Advances in Neural Information Processing Systems","venue":null,"work_id":"343576f4-426c-4c72-a651-425c3e902217","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:00.976045Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:b372c53d6e3a3f6c52dce8ef8e47a472a6fd910f7c88e050d9d99ca95996bb62","observation_id":"be766e0b-d2a5-47d3-9a86-af69fb2285a3","resolution":{"observed_at":"2026-08-07T15:23:06.558009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.384006Z","title":"The phase vocoder: A tutorial // Computer Music Journal","venue":null,"work_id":"087016d2-076c-440d-b358-5abca3133335","year":1986},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.020120Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:01bb96682d0896d22bf93c8656fe146bd7c8425c72035cde18575afc10079901","observation_id":"cf5be773-4c3b-4785-95e6-2a4cf23981db","resolution":{"observed_at":"2026-08-07T15:23:06.442005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.261778Z","title":"When does contrastive learning preserve adversarial robustness from pretraining to finetuning? // Advances in neural information processing systems","venue":null,"work_id":"2c1fd820-c58e-4f7b-91f1-d3e66742991a","year":2021},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.088155Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9ee8e8cb351ea2966df8b77a319894204fd429eea1dc3c91d1bc14b4bf8f5f9a","observation_id":"28471991-f4b6-442c-ac2c-5bcd9650c886","resolution":{"observed_at":"2026-08-07T15:23:06.332081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:23:01.147173Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models // arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.147173Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e14f0cf46d11af4516229bce7ba8c1b6dfa9cb301ca79b643664a2ef1ed758e4","observation_id":"dc9e1a5e-b5fa-4f82-8711-d91ee80fa622","resolution":{"observed_at":"2026-08-07T15:23:01.147173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:06.084118Z","title":"Prompting large language models with speech recognition abilities // ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"f06bc581-1916-42cc-8cbb-733d5a6cd646","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.191660Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:bda7d124dcfd4cb6bfa175be8c1513b90b98b1a7ec60d4cb51ccf1bbaad850c6","observation_id":"68df4d41-e9eb-4ddd-bd5f-702551a6b126","resolution":{"observed_at":"2026-08-07T15:23:06.160143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-07T12:49:05.688504Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-07T15:23:01.286272Z","title":"A tutorial on Bayesian optimization // arXiv preprint arXiv:1807.02811","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.286272Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:90e8392d8ef555a5d6ca0b8a3e6b3e629c20c6a9a0c4aa2c2d225478c1c111fc","observation_id":"92d5cb71-f2f4-49f0-abf1-5cafde38f643","resolution":{"observed_at":"2026-08-07T15:23:01.286272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.973756Z","title":null,"venue":null,"work_id":"edabf62e-b883-4188-b8f8-48af2f6fa545","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.363375Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ec7258103c82bdbb044d35b01c01e37f2cd13db6b3117735b8070777abd787c5","observation_id":"fc54a43b-0412-4f6c-a823-2e555c397ae1","resolution":{"observed_at":"2026-08-07T15:23:06.030619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-08-07T15:23:01.399521Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models // arXiv preprint arXiv:2412.17034","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.399521Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d01c97a0a18b76cccea312edaf81b1e6f9071534b831f0b810ad795a68c2c21f","observation_id":"b83560eb-6c72-4f8f-bc06-60b13f5dd309","resolution":{"observed_at":"2026-08-07T15:23:01.399521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T15:23:01.440392Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities // arXiv preprint arXiv:2406.11768","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.440392Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:6d8adedde7e32be2ba69d3e51d2893b298110abaa3e395997ff80eef7ba2411b","observation_id":"7736233f-1a62-4215-91ab-9ca5f3ef4338","resolution":{"observed_at":"2026-08-07T15:23:01.440392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-06T15:52:37.531678Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-07T15:23:01.487032Z","title":"Listen, think, and understand // arXiv preprint arXiv:2305.10790","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.487032Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ee520139493440a4e63f6859d02bcf8eead5b6f0ba15784ce984165a9b3f8484","observation_id":"1bcd468c-9691-4cef-ad2d-f78d419acf2b","resolution":{"observed_at":"2026-08-07T15:23:01.487032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13458","last_updated":"2024-10-17T11:38:54Z","snapshot_observed_at":"2026-08-02T03:03:54.813092Z","submitted_at":"2024-10-17T11:38:54Z","title":"MedINST: Meta Dataset of Biomedical Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13458","snapshot_observed_at":"2026-08-07T15:23:01.588714Z","title":"MedINST: Meta Dataset of Biomedical Instructions // arXiv preprint arXiv:2410.13458","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.588714Z"},"links":{"cited_paper":"/paper/2410.13458","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:90bd1d22dd21bda93b8df90086f4f866c3d9a5a58fcb81cf4a9b5f9d9319aa24","observation_id":"7a5b2b43-06b5-4a4f-84c0-c711f0c589b4","resolution":{"observed_at":"2026-08-07T15:23:01.588714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02678","last_updated":"2024-10-03T17:04:48Z","snapshot_observed_at":"2026-08-07T07:21:28.700705Z","submitted_at":"2024-10-03T17:04:48Z","title":"Distilling an End-to-End Voice Assistant Without Instruction Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02678","snapshot_observed_at":"2026-08-07T15:23:01.636740Z","title":"Distilling an end-to-end voice assistant without instruction training data // arXiv preprint arXiv:2410.02678","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.636740Z"},"links":{"cited_paper":"/paper/2410.02678","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:924b33a49dfd7cde89b1aba1d17fed369990acc182a8e9a9cf2921ea5484c0e7","observation_id":"e9bebd05-8fbe-4d53-b74d-843f9e9c173f","resolution":{"observed_at":"2026-08-07T15:23:01.636740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14296","last_updated":"2026-05-15T15:43:44Z","snapshot_observed_at":"2026-08-03T01:16:22.778897Z","submitted_at":"2025-02-20T06:20:36Z","title":"On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14296","snapshot_observed_at":"2026-08-07T15:23:01.681691Z","title":"On the trustworthiness of generative foundation models: Guideline, assessment, and perspective // arXiv preprint arXiv:2502.14296","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.681691Z"},"links":{"cited_paper":"/paper/2502.14296","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:0d70ec5b2a68ee418cfa24f7a1ef047a4ba791a187e80e1781de8f6f370e1358","observation_id":"d85f12f6-46a1-4b49-9b75-10a68e8d8692","resolution":{"observed_at":"2026-08-07T15:23:01.681691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:01.726140Z","title":"Breaking Focus: Contextual Distraction Curse in Large Language Models // arXiv preprint arXiv:2502.01609","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.726140Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:fbc3fac63837d70674ea6fec496bad366d998364b2fbf85bc99a04352dcd0517","observation_id":"deab6ffb-3312-4d70-9c79-307d167e06cc","resolution":{"observed_at":"2026-08-07T15:23:01.726140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03556","last_updated":"2024-12-19T22:37:45Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:51:32Z","title":"Best-of-N Jailbreaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03556","snapshot_observed_at":"2026-08-07T15:23:01.792126Z","title":"Best-of-n jailbreaking // arXiv preprint arXiv:2412.03556","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.792126Z"},"links":{"cited_paper":"/paper/2412.03556","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ecc50fcec607d06370e39688a95054bcf06323959f882abd20bee8f26dbd68e4","observation_id":"2eb2895a-8b70-4ba9-a4b1-72f283573b16","resolution":{"observed_at":"2026-08-07T15:23:01.792126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08608","last_updated":"2024-12-11T18:30:57Z","snapshot_observed_at":"2026-08-05T01:04:08.700267Z","submitted_at":"2024-12-11T18:30:57Z","title":"AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08608","snapshot_observed_at":"2026-08-07T15:23:01.879152Z","title":"AdvWave: Stealthy Adversarial Jailbreak Attack against Large Audio-Language Models // arXiv preprint arXiv:2412.08608","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.879152Z"},"links":{"cited_paper":"/paper/2412.08608","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a56ef1deeb7d55236cad683e8783b1ecd95a3c02f680e1f8ef5ab43a486a737b","observation_id":"597f482d-0e88-42a5-94ce-f8a28a0ec0f2","resolution":{"observed_at":"2026-08-07T15:23:01.879152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.806884Z","title":"On generative spoken language modeling from raw audio // Transactions of the Association for Computational Linguistics","venue":null,"work_id":"883314a6-84b4-4618-acd1-97a25b15fdbf","year":2021},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.925562Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:fa063ec60936546e609002e7718f18e3928e030ba0e1fac9eee3d72b0435b7e8","observation_id":"0de53495-e92f-43d3-a20c-922b0e3ce738","resolution":{"observed_at":"2026-08-07T15:23:05.860628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:01.968676Z","title":"Appagent v2: Advanced agent for flexible mobile interactions // arXiv preprint arXiv:2408.11824","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.968676Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:405452229f7bc4315dfaea428f1793c54f7060e85c565a7611378be7bae8971d","observation_id":"364709af-c496-489e-a38a-8bb2476330c3","resolution":{"observed_at":"2026-08-07T15:23:01.968676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-07T00:42:49.627314Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-07T15:23:02.007476Z","title":"The unlocking spell on base llms: Rethinking alignment via in-context learning // arXiv preprint arXiv:2312.01552","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.007476Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:6d20b9a82c72b735086db6ae53f8086ebb451f0aa31f168169d876dc1a8e9196","observation_id":"081e9339-f6f7-42ea-9357-433d651db1c7","resolution":{"observed_at":"2026-08-07T15:23:02.007476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T15:23:02.108648Z","title":"Deepseek-v3 technical report // arXiv preprint arXiv:2412.19437","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.108648Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:e58fe1c90224ba74dc15fadbef8513c2b62f7352727ae1b3e8da1b8ccb024b59","observation_id":"e80b5488-f604-4a6e-9bf8-64e24c0699db","resolution":{"observed_at":"2026-08-07T15:23:02.108648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19064","last_updated":"2025-05-28T08:26:32Z","snapshot_observed_at":"2026-07-06T19:39:19.409512Z","submitted_at":"2024-10-24T18:17:16Z","title":"The Stepwise Deception: Simulating the Evolution from True News to Fake News with LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19064","snapshot_observed_at":"2026-08-07T15:23:02.176423Z","title":"From a tiny slip to a giant leap: An llm-based simulation for fake news evolution // arXiv preprint arXiv:2410.19064","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.176423Z"},"links":{"cited_paper":"/paper/2410.19064","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:cb6cd79f15783784c0e207d659c64d3439cd57e166e065536666660fe907d1b3","observation_id":"744829b7-db84-4717-ae27-c546e16a6251","resolution":{"observed_at":"2026-08-07T15:23:02.176423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.618405Z","title":"Semi-Supervised Audio Classification with Consistency-Based Regularization","venue":null,"work_id":"491581f0-2cdc-4787-a39e-e8f14b71b259","year":2019},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.217670Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:753d7e4bef867c61bfea3734a49159fd654b2ab1130fbe3fd6c1257ea5eda6fa","observation_id":"9b5bae6b-6cc0-442f-9763-014445911a9e","resolution":{"observed_at":"2026-08-07T15:23:05.711665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T15:23:02.306051Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM // arXiv preprint arXiv:2305.15255","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.306051Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d6318b682406e1c7e22ccdddff03dbb25a62e62e4c5e549477733d94d1b63423","observation_id":"ca56d13a-6ae1-47f2-8bb2-cbfae82600fe","resolution":{"observed_at":"2026-08-07T15:23:02.306051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.418075Z","title":"GPT-4o System Card","venue":null,"work_id":"6e17c83c-e4d9-4f91-950a-057e8f6698de","year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.385978Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:83f0cf1d8172a7032b5b013c31f17033b00849bcdc13066bd574999cc62bc51a","observation_id":"9bf90d67-6483-4171-9319-5c844864419e","resolution":{"observed_at":"2026-08-07T15:23:05.493281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.228544Z","title":"Robust speech recognition via large-scale weak supervision // International conference on machine learning","venue":null,"work_id":"ed6568c6-a026-4b96-99b2-b5a3355cbf54","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.427147Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:db1b4ef14d4d6f8b1dc05e8120998c16c29a06cf405548bc86ccebd3975dd9b2","observation_id":"c6f8883c-a238-4374-a738-f4a48ca2e6ee","resolution":{"observed_at":"2026-08-07T15:23:05.293333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:23:02.488545Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context // arXiv preprint arXiv:2403.05530","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.488545Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:316343e7ceadf065d93270dba15e01cb1aa95e95f67b361f1a87983cdf9a56df","observation_id":"b15cb1dd-8681-4a9b-9144-e7b62a26388e","resolution":{"observed_at":"2026-08-07T15:23:02.488545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T15:23:02.574675Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks // arXiv preprint arXiv:1908.10084","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.574675Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:9eae360bc219180455fe3244df972724d9cbcf6862a064d3cc5cf567f3eac5e8","observation_id":"685266cb-e724-4002-aa77-91c78b6438ee","resolution":{"observed_at":"2026-08-07T15:23:02.574675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-07-06T16:03:34.432602Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-07T15:23:02.652356Z","title":"do anything now","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.652356Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:b77948baf8766629efeb2c0412dadddad17a0600689b4e9352ea7433ea0d0270","observation_id":"07f45772-dcd5-4b4f-b063-9b2910745024","resolution":{"observed_at":"2026-08-07T15:23:02.652356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19103","last_updated":"2024-05-29T14:07:44Z","snapshot_observed_at":"2026-08-08T08:50:38.659737Z","submitted_at":"2024-05-29T14:07:44Z","title":"Voice Jailbreak Attacks Against GPT-4o","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19103","snapshot_observed_at":"2026-08-07T15:23:02.718736Z","title":"Voice Jailbreak Attacks Against GPT-4o // arXiv preprint arXiv:2405.19103","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.718736Z"},"links":{"cited_paper":"/paper/2405.19103","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:eb4ba3308ed4d5995fa1e0cc05c75b78c679c6d69e2a1e9441b7ee98611d91f9","observation_id":"70fada26-c9f2-497b-be8e-ad7fecc34ae4","resolution":{"observed_at":"2026-08-07T15:23:02.718736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18074","last_updated":"2025-03-23T13:04:57Z","snapshot_observed_at":"2026-07-06T18:06:36.637559Z","submitted_at":"2024-04-28T05:33:15Z","title":"MMAC-Copilot: Multi-modal Agent Collaboration Operating Copilot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18074","snapshot_observed_at":"2026-08-07T15:23:02.806149Z","title":"Mmac-copilot: Multi-modal agent collaboration operating system copilot // arXiv preprint arXiv:2404.18074","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.806149Z"},"links":{"cited_paper":"/paper/2404.18074","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:fe151ecfe610003cb4a51bd9969a8a7d9c3d99383902d41f4be69c5b9847a4b4","observation_id":"2bbd188d-7258-4011-9421-be4bef6806dd","resolution":{"observed_at":"2026-08-07T15:23:02.806149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00781","last_updated":"2024-10-16T19:29:14Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-10-16T19:29:14Z","title":"Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00781","snapshot_observed_at":"2026-08-07T15:23:02.864812Z","title":"Hazards in Daily Life? Enabling Robots to Proactively Detect and Resolve Anomalies // arXiv preprint arXiv:2411.00781","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.864812Z"},"links":{"cited_paper":"/paper/2411.00781","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:c2eb03256cb5b1eb0733b0be61dcef574af96b279b64eda350618dd678280668","observation_id":"aa19044d-0fb0-4ca3-b729-09d96db6621a","resolution":{"observed_at":"2026-08-07T15:23:02.864812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10708","last_updated":"2025-08-30T11:17:17Z","snapshot_observed_at":"2026-08-07T18:16:13.553574Z","submitted_at":"2025-02-15T07:43:43Z","title":"Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10708","snapshot_observed_at":"2026-08-07T15:23:02.924153Z","title":"Injecting Domain-Specific Knowledge into Large Language Models: A Comprehensive Survey // arXiv preprint arXiv:2502.10708","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:02.924153Z"},"links":{"cited_paper":"/paper/2502.10708","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:374778975ed7fb7464f04dd62ce59813f8b3d88a7d3459b7e0b8c01c712beb02","observation_id":"72687450-45bb-4fad-819c-71493aae0c64","resolution":{"observed_at":"2026-08-07T15:23:02.924153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:03.023360Z","title":"Geolocation with Real Human Gameplay Data: A Large-Scale Dataset and Human-Like Reasoning Framework // arXiv preprint arXiv:2502.13759","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.023360Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:16b8ddcd872d034e613f8ae4eb9f71c10bc8f719cf2afbf3aaab7eb8e577c928","observation_id":"a940e22c-b5cf-4a0c-8454-71bab046d0e9","resolution":{"observed_at":"2026-08-07T15:23:03.023360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-07T15:23:03.080825Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs // arXiv preprint arXiv:2407.04051","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.080825Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:4f095653f2eff8b62a45394c86a60d5b3612a276b181cbc202b3cdd4fdab3bc0","observation_id":"c7aa87d2-76f0-434a-bbbf-bd1f5efc4938","resolution":{"observed_at":"2026-08-07T15:23:03.080825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:05.093080Z","title":"Uncertainty-aware audiovisual activity recognition using deep bayesian variational inference // Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"1dcff80b-7dc8-4bda-ae7f-3fc3064964e5","year":2019},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.151665Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:7deaf863ff14f4a3abd1b3a5a796e3d30ad11e8994dfb508b3ffd783b1c20c2d","observation_id":"e79854be-f6b5-4ec1-b729-de796a11c984","resolution":{"observed_at":"2026-08-07T15:23:05.176210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T15:23:03.204970Z","title":"Salmonn: Towards generic hearing abilities for large language models // arXiv preprint arXiv:2310.13289","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.204970Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:3ed1fca3111f5387cb3b413ed54a5e9f2cf1901add447c7b9b6f9c7586866737","observation_id":"9ee6abce-ebcb-4242-83c9-4d258b3341c5","resolution":{"observed_at":"2026-08-07T15:23:03.204970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01714","last_updated":"2025-03-03T16:31:45Z","snapshot_observed_at":"2026-08-07T17:33:08.982744Z","submitted_at":"2025-03-03T16:31:45Z","title":"Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01714","snapshot_observed_at":"2026-08-07T15:23:03.261377Z","title":"Word Form Matters: LLMs' Semantic Reconstruction under Typoglycemia // arXiv preprint arXiv:2503.01714","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.261377Z"},"links":{"cited_paper":"/paper/2503.01714","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d9e4fa640bb5dfd495980b6e6f8ed8b011951fe213374dad6b6429d1ba28abc6","observation_id":"3d668558-ce22-46b3-8aa0-da12d6dc8533","resolution":{"observed_at":"2026-08-07T15:23:03.261377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T15:23:03.314763Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation // arXiv preprint arXiv:2305.16107","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.314763Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:0ec281c183f64dbfffdaa7983a364bf948a091b48bf07439205850e1cd992f7f","observation_id":"4f65ed92-a07d-4eba-b903-d475e502c3ad","resolution":{"observed_at":"2026-08-07T15:23:03.314763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.985859Z","title":null,"venue":null,"work_id":"2796f45f-0f52-4a51-b4cf-7902dc0288e7","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.372586Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a33ce1d57b9d05811602cf4bc1f7addcc82e374810df65bcf5e3396f91792b32","observation_id":"1929dd54-4ffb-41f3-8da3-c6abc5681a79","resolution":{"observed_at":"2026-08-07T15:23:05.034694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11127","last_updated":"2026-05-31T18:23:52Z","snapshot_observed_at":"2026-07-06T15:18:30.127408Z","submitted_at":"2023-04-21T17:02:38Z","title":"Tree-Structured Parzen Estimator: Understanding Its Algorithm Components and Their Roles for Better Empirical Performance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11127","snapshot_observed_at":"2026-08-07T15:23:03.437115Z","title":"Tree-structured parzen estimator: Understanding its algorithm components and their roles for better empirical performance // arXiv preprint arXiv:2304.11127","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.437115Z"},"links":{"cited_paper":"/paper/2304.11127","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:8116893ebf8e0ad19c58cd2dcd3501a8149024084c6083fff4d5bbfccd22dc77","observation_id":"eb6fa4e2-26a0-45e8-97e8-974bf38c77fb","resolution":{"observed_at":"2026-08-07T15:23:03.437115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.854702Z","title":"On decoder-only architecture for speech-to-text and large language model integration // 2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)","venue":null,"work_id":"b0e84d2e-7521-4d5b-b118-da14b720e9d1","year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.497543Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:ee039a426b0bf1fd91851bcd51d2b4f926a664ac663882d527db75d2521d92fb","observation_id":"cab37f51-1b86-434f-9f0c-d6261bc06c5d","resolution":{"observed_at":"2026-08-07T15:23:04.914786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-07T15:23:03.563984Z","title":"Next-gpt: Any-to-any multimodal llm // arXiv preprint arXiv:2309.05519","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.563984Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:1a1dfd2256d93fa9ae584621bcc6fd60b3733d79ba4e66210c2960c66c588d2d","observation_id":"489727a3-afcd-4908-9d9c-f9f8f5e0b8df","resolution":{"observed_at":"2026-08-07T15:23:03.563984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:03.611324Z","title":"Tune In, Act Up: Exploring the Impact of Audio Modality-Specific Edits on Large Audio Language Models in Jailbreak // arXiv preprint arXiv:2501.13772","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.611324Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:2a145a51c33a10fdbef0aef260f13a30930c3ddbbb6eda2bb069ac4d0f67a600","observation_id":"7715cdcd-02e7-4453-8ff8-6f024434de7c","resolution":{"observed_at":"2026-08-07T15:23:03.611324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:04.738624Z","title":"MedTrinity-25M: A Large-scale Multimodal Dataset with Multigranular Annotations for Medicine","venue":null,"work_id":"565833ac-e0e1-46eb-a52a-f87abe34793f","year":2025},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.684965Z"},"links":{"citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:1ae96d356011034dcb035939f604613074c43e860461c30c0335d5ccba70bf74","observation_id":"5b6bc949-bb67-4e16-ae07-5c37c9392648","resolution":{"observed_at":"2026-08-07T15:23:04.785627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T15:23:03.760260Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming // arXiv preprint arXiv:2408.16725","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.760260Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:a30d5ea79feb7b1feddcc9316e21fcd4900aae8d576401386c1e043fbad4823c","observation_id":"ac45c727-7552-4005-bf59-aa94ff80e20f","resolution":{"observed_at":"2026-08-07T15:23:03.760260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23861","last_updated":"2024-10-31T12:11:17Z","snapshot_observed_at":"2026-07-06T19:42:51.617598Z","submitted_at":"2024-10-31T12:11:17Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23861","snapshot_observed_at":"2026-08-07T15:23:03.832495Z","title":"Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models // arXiv preprint arXiv:2410.23861","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.832495Z"},"links":{"cited_paper":"/paper/2410.23861","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d55f8f007b0d8cfff3d0657c588194923793ccacac4f4413ebc7a2a0083f37db","observation_id":"2c8a081b-e87f-4448-8d6b-83e182e5bd67","resolution":{"observed_at":"2026-08-07T15:23:03.832495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06302","last_updated":"2024-07-03T00:51:21Z","snapshot_observed_at":"2026-08-04T06:08:32.233717Z","submitted_at":"2024-06-10T14:18:56Z","title":"Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06302","snapshot_observed_at":"2026-08-07T15:23:03.879687Z","title":"Unveiling the Safety of GPT-4o: An Empirical Study using Jailbreak Attacks // arXiv preprint arXiv:2406.06302","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.879687Z"},"links":{"cited_paper":"/paper/2406.06302","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:f754cde5a3ed42bd64e1e5108009ef52d9fa693bdf64305451d5af22a277b091","observation_id":"bf0da2a0-4557-45b0-87f0-095555012f49","resolution":{"observed_at":"2026-08-07T15:23:03.879687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T15:23:03.939492Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities // arXiv preprint arXiv:2305.11000","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:03.939492Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:aca7882ec7833dc4bb797b336d7da248ad0dd9d6938f994989a46b532da4feb1","observation_id":"3779bbc0-9a67-4738-bbb6-19f27823bcf2","resolution":{"observed_at":"2026-08-07T15:23:03.939492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T15:23:04.010212Z","title":"Universal and transferable adversarial attacks on aligned language models // arXiv preprint arXiv:2307.15043","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:04.010212Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:d33dd4caf5b104d9f7d0c076989f6ad965cca3eb3708cf63125d77ff4ea5497f","observation_id":"b46e04f3-5895-4420-9e00-c87e2cbd00e0","resolution":{"observed_at":"2026-08-07T15:23:04.010212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 9 inbound Pith citation observations for arXiv:2505.15406."}