{"as_of":"2026-08-13T04:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5ec6a5bdf6cb6925975102834292d37497280ef12dc2396598c48121a62fd57","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:53:50.291447Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:08:53.614645Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T13:01:24.303798Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14842","snapshot_observed_at":"2026-08-07T04:08:53.614645Z","title":"arXiv preprint arXiv:2411.14842 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11521","last_updated":"2025-06-13T07:22:36Z","snapshot_observed_at":"2026-08-07T12:06:46.005829Z","submitted_at":"2025-06-13T07:22:36Z","title":"Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-08-07T04:08:53.614645Z"},"links":{"cited_paper":"/paper/2411.14842","citing_paper":"/paper/2506.11521"},"observation_digest":"sha256:f3280232f5d598662cf972d80d84e6d86f97183b257747704578e4d79170997f","observation_id":"5fc71e28-71a2-4d99-8525-194bb4fceb9a","resolution":{"observed_at":"2026-08-07T04:08:53.614645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2411.14842","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14842","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Who can withstand chat-audio attacks? an evaluation benchmark for large language models","venue":null,"work_id":"ea0b654c-7d41-4666-8d38-645409da8879","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2411.14842","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:e328317aa0b0f7a042b4d8fd86dd8f0b4ff5f14889e22610fd6a9c8207398d30","observation_id":"7cf92bd0-5ea8-4629-95ae-e39e65d899e1","resolution":{"observed_at":"2026-05-18T13:01:24.305685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14842/citation-record","integrity":"/paper/2411.14842/integrity","json":"/paper/2411.14842/citation-record.json","paper":"/paper/2411.14842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.181090Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.181090Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:11349b6af2e4c653855a492732f12c3357514fab082678afba72ef2bf2a1860d","observation_id":"ba5d5b06-610e-45d7-b0b0-45b07683fe57","resolution":{"observed_at":"2026-08-12T14:53:50.181090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.184464Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.184464Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2cfbbded90422df2cf50d5e720f3d8f62cc6bf0093fff248b8226e4b7826dc98","observation_id":"10b626ae-cc60-4653-99b9-08db4fc775d5","resolution":{"observed_at":"2026-08-12T14:53:50.184464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.559691Z","title":"https://mindgard.ai/resources/audio-based-jailbreak-attacks-on-multi-modal-llms?hs_amp=true Audio-based jailbreak attacks on multi-modal llms","venue":null,"work_id":"46a4cc68-69cd-4129-a9bb-b391d13d1b82","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.187536Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:735536fae5b4e9216b58c1d4b178e566c9df4427aee86c267bb7dca46c62a321","observation_id":"03958182-a0ae-4e07-9242-fe66ca3dda32","resolution":{"observed_at":"2026-08-12T14:53:50.562562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:53:50.190254Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.190254Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b23f3a1e55edc52d4e3214e8fb8669761323f7fc8479ef1a7e2bf8f8b53821b3","observation_id":"648746cc-f3a7-46ef-b7e1-a66bf1f98a50","resolution":{"observed_at":"2026-08-12T14:53:50.190254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T14:53:50.193004Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.193004Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:f8e84ded355e285ad36b17c192f10c178560a81050e7befe00279922442ac8c3","observation_id":"cc86c316-5d8f-44fe-a60a-5e5e3d4e7047","resolution":{"observed_at":"2026-08-12T14:53:50.193004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-02T01:30:06.675966Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-12T14:53:50.195710Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.195710Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8927a463556cb31d34a933372e610f62c6b8cd3a007821df683ea56afe88d8ac","observation_id":"37f13612-8d29-464a-83c4-2f0d060d96c6","resolution":{"observed_at":"2026-08-12T14:53:50.195710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.552436Z","title":null,"venue":null,"work_id":"546b0e80-5f5e-45dd-8157-41613a88fe75","year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.198493Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:6ffa4349333d6c6f7ba28540f0986c1d8a9cbdf021340d241b4268a855620892","observation_id":"96eff583-1f1d-48ee-b94c-d9ee0a3e4208","resolution":{"observed_at":"2026-08-12T14:53:50.555001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-03T10:34:58.776935Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-12T14:53:50.200951Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.200951Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:cdc88ed208e91feca8925521077755938f74506a6fc591e70ffae353064130f9","observation_id":"fcf0152e-b1f2-4192-95ba-797a2a41b387","resolution":{"observed_at":"2026-08-12T14:53:50.200951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-12T14:53:50.203848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.203848Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:aa0cdb19e31c8a2d06a8d147c2d9e9df51edfd0f3fb8a3e26a212d4ab3d95355","observation_id":"d0cc565e-8671-4409-8d88-c0eef7461e5c","resolution":{"observed_at":"2026-08-12T14:53:50.203848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-12T22:47:34.452271Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T14:53:50.206384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.206384Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:dbe562f407ffc5d5f2cb1bdc3db08f39ccf62b986e40d108ad386ae4f7835ea8","observation_id":"b9dd0ca6-42d6-4fdf-8f04-b1419870419b","resolution":{"observed_at":"2026-08-12T14:53:50.206384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.209199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.209199Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:9fe80ccd4128cf1ad4dd6179c4351124bf0430dd2ff409112348d7b93788f21a","observation_id":"627023ff-a988-4368-a316-a63aa45e0422","resolution":{"observed_at":"2026-08-12T14:53:50.209199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.03280","last_updated":"2019-01-11T06:57:33Z","snapshot_observed_at":"2026-07-06T06:08:32.009246Z","submitted_at":"2017-11-09T07:41:53Z","title":"Crafting Adversarial Examples For Speech Paralinguistics Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.03280","snapshot_observed_at":"2026-08-12T14:53:50.211503Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.211503Z"},"links":{"cited_paper":"/paper/1711.03280","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:21739c6da3458d6357243e30db7d84fd175c46c8737a1c732b4c49c34393a071","observation_id":"486790f9-0b5a-40f8-afbc-20ba81c3b34b","resolution":{"observed_at":"2026-08-12T14:53:50.211503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-12T14:53:50.214015Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.214015Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:c919a46b0ad5b3a12af7e5a75eb0ea3e791638f820d906d05752f9c184379a2e","observation_id":"a7406b9c-ca49-476d-83c2-231ae9e05159","resolution":{"observed_at":"2026-08-12T14:53:50.214015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.216630Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.216630Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:d41e7eaeb11d813fafc277c942e22d8bb6846b2a9686cf9d04f5f796b484ff05","observation_id":"477936b0-7483-4144-a6dc-0903cd6b9dd3","resolution":{"observed_at":"2026-08-12T14:53:50.216630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.537027Z","title":null,"venue":null,"work_id":"d96fcd87-f99e-48f6-8333-a1331828baa1","year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.218844Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:9eb5d79334e1d91294406cda88cc0a71fb9d74a1e065a38b2a0201c32017d328","observation_id":"bc1c7d80-3e03-47e2-815f-e82673e8cd43","resolution":{"observed_at":"2026-08-12T14:53:50.539989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.529034Z","title":null,"venue":null,"work_id":"a9feb79c-67d2-480f-82cc-83ced91e7cc6","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.221167Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:e556ea27b91b5f163d7aeaef5a273edb10701aea1521930f709035353368ebb5","observation_id":"42422993-fcd3-4c08-b84e-3dd72e361457","resolution":{"observed_at":"2026-08-12T14:53:50.531981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.223514Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.223514Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2823e012fc03b21315950a4fc3a07b3e72fc707df60bf616d3c4b5606923b66c","observation_id":"222b03e1-8048-4644-bdb2-827943b144b8","resolution":{"observed_at":"2026-08-12T14:53:50.223514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14642","last_updated":"2021-07-30T14:07:49Z","snapshot_observed_at":"2026-08-12T20:22:35.248289Z","submitted_at":"2021-07-30T14:07:49Z","title":"Practical Attacks on Voice Spoofing Countermeasures","version":1},"cited_work":{"arxiv_id":"2107.14642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.14642","snapshot_observed_at":"2026-08-12T14:53:50.373411Z","title":"Practical Attacks on Voice Spoofing Countermeasures","venue":"cs.CR","work_id":"c3f09c97-b4ab-4715-abc1-11a36fe19dce","year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.225865Z"},"links":{"cited_paper":"/paper/2107.14642","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:07e3048bcbd4628ba371a2c5461ffb8cc0b932694cfb9ac64dca7d040c5160eb","observation_id":"60bab187-7eec-47aa-bbee-82ed448c3745","resolution":{"observed_at":"2026-08-12T14:53:50.378095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.516885Z","title":null,"venue":null,"work_id":"01300c39-d24f-4191-97b1-72e6b8e5a8a4","year":2015},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.228627Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:ad6f508bbac0ecb9343e66f8c110c0510da68d991001ffeaae5dd5a5746c522d","observation_id":"11b5b3a4-84e1-4dd1-b689-04f7dd265e23","resolution":{"observed_at":"2026-08-12T14:53:50.519528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.509644Z","title":null,"venue":null,"work_id":"f0caca51-33d6-4bd7-b64d-2570f5974cf8","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.230799Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:826d449cfc29257c324d3f5bbb260db22ed649caa1435e98755c1bcb5eed4e15","observation_id":"7795793c-73df-4ed6-80c1-8a583cd36271","resolution":{"observed_at":"2026-08-12T14:53:50.512298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.233179Z","title":"o pf, Yannic Kilcher, Dimitri von R \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.233179Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:936fc818884fcf81dfced9e79d86eb0fb82570d1eba3bec6b87f0db0cecc34b1","observation_id":"e0bb5fff-4783-4c6e-a3a4-eda8094b08b7","resolution":{"observed_at":"2026-08-12T14:53:50.233179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.235548Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.235548Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:1e14ed6af396b3d893da042b9d997e37b2fd36f492046bff7cb8a8df0166b09e","observation_id":"43218a79-3d53-46e9-8701-1f2bce8624e5","resolution":{"observed_at":"2026-08-12T14:53:50.235548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.237798Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.237798Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:a29153ef85b58810197ab9ece6170da579312e321ca0ad152e651ce6c46414a2","observation_id":"38bf092c-26d5-4826-bb45-b7eb49dcc8c1","resolution":{"observed_at":"2026-08-12T14:53:50.237798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-12T14:53:50.240142Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.240142Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:f183180793151762e17fe8542561464cdb066afa2be45dfa4c0d3ca2e6af5fcd","observation_id":"f25f35c9-0600-405d-854c-58c93ff06b6e","resolution":{"observed_at":"2026-08-12T14:53:50.240142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-08-09T12:20:45.396771Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-12T14:53:50.242789Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.242789Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:4a8a865bf7738d6c2cc2f54a472885805c768bee32f7b446d877c9ee95ed70b1","observation_id":"3d40e55a-6c83-4881-bc8c-648778f03a46","resolution":{"observed_at":"2026-08-12T14:53:50.242789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.245376Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.245376Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:7f05eb42397d04a74c538419360c59b1c4a0edffd6870df9e56fde8799c49bd6","observation_id":"bd491c59-430d-4cb9-acc9-46c016f2f114","resolution":{"observed_at":"2026-08-12T14:53:50.245376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.487649Z","title":null,"venue":null,"work_id":"1f460773-c4cb-4439-bc17-f671ff9a791b","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.247705Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:c5e073a6c380e2d5ddca3b16343cc9ceb7c1e0dc4bf9d25f2f8a02dfb148e4cc","observation_id":"dfa25e81-5557-42c7-b925-8def239575c5","resolution":{"observed_at":"2026-08-12T14:53:50.490297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03828","last_updated":"2019-08-15T05:15:43Z","snapshot_observed_at":"2026-08-01T00:27:10.219357Z","submitted_at":"2019-05-09T19:35:30Z","title":"Universal Adversarial Perturbations for Speech Recognition Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03828","snapshot_observed_at":"2026-08-12T14:53:50.250123Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.250123Z"},"links":{"cited_paper":"/paper/1905.03828","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:b4d416a17cb4fbbbe4c4b9abdd57f1d60986b24160a4316f51fae3e72f749dbc","observation_id":"f2dfba72-681a-42a7-9238-80a840cd5757","resolution":{"observed_at":"2026-08-12T14:53:50.250123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.480360Z","title":null,"venue":null,"work_id":"2cd31441-19df-4736-a91e-bb683804f56b","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.252728Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:5a2c07c9873a928eebcfbfe8d99a618144212598c98865756a36df9e9255ec12","observation_id":"b11c9d48-3d80-42e9-93a1-58213be636e4","resolution":{"observed_at":"2026-08-12T14:53:50.482953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-09T15:41:11.041317Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-12T14:53:50.255144Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.255144Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:52e72fcfd472d6c78901140271cb914c814959fca4811d02181bb181dccfc69d","observation_id":"f9366436-e76f-4f1f-8760-ae3355f798c9","resolution":{"observed_at":"2026-08-12T14:53:50.255144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.257739Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.257739Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:12799a5476c36cbc5a5fc380602506be977fe1d486099fdf81719e6a6635c5bf","observation_id":"d719191c-745e-40de-9674-334d7756c878","resolution":{"observed_at":"2026-08-12T14:53:50.257739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-12T14:53:50.260054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.260054Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:abcd6a8416d7ada2b0fe3bd5358bb0aa34f9e38fda8fa2b1a7667d3cfc380b2b","observation_id":"e29aff72-4f58-4383-a4eb-300dc7d3922f","resolution":{"observed_at":"2026-08-12T14:53:50.260054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.262421Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.262421Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:94a9b02955a9738e813d4a1f5425cb4cb85cc8fa6a10d2ddc7d92e5a4bf3b898","observation_id":"28da6201-a48e-4fca-b5d3-aa3929698ff2","resolution":{"observed_at":"2026-08-12T14:53:50.262421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10844","last_updated":"2023-10-16T21:37:24Z","snapshot_observed_at":"2026-08-11T04:10:50.839613Z","submitted_at":"2023-10-16T21:37:24Z","title":"Survey of Vulnerabilities in Large Language Models Revealed by Adversarial Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10844","snapshot_observed_at":"2026-08-12T14:53:50.264719Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.264719Z"},"links":{"cited_paper":"/paper/2310.10844","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:3dc42e358626b83e630b85636aff292d1124a76f6e09f8334ef4045ae9db8278","observation_id":"6563df85-7341-406a-860c-5133be0ec1cd","resolution":{"observed_at":"2026-08-12T14:53:50.264719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.465055Z","title":null,"venue":null,"work_id":"dfc1c64d-fbb5-468f-af09-094fd5f2f857","year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.267548Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2663a215bf6ff3280d469caeb03fddb6ecb2fc8ef50068834edf290c38aef966","observation_id":"0d80c757-b79b-4f3a-80e6-be0e7c0472e9","resolution":{"observed_at":"2026-08-12T14:53:50.467619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-12T14:53:50.269950Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.269950Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:e4503397f398a056c14bd65acba4302c45e7387117fe9d9cc58ee29de12da26e","observation_id":"eb30e7a8-8cb1-4b0d-aebd-af82e3ce047a","resolution":{"observed_at":"2026-08-12T14:53:50.269950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-12T14:53:50.272249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.272249Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:c0c17ea6e657e587e220989a305e7584170605c7397b4b3bac1848b9b2803db1","observation_id":"8e68ac8a-b0bc-4e98-8101-4533f3045b4e","resolution":{"observed_at":"2026-08-12T14:53:50.272249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.457811Z","title":null,"venue":null,"work_id":"1f919539-2a2a-4274-b4e6-b5382b3d35a7","year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.274792Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2b4b31acda55f0c110869a45e54694f07f51fee94d6a53c64a53a19bd8d49a89","observation_id":"34cbb73a-4218-4fa6-bdb3-3f9828aa8201","resolution":{"observed_at":"2026-08-12T14:53:50.460451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11196","last_updated":"2019-08-25T23:11:07Z","snapshot_observed_at":"2026-08-10T16:55:05.317569Z","submitted_at":"2019-01-31T03:20:52Z","title":"EDA: Easy Data Augmentation Techniques for Boosting Performance on Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11196","snapshot_observed_at":"2026-08-12T14:53:50.277008Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.277008Z"},"links":{"cited_paper":"/paper/1901.11196","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:2547c62d539b76d3f4cd984b8c2c262689280f525c33a5c1436aa3f7ba7509fa","observation_id":"9973a1e1-1a7e-4873-b5cd-f824c26b7f68","resolution":{"observed_at":"2026-08-12T14:53:50.277008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.279212Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.279212Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:e51d7f8b4d6a766dfebb31742264b16d14f7a0731a161a685919acd3f74b92fa","observation_id":"dcf30d46-b378-44b1-b844-e9e79cd55611","resolution":{"observed_at":"2026-08-12T14:53:50.279212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.446570Z","title":null,"venue":null,"work_id":"e67662ff-9f75-43c0-b4ac-93adc6951e72","year":2021},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.281571Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:f8b7a879daa75ee2052b583c4e49828a65a87ba79ebbb8fa0880d10712399217","observation_id":"2845429d-25e5-4aa7-a5da-d30a9c8155a6","resolution":{"observed_at":"2026-08-12T14:53:50.449323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.439222Z","title":null,"venue":null,"work_id":"343058c0-120a-426b-96e3-43f7f1a29121","year":2020},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.284062Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:ae82ab8224683ec66e984764dee2553eacd34c93ceba5f38237dfffa1f54f801","observation_id":"24ad5ad3-8b5a-4d78-804e-b78ca199ed99","resolution":{"observed_at":"2026-08-12T14:53:50.441791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-12T14:53:50.286582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.286582Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:aaacdceeb3f729af563300d71fcc53cae256144828601f79e95a7e7b74b2183c","observation_id":"a6fc6891-7878-449c-ad9a-34aa68a21cc8","resolution":{"observed_at":"2026-08-12T14:53:50.286582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.431891Z","title":null,"venue":null,"work_id":"451910d5-2dcb-4104-a2ee-aae7d63df564","year":2022},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.289070Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:8291331617fdc77500402ac575154cbedd016ded1ccfaccdd63ce74abf060c6e","observation_id":"4dc5f1dd-5a8f-4ef7-ad56-ec30331b9091","resolution":{"observed_at":"2026-08-12T14:53:50.434539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:53:50.291447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.291447Z"},"links":{"citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:95f89b2b091d906246b19a43671035b10d53beecae8029430a9e3c423f15acdb","observation_id":"39a28f5e-ad5d-4226-9991-0e9a31096deb","resolution":{"observed_at":"2026-08-12T14:53:50.291447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T14:46:24.285592Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2411.14842."}