{"as_of":"2026-08-04T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45ae503fca4d2e167e6ba25b869ee8187382a854a2595644050ac8be3efdc77b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T18:57:28.666194Z","state":"measured"},{"denominator":137,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":137,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":120,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T03:03:32.342985Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:27:36.579792Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:14:45.371564Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2407.10759"},"observation_digest":"sha256:d094eb10c187dfc0d4692bc5d0ea311b6ed3785f600c179db1d7be345826811e","observation_id":"1fce556b-0194-4d5f-9565-dc42f0d4f564","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:4959ea82c1c01f82250cafb4e66df6e39bff5b9ff755893c14a47b0596290e39","observation_id":"23e023fc-61b4-45fd-a4c8-b6b1a7d5011d","resolution":{"observed_at":"2026-05-17T00:50:13.957823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:5e40910c115d2e40b7004dbb87a01c5e644ade3f629b9b41ee9f6667e8e322b7","observation_id":"af400f69-26f3-42aa-8581-4de09686fd5e","resolution":{"observed_at":"2026-05-16T03:53:47.586781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:4ea10f64797066fad4cd1d1b90ed83f06871b217ba5a2823af3d4da9aa66d577","observation_id":"5a11210e-e87e-4a6c-b8c7-d7f1f4be233d","resolution":{"observed_at":"2026-05-17T05:53:26.220877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:551e677af8a2c452d81b6d58cf008a132bec55c3aded943220a05455f74cd890","observation_id":"fee4a322-b101-4a6d-8353-d3e47ddd677e","resolution":{"observed_at":"2026-05-15T17:18:53.363845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:e87471953fb8dd9a888007ec40015aa61060d90c4a6a25f02e3230a7c29c06ac","observation_id":"f7f4e2d5-eef8-4afe-ac6e-be2886e2d488","resolution":{"observed_at":"2026-05-22T20:45:08.215895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:77e8be1990bab4105c52d15f99bdcc6ea214617b7d614ca84df35d8f4ceec5b4","observation_id":"069f554c-bd79-4cfd-a636-58f85cf251ce","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.13777","last_updated":"2026-04-11T05:01:03Z","snapshot_observed_at":"2026-07-06T21:26:40.118249Z","submitted_at":"2025-05-19T23:36:04Z","title":"Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T13:38:17.640841Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.13777"},"observation_digest":"sha256:719188f1852809f723b296e18d54d8fba0b0f7e33a7a5169f42122dafdc185cc","observation_id":"a68178db-90bf-4a1b-a8a9-5ee404ebe3b1","resolution":{"observed_at":"2026-05-22T13:41:36.647489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:7281159304cb4e41b3faa5e39e1c60758ad6b984b01f0a28aa8693e9c15bf59b","observation_id":"8b25ced2-3437-4776-af5b-64709d4dc2ab","resolution":{"observed_at":"2026-05-17T03:46:06.391139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:40.245908Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.18719"},"observation_digest":"sha256:7e703eb788e08e3f56929920d7ced6609aba1e2150d24cc3e6ebea344aff0ceb","observation_id":"2f947a66-9d89-4f63-8508-05c68e9a5cdb","resolution":{"observed_at":"2026-05-16T12:55:40.434915Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-19T12:01:42.681135Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.03610"},"observation_digest":"sha256:dbbbff9dd2797124d1eafa0d3056bac81ec09d448678f3c17257a718d63e3431","observation_id":"bb4ccade-bec5-4864-aff7-30c54bb5815c","resolution":{"observed_at":"2026-05-19T12:02:16.689598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:6580924198419c0f910dde39e892a012c209915bd10851a26e2b79ea9d0c8852","observation_id":"a85c5273-a4ad-4bb3-83da-cfd9fe8cb236","resolution":{"observed_at":"2026-05-16T05:59:50.980061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:afc60337505eb62deaa8738103d6bd149f1da85c59669ca638efbb6f0136bc46","observation_id":"5ba525c0-e879-4e1c-ac0c-dfc514a71efe","resolution":{"observed_at":"2026-05-19T02:41:59.607161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-07-06T22:23:05.533901Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:ac1c7eac0a02886e2a9086716569aa15d078422087ace76cea9bbf1daf194715","observation_id":"9459bfa7-63e8-4767-b177-81c377a0642e","resolution":{"observed_at":"2026-05-21T22:24:23.487552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.15692","last_updated":"2026-05-05T10:00:46Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-19T07:12:18Z","title":"Direct Simultaneous Translation Activation for Large Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:30:39.575148Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.15692"},"observation_digest":"sha256:823b46ef6477647d8adea3a5675a04a432c65438bfb39e7620b7cfed998f96e5","observation_id":"dd84d51e-7157-4d6f-a6f6-17f81ad08e06","resolution":{"observed_at":"2026-05-18T16:31:36.817162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.16248","last_updated":"2026-06-29T23:42:05Z","snapshot_observed_at":"2026-08-02T00:11:32.547707Z","submitted_at":"2025-09-17T17:15:35Z","title":"GraphMend: Code Transformations for Fixing Graph Breaks in PyTorch 2","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T16:04:29.215393Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.16248"},"observation_digest":"sha256:234a850b4f86e2b3219ed399276ece7fda923c905cf5c8d519b6af93fbecf01c","observation_id":"a15dbc66-93b9-4f32-825e-c029cb124bea","resolution":{"observed_at":"2026-05-18T16:06:35.002150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T00:20:37.406351Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.17765"},"observation_digest":"sha256:aeaf974d0e540e0920e93b9c8942272cd969c8ec575417953e1c81e60e051595","observation_id":"f87db4fa-bc05-4d2f-8cab-d25c11610b5e","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2509.20641","last_updated":"2026-02-02T15:29:03Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-25T00:56:35Z","title":"Investigating Modality Contribution in Audio LLMs for Music","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T22:46:49.051113Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.20641"},"observation_digest":"sha256:d394f62ed1ddfc73ea51bfa8ece7f82d4d727bf458237900c96948b8e3805f64","observation_id":"e78fa995-c65f-4887-8e7c-cdeffa3ff2e6","resolution":{"observed_at":"2026-05-21T22:50:43.452848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2511.09282","last_updated":"2026-04-11T11:33:33Z","snapshot_observed_at":"2026-08-02T09:37:12.651192Z","submitted_at":"2025-11-12T12:49:30Z","title":"End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T22:44:49.949759Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2511.09282"},"observation_digest":"sha256:22cd14d69dd0ffeaf0badf215c59663aca1c696282011881135d82fef849b097","observation_id":"a0e35937-98ce-43e6-bdbc-85b965b995a4","resolution":{"observed_at":"2026-05-17T22:45:24.311935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2512.01512","last_updated":"2026-04-13T14:21:57Z","snapshot_observed_at":"2026-07-30T01:31:44.078208Z","submitted_at":"2025-12-01T10:39:12Z","title":"MCAT: Scaling Many-to-Many Speech-to-Text Translation with MLLMs to 70 Languages","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T03:15:04.685150Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2512.01512"},"observation_digest":"sha256:8f70267d3f039df0a3957f6f1803eab311dbb71004ecbe876184a88f0ed31931","observation_id":"5a4f7985-4e58-499b-94de-6d9b360f85cf","resolution":{"observed_at":"2026-05-17T03:18:57.209538Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T18:48:53.066189Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.03553","last_updated":"2026-06-03T10:10:35Z","snapshot_observed_at":"2026-08-03T18:48:50.639162Z","submitted_at":"2025-12-03T08:20:58Z","title":"Dynamic Content Moderation in Livestreams: Combining Supervised Classification with MLLM-Boosted Similarity Matching","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:48:53.066189Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2512.03553"},"observation_digest":"sha256:ad79bd1d51b386cd57f367358e48bc6df8c1e5b33d16affbfe12123e05d1e5a5","observation_id":"b2fca029-712f-4cfe-9d69-cc6c5f6b7842","resolution":{"observed_at":"2026-08-03T18:48:53.066189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T12:49:50.056919Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.01554","last_updated":"2026-07-17T03:41:37Z","snapshot_observed_at":"2026-08-03T16:43:04.399919Z","submitted_at":"2026-01-04T15:01:10Z","title":"MOSS Transcribe Diarize Technical Report","version":7},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T12:49:50.056919Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.01554"},"observation_digest":"sha256:24eb848cdf745281db74f2b59a2988cbaf9dedb39615463b78c235afaf3a15cb","observation_id":"938d5d20-137b-438b-92bb-7c6fc392fde4","resolution":{"observed_at":"2026-08-03T12:49:50.056919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T12:01:59.150857Z","title":"Qwen-audio: Ad- vancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-03T12:01:57.439695Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:59.150857Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:82ebc5113f62ae33abd52d8e86d54a4ea5bd020e148f546fba37eee14b851ba4","observation_id":"82d211a8-aba7-478b-aa7b-03ef17f646a1","resolution":{"observed_at":"2026-08-03T12:01:59.150857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2601.12248","last_updated":"2026-05-10T16:47:20Z","snapshot_observed_at":"2026-07-06T22:42:03.665045Z","submitted_at":"2026-01-18T03:55:28Z","title":"AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T14:04:17.935630Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2601.12248"},"observation_digest":"sha256:47f043f4d6d8b3aa199b52d23d020a7d9ce24c85ca7ccf60d43cda146a375564","observation_id":"b4e00556-f75b-4533-98b7-ea35e4ccfbd6","resolution":{"observed_at":"2026-05-16T14:07:58.679402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T06:23:42.307716Z","title":"Qwen-audio: Advancing univer- sal audio understanding via unified large-scale audio- language models.arXiv preprint arXiv:2311.07919,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02557","last_updated":"2026-05-29T23:48:47Z","snapshot_observed_at":"2026-08-03T06:23:40.878064Z","submitted_at":"2026-01-30T14:23:50Z","title":"The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:23:42.307716Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2602.02557"},"observation_digest":"sha256:5ad63e076a765d7e708519379af834b9b2df1afe2f7108861d4ff8dd52040e57","observation_id":"915656ab-cbcd-4b88-b8c6-f189a0119684","resolution":{"observed_at":"2026-08-03T06:23:42.307716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-03T04:37:50.902443Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.18452","last_updated":"2026-06-29T11:58:47Z","snapshot_observed_at":"2026-08-03T04:37:48.911061Z","submitted_at":"2026-02-04T13:25:47Z","title":"RA-QA: A Benchmarking System for Respiratory Audio Question Answering Under Real-World Heterogeneity","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:50.902443Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2602.18452"},"observation_digest":"sha256:40bb87dc9814a2d2e96dd55ddf72313e2cb2a5c756926d6734c5c6efd8cf95d8","observation_id":"736bbc75-f1be-4855-a73d-8c2fb4eef428","resolution":{"observed_at":"2026-08-03T04:37:50.902443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2603.05094","last_updated":"2026-05-13T05:33:43Z","snapshot_observed_at":"2026-08-02T09:54:13.118919Z","submitted_at":"2026-03-05T12:07:19Z","title":"TW-Sound580K: A Regional Audio-Text Dataset with Verification-Guided Curation for Localized Audio-Language Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T15:40:07.421894Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2603.05094"},"observation_digest":"sha256:3a1da3fdf56d9e15545649d05df8109fe795cefc4bbd6dd4e2753d5d43f70a3b","observation_id":"4eaee3f0-f2e7-4f2a-89ec-0f84c995de76","resolution":{"observed_at":"2026-05-15T15:41:12.014149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-02T18:42:05.405658Z","title":"Qwen-audio: Advancing universal audio un- derstanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07025","last_updated":"2026-07-24T15:35:47Z","snapshot_observed_at":"2026-08-03T04:43:50.232645Z","submitted_at":"2026-03-07T04:09:47Z","title":"Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:42:05.405658Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2603.07025"},"observation_digest":"sha256:9d4a2290c7315f3b84c769a414cee44273f0b3d0f2b99c741c2e45b86cdd26b3","observation_id":"dec17be9-5a17-4f83-abe7-6e3b2f56bacb","resolution":{"observed_at":"2026-08-02T18:42:05.405658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.05731","last_updated":"2026-04-07T11:34:04Z","snapshot_observed_at":"2026-07-06T22:54:21.571606Z","submitted_at":"2026-04-07T11:34:04Z","title":"FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:57:21.434793Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.05731"},"observation_digest":"sha256:524a0237b6e8891bd8879ebb4386f46f38c64c0d95b93dee8f5e93ba5ce8d26e","observation_id":"c879398c-5410-45c8-b011-e0edb2ffcbaa","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.09121","last_updated":"2026-04-14T06:45:50Z","snapshot_observed_at":"2026-08-02T20:05:01.635841Z","submitted_at":"2026-04-10T09:02:42Z","title":"Interactive ASR: Towards Human-Like Interaction and Semantic Coherence Evaluation for Agentic Speech Recognition","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:22:08.670559Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.09121"},"observation_digest":"sha256:4b0141c18994b6759bc519eb1d60d2f7bae8ca9d8ab10357b0cbe62143b7dab4","observation_id":"290cb93c-7d3d-4bcb-bfbd-7e3b0930fc6b","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.10438","last_updated":"2026-04-12T03:29:14Z","snapshot_observed_at":"2026-08-03T03:39:04.776753Z","submitted_at":"2026-04-12T03:29:14Z","title":"Whisper-AuT: Domain-Adapted Audio Encoder for Efficient Audio-LLM Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:31:50.670807Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.10438"},"observation_digest":"sha256:114592cb91beb515c946cb5a8cddc7d7d301179042ce67669aa5636f4010baac","observation_id":"e9a965b2-0d0a-4ef0-9396-243c375e80d4","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.11269","last_updated":"2026-04-13T10:23:58Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T10:23:58Z","title":"Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:08:56.412939Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.11269"},"observation_digest":"sha256:eb39842efdcbdba04cdc87766884ab406ce3bfe352cf3bea7f309e0fcca264cf","observation_id":"bd9ea5f8-f59b-491e-ad1c-ff72371925c7","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.11594","last_updated":"2026-04-24T06:36:24Z","snapshot_observed_at":"2026-08-02T02:42:26.875995Z","submitted_at":"2026-04-13T15:06:05Z","title":"HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:24:27.118694Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.11594"},"observation_digest":"sha256:bfcf83fc1af156f9771058e560733b3ddd00a007c479a141de66a8f12b703bf1","observation_id":"c749619a-078b-4728-8ab2-c3c25b7369e6","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13023","last_updated":"2026-04-14T17:57:01Z","snapshot_observed_at":"2026-08-03T18:18:13.717802Z","submitted_at":"2026-04-14T17:57:01Z","title":"SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:54:52.275011Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13023"},"observation_digest":"sha256:62d33c052829a27a80a70bdb24df2921e6c7eafb5ba07fbbc9e6f06efb75c10e","observation_id":"c3034d23-7de3-4507-864f-79a5b5ad6212","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13715","last_updated":"2026-04-15T10:50:29Z","snapshot_observed_at":"2026-08-03T11:14:47.252184Z","submitted_at":"2026-04-15T10:50:29Z","title":"Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:37:17.843365Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13715"},"observation_digest":"sha256:9c666ae3e56d9827005ac0dd049d3e671d279421d0815674268ae6041e0b9102","observation_id":"b52494af-c2e3-4ba0-853e-437c93d78287","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-07-06T23:01:41.643335Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:25.660785Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.13804"},"observation_digest":"sha256:9a12473df3a49a5f265a0d4b62edffd955f3adc05b16581cd1bdd133dc44e9fe","observation_id":"8379af5e-6e66-4f3f-ad8f-1aa9fea82c16","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:d93d79caafa9d12e7d3ff8de740e2dedf517afc29f67686130c92e2222344d52","observation_id":"7547d7e1-6daa-43f2-8e63-084d53cb4443","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:f4dd7cf146cc564ad62d86078140c78e160527bc1208a87a6cce15cfc001ed81","observation_id":"5b6f4c32-1675-40bd-987f-f73297d3e4fa","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-01T22:56:50.755050Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T08:11:22.402552Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.15804"},"observation_digest":"sha256:c5045d90f4fb8178b63ae3485ff3eda106f6ee704794ace2dd32c1431cc59a95","observation_id":"70ea96b3-229c-4098-bf72-f96e84c1f355","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.15849","last_updated":"2026-04-17T08:57:44Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:57:44Z","title":"TinyMU: A Compact Audio-Language Model for Music Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T08:17:23.740979Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.15849"},"observation_digest":"sha256:abba30bddeaf61e8271951a58fd4b2add26bbc89cfed4f4878677a3982a64fe5","observation_id":"d0052591-51b9-4b3f-9b14-905b6495f83f","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.18360","last_updated":"2026-07-07T23:45:36Z","snapshot_observed_at":"2026-07-12T18:59:37.538555Z","submitted_at":"2026-04-20T14:50:33Z","title":"Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T03:23:40.993175Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.18360"},"observation_digest":"sha256:f5961e16960cd7bda85e801b7bccc232c2e05996fa5f69afac63ce559fb704d2","observation_id":"95e3d43a-fc71-4bc5-87b6-3b5faa34f5a9","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.19300","last_updated":"2026-04-21T10:05:28Z","snapshot_observed_at":"2026-08-03T21:49:52.344628Z","submitted_at":"2026-04-21T10:05:28Z","title":"HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T01:34:54.375266Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.19300"},"observation_digest":"sha256:dc9ef29e36413bce3790187c2b129c1de47c1d8dfa31147b2bd205bd1529e51e","observation_id":"2edfa591-0bad-47f3-b02a-3ae6c8c974dc","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.19949","last_updated":"2026-04-21T19:54:54Z","snapshot_observed_at":"2026-07-06T23:06:31.110859Z","submitted_at":"2026-04-21T19:54:54Z","title":"Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-05-10T00:34:30.978387Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.19949"},"observation_digest":"sha256:df46f439277313ef6399f7f5447065d5e67f9f133df81e0523e18be3e9983e1a","observation_id":"e5ad04c3-579a-43ea-aa50-76833e525b9c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.20719","last_updated":"2026-04-22T16:06:48Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:06:48Z","title":"ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T23:03:01.356594Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.20719"},"observation_digest":"sha256:04cfbb9d4840b060cfe8471e85a62e932bda6b037b044be91b67f5b356018129","observation_id":"fda59e30-64c1-4c59-bba0-294afcb332f5","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2604.22817","last_updated":"2026-04-14T20:56:24Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T20:56:24Z","title":"In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:50.524448Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2604.22817"},"observation_digest":"sha256:1f066377c08fc861ddfdf177c5323b075346b07dd167b213e8f524adc66f5149","observation_id":"2c5cbd56-3b87-4777-9b2b-6e83b530d87e","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.02782","last_updated":"2026-05-04T16:24:06Z","snapshot_observed_at":"2026-08-02T19:52:19.243799Z","submitted_at":"2026-05-04T16:24:06Z","title":"When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T18:06:47.859998Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.02782"},"observation_digest":"sha256:7a4c820147d54701a1764f266a05386e248a53b65d968b0447906e80327d119f","observation_id":"abfbf2bf-15ea-4e16-bd20-bb0be9f09530","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06126","last_updated":"2026-05-07T12:31:22Z","snapshot_observed_at":"2026-08-03T10:59:40.481635Z","submitted_at":"2026-05-07T12:31:22Z","title":"AffectGPT-RL: Revealing Roles of Reinforcement Learning in Open-Vocabulary Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T07:25:42.870223Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06126"},"observation_digest":"sha256:7f6b27959851bb2c7914cadbc64f42cdf6973fd270c388fae3523a70151a9e59","observation_id":"bdaf2b62-393c-44b1-885c-7505b775a31c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-02T05:36:23.979419Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:db6da9351081c394405e4a7b53d77b835319fed9a782bdf4d424b9aadd3b9136","observation_id":"9e68c7f7-ce71-4e29-b9ae-f44abb081e5c","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.06897","last_updated":"2026-05-07T19:57:39Z","snapshot_observed_at":"2026-07-06T23:19:20.674889Z","submitted_at":"2026-05-07T19:57:39Z","title":"MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-11T01:14:43.744389Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.06897"},"observation_digest":"sha256:9e19d1099f78ce6f69aac32723e3eaaf3e1d4900e8f768ee003f73ad5c9fac4d","observation_id":"5729abf1-bc37-4611-9f1e-e94c51ac38bf","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.10203","last_updated":"2026-05-11T08:49:26Z","snapshot_observed_at":"2026-07-29T20:41:29.988615Z","submitted_at":"2026-05-11T08:49:26Z","title":"Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-12T05:15:55.193062Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.10203"},"observation_digest":"sha256:83b231856b20aa7ed4dacb6825c2a95f499af59f6b84574e4a0f05329bfd4cdd","observation_id":"f5cc76f9-0d30-4fda-a649-90c29cfca4d9","resolution":{"observed_at":"2026-05-12T18:57:28.886773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.13651","last_updated":"2026-05-13T15:09:47Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:09:47Z","title":"NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-14T18:16:22.762405Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.13651"},"observation_digest":"sha256:a5409a12949c40509a0fa077061408df3aaf90fa4722956c1e1f87a6808c6143","observation_id":"620ffce7-c856-4ca7-9bb0-3c8f10fadcb3","resolution":{"observed_at":"2026-05-14T18:17:35.034442Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.15044","last_updated":"2026-05-14T16:36:57Z","snapshot_observed_at":"2026-08-02T23:03:08.998549Z","submitted_at":"2026-05-14T16:36:57Z","title":"SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T03:20:37.488507Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.15044"},"observation_digest":"sha256:067627c56f38d2d0e02fea0681129aac558b498cfd661d3470a2346a5a380b93","observation_id":"cdc99437-c98d-415e-b494-73f7e9b21483","resolution":{"observed_at":"2026-05-15T03:24:55.762374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.18104","last_updated":"2026-05-18T09:16:55Z","snapshot_observed_at":"2026-08-02T08:21:56.104408Z","submitted_at":"2026-05-18T09:16:55Z","title":"Safety Geometry Collapse in Multimodal LLMs and Adaptive Drift Correction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T10:57:40.997128Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.18104"},"observation_digest":"sha256:d9f2580f911ec6858ffd1fdd28df182cab78dd7591b48f0a884e9c298d6ae23e","observation_id":"df4a1cc0-e0b4-4445-bf82-31cf959c3e95","resolution":{"observed_at":"2026-05-20T10:58:13.582853Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:73b776148c5d0ae9f3621821d706259c4b1e1c6de73266599a432fd5aebb75d5","observation_id":"1e53ada0-156c-4bd4-97c7-dbbb9a207388","resolution":{"observed_at":"2026-05-20T10:13:11.904848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.19101","last_updated":"2026-05-18T20:41:08Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:41:08Z","title":"Heterogeneity-Aware Dataset Scheduling for Efficient Audio Large Language Model Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T07:13:29.041056Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.19101"},"observation_digest":"sha256:e93ed670f6e75379b013a364c50fe4a574fc680b8ea018c3c3a2024fb85c78a3","observation_id":"9e8fa346-5ab2-42b9-a605-1bb28993f172","resolution":{"observed_at":"2026-05-20T07:18:07.283584Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.19950","last_updated":"2026-05-19T15:05:00Z","snapshot_observed_at":"2026-07-06T23:30:35.042915Z","submitted_at":"2026-05-19T15:05:00Z","title":"AffectVerse: Emotional World Models for Multimodal Affective Computing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T06:46:33.612905Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.19950"},"observation_digest":"sha256:c4a72c51ade8508bdd0c8ff27ca796b289824ddb0dc39b1aff3416028c4409eb","observation_id":"4f00b568-ccd7-42fa-9273-d5de3b870bea","resolution":{"observed_at":"2026-05-20T06:48:05.771479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:29887fddf8db823ab8a8de02fa0e535e857ebceb0d9e9928340da59b80232b46","observation_id":"eb3712d9-5bb2-4d85-8236-08592f036432","resolution":{"observed_at":"2026-05-21T07:39:49.032020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T06:43:52.735211Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:006159a3ded804f19d2615c54cf9156713dae3b66d41ef8c68ba6dbf9ba8917d","observation_id":"d0601d4d-da6c-4519-8b2d-1c2ceed0618d","resolution":{"observed_at":"2026-05-21T06:44:00.638652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20519","last_updated":"2026-05-21T17:49:53Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T21:39:52Z","title":"Codec-Robust Attacks on Audio LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-25T05:44:46.831360Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20519"},"observation_digest":"sha256:09d715bf8e85e531ca22d353206584a6c7fc8dae7b7d8f33747e6b21c1567602","observation_id":"479df41f-2545-4208-89ef-c1e4ca2aa2a3","resolution":{"observed_at":"2026-05-25T05:45:23.736609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.21538","last_updated":"2026-06-23T07:00:03Z","snapshot_observed_at":"2026-07-06T23:31:56.199912Z","submitted_at":"2026-05-20T07:18:24Z","title":"Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T01:38:39.499793Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.21538"},"observation_digest":"sha256:0b62853b6f5135aa311cc64401730dc101a4a3fa40f001179684c7fdf6a72c82","observation_id":"7f4ccaf0-1710-4abd-8708-534d46d21743","resolution":{"observed_at":"2026-05-22T01:40:53.973928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.21538","last_updated":"2026-06-23T07:00:03Z","snapshot_observed_at":"2026-07-06T23:31:56.199912Z","submitted_at":"2026-05-20T07:18:24Z","title":"Academic Text-to-Music Grand Challenge: Datasets, Baselines, and Evaluation Methods","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T17:37:57.477175Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.21538"},"observation_digest":"sha256:c98ff0de36fa47deb5a14f5e44be763949ab69216c35b316543a71f787677f27","observation_id":"5c25e27e-88b1-45a4-872a-19bd9b4dd46c","resolution":{"observed_at":"2026-06-30T17:44:57.896841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:6a8b4e23eb565d5e31d0f9a8a3df8caa15c087c5d48180a106e0608523cd4990","observation_id":"740e0a2d-bb52-478b-b45b-c7f7d49cb0e8","resolution":{"observed_at":"2026-06-29T23:04:01.933661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.27190","last_updated":"2026-05-26T15:43:11Z","snapshot_observed_at":"2026-07-06T23:36:58.541051Z","submitted_at":"2026-05-26T15:43:11Z","title":"Learning When to Think While Listening in Large Audio-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:37:34.409802Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.27190"},"observation_digest":"sha256:8af9ccafd74c920148dffbc87d37d69021e3afcde57cee972cb96a2842738ed0","observation_id":"da3ac5f8-e845-4de2-bfd5-97485eec1690","resolution":{"observed_at":"2026-06-29T18:43:50.761327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.28642","last_updated":"2026-05-27T15:47:33Z","snapshot_observed_at":"2026-08-02T18:33:04.456837Z","submitted_at":"2026-05-27T15:47:33Z","title":"Bandwidth-Efficient and Privacy-Preserving Edge-Cloud Many-to-Many Speech Translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T11:40:46.165547Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.28642"},"observation_digest":"sha256:b5e33b479398916755aab3b73a6431e62270c598e605ab679095087a703802f3","observation_id":"0bc2763b-f789-42ea-9194-ebae95b4c9f7","resolution":{"observed_at":"2026-06-29T11:43:23.632863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.29613","last_updated":"2026-05-28T08:48:56Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T08:48:56Z","title":"Decoding Strategies for Diffusion-Based ASR: A Systematic Evaluation of Confidence-Based Thresholding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:45:19.762023Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.29613"},"observation_digest":"sha256:142f5026a7c2379e53f42e4c93e2fb68fe541d28b1470b330b6c38a744d1ec2c","observation_id":"9d928bee-1a71-4611-b74a-b293c28cb711","resolution":{"observed_at":"2026-06-29T05:53:09.221791Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.31530","last_updated":"2026-06-02T14:24:03Z","snapshot_observed_at":"2026-08-03T03:12:41.167162Z","submitted_at":"2026-05-29T16:43:07Z","title":"UNISON: A Unified Sound Generation and Editing Framework via Deep LLM Fusion","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T20:44:20.190064Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.31530"},"observation_digest":"sha256:7e7db85f31f26368d83f8440812e4c4d7bb360b21dc606102e80cedd01c0f551","observation_id":"aefe8a3d-a213-4bab-a83d-2b41b781e83d","resolution":{"observed_at":"2026-06-28T20:52:37.927179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.00460","last_updated":"2026-05-30T00:54:53Z","snapshot_observed_at":"2026-07-30T20:34:03.133280Z","submitted_at":"2026-05-30T00:54:53Z","title":"SALSA: Speech Aware LLM Adaptation via Learned Steering Activation Vectors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:19.422735Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.00460"},"observation_digest":"sha256:d8b2ccb4d74e2bcb5449de716c4f816bac5d586dcee88396c556d261898575cf","observation_id":"179085e3-992f-4d2a-ae0a-f132a28e8a89","resolution":{"observed_at":"2026-06-28T19:32:35.160558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T13:05:29.813707Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.01802"},"observation_digest":"sha256:84f8b10a122a85bf649799a65312e03df35f21783cbda92c768a8b44953b48be","observation_id":"f4ca3108-7a9c-4749-b2ad-8a07fd214955","resolution":{"observed_at":"2026-07-02T00:56:25.088047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.03283","last_updated":"2026-06-28T12:59:22Z","snapshot_observed_at":"2026-08-02T08:17:49.710129Z","submitted_at":"2026-06-02T07:49:30Z","title":"SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T08:34:11.270002Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.03283"},"observation_digest":"sha256:e8419bcdca2b561d2015503cf0c73e2ec65f64d1c46ddc90cc0aa97fc629f7cd","observation_id":"8849e7a8-7d9b-4497-bb3f-0ad7da2baa51","resolution":{"observed_at":"2026-07-02T05:06:39.874784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.03283","last_updated":"2026-06-28T12:59:22Z","snapshot_observed_at":"2026-08-02T08:17:49.710129Z","submitted_at":"2026-06-02T07:49:30Z","title":"SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T11:24:22.023188Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.03283"},"observation_digest":"sha256:3b05a22d88838db4ce68809a217b766e6113d40d2878b94730dda97cc1acd4a9","observation_id":"723b62a9-8d87-4d49-b458-0387ac1675a5","resolution":{"observed_at":"2026-06-30T11:24:37.761323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.04474","last_updated":"2026-06-11T09:28:59Z","snapshot_observed_at":"2026-07-06T23:44:33.095008Z","submitted_at":"2026-06-03T05:44:09Z","title":"Entity Binding Failures in Speech LLM Reasoning: Diagnosis and Chain-of-Thought Intervention","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T06:41:25.592270Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.04474"},"observation_digest":"sha256:14e2c4d14be7b581a9fbc486049e2b6ede1fee984c9a09885e9dc3d10c6ad977","observation_id":"e2bb7787-a114-40f1-8466-be63fe23eef8","resolution":{"observed_at":"2026-07-02T07:46:46.222824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.04939","last_updated":"2026-06-03T14:29:52Z","snapshot_observed_at":"2026-07-06T23:44:57.208389Z","submitted_at":"2026-06-03T14:29:52Z","title":"UAT: Unified Audio-Text Diffusion for Audio Generation, Editing, and Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T04:22:13.478562Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.04939"},"observation_digest":"sha256:2e605299231d048b1b533270dda7056e9de9445f2f5a57de5e96a15c85d320e1","observation_id":"eb536c04-8d0a-4304-9e23-2ec0aa406ed2","resolution":{"observed_at":"2026-07-02T11:16:53.506262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:2200b2894ae691fa48810ad8f0762c640d39fb81c1cacb62abfd423644133042","observation_id":"a5855a8f-e10c-4cb7-bb7c-fab514158adb","resolution":{"observed_at":"2026-07-02T10:46:52.393805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.06940","last_updated":"2026-06-10T06:55:49Z","snapshot_observed_at":"2026-08-03T21:56:13.034676Z","submitted_at":"2026-06-05T06:11:38Z","title":"Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:07.007759Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.06940"},"observation_digest":"sha256:0ee90d49d277972c483871f242c9e593c71eef4872fb8fb9e41796f7f5dde204","observation_id":"932b0ab3-6afd-45de-b862-4d56d7a095e1","resolution":{"observed_at":"2026-07-02T19:47:20.020338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.07387","last_updated":"2026-06-05T15:24:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-05T15:24:36Z","title":"Making the Most of Limited Data: Score-Aware Training for Text-to-Music Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T23:00:07.144841Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.07387"},"observation_digest":"sha256:33738ddff1f25857ae4b18bba7cfc37744b180db86959081fd53212cfad309f8","observation_id":"3176a1fb-2ea5-4502-bd1c-55e08d7d8913","resolution":{"observed_at":"2026-07-02T16:07:08.932270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.08573","last_updated":"2026-06-07T11:07:30Z","snapshot_observed_at":"2026-08-01T04:00:28.663686Z","submitted_at":"2026-06-07T11:07:30Z","title":"Titans-as-a-Layer: Test-Time Memory for Conversational Speech Emotion Recognition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T18:28:44.652813Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.08573"},"observation_digest":"sha256:d10669816398166bd010a55ad8672d881cc8472922c1fd68602113f3e690e414","observation_id":"2eae3c81-fd6b-4d33-881c-12a91f9888d2","resolution":{"observed_at":"2026-07-02T23:07:26.859912Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.09366","last_updated":"2026-06-08T11:38:40Z","snapshot_observed_at":"2026-08-02T15:25:04.223346Z","submitted_at":"2026-06-08T11:38:40Z","title":"Is Text All You Need? Text as a Universal Information Bottleneck for Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:26:32.594986Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.09366"},"observation_digest":"sha256:11a9e227f4b13e09d803777e246d63bae06ea3094dfb91fb2eb9621123c021e7","observation_id":"4ba04366-f80d-42f3-b828-93d0309bccac","resolution":{"observed_at":"2026-07-03T01:37:30.605027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.09470","last_updated":"2026-06-08T13:27:40Z","snapshot_observed_at":"2026-08-02T04:49:53.664865Z","submitted_at":"2026-06-08T13:27:40Z","title":"A Finetuned SpeechLLM for Joint Multi-Granular L2 Assessment and Natural-Language Rationales","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T16:33:41.230574Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.09470"},"observation_digest":"sha256:8988d8e908699cbd2d07329b3a74f785a5ec7339816a2c350aac7e819e6972a0","observation_id":"c241abff-92c0-4a8e-9fa7-a78e8cf487c2","resolution":{"observed_at":"2026-07-03T01:27:30.830670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.10853","last_updated":"2026-06-09T13:32:13Z","snapshot_observed_at":"2026-07-06T23:50:01.838569Z","submitted_at":"2026-06-09T13:32:13Z","title":"Speech Encoder Fusion for LLM-based Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T11:32:58.335783Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.10853"},"observation_digest":"sha256:de2d8be6f8d9f6efdf8eb30bd06e5f944fd371787f775b457bfa5886e8de6e28","observation_id":"e4925622-4525-4f07-9bf9-2d1dc972c69e","resolution":{"observed_at":"2026-07-03T07:57:44.685719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-03T04:36:58.884789Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:0e3842128b34a0b12a3e8dd73bb23b638bc1c456a3ce618c78563a984262b8f3","observation_id":"b6ca04b8-b71d-4992-bd17-b1f28879ad73","resolution":{"observed_at":"2026-06-30T22:15:05.345453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11260","last_updated":"2026-06-09T02:38:17Z","snapshot_observed_at":"2026-07-06T23:50:20.698344Z","submitted_at":"2026-06-09T02:38:17Z","title":"RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T12:11:56.629002Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11260"},"observation_digest":"sha256:f137479eab0c834b35a0d9ac16eb0484b61dc3b6b599702d1bc6de370d10eaa2","observation_id":"9452a331-52ee-4638-9edb-3d048f2d355a","resolution":{"observed_at":"2026-07-03T07:17:43.937486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.11385","last_updated":"2026-07-31T21:56:40Z","snapshot_observed_at":"2026-08-04T05:16:54.982717Z","submitted_at":"2026-06-09T19:08:00Z","title":"DeceptionX: From Multimodal Evidence to Explainable Deception Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:15:49.796647Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11385"},"observation_digest":"sha256:ce3d44ac350ebb93911dbb854363ef35a82137b6d69ea0e7877e6d1c61ccc9fe","observation_id":"f1b06a76-9818-43c9-900a-f37b5ca039e7","resolution":{"observed_at":"2026-07-03T05:27:40.118590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T03:03:32.342985Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11385","last_updated":"2026-07-31T21:56:40Z","snapshot_observed_at":"2026-08-04T05:16:54.982717Z","submitted_at":"2026-06-09T19:08:00Z","title":"DeceptionX: From Multimodal Evidence to Explainable Deception Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T03:03:32.342985Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.11385"},"observation_digest":"sha256:254ef62553aa9c318f354f9ec2b1045a7ed39b588e2e8f722484d0fda8d09e1d","observation_id":"9b7135e4-56ed-4edb-95a9-bb132db28181","resolution":{"observed_at":"2026-08-04T03:03:32.342985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:cf7d597f3e03d473e02361536caae4a00f910b3665134b6543c995c751c498ee","observation_id":"ac7ff34f-1db1-4410-b224-25bed8213b59","resolution":{"observed_at":"2026-07-02T17:47:18.010086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.21854","last_updated":"2026-06-20T03:21:57Z","snapshot_observed_at":"2026-08-02T18:16:50.732892Z","submitted_at":"2026-06-20T03:21:57Z","title":"ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T11:54:08.457573Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.21854"},"observation_digest":"sha256:75345a9cfee6022613dc06115486fb677cca5ae8d7d64869cd7a02153f1089de","observation_id":"619b0362-c950-408b-be0b-f8183fec4b63","resolution":{"observed_at":"2026-07-04T08:19:44.206175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.23313","last_updated":"2026-06-22T13:26:29Z","snapshot_observed_at":"2026-08-01T15:51:02.528612Z","submitted_at":"2026-06-22T13:26:29Z","title":"Uncertainty-based Debiasing and Unlearning for Decontamination","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T05:57:44.576411Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.23313"},"observation_digest":"sha256:f07e963f1d4831a74b5d88194374788116e9e46e727c875e4825eea85b295060","observation_id":"0b2d104a-d72a-4026-8a0a-2d0483a7cfd6","resolution":{"observed_at":"2026-07-04T12:49:52.436103Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:cb0b56c8dc55fe3485793f502fec678108e834f80dc2872f43d851ec06fbbeac","observation_id":"5ea7e87f-1ab4-41c0-9425-0c9ebd3b1236","resolution":{"observed_at":"2026-07-04T19:20:06.521202Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25436","last_updated":"2026-06-24T05:57:45Z","snapshot_observed_at":"2026-08-01T06:38:21.357775Z","submitted_at":"2026-06-24T05:57:45Z","title":"Evaluating Japanese Dialect Robustness Across Speech and Text-based Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T20:08:33.322532Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25436"},"observation_digest":"sha256:1f3582c80615cf71e6830f58b9c527bb71635db49c99fe46d3ba73fb501c753a","observation_id":"4fb3ee76-5ee9-4a24-9bed-c477ba7f6356","resolution":{"observed_at":"2026-07-04T20:30:07.197249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.25444","last_updated":"2026-06-24T06:15:18Z","snapshot_observed_at":"2026-08-02T19:50:32.355214Z","submitted_at":"2026-06-24T06:15:18Z","title":"Does Translation-Enhanced Speech Encoder Pre-training Affect Speech LLMs?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T20:03:10.858349Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.25444"},"observation_digest":"sha256:4c25ad49629e365531d1c13b4648dbaa3810b8e778b12090fd5fd4e7f651f168","observation_id":"4d7d6bd8-907e-4ffd-8ad1-d78f8f3a39b2","resolution":{"observed_at":"2026-07-04T20:30:08.192339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.26824","last_updated":"2026-06-25T10:04:35Z","snapshot_observed_at":"2026-08-04T03:38:31.867526Z","submitted_at":"2026-06-25T10:04:35Z","title":"wav2tok 2.0: Scalable Audio Tokenization Maintaining Explicit Pairwise Token Alignment for Efficient Audio Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T02:49:35.819155Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.26824"},"observation_digest":"sha256:1a55a4ced266e527ac66aed05144dbb3afbadf94d47cf78bcdc82a7dd52ac07d","observation_id":"9df4c430-c924-4e36-9570-2ed681fabf5e","resolution":{"observed_at":"2026-07-04T14:39:58.377508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-02T13:44:43.785281Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:4415163f027a603ab25a7af3a78bb1d926f0613b8726dcf2b8df2dfc5f6cc1a7","observation_id":"83072bef-a268-4225-a828-3e1b98b061ed","resolution":{"observed_at":"2026-06-29T18:23:51.453211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T09:35:03.660671Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:c947ac9242a4674c38a2ace629f374309092c686487a084c00a569766863e6b0","observation_id":"a1f64d49-bfc4-47c2-8d5c-48b413637a29","resolution":{"observed_at":"2026-06-30T12:54:40.667112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T11:11:08.878850Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T11:11:08.878850Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:6eae6fa61d2e9f6614d0b1a9b22d4fa6f252206cd37ce6b9210c05aade2e6140","observation_id":"89de6386-c342-448a-951d-515551432d5f","resolution":{"observed_at":"2026-07-12T11:11:08.878850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.29534","last_updated":"2026-06-28T17:57:41Z","snapshot_observed_at":"2026-07-07T00:03:31.715960Z","submitted_at":"2026-06-28T17:57:41Z","title":"Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T07:26:38.380118Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.29534"},"observation_digest":"sha256:7c707b9566ff239a991f5eaaa0fd22ae450b209d7dc1d9a15b644f23771693f1","observation_id":"0891cb16-4399-4f0e-b866-501bbb99ede7","resolution":{"observed_at":"2026-06-30T07:34:21.799793Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.31338","last_updated":"2026-06-30T08:39:56Z","snapshot_observed_at":"2026-07-07T00:05:02.977105Z","submitted_at":"2026-06-30T08:39:56Z","title":"Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T03:31:42.611472Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.31338"},"observation_digest":"sha256:d6d5e1a53bbc758739d39bf9a69344afc645622ef647bdcb2473d405e15d0484","observation_id":"cc259b6a-0406-45d8-868c-c62268c37d7d","resolution":{"observed_at":"2026-07-01T11:55:42.994017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-12T03:03:59.776103Z","title":"arXiv preprint arXiv:2311.07919 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03356","last_updated":"2026-07-03T14:14:04Z","snapshot_observed_at":"2026-08-02T05:21:22.714607Z","submitted_at":"2026-07-03T14:14:04Z","title":"CaReCoS: A Spectrogram based Visual Benchmark for Cardiac, Respiratory and Cough Sounds","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-12T03:03:59.776103Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.03356"},"observation_digest":"sha256:26706ba56edadfee3bfc23a94a9871c11a37890b5b2ea80366c685f5c89cf26e","observation_id":"b8215101-0e5e-467c-8a2a-491459e6a730","resolution":{"observed_at":"2026-07-12T03:03:59.776103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-11T19:34:49.358453Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-02T08:43:31.280419Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T19:34:49.358453Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:215933836a3436ada85522c5fe447a51cdfb1369265337d98d546d5c94afec68","observation_id":"2f60d2a8-ff7e-4bd3-a57e-289062cf1888","resolution":{"observed_at":"2026-07-11T19:34:49.358453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-02T08:43:33.132312Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04383","last_updated":"2026-07-29T12:04:35Z","snapshot_observed_at":"2026-08-02T08:43:31.280419Z","submitted_at":"2026-07-05T16:22:14Z","title":"Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T08:43:33.132312Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.04383"},"observation_digest":"sha256:b68269cbdd0423b1bed8979a84626399f4864f60bfaaf34d8845128902574e92","observation_id":"ad3f1393-442d-4c5a-b34a-89707874ac6f","resolution":{"observed_at":"2026-08-02T08:43:33.132312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-11T09:26:54.286790Z","title":"Qwen-Audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05058","last_updated":"2026-07-06T13:31:09Z","snapshot_observed_at":"2026-08-03T15:27:29.701755Z","submitted_at":"2026-07-06T13:31:09Z","title":"Context-Aware ASR for Mandarin Technical Lectures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T09:26:54.286790Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.05058"},"observation_digest":"sha256:e06705887f2dc055ccac5fc31ce3445979df8b2d4ceba85dc58ab645f72a1189","observation_id":"2c0c3017-8736-467a-85ae-40de1a7a8f12","resolution":{"observed_at":"2026-07-11T09:26:54.286790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-07-10T20:27:36.579792Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:d47b4b6afd2302e5079fee23f4f30df6e20a9241474dc980d33d71438dc39885","observation_id":"71b2450c-44af-4992-b2b3-d8adbe4b8090","resolution":{"observed_at":"2026-07-08T00:04:22.353380Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.07919/citation-record","integrity":"/paper/2311.07919/integrity","json":"/paper/2311.07919/citation-record.json","paper":"/paper/2311.07919"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"1a9872b0-a048-46e6-9642-6eaad358fb33","year":2016},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:029e0e0cc27bac1181b21a374f9930e177ca5d0a52f2e3b844e58ebeccd5d676","observation_id":"f82b18c7-0b96-499e-bba2-fcb3970209e0","resolution":{"observed_at":"2026-05-12T18:57:28.885441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2305.10403","doi":"10.48550/arxiv.2305.10403","metadata_source":"pith","pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-07-10T13:57:07.008081Z","title":"PaLM 2 Technical Report","venue":"cs.CL","work_id":"905ee9a7-ea61-4a94-bd62-2600cbe3e315","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:f23029e24b674dfdcd2b9abf335d8d2ed51aa385b0e689e7ec93c653dfdbc590","observation_id":"0b34eb66-5d5e-4197-b53c-291d3fa9631a","resolution":{"observed_at":"2026-05-12T18:57:28.779045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-07-06T11:57:45.449669Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":"2110.07205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-07-02T00:56:25.108341Z","title":"JunyiAo,RuiWang,LongZhou,ChengyiWang,ShuoRen,YuWu,ShujieLiu,TomKo,QingLi,YuZhang,etal","venue":null,"work_id":"df733364-79f3-4be2-a7cb-329e91337a7f","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:8a2e71ca92d84f5a15c1e71eec5afdb90a85c0a7b734fdfba58d75d2c05d6b79","observation_id":"1a9a4096-7be8-487e-bd11-85d4f50bebe4","resolution":{"observed_at":"2026-05-12T18:57:28.714811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-10T20:57:35.014119Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:d69fb1dd114eb8566e2d44a8a268855538e841dd5950a13e911dc0af8644af50","observation_id":"686a88c1-2cb5-4cc3-9743-96b07e7caff0","resolution":{"observed_at":"2026-05-12T18:57:28.736051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AISHELL-1: an open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":"6257141b-6551-418c-86f6-d9187fddd6a6","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:4519f3c21a89b6158a00999f40cc72a8f785f5a7b19232458917eb527f07d904","observation_id":"978cba6e-4754-4698-89bd-496af42f7de5","resolution":{"observed_at":"2026-05-12T18:57:28.831322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:c6d1ade95192ebfe47ba015bf6617c9d08add2e452abb167272286da85a3f748","observation_id":"40075b4d-b472-4db9-9b1e-be1236df4437","resolution":{"observed_at":"2026-05-12T18:57:28.801899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03070","last_updated":"2021-05-31T11:05:43Z","snapshot_observed_at":"2026-07-06T11:07:08.503991Z","submitted_at":"2021-05-07T05:31:34Z","title":"SpeechNet: A Universal Modularized Model for Speech Processing Tasks","version":2},"cited_work":{"arxiv_id":"2105.03070","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.03070","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speechnet: A universal modularized model for speech processing tasks","venue":null,"work_id":"07752b40-0b3a-4488-897a-19a69b941d9e","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2105.03070","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:9fc664a5cb74970d8f743a78110648d41e37c8f3182823589b22885c81fbca93","observation_id":"c2e4f870-f674-4337-aaa5-83566ad92f9f","resolution":{"observed_at":"2026-05-12T18:57:28.808161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:e9d21586cef5b0518cdd413a6694149562573224a47051c4be90f2fd8dfbf48f","observation_id":"0389ca6e-f17d-4aec-b5e2-8381638cda49","resolution":{"observed_at":"2026-05-12T18:57:28.817947Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:bf7a4f8a0088e44578e95d6e9ef77a5c23eed594298bf08045ef3ac07872a0a5","observation_id":"513cee5e-03c7-4c91-98bd-c697f2efda83","resolution":{"observed_at":"2026-05-13T21:49:52.306785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clotho: an audio captioning dataset","venue":null,"work_id":"e98e70a4-c0dc-4ace-af67-bfffb1c668ef","year":2020},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:6ed379ff9adc7ccb2dd468d366c359f957e978be629adc341912b9de44c2a9a7","observation_id":"527b4f02-96cd-4cc8-b586-ec04dde22436","resolution":{"observed_at":"2026-05-12T18:57:28.835232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":"1808.10583","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-07-05T13:21:06.309631Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","venue":"cs.CL","work_id":"123cad45-dfd0-4b02-a99a-47d962dc2ab4","year":2018},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:81d4f0f6f12c5155631150b4e58469b8d03218d8195cc9fe06f802ed535a2992","observation_id":"68ff7646-e1bf-41d7-bcfa-203ecfe6a788","resolution":{"observed_at":"2026-05-12T18:57:28.720600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04769","last_updated":"2022-06-09T21:16:10Z","snapshot_observed_at":"2026-07-06T13:19:15.758425Z","submitted_at":"2022-06-09T21:16:10Z","title":"CLAP: Learning Audio Concepts From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":"2206.04769","doi":"10.48550/arxiv.2206.04769","metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04769","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Clap: Learning audio concepts from natural language supervision","venue":null,"work_id":"983269ec-ba9c-4b46-92ae-314e1b52c693","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2206.04769","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:614e1c8c82c3b06cd0b3fbd0238a01ad49c91824c7777a2101c88f05e517a5e9","observation_id":"6f5b030d-787a-4213-8656-d5a8ac082472","resolution":{"observed_at":"2026-05-12T18:57:28.731393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Engel, Cinjon Resnick, Adam Roberts, Sander Dieleman, Mohammad Norouzi, Douglas Eck, and Karen Simonyan","venue":null,"work_id":"e3d8d41c-9929-4e7b-a249-d184c6caa04b","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b45d2101ebc48f3c82d5343ab70ae12e91779221c5b6c2ddcc080ae3eb9dc515","observation_id":"8797769d-2f3c-4613-9ead-011e07268843","resolution":{"observed_at":"2026-05-12T18:57:28.838846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":"2305.11013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-07-10T11:27:03.142196Z","title":"FunASR: A fundamental end-to-end speech recognition toolkit","venue":"cs.SD","work_id":"a1b4d167-dd83-49f9-8309-1e4d5492acf5","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:e83adcdf4c52325466ffe30d37d7826e89fdcb89942cdccaa5c13f066af16686","observation_id":"3ad2844e-c9f5-4714-bff0-1a4b7959d5fd","resolution":{"observed_at":"2026-05-12T18:57:28.775426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vocalsound: Adatasetforimprovinghumanvocalsoundsrecognition","venue":null,"work_id":"6af9ba3b-d108-4c7e-b927-2047ba7498dc","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:5fd441fab92b7c3a47341c3f3932c6c0a7dc48a3befb272ff6a809b2bc2d07b8","observation_id":"36888e76-61f8-40ff-8187-3bcc31335b98","resolution":{"observed_at":"2026-05-12T18:57:28.845340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3922.2022","doi":"10.1109/icassp43922.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"author Zhou, A","venue":null,"work_id":"ad61b46b-30ce-4e77-9b24-298e8b28f2dd","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:917c139f0dc3be32c2d4f9af07c0cb26affbb5c0cf2735bef5f11ba54efbc138","observation_id":"f7b85189-ba7f-4e93-8573-4e11a561165d","resolution":{"observed_at":"2026-05-12T18:57:28.701257Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T00:50:01.977196+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:1300a987f904c555b20c54cfa4a3d3e100230f874a894d021ebd85062fd14465","observation_id":"2af46fc4-917a-4c63-8f0e-57d6da47ab1e","resolution":{"observed_at":"2026-05-12T18:57:28.783179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12995","last_updated":"2023-04-25T17:05:38Z","snapshot_observed_at":"2026-07-06T15:19:53.739852Z","submitted_at":"2023-04-25T17:05:38Z","title":"AudioGPT: Understanding and Generating Speech, Music, Sound, and Talking Head","version":1},"cited_work":{"arxiv_id":"2304.12995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.12995","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"d9cf9bad-35d2-4253-bdaa-b464fbb89733","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2304.12995","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:7ac7d5dbadeb671c0f1957b6f39ed03669ac6a54e58ab56926a473712e19014b","observation_id":"fe563662-f13d-4f5b-860d-d8d85889f490","resolution":{"observed_at":"2026-05-12T18:57:28.789265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02289","last_updated":"2022-11-04T07:01:16Z","snapshot_observed_at":"2026-07-06T14:14:23.751937Z","submitted_at":"2022-11-04T07:01:16Z","title":"CochlScene: Acquisition of acoustic scene data using crowdsourcing","version":1},"cited_work":{"arxiv_id":"2211.02289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.02289","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cochlscene: Acquisition of acoustic scene data using crowdsourcing","venue":null,"work_id":"c501096d-d905-44d4-8bc7-3f3a8bd6df2b","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2211.02289","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:684352815c052b8042193ed650064e59a362224aef2505bf67b71343a2de1721","observation_id":"06221470-b5d6-497b-bdc2-9c210a4d8566","resolution":{"observed_at":"2026-05-12T18:57:28.796789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fcf12750-6357-4d4a-8c99-779a5f3bb86c","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2d71a83d6b6c62b358d8d76791d0947ce73a5bc5766ef73fe0f48a8c782219ce","observation_id":"59b741bb-9023-4ffb-849d-3efec1ae8228","resolution":{"observed_at":"2026-05-12T18:57:28.849814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clotho-aqa: A crowdsourceddatasetforaudioquestionanswering","venue":null,"work_id":"f19553ff-321c-4b1e-81a1-8544da7b3af4","year":2022},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:6e171b83a651982d30a843a6cc97b6fadf16770c7d58f26a12f3f78bff09051d","observation_id":"85bb758f-2015-4066-8751-0af96520986f","resolution":{"observed_at":"2026-05-12T18:57:28.859905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":"2306.09093","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-07-03T04:27:36.858275Z","title":"Macaw-LLM : Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":"749921fa-f7c8-417b-a9e2-2e3ed4cd0054","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:d9c7e2e1fcb75153941adf2b1fbc53f9aaad59fd8f49c89a71318b660899c4ed","observation_id":"0e5f935e-91f7-42dd-90d9-b091d4afbb92","resolution":{"observed_at":"2026-05-12T18:57:28.813519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07937","last_updated":"2024-01-24T15:36:31Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T03:13:18Z","title":"Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks","version":3},"cited_work":{"arxiv_id":"2309.07937","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07937","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Voxtlm: unified decoder-only models for consolidating speech recognition/synthesis and speech/text continuation tasks","venue":null,"work_id":"f014baca-7e3d-4528-a8d6-8117be741f4d","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2309.07937","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:24806d32e44488f562a13f327b4a978448fbab01e4294a1fbeddc8b167775645","observation_id":"8f2a679e-c6bd-4afd-850c-f503f410178f","resolution":{"observed_at":"2026-05-12T18:57:28.823612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Montreal forced aligner: Trainable text-speech alignment using kaldi","venue":null,"work_id":"971ca3e4-1375-4fb7-a3b2-37228cbfee8f","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:c7888152e9a0e2c449cd8d2742995dcc4eca9250489b5e1bd60ae7dae9ce7256","observation_id":"86c9db3c-e837-44ff-a9fc-598806601471","resolution":{"observed_at":"2026-05-12T18:57:28.863538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DCASE2017 challenge setup: Tasks, datasets and baseline system","venue":null,"work_id":"56f6a313-818e-40b7-9eac-ae646305fdc8","year":2017},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:84bcb4b854cee37cac502f7708babd9401f28dddf1471f185a83053ed6fd4d12","observation_id":"9138ff39-1341-42d4-9330-8c7a9faac660","resolution":{"observed_at":"2026-05-12T18:57:28.866991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Librispeech: AnASRcorpusbasedon public domain audio books","venue":null,"work_id":"2fc2fc79-b914-4b7a-9a8a-80a5bca138de","year":2015},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:fdf535f4581ce28c0b7cfc0953faf88f95d017ab934b14f23d969df489a21119","observation_id":"7d1d4f61-5064-42a0-8e1d-3aa78034ab6a","resolution":{"observed_at":"2026-05-12T18:57:28.870304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D","venue":null,"work_id":"dbe882cf-1795-4034-8bc4-89ec2d2ab389","year":2019},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:ac99e1ffd4014b13ba29f9edd9fa9f1e4ffd78b14155235202ff6d93535ffc27","observation_id":"24f53383-474b-4b6d-b5df-d15bf63ea882","resolution":{"observed_at":"2026-05-12T18:57:28.873606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":"2306.14824","doi":"10.48550/arxiv.2306.14824","metadata_source":"pith","pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-07-10T06:36:52.542747Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","venue":"cs.CL","work_id":"46e7f9e9-24c6-49af-b7d5-96159fa6f443","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:6dd326e689d5cc2ec984a2d327de2b2b3c3f2367cc4f978e6a65ff99ffe5de80","observation_id":"4578af68-d155-46d8-8b0e-6e1618754984","resolution":{"observed_at":"2026-05-12T18:57:28.726199Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":"d2f7dc48-9381-4c73-ab96-6c09344f3c8f","year":2019},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:a77072c03ddcd0f0a96066cf05a3c68b26af8b7a6c4477e488cbf013173ab225","observation_id":"1b0ec48a-8858-49fd-8f34-0c73b749ae2a","resolution":{"observed_at":"2026-05-12T18:57:28.876807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alec Radford, Jong Wook Kim, Tao Xu, Greg Brockman, Christine McLeavey, and Ilya Sutskever","venue":null,"work_id":"8c059412-b524-4524-bc94-ad2c6dbac786","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:2f0223397ea47e8877a20d376c73f349fdcd89225f94fa5c0a2ddc9be749b6bf","observation_id":"5fe6b423-28aa-4c97-9865-085fe94460da","resolution":{"observed_at":"2026-05-12T18:57:28.880806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":"2303.17580","doi":"10.48550/arxiv.2303.17580","metadata_source":"pith","pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","venue":"cs.CL","work_id":"f20ed1da-2676-4598-a11b-54549718735b","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:c48a65710e4dbe2ef4bcd3b1c6ec1b550a6878d6975c4ba5a547d80fb33deb8b","observation_id":"fb10e4d5-8f2d-43af-8bde-5bdd7fc47cd6","resolution":{"observed_at":"2026-05-14T00:06:45.816188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:34.235168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:34.235168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15930","last_updated":"2023-09-16T06:14:54Z","snapshot_observed_at":"2026-08-03T12:20:32.037666Z","submitted_at":"2023-08-30T10:12:39Z","title":"LLaSM: Large Language and Speech Model","version":3},"cited_work":{"arxiv_id":"2308.15930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.15930","snapshot_observed_at":"2026-07-03T01:37:30.579102Z","title":"LLaSM: Large language and speech model.arXiv preprint arXiv:2308.15930","venue":null,"work_id":"2959c7f3-e690-4086-b347-09ba2e8f3989","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2308.15930","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b84b7b630a84b73ba9e4e9d6cf56dd28797f38e75cfd356eded25ce2ecc7fae5","observation_id":"2bcc33b7-1fb3-4b57-ad7c-82fe00b902f9","resolution":{"observed_at":"2026-05-12T18:57:28.748529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05222","last_updated":"2024-05-08T02:46:43Z","snapshot_observed_at":"2026-07-06T15:52:36.416440Z","submitted_at":"2023-07-11T12:45:39Z","title":"Emu: Generative Pretraining in Multimodality","version":2},"cited_work":{"arxiv_id":"2307.05222","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05222","snapshot_observed_at":"2026-07-04T10:09:44.721463Z","title":"Emu: Generative Pretraining in Multimodality","venue":"cs.CV","work_id":"d20ff802-68ef-4783-943f-7bf17acb6a68","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2307.05222","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b0d24a600df0d4b507aa418ec0584c92ad8b13699bc99343887281e0ed3d3d5d","observation_id":"d1b73c67-50be-45a3-9491-94e911eddeed","resolution":{"observed_at":"2026-05-16T20:22:11.462164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:1d4ca47dfd73270c128a68099542f39c7d5de13fadf3766464d84e074eaa83cc","observation_id":"0877f768-621a-4a4f-a3aa-e5cdd7c7ac10","resolution":{"observed_at":"2026-05-12T18:57:28.757812Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-01T17:44:35.425095Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:b15385d032867f3a77d2ff7f5794d7b8307450a4074f6cf378e396dd4f4e3a98","observation_id":"492184fe-5f82-4b06-a1a1-3b6b33fe2ea8","resolution":{"observed_at":"2026-05-12T18:57:28.762806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:ef5245fdeafac9fac8ff02ba2f02e81c4d3e54e8c91a02ba45cba233a3b61caf","observation_id":"e09f75fc-0890-4b05-b290-52f56213f9f7","resolution":{"observed_at":"2026-05-12T18:57:28.769454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whisper-large-v2 Qwen-audio 1st-stage LLM init","venue":null,"work_id":"94fb6db7-2e38-4838-93f9-cd1e0b97a27a","year":2000},"citing_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T18:57:28.666194Z"},"links":{"citing_paper":"/paper/2311.07919"},"observation_digest":"sha256:041daaae3d190caf6313a88b4f497cf76b6d7dbb6066d21438a958bbcdbf1255","observation_id":"fe3be170-510f-402f-8ce1-f13f025a6ccb","resolution":{"observed_at":"2026-05-12T18:57:28.827623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T16:47:12.709738Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":21,"verified_fuzzy":13},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 100 inbound Pith citation observations for arXiv:2311.07919."}