{"as_of":"2026-08-13T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f897a3774b55d9aad7a7491f051612234923e1551bcf53000a70063c91d5f5f","coverage":[{"denominator":212,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:38:23.099479Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:31:00.822147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T14:31:01.440724Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20266","snapshot_observed_at":"2026-07-13T17:08:58.831798Z","title":"Yu, and Yew-Soon Ong","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.02900","last_updated":"2026-05-24T13:33:45Z","snapshot_observed_at":"2026-08-12T06:42:35.267467Z","submitted_at":"2026-03-28T13:21:44Z","title":"Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses","version":2},"reference_index":251,"source":"pdf_text","source_observed_at":"2026-07-13T17:08:58.831798Z"},"links":{"cited_paper":"/paper/2605.20266","citing_paper":"/paper/2605.02900"},"observation_digest":"sha256:cfd9218952dba7df70cf44669be615a89ed8d0d3c636388786302855512b687c","observation_id":"08cf7ec4-5cdd-4f04-b090-0b7f13e7fd5c","resolution":{"observed_at":"2026-07-13T17:08:58.831798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20266","snapshot_observed_at":"2026-08-01T02:46:58.160847Z","title":"arXiv preprint arXiv:2605.20266 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25355","last_updated":"2026-07-28T07:00:39Z","snapshot_observed_at":"2026-08-08T05:57:56.409443Z","submitted_at":"2026-07-28T07:00:39Z","title":"From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T02:46:58.160847Z"},"links":{"cited_paper":"/paper/2605.20266","citing_paper":"/paper/2607.25355"},"observation_digest":"sha256:d89bec98f3d105cc46749bb5626a6b16a4921256b7aa6f8bbd39660b27dbff98","observation_id":"1e59c1ab-3171-48be-92de-7bddcd9d1d8c","resolution":{"observed_at":"2026-08-01T02:46:58.160847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"cited_work":{"arxiv_id":"2605.20266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20266","snapshot_observed_at":"2026-08-11T14:31:01.440724Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","venue":"cs.SD","work_id":"856fb519-3255-406d-bad7-9ad2b4cfdb09","year":2026},"citing_paper":{"arxiv_id":"2608.09593","last_updated":"2026-08-10T13:27:09Z","snapshot_observed_at":"2026-08-13T21:43:37.226728Z","submitted_at":"2026-08-10T13:27:09Z","title":"MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:31:00.822147Z"},"links":{"cited_paper":"/paper/2605.20266","citing_paper":"/paper/2608.09593"},"observation_digest":"sha256:46626f0cec711d7bdb009b6e3b6f51b0c4d4e0b07fa93f14193e35437f788cd1","observation_id":"0f456d3a-1629-4e93-9508-c92ebf808190","resolution":{"observed_at":"2026-08-11T14:31:01.447278Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20266/citation-record","integrity":"/paper/2605.20266/integrity","json":"/paper/2605.20266/citation-record.json","paper":"/paper/2605.20266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train- ing language models to follow instructions with human feed- back","venue":null,"work_id":"063cc08d-29d0-4f3a-a99e-70e3676cd75e","year":2022},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f2d2f1a09c33c2ca42f112522558c91d263c5a6c2affd06658eb8b536fc2a993","observation_id":"694d4f4d-6c8c-43a8-9e9f-bee119defb1f","resolution":{"observed_at":"2026-05-21T07:39:49.817198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:bab4218d0dc6e8d8da64021d17d88b77029ce826e8faa3802e3c6aeaf922266e","observation_id":"1a6a01ad-9ee4-43a4-a0ed-bb0edc875175","resolution":{"observed_at":"2026-05-21T07:39:48.861990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:a9fbee22350ad6e47c72aa2444dc89268c5462f8c97b2b4f0c0b09933ca5ca4c","observation_id":"6d50fc00-bda8-4c79-9149-59500ddbf3dd","resolution":{"observed_at":"2026-05-21T07:39:48.799576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9fe950723dc271af19c66ad2922aff3b947965b3ce1e1f0faa85ba851d12f355","observation_id":"c4b18f69-8e38-4a43-856e-e7d1ea250db9","resolution":{"observed_at":"2026-05-21T07:39:48.802464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:db997a82a9f69591c43de7e54b4ea917cce7f76298c39eddfac2c1e53971737d","observation_id":"ccfb269b-f7e0-4e32-ad46-b412b6f1b0c0","resolution":{"observed_at":"2026-05-21T07:39:48.975191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f0d07c43e83bcf68653e1246434dd4ab5b5f8a9ba550b14455b7718eae92985f","observation_id":"c88ab41e-9ac0-40ea-b897-df2b065cb616","resolution":{"observed_at":"2026-05-21T07:39:48.972211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"cited_work":{"arxiv_id":"2502.02871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02871","snapshot_observed_at":"2026-06-29T13:03:26.330684Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","venue":"cs.CL","work_id":"cdb0ff1d-fc25-4dab-a64f-292770926f2a","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2502.02871","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2b5076b4f3cdc72c18a05c8ef52a1999c9a83241f042c99f0df95a5aa5601bb9","observation_id":"71218e0b-0241-4385-9a0d-1001978ec24b","resolution":{"observed_at":"2026-05-21T07:39:48.726419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of mathematical reasoning in the era of multimodal large language model: Benchmark, method & challenges","venue":null,"work_id":"d35d6023-2579-4844-a16a-46e09f8781c4","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:c0dc380350b9f2671c5d20304600c65baffc68a4ebc2551bc475dc226ca65d9e","observation_id":"665e8213-d143-4275-8771-2388157dc191","resolution":{"observed_at":"2026-05-21T07:39:49.759049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-10T14:43:33.791354Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:fd583a1b17cbdb4c64c52567701b40c9777175c3fefd4e9b9780469cbf129688","observation_id":"4e07d990-05bc-4a69-9622-ced1ccad604f","resolution":{"observed_at":"2026-05-21T07:39:48.774649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-13T10:28:20.015911Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":"2308.12792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schuller","venue":null,"work_id":"a75066e0-be80-49f3-adf5-c74af9ac4b8d","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b5ef33b8b2572fb0bdae9ded4af65b3b6896482a9bbaf15c3fa0bd135ae526d6","observation_id":"6c6d05f5-03a7-48d3-b83c-8c7ed597307e","resolution":{"observed_at":"2026-05-21T07:39:48.960571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio-conditioned diffusion llms for asr and deliberation pro- cessing","venue":null,"work_id":"a72ab7ef-9b2c-4307-b57d-1fb6bc5a5947","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:1225ec556069c378ea45a9e834d2b0455de2815390d5a698f6a545f00ec93237","observation_id":"d7f102fe-a4ed-49a3-a7ce-567ab1f56662","resolution":{"observed_at":"2026-05-21T07:39:49.754984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-08-13T02:49:58.912820Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:a71a163bf3cf72e7680805bd9d59832eb0bb00b47c1ce716e334ea17c7d8dbbb","observation_id":"bc4ed5c6-98d8-4860-bb69-3c269283cbac","resolution":{"observed_at":"2026-05-21T07:39:48.719800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"ab42d3ad-859e-4e50-9b7b-166716cfadc2","year":2017},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9c7490da19ed7ef6e84be3a0f09f4f1c105632d38afa9222c917e95621a62937","observation_id":"4a6d298b-aaec-4927-a64f-f4e518264932","resolution":{"observed_at":"2026-05-21T07:39:49.778557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition","venue":null,"work_id":"ac15c113-9558-4c8a-9c59-725ad2cbafbf","year":2020},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:ef68fef4f5a7b7a35bdfc1ea80a43909d0902e9bb8d17a46aade12a9e7b81479","observation_id":"26867c5d-7cdf-48ca-b644-c27dd9cc5ded","resolution":{"observed_at":"2026-05-21T07:39:49.846414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:32e1728f223e37672c4f36f2fd35ac234b63f3b5b9c171d8ba26eaf9bb445abc","observation_id":"eb3712d9-5bb2-4d85-8236-08592f036432","resolution":{"observed_at":"2026-05-21T07:39:49.032020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.13289","doi":"10.1016/j.ajhg.2009.06.010","metadata_source":"pith","pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":"cs.SD","work_id":"b06d6def-ea7a-4cbd-8bb3-73f6a81db238","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:94a431e4077d739223f2cd3c7719bc8dbcb649cd5b7ec5f49f1f71f35ee83cdd","observation_id":"c6e1a597-9785-44ea-9428-e31770419ecb","resolution":{"observed_at":"2026-05-21T07:39:49.005020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:4e28c4d09e1e1b2a89a09d4b33aa26024687b30e77e3a81810e0e4702f8f12d1","observation_id":"d6f59265-9359-4906-b01c-3441777c4884","resolution":{"observed_at":"2026-05-21T07:39:49.121346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-13T05:33:22.244747Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":"2407.10759","doi":"10.48550/arxiv.2407.10759","metadata_source":"pith","pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-Audio Technical Report","venue":"eess.AS","work_id":"c249e63c-cf40-408f-a4ff-fdf68e8cbeb8","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:226d27008adc3b81be95498f2cad10db442cad595df0b2827cd52de445c9c43e","observation_id":"0f2f1cc2-7c84-4d62-ace3-918330bf26f6","resolution":{"observed_at":"2026-05-21T07:39:48.995254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:935877b9e60bf77528f54e76c949fcd85400202e43a96fce9cf582f2373f4d57","observation_id":"1127c340-aff0-405a-a49c-8502257f8e5a","resolution":{"observed_at":"2026-05-21T07:39:48.989142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17686","last_updated":"2024-12-23T16:11:27Z","snapshot_observed_at":"2026-08-13T21:57:18.514742Z","submitted_at":"2024-12-23T16:11:27Z","title":"Large Language Model Safety: A Holistic Survey","version":1},"cited_work":{"arxiv_id":"2412.17686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17686","snapshot_observed_at":"2026-07-03T01:07:30.299088Z","title":"Large language model safety: A holistic survey","venue":null,"work_id":"eaec35df-3042-4000-bf7a-449b7aacc386","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2412.17686","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:84a714cb06c9a84ddf5bd6beb6e897ebbb22a8878995aa18da335f6d91f6bef6","observation_id":"a6c798d3-1c16-4c0b-bb8a-df65629c8dfa","resolution":{"observed_at":"2026-05-21T07:39:49.118397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-09T14:46:30.842437Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"cited_work":{"arxiv_id":"2504.15585","doi":"10.48550/arxiv.2504.15585","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A comprehensive survey in llm (-agent) full stack safety: Data, training and deployment","venue":"ArXiv.org","work_id":"890e4d27-50d3-4726-8e34-bbd56d407411","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2504.15585","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:98e08c7c88552ae35830b5b9b85bae8054bf7cd042cac9dcd74cf7af12d6e582","observation_id":"1ebf339c-e46d-4d65-addf-a2d9d2dc71a7","resolution":{"observed_at":"2026-05-21T07:39:49.124688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on trustworthy llm agents: Threats and countermeasures","venue":null,"work_id":"ca0bcec2-60c7-4fa8-9e7d-f48f82dce5f3","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f4338aa4e38e01333ef88bd50e27d5933b98f9c759721eaf76d88619dad5795c","observation_id":"511d99d4-2429-420a-b5bb-040b1dad7325","resolution":{"observed_at":"2026-05-21T07:39:49.844469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Safety at scale: A comprehensive survey of large model and agent safety","venue":null,"work_id":"c90523e8-e887-44e1-8958-82d4cf7c8249","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f3c56eaa749e255397fa3526646ac2e38cf6c1fb9f6a72272d916785b4e68f79","observation_id":"6a8e730f-5ff1-46aa-8424-d485d76795a5","resolution":{"observed_at":"2026-05-21T07:39:49.842520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.02175","doi":"10.48550/arxiv.2508.02175","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hidden in the noise: Unveil- ing backdoors in audio llms alignment through latent acoustic pattern triggers","venue":"arXiv (Cornell University)","work_id":"f5ba10b7-d8b2-44d0-9cae-b7c20e2e20be","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:36067d5fb6f1c3656b6e5728e621d2060e3985bba882861c64987e40fd467cca","observation_id":"fcb8bd76-8422-4caf-9721-3cce9a275860","resolution":{"observed_at":"2026-05-21T07:39:49.135181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic voices, real threats: Evaluating large text-to-speech models in generating harmful audio","venue":null,"work_id":"cd1a1c53-783a-46bf-b119-9566e3f3ed5a","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:60b76e8e898daf7db781a166ff534ec3d33275fa23ad0018d4b197cf7ff553af","observation_id":"8228f3fe-ee4e-416a-8f14-6321626996dc","resolution":{"observed_at":"2026-05-21T07:39:49.017035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:59:52.827970Z","title":"Evalu- ation of audio language models for fairness, safety, and security","venue":null,"work_id":"c265464e-7654-4215-a060-e24f8e09b15c","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:ef91de1a43968c2ce9f578b68692caa4195eab8b6cc96760a8b69e770845c358","observation_id":"17dd6268-9d23-460d-9af3-3a77e27beb01","resolution":{"observed_at":"2026-05-21T07:39:48.754127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-11T08:37:21.535936Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"cited_work":{"arxiv_id":"2604.14604","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","venue":"cs.CR","work_id":"98731069-6aa1-4c3b-a6eb-ddbc21d15ef8","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2604.14604","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:e4dcee93106e6b0d2ceb3c0a5564c78f5cc4a8e4a9ce66071d40274e087e8bff","observation_id":"4e65afcc-bc2c-441c-b480-3433297dde8d","resolution":{"observed_at":"2026-05-21T07:39:49.131246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.06606","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T07:47:44.500718Z","title":"Spur: A plug-and-play framework for integrating spatial audio understanding and reasoning into large audio-language models","venue":null,"work_id":"def0b7ba-4bad-41dd-8ef4-8b0f0015ff25","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:c75131799d8d29d2605bc5a7180d419d03cce80074c1a0baec339c3370796a20","observation_id":"9fc9cc4a-4674-42f3-80ae-4589d960a83d","resolution":{"observed_at":"2026-05-21T07:39:49.089781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.10423","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:19:31.062841Z","title":"Pal: Probing audio encoders via llms-audio information transfer into llms","venue":null,"work_id":"4b8f99a3-1ac8-4ccd-ad75-78ec55b3f731","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:0e66330270ce1cb782d112cda8af6f0c486e0b568fe6dc8a399834954b80560a","observation_id":"03366fba-bcde-4bc0-b917-7b224505f92d","resolution":{"observed_at":"2026-05-21T07:39:49.102787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02954","last_updated":"2026-05-10T15:03:28Z","snapshot_observed_at":"2026-08-11T15:36:41.247431Z","submitted_at":"2026-01-06T11:54:47Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","version":3},"cited_work":{"arxiv_id":"2601.02954","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.02954","snapshot_observed_at":"2026-07-03T07:47:44.503602Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","venue":"cs.SD","work_id":"21ce33c1-a81d-48f7-b706-b895c7df924f","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2601.02954","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:045dd89c98186f18ed5eea100165d01fd494cb1fc3be4bde14aaed9fa60db821","observation_id":"d0344805-9d67-4ee9-b91d-1601b26a7c17","resolution":{"observed_at":"2026-05-21T07:39:49.108827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llamapartialspoof: An llm-driven fake speech dataset simulat- ing disinformation generation","venue":null,"work_id":"138a64fc-4bb6-47e9-bd9a-5631d63dcb97","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:5b4b3ea13a1b323ec5d0d02e1bff972fc4145a8fb918f03e918d927ce7baeecb","observation_id":"74c04294-e087-4126-9c6b-56957c546dec","resolution":{"observed_at":"2026-05-21T07:39:49.838733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dfallm: Achieving generalizable multitask deepfake detection by optimizing audio llm components","venue":null,"work_id":"8b245c16-6554-4a83-b498-d96a385c9567","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:c16e4b2fcb4511024b18aff3c3b0fadff0bcb4d5f6e7fe8d9c566bdfe959bd60","observation_id":"bbefb739-4bcb-4b92-baf6-d0b16a47bf27","resolution":{"observed_at":"2026-05-21T07:39:49.080261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03615","last_updated":"2026-05-31T06:28:59Z","snapshot_observed_at":"2026-08-13T18:47:40.849239Z","submitted_at":"2026-01-07T05:46:45Z","title":"SARA: Stress Test Reasoning in Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":"2601.03615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03615","snapshot_observed_at":"2026-06-29T13:23:28.083486Z","title":"Analyzing reasoning shifts in audio deepfake detection under adversarial attacks: The reasoning tax versus shield bifurcation","venue":"cs.CL","work_id":"5185561b-d58b-48df-900f-93f5f90c9e09","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2601.03615","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:af4efd21410e818fd61ffc41efafdedd21f14120dc9fbdb4804d2b63bef8c65f","observation_id":"2a2b6d12-5372-44e8-a201-512ef6c09873","resolution":{"observed_at":"2026-06-02T02:04:12.916729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on speech large language models for understanding","venue":null,"work_id":"b8603dcb-dbb7-4473-b026-bb52a0af9b58","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:065d23e7f5a31e274cfa8a6eba2fdeb5672cfa42db1ea43aa96ac0356eaab485","observation_id":"5c629e03-3ee2-4f93-9b3a-70a5f23446ea","resolution":{"observed_at":"2026-05-21T07:39:49.835077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-10T17:21:32.264725Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:62bbfe9f54bfdbeddc6ecb4ba2587afab2831de4b710fa224f64fd76d9e2d24d","observation_id":"9f4bed0e-2a05-402c-a285-dfbabd16d2bc","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey","venue":null,"work_id":"6deb8222-a058-491d-a2b2-b15f1fc0486b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:4027142fe82ccf7d64ab301a8ccdca2143c72b74df049594d0c7450dfbfde6ab","observation_id":"f35eb555-253a-4471-bc51-49ec37d24d6d","resolution":{"observed_at":"2026-05-21T07:39:49.832872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09006","last_updated":"2023-04-16T10:08:40Z","snapshot_observed_at":"2026-08-13T13:19:32.093717Z","submitted_at":"2022-12-18T04:21:35Z","title":"A Review of Speech-centric Trustworthy Machine Learning: Privacy, Safety, and Fairness","version":2},"cited_work":{"arxiv_id":"2212.09006","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.09006","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review of speech-centric trustworthy machine learning: Privacy, safety, and fairness","venue":null,"work_id":"268ffde0-9098-4d09-8cdc-640d866f0ffc","year":2022},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2212.09006","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:33b7b4ccfa39d78bc7c9d4357d89c43102120abe304621093905cb5699b633b6","observation_id":"478d7935-bf90-419f-9588-e7702fdd17e8","resolution":{"observed_at":"2026-05-21T07:39:49.127787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14970","last_updated":"2023-08-29T01:50:01Z","snapshot_observed_at":"2026-08-13T10:25:20.599046Z","submitted_at":"2023-08-29T01:50:01Z","title":"Audio Deepfake Detection: A Survey","version":1},"cited_work":{"arxiv_id":"2308.14970","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.14970","snapshot_observed_at":"2026-07-03T18:18:50.126056Z","title":"Audio Deepfake detection: A survey","venue":null,"work_id":"928f5967-be3a-4ade-96df-8dd82f3810e9","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2308.14970","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:89eb1b54959f12d736104dd163e7cb67bc07067c839c8489fb764f25387b6247","observation_id":"7b7963dc-e970-485b-bca8-05ac9c338ed2","resolution":{"observed_at":"2026-05-21T07:39:48.684881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on speech deepfake detection","venue":null,"work_id":"cc8df00e-7195-4cfe-994e-0ecc944bebb6","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:7991ef05b81b8a5e627146916441b9e81226ad1d11faf2f3253e133826585d3d","observation_id":"7a136817-6ac6-4423-a50d-9ceca150c06e","resolution":{"observed_at":"2026-05-21T07:39:49.824885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comprehensive survey with critical analysis for deepfake speech detection","venue":null,"work_id":"feb1d690-1b04-439c-afd0-5711b146dfa0","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:28b3b6313d59285507b283f8e679ac579b6dfde852606d2aa9ffeea364fdb997","observation_id":"d5605ed9-cb1f-4f14-bcb4-281927ed6c08","resolution":{"observed_at":"2026-05-21T07:39:49.820909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances in speech language models: A survey","venue":null,"work_id":"981bd6ed-60a4-412a-a41c-d58bc8d3c5f8","year":2021},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b30bb62ed0c23dac7eb161145332a6054bcd2481e4886025385d7e09e727b964","observation_id":"f242cafb-2e46-4341-b95a-a5e247b7d1e9","resolution":{"observed_at":"2026-05-21T07:39:49.836923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"3a090f1e-5cc1-4837-a61a-710bd61c927b","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:1e192a5f79b71c2c44ee134f81e2148f5ef9d0e218bdb6f800c0bd94a97df4dd","observation_id":"c756bf35-c122-4e1f-9e74-1b68d9f4756e","resolution":{"observed_at":"2026-05-21T07:39:49.765291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.14224","doi":"10.48550/arxiv.2602.14224","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The interspeech 2026 audio reasoning chal- lenge: Evaluating reasoning process quality for audio reasoning models and agents","venue":"Open MIND","work_id":"235d1022-58e5-4528-8ba4-9e2e87a97242","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:695044d0b2b221715c6ca8d360743371d29b68813f2dc0fc02c9b18be7d4c943","observation_id":"622f736f-9925-43a8-a7ca-b854f80fd733","resolution":{"observed_at":"2026-05-21T07:39:48.954048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sci-phi: A large language model spatial audio descriptor","venue":null,"work_id":"69013311-8a46-40dd-b18d-3ab188dc542d","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:4baab66c5577c689756aebbe26e518a561e69f9a741a5050aec8f04fa82450d1","observation_id":"69bf8a91-a929-441f-8d9f-417e2c0257ba","resolution":{"observed_at":"2026-05-21T07:39:49.763060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It hears, it sees too: Multi-modal llm for depression detection by integrating visual understanding into audio language models","venue":null,"work_id":"a793b9c2-77bb-48fd-b1bc-4776e0fe46c8","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:7144c6372c0e056144667ed002a4f645b641f8ce5809686380ca2c7e4f234feb","observation_id":"e0ca901e-a703-4296-8371-51c885591bfd","resolution":{"observed_at":"2026-05-21T07:39:48.665573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wearvox: An egocentric multi- channel voice assistant benchmark for wearables","venue":null,"work_id":"2c623792-2cca-4bee-8405-08c5930d956c","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2de24fc8a7854d8f29493f89d346dabebe8cb9bd3adc679aaea23b1e74184835","observation_id":"bd828b01-e59d-422d-8fff-61692e943548","resolution":{"observed_at":"2026-05-21T07:39:48.944786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.19195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T12:54:40.670804Z","title":"How auditory knowledge in llm backbones shapes audio language models: A holistic evaluation","venue":null,"work_id":"c3c294fc-0455-4739-a1d7-a40747a92deb","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:3c3673584455e901744657b0a5c4595453c41035f373ec081f621a3d487ccca2","observation_id":"f1ac5a27-310a-41f9-9d21-2adf5733ec1b","resolution":{"observed_at":"2026-05-21T07:39:48.907955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16724","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Salm: Spatial audio language model with structured embeddings for understanding and editing","venue":null,"work_id":"5970fe0e-dec7-4076-81d4-e47246f39364","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:8e0724048e6cef5cc0cd6dd7c07c7d58faf72d18807acb95a8db4959778b157a","observation_id":"1f82e285-9cf7-4e9f-9430-b6b4621847c5","resolution":{"observed_at":"2026-05-21T07:39:49.019768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent speech- text transformer","venue":null,"work_id":"ae6d3eb2-7177-454a-b2bb-6bd81c8eaf41","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9ac8cbc706e8e8bda70f7aa29d4b04010825e8fd2e17829d00ba2e73da974905","observation_id":"3a85349f-211d-4f1e-bb04-61872c10a105","resolution":{"observed_at":"2026-05-21T07:39:48.656510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04683","doi":"10.48550/arxiv.2602.04683","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uniaudio 2.0: A unified audio language model with text-aligned factorized audio tokenization","venue":"Open MIND","work_id":"948fbb52-c200-4567-8bf7-407498c994d0","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9f69100461d5556e434b237a4899664a43bf468597a9521bd24650e32ef3eb6f","observation_id":"a6877885-3c6d-49cc-9ddf-860bece034aa","resolution":{"observed_at":"2026-05-21T07:39:48.897242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20973","doi":"10.48550/arxiv.2511.20973","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards audio token compression in large audio language models","venue":"ArXiv.org","work_id":"41b97985-618b-4192-8d41-3d9849f7512e","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2b21da6417906772cd45cd26cdf77100ade151329d57112c12b307958e66336d","observation_id":"8134bbdb-59df-4ba9-91de-6beb2d1c3d04","resolution":{"observed_at":"2026-05-21T07:39:48.870971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vowelprompt: Hearing speech emo- tions from text via vowel-level prosodic augmentation","venue":null,"work_id":"73633c2e-1bd4-471b-a21d-93348cb774d5","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:e33b62cd412bc38b5c88e72d82b8555538a78b5ba6fe5f586e1035747a8624cc","observation_id":"b6264d41-974c-4c6e-81d7-16bb7a80d931","resolution":{"observed_at":"2026-05-21T07:39:48.963339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.02967","doi":"10.48550/arxiv.2601.02967","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moe adapter for large audio language models: Sparsity, disentanglement, and gradient-conflict-free","venue":"arXiv (Cornell University)","work_id":"f627f722-810b-4303-b3ba-535153e3253c","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:487bda304f02e39f4ec7c198cbf37ba34e89a32f1895af311895ee2994aae82a","observation_id":"d1e5b316-d06a-4960-a03c-44daa7b02aeb","resolution":{"observed_at":"2026-05-21T07:39:48.811484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:52.695211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:52.695211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.14293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T11:44:38.347335Z","title":"Segmentwise pruning in audio-language models","venue":null,"work_id":"9342d6b3-82ac-4cd5-a764-cacfe65d575a","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:e142bbc87b3befea642925f418c794cc8ba086cd29e6f69f4a9705334f8e39fd","observation_id":"4e00dbb0-2c33-46f8-944d-bdb78dfa175b","resolution":{"observed_at":"2026-05-21T07:39:48.653295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning large audio-language mod- els with lora for precise temporal localization of prolonged expo- sure therapy elements","venue":null,"work_id":"23704f68-5d9b-40be-acf8-9e152b389f15","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:1333e597ac58f0a8f335c32d669e5992c66ceed849ccc43131a0c07ab6385339","observation_id":"9371d7ec-62d0-4181-a271-12d2e274e222","resolution":{"observed_at":"2026-05-21T07:39:48.978533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04876","last_updated":"2026-05-27T05:39:51Z","snapshot_observed_at":"2026-08-06T04:16:05.142007Z","submitted_at":"2026-01-08T12:21:09Z","title":"ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models","version":2},"cited_work":{"arxiv_id":"2601.04876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.04876","snapshot_observed_at":"2026-07-07T14:53:55.862562Z","title":"Chronosaudio: A comprehensive long-audio benchmark for evaluating audio-large language mod- els","venue":"cs.SD","work_id":"20767bd2-9c5e-413b-a479-7c5b281cbdc0","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2601.04876","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:685d4c3c859f351137a0cceb61a6bbffe87276abfd996dde45a80a5d764637b2","observation_id":"a0be3ba8-caa5-4852-ab22-dc9166fd8491","resolution":{"observed_at":"2026-05-28T02:04:13.437222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Extending audio context for long-form understanding in large audio-language models","venue":null,"work_id":"56112fd6-ceeb-4c6f-a9ff-3962ac903633","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:df71d4e0db4816b43d6088c770b2cd396e119e8541785af86c3cf62bb9171a09","observation_id":"85bfcc72-19f4-413b-8ab3-f5cef501f160","resolution":{"observed_at":"2026-05-21T07:39:49.753014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Listening between the frames: Bridging temporal gaps in large audio-language mod- els","venue":null,"work_id":"7c593f36-dff6-494b-a0f6-f05d0e8cbbb8","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:44fd1f91a1d7fb62ce33d54dfcb8ea35610bd503d2e49ec7648f37852e19e106","observation_id":"a762a375-8756-4105-97dd-8bc156d1cf14","resolution":{"observed_at":"2026-05-21T07:39:49.840626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end contrastive language-speech pretraining model for long-form spoken ques- tion answering","venue":null,"work_id":"2c2424fa-df94-490b-8697-8dad5ca2f596","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f9767bfe8c90e11b8e2d26fd60d7ef80ba670c09e6c82eb2e95f18bd212b059a","observation_id":"16001722-9dbc-43e2-a94f-cdf2e47fdea3","resolution":{"observed_at":"2026-05-21T07:39:49.756949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23808","doi":"10.48550/arxiv.2512.23808","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mimo-audio: Audio language models are few-shot learners","venue":"arXiv (Cornell University)","work_id":"8c438dfc-e0fb-45e5-983b-3708cd7afa91","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2034b38fb53f1f28ac5c5252ab5fb8aa1422775370bd1cbfc235e1961683951a","observation_id":"fc930028-8e59-4a9e-b904-3101dc7422b5","resolution":{"observed_at":"2026-05-21T07:39:48.876692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:39:01.638144Z","title":"Pay more attention to audio: Mitigating imbalance of cross- modal attention in large audio language models","venue":null,"work_id":"9f3b162d-859d-486d-b83b-f3032b48c76a","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:7223944596955c061c10c794400f1b6df5f5a5f3583b0626de9c6d7fa8ec0b12","observation_id":"dc7f0c5b-d58e-4804-a8fd-bde7c8fdd1cd","resolution":{"observed_at":"2026-05-21T07:39:48.762945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21060","doi":"10.48550/arxiv.2509.21060","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring audio’s impact on correctness: Audio-contribution-aware post-training of large audio language models","venue":"Research Portal (King's College London)","work_id":"78aac118-cc6b-4c29-bfd2-7104eaab9861","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b90db62fb5b9a5596d998583a4f7b62aac8d79cb1dece8400c8d6e76f2c7a994","observation_id":"b2eeec74-f6b4-4aaa-84f7-2f8d2f25d4b5","resolution":{"observed_at":"2026-05-21T07:39:48.745260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.09556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALARM: Audio–language align- ment for reasoning models","venue":null,"work_id":"1b75912c-499c-4432-a692-d6ea512702c7","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:837d042e2c5f6951c951ee5715a9d9a5c484ee36e3ddbdcb759698f304c20c45","observation_id":"777b3c29-c517-4f61-993a-314ec0faac2b","resolution":{"observed_at":"2026-05-21T07:39:48.777599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sightsound- r1: Cross-modal reasoning distillation from vision to audio lan- guage models","venue":null,"work_id":"a4a115aa-4aa0-4b84-90bd-5fd26a8e6a6b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:0d0b65cd937242d0fce99d8f893a37aed76ac64b922007567260161172afb32d","observation_id":"e2e6d3a6-16dc-4ae0-980c-70cdc4b0fd6c","resolution":{"observed_at":"2026-05-21T07:39:48.852598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.16547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:46:46.252465Z","title":"Cord: Bridging the audio-text reasoning gap via weighted on-policy cross-modal distillation","venue":null,"work_id":"65a586a4-cb3d-4f7a-99c3-51f8f7bd1e79","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:bc1976939b364beef76bd0ea162492a27218d884fb4a53ec89fd53b5213bd94f","observation_id":"6bf543d6-bdeb-471e-a7fa-2403dd2e9ef8","resolution":{"observed_at":"2026-05-21T07:39:48.643960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention-weighted centered kernel alignment for knowledge distillation in large audio-language models applied to speech emotion recognition","venue":null,"work_id":"488fd1a9-2908-4a12-9e6a-1dfe0c478c50","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b6e0974f14161c04eccc3512b800d8461e5d42e74bf47cd6fc0809adca60f237","observation_id":"50abe11a-3eb8-4798-bb52-8280d0da6e07","resolution":{"observed_at":"2026-05-21T07:39:48.911456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.01091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feedback-driven retrieval-augmented audio generation with large audio language models","venue":null,"work_id":"56d4a855-450c-4320-b4c2-49e17dba2190","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:0727d82c114866a1bfb2833bace19dbdb2b0a5785bd5ae37273107e0bae916ad","observation_id":"0c16837a-701e-4bb2-b07b-f7e282ccd707","resolution":{"observed_at":"2026-05-21T07:39:49.059461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T10:16:52.276735Z","title":"Emo-tta: Improving test- time adaptation of audio-language models for speech emotion recognition","venue":null,"work_id":"fc790bbf-184d-4cd4-a9fa-08a995285e29","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:551bb09d8a16ee5551f728f0635d13a205f288e5bd3dfdfdeee45cac88fd6ab4","observation_id":"a834effd-d46b-4a95-ad35-ba7c2ef013da","resolution":{"observed_at":"2026-05-21T07:39:49.062382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b84750f17af917ab3153b9f197d1c39ecf4161bede63ac69d7f7b5d2d1d1c8b8","observation_id":"3e1a5b93-42aa-42d3-b65a-0f686d7bb436","resolution":{"observed_at":"2026-05-21T07:39:49.050610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.14515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.709693Z","title":"From turn-taking to synchronous dialogue: A survey of full-duplex spoken language models","venue":null,"work_id":"b7e531ae-f18c-4c43-9259-84866b46f913","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:12c28a415b8b83a03ce1aa71e0e0200aa2134125e3c8c78ba7c61aff40036da0","observation_id":"45edfc70-9523-4b0c-bf8c-15961c8ea932","resolution":{"observed_at":"2026-05-21T07:39:48.710604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the turn-based game: Enabling real- time conversations with duplex models","venue":null,"work_id":"0d3a088d-3e29-4425-9873-40eedce9f6f4","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:de436e2a2896af5555da911f0b8bef9997cef4d28085756313223f06b1f298aa","observation_id":"af44c0a8-9c92-4863-be2e-b5a09527af87","resolution":{"observed_at":"2026-05-21T07:39:49.823005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-13T14:17:58.045264Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2411.18138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-07-04T03:49:30.373862Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation","venue":null,"work_id":"28fdac16-3d7f-4580-bfab-d6509003e772","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:84db1e8d40673d6adb1478967a28ae206f8564fffc558556088f72cc3fc1e9c3","observation_id":"61fc04fe-291b-453e-aafe-84f5e13f9255","resolution":{"observed_at":"2026-05-21T07:39:48.723184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15670","last_updated":"2025-07-25T15:07:10Z","snapshot_observed_at":"2026-08-09T02:59:04.485815Z","submitted_at":"2025-05-21T15:48:30Z","title":"SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model","version":4},"cited_work":{"arxiv_id":"2505.15670","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15670","snapshot_observed_at":"2026-07-08T00:04:22.333058Z","title":"Efficient and direct duplex modeling for speech-to-speech language model.arXiv preprint arXiv:2505.15670","venue":"cs.CL","work_id":"ca80a80e-983c-4a18-9a7c-74dbcc1dec1b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2505.15670","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2808481ccf29860abdf4d50255753034af3cc06cceec57491b9aafc6e957e948","observation_id":"38d2eaf1-5dd8-4436-85e2-856c68393d1f","resolution":{"observed_at":"2026-05-21T07:39:48.873747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18706","doi":"10.48550/arxiv.2512.18706","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"X-talk: On the underestimated potential of modular speech-to-speech dialogue system","venue":"arXiv (Cornell University)","work_id":"60429a3f-475b-4321-998a-083e2b5113e3","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:1b587ae3760bd3260d3cd0475bbfdec47c0b65997d9189d4db7556ace1bef58f","observation_id":"e606ea92-8c06-4e21-9526-d6c9c9e1fed2","resolution":{"observed_at":"2026-05-21T07:39:48.678800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:49:25.017689Z","title":"Soulx-duplug: Plug-and-play streaming state prediction module for realtime full-duplex speech conver- sation","venue":null,"work_id":"79d81189-5f3b-41ef-8d73-3947f4d66799","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:27ff47f37b25e35c1fd6db5038b929017096d2e4c74c9ae4714fba39ee68927c","observation_id":"be54a2f3-04cf-4627-8db8-70f9a5e5092f","resolution":{"observed_at":"2026-05-21T07:39:49.115100Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-03T10:51:29.519900Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"cited_work":{"arxiv_id":"2603.22267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.22267","snapshot_observed_at":"2026-07-03T05:07:39.491383Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","venue":"cs.CL","work_id":"7a127a16-f363-484d-b677-9864a1ca9a30","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2603.22267","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:d0a374ceb7e278ef6540e087c34cc6e6fb91ab3590e8185562ed9fa8b34683fa","observation_id":"bf962174-d5e0-472b-8040-867b5abb5218","resolution":{"observed_at":"2026-05-21T07:39:48.984447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-08-13T18:44:53.184030Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"cited_work":{"arxiv_id":"2604.10065","doi":"10.48550/arxiv.2604.10065","metadata_source":"pith","pith_arxiv_id":"2604.10065","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","venue":"cs.CL","work_id":"531f5612-0fd0-432d-8e8b-fa941cc13ce1","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2604.10065","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:17fe2ddfbce105631d96f71ccf15cc9cfa3cc2cc914b1954caba98b1dcb49f20","observation_id":"9e8d5479-f8cb-4d95-9e96-ba3ab84b27cb","resolution":{"observed_at":"2026-05-21T07:39:48.650067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.02521","doi":"10.48550/arxiv.2509.02521","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flm-audio: Natural monologues improves native full-duplex chatbots via dual training","venue":"Open MIND","work_id":"836eb1ee-cc6b-43c3-9eed-d4c77ebd4d27","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9f796e6e274796e19a960229ef72bdbd19ab9e5312f6c458b4948555c8fc1db0","observation_id":"a7c577a3-c9a2-4781-971f-36e086d45258","resolution":{"observed_at":"2026-05-21T07:39:48.662521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:47.823313+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:47.823313+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12928","last_updated":"2026-05-12T00:31:31Z","snapshot_observed_at":"2026-08-11T05:14:42.532529Z","submitted_at":"2026-04-14T16:17:52Z","title":"MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models","version":3},"cited_work":{"arxiv_id":"2604.12928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12928","snapshot_observed_at":"2026-07-08T00:04:22.468935Z","title":"MoshiRAG: Asynchronous Knowledge Retrieval for Full-Duplex Speech Language Models","venue":"cs.CL","work_id":"3892f74f-5dcd-43d6-82c8-e54735223edf","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2604.12928","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:50895e3bac60473b4b74c622e2cf2df6ba5b994a4ef1537e4c3c223b43748343","observation_id":"654553f8-955e-4c16-9ce8-bac3cabd52a1","resolution":{"observed_at":"2026-05-21T07:39:48.783203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"cited_work":{"arxiv_id":"2603.17837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.17837","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","venue":"eess.AS","work_id":"dfb267b4-fcc6-4097-9eb0-9b209e5c2033","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2603.17837","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:85d1ff25988b8ad7d1c3174385ebbfbdb79f4d616c936bd3e80219bf61b0b5f0","observation_id":"034d76da-74bc-4a1f-8528-057f34dcb6a4","resolution":{"observed_at":"2026-05-21T07:39:48.786532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08179","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privacy-preserving end-to-end full-duplex speech dialogue models","venue":null,"work_id":"aa54bd07-de33-4b0e-9702-b152568f27cd","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:bdf12f08939d96c7c4a226dd681477d5f2ed4869a92724a916439c0fd96a22a7","observation_id":"2d0d38c5-f495-476d-b209-703ffee56fbe","resolution":{"observed_at":"2026-05-21T07:39:48.859379Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T02:49:25.023354Z","title":"Covo-audio technical report","venue":null,"work_id":"b131a09f-08ea-46fa-8553-8ea5fc48c89c","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2e43a05d4f0697bb79dc6efd6510a058cb047bce832a49761f900fc981fd401f","observation_id":"fee3831a-cbb2-4ee3-a1cf-2e8a07c88764","resolution":{"observed_at":"2026-05-21T07:39:48.690963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21749","doi":"10.48550/arxiv.2509.21749","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking with sound: Audio chain-of-thought enables multimodal reasoning in large audio-language models","venue":"arXiv (Cornell University)","work_id":"85380550-036c-4fee-9b12-7e2089268565","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:8890f4296af378ae8e563303b812fa46f0ef17941fc35eba3901f373a54c3884","observation_id":"1ab8df7f-4c69-45d5-af14-c9dd7a7ca169","resolution":{"observed_at":"2026-05-21T07:39:48.922078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11909","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:07:22.084492Z","title":"Echo: Towards advanced audio comprehension via audio-interleaved reasoning","venue":null,"work_id":"34bf5386-5069-480a-82bc-043e86fc3f55","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:e1f9db78dd109ecc1b9795cd1b1d358aabc90bec0733253281c6825fe394ba96","observation_id":"310f6a7a-68d9-4d62-8292-f52092b95b66","resolution":{"observed_at":"2026-05-21T07:39:48.829044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14636","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nudging hidden states: Training-free model steering for chain-of-thought reasoning in large audio-language models","venue":null,"work_id":"74fee78f-85d5-40ef-a42c-fb9cbf46244a","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:717b31e7071b03aff2bde9f61e428137c9288290eaf18100d0eece6d86166458","observation_id":"8b58e20f-7775-4376-8202-19d9b5e928bf","resolution":{"observed_at":"2026-05-21T07:39:48.904441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07497","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:28:39.159788Z","title":"Can speech llms think while listening?arXiv preprint arXiv:2510.07497","venue":null,"work_id":"defed70b-f7eb-4587-8f86-c51c624c6778","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:9853fb7b25f13227d837768dbacdbfeed214fc7de351732178e59de128589c94","observation_id":"05e21043-7cbd-4820-90c5-a3cd5bfec5eb","resolution":{"observed_at":"2026-05-21T07:39:48.879572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.20867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:07:22.080867Z","title":"Incentivizing consistent, effective and scalable reasoning capability in audio llms via reasoning process rewards","venue":null,"work_id":"b4484a14-7325-4866-b4f5-1e2969505a52","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:a45a9e02f6b9df28de800743509faaf62db9f2a59e36c52c1c413b3e0117447f","observation_id":"693ea396-46a3-4d07-986b-0fc30851d3b8","resolution":{"observed_at":"2026-05-21T07:39:48.780542Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo- rl: Emotion-rule-based reinforcement learning enhanced audio- language model for generalized speech emotion recognition","venue":null,"work_id":"5e69c285-a1dd-48a8-bc4f-f9bf3dd484b5","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:cd34346f055a742c813bf15741919d3fbebb31da9de85bc891722a23a412b2c7","observation_id":"dea77beb-84cc-4e0a-b12b-ee11ac5e4ff2","resolution":{"observed_at":"2026-05-21T07:39:48.834849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.08039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T00:04:22.382702Z","title":"Audio-thinker: Guiding audio language model when and how to think via reinforcement learning","venue":null,"work_id":"cf80154c-35ad-4790-8ebd-2a8878db0ee6","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:de61c935ea25b7859a894da628597c81e3cb6e032e4273fe0c06c8868340513f","observation_id":"8c77be89-b810-42a5-81ff-0036fd64df1d","resolution":{"observed_at":"2026-05-21T07:39:48.640261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soundmind: Rl-incentivized logic rea- soning for audio-language models","venue":null,"work_id":"61664c2d-6958-4571-acb5-64508917e99a","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:fa1bc3cc482466dbf175222299cb2857efab7f30df9de479643622a5c59693f8","observation_id":"fe4f1a89-8be1-4536-802b-8a6fd2f884ca","resolution":{"observed_at":"2026-05-21T07:39:49.815137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think smart, not hard: Difficulty adaptive reasoning for large audio language models","venue":null,"work_id":"74acc673-540c-4c24-b939-74e184006a34","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:ae91ff1f8614cd8c2e08415a228bcc2a8f76c405159f6c7780d3b41c230221a1","observation_id":"08dd4019-555d-41ef-a045-f69dd010ffec","resolution":{"observed_at":"2026-05-21T07:39:48.637079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.03873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoding ambiguous emotions with test-time scaling in audio-language models","venue":null,"work_id":"42e4a8e4-4389-4525-b4dd-4e342e22b973","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:3ec5a9225977693c723a5fe5c9fc887d2601568de23fa9d3ce3daee62c72ea25","observation_id":"bdbaac45-b97f-4d07-8191-80a589687c39","resolution":{"observed_at":"2026-05-21T07:39:48.630868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02995","doi":"10.48550/arxiv.2510.02995","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Au- diotoolagent: An agentic framework for audio-language mod- els","venue":"arXiv (Cornell University)","work_id":"e46ac902-9b95-4f03-945e-f84f6394862b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:04d0e3925460cf9b257b8a54cc8fe3ada55a85f62c2fdbca88480813d26366fe","observation_id":"5f2a0e8b-49ba-4742-a0bf-0583f24dfd86","resolution":{"observed_at":"2026-05-21T07:39:48.938902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05933","last_updated":"2026-07-13T01:06:41Z","snapshot_observed_at":"2026-08-13T16:16:56.329184Z","submitted_at":"2025-12-05T18:19:36Z","title":"Speech World Model: Causal State-Action Planning with Explicit Reasoning for Speech","version":2},"cited_work":{"arxiv_id":"2512.05933","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.05933","snapshot_observed_at":"2026-07-14T02:20:20.750907Z","title":"Speech world model: Causal state-action planning with explicit reasoning for speech","venue":null,"work_id":"dc9bb4b1-b7bf-4f04-8924-5bdd2c5ac092","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2512.05933","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:d54dd6416850a0066f70ece9d9bb48a475e812a6167b845632fcf4702e345703","observation_id":"12502bd8-2070-4215-a6c0-8382fcec15f9","resolution":{"observed_at":"2026-07-14T02:20:20.750907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.04564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:47:19.985054Z","title":"When tone and words disagree: Towards robust speech emotion recognition un- der acoustic-semantic conflict","venue":null,"work_id":"5dad5eaa-cd03-4ae5-abe2-4e3e383874eb","year":2026},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:3d778a024f203b27faf0f1e52141557b6fd1a8eba10f04a6889a471bf48ec027","observation_id":"b66ee77e-b10c-42d0-aea1-7a422be4908d","resolution":{"observed_at":"2026-05-21T07:39:48.831950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-09T21:30:12.152751Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":"2503.04721","doi":"10.48550/arxiv.2503.04721","metadata_source":"pith","pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In2024 IEEE Spo- ken Language Technology Workshop (SLT), pages 1115–1122","venue":"cs.CL","work_id":"8553d8cf-0da9-40b7-a402-7c170c79df4b","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:e2ab5ab44e2e5759dc0fc13e6a39db2b1ecc55d0e23c8242210cd9b601a3d45a","observation_id":"b9fd82de-09c3-44a5-b2e9-acfc33543015","resolution":{"observed_at":"2026-05-21T07:39:48.826169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:51.434968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative spoken dialogue language modeling","venue":null,"work_id":"0146959d-0dd6-4439-be3d-b7c82ab3df81","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b57533e2b78a806ce8b4127f422dbbebcc7e72c3e0f658a9b873a9bf1dc4da53","observation_id":"bd69a664-fcfa-40cb-b51b-6f042b620544","resolution":{"observed_at":"2026-05-21T07:39:49.805530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T02:53:19.224262Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":"95fdcccb-e76f-4e91-a431-8b3baaddb25b","year":2023},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:f805c0589419839379f580f5e3b33950a9512ee144452561767f386acaf79e96","observation_id":"9c8dfef1-2b9b-477b-96f5-49dd2f8fc4f9","resolution":{"observed_at":"2026-05-21T07:39:49.803819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3cfc6bf1-23be-44ab-8433-5388da21ee71","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:5e785f28c26de2eb78470f5c1b912e0a395aba551bc742c6bbda785c5c2ad93e","observation_id":"cb5bceb9-4a50-4a71-8364-691e61c04010","resolution":{"observed_at":"2026-05-21T07:39:49.807192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoken question answering and speech con- tinuation using spectrogram-powered llm","venue":null,"work_id":"0e46297c-84ee-411c-b30d-9ed12d029098","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:94901330abf11806c475f132fd4d038139def4bfb369b94894cd802a4faf152d","observation_id":"b0af11f8-4b65-497a-9583-98c984c857b7","resolution":{"observed_at":"2026-05-21T07:39:49.809145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":74,"verified_fuzzy":23},"total_outbound_references":212},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 212 outbound references and 3 inbound Pith citation observations for arXiv:2605.20266."}