{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:275d79e5c40b2520071bdde9b2aa995ed2804e105a3b82e10f9bff549718ad21","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:50:44.994154Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-07T11:50:44.994154Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01319","last_updated":"2025-06-02T05:02:03Z","snapshot_observed_at":"2026-08-07T11:42:07.958110Z","submitted_at":"2025-06-02T05:02:03Z","title":"Learning Sparsity for Effective and Efficient Music Performance Question Answering","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:50:44.994154Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2506.01319"},"observation_digest":"sha256:0bd204698f5d35cd891d210e82e66899c579494280ff61d4cba2c71a4773a836","observation_id":"a9181726-0b0f-4d86-974f-52685268cfe8","resolution":{"observed_at":"2026-08-07T11:50:44.994154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T17:56:54.908507Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-07T04:50:21.719268Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:54.908507Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:39e1180293a19e78d5ed3ec1e8804d401199137a53f99854c3d1b2efdaa2702b","observation_id":"67c45737-4490-4377-ae36-7247300acb00","resolution":{"observed_at":"2026-08-05T17:56:54.908507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-03T21:06:11.400124Z","title":"Audio-language models for audio-centric tasks: A survey.arXiv preprint arXiv:2501.15177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16757","last_updated":"2026-06-29T23:59:45Z","snapshot_observed_at":"2026-08-07T10:03:17.767830Z","submitted_at":"2025-11-20T19:17:35Z","title":"Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:11.400124Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2511.16757"},"observation_digest":"sha256:13a131d959d637c7b741f377ffbbb8fc9ebfc9400cf3100c3b22e0dba964a065","observation_id":"0168ded6-1ca9-410c-b702-a6f097fbf190","resolution":{"observed_at":"2026-08-03T21:06:11.400124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2604.16659","last_updated":"2026-04-17T19:28:07Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T19:28:07Z","title":"Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T08:01:25.938248Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2604.16659"},"observation_digest":"sha256:22f568e44dace0bfcba1057d482fdad85bf6b102216e9fed3aef42cea72d22a6","observation_id":"a339adb2-3b79-47a0-9a57-8a21cead81a6","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T12:25:52.847432Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:d10731dd4799efd6df878bdf115bd868e3a70bd513f8675dccf2312cc01cc7df","observation_id":"6793b64c-7fdc-4fb7-9310-ae5fceb14b6f","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.06582","last_updated":"2026-06-21T09:09:33Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:11:22Z","title":"PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T23:14:32.494076Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.06582"},"observation_digest":"sha256:97d8ece2d4dc38411203522ed9bd007291525854129a94fa6a73c4c3b98e308c","observation_id":"5d178954-211e-4767-8bc1-1a2ab5a9ebb2","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:2ec03a5ef2bae147dd35a53b26582ad2fe23e0ddddc39bfd14c63ecf52365534","observation_id":"9f4bed0e-2a05-402c-a285-dfbabd16d2bc","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.21008","last_updated":"2026-05-20T10:44:56Z","snapshot_observed_at":"2026-07-06T23:31:32.577242Z","submitted_at":"2026-05-20T10:44:56Z","title":"A Survey of Audio Reasoning in Multimodal Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T02:08:06.976461Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.21008"},"observation_digest":"sha256:94bdfa407feeb7b735dc3e9579021caa9dc9e048ed2a78823788973f55c91fb8","observation_id":"6a65ae05-1e3c-4198-9414-f910e7395f4e","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2605.27190","last_updated":"2026-05-26T15:43:11Z","snapshot_observed_at":"2026-08-06T18:21:13.610239Z","submitted_at":"2026-05-26T15:43:11Z","title":"Learning When to Think While Listening in Large Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:37:34.409802Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2605.27190"},"observation_digest":"sha256:2a2dc77be867f25cf20d370338acfc0b669f5dd008de903582488e068311a728","observation_id":"629c2bc5-ea64-466a-8b8a-032465a7be1f","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.07309","last_updated":"2026-06-05T14:26:06Z","snapshot_observed_at":"2026-08-06T17:25:22.857584Z","submitted_at":"2026-06-05T14:26:06Z","title":"Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T20:56:59.118526Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.07309"},"observation_digest":"sha256:ab55761e4bca0852e99ee08521bfb21ede0cd8cebfeaea8e176657ad4aa43dd5","observation_id":"457c8e9c-249a-4a9d-9213-9a558c55a0d6","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.08194","last_updated":"2026-06-06T14:24:05Z","snapshot_observed_at":"2026-08-02T20:27:06.280658Z","submitted_at":"2026-06-06T14:24:05Z","title":"GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-27T19:51:59.265579Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.08194"},"observation_digest":"sha256:52645f02b946a5d194d130bc65e1bd0c85326bae506968dc887b6bc49fffaaef","observation_id":"6d6eed2a-f84a-4875-9a06-c93df3cc29ef","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:b0a638698df2b4496bea8fb8ced524b78cc529934398d356187bd4a167a281b3","observation_id":"bca6fe96-5ef7-486b-a6d4-e155b5dd30a4","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.15088","last_updated":"2026-06-17T09:45:24Z","snapshot_observed_at":"2026-08-06T07:00:03.779955Z","submitted_at":"2026-06-13T03:42:08Z","title":"When the Same Musical Knowledge Forgets Differently: A Clean Probe of Pathway-Dependent Forgetting","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T04:50:48.712481Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.15088"},"observation_digest":"sha256:491ea662e43534ca533305f19a7fc4a3d0281f21740e56c3545a2a45888cd04f","observation_id":"250fabc9-f870-4cf2-8d21-bcc649aa5c8f","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.17404","last_updated":"2026-06-16T01:38:38Z","snapshot_observed_at":"2026-07-06T23:53:02.028020Z","submitted_at":"2026-06-16T01:38:38Z","title":"ELSA: Acoustic Event-Level Semantic Alignment for Fine-Grained Reference-Free Text-to-Audio Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:37.444210Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.17404"},"observation_digest":"sha256:256be08dfa922076c27513856ff980fb99b1b7c6adcf2fdac612b93f58f5cea7","observation_id":"2b42ec49-bb0c-4847-86ec-5eb5e652407a","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.21147","last_updated":"2026-06-19T06:37:32Z","snapshot_observed_at":"2026-07-06T23:56:12.374739Z","submitted_at":"2026-06-19T06:37:32Z","title":"AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T13:22:12.541923Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.21147"},"observation_digest":"sha256:f8800b1067d5ae38df8c82fac8f6e903cfdb9e7b84274e5b9d5911b954e0f76e","observation_id":"2b321af5-938c-4c76-be6f-ee2c3b5c379b","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"cited_work":{"arxiv_id":"2501.15177","doi":"10.48550/arxiv.2501.15177","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.15177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-language models for audio-centric tasks: A survey","venue":"ArXiv.org","work_id":"73cbc6ec-7ab0-480c-af3b-c3c825a95ea7","year":2025},"citing_paper":{"arxiv_id":"2606.22868","last_updated":"2026-06-22T05:24:35Z","snapshot_observed_at":"2026-07-06T23:57:42.632111Z","submitted_at":"2026-06-22T05:24:35Z","title":"MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T07:36:34.307652Z"},"links":{"cited_paper":"/paper/2501.15177","citing_paper":"/paper/2606.22868"},"observation_digest":"sha256:08ad21f76119312b7c0200e9a7c8e2602a9ebb8fb7ff4d21b643f8cd0f83f7ca","observation_id":"09ee30bd-04f3-4e16-827e-6e2bcd8dd040","resolution":{"observed_at":"2026-07-07T03:17:07.899293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15177/citation-record","integrity":"/paper/2501.15177/integrity","json":"/paper/2501.15177/citation-record.json","paper":"/paper/2501.15177"},"outbound":[],"paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T03:06:09.354504Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2501.15177."}