Pith. sign in

Paper Citation Record · LEDGER

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

As of 15 August 2026, this Paper Citation Record lists 100 of 168 outbound references and 16 inbound Pith citation observations for arXiv:2501.15177.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15177 v3

Coverage vector

measured 100 of 168 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:36:19.603067Z

measured 116 of 116 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 16 of 16 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:50:44.994154Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 168 outbound references displayed

  • verified exact2
  • verified fuzzy0
  • unresolved98
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation 12b7cf0a-724e-4c01-8d39-5bf644a579bd · outbound

This paper cites Pengi: An Audio Language Model for Audio Tasks,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Pengi: An Audio Language Model for Audio Tasks,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.089329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.089329Z digest=sha256:4a5e8bc6c9ff41b6dc7eabca18d59545c70277f925909a1ceba2fed31d33e9be

Observation b524c830-54c3-40a3-827d-038fd56e5599 · outbound

This paper cites CLAP Learn- ing Audio Concepts from Natural Language Supervision,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey CLAP Learn- ing Audio Concepts from Natural Language Supervision,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.095761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.095761Z digest=sha256:54a5e64bf98e7fbff2a5aa097b0aaff6ef15a5c1bc803e0b4e6c711e120e4a7d

Observation 666fa1d9-21c6-420e-b5dd-d18ed62c0a76 · outbound

This paper cites Bridging language gaps in audio-text retrieval,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Bridging language gaps in audio-text retrieval,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.101206Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.101206Z digest=sha256:dca064013bcb3f89ab5073b703818a08165e1ee113afa830e06a85d84b19722a

Observation 9a083652-315d-41aa-adee-c55addd7e074 · outbound

This paper cites Audioldm: text-to-audio generation with latent diffusion models,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audioldm: text-to-audio generation with latent diffusion models,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.107294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.107294Z digest=sha256:d6e33ef5811ef90f0000c579aa5b48333df55920a975f2e6a5105a79e66bc565

Observation 6452b7c5-7446-4034-8e18-5dfaca868a5f · outbound

This paper cites EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey EnCLAP: Combining Neural Audio Codec and Audio-Text Joint Embedding for Automated Audio Captioning,

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.112949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.112949Z digest=sha256:9ae9d7e9a9856c99226ad25d624ca478e9e2f5677a073b1e1be1eff0fab8f958

Observation 38faad7a-526e-45fd-ad24-e100c5311819 · outbound

This paper cites Separate what you describe: Language-queried audio source separation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Separate what you describe: Language-queried audio source separation,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.118367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.118367Z digest=sha256:b061787e212d80efb3ed1391986a815b844e7620314d3019471f957df9338ae0

Observation 6b35920c-04cd-48fa-8849-0aa5d7244e9a · outbound

This paper cites AudioPaLM: A Large Language Model That Can Speak and Listen.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey AudioPaLM: A Large Language Model That Can Speak and Listen

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.124376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.124376Z digest=sha256:9b19a8f5c0dac7effa505ff60f5c2b9036b948e03200235dc56cf098b474954a

Observation 30671dc0-f696-4464-b101-c7bda7e0e60b · outbound

This paper cites Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Speechgpt: Empowering large language models with intrinsic cross- modal conversational abilities,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.130651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.130651Z digest=sha256:adc587eba4b7eea9366869bb2c75c89c12b6fdd8e053ffa0e2ba1b0fe7edaf54

Observation de8e074c-1f63-45ae-bdc7-79a6890c39c2 · outbound

This paper cites Audio Dataset,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audio Dataset,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.135882Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.135882Z digest=sha256:60b13399cda2a24184efc4650d5fb9d6d299277f0295c23bfd04a42f3bc44df6

Observation f68d9703-36cb-40df-ad40-0095180aadfa · outbound

This paper cites Audio caption: Listen and tell,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audio caption: Listen and tell,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.141272Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.141272Z digest=sha256:2661f37d69baf20a16a256097131c980e954873cd9af1392e529f6b0f3ea1a1e

Observation 22dd4c4a-e67b-4063-912c-c09c2820cbe7 · outbound

This paper cites A Survey of Large Language Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey A Survey of Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.146212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.146212Z digest=sha256:3bebe87ee2b19a6fae4629245c31fad3e37efdecbe22c937163679b015c07369

Observation 388ed2cb-d343-40c8-9560-cfcf09fa9a56 · outbound

This paper cites Recent advances in speech language models: A survey,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Recent advances in speech language models: A survey,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.151832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.151832Z digest=sha256:7f44136289eb200b9d2efc1923b5e580be6c6bf2304d80b6618dbda7f4fc3633

Observation a5207cc1-6394-4a24-acb1-e3f238b866c6 · outbound

This paper cites WavChat: A Survey of Spoken Dialogue Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey WavChat: A Survey of Spoken Dialogue Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.156715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.156715Z digest=sha256:469bd692e24eaa5a29619320ca82787927f000bbe307626fd85f7c0ff6a618ca

Observation fdfca223-bb90-4a11-a52f-1d01963f68d1 · outbound

This paper cites Audio retrieval with natural language queries: A benchmark study,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audio retrieval with natural language queries: A benchmark study,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.167424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.167424Z digest=sha256:08ecb096f385bf028468f94c3dc2ea1d8c382fc8f4be298d8389c59eda60650f

Observation 909caf73-5985-4ea7-aae3-1927fd21afd7 · outbound

This paper cites Beyond the Status Quo: A Con- temporary Survey of Advances and Challenges in Audio Captioning,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Beyond the Status Quo: A Con- temporary Survey of Advances and Challenges in Audio Captioning,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.172192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.172192Z digest=sha256:3b5db181188d94a5d64e0a98b9b3c2f33d11174581ed1a98bbc09ea46037f6c0

Observation 72b3fb2f-b8f9-41c8-bf11-0d499b3b2db8 · outbound

This paper cites Recent Advances in Direct Speech-to-text Translation.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Recent Advances in Direct Speech-to-text Translation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.177020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.177020Z digest=sha256:17bf24ccab90ce2408bb1767c3b22a64e356f51eb5d0be77b830e153a8c7fc08

Observation c12161ed-ee77-4d57-8fa2-de2e17ddc279 · outbound

This paper cites Audio-Language Datasets of Scenes and Events: A Survey.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audio-Language Datasets of Scenes and Events: A Survey

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.182620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.182620Z digest=sha256:eedc84e3d58d2c734f111320965e9058bdbae71d2f837cfafe67c5eae2bc0a79

Observation 865c371f-ee60-450d-b19a-33590dfb8747 · outbound

This paper cites AudioCaps: Generating Cap- tions for Audios in The Wild,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey AudioCaps: Generating Cap- tions for Audios in The Wild,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.188040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.188040Z digest=sha256:a3ccc68c21035dd2c27125b30905fc0182819d4c78258fb351b1cce13dd8d406

Observation 272fa887-9511-4073-87a6-21af1a5f006d · outbound

This paper cites Clotho: an Audio Captioning Dataset,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Clotho: an Audio Captioning Dataset,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.192909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.192909Z digest=sha256:58287ac2306da47aea171fa520aacec2606b62b165410a2a885d5ff0e617b037

Observation bcc22394-cf69-4339-8753-1ddf6522f958 · outbound

This paper cites Clotho-aqa: A crowdsourced dataset for audio question answering,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Clotho-aqa: A crowdsourced dataset for audio question answering,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.198058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.198058Z digest=sha256:5e4ee53818f3a70167202c158d87f99aa4441bb6efcc9df4769814c23673d4c3

Observation 7669c81f-aaea-4b18-8b5e-9872b341ad8b · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.204094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.204094Z digest=sha256:fa621d80a5b0c4b22dcc3b546b0ebb8c661b02a1dc6d33da21e1dad16e6f4783

Observation cdf349f5-12d0-4697-9651-57b26868c376 · outbound

This paper cites Beats: audio pre-training with acoustic tokenizers,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Beats: audio pre-training with acoustic tokenizers,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.209178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.209178Z digest=sha256:f4498f7078759ad5d1e98cc39e7bf6d0707fc8c9fb1ae61fa9a6ba79c39f8df4

Observation bb5bdd9c-c85b-44b5-9c17-643280d377b0 · outbound

This paper cites Listen, think, and understand,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Listen, think, and understand,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.213990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.213990Z digest=sha256:905c4ddc936d367c6a95c06adab0b915fae0b549e990aee2766af2fbbbc8083d

Observation 617bebe3-aa22-4e97-be69-52a77f10cc99 · outbound

This paper cites Automated data augmentation for audio classification,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Automated data augmentation for audio classification,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.218648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.218648Z digest=sha256:9a0322d5919c40e6cfaf9553d672d54efe0c5fcc5278b57058838a7876a5b6d6

Observation 501235d7-29b7-4738-b5d6-53e4e6723a46 · outbound

This paper cites Compa: Addressing the gap in compositional reasoning in audio- language models,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Compa: Addressing the gap in compositional reasoning in audio- language models,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.223199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.223199Z digest=sha256:8cbbdfb8f8ceb99aa7856b31d9718dbc3a54f956bb6730973570dcd098efe5ae

Observation 6f8ff340-5ee6-4ed8-9486-b1b70ef402f1 · outbound

This paper cites Finetuned language models are zero-shot learners,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Finetuned language models are zero-shot learners,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.228172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.228172Z digest=sha256:63ae4dcb72931c379090c450e3d42a47d3c089af60fd2817b7bdf48f96752f44

Observation a3f3efb4-5131-4b49-8fdf-e5fe6f7be77c · outbound

This paper cites CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey CTAL: Pre-training Cross-modal Transformer for Audio-and-Language Representations

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.232892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.232892Z digest=sha256:a30b54cd56e5734346f632f42c80c6b4ecd835a186bc2ac4eff739a5deeb638d

Observation 7573674a-1a43-400a-adce-1d9c637b4657 · outbound

This paper cites SimVLM: Simple Visual Language Model Pretraining with Weak Supervision.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey SimVLM: Simple Visual Language Model Pretraining with Weak Supervision

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.238053Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.238053Z digest=sha256:de152974f66eafbc6bc91a49874d75a01fe8374f4eb111bae67ab2878bec3b18

Observation 2ea22914-42a0-42f2-aee2-95f6a75f5005 · outbound

This paper cites Multimodal contrastive learning with limoe: the language-image mix- ture of experts,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Multimodal contrastive learning with limoe: the language-image mix- ture of experts,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.243000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.243000Z digest=sha256:b99c23d4d07cce89e2e894f5f41be9eb75700c0edd1674478ee26b606b1fbd8e

Observation 5184169b-4978-4c4d-b578-96338c72d7f1 · outbound

This paper cites Unifying vision- language representation space with single-tower transformer,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Unifying vision- language representation space with single-tower transformer,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.247956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.247956Z digest=sha256:d08fb3bed6b0866348ddd673371847e2408c44fa42b1e72f83fa0db335a52889

Observation d48753c6-8634-4af9-9e5c-81ec798f5a0e · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.253495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.253495Z digest=sha256:bc0ec0c42333eeb8de05d39e1f485c872f1b11e81a82ecc9bf7685bf02c93c50

Observation b7380048-7629-4ea8-b5bf-68ab5d21c936 · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.258601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.258601Z digest=sha256:03ee14ab33872e562a8c81a9066df1e3e51cb28083a5cad6014a08de13fb675e

Observation 040a6ff7-9330-459f-b740-7260e9ead14e · outbound

This paper cites Mint: Boosting audio-language model via multi-target pre-training and instruction tuning,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Mint: Boosting audio-language model via multi-target pre-training and instruction tuning,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.263734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.263734Z digest=sha256:ad8bbb78092c04345448744b85ed4f45f4fb00f45711af4c6ddb9726ca53023a

Observation 33a9f8c5-90a4-4232-a731-8e67e4b5bb0c · outbound

This paper cites CALM: Contrastive Aligned Audio-Language Multirate and Multimodal Representations.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey CALM: Contrastive Aligned Audio-Language Multirate and Multimodal Representations

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-10T14:36:20.888574Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-10T14:36:19.268871Z digest=sha256:2e730afe8ef417d87299dc810929bdaf829e0afa6f0bc7d6bd7892ed6e72738d

Observation 98870a65-85c1-4129-aa9b-7fd0613d8de3 · outbound

This paper cites A survey on llm- based multi-agent systems: workflow, infrastructure, and challenges,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey A survey on llm- based multi-agent systems: workflow, infrastructure, and challenges,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.273770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.273770Z digest=sha256:d311124290d17a9c4eb59fb6e8e05321be8d8bd24462df364547083b561a485b

Observation 7cba960e-0e83-4e47-9272-c42de57830cf · outbound

This paper cites Representation Learning with Contrastive Predictive Coding.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Representation Learning with Contrastive Predictive Coding

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.278548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.278548Z digest=sha256:ebcf3e0d87c29f83ec1690d9e56b98823176fb4d883ce9916c65e74145f4424f

Observation abace351-ec70-4724-ae05-06aeafb05997 · outbound

This paper cites Masked autoencoders that listen,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Masked autoencoders that listen,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.283505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.283505Z digest=sha256:efc38390baffe17c7c1124cea78467420cf1c5d31584492c35caae3cb2a0a630

Observation 2896c677-f2a7-441c-bcf8-1bdc4d7d9862 · outbound

This paper cites Palm: Scaling language modeling with pathways,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Palm: Scaling language modeling with pathways,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.289321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.289321Z digest=sha256:6f245ac70537a95bca87396628047063df0ce309dde205e044107f282f83f508

Observation cad1d089-3e04-408f-a422-119f17b10928 · outbound

This paper cites WavCaps: A ChatGPT-Assisted Weakly- Labelled Audio Captioning Dataset for Audio-Language Multimodal Research,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey WavCaps: A ChatGPT-Assisted Weakly- Labelled Audio Captioning Dataset for Audio-Language Multimodal Research,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.294371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.294371Z digest=sha256:a7f5945c66964486ac5d8ae904198ae661d21672185d57e28a4e46ed19d7ad90

Observation 2a6d20bb-6d94-4f44-92c5-ce5f52e95f16 · outbound

This paper cites Automatic tagging using deep convolutional neural networks.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Automatic tagging using deep convolutional neural networks

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.299621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.299621Z digest=sha256:ed0a12626536950a08cf57c5562e7c694d27406ff73ec3ff474736b881c05205

Observation 970b31af-b834-4338-9cf9-a0ac4d70b7de · outbound

This paper cites Cnn architectures for large-scale audio classification,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Cnn architectures for large-scale audio classification,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.305402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.305402Z digest=sha256:efb3ff230cc17718f6e0432530e81be92c521fd07b4786dc074fcc36d2c8e60e

Observation 1397e390-83d7-425a-ab1f-128ca3480ded · outbound

This paper cites Panns: Large-scale pretrained audio neural networks for audio pattern recognition,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Panns: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.310312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.310312Z digest=sha256:206d27e4c65eedc287024ed19dd419ae924eb45e795c416c16f555de4b567dce

Observation 49c473b8-02d0-4bd0-a49d-eca87b0c000c · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representations,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey wav2vec 2.0: A framework for self-supervised learning of speech representations,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.315250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.315250Z digest=sha256:2d7663ab5baba6afb3223d2f9722178c6fcaee8378dfbd6612b39a737ffe127e

Observation 92efebeb-f5a6-4db8-9b90-db6aa4311d4b · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Hubert: Self-supervised speech representation learning by masked prediction of hidden units,

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.320396Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.320396Z digest=sha256:47392c6dc11b59cf5eed57db62e947ed7023db198277b4fe9c9a118a6910c691

Observation 79dbc15c-ebac-49f2-b5aa-66368b9a1ea8 · outbound

This paper cites Shortcut learning in deep neural networks,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Shortcut learning in deep neural networks,

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.325465Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.325465Z digest=sha256:2ef1c4aa01ab405ec283c60897195143cce88e50c164761b5171f1b75615d0bc

Observation 6df1d3ff-f31c-43f1-9a2e-31c6d7607c78 · outbound

This paper cites Robust speech recognition via large-scale weak supervi- sion,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Robust speech recognition via large-scale weak supervi- sion,

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.330596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.330596Z digest=sha256:7ce027e4b0ff00b28bb206f87b65f3d7d9dcd37488f72bdd8fcb0569f8fbb0da

Observation 62b7ac7c-80b5-4c0a-ad74-bda9894d9955 · outbound

This paper cites AST: Audio Spectrogram Transformer.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey AST: Audio Spectrogram Transformer

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.335734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.335734Z digest=sha256:711cd9f69b57d391e08fbc54152f02ad2c157df4dea8720a1311077b14bf629a

Observation 7ac7ea6b-dbf1-4da9-9afb-1811b95ccf11 · outbound

This paper cites An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.340982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.340982Z digest=sha256:cbbb25b9e3eb47ba52fd8da9e54d5ab54cb43d9d13edd457aff5d309e9fb5e44

Observation 4bd65bdd-f3fc-461e-9d40-c69a1bfcacd5 · outbound

This paper cites Natural language supervision for general-purpose audio representations,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Natural language supervision for general-purpose audio representations,

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.345560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.345560Z digest=sha256:ab71e1e8da8b13a64f7aa66ddbce561759a35403504f97041982715e0ff17e20

Observation 187e7e93-3dae-424a-a998-97168e30c4bf · outbound

This paper cites Masked autoencoders are scalable vision learners,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Masked autoencoders are scalable vision learners,

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.350228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.350228Z digest=sha256:39f731e6d30b5a7a5e744c5205030fb521cdcb2e7a0a231d3c227beb0c756ac7

Observation eea972aa-1ba7-4598-a556-a9c68713d9fd · outbound

This paper cites Towards audio language modeling -- an overview.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Towards audio language modeling -- an overview

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.354936Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.354936Z digest=sha256:17f635d53f3439e67509f3554116e2f0054d4fad933068eebf9a6b46244e21a1

Observation 47566490-aea1-49e4-b5be-c86ec1c6ac23 · outbound

This paper cites Soundstream: An end-to-end neural audio codec,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Soundstream: An end-to-end neural audio codec,

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.359717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.359717Z digest=sha256:ad7074d6875a4662288ca1d576e2dbddabcd4976f83ce60d024988bbc5da7074

Observation 03918a5a-9086-48fb-97a0-1f67737b79cf · outbound

This paper cites Seanet: A multi- modal speech enhancement network,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Seanet: A multi- modal speech enhancement network,

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.364478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.364478Z digest=sha256:b1dab438e16c2a81fb36435d25065d24afdee8d7e5946712e379e5e2830f864d

Observation 3bb47107-a10d-48bf-acac-d05b1466d082 · outbound

This paper cites High fidelity neural audio compression,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey High fidelity neural audio compression,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.369789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.369789Z digest=sha256:619c9e729e17ee8cf632371da7e18d59f9f00fc53a0e6ec2bbf137eddbd5b726

Observation 330c9ed0-1917-4338-a7f0-fd49768d9df1 · outbound

This paper cites Improving language understanding by generative pre- training,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Improving language understanding by generative pre- training,

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.374459Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.374459Z digest=sha256:46ebba53cc9e85308fb39a7eeb6898accae24e9b765229d8bdfa2423d6046b58

Observation 8323bd2c-b489-48ba-ad17-f49e69bba502 · outbound

This paper cites Language models are unsupervised multitask learners,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Language models are unsupervised multitask learners,

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.379082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.379082Z digest=sha256:95d7a3cd456f74250316672df1c344c9b855b082e2fb29c8cfc570fa4fa5b224

Observation 74c341f4-e9ed-427a-82c3-f04b8804ed39 · outbound

This paper cites Language models are few-shot learners,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Language models are few-shot learners,

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.383557Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.383557Z digest=sha256:d9b518708a56853c772f0aaa2e69a11616d27d68e67692ff995322da12ce7e58

Observation 82daa610-5e93-4b78-ad2e-25de64fc7f0d · outbound

This paper cites GPT-4 Technical Report.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey GPT-4 Technical Report

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.388106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.388106Z digest=sha256:53749e1febd8da77a43d77238016facc6c60937beb6e0dcf09bed0f268556657

Observation 36780942-25f6-4e18-80b0-1068d38eb8bc · outbound

This paper cites Training language models to follow instructions with human feedback,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Training language models to follow instructions with human feedback,

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.392798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.392798Z digest=sha256:5f01df6d15dfe45fc46894c8d51e1b8498b19b199dea0ac88ab20ebff2ae7544

Observation fcbb9986-bba0-4f20-86ad-db16fd443e57 · outbound

This paper cites Introducing chatgpt,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Introducing chatgpt,

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.397809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.397809Z digest=sha256:e0268d69a89962526b67c2e768f12757681862039c002006a43dfee88648e645

Observation 6aeffd84-c60b-4393-9b31-2d9e83f883c4 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey LLaMA: Open and Efficient Foundation Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.403108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.403108Z digest=sha256:6984664f6a960d3216097a50473857bb619e55b9599876b90cc068f1b3f0ca38

Observation 299797a9-998c-4840-a08a-2f2a92b311cf · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.408394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.408394Z digest=sha256:a481b19f4ef2559aa5dc0be88617c6bcf754868188ce928c34496fa17b8db152

Observation 99251b4c-530f-454e-867b-430fad32b952 · outbound

This paper cites Alpaca: A strong, replicable instruction- following model,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Alpaca: A strong, replicable instruction- following model,

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.413119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.413119Z digest=sha256:75439c75b531b705b73867ff65b62ff0374d6e79093f2e75cb0d043c2c3be765

Observation e3d80bc2-d6c9-4f72-9113-1d130bf95c5b · outbound

This paper cites Vicuna: An open- source chatbot impressing gpt-4 with 90%* chatgpt quality,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Vicuna: An open- source chatbot impressing gpt-4 with 90%* chatgpt quality,

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.417709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.417709Z digest=sha256:ee65f1903704832fe30d371d3a998ee1092057b3ecc2af76347d32e7be1da9ef

Observation 4b9f0ec1-ae64-443b-9233-611d280a9d11 · outbound

This paper cites Qwen Technical Report.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Qwen Technical Report

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.422393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.422393Z digest=sha256:b7a1abe63ba45204ef6612f0b5edc17c79eb7f9c31404a9ab483865c578d3756

Observation f29d03a1-47aa-47f9-9491-4f614bb0c2d6 · outbound

This paper cites Qwen2 Technical Report.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Qwen2 Technical Report

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.426971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.426971Z digest=sha256:2d37b5aad2849f68998aeece8ff6088fd359852b1beba5fcc2388d22eeaa5d6b

Observation 69d31559-ec7b-4a40-b734-55bf9459816a · outbound

This paper cites Qwen2.5-Coder Technical Report.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Qwen2.5-Coder Technical Report

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.431680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.431680Z digest=sha256:2c57189269db2da32b857d504cf794391ce1e14def2d6d05d3f36069d0ea8542

Observation b414b4f5-5841-4e44-a16c-ab54138d0a32 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.436612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.436612Z digest=sha256:dd5692bafedfcc087f0b07ebaf9fd074a40fcf6a730aa37e5220b30a95ac3fb9

Observation 13f57039-dc2d-4b1c-a2d9-a10f4c0e30bc · outbound

This paper cites OPT: Open Pre-trained Transformer Language Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey OPT: Open Pre-trained Transformer Language Models

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.441489Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.441489Z digest=sha256:1ab9b0fc27fabc4b8c2235682d32d78acaa067aadeef7aae7d0fee75c1f4f959

Observation 740b64c8-9108-478f-8406-1f4f03f156c8 · outbound

This paper cites OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.446387Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.446387Z digest=sha256:cbf28fd3f08ba9b14ea96fd290aa829a7396423977a6de08fd21ed9938a56c07

Observation 89a93bc4-2756-4807-ae74-19e76f58de54 · outbound

This paper cites Large Language Models: A Survey.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Large Language Models: A Survey

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.451207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.451207Z digest=sha256:ee559ff02cd56fced8c8454635c6a81039f843a2a9457b857fe0c370539c89e3

Observation e68363f9-eaa8-461b-ae82-639d20d11720 · outbound

This paper cites Blat: Bootstrapping language-audio pre-training based on audioset tag-guided synthetic data,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Blat: Bootstrapping language-audio pre-training based on audioset tag-guided synthetic data,

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.456279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.456279Z digest=sha256:886185c5b7717b99e1fe20804d4018086620eff40499aed696d4a3021874a0bd

Observation 51b6a62d-17c9-4dcf-9318-ee19bc357c65 · outbound

This paper cites Audio-text models do not yet leverage natural language,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audio-text models do not yet leverage natural language,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.461326Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.461326Z digest=sha256:4cdaf3f705bf180fb5112723b697343d89e204f5ac62f60de59b8d9b84ceb84c

Observation 9ee11212-2e75-41ef-b2c8-09d2919a1c4c · outbound

This paper cites Advancing multi-grained align- ment for contrastive language-audio pre-training,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Advancing multi-grained align- ment for contrastive language-audio pre-training,

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.466371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.466371Z digest=sha256:716eef3c02bd8bbe0e37ab58324780876faf8caf8b25795887ccaf0b7d7b7ba5

Observation 21946010-80d4-4e66-87ac-4a68cbbb744c · outbound

This paper cites Contrastive audio- language learning for music,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Contrastive audio- language learning for music,

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.471333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.471333Z digest=sha256:4147c90dd17a49b1ddb37d06e9e3407f42e86420213a6749b3da105593f8b66f

Observation 8c3e113f-e52e-45f6-8609-8e7b05ff030e · outbound

This paper cites Flap: Fast language-audio pre-training,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Flap: Fast language-audio pre-training,

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.476194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.476194Z digest=sha256:6f2d3954ebadb2cd325e3dd603cfed9aa3c38b66db384aaa64f6e96ca7c6bc29

Observation 2d2687ad-813e-4b7c-87f8-1d8251663d1b · outbound

This paper cites M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation

Reference 78

Resolution
verified exact
local_arxiv, observed 2026-08-10T14:36:20.634183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-10T14:36:19.481174Z digest=sha256:c11ff628bfe17ec119d588fa00fffea0fabe836b35238b7005d4974c3c2206a0

Observation 2a3d6981-0b78-432b-80bf-01e144a37c99 · outbound

This paper cites Cacophony: An Improved Contrastive Audio-Text Model.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Cacophony: An Improved Contrastive Audio-Text Model

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.486690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.486690Z digest=sha256:4a144afe6274eb8fa68ef688b4371870e71b15eae635462285b14b04b98adc25

Observation 43d1b034-1e2a-47cd-8c08-7cba1fa32087 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Learning transferable visual models from natural language supervision,

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.491532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.491532Z digest=sha256:1283e48f7806a46b96d586600ce45f6a4bf8ba33b269684d6a212eec5f135ff9

Observation 4edf8561-fc46-4df4-a5af-0f20fa2d5d75 · outbound

This paper cites Masked modeling duo: Learning representations by encouraging both networks to model the input,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Masked modeling duo: Learning representations by encouraging both networks to model the input,

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.496502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.496502Z digest=sha256:4d908ded9f61e493b47e010c5765930b6da8cf3ef8df691bfb79fcdb41e2cdb4

Observation abe95b06-abf1-49eb-aefc-0a0b884f8b1e · outbound

This paper cites Coca: Contrastive captioners are image-text foundation mod- els,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Coca: Contrastive captioners are image-text foundation mod- els,

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.501366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.501366Z digest=sha256:7a19947db32608c686719509f49bd0161001dd3d4b4d9fcebe442b6353fd38fe

Observation 09d412e7-936a-4dcd-b220-da495dc210e8 · outbound

This paper cites Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.506471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.506471Z digest=sha256:27d2ba02c9812ff3188146373e0774a79b32ae7cacb3bfe7146e11db278b4d83

Observation a540f9f8-f850-4a4d-aa07-8b4d219d5e4b · outbound

This paper cites Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.511219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.511219Z digest=sha256:479b59d91a8ea4c7b551fdfe397667a892b5d02850d27e0d7fd181c3435abab7

Observation 8c711961-8b0e-4533-a395-969bcc99c33e · outbound

This paper cites Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.516344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.516344Z digest=sha256:e1551365ad4893292390b465c47ebe7bd2a6e5514687ca05dcc3befb8c2d2f40

Observation ad64020b-cff5-4485-9922-e18c42653483 · outbound

This paper cites E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.521474Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.521474Z digest=sha256:2270881dd98389d2ef90f09ab389363d2e7b6de4400cf93c50e9967c13f05255

Observation eed5aba6-9d71-4d4c-99ba-af1d401b03b2 · outbound

This paper cites Seed-TTS: A Family of High-Quality Versatile Speech Generation Models.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Seed-TTS: A Family of High-Quality Versatile Speech Generation Models

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.527155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.527155Z digest=sha256:260fdd21e2bd59563926faad1c48f09cdd1f9b5186fcb61187b62777de50ce40

Observation 716b2f3e-1cb8-48b2-81ae-e1da5beb5dfd · outbound

This paper cites F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.533122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.533122Z digest=sha256:7068bc65ee92b2ba75667d435da2566ef982cad1b2acc65c549e1036f6672d55

Observation a9c825c1-24f3-412d-a28c-85cac637a18f · outbound

This paper cites Audiolm: A language modeling approach to audio generation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audiolm: A language modeling approach to audio generation,

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.538310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.538310Z digest=sha256:c7e176e6949fe6a8b2f971744a267fa101c7361c12b97b39e1d40eeff950d607

Observation 38d3ed5b-a6b8-42e5-b69e-895b69e92a5d · outbound

This paper cites MusicLM: Generating Music From Text.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey MusicLM: Generating Music From Text

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.543975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.543975Z digest=sha256:3e32a9bef175f24a68257604249165cf2b9e86267a0577ce423246acaa70598f

Observation 6fdffaf9-56c2-448c-9ddb-78391af87148 · outbound

This paper cites Mustango: Toward controllable text-to-music generation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Mustango: Toward controllable text-to-music generation,

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.548861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.548861Z digest=sha256:3057be613dc3050e29b53c881f04c29925018b5f6747081b22cd970a45092226

Observation 0c4a3b66-d69f-492d-b3ee-03fee6f069ec · outbound

This paper cites Audiogen: Textually guided audio generation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Audiogen: Textually guided audio generation,

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.553643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.553643Z digest=sha256:9bda19b9523e3671ca9037d6a1ee6ab52fc491bd294d1f701befa246b6e1f29c

Observation bd797f66-df8b-4775-ad84-c7ec8f535c84 · outbound

This paper cites Diffsound: Discrete diffusion model for text-to-sound generation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Diffsound: Discrete diffusion model for text-to-sound generation,

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.558847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.558847Z digest=sha256:3b32e7e7fa9e7d9bbeccdc64b4c9bc5574fe9b5d0047d05ced3acafc73e34fe0

Observation 7dab5646-809a-4a06-abaa-e6080e616efb · outbound

This paper cites CLIPSep: Learning text-queried sound separation with noisy unlabeled videos,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey CLIPSep: Learning text-queried sound separation with noisy unlabeled videos,

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.564279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.564279Z digest=sha256:9ed4a5dcbe08daac888b5d0f2db8f1be8ac5b431693ce51083f59123043f36b0

Observation 253a674d-a8d9-481b-af07-8ceb909f0402 · outbound

This paper cites Separate Anything You Describe.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Separate Anything You Describe

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.569685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.569685Z digest=sha256:90048a007f530cd48bfa7233d70d4e0e1dac60c5634d60b9e45a61e801ba4ea5

Observation 0127a8f9-7991-4dde-8c71-f659a66aca71 · outbound

This paper cites Opensep: Leveraging large language models with textual inversion for open world audio separation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Opensep: Leveraging large language models with textual inversion for open world audio separation,

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.574755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.574755Z digest=sha256:9c00408ac12e96e7e0f94f7d6298f3603209358e271f827e91fd55d1dd94f9a2

Observation 9b22e6b7-09f4-412e-8555-cd466df31e48 · outbound

This paper cites FlowSep: Language-Queried Sound Separation with Rectified Flow Matching.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey FlowSep: Language-Queried Sound Separation with Rectified Flow Matching

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.581064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.581064Z digest=sha256:86d06b2ee916e61acf1a030d610cfb1a37fd91c5ecafcadedb7f96cfa5b4fcc2

Observation 01761d08-92c4-4551-a165-da75e24932b0 · outbound

This paper cites Exploring text-queried sound event detection with audio source separation,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Exploring text-queried sound event detection with audio source separation,

Reference 98

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.586981Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.586981Z digest=sha256:48cc0672d6e83aae5e1baebe3caee4eeaa6610b0c84cfab1b5648110cee5f271

Observation 5fdf5a94-3b79-45a9-8da6-5b0923330a3c · outbound

This paper cites Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Style-Talker: Finetuning Audio Language Model and Style-Based Text-to-Speech Model for Fast Spoken Dialogue Generation

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.592384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.592384Z digest=sha256:a11cbc66a549130a64f4d32a632f6148b0f8721d85c5b20b45f02d7f2126ff5b

Observation 22b1f541-060f-41ed-8f1c-ad0228b1741b · outbound

This paper cites Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.597943Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.597943Z digest=sha256:67ce047a94299d55a45841f4200e11a30fa47ef2ee400f1501f755289bbab2bc

Observation 098e0395-4feb-42f1-8c84-937ecb6c59c4 · outbound

This paper cites Lp-musiccaps: Llm-based pseudo music captioning,.

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey Lp-musiccaps: Llm-based pseudo music captioning,

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-10T14:36:19.603067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:36:19.603067Z digest=sha256:31ded7dd3feb4a9950023330f99a4bcf1c59f5843b298cb814a9f4714813eb90

Pith citing papers

Observation a9181726-0b0f-4d86-974f-52685268cfe8 · inbound

Learning Sparsity for Effective and Efficient Music Performance Question Answering cites this paper.

Learning Sparsity for Effective and Efficient Music Performance Question Answering Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T11:50:44.994154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T11:50:44.994154Z digest=sha256:8f3cd3334cde44e690fd2effd01eb16e4edbabe30d830c41d1e8130ffa1dc725

Observation 67c45737-4490-4377-ae36-7247300acb00 · inbound

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model cites this paper.

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-05T17:56:54.908507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T17:56:54.908507Z digest=sha256:f66202547c05038268d127b97428e2a5fd5aabc15b99cdbd6537522d5f078ac7

Observation 0168ded6-1ca9-410c-b702-a6f097fbf190 · inbound

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation cites this paper.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.400124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.400124Z digest=sha256:1f2f0c970c266783ce70b0c792e15197c08340fbf3b236b67d9eac60beb6f57e

Observation a339adb2-3b79-47a0-9a57-8a21cead81a6 · inbound

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs cites this paper.

Benign Fine-Tuning Breaks Safety Alignment in Audio LLMs Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T08:01:25.938248Z digest=sha256:a65766ed0b147e686c989cf316e81f3a4a4883b9a5532dea01a33938accaddcf

Observation 6793b64c-7fdc-4fb7-9310-ae5fceb14b6f · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-08T12:25:52.847432Z digest=sha256:14b69fcb966569e9db4ef9dc00a885daf411d4ec8bed6b10e97ec1dccc035e8c

Observation 5d178954-211e-4767-8bc1-1a2ab5a9ebb2 · inbound

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization cites this paper.

PairAlign: A Framework for Sequence Tokenization via Self-Alignment with Applications to Audio Tokenization Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-30T23:14:32.494076Z digest=sha256:1f62e93c9e3bb365712d58db6bbce5beeb6439898c009cadbcbe4b94d39d73c3

Observation 9f4bed0e-2a05-402c-a285-dfbabd16d2bc · inbound

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook cites this paper.

A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T07:38:23.099479Z digest=sha256:10257a9cda71195471f31447f5334154ec65365822e8743de6f1832973970431

Observation 6a65ae05-1e3c-4198-9414-f910e7395f4e · inbound

A Survey of Audio Reasoning in Multimodal Foundation Models cites this paper.

A Survey of Audio Reasoning in Multimodal Foundation Models Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-21T02:08:06.976461Z digest=sha256:789c71568f2c402f178395869f5ab767f307e22275a10ba161c856b6c261829a

Observation 629c2bc5-ea64-466a-8b8a-032465a7be1f · inbound

Learning When to Think While Listening in Large Audio-Language Models cites this paper.

Learning When to Think While Listening in Large Audio-Language Models Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-29T18:37:34.409802Z digest=sha256:119db79c516dec45b3656f4f071ea84e416e49f1d2c241b24aea92fa790067bd

Observation 457c8e9c-249a-4a9d-9213-9a558c55a0d6 · inbound

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition cites this paper.

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T20:56:59.118526Z digest=sha256:0bd4bccdd244c6ee24f8f73309ccd7ea1358984f282e1301c287da3c26602736

Observation 6d6eed2a-f84a-4875-9a06-c93df3cc29ef · inbound

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models cites this paper.

GlobeAudio: A Multilingual Multicultural Benchmark for Naturalistic Evaluation of Large Audio-Language Models Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 78

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T19:51:59.265579Z digest=sha256:3954fddc95332084dae2b12fa258c77b1dbb27f34434588bb5c96ae12a2b0ec3

Observation bca6fe96-5ef7-486b-a6d4-e155b5dd30a4 · inbound

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents cites this paper.

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 180

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-30T22:11:44.891731Z digest=sha256:3b3e3f266c00c14c4a1fafdf1b126c6ccd03abdab991a38470be86f3c37a96e2

Observation 250fabc9-f870-4cf2-8d21-bcc649aa5c8f · inbound

When the Same Musical Knowledge Forgets Differently: A Clean Probe of Pathway-Dependent Forgetting cites this paper.

When the Same Musical Knowledge Forgets Differently: A Clean Probe of Pathway-Dependent Forgetting Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T04:50:48.712481Z digest=sha256:d8b8952800c54476ca73888a11eccc9c551c7fb9f270d6059f3f8d9366e4337c

Observation 2b42ec49-bb0c-4847-86ec-5eb5e652407a · inbound

ELSA: Acoustic Event-Level Semantic Alignment for Fine-Grained Reference-Free Text-to-Audio Evaluation cites this paper.

ELSA: Acoustic Event-Level Semantic Alignment for Fine-Grained Reference-Free Text-to-Audio Evaluation Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T23:17:37.444210Z digest=sha256:58ba4e70a89bab15f3c939ffe388c48f819da255ba234e430b2cc610faa68fd8

Observation 2b321af5-938c-4c76-be6f-ee2c3b5c379b · inbound

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries? cites this paper.

AOR-Bench: Do Large Audio Language Models Over-Refuse Pseudo-Harmful Queries? Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-26T13:22:12.541923Z digest=sha256:7447e6b4160276eb06b0a92ee43c4bca5ea718f6d3806b01a0495d73498c5c89

Observation 09ee30bd-04f3-4e16-827e-6e2bcd8dd040 · inbound

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios cites this paper.

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:17:07.899293Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T07:36:34.307652Z digest=sha256:98a6d4fb12f1df72d24afdaaa4ae8f5f48ef0279839644b430a2a9861d7926e5