Pith. sign in

Paper Citation Record · LEDGER

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

As of 22 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2511.16757.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2511.16757 v2

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T21:06:13.173892Z

measured 53 of 53 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-01T06:28:49.998236Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

52 of 52 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved52
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ce739042-061b-4cb0-8cc6-c22fbdc75922 · outbound

This paper cites YouTube-8M: A Large-Scale Video Classification Benchmark.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation YouTube-8M: A Large-Scale Video Classification Benchmark

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.064176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.064176Z digest=sha256:8a0614d143b2dc200dbbefc9102a392c863644721de5c13b79aff83c55437b61

Observation d6b5de18-f890-4206-93bc-4bd68033e922 · outbound

This paper cites Common Voice: A Massively-Multilingual Speech Corpus.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Common Voice: A Massively-Multilingual Speech Corpus

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.490691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.490691Z digest=sha256:c443c3ae6c0e9ea9fcebc819bad9e58fe2b7420ca54df693172a05bc45859e9c

Observation 2dca371f-5f41-4521-8e81-5b79e200dd2f · outbound

This paper cites FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation FusionAudio-1.2M: Towards Fine-grained Audio Captioning with Multimodal Contextual Fusion

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.068024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.068024Z digest=sha256:e8571f3c0b96e3a5ba063aa8a66088dd7464eec888bd71ac7613a50671b01434

Observation 757193c3-f9c7-4b35-b7af-7d9caf4bc02b · outbound

This paper cites Qwen2-Audio Technical Report.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Qwen2-Audio Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.175687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.175687Z digest=sha256:230928e478b15cef85f41bf3f219d057b54b1d359f7380ff6ea556b717c1fcd9

Observation 1f57623f-60c2-4210-ab8a-0d3b36eb8654 · outbound

This paper cites Midashenglm: Efficient audio understanding with general audio captions.arXiv preprint arXiv:2508.03983,.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Midashenglm: Efficient audio understanding with general audio captions.arXiv preprint arXiv:2508.03983,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.162666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.162666Z digest=sha256:59213ef6698963a74a721c3e16ddda4b5928c44c6d600d16b6a24efc0013cd3f

Observation 1c5f3008-b2be-4e24-ae04-917548a25f26 · outbound

This paper cites Scaling rich style-prompted text- to-speech datasets.arXiv preprint arXiv:2503.04713,.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Scaling rich style-prompted text- to-speech datasets.arXiv preprint arXiv:2503.04713,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.242369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.242369Z digest=sha256:b39cc08e93a3f9e2fc0adc9e5827ca77889d17d96e0e15eef0e1d960f0917d6b

Observation c73e955d-b0cc-40f7-b1be-502aa5bbf469 · outbound

This paper cites Clotho: An audio captioning dataset.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Clotho: An audio captioning dataset

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.324790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.324790Z digest=sha256:178b014ea5efd4711a39121f7aa881496eb1e9faadc188bdfd6e689a36d5a571

Observation 9d4e6e2c-d6cf-4df0-b13f-13feba227ed4 · outbound

This paper cites Threshold independent evaluation of sound event detection scores.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Threshold independent evaluation of sound event detection scores

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.390675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.390675Z digest=sha256:5ddab62c15e840800c6eadc8b4cd3ecfb060b96116c68e214ed6c5e05623128a

Observation 85a23a6c-3396-45dd-ae43-fa5e3796ae36 · outbound

This paper cites Clap learning audio concepts from natural language supervision.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Clap learning audio concepts from natural language supervision

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.467312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.467312Z digest=sha256:2a25f944c704e2a4935c10d7e9015f996624ad8f3ef5cc586d345885fe71def0

Observation ef0f3a52-89c0-4f58-866f-3797e15bbf98 · outbound

This paper cites Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.712057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.712057Z digest=sha256:54878657072c7b510d99f03906117391920b86d70a1ea540b07297e374cd1d3c

Observation 04b5af39-f331-434e-8f89-d572b3de60d2 · outbound

This paper cites Ast: Audio spectrogram transformer.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Ast: Audio spectrogram transformer

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.825665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.825665Z digest=sha256:f94b1f08b7d56f6c268f2a59c974cb0281efaa538002f8048ce8f288cfe59b28

Observation 0b1f7c7a-b55a-4d1e-b348-b32c898633d5 · outbound

This paper cites Contrastive Audio-Visual Masked Autoencoder.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Contrastive Audio-Visual Masked Autoencoder

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.947756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.947756Z digest=sha256:b293d92a2e352e6208bd6ec7bea901ac75a216daa5ceb7d573aff925a676c2b7

Observation d3fc791d-3b12-4f09-a897-e58df262fbf4 · outbound

This paper cites The benefit of temporally-strong labels in audio event classification.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation The benefit of temporally-strong labels in audio event classification

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.072808Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.072808Z digest=sha256:909e4be573b2c0614770090fb08137324abda9dddbf18359b64be29f1f255d75

Observation fe928ae7-8709-4edf-a97e-74d858049082 · outbound

This paper cites Audiocaps: Generating captions for audios in the wild.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Audiocaps: Generating captions for audios in the wild

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.192703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.192703Z digest=sha256:d94905235b712a1ac2f43f25be1a6637078020d3a5a83eb6f202cc6a06c848d8

Observation c57a7e6f-9813-476f-a697-ffe5175a3ab7 · outbound

This paper cites Bootstrap- ping language-audio pre-training for music captioning.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Bootstrap- ping language-audio pre-training for music captioning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.308807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.308807Z digest=sha256:756508eb83ff9452e2fcb0315bd580f558fa025a5cdaaf3efa8d41a29335987f

Observation 8cb5d8aa-187c-4b0c-b7f8-9a9eb6fec207 · outbound

This paper cites A Diversity-Promoting Objective Function for Neural Conversation Models.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation A Diversity-Promoting Objective Function for Neural Conversation Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.418194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.418194Z digest=sha256:9debe0b26c804ed0f8a06cf95341d1447cf5e30fa4f38cae97fb56eba96e6215

Observation c4ce15a0-f12f-43a9-9ab7-1316e2bdc2ba · outbound

This paper cites Music understanding llama: Advancing text-to-music generation with question answering and captioning.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Music understanding llama: Advancing text-to-music generation with question answering and captioning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.566293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.566293Z digest=sha256:884e29d82088143f03d5314677ff2366ff5423221410200c43cd145a467e3b81

Observation bd121fca-7daf-49e3-b6ae-7a1c0ac820ab · outbound

This paper cites RoBERTa: A Robustly Optimized BERT Pretraining Approach.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation RoBERTa: A Robustly Optimized BERT Pretraining Approach

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.633950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.633950Z digest=sha256:4b9a4abe49de44cc0b50b7bfa89774f4ceaaf69d45a59d46232b2bea764e8820

Observation c171446b-c51c-4493-9a76-50842f872cfe · outbound

This paper cites MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.705003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.705003Z digest=sha256:733d9e9f8d24b3400714c8fed363a36ac6ea1d7ca855c8e970be6d7a9aca6b80

Observation 615dafb6-a46e-4309-9fdc-cd1f6b58f6fd · outbound

This paper cites Expresso: A benchmark and analysis of discrete expressive speech resynthesis.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Expresso: A benchmark and analysis of discrete expressive speech resynthesis

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.775784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.775784Z digest=sha256:2418a9bf254fbbb8653480690dc0a17a70279424d19337ea1db4b14a69eb7c23

Observation ed604b87-016f-4410-a5d2-8b5f8682cee0 · outbound

This paper cites M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation M2D-CLAP: Masked Modeling Duo Meets CLAP for Learning General-purpose Audio-Language Representation

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.841830Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.841830Z digest=sha256:4e6996363e0776449f0b276c1463c7449c7c0e8fea15f8c8946470068270ea91

Observation d96523a0-8922-43e6-9e09-2bc2a24d2d48 · outbound

This paper cites M2d2: Exploring general-purpose audio-language representations beyond clap.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation M2d2: Exploring general-purpose audio-language representations beyond clap

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.915628Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.915628Z digest=sha256:3a363e64dec64cfd7f9366ac501b0ccb43216746561ea14deeb3506100e17b2a

Observation 7017ae55-494d-4018-bbba-7d7c1f050101 · outbound

This paper cites Representation Learning with Contrastive Predictive Coding.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Representation Learning with Contrastive Predictive Coding

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.032587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.032587Z digest=sha256:8e903a805bf14c1b4b8c34b0b7298a7a9f572868ae164a515794a1a019af9ee8

Observation dbc2b25d-b38f-466c-9474-26e972a603c6 · outbound

This paper cites MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.114113Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.114113Z digest=sha256:00eaacf93dcc5d3b6b4497c881a8d1775f89890b3137c0ac6ada1d313e0ebc98

Observation 0e47b155-47ef-4a4c-9af1-7c81fcf94e81 · outbound

This paper cites Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.188963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.188963Z digest=sha256:624b0946598c2428b1b2b5e801430a28422bdebb31caec62284bc4ef398e353b

Observation c40cd07d-aa01-47c4-b07d-6516381f5823 · outbound

This paper cites Ears: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Ears: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.260914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.260914Z digest=sha256:e7ae58ef5244d228ba017dfda3a7dbeeff9226cc20117348057344edf140807b

Observation 537edd05-764f-4232-9357-53816e6f6c68 · outbound

This paper cites JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.334903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.334903Z digest=sha256:0aecaa5ebeaeb7afd6ea05f3c4e6e833a439897f122374586eee5dcda5f19f7c

Observation 0168ded6-1ca9-410c-b702-a6f097fbf190 · outbound

This paper cites Audio-Language Models for Audio-Centric Tasks: A Systematic Survey.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.400124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.400124Z digest=sha256:b24f166814096f330dc2c0786dbdac48dad97faa1a1be1d8e36b1daf760c366f

Observation f9652705-8b00-4560-b9a1-ad4bf3f5b834 · outbound

This paper cites Hear: Holistic evaluation of audio representations.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Hear: Holistic evaluation of audio representations

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.476479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.476479Z digest=sha256:1b5d00ed6d34b27d84fd1a958925c6afa4979be5f3b9cffe97233b8962f3d0e5

Observation ebb0f9fa-5e98-466b-86ef-b27020d59182 · outbound

This paper cites Towards learning universal audio representations.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Towards learning universal audio representations

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.497545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.497545Z digest=sha256:1b95e978cc9806037ced0c0d178d827a798e40114c630e567e5be06fb8647ec6

Observation 5f39bf62-dda9-404d-80e7-c689903a62ab · outbound

This paper cites Wav2clip: Learning robust audio representations from clip.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Wav2clip: Learning robust audio representations from clip

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.511640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.511640Z digest=sha256:e63412b8ac76bb6da8a29757152800bdaa152fa1fb974553543a4c29d35cef65

Observation a645b7a2-ed46-446e-a966-78c3b632861d · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.655197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.655197Z digest=sha256:f561f278d467a94ea9b5200c4b360fbf061900f00dc14ba1dd30130ef10f2bc3

Observation 5290700a-c99c-4190-b100-73ddc28758a2 · outbound

This paper cites Qwen2.5 Technical Report.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Qwen2.5 Technical Report

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:11.795076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:11.795076Z digest=sha256:7f4873a65d31bc5b402d859b3317144ed035b6f9022e81c65cfb9ad9cd8bf888

Observation 32d11406-f61d-48f6-8d96-a004bf39d094 · outbound

This paper cites Speech self- supervised representation benchmarking: Are we doing it right? InInterspeech 2023, pp.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Speech self- supervised representation benchmarking: Are we doing it right? InInterspeech 2023, pp

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.049728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.049728Z digest=sha256:24e786021e205d8396636888482c4f11f5d1bc4c318dc85608bba6e041371272

Observation 34f80b2d-5844-41fe-98f7-cc8dcdbdee82 · outbound

This paper cites Xiaohua Zhai, Xiao Wang, Basil Mustafa, Andreas Steiner, Daniel Keysers, Alexander Kolesnikov, and Lucas Beyer.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Xiaohua Zhai, Xiao Wang, Basil Mustafa, Andreas Steiner, Daniel Keysers, Alexander Kolesnikov, and Lucas Beyer

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.221734Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.221734Z digest=sha256:ecd83e7bc87ddf8e0967f7192176b439be2d66bd47459234c660b12cd588837f

Observation 1f31a174-8633-4e17-9659-dab533bdfcf6 · outbound

This paper cites MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.382168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.382168Z digest=sha256:d27cd4a5263548f84a6a3bbc87dcb0948213a729ac40cd617d047864b9919355

Observation d7e2a49a-a2bb-48fa-8a53-f1bb106aefca · outbound

This paper cites an unresolved cited work.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.550088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.550088Z digest=sha256:b6623eb62c54234ef55a55b311c88aad874f359c45acf8254bfd5f0db5e9f952

Observation d305ed88-57b4-4a52-ac45-b4292756d9d8 · outbound

This paper cites an unresolved cited work.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.720421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.720421Z digest=sha256:e5a57c40f291aa75171a31165427b8208684d454f22ba1350f9ddf380ca6c68e

Observation a311440c-b7a8-416b-9802-b704963ea926 · outbound

This paper cites an unresolved cited work.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:12.895160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:12.895160Z digest=sha256:ea5e905dde82eac6e60aef851ce676e26f36741efaca1273bcf245fc62522294

Observation 9ead360e-496e-41d7-aacb-c35a78841280 · outbound

This paper cites The architecture employs a U-Net-inspired design with six Transformer stages that process sequences at multiple temporal resolutions.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation The architecture employs a U-Net-inspired design with six Transformer stages that process sequences at multiple temporal resolutions

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:13.035165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:13.035165Z digest=sha256:f554c6f16b1bb3cdd7a9bdb5e3df4a91ad38d04727828a08984d57d123cd140d

Observation 8aa230fa-7631-42be-b74e-14a8343967dc · outbound

This paper cites an unresolved cited work.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:13.173892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:13.173892Z digest=sha256:23f2909dd4ce6818f46cd15c774dd11f217e98f226762432f4d61ceedd580f2d

Observation 0edf5fba-f34d-41b8-a3ae-311d3e6b0463 · outbound

This paper cites ATST: Audio Representation Learning with Teacher-Student Transformer.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation ATST: Audio Representation Learning with Teacher-Student Transformer

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:10.496343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:10.496343Z digest=sha256:76078c695a95161aeace54f98f80445fcd26f1f92f0cb0cbb288c97e516a2b86

Observation fff260b9-0970-433a-a3d5-522553d1d05d · outbound

This paper cites MusicLM: Generating Music From Text.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation MusicLM: Generating Music From Text

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.208641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.208641Z digest=sha256:a883d3a861895ee466e63fd9a9400f180e76a7077d00b6cd2288a01e2eaa6e77

Observation bf63c450-d9dc-4046-9236-8c7c6b994720 · outbound

This paper cites Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.587432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.587432Z digest=sha256:c2f8145ee706b3fa53be4b106865a09c87d68a8250aa9351ab859261df6ac030

Observation 03dc1531-4719-4696-9910-0733bb3d7b61 · outbound

This paper cites Look, listen, and learn more: Design choices for deep audio embeddings.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Look, listen, and learn more: Design choices for deep audio embeddings

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.501672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.501672Z digest=sha256:9cf087d25876aae3640d75d4c262fe829ba422ec1af534321aac5c3465b079e0

Observation 3bdd87a5-184b-4737-94c4-aecfa217fecd · outbound

This paper cites Scaling up masked audio encoder learning for general audio classification.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Scaling up masked audio encoder learning for general audio classification

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:09.076370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:09.076370Z digest=sha256:877af8e355aee37c4e0f2d22ea1ab9846ea4dc2bc67f7e20c9ad754a6e53c015

Observation bae167f7-1436-4d5b-ad13-6f556a13f876 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.928487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.928487Z digest=sha256:7014abee757d0a32794d7c20c0f8be0a6756d8ac38fdbc24b3247a755d3ef935

Observation e99ea17d-78c8-4096-b2c1-476e33bc9d56 · outbound

This paper cites Vggsound: A large-scale audio- visual dataset.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Vggsound: A large-scale audio- visual dataset

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.900028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.900028Z digest=sha256:695230646d445d2af9765b6256ee740d8fe39f16ea8a6bd48d2c36fea96a8aa2

Observation dad4edd1-5800-4821-a31b-d0a2090f0f3b · outbound

This paper cites ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.738117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.738117Z digest=sha256:a3427a88bd8c2f9fb9cca7823a4686c0d85f6a6fd3838edac98845ff3433ee7f

Observation 36034fc8-1f4e-4a03-8780-8f0aa5dbafb4 · outbound

This paper cites Efficient supervised training of audio transformers for music representation learning.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation Efficient supervised training of audio transformers for music representation learning

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.316713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.316713Z digest=sha256:7158f6051036505cc1d779358923ed9e3604f7d2d95a079a17403f0f72db9ef0

Observation bcab7841-040c-4567-820b-9a2a5c149269 · outbound

This paper cites VoxCeleb2: Deep Speaker Recognition.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation VoxCeleb2: Deep Speaker Recognition

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:08.388565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:08.388565Z digest=sha256:396d028da091ce2fc0ccdfa560adbb4f75ad9df6d181a70987334cf741c4f2bb

Observation 84d977bf-7ef6-491a-bfea-26e008035d6d · outbound

This paper cites OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder.

Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation OpenBEATs: A Fully Open-Source General-Purpose Audio Encoder

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T21:06:07.665524Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T21:06:07.665524Z digest=sha256:1eff6c3724a8ab71f72afc4e413ae886218e9f7244279de9533397ea23353224

Pith citing papers

Observation a8b7fc15-ce07-44c9-9380-e6ffe9713782 · inbound

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision cites this paper.

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision Revisiting Audio-language Pretraining for Learning General-purpose Audio Representation

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-01T06:28:49.998236Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T06:28:49.998236Z digest=sha256:65e7ea2c17d64da515f30e5524e8c698a53d4dc807168b7396243507b1e20ab2