Pith. sign in

Paper Citation Record · LEDGER

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training

As of 22 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2506.16833.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.16833 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T19:24:37.172437Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

29 of 29 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved16
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bff8ce61-8ddc-4ae8-9cd8-a78c2fd7ccee · outbound

This paper cites Separate anything you describe,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Separate anything you describe,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.600509Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.033545Z digest=sha256:0513e83b3ad93c902ecacf2cf1e3549e3aa8f98487cc1859e6d5ced6d8c21448

Observation ad76adee-32fc-4b00-8f97-59098595cb0c · outbound

This paper cites Exploring text-queried sound event detection with audio source separation,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Exploring text-queried sound event detection with audio source separation,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.585729Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.038653Z digest=sha256:c1cd8c39454827aa650cd8a46ddae359ee92b211ec6b35030ebad4fe0610a669

Observation 978187c4-3899-4453-8a01-1c9cb1fa440a · outbound

This paper cites Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.044527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.044527Z digest=sha256:ec36e1c1ab768088375560cf0f868d4d2492a6211f1bc225860ceb3debb7215d

Observation 923c3b4e-69cf-4477-8863-be0fc262c475 · outbound

This paper cites Language-queried audio source separation enhanced by expanded language-audio contrastive loss,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Language-queried audio source separation enhanced by expanded language-audio contrastive loss,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.570445Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.049589Z digest=sha256:09ab357c1e47d51f2e614eeed8a5d2cf221663bc65495b2b916fb3b6e83283af

Observation 2de167ed-8bed-4a64-8101-cda7b60a9ce5 · outbound

This paper cites Flowsep: Language-queried sound separation with rectified flow matching,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Flowsep: Language-queried sound separation with rectified flow matching,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.554748Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.054731Z digest=sha256:db40691ef12fe77f751e9a9805729c1bc498e1a62b1a00381bc577df2b30e676

Observation 8ba3f212-fcad-458a-9935-d58d392b53f8 · outbound

This paper cites A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.059818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.059818Z digest=sha256:d2e9478407d8ef57af67c727bd4081795c03af53d50dc1fa999faa4fe1154888

Observation 36601e78-aefa-4dcb-aa96-5a79fb957982 · outbound

This paper cites Fr\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Fr\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.065667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.065667Z digest=sha256:7b0abc2d9b7fe3687051747b2040f40e05af683fdb38afec22b9b392efbeaaee

Observation 78d42082-1d09-4dc4-ba1b-5f78247fcfa8 · outbound

This paper cites Consistency models,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Consistency models,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.070343Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.070343Z digest=sha256:e2ee10406892b3cd309ecb952a81471fd3a7b7fe1e99d331ef6f16e0a4900e56

Observation 48cc23d3-3255-4759-8132-070492371a35 · outbound

This paper cites Autoregressive Image Generation without Vector Quantization.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Autoregressive Image Generation without Vector Quantization

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.080464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.080464Z digest=sha256:d38bad1f2c4c0be40e09291d137ba47fa3948467276c464db2bea6422ffce544

Observation ef754a00-b9cc-4900-8fe4-634e487ed3a4 · outbound

This paper cites Drcap: Decoding clap latents with retrieval-augmented generation for zero-shot audio captioning,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Drcap: Decoding clap latents with retrieval-augmented generation for zero-shot audio captioning,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.530113Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.085512Z digest=sha256:443fa856b9add8d7f25b4e4c2badf877b68b9b728c67df538f68460982bf19e2

Observation 25fef697-ef48-464b-9386-cbc07323f240 · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.090834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.090834Z digest=sha256:013087f3739cd5d79524ec612614b37071ee7062172d11bfe404b147802027fc

Observation 6d53b1b2-1ccb-4ce7-9014-2c52b584b07d · outbound

This paper cites T-clap: Temporal-enhanced contrastive language-audio pretraining,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training T-clap: Temporal-enhanced contrastive language-audio pretraining,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.505351Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.095715Z digest=sha256:945a2beda602f677a7e2ba490d89c531ca9434feac3a37cee77712871d98aac6

Observation 56532566-6816-46c3-b1d3-60f5bae816b6 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Hubert: Self-supervised speech representation learning by masked prediction of hidden units,

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.100587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.100587Z digest=sha256:65c7fc43c9e4987f18fa186e32ad3689048a4eb5e3f7c8e301c5c02226ba35e8

Observation f7ec1a1b-d6cf-4c47-b2e6-defab20693bb · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.105136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.105136Z digest=sha256:bd32d0b9057b9bdb607ead16f86b3e1221033779d5282c8c2d477cf412e2ec80

Observation 3eb69a36-6084-4b01-9bb1-243a16dd559d · outbound

This paper cites MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.110121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.110121Z digest=sha256:ea47ea2ddd2236d0ff2e4368f7d20f7b781081f9ad7c6704d9829753b9f70874

Observation d4fe0313-bb7a-46b1-ac2a-18ca3b516d30 · outbound

This paper cites High fidelity neural audio compression,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training High fidelity neural audio compression,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.481367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.114881Z digest=sha256:3aae3ef22af4b4281d9cffbad6a33296330e75a4eff5472ecd7f61a5b5e368c3

Observation d4072610-7370-4639-b7db-03795e739b5f · outbound

This paper cites Improved Techniques for Training Consistency Models.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Improved Techniques for Training Consistency Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.119598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.119598Z digest=sha256:67d95380b91e2176813cc69ea798ede467b77db9bb7f8ed7b4f935faf9c4633e

Observation 73d4c029-cf6c-42ff-b943-2f841816eef2 · outbound

This paper cites Design and evaluation of parallel quadrature mirror filters (pqmf),.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Design and evaluation of parallel quadrature mirror filters (pqmf),

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.466458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.124913Z digest=sha256:b0680b83d41d64315f5182b30b759058c1c207ea825fa017a0893d04d1143777

Observation c756ab98-b9ca-46f8-a271-f3d610a05dc7 · outbound

This paper cites Audio set: An ontology and human- labeled dataset for audio events,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Audio set: An ontology and human- labeled dataset for audio events,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.129330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.129330Z digest=sha256:513dbe941c4eeec2ee81970e85cb2673093812c94db46095728fb329518351d4

Observation d946129e-6169-4dae-8715-11432a74e4ef · outbound

This paper cites The musdb18 corpus for music separation,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training The musdb18 corpus for music separation,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.134864Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.134864Z digest=sha256:4bce4e02b8d60d3473bfa770c96cbd218c381371ad891b5b58209727dbef4dc9

Observation ca679567-d9e3-41ac-8ab8-eee189168bf2 · outbound

This paper cites Cutting music source separation some slakh: A dataset to study the impact of training data quality and quantity,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Cutting music source separation some slakh: A dataset to study the impact of training data quality and quantity,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.442611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.139593Z digest=sha256:81d295fce1ca06c02ca56ecc2381b610cb83f7797fc448048e458783e2b12a6c

Observation ec1be601-65b1-4666-a3e2-8fb3df45c90d · outbound

This paper cites Icassp 2023 deep noise suppression challenge,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Icassp 2023 deep noise suppression challenge,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.427947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.144618Z digest=sha256:6843feca0d30151d95dbb0c7f7d00f0ad2c9751acb77e1cb887e6d1b7499242c

Observation 6b4d013f-3b35-4088-bd14-f0a9cdbf0f2e · outbound

This paper cites Audiocaps: Generating captions for audios in the wild,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Audiocaps: Generating captions for audios in the wild,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.413268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.149221Z digest=sha256:c85ad76ca6bc4c383ba73493d32db259fa76277047adf9986596fc64bb175f5b

Observation e06d6d09-54c5-4104-8423-e1cd0d81591b · outbound

This paper cites Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.398625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.153938Z digest=sha256:8670abe8d3e7f2870258ea393776b823b992bd602bdfab6fd39856dff72d147f

Observation 8a3eb973-4a07-4832-93e8-a3bcb1002502 · outbound

This paper cites Clotho: An Audio Captioning Dataset.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Clotho: An Audio Captioning Dataset

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.158595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.158595Z digest=sha256:422f6da835511f86a429bc6417a42bb5e16e8398b0b8496bbb31e63d056dc8b1

Observation 4a2d17d5-ef9b-48b2-9c1c-cdee878e5fb1 · outbound

This paper cites Fsd50k: an open dataset of human-labeled sound events,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Fsd50k: an open dataset of human-labeled sound events,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.163364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.163364Z digest=sha256:c912817b5a4b132188106e229330f860a90318b12c8df8a71f7d59edd1421aa2

Observation a525afeb-3fe1-4784-9a8b-f30df58b0768 · outbound

This paper cites Auto-acd: A large-scale dataset for audio-language representation learning,.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Auto-acd: A large-scale dataset for audio-language representation learning,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T19:24:37.374041Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-15T19:24:37.167684Z digest=sha256:4139ee7f64ff15165fd2a08df6223207b27670dd9f21ed0ca71f9fef542d03fd

Observation 9871a8fb-32ce-4618-b159-123b023c7d97 · outbound

This paper cites Decoupled Weight Decay Regularization.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Decoupled Weight Decay Regularization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.172437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.172437Z digest=sha256:a90b70412525ae28d8be81c31a286a56adce9c2d2969713e51cce04b80cc5357

Observation 59dc9cdf-d077-41cf-90ac-9ede79615a60 · outbound

This paper cites Consistency Models.

Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training Consistency Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T19:24:37.075202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:24:37.075202Z digest=sha256:98fe70cb29d15c39ae54d9e4082cc84f1265406d6102513f0083371be05fbd27

Pith citing papers

No inbound Pith citation observations are available.