{"as_of":"2026-08-22T11:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4989db9128499e3d1fe71fd123ba99ebb59c1a5679bca05531be8266b97f7691","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:24:37.172437Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16833/citation-record","integrity":"/paper/2506.16833/integrity","json":"/paper/2506.16833/citation-record.json","paper":"/paper/2506.16833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.595911Z","title":"Separate anything you describe,","venue":null,"work_id":"3d363620-f490-43af-a720-29451486b7ce","year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.033545Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:0513e83b3ad93c902ecacf2cf1e3549e3aa8f98487cc1859e6d5ced6d8c21448","observation_id":"bff8ce61-8ddc-4ae8-9cd8-a78c2fd7ccee","resolution":{"observed_at":"2026-08-15T19:24:37.600509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.580764Z","title":"Exploring text-queried sound event detection with audio source separation,","venue":null,"work_id":"87a80ebb-3815-4be6-9366-cde53c4954f3","year":2025},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.038653Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:c1cd8c39454827aa650cd8a46ddae359ee92b211ec6b35030ebad4fe0610a669","observation_id":"ad76adee-32fc-4b00-8f97-59098595cb0c","resolution":{"observed_at":"2026-08-15T19:24:37.585729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11248","last_updated":"2024-11-27T02:17:54Z","snapshot_observed_at":"2026-08-18T01:03:15.464131Z","submitted_at":"2024-06-17T06:19:14Z","title":"Performance Improvement of Language-Queried Audio Source Separation Based on Caption Augmentation From Large Language Models for DCASE Challenge 2024 Task 9","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11248","snapshot_observed_at":"2026-08-15T19:24:37.044527Z","title":"Performance improvement of language-queried audio source separation based on caption augmentation from large language models for dcase challenge 2024 task 9,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.044527Z"},"links":{"cited_paper":"/paper/2406.11248","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:ec36e1c1ab768088375560cf0f868d4d2492a6211f1bc225860ceb3debb7215d","observation_id":"978187c4-3899-4453-8a01-1c9cb1fa440a","resolution":{"observed_at":"2026-08-15T19:24:37.044527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.565517Z","title":"Language-queried audio source separation enhanced by expanded language-audio contrastive loss,","venue":null,"work_id":"df92a2d6-60ea-4f1d-98f5-916698ad3cc5","year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.049589Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:09ab357c1e47d51f2e614eeed8a5d2cf221663bc65495b2b916fb3b6e83283af","observation_id":"923c3b4e-69cf-4477-8863-be0fc262c475","resolution":{"observed_at":"2026-08-15T19:24:37.570445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.549540Z","title":"Flowsep: Language-queried sound separation with rectified flow matching,","venue":null,"work_id":"f583cdb5-120b-46f3-80b3-b629050731e5","year":2025},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.054731Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:db40691ef12fe77f751e9a9805729c1bc498e1a62b1a00381bc577df2b30e676","observation_id":"2de167ed-8bed-4a64-8101-cda7b60a9ce5","resolution":{"observed_at":"2026-08-15T19:24:37.554748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04936","last_updated":"2025-01-06T00:55:27Z","snapshot_observed_at":"2026-08-18T04:02:20.732602Z","submitted_at":"2024-07-06T02:55:28Z","title":"A Reference-free Metric for Language-Queried Audio Source Separation using Contrastive Language-Audio Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04936","snapshot_observed_at":"2026-08-15T19:24:37.059818Z","title":"A reference-free metric for language-queried audio source separation using contrastive language-audio pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.059818Z"},"links":{"cited_paper":"/paper/2407.04936","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:d2e9478407d8ef57af67c727bd4081795c03af53d50dc1fa999faa4fe1154888","observation_id":"8ba3f212-fcad-458a-9935-d58d392b53f8","resolution":{"observed_at":"2026-08-15T19:24:37.059818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-15T19:24:37.065667Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.065667Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:7b0abc2d9b7fe3687051747b2040f40e05af683fdb38afec22b9b392efbeaaee","observation_id":"36601e78-aefa-4dcb-aa96-5a79fb957982","resolution":{"observed_at":"2026-08-15T19:24:37.065667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.070343Z","title":"Consistency models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.070343Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:e2ee10406892b3cd309ecb952a81471fd3a7b7fe1e99d331ef6f16e0a4900e56","observation_id":"78d42082-1d09-4dc4-ba1b-5f78247fcfa8","resolution":{"observed_at":"2026-08-15T19:24:37.070343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-15T19:24:37.080464Z","title":"Autoregressive image generation without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.080464Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:d38bad1f2c4c0be40e09291d137ba47fa3948467276c464db2bea6422ffce544","observation_id":"48cc23d3-3255-4759-8132-070492371a35","resolution":{"observed_at":"2026-08-15T19:24:37.080464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.525156Z","title":"Drcap: Decoding clap latents with retrieval-augmented generation for zero-shot audio captioning,","venue":null,"work_id":"d652ec40-3c32-4868-ad2b-e98d0e513957","year":2025},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.085512Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:443fa856b9add8d7f25b4e4c2badf877b68b9b728c67df538f68460982bf19e2","observation_id":"ef754a00-b9cc-4900-8fe4-634e487ed3a4","resolution":{"observed_at":"2026-08-15T19:24:37.530113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.090834Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.090834Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:013087f3739cd5d79524ec612614b37071ee7062172d11bfe404b147802027fc","observation_id":"25fef697-ef48-464b-9386-cbc07323f240","resolution":{"observed_at":"2026-08-15T19:24:37.090834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.500720Z","title":"T-clap: Temporal-enhanced contrastive language-audio pretraining,","venue":null,"work_id":"fbaaa819-28f2-4ae3-baba-7264cafe2fa1","year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.095715Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:945a2beda602f677a7e2ba490d89c531ca9434feac3a37cee77712871d98aac6","observation_id":"6d53b1b2-1ccb-4ce7-9014-2c52b584b07d","resolution":{"observed_at":"2026-08-15T19:24:37.505351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.100587Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.100587Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:65c7fc43c9e4987f18fa186e32ad3689048a4eb5e3f7c8e301c5c02226ba35e8","observation_id":"56532566-6816-46c3-b1d3-60f5bae816b6","resolution":{"observed_at":"2026-08-15T19:24:37.100587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-19T21:51:01.237503Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-15T19:24:37.105136Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.105136Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:bd32d0b9057b9bdb607ead16f86b3e1221033779d5282c8c2d477cf412e2ec80","observation_id":"f7ec1a1b-d6cf-4c47-b2e6-defab20693bb","resolution":{"observed_at":"2026-08-15T19:24:37.105136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-20T05:49:02.872593Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-15T19:24:37.110121Z","title":"Mert: Acoustic music under- standing model with large-scale self-supervised training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.110121Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:ea47ea2ddd2236d0ff2e4368f7d20f7b781081f9ad7c6704d9829753b9f70874","observation_id":"3eb69a36-6084-4b01-9bb1-243a16dd559d","resolution":{"observed_at":"2026-08-15T19:24:37.110121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.476723Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"96b20814-1b7d-42de-bee7-6fb9f71c4465","year":2022},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.114881Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:3aae3ef22af4b4281d9cffbad6a33296330e75a4eff5472ecd7f61a5b5e368c3","observation_id":"d4fe0313-bb7a-46b1-ac2a-18ca3b516d30","resolution":{"observed_at":"2026-08-15T19:24:37.481367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14189","last_updated":"2023-10-22T05:33:38Z","snapshot_observed_at":"2026-08-17T19:16:27.766862Z","submitted_at":"2023-10-22T05:33:38Z","title":"Improved Techniques for Training Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14189","snapshot_observed_at":"2026-08-15T19:24:37.119598Z","title":"Improved techniques for training consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.119598Z"},"links":{"cited_paper":"/paper/2310.14189","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:67d95380b91e2176813cc69ea798ede467b77db9bb7f8ed7b4f935faf9c4633e","observation_id":"d4072610-7370-4639-b7db-03795e739b5f","resolution":{"observed_at":"2026-08-15T19:24:37.119598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.461775Z","title":"Design and evaluation of parallel quadrature mirror filters (pqmf),","venue":null,"work_id":"dd569075-eabc-41d2-8a7a-8885d3e4c9dc","year":1983},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.124913Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:b0680b83d41d64315f5182b30b759058c1c207ea825fa017a0893d04d1143777","observation_id":"73d4c029-cf6c-42ff-b943-2f841816eef2","resolution":{"observed_at":"2026-08-15T19:24:37.466458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.129330Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.129330Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:513dbe941c4eeec2ee81970e85cb2673093812c94db46095728fb329518351d4","observation_id":"c756ab98-b9ca-46f8-a271-f3d610a05dc7","resolution":{"observed_at":"2026-08-15T19:24:37.129330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.134864Z","title":"The musdb18 corpus for music separation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.134864Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:4bce4e02b8d60d3473bfa770c96cbd218c381371ad891b5b58209727dbef4dc9","observation_id":"d946129e-6169-4dae-8715-11432a74e4ef","resolution":{"observed_at":"2026-08-15T19:24:37.134864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.437997Z","title":"Cutting music source separation some slakh: A dataset to study the impact of training data quality and quantity,","venue":null,"work_id":"03779bb1-e416-4472-9e9d-5de043a3a0d4","year":2019},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.139593Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:81d295fce1ca06c02ca56ecc2381b610cb83f7797fc448048e458783e2b12a6c","observation_id":"ca679567-d9e3-41ac-8ab8-eee189168bf2","resolution":{"observed_at":"2026-08-15T19:24:37.442611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.423261Z","title":"Icassp 2023 deep noise suppression challenge,","venue":null,"work_id":"7ee4fc22-c3d0-40b8-837a-570ba8def6ee","year":2023},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.144618Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:6843feca0d30151d95dbb0c7f7d00f0ad2c9751acb77e1cb887e6d1b7499242c","observation_id":"ec1be601-65b1-4666-a3e2-8fb3df45c90d","resolution":{"observed_at":"2026-08-15T19:24:37.427947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.408601Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"2729cae8-65fe-47fc-9d31-f3610cb4810d","year":2019},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.149221Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:c85ad76ca6bc4c383ba73493d32db259fa76277047adf9986596fc64bb175f5b","observation_id":"6b4d013f-3b35-4088-bd14-f0a9cdbf0f2e","resolution":{"observed_at":"2026-08-15T19:24:37.413268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.393655Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":"1fd51f55-040d-4a5f-83c5-d24a88cab730","year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.153938Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:8670abe8d3e7f2870258ea393776b823b992bd602bdfab6fd39856dff72d147f","observation_id":"e06d6d09-54c5-4104-8423-e1cd0d81591b","resolution":{"observed_at":"2026-08-15T19:24:37.398625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09387","last_updated":"2019-10-21T14:06:01Z","snapshot_observed_at":"2026-08-10T12:14:01.060108Z","submitted_at":"2019-10-21T14:06:01Z","title":"Clotho: An Audio Captioning Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09387","snapshot_observed_at":"2026-08-15T19:24:37.158595Z","title":"Clotho: An audio captioning dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.158595Z"},"links":{"cited_paper":"/paper/1910.09387","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:422f6da835511f86a429bc6417a42bb5e16e8398b0b8496bbb31e63d056dc8b1","observation_id":"8a3eb973-4a07-4832-93e8-a3bcb1002502","resolution":{"observed_at":"2026-08-15T19:24:37.158595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.163364Z","title":"Fsd50k: an open dataset of human-labeled sound events,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.163364Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:c912817b5a4b132188106e229330f860a90318b12c8df8a71f7d59edd1421aa2","observation_id":"4a2d17d5-ef9b-48b2-9c1c-cdee878e5fb1","resolution":{"observed_at":"2026-08-15T19:24:37.163364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:24:37.367520Z","title":"Auto-acd: A large-scale dataset for audio-language representation learning,","venue":null,"work_id":"3a0efdee-0248-46da-a118-36167843e6a9","year":2024},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.167684Z"},"links":{"citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:4139ee7f64ff15165fd2a08df6223207b27670dd9f21ed0ca71f9fef542d03fd","observation_id":"a525afeb-3fe1-4784-9a8b-f30df58b0768","resolution":{"observed_at":"2026-08-15T19:24:37.374041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T19:24:37.172437Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.172437Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:a90b70412525ae28d8be81c31a286a56adce9c2d2969713e51cce04b80cc5357","observation_id":"9871a8fb-32ce-4618-b159-123b023c7d97","resolution":{"observed_at":"2026-08-15T19:24:37.172437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-15T07:00:23.337991Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-15T19:24:37.075202Z","title":"Available: https://arxiv.org/abs/2303.01469","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T19:24:37.075202Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2506.16833"},"observation_digest":"sha256:98fe70cb29d15c39ae54d9e4082cc84f1265406d6102513f0083371be05fbd27","observation_id":"59dc9cdf-d077-41cf-90ac-9ede79615a60","resolution":{"observed_at":"2026-08-15T19:24:37.075202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.16833","last_updated":"2025-06-20T08:38:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T13:14:24.523577Z","submitted_at":"2025-06-20T08:38:51Z","title":"Hybrid-Sep: Language-queried audio source separation via pre-trained Model Fusion and Adversarial Diffusion Training"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2506.16833."}