{"as_of":"2026-08-07T05:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6762d2e0d30f5a86bf5cfc470b7c1b5f82b38c099a43faddb0bd4cc4b956e1e8","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T23:50:12.369547Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:13:52.441021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:13:54.931212Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:faf34c4031abe331261924ba934aa2746bc1d734eb3d46007bb0f88040298dc4","observation_id":"0c1d265d-c18e-4906-bc15-45305326e970","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":"2607.03806","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-08-07T00:13:54.931212Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","venue":"eess.AS","work_id":"97c10890-2639-4f0a-b3a2-9c47eecadfe6","year":2026},"citing_paper":{"arxiv_id":"2608.01560","last_updated":"2026-08-03T00:34:45Z","snapshot_observed_at":"2026-08-07T00:07:02.163437Z","submitted_at":"2026-08-03T00:34:45Z","title":"Discriminative Axis, Not Data Volume: What a Contrastive Corpus Teaches an Audio Embedding","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:52.441021Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2608.01560"},"observation_digest":"sha256:0779681240f89138f3174e711fe656e0d08e8a425251e97293aa1cc8ce116de5","observation_id":"4e582ce5-864a-400c-aeb7-2df1822df112","resolution":{"observed_at":"2026-08-07T00:13:55.009060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03806/citation-record","integrity":"/paper/2607.03806/integrity","json":"/paper/2607.03806/citation-record.json","paper":"/paper/2607.03806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c5d149734d4ebb45621741e177fb68fa0825cf4d3d67c0ec88c880f868a9309c","observation_id":"ee41af6b-b509-468e-a9c8-52051b886ea7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03806","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2607.03806","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:faf34c4031abe331261924ba934aa2746bc1d734eb3d46007bb0f88040298dc4","observation_id":"0c1d265d-c18e-4906-bc15-45305326e970","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:d7b8287128717e2f6f50a82fb786813964dcdf64fee6cf395adc418853817664","observation_id":"9afe3d18-4a72-4e49-b4f0-e265b94a17eb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c5db7f8d6ab6e2c8b4592bd2af76a7fdfbe40df85a23f02ffcd6e7cdd4333e28","observation_id":"2b0b683f-ee34-4d91-afa5-a3bdb39f988a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:b42f36c24f18ebb6991812b616cef2e37a18f0df92f8fc72bac2bbafede459d3","observation_id":"94e8013b-e411-49a8-a644-9acbe548d16f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Clap: Learning audio concepts from natural language su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:d6eb73959a39a34c4cf302bfc933150ed68c4c80faa98d740e7dc040225b0b97","observation_id":"c43f89b3-2115-4c6d-abdf-8e0b5db0669a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:7a3d54d2c609c728f457291ee27c56b0730318abbab7fef370bc6715731696b8","observation_id":"75b4cc02-c330-495f-aa8e-30680802d67f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14076","last_updated":"2025-04-18T21:00:50Z","snapshot_observed_at":"2026-08-05T06:27:53.374001Z","submitted_at":"2025-04-18T21:00:50Z","title":"Transformation of audio embeddings into interpretable, concept-based representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14076","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Transformation of audio embeddings into interpretable, concept-based representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2504.14076","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:ecd06fe94200de37b92a18e5b6a40c821d0e600898a8dfd81400c077a03b96af","observation_id":"fc246ef7-dc97-4383-9a25-f9ad0bdfbd67","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Drcap: Decoding clap latents with retrieval- augmented generation for zero-shot audio captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c8f0f78dc768bb4702f53ba9aa5af9061b675ae486843a138237142f1531ddcc","observation_id":"08bc8b6a-c8c9-41c7-b703-9bada44dfc68","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Pam: Prompting audio-language models for audio quality assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:f2f918fbffe282f825bcb34a51ec9d1f45717f7fb5067d88596f43f685a91137","observation_id":"ed783ea8-c6ee-422c-950f-b554e330752f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Listen through the sound: Generative speech restoration leveraging acoustic context representation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:f6cacf2dd62bfd956ea7a05b8f8fc875d19f521ef47c7fe18aa0aa14ef48dbab","observation_id":"23d867f7-1456-46c5-8f08-1997fb49bb2c","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Text2FX: Harnessing clap embeddings for text-guided audio effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:f7f8b3d5b82725a8d9a7e3c6a4347fc637850d866eba160745e6c975c7e2c921","observation_id":"db2e4b33-a4f4-4b31-82b7-c027e54eb08a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Multimodal room impulse response generation through latent rectified flow matching,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c7a5af420449966c9237943cff8250e9ee5a6fcb7aeecbf2db44f47d7a0b4f76","observation_id":"3cc318aa-ce88-44f7-97ee-0cf007adb98a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"TokenSynth: A token-based neural synthesizer for instrument cloning and text-to-instrument,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c48ea6737b03367cfb715fee0d56047e10833c66c76eb1d0558bb2af25b1daf7","observation_id":"1df08775-dc71-416b-bd7b-b0f14cb7c6d7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"FlowSynth: Instru- ment generation through distributional flow matching and test-time search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:480e76cce1765a4baaf933b0be3bbd90102e0114f75ee9dd8963ba709ac0f19c","observation_id":"e491dff7-07f1-42c7-924e-9745797aeb1b","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Make-An-Audio: Text-to- audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:20ac333ed9031feaa94caab1062727cf1b2669b507dd7a0f9f0390130848a324","observation_id":"85b5dae5-4529-4102-9e0f-73eb8b07c0d9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"T-clap: Temporal-enhanced contrastive language-audio pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:3c47a7afdfce44a8c48ae65d0c34cb37c075436d306af70a5eaee942c351e3e5","observation_id":"b7f7264e-6808-4ec7-894b-cd738a4f4437","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Spatial-clap: Learning spatially-aware audio–text embeddings for multi-source conditions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:65c3db6625106e3c0dfba0741350daa3e2d2717cb1400fd9765fa05f93c230fe","observation_id":"5bb71a8c-7804-49d7-ab52-0963347a7ac9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Probing the information encoded in x-vectors,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:a491104a9f217183a0d89203f93e913a739bbe24adf256505cbdc7c62fa2f536","observation_id":"3859c217-7c4e-4788-ba24-51d24cab14c7","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-07-06T21:37:18.677974Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Audiolens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:be3b90c1028ef31e91d4955ee56d08ff51e41340c06902489f88c1345fbff4de","observation_id":"81c5aee3-dbe6-4897-8bb8-a06c1a164750","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Causal tracing of audio-text fusion in large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:dfda36badb7c8ca3b33cc869893eef441c25e35a37ab8e944558faeec8661111","observation_id":"0de9bca0-1c3d-4e85-806f-6d8ce1a21a95","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"AND: Audio network dissection for interpreting deep acoustic models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:3fb347042d77e7dd6460ee865d02e76c938e2a770322cf2ed953f14d73a43aa7","observation_id":"5fcd47f9-1234-46b4-8011-2037130c5740","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Do joint language- audio embeddings encode perceptual timbre semantics?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:24d8026c185f87a55f8136db7dee52cf72f1c6a700ee3fe14db791fc45129dbb","observation_id":"0c16cf67-d7fa-42f4-ad13-c04e14a69f56","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Evaluating foundation models on timbre-related cognitive tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:a800761f492aec89de1ab931d48f673dc0ae0bddbdc0fd5bee51440334513aa5","observation_id":"4266ee53-5c2f-44a2-b1c7-e91a0c3834b8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Investigat- ing the sensitivity of pre-trained audio embeddings to com- mon effects,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:457252cbdcb90b75abe19d6a1cba80cdef43690bb41b52f0e56298296bac388f","observation_id":"c23d28e3-d8aa-4561-8803-b4eb153d1a10","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Fx-encoder++: Extracting instrument-wise audio effects representations from mix- tures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:b057760c81984bf595386cb54a31aed8a978b9b1e8766e9ccd6dc1184a93d2a1","observation_id":"562feb02-a6d2-441c-9abc-281e1e49de45","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Large-scale contrastive language-audio pre- training with feature fusion and keyword-to-caption aug- mentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:03d9f43cffd00a7f3038a64c28739a56339a88d1cd4a9f9ee247f2bb5d338c4c","observation_id":"cf9844ae-7077-471c-baa2-c515c754ebda","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:2a416bb4400f940fed980f5c1b3e813947e1a4efdc3458208dcdddcc5473eb15","observation_id":"887db5df-2e21-4ed7-940f-fe81b566c3ef","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"New method of measuring reverberation time,","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:955128fc8b5c23e6d5c3dd2a3aa117a52344bba00a8fde222a8a4176baa23a43","observation_id":"ad824632-2204-47d6-b632-dd91f8ad6ed8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Algorithms to measure audio programme loudness and true-peak audio level,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9f09e41294b41b3cdffed62fe87cccbf7f0982514f4cb4899e8ee23fb772c7e0","observation_id":"4dd43220-ea83-490e-b905-f58616170a66","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Müller,Fundamentals of Music Processing: Audio, Anal- ysis, Algorithms, Applications","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:e42b9bed23a826ef0e29d6004c44f06cb8758c9bc6512519df8fe734bbf5c724","observation_id":"dedcc5e8-d506-4d15-bac9-42870b0d35eb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:8be237e3746496deccb8c000d41c1693bffd4ab319bb0d255371be66ded04025","observation_id":"c6c75ea2-cd55-4574-a8af-1f2337fcd36f","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Schölkopf and A","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:98db45f72e335555d9f07e964cc71e3482e72cb9b94fcf432162218c0bbafd5c","observation_id":"ea7efda3-219e-4dc2-859e-53b931ad400d","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Neural audio synthesis of musi- cal notes with wavenet autoencoders,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:5bb4aabc9a67a695a5b25ca484559eba90b272f6eefc4cc72158b9a08ba5fa02","observation_id":"5131fc46-3202-4e66-8491-2bd7096d42f9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:063c55994bab2e230d9e656bc3ed730aae53acaca9ffcc3179f07352455cc806","observation_id":"0d31c327-9087-4455-afa3-82b559705cfe","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"MUSDB18-HQ - an uncompressed version of musdb18,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:68b985e24391bd28435787de816ebb69a071f52a9b7faf2c25484c624cb865b9","observation_id":"3f06b495-8be4-4f06-b7c7-898278dd178a","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03448","last_updated":"2025-12-27T19:25:03Z","snapshot_observed_at":"2026-08-02T13:48:38.069766Z","submitted_at":"2025-08-05T13:49:04Z","title":"SonicMaster: Towards Controllable All-in-One Music Restoration and Mastering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03448","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"SonicMaster: Towards controllable all-in- one music restoration and mastering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2508.03448","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:2ff3151e6a9c606ef0621d0ea17c081492089a64cdc4cf6d5c4786de38c29737","observation_id":"d8cfdff0-45b2-4cfa-9fa9-f1917c37da25","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"gpurir: A python library for room impulse response simulation with gpu acceleration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:cafa7b5a7d78c050b14d40a414fd078c095eae21f5613d1ebf815194bd9d3f53","observation_id":"10d1efbb-3543-4ca9-9761-43e7d8b0a21b","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised train- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:745e66aa19ff8891b22a937d986ac4239768e6b03ca068e12d0822b07be05554","observation_id":"410bb847-7bfc-42c3-b526-1bd5c8aaa7c9","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech rep- resentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:fb36897928f99b60cb9a58a1bd4ccb33d7c4f186c2033ac3def8df41385a4820","observation_id":"333eccd9-2ec5-4d40-a919-7b0996d5e515","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Wavlm: Large- scale self-supervised pre-training for full stack speech pro- cessing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c82eb93eccd17505e04e344ff2ff81254c6f044ca8fd45a60895aa53ef9edcef","observation_id":"cc421c45-9586-4933-bc57-32dba69ac8cb","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:5fa5ad7a7f40fbc8d5ab389818a7d6f2462cd22c56b842686b2c13f8b1ca69ed","observation_id":"78ccc18b-dad3-48f5-8fd8-2b05e1246ce8","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:9b06f4136459cb6e8d9347c14cecf8f3d9be4f4cedc0b297ab4c177cc9092277","observation_id":"2d5cde8c-4c29-488e-a4a4-98805a57bbaa","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Adapting Fréchet audio distance for generative music eval- uation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:c87068cad9f7271f4d9ca7ae7b5f076c5d16f0b6377d18e70510e8611a0a1239","observation_id":"0921a447-7848-4038-a8ab-6309bdfd3484","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T19:21:14.835962Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2607.03806."}