{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a6b7b4926fe385e0cfee8a2d4bad8032189808c7a842b47e35f71983d7ef609","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:43.372701Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:43.249937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:46:15.415472Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-08-07T12:01:43.249937Z","title":"This framework enables good word error rate (WER) performance, strong com- pression, and high-quality reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.249937Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:824b9fe906300635baa496353ec8cffb757994ae77db8741085df5dcc1d9ebb4","observation_id":"8bd3210c-2a8c-4609-9fee-b50842449518","resolution":{"observed_at":"2026-08-07T12:01:43.249937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":"2506.00843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hasrd: Hierarchical acoustic and semantic representation disentanglement","venue":null,"work_id":"a0d49889-3d32-47ae-ae72-329c81bc0f86","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:01d90be90c6235c4ba9054ccfcc8830b543fa4e9063b964fd2c524c615eec335","observation_id":"da8f0ff8-c3eb-4a88-8fbf-6acdd6e5f6ab","resolution":{"observed_at":"2026-05-11T19:46:15.417161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":"2506.00843","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hasrd: Hierarchical acoustic and semantic representation disentanglement","venue":null,"work_id":"a0d49889-3d32-47ae-ae72-329c81bc0f86","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:9a4abe28793f22c425f2f0cf579b88522dff00fe3a42cdcfba087fe2b85790f2","observation_id":"98a9678c-94cd-430a-88af-17b774c73b52","resolution":{"observed_at":"2026-05-11T00:50:49.653335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00843/citation-record","integrity":"/paper/2506.00843/integrity","json":"/paper/2506.00843/citation-record.json","paper":"/paper/2506.00843"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.867466Z","title":null,"venue":null,"work_id":"e4a18197-0a8f-46c9-8cce-9961f35314c5","year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.240637Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:dd0894d7646db3932c53327688f660db65c7ce2da2bae81ec73d5fb157427bf2","observation_id":"db0b3957-29f6-4b6f-b8cd-57d4aaa09ccb","resolution":{"observed_at":"2026-08-07T12:01:43.870474Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.857515Z","title":null,"venue":null,"work_id":"d855736c-67a3-42ef-8fc1-5177a41760b2","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.244948Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:039f397fd1abc570c096f5f9aeeb3893a9d048617c3562a721b52f2b9e38303d","observation_id":"b4929345-79bb-4128-8beb-68d305901ca9","resolution":{"observed_at":"2026-08-07T12:01:43.860707Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00843","snapshot_observed_at":"2026-08-07T12:01:43.249937Z","title":"This framework enables good word error rate (WER) performance, strong com- pression, and high-quality reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.249937Z"},"links":{"cited_paper":"/paper/2506.00843","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:824b9fe906300635baa496353ec8cffb757994ae77db8741085df5dcc1d9ebb4","observation_id":"8bd3210c-2a8c-4609-9fee-b50842449518","resolution":{"observed_at":"2026-08-07T12:01:43.249937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.847170Z","title":"For acoustic training, we adopt the DAC framework [16], extracting random 5-second segments (vs","venue":null,"work_id":"b6b9bd4a-3218-45e1-9bc0-db993be4bd38","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.253983Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c36673308cc19afb2f08db464c037192b8296e67eeb370fe7ee935a7ed8a4b31","observation_id":"eeba0d67-d4b5-4d19-b4af-2ae36ba30a39","resolution":{"observed_at":"2026-08-07T12:01:43.851385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.836700Z","title":null,"venue":null,"work_id":"d14ab154-b803-435e-a90d-f4e6c5e8ed6d","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.258313Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:763d2f351552a2b83a1ce0c1c608352a0e0edc4012871e3521f4cff1e1589ce2","observation_id":"82947716-31aa-43ff-bbdf-3dc0d1a48e89","resolution":{"observed_at":"2026-08-07T12:01:43.840244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.825004Z","title":"Our approach effectively preserves semantic performance for ASR while achieving reconstruction quality comparable to state-of-the-art neural audio codecs like DAC","venue":null,"work_id":"0adb8beb-6afd-44c3-83a5-2f8102c08455","year":null},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.262122Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:ae982f09eabd84934645d81f9b1f1866f411cbcfd79f3aa3bfd1349d3b6a0dae","observation_id":"1e0b5dee-e1bc-4f0a-8c5a-9f05b98671d7","resolution":{"observed_at":"2026-08-07T12:01:43.828795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00800","last_updated":"2024-09-01T18:29:45Z","snapshot_observed_at":"2026-08-06T16:38:12.074592Z","submitted_at":"2024-09-01T18:29:45Z","title":"Comparing Discrete and Continuous Space LLMs for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00800","snapshot_observed_at":"2026-08-07T12:01:43.265309Z","title":"Comparing dis- crete and continuous space LLMs for speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.265309Z"},"links":{"cited_paper":"/paper/2409.00800","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:2874d89c4a072b9f2ad5b81fe0be098233b9876131fe993c9945df6fb83670a6","observation_id":"0da11723-e0cd-4d2b-9188-999a55a0e457","resolution":{"observed_at":"2026-08-07T12:01:43.265309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.810666Z","title":"AudioLM: A language modeling approach to audio generation,","venue":null,"work_id":"4506d07c-6dcd-4110-9827-e8a75a0b21bb","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.268694Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:ab3c338110be0a3d6d89daa7749e802548794857db2632424829533deefaf002","observation_id":"aa2e66cf-500f-461a-a0b3-adc34cf2a18f","resolution":{"observed_at":"2026-08-07T12:01:43.816128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.272054Z","title":"A survey on speech large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.272054Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:a3139a662ba3db23fe7934148e2f2616193ae3bf63d7924fc6b809a99add001e","observation_id":"2693840c-85e6-414a-85aa-b7687e230ab6","resolution":{"observed_at":"2026-08-07T12:01:43.272054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.796674Z","title":"SpeechGPT: Empowering large language models with in- trinsic cross-modal conversational abilities,","venue":null,"work_id":"4d9ce960-b8c8-4e44-8010-6f55d9d24672","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.275346Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:034fd365fea8e6f0d31fd43045c17d2dddc2ed2a8a096c092227f73bdccfa28a","observation_id":"99b8b4a1-1f61-4892-aff3-7334e25a17f6","resolution":{"observed_at":"2026-08-07T12:01:43.800601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T12:01:43.278401Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.278401Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:5ad6f57e19d57c3942e2ead0459e85ba112be1c3c520f86d585a13f6659525b6","observation_id":"8267a6c4-ff08-4903-b453-4e3fed29d9db","resolution":{"observed_at":"2026-08-07T12:01:43.278401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.785702Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A comparative study,","venue":null,"work_id":"912a6640-06b1-4861-9659-84c133c54bf8","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.281631Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:85f5bb5058926fe69cf9a87b0765e6f4f3d442a39ca8f412f0f64331e01a103c","observation_id":"7f951cb4-542c-4b3a-b069-28b70dc236dd","resolution":{"observed_at":"2026-08-07T12:01:43.788909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.776115Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"b952276d-3593-4ea0-8fcb-7bd1d21dac16","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.285176Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:cf009bf2f9fff67c7153b9dba8e8c39950c358bdb23402e4d9782fb37204d1cb","observation_id":"a28f4ebe-6fac-4bd1-9202-ff7f9a27a104","resolution":{"observed_at":"2026-08-07T12:01:43.779218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.767214Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"85313746-88cb-4ea6-ae97-dbf25ca6e443","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.288493Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:932f0adaca55bff484fcae867b01c256d4cdb7500f13ed10e9c0b787ebe8cff1","observation_id":"62870af1-70b1-4e6b-add9-e5cae4802663","resolution":{"observed_at":"2026-08-07T12:01:43.770201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.757351Z","title":"W2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre- training,","venue":null,"work_id":"fecfbef8-8fb1-4cd7-980d-7b30e84b57b1","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.293070Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:2644eadf950be3091c5e4cdcc9aea50a24dfda3eb2947bcba60456cff6aa16a3","observation_id":"39eac272-4f3c-464f-ab0c-9e0b666e396d","resolution":{"observed_at":"2026-08-07T12:01:43.761050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.747251Z","title":"Ex- ploration of efficient end-to-end ASR using discretized input from self-supervised learning,","venue":null,"work_id":"990e901b-4118-43f0-b081-a48eba40e414","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.297026Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c3af70790a48e15c890fcd323c836ae3f96b921c9d3431c81c4165558a311962","observation_id":"b7bc03b7-2eb0-481f-9ebb-67c954e0e0d9","resolution":{"observed_at":"2026-08-07T12:01:43.750837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.737805Z","title":"Speech resynthesis from discrete disentangled self-supervised representations,","venue":null,"work_id":"dd5b9b0d-b815-4655-bbac-05b73bc1645b","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.300050Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:2b2f9bb70022e6f311b25e59ea9713de0c13d1f7342bb45f43fa7879530a4479","observation_id":"63762711-6ffb-4f12-9c90-beb58a970dd6","resolution":{"observed_at":"2026-08-07T12:01:43.740820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.727533Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":"12f391d8-9e8f-4594-913b-8860c0ea2e2d","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.303897Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:88d5871ba279aff8e2a851920f217c4248128d5933f2cd9da4e3a1291f3c18ce","observation_id":"1debd9fd-98c2-4a19-af30-efeb8f8a53c2","resolution":{"observed_at":"2026-08-07T12:01:43.731052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.716454Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":"81255d95-e70f-408e-a0c7-bd7903fc3055","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.307670Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:a822ab6053d0d3024db2d666c8e2d7361590557c5cbdaf20dd115b6a72ec6ed9","observation_id":"ad690667-0ceb-4340-948d-a5881e8ed5dc","resolution":{"observed_at":"2026-08-07T12:01:43.720715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:01:43.311743Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.311743Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:bcb7c885d5ee2454b6ac74de600d3d184d8122bb73c7179c4fa0bf15f836077e","observation_id":"14e5435b-bbc6-4a45-84ca-5fc60c5ad807","resolution":{"observed_at":"2026-08-07T12:01:43.311743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T12:01:43.315618Z","title":"Moshi: A speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.315618Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:967c022987ffcc860304860dcf9548a2250b0325feb9112f2ac64db1d7d29e7e","observation_id":"1bec4980-6a30-4924-a5a5-417b5b962cdc","resolution":{"observed_at":"2026-08-07T12:01:43.315618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.704846Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"19d87de9-7405-409f-89e6-77782e607a02","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.319166Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:00405d75a1c69dfab11de8793b96fed12a9dc29b64bbc87c8203550e8a01315e","observation_id":"69d89b07-bf94-43c7-b1d9-5e91394365e4","resolution":{"observed_at":"2026-08-07T12:01:43.708488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-07-06T19:08:09.037019Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T12:01:43.322223Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.322223Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:432cbb5121d03863ca944f6fa1343340797d2042a4e7d827f96ae08a2d6e653f","observation_id":"5b674017-f082-4303-b5d2-94a79dfa57b3","resolution":{"observed_at":"2026-08-07T12:01:43.322223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16147","last_updated":"2025-09-10T13:42:20Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T07:14:26Z","title":"QR-VC: Leveraging Quantization Residuals for Linear Disentanglement in Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16147","snapshot_observed_at":"2026-08-07T12:01:43.325585Z","title":"SKQVC: One-shot voice con- version by k-means quantization with self-supervised speech representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.325585Z"},"links":{"cited_paper":"/paper/2411.16147","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:3b48b3848928042ecddcdcf6d43c07ba3f6098b7411d576e0815f85842df0830","observation_id":"2c5d41c7-f072-4f97-8fc0-eb203deab3ff","resolution":{"observed_at":"2026-08-07T12:01:43.325585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.694036Z","title":"MMM: Multi-layer multi-residual multi-stream discrete speech repre- sentation from self-supervised learning model,","venue":null,"work_id":"6741ad07-03ca-443a-a5e0-48a6715243a1","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.329456Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:1cf20adea039c4f25b4673a8b237b6381aaa00bae9df35585e3fe4d4bf9b0476","observation_id":"ac8b6874-1279-488e-ab19-fcd25f5d331f","resolution":{"observed_at":"2026-08-07T12:01:43.697823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.683642Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"4eb69515-c629-47bc-814c-af791f32fda6","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.332570Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:7414a07041a96f9bb718bd3b469e63bf83ddcc2cdda9c1c12edd48c950d34506","observation_id":"9550b58b-0ce6-43f0-9933-47545d4125e1","resolution":{"observed_at":"2026-08-07T12:01:43.687447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.671548Z","title":"ReVISE: Self-supervised speech resynthesis with visual input for univer- sal and generalized speech regeneration,","venue":null,"work_id":"4eddb75e-352a-488b-a11a-0164f08a4d81","year":2023},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.335931Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:b4d835b18f705e11cc9e23c59d8858e623e8593e1a14fd193225c01e2707eea2","observation_id":"5229250d-6dd1-4705-8258-566427df1879","resolution":{"observed_at":"2026-08-07T12:01:43.675974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.660689Z","title":"Self-supervised disentan- gled representation learning for robust target speech extraction,","venue":null,"work_id":"8af8861c-1bb6-4b59-9ecd-d54cf7aa8363","year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.339284Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:f754f8be2aded8b2aaca1318e6e3108de986b9d29e559c9fecc7252a13a6d2ed","observation_id":"c93f827d-aab7-45c8-ab08-d67d4ec6893a","resolution":{"observed_at":"2026-08-07T12:01:43.664679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.650635Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":"fa133539-8617-4eeb-8860-19355cf99911","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.342683Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:11f629f3f05c611f1c26368eb92966a36b0d3ede3004a44735f0ee75a45d4565","observation_id":"5457c13d-fa21-4af3-aece-434aff075c76","resolution":{"observed_at":"2026-08-07T12:01:43.653509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.640233Z","title":"Self-supervised learning with random-projection quantizer for speech recogni- tion,","venue":null,"work_id":"7281a7cb-6354-462b-84c3-0a9f21ed5182","year":2022},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.345879Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:0e654a1cdfe1643170d49e7d97f233d701881e665c9207bc31790c3b07c4ac96","observation_id":"1c0dc1e9-17c3-4a52-841d-b2ddf644724c","resolution":{"observed_at":"2026-08-07T12:01:43.643567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.629279Z","title":"Mel- GAN: Generative adversarial networks for conditional wave- form synthesis,","venue":null,"work_id":"3441c396-3911-4e5f-8265-3677c1721a1f","year":2019},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.349431Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:1694c66b196b601b5c202dfb96f8b1256aa285621c56bdb62e6bf3b272cbcb52","observation_id":"7cbdc036-e0b1-4139-b856-a6d2a7927a1a","resolution":{"observed_at":"2026-08-07T12:01:43.633237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.353811Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.353811Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:e1ddfe6ad8ddc0c4547a7f70f61571d0fc591e34d8d41946abf3508ee1b20b31","observation_id":"46499834-a384-4020-954c-719ab49dde7d","resolution":{"observed_at":"2026-08-07T12:01:43.353811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.612812Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"2ef6ed5b-57ba-4405-b5b4-e4824a5ddb4d","year":2015},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.357062Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:817a83b514ec76f80ade8940996ce8a2aef7606a0b7dd694298d0bb6b2c47499","observation_id":"8f28f306-a4f7-4dee-a2c4-9d2e8bdd0af8","resolution":{"observed_at":"2026-08-07T12:01:43.615831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.602154Z","title":"Lhotse: A speech data representation library for the modern deep learning ecosystem,","venue":null,"work_id":"78bf0e5e-b604-4d00-b3c7-b1e874057685","year":2021},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.360747Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:3fe19eae6aa9ab9167f85d06f2be1ce7094e0e7507855a4bf410d373aba06844","observation_id":"13b65055-9954-4a90-baa7-7cd5312b1987","resolution":{"observed_at":"2026-08-07T12:01:43.605540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04296","last_updated":"2024-09-04T10:23:04Z","snapshot_observed_at":"2026-08-06T07:28:46.309465Z","submitted_at":"2024-05-07T13:11:37Z","title":"Open Implementation and Study of BEST-RQ for Speech Processing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04296","snapshot_observed_at":"2026-08-07T12:01:43.364043Z","title":"Open implementation and study of BEST-RQ for speech processing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.364043Z"},"links":{"cited_paper":"/paper/2405.04296","citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:375b84e64c023f1278b429cab95e9e63acf02c747233b989cec79736590f2ad9","observation_id":"e29dcf14-9587-42e5-ac29-b1656da52e00","resolution":{"observed_at":"2026-08-07T12:01:43.364043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.591448Z","title":"Con- nectionist temporal classification: Labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":"520ecab4-0529-423a-a8eb-78c4fd4f260c","year":2006},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.368593Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:c576dfcaa09e1289bc018fa81971d9cae9ecad0acb269f3009c2d88672d3fe36","observation_id":"a8a9fc1d-9240-4912-9dd7-2837dee109f3","resolution":{"observed_at":"2026-08-07T12:01:43.595072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:43.579032Z","title":"ECAPA- TDNN: Emphasized channel attention, propagation and aggre- gation in TDNN based speaker verification,","venue":null,"work_id":"b5e04908-a0a8-4ac7-805b-b164c46ee304","year":2020},"citing_paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:43.372701Z"},"links":{"citing_paper":"/paper/2506.00843"},"observation_digest":"sha256:e9bcfe8c0321e6ebb6b804c4d47224eff98267ffe154f22d27af6976ba0536c2","observation_id":"d64d0e91-ea06-4e9c-87b0-c57f1cf42165","resolution":{"observed_at":"2026-08-07T12:01:43.584006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00843","last_updated":"2025-06-01T05:38:39Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:54:34.368733Z","submitted_at":"2025-06-01T05:38:39Z","title":"HASRD: Hierarchical Acoustic and Semantic Representation Disentanglement"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2506.00843."}