{"as_of":"2026-08-07T23:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac27ec3f2246fbdbc62cc7fd1c0b9b74c1db81e26279d15cb20a6413eec2c063","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:42.730075Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:38.143308Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:58:08.378519Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-08-07T12:29:38.143308Z","title":"Model Architecture The overall framework of our model adopts a non-mirrored ar- chitecture, as illustrated in Figure 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.143308Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a19a6f9c676ec3c84a40c9addc0069d504b270f2e3ab6c269e2896d4f4010ca6","observation_id":"76b3dc45-1f91-4739-b897-3356dcbba6c3","resolution":{"observed_at":"2026-08-07T12:29:38.143308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":"2505.24314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-07-03T12:58:08.378519Z","title":"Ds-codec: Dual-stage training with mirror-to- nonmirror architecture switching for speech codec,","venue":null,"work_id":"391e75f7-4374-49d2-9005-2e560921b711","year":2025},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:92e4d01fa18f1591cf4bc336067f2e979ba21cc9dc607d867fb5f419e73d433c","observation_id":"8fceee68-b136-429c-92a9-30fb9d09d7bd","resolution":{"observed_at":"2026-07-03T12:58:08.380228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24314/citation-record","integrity":"/paper/2505.24314/integrity","json":"/paper/2505.24314/citation-record.json","paper":"/paper/2505.24314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:45.328674Z","title":"A pivotal challenge is the transformation of continuous speech signals into interpretable representations suitable for inference and training within large language models","venue":null,"work_id":"616b5d87-cbf3-47c7-930f-29d7380bf293","year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.015315Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:32a9e264336421dda08e48abb0fd420a3cf24f1a94a92d720e1531f46d27ac1c","observation_id":"2fa164f2-80ec-4a8d-b819-b94dfee2e5c0","resolution":{"observed_at":"2026-08-07T12:29:45.426994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24314","snapshot_observed_at":"2026-08-07T12:29:38.143308Z","title":"Model Architecture The overall framework of our model adopts a non-mirrored ar- chitecture, as illustrated in Figure 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.143308Z"},"links":{"cited_paper":"/paper/2505.24314","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a19a6f9c676ec3c84a40c9addc0069d504b270f2e3ab6c269e2896d4f4010ca6","observation_id":"76b3dc45-1f91-4739-b897-3356dcbba6c3","resolution":{"observed_at":"2026-08-07T12:29:38.143308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:45.118824Z","title":"Dataset and Metrics We use LibriSpeech [27] to train the speech codec we proposed","venue":null,"work_id":"9c5e201b-8b64-483c-a147-cea599b5580a","year":2000},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.356758Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:8d6f69e383aa002e2c1f39cfdca6015cd45d6ee3e551dc4c0c1e00414e8c9b08","observation_id":"c0c0a5dc-6434-47c6-b322-762abc0e66cd","resolution":{"observed_at":"2026-08-07T12:29:45.216566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.921212Z","title":null,"venue":null,"work_id":"9df4bcdc-9abd-48cf-b7f4-16b2031b2f10","year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.550836Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a413c12a208bab59745f65ea4bbecb605a965ee59325af87e56d72c68b227254","observation_id":"50daa269-e8bb-427e-85fa-e338e3a0802c","resolution":{"observed_at":"2026-08-07T12:29:45.003225Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:38.724956Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.724956Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:576daebaf086aa883b501f584732d48d9550f6e5a38e12454cc913ae402dca92","observation_id":"135c561d-84a1-4b24-ad73-6fd213a3eb8b","resolution":{"observed_at":"2026-08-07T12:29:38.724956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:29:38.877708Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.877708Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:969f78dbda72822615dbd28128672cfe312566b453d02638e26cef364ee6626f","observation_id":"c93301bc-58d4-4e4a-895d-74c5133d163b","resolution":{"observed_at":"2026-08-07T12:29:38.877708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T12:29:38.995350Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:38.995350Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:b10a02f0ba417f22ffb8717b56dd2c0f8d403b1eb62922f3953b6459498be80f","observation_id":"df8710a3-de5f-4dc5-a521-9e6086b4050e","resolution":{"observed_at":"2026-08-07T12:29:38.995350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T12:29:39.170430Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.170430Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:facfc60f8232ed6f4d254f2675dbe3c3453d9f5c9c63800d32c7415aedb58d78","observation_id":"66668e64-fd4e-4e02-80ef-9a0e7aedb0c6","resolution":{"observed_at":"2026-08-07T12:29:39.170430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.703422Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":"c71ba3f7-d28c-4a3a-bec8-03106216e0b6","year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.311348Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:657d39c583d576638c7ca593d5308d78314b6a5320e66b31d647348f178e17f3","observation_id":"4d20e720-c46f-429d-940e-18ebc9537d45","resolution":{"observed_at":"2026-08-07T12:29:44.799493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T12:29:39.487610Z","title":"Audiogen: Textu- ally guided audio generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.487610Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:20baa83f7fdf6459348580619d123e819202e97a52f718bd380be80540332cc4","observation_id":"dd6f89eb-99a1-4a4f-b2c3-2541d03efd3c","resolution":{"observed_at":"2026-08-07T12:29:39.487610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.412900Z","title":"Slim- speech: Lightweight and efficient text-to-speech with slim recti- fied flow,","venue":null,"work_id":"d2aa0a18-c230-47d4-802d-17fc58852f15","year":2025},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.605523Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:0c6bb37b34495daf7c05393fd7bbe2aab43cfda7ff642bec3db414e7ccf0c387","observation_id":"52a05e72-d8c6-460b-8948-185223fca620","resolution":{"observed_at":"2026-08-07T12:29:44.553668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:39.703511Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.703511Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:955c0429323e4fed568ca34f12063a6669e642a5f494a38a5fff964fe6b6a4e2","observation_id":"8aed8f60-4168-402d-833e-330fb7cca6b2","resolution":{"observed_at":"2026-08-07T12:29:39.703511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T12:29:39.796888Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.796888Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:4001203ff3feefff8a27549beebbe6584eed77060f103c044ccbc909bb531107","observation_id":"e7f091b9-a0e6-4a24-993f-f5a1d4d7890b","resolution":{"observed_at":"2026-08-07T12:29:39.796888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:39.892248Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.892248Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:efa92775600ddca561cfb2b93c2ad6541d0da5dd0c1d3094bb4caf4c5452a239","observation_id":"7fbe07b5-6546-48b6-b90f-3772504bdf95","resolution":{"observed_at":"2026-08-07T12:29:39.892248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:44.203132Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":"8fd2f2c3-7c4b-4e45-a05e-875c0e01a23b","year":2017},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:39.994883Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ed77b6d859830a25dac8de298b5e0f890de73b68e69224cf418b47f33de99741","observation_id":"78a5e2e8-1abb-47ea-85e7-721a5bb96f9d","resolution":{"observed_at":"2026-08-07T12:29:44.307824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.070603Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.070603Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:df1dea69cc78506cab8d49efe17095b3984671d15cc060ede2b4a905fc552293","observation_id":"2523b863-a545-4f77-a382-86958b415664","resolution":{"observed_at":"2026-08-07T12:29:40.070603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.192413Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.192413Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:3dbd18ecd8a5354fe8f18c356ab95f938a6986bc84255e6ab393455a252e8f69","observation_id":"c6b6e291-50a2-419b-bda5-1d403f010a1e","resolution":{"observed_at":"2026-08-07T12:29:40.192413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:40.359010Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.359010Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:a609d6562850192e8ca70989cb2bb6ac098a3dde3a451a4d410ac77d5bb5dbef","observation_id":"4f05c427-1b02-471e-9010-8995781d9162","resolution":{"observed_at":"2026-08-07T12:29:40.359010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T12:29:40.426238Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.426238Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:f9b3d41e19a76846291c6914a52579b22129ff59c95c5802dd930b1ae8617e89","observation_id":"e7be356b-fd57-472e-a7d5-42ef4f47fad2","resolution":{"observed_at":"2026-08-07T12:29:40.426238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T12:29:40.551229Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.551229Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:5197cee34a047e83a7419c47afb6568dc1301bc6ffcb57f683d21832f53a65cf","observation_id":"25530ef0-39a0-44ea-99d3-c96a65232ecd","resolution":{"observed_at":"2026-08-07T12:29:40.551229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T12:29:40.695004Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.695004Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ad6b46c660fe1bf9216119143dbf9073d67be646df813a4f9560761c9c22a539","observation_id":"be0e75f5-0f79-433d-a3df-d9d60d153304","resolution":{"observed_at":"2026-08-07T12:29:40.695004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-07T12:29:40.791796Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.791796Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:2f61d8cdac23cc9f1f39d4853343232db3c5b6992c98fee3de82adaa1ca7fd73","observation_id":"18ce0122-83d8-410c-a52c-5e72d928fc6a","resolution":{"observed_at":"2026-08-07T12:29:40.791796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-02T08:47:14.659563Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-07T12:29:40.894154Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:40.894154Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:32173172f3cb8cbb14ea6144b2d9ba183a1861af2d3aa05829ea7c1895f04828","observation_id":"dd699265-cf72-4969-8c57-dfa127b10c6c","resolution":{"observed_at":"2026-08-07T12:29:40.894154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02940","last_updated":"2024-06-05T04:54:49Z","snapshot_observed_at":"2026-07-06T18:25:40.229186Z","submitted_at":"2024-06-05T04:54:49Z","title":"Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder","version":1},"cited_work":{"arxiv_id":"2406.02940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02940","snapshot_observed_at":"2026-08-07T12:29:43.045306Z","title":"Addressing Index Collapse of Large-Codebook Speech Tokenizer with Dual-Decoding Product-Quantized Variational Auto-Encoder","venue":"cs.SD","work_id":"7d74a2f7-c4b1-4ab8-9cc5-c632687abbe7","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.008351Z"},"links":{"cited_paper":"/paper/2406.02940","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ab716331ba9009885acf54f1239f5582053db9a733625ca5bf2c90eec0222218","observation_id":"9bd0c454-47d4-4e4c-a0f1-a5ed8524626a","resolution":{"observed_at":"2026-08-07T12:29:43.140544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T12:29:41.168284Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.168284Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:441118901709996527cb3d8c6c6c5da0c76ba843016fb07809e344e2461fdf7d","observation_id":"446a5104-842b-467a-b0a4-d240d0b57b5b","resolution":{"observed_at":"2026-08-07T12:29:41.168284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.272611Z","title":"Neural networks fail to learn periodic functions and how to fix it,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.272611Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:56cb4fe31136c9b03d32ab0ed7cde3d48c5dba48e308c857af7cf05f5bd234b8","observation_id":"e4799653-6b8b-4791-8dde-31578b37c5f6","resolution":{"observed_at":"2026-08-07T12:29:41.272611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:29:41.423921Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.423921Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:18e0a8582eba5521b88184aec6d8cfe7c8e0ee1a8791532b33889475d488219b","observation_id":"88b08a74-0353-4fc9-bb31-d1c8306b6e77","resolution":{"observed_at":"2026-08-07T12:29:41.423921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.569951Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.569951Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:e889d8342d163db535b24d3db12aea640b07ab74b5d7f17e36be17845bca279d","observation_id":"ea8bc6fa-13d4-4dc6-b9ed-2dc502f00316","resolution":{"observed_at":"2026-08-07T12:29:41.569951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T12:29:41.764813Z","title":"Vector-quantized image modeling with improved vqgan,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.764813Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ffb96a88beae4ca68c9b3cfc0f2f8682e3a98d03ec78c4158a368373d012406e","observation_id":"72a21425-ef2f-45e1-b045-18c894474aed","resolution":{"observed_at":"2026-08-07T12:29:41.764813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:41.908267Z","title":"Product quantization for nearest neighbor search,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:41.908267Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:ba77157c7c8b2513d5c63488f7da84474fb6f3c0830a4eef1d0ede478eee1c8a","observation_id":"d7dfcef2-cb64-443f-964a-127c625c7164","resolution":{"observed_at":"2026-08-07T12:29:41.908267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:43.885810Z","title":"Apcodec+: A spectrum-coding-based high-fidelity and high-compression-rate neural audio codec with staged training paradigm,","venue":null,"work_id":"86c0a341-22f9-4dcc-b124-40e42bb90701","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.045168Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:b54a0c7edc225eef9f35bac294e53a0861ef45fee97a17aea91fe221e624308b","observation_id":"4d360477-8cb8-4fd3-8c03-57363716f9aa","resolution":{"observed_at":"2026-08-07T12:29:44.001741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:42.189677Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.189677Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:d8880bdc9f00514766844838b0bd83b8ef15d76611f52096a4a15728b77a91b1","observation_id":"78882b71-3869-46ee-be91-9f552fe4d393","resolution":{"observed_at":"2026-08-07T12:29:42.189677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-07-06T15:36:41.266003Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-07T12:29:42.327056Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.327056Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:24c1b775560073c0fdf5f5c138d36f5dad5b3b73a0d6734d684ba3f461b2e126","observation_id":"f7213156-5f1e-49bc-937f-5e62869b6ad6","resolution":{"observed_at":"2026-08-07T12:29:42.327056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T12:29:42.472159Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.472159Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:0d164bd3c5ff74135695cacd78996fa93a7ef4868999458e46e608d1927276a0","observation_id":"e454bdb2-bee3-4c12-b1ac-760223fe8ed8","resolution":{"observed_at":"2026-08-07T12:29:42.472159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:42.622160Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.622160Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:55d1596669d5da91f8edc6ce2b95fb37c92dde6fbf708fac1ea753404fc89dbe","observation_id":"59040c31-6b56-4635-ba6f-3724689adf01","resolution":{"observed_at":"2026-08-07T12:29:42.622160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:43.647537Z","title":"Fewer-token neural speech codec with time-invariant codes,","venue":null,"work_id":"8e067387-f109-4d15-bf4d-3663e8121ff7","year":2024},"citing_paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:42.730075Z"},"links":{"citing_paper":"/paper/2505.24314"},"observation_digest":"sha256:0d063dcf21be829b78fcd3111dedf64d28ed1304e9a57db78570da3775813a22","observation_id":"83dbc189-7a8e-4ccf-b0a1-1a46cc871e63","resolution":{"observed_at":"2026-08-07T12:29:43.717631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24314","last_updated":"2025-05-30T07:53:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T16:55:51.904027Z","submitted_at":"2025-05-30T07:53:01Z","title":"DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2505.24314."}