{"as_of":"2026-08-06T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5cdf74d445be8f86dbc7efe8141b54a4a7282f8daca64853be1cf8c251c8bbeb","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T03:57:38.298693Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06407/citation-record","integrity":"/paper/2605.06407/integrity","json":"/paper/2605.06407/citation-record.json","paper":"/paper/2605.06407"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations.Proc.NIPS","venue":null,"work_id":"d92e292b-636e-4c2a-8a6d-02ce066d3b4d","year":2020},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:9dfa827467898926a1ca9c84252183633d61b19f4ef30ac4153af115c865b2dc","observation_id":"1a5b5db7-b8e1-4500-a3b8-e1e22eb9396b","resolution":{"observed_at":"2026-05-26T21:28:22.811214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semanticgen: Video generation in semantic space","venue":null,"work_id":"4e579b51-7b70-47e2-b15d-7dd9dc2e82ec","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:b2820d22a5a59b5b780401db07655b406344ebe00c747e4679ff8b8146743158","observation_id":"0b4fa7bb-89d3-4046-8aa2-64ea35599fd8","resolution":{"observed_at":"2026-05-26T21:28:22.806449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dino-sae: Dino spherical autoencoder for high-fidelity image reconstruction and generation","venue":null,"work_id":"29408f33-4539-4483-a8c7-d058feb1404b","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:eae0515bbe867e74f98ba9fb03fc95af51e938836548a6bdd7b3676a252a342a","observation_id":"5567082c-745b-434d-8021-3dec5a131289","resolution":{"observed_at":"2026-05-26T21:28:22.793701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning visual foundation encoders to tokenizers for diffusion models","venue":null,"work_id":"878be8fa-40a7-4431-99d4-729fe835ca31","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:83b969cf52def46bb852637ac6fee03218eb786fe5150c903e93d2aada423648","observation_id":"5b4c785c-d610-4ca8-801a-7025db119237","resolution":{"observed_at":"2026-05-26T21:28:22.775224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing.Proc.JSTSP","venue":null,"work_id":"a3f7b24a-62d3-4595-b8c9-7ac7909febf5","year":2022},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:2c8ba2329e4d94a00cea946bdc09cdad1b4c9de75c2342a28ea1c78d3cd0b351","observation_id":"a7981266-e00d-4c78-93b1-4050edcec904","resolution":{"observed_at":"2026-05-26T21:28:22.771771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":"f6cf0aa4-e2ee-4409-ad4c-3e68ece97d44","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:8f8f2a4db46d12a506baa66a134f4f2297bc57bfb75dfb3b03fee2f4b87f4b25","observation_id":"cdc84f77-62c6-4362-8f66-e0bb374087ce","resolution":{"observed_at":"2026-05-26T21:28:22.778667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale self-supervised speech representation learning for automatic speaker verification","venue":null,"work_id":"60742298-ba16-4f37-b176-260b683e22f0","year":2022},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:567cc1a03e9647fe65f15b14dc849f50f18ccb829cc96c0ce7b0691aa447c137","observation_id":"1d4b5985-8f0d-49fe-9ba2-468c013fdcbc","resolution":{"observed_at":"2026-05-26T21:28:22.764782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the distillation loss functions of speech vae for unified reconstruction, understanding, and generation","venue":null,"work_id":"9a6a3c6f-aa5c-4b0a-a5bb-a58395462f2b","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:78c23ad4acd74011b1a927fd8cd169a66af1c40433324408c9e230274223e5e8","observation_id":"f89d1a5d-f419-47b1-8823-3a8a06858779","resolution":{"observed_at":"2026-05-26T21:28:22.710147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":"42ce59a2-5d5c-44ee-9122-47eacdc8774a","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:26cdaa466c0cb0ae2ea3723e11b6f2b5726360c50504e409392b4c0c5ef189c9","observation_id":"72c49639-6ed0-4037-8d83-073618180500","resolution":{"observed_at":"2026-05-26T21:28:22.713185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dashengtokenizer: One layer is enough for unified audio understanding and generation","venue":null,"work_id":"1c24eaff-a57b-4f1b-8ca0-9ae198903fa6","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:8f327f93d813562ec139883724fbfccac863c9e305c1a11474e93020bee4bc64","observation_id":"3acfc358-8e54-4a0f-baa5-9e983f9ab79b","resolution":{"observed_at":"2026-05-26T21:28:22.761462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RePack: Representation packing of vision foundation model features enhances diffusion transformer","venue":null,"work_id":"dfa70a72-2ad1-4f19-900d-6468958388a0","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:362578cc92563f2987d3d97f06502fb131d2cd770dd2492c0026f7bdce5857f4","observation_id":"47a5ce0d-6d48-441d-ad9e-c73dcd679740","resolution":{"observed_at":"2026-05-26T21:28:22.768413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqrae: Representation quantization autoencoders for multimodal understanding, generation and reconstruction","venue":null,"work_id":"98bf6f79-c8c4-4e4c-bb4f-efad034134b8","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:b53502140a2fc60867f4326dbaddffdc2bc6cc8c050de0969d58d65267a608f1","observation_id":"353da288-f00d-4c7c-82e4-05118952e1d6","resolution":{"observed_at":"2026-05-26T21:28:22.782309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":"e77de3ea-bdac-43cb-afe2-27a348ff43ea","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:4c89daaf1ae06e098860e39639520a647ae8170f87105d9300f4951a1e7826ee","observation_id":"0ef03bc7-bb72-4882-b7ca-15ef767d6c2f","resolution":{"observed_at":"2026-05-26T21:28:22.785861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":"cdd67533-2da9-4f2c-a83c-865caaa27060","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:61fea9504033154b8808f2d26eaeae3410e2b5e0e7b5e4089149eb0d0b4a7842","observation_id":"ee5c5b21-5cb8-40f3-a5ba-329e68b0eb97","resolution":{"observed_at":"2026-05-26T21:28:22.789668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":"37b74c4a-a914-4d13-89da-e7a06dd939de","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:503a4d51d9789d9564e5cf1e5b5522d6bba2deccc14defe11398a0591111e38d","observation_id":"b34e2d68-2dea-4b97-bb10-76e40495fc58","resolution":{"observed_at":"2026-05-26T21:28:22.820045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable audio open","venue":null,"work_id":"63c95fb0-cb65-48e1-b52d-cd81bda05706","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:e447b240e1996d03f6f87cda1e4cf1509c1d7c5d5bcde5631e306534f27b1b82","observation_id":"3c21039e-63ef-429a-b36a-5b8deb1eb1e9","resolution":{"observed_at":"2026-05-26T21:28:22.861520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified autoregressive visual generation and under- standing with continuous tokens","venue":null,"work_id":"e1448b1b-1c37-4f36-95ad-71bc5d43539d","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:ba2b711a43834a5c385efa8e81c1cd9078a6be3a2df6e4b1b3e7f8dd8c35e608","observation_id":"c876adfc-0a34-4e5d-9d48-ceffa4fb810a","resolution":{"observed_at":"2026-05-26T21:28:22.743188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The prism hypothesis: Harmonizing semantic and pixel representations via unified autoencoding","venue":null,"work_id":"db724a0f-7c41-4bfd-849a-865bc80e1542","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:c6ab95ac993ac2890c44a615b204cfe8a8043f58a889b9e82114f31fe745106e","observation_id":"8ffc97e6-beab-49b3-8f52-0b89a3d59fff","resolution":{"observed_at":"2026-05-26T21:28:22.852504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One layer is enough: Adapting pretrained visual encoders for image generation","venue":null,"work_id":"f3f4ff04-7cd4-46c6-b827-6aa965a8dd62","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:8d5970671b4ba4bde1982ce9ed14a79ab92d57b5e1d6d2d7114f7e0cf001bef7","observation_id":"fc7ea41a-3ae4-4a53-9f58-df1cf0c49091","resolution":{"observed_at":"2026-05-26T21:28:22.823676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rpiae: A representation-pivoted autoencoder enhancing both image generation and editing","venue":null,"work_id":"e3648adc-2e46-4bb3-a481-d36e029b1cf1","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:dee274860d015f90c935554a35211bba6d2c49d746cadf09075ce0b183cfd16a","observation_id":"0dc84dfe-0978-4ed0-87f2-25d5d6048935","resolution":{"observed_at":"2026-05-26T21:28:22.753465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"cc58dcc1-d404-47e4-95c5-e55067e1f5c0","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:51998db8bd62c324e9849b0ff0f21e5e7800284beea0a563810a0113a3f38a77","observation_id":"9341eaba-4edd-468d-9e4d-b5ee815f93cb","resolution":{"observed_at":"2026-05-26T21:28:22.746642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dera: Decoupled representation alignment for video tokenization","venue":null,"work_id":"dbb790fa-745f-4eea-9fe4-bd2a233a6bd5","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:f5ac9ba8c2842e8e5a79cd9356f1e2bcff79edc8749200b7d8e4dbc57b7dfab4","observation_id":"076ee37e-d19c-455c-a442-e2621a9818a4","resolution":{"observed_at":"2026-05-26T21:28:22.750012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"fd6ce6f4-05a2-4399-b389-7f526e502859","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:efdcd010e4a8d19f1d892e0ed40295f881283ef553fcae3e6f80fca7e306d81b","observation_id":"9c78bd01-f01b-45a4-94c3-6730cf6ed50e","resolution":{"observed_at":"2026-05-26T21:28:22.723789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified latents (ul): How to train your latents","venue":null,"work_id":"4fa6162d-4dc8-4b30-a7ca-d0313977a16b","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:c6b925e681a1ed9153304b797e18b69fc9c5a357d9ebc3529af3b08618b9958f","observation_id":"03569692-1b96-46e4-83a5-b9f04cd56c34","resolution":{"observed_at":"2026-05-26T21:28:22.731260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.Proc.TASLP","venue":null,"work_id":"52e9da9c-a18c-4cd6-9464-3fe55472ec7a","year":2021},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:723a8cf3e7e70e9c57de1464cef2e0b0d882fcd8fe268c2d05da42b5ced40806","observation_id":"a4396a53-4b04-4535-b732-0b1d66927549","resolution":{"observed_at":"2026-05-26T21:28:22.830842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meanflow trans- formers with representation autoencoders","venue":null,"work_id":"f8507b0b-d594-46a6-b27c-ba5395ed3422","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:db4e1d8da003b71eccda3353bb32a935a8813e2e11577c43408edfdb9feb5555","observation_id":"f8fdc8e7-4e69-427a-9aa7-0f7e6f29dcee","resolution":{"observed_at":"2026-05-26T21:28:22.716037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context","venue":null,"work_id":"4a5850c8-1238-4631-8d76-4f20b9631f81","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:a0a6bc4cdecff5565ec1f3f83981b3398c98e356af19c1e353696e4b1b2a8f06","observation_id":"22d56740-0d77-42c4-833b-d8d335682d04","resolution":{"observed_at":"2026-05-26T21:28:22.849191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planning in 8 tokens: A compact discrete tokenizer for latent world model","venue":null,"work_id":"032f6686-b578-4bf7-b658-7c14df2d8ede","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:2eba1f2b74d1b9a3409ce75c5c5138948680ff2cfc94391dc3995ded12b5cdd1","observation_id":"11020210-052a-4376-839f-5138a8b20b59","resolution":{"observed_at":"2026-05-26T21:28:22.712448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toward diffusible high-dimensional latent spaces: A frequency perspective","venue":null,"work_id":"71233cef-e3b1-4d49-adf5-5ce164a85560","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:e744d0f48e8d21684e3ed8f57c293d24945523958461f296c6638faf6544cfd7","observation_id":"cfa8f662-60a1-4d3a-80b7-225f264b407d","resolution":{"observed_at":"2026-05-26T21:28:22.760944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Repa-e: Unlocking vae for end-to-end tuning of latent diffusion transformers","venue":null,"work_id":"20fadef8-6727-443d-b067-1572cabc7d91","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:3fc95d36ba13a3936eb594498a33d7272324890784773fcc22085d78968baba1","observation_id":"e3be5ef7-acee-4ad8-990a-b33b1c854a3a","resolution":{"observed_at":"2026-05-26T21:28:22.786638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mogao: An omni foundation model for interleaved multi-modal generation","venue":null,"work_id":"bee997fc-852b-406e-9a36-38d9ee02b952","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:7ca8d0d7ec3742236265487635cf20c73e83103de4d7a52d416500c2114fe848","observation_id":"03ee103d-472b-4605-9486-19260405146d","resolution":{"observed_at":"2026-05-26T21:28:22.753367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuna: Taming unified visual representations for native unified multimodal models","venue":null,"work_id":"22064869-2334-4b05-bb67-a95f2a85b676","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:bcd1dca6c979895e29b1c7ffa91aebfb5f66e8a8e75371c52f329277cc6a8d6f","observation_id":"624348d6-389d-4c26-8b94-adefa348426e","resolution":{"observed_at":"2026-05-26T21:28:22.708830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixelgen: Pixel diffusion beats latent diffusion with perceptual loss","venue":null,"work_id":"e81e30ac-857d-4d26-a276-c299d5a37471","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:72cdd44b19a17ea8ca270b5fd20b2019d7eb7ada53ac4ee3c38e8909c08c61a7","observation_id":"8df0f97f-ea1e-4bc3-8070-0bd9d116822b","resolution":{"observed_at":"2026-05-26T21:28:22.725000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised speech representation learning: A review.Proc.JSTSP","venue":null,"work_id":"cfaaf556-831d-47d7-a38a-5e17138153cb","year":2022},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:4671ce19af70dd6b3ac68fe10cdee5a87064d087cd0b277cdd8c0ea206805552","observation_id":"8420f11e-0cd0-4a15-b670-087c054041f8","resolution":{"observed_at":"2026-05-26T21:28:22.767124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic-vae: Semantic-alignment latent representation for better speech synthesis","venue":null,"work_id":"8e952022-9fb7-415b-80c2-3c0ce254502b","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:d0d1676c192b21e5556f007a6e00470ec0160ca64f596b6e340b1b578f90cc14","observation_id":"945f4e9e-b6b8-41ec-b291-8ae955989e45","resolution":{"observed_at":"2026-05-26T21:28:22.827390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"999c6b03-d87f-4dfd-84c0-753bcaef289e","year":2023},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:1c82d6ace99c01d1ce2a388fd91379cf6a95ab58c864ba54b5a3381baccbca7d","observation_id":"796b709a-fe72-40f3-9692-6147da8e07fc","resolution":{"observed_at":"2026-05-26T21:28:22.722298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantics lead the way: Harmonizing semantic and texture modeling with asynchronous latent diffusion","venue":null,"work_id":"dcb765cf-fbc7-4296-9122-c61b53757513","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:3c782009e88ee1af3da7aa1e99db42c58c544e85aeb093504a586ad9646f748d","observation_id":"44bd08bb-c6d5-4ca5-86b7-2db5f2765ffc","resolution":{"observed_at":"2026-05-26T21:28:22.834443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":"febf712c-449f-4ec7-9b8e-8ac56e9a681e","year":2015},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:c9c3de77c145be839100b13353a2f1aee8eef35cd4f646cb4ff05cd4614a1305","observation_id":"e38fe8ac-e9ae-4342-9b55-c9d5ac22e624","resolution":{"observed_at":"2026-05-26T21:28:22.682833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Esc: Dataset for environmental sound classification","venue":null,"work_id":"ee20507e-13e2-41c0-b2ba-84751f12bcf4","year":2015},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:0f391950362925c58cfe25152146c20ba36dfefc9e64524d13b77717dc2b36fe","observation_id":"a39dfb3d-a2a5-4ee9-8988-d09a3d266a28","resolution":{"observed_at":"2026-05-26T21:28:22.686294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"2ba0e78d-d2a9-49a4-9185-92c3e2539da9","year":2023},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:ea40d8726d53e8b7b41b8bf86e8a5653284bc2be4283b3969616270f45e8744a","observation_id":"2229547e-7223-4e48-943c-24d7f0b42212","resolution":{"observed_at":"2026-05-26T21:28:22.675581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":"b5ccc001-4e44-40ec-baf0-19dec4649405","year":2022},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:688d8dc079f6faaaba5ca79eef0ddc1183ca7b74adea6068664d2cbae58b3691","observation_id":"ea19573a-d43a-4006-9497-f4c4432b4e5b","resolution":{"observed_at":"2026-05-26T21:28:22.841850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent diffusion model without variational autoencoder","venue":null,"work_id":"d23b30b7-d205-4ee9-8e49-9b0c32afde06","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:c8c61b871b5f99f3282f4c8085f77ad2bd7792d4fba9b6bfaffad68e53e0c185","observation_id":"23434823-e6c4-45d3-b204-74bc250ad0c9","resolution":{"observed_at":"2026-05-26T21:28:22.838072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":"d198b667-4a9c-473a-b463-fd4618834ab5","year":2023},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:0ddf8a18492e414e1a29682ead4af805e8b839d1f1841b9797d7cf4912c75bdf","observation_id":"49757e23-4e06-484c-afb0-bf0185213c8d","resolution":{"observed_at":"2026-05-26T21:28:22.769903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicodec: Simple masked gaussian-injected codec for high-fidelity reconstruction and generation","venue":null,"work_id":"87027f5a-831d-4599-8462-095ee3429279","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:fb6cac5d69dfc12586bec903ca426de216fad2620af2f964fe806ffac0c12d10","observation_id":"cbec838a-4299-4777-b1b0-59f35dad94b2","resolution":{"observed_at":"2026-05-26T21:28:22.845697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal latent language modeling with next-token diffusion","venue":null,"work_id":"c2bb93fc-fac5-4d2c-8b59-fa644eadb5f7","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:a784ecc395d257ff64b8fb69bb02b4083966f5e12cb212491f4d0177544077ef","observation_id":"19d63470-fa9c-4956-9cec-7f38ec747a8d","resolution":{"observed_at":"2026-05-26T21:28:22.679137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling text-to-image diffusion transformers with representation autoencoders","venue":null,"work_id":"0a8c7509-1a69-4549-9ec1-a98c39d6b4ef","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:a1d24a323bc309c16f11c03d83e070d055b91f01b2440c3dac6b47292ae27638","observation_id":"c4762025-a3f0-4acc-9922-744fd3f7c3c8","resolution":{"observed_at":"2026-05-26T21:28:22.778369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semanticvocoder: Bridging audio generation and audio understanding via semantic latents","venue":null,"work_id":"72985e75-1383-4256-8096-43d307023d36","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:39f78d27f716fa1fb77a98c5829d6cef8d2978bfa8953094f672abc8ba7f17e4","observation_id":"bfa511e5-6a30-4a24-8a69-7d9bdac8dd37","resolution":{"observed_at":"2026-05-26T21:28:22.772913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ming-uniaudio: Speech llm for joint understanding, generation and editing with unified representation","venue":null,"work_id":"7b47457b-c3c8-424d-8a93-b9ca843cee9d","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:bccf353e4a71c92a1e9aa5f3bdf3e0677f7d54cd09aac1f2bff6b33d794fb047","observation_id":"09af182e-1063-4306-8987-4057aad00c6f","resolution":{"observed_at":"2026-05-26T21:28:22.757823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superb: Speech processing universal performance benchmark","venue":null,"work_id":"2a61d4cb-677c-4cb7-a4ff-38b8f804599d","year":2021},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:7d36d5cf5deb33e05594092f91340bf55dfa7c2c17f337445b8eaa7136ab274d","observation_id":"97890df2-f0ed-4595-87fc-22fde36dd534","resolution":{"observed_at":"2026-05-26T21:28:22.775601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of unified multimodal understanding and generation: Advances and challenges.Authorea Preprints","venue":null,"work_id":"687d1084-c46a-4b12-a3d6-460108dea29b","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:fe38d36fb3e9b72ef1ac71161d7e490fb30c598eadb6d466b539880d4a6d0de5","observation_id":"b7188616-fdcd-436f-ac93-ee5710d1ad99","resolution":{"observed_at":"2026-05-26T21:28:22.780948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards scalable pre-training of visual tokenizers for generation","venue":null,"work_id":"e6f96e02-fc28-4ec8-94e8-82cdbdf94b4e","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:a6d3608284196c661097a4bbb264f4ca5236766bc55e30ce71082465b087228f","observation_id":"1646acd4-4f89-4498-b244-ec4353f4435e","resolution":{"observed_at":"2026-05-26T21:28:22.668542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reconstruction vs","venue":null,"work_id":"38798ec7-3016-4b8a-b18c-4dc26660bc6d","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:6ff06cd997770a4aa182b459d06fe2d6dc851a1972deac8a20d2e5031e37f7f8","observation_id":"788c1e23-d045-45c1-a7c8-7b37dedef0c6","resolution":{"observed_at":"2026-05-26T21:28:22.858438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distribution matching variational autoencoder","venue":null,"work_id":"94e919f8-90d0-4e03-b78c-bcf2b5ea1e57","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:2a6f76a82f8bc5b7ca6537f3ca01fba6faa72e3d04db71eb44e2d7877b8a00d1","observation_id":"dcbd8e9b-0b9f-4b8e-997b-d1238c2b5cc1","resolution":{"observed_at":"2026-05-26T21:28:22.649604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":"c6142fd7-6c41-4c46-aef5-d382e4a89549","year":2024},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:6bc7cfd93e3a7a2bd235682d2e8a8d67ed68356147db330f2113f0baaa4761a5","observation_id":"c001eb19-247e-4fe6-adf4-30b8c11ee4e0","resolution":{"observed_at":"2026-05-26T21:28:22.660563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":"cd174af7-1022-4cc0-a15f-059a97c4d934","year":2019},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:ebbafa65cf0aeac3b06002b2aec4c86f5ce44a3da158ab5257db26437e7464f1","observation_id":"0ef2fefd-703a-48e8-8a01-8279a4538fc4","resolution":{"observed_at":"2026-05-26T21:28:22.670159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"e6f5e09a-57d1-4c57-8ed2-6e827c2515cd","year":2023},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:4bd02334b9ca38e87f9b68ca45a01090773d3055c2cc5459dc651e6fd45bb03f","observation_id":"2d172464-4a49-4daa-abf4-4ffbd514521d","resolution":{"observed_at":"2026-05-26T21:28:22.719709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mimo-audio: Audio language models are few-shot learners","venue":null,"work_id":"4f0cc814-be49-43de-aa29-be537f727939","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:eb2db113bba122a6bbd69a39b83256a9896ec50367fcaacf40976676188e0330","observation_id":"a063cb65-f995-49b8-b9c2-ea39021f0339","resolution":{"observed_at":"2026-05-26T21:28:22.737874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openvision 3: A family of unified visual encoder for both understanding and generation","venue":null,"work_id":"d6eda25f-e231-4cc6-8918-1e49e46f6de1","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:147f2e837180d727efa2a4c2c6432320a0a6e5b845b11714a19cfe81e21f0b8b","observation_id":"fdf06353-1a0e-485f-826e-9dc74de59bac","resolution":{"observed_at":"2026-05-26T21:28:22.634948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rae- nwm: Navigation world model in dense visual representation space","venue":null,"work_id":"795aa7c4-264b-433d-9e03-2ed964fadb69","year":2026},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:68290dcf0ba2980f76432d11ab6334d4f7fc8aeadbcb0dea871636b08380d953","observation_id":"2d5bee4b-a855-4cda-a0ff-051c04601585","resolution":{"observed_at":"2026-05-26T21:28:22.638498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both semantics and reconstruction matter: Making representation encoders ready for text-to-image generation and editing","venue":null,"work_id":"050e35f4-2fe9-4c5d-82db-58d4d7f1a775","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:f50d2e480b0ef97e76eeeef18dbb39d2ef379a3d466808d4fd21e505dcd19fe8","observation_id":"f0a7d532-0664-4f0c-a804-7c531c4942ec","resolution":{"observed_at":"2026-05-26T21:28:22.646338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient image-goal navigation with representative latent world model","venue":null,"work_id":"9c3ebb9d-f464-4dde-9280-515835c3fbf3","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:d7e9be1c23a6373913df6450b018b8fb552f24f6fa37c9781bd077a310c90acd","observation_id":"1d5392e2-3d7e-49ff-a75b-ee31b52980b6","resolution":{"observed_at":"2026-05-26T21:28:22.628030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified multimodal understanding and generation models: Advances, challenges, and opportunities","venue":null,"work_id":"c7b3fd8d-60af-4059-9c3b-04edcba1185e","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:3d12c52d7242b59aed6e1b4f6d4a0c816ea13f753fbeb305ee0351ba1cad47f3","observation_id":"4a81d87f-a1b4-4d32-af54-fbc6f9e9a846","resolution":{"observed_at":"2026-05-26T21:28:22.631689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion transformers with representation autoencoders","venue":null,"work_id":"5e124561-b5ab-43b3-a20f-12dc7c9a4116","year":2025},"citing_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-08T03:57:38.298693Z"},"links":{"citing_paper":"/paper/2605.06407"},"observation_digest":"sha256:eb21af2d4e60beb176c50c6edeb23b8d0522d788f399b5b8d8e7bd442969b5a6","observation_id":"986a14f4-00de-4b34-b7bd-bb6594d5f021","resolution":{"observed_at":"2026-05-26T21:28:22.816029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-31T20:45:51.246853Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":63},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2605.06407."}