{"as_of":"2026-08-08T12:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7c2738314d6ab2cb7646730049a8aa113a0d4e8d992eb40c1e01c49974bce9e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:36:07.757161Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.00503/citation-record","integrity":"/paper/2509.00503/integrity","json":"/paper/2509.00503/citation-record.json","paper":"/paper/2509.00503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:04.251136Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.251136Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f92b52a2926074838edfb3ebb1b60b0bf5a1060c730e8cf4327230893bff97c3","observation_id":"bc4316e2-543f-4228-9e0f-8898e09e41a6","resolution":{"observed_at":"2026-08-05T13:36:04.251136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:04.298614Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.298614Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:9c865b624389668a4db31b04b71855446dabf2814f9b9d5d95a4e19c587cf64e","observation_id":"b9404f6d-9072-4903-bb6d-9c9aab3fe8db","resolution":{"observed_at":"2026-08-05T13:36:04.298614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:10.799152Z","title":null,"venue":null,"work_id":"5bb89f83-4dd6-45b2-a475-746c8b4b5bc0","year":2022},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.304379Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:d9c172b1cfc94284959602957c4e2bea534d150a662109d8a52f2ec2467c123b","observation_id":"0ef37c56-c405-42a1-9d8d-c312e10b307d","resolution":{"observed_at":"2026-08-05T13:36:10.898123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:10.517117Z","title":null,"venue":null,"work_id":"07ac2d42-21bc-4982-bb5e-c7b928cb91a7","year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.309939Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:3b6837663819e4ab15af126ae3ae08a40655af32351be00be8a87951e44198cd","observation_id":"dc7cd832-137f-4e21-964e-60d0309c2d2d","resolution":{"observed_at":"2026-08-05T13:36:10.673193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:10.215841Z","title":null,"venue":null,"work_id":"5dbd470f-8cbf-4ef3-9bdf-bdaaac4fca04","year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.314852Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:aa41a9b95d180c72ae0302dc2ce59edfb8758508f39bdeaadaff0170dbfdf55c","observation_id":"3f98afc7-7a15-479b-8ddd-3ffd377e87f8","resolution":{"observed_at":"2026-08-05T13:36:10.396573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08619","last_updated":"2024-06-12T20:04:44Z","snapshot_observed_at":"2026-08-05T11:23:51.812806Z","submitted_at":"2024-06-12T20:04:44Z","title":"Self-Supervised Speech Representations are More Phonetic than Semantic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08619","snapshot_observed_at":"2026-08-05T13:36:04.348855Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.348855Z"},"links":{"cited_paper":"/paper/2406.08619","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:56bdec709141d26157692eb03610664b62d65647191d1be3b4704c280d6fe612","observation_id":"c9ff6f51-2056-4e15-a5a1-b30733c5682a","resolution":{"observed_at":"2026-08-05T13:36:04.348855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:09.964651Z","title":null,"venue":null,"work_id":"c89bf13b-6920-498f-b366-011055bd4474","year":2021},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.439066Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:93d8dc8e27ecea78b2b5b4a1b40f38a3958437daa16183490d0965253cfe5513","observation_id":"81fa351b-9ae4-4545-adb1-7a4c8a405566","resolution":{"observed_at":"2026-08-05T13:36:10.094616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T13:36:04.504715Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.504715Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f7124ed4cfcdc7dbf5ac857a7e72bb5e2e7341e59e73cfaef47d73556346ae17","observation_id":"c47d4970-bc32-4c96-9678-cb278a7ea6f8","resolution":{"observed_at":"2026-08-05T13:36:04.504715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T13:36:04.593428Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.593428Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:396ba095eefd7ac20dcb068acf30a94e49bd8b5dafa4fcd06b96ce0c715f4eec","observation_id":"b4cc4b2e-4175-42d5-afd0-7e434a894fc0","resolution":{"observed_at":"2026-08-05T13:36:04.593428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-05T13:36:04.660557Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.660557Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:c616e842f6eef682d16b3f4399eeca3cabe7daede09698e223f04ef57fab96cc","observation_id":"71d59571-a5e8-4a80-920c-49ba09d4ac7a","resolution":{"observed_at":"2026-08-05T13:36:04.660557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-08T09:38:45.288574Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-05T13:36:04.730722Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.730722Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:b5a72c61cc50325b96ffed01d3a23d55992317604ee8e62916c082e016cd191b","observation_id":"c9954816-dbc8-43e3-9707-98f3ef9225ec","resolution":{"observed_at":"2026-08-05T13:36:04.730722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T13:36:04.798312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.798312Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:da1d1ef26bb16a7dae0424181c8900c4ec28e9290b97c080f89c6a9243618163","observation_id":"33b3e593-731f-425f-bc8f-47ff2a9a6ad7","resolution":{"observed_at":"2026-08-05T13:36:04.798312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03713","last_updated":"2022-06-26T06:14:05Z","snapshot_observed_at":"2026-08-06T16:06:51.166471Z","submitted_at":"2022-01-11T00:27:08Z","title":"CVSS Corpus and Massively Multilingual Speech-to-Speech Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03713","snapshot_observed_at":"2026-08-05T13:36:04.874214Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.874214Z"},"links":{"cited_paper":"/paper/2201.03713","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:8c1447d04c668c19c25baceda3cd28abf94b36bbc9be1580e29969db1d905271","observation_id":"7b99ceb9-d7d8-4579-916a-0b1007b6bbfa","resolution":{"observed_at":"2026-08-05T13:36:04.874214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-05T13:36:04.952458Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:04.952458Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:b47782449902884735dbc13f9815dd90641ccb89a6f84430dc985909d1877007","observation_id":"5a5d7d75-8ae9-430e-bd07-9932e8978c57","resolution":{"observed_at":"2026-08-05T13:36:04.952458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16083","last_updated":"2023-06-28T10:30:39Z","snapshot_observed_at":"2026-07-06T15:47:42.066252Z","submitted_at":"2023-06-28T10:30:39Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data","version":1},"cited_work":{"arxiv_id":"2306.16083","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.16083","snapshot_observed_at":"2026-08-05T13:36:08.121151Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data","venue":"cs.SD","work_id":"fd8e22a2-02b2-44af-aed5-8b960c818d24","year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.042135Z"},"links":{"cited_paper":"/paper/2306.16083","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f744156f1cdea74dcbad01068c7c99b2f2e3ab7f456079fe11b434d91d67d10f","observation_id":"29368659-784a-4e0f-a7be-fc092e4608f2","resolution":{"observed_at":"2026-08-05T13:36:08.298949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-05T13:36:05.134630Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.134630Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f1776ebc31c8b3dbf2ebd5156e1e6ab08c1c92b7b92f2267d33fe587b6da83e7","observation_id":"36c2ed4e-c239-424e-a24f-596773e1d546","resolution":{"observed_at":"2026-08-05T13:36:05.134630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:09.726760Z","title":null,"venue":null,"work_id":"db19fbf8-9a1c-4a0a-9046-471d686492eb","year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.227675Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:de5d1547f6ce1e7d50a363ee007fe46c17f636ff40ccc3327523a96f1f6280c4","observation_id":"bd7b7324-e1d9-4b2c-9328-d89f1d37ed84","resolution":{"observed_at":"2026-08-05T13:36:09.830239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-06T16:37:49.547342Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-05T13:36:05.343480Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.343480Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:5182742daac57e66c0a79fc19e1a260ebb047bf80aadf47bae3780c19dc352dc","observation_id":"8c260918-7ea5-4d2c-8c26-e641f28fb380","resolution":{"observed_at":"2026-08-05T13:36:05.343480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:09.430819Z","title":null,"venue":null,"work_id":"56f3852d-3c94-42b7-b80f-29cea129a548","year":2025},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.478618Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f699921e083b122d61cc96671905e23748a9db9a7d2de3269776da87c58a6700","observation_id":"8887f58a-6b4b-4025-a471-13878b10a970","resolution":{"observed_at":"2026-08-05T13:36:09.538561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:05.553255Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.553255Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:c6f630940f24c331ee7dae73783f05019a98f47a1cb04e03bed68ae925fdc508","observation_id":"d71f030b-e25d-4fb1-9f42-842890774b22","resolution":{"observed_at":"2026-08-05T13:36:05.553255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-05T13:36:05.638247Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.638247Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:15b3b59e8c50b5ba09a50ac508d9fee78bb46a61b1c855c9569a1034ba0cbf26","observation_id":"b4ce842d-b1cb-4f44-9022-82e71760e3a6","resolution":{"observed_at":"2026-08-05T13:36:05.638247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T13:36:05.765792Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.765792Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:f128d8a0564fda91de7a4fb0c3339dde3c3fbf01edb64ae128dba890bdf5b3a0","observation_id":"29075c9a-4d40-4722-8e61-1c47ad80d6f7","resolution":{"observed_at":"2026-08-05T13:36:05.765792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-05T13:36:05.822457Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.822457Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:6a0ff5cd12275583b5f2bf003a84ca929f01733d181214bf6146a1d7e0dc1629","observation_id":"2908084a-cda6-42b9-baed-26da80f1762f","resolution":{"observed_at":"2026-08-05T13:36:05.822457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T13:36:05.908306Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.908306Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:1f479aefaeea6a0373dac93aa8e9c9c6a05696e7b7a891d071390647b87fe6a5","observation_id":"2df71453-5bde-4389-8e4f-9818f88521cb","resolution":{"observed_at":"2026-08-05T13:36:05.908306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:09.135404Z","title":null,"venue":null,"work_id":"109b4fba-db8b-4507-b9b2-4f51ccec595a","year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:05.989102Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:b9724e2f2e95d03c33ec04248819cd324a9897037bbb9b1d344182d89a40f47f","observation_id":"eed9cfc3-5036-4fc0-8139-d21dd102a3ca","resolution":{"observed_at":"2026-08-05T13:36:09.271008Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-05T13:36:06.099679Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.099679Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:184100d1deabb271e84d1034f366184bc19ffeda5289c09548a6f6badc522e02","observation_id":"7439071f-fdd5-4523-9276-d5b680545379","resolution":{"observed_at":"2026-08-05T13:36:06.099679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T13:36:06.272176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.272176Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:54ada04751db39b32b2941ac710aa1221878e8d91413522a1cebee9fdbac13bf","observation_id":"81359061-edc0-4f25-b307-1f1a5a4ca378","resolution":{"observed_at":"2026-08-05T13:36:06.272176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-01T14:58:21.912263Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-05T13:36:06.405065Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.405065Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:ab61b804721840b0a7a197c06df1034861284052baf4d0241ad2f0753f1fbb45","observation_id":"b5b0bbeb-1279-4003-b7f5-e591c11f41e4","resolution":{"observed_at":"2026-08-05T13:36:06.405065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:08.886744Z","title":null,"venue":null,"work_id":"7c3de3b8-e06e-4b18-976f-d0b1299638db","year":2021},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.530016Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:9662514ef0dbf6595d39088ab7166d2fee5f230d3a0ecbfbee59dc921b790cc7","observation_id":"64cd705e-8395-432d-8f86-c315d8a4f3f8","resolution":{"observed_at":"2026-08-05T13:36:09.008327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-05T13:36:06.639779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.639779Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:085cff0db8c9796921f4babded61889cc93886d9569ce0f90b6c5379b2b8234d","observation_id":"46ccd477-b2ae-4e42-ac81-b7a3e019362b","resolution":{"observed_at":"2026-08-05T13:36:06.639779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-05T13:36:06.764129Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.764129Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:0caa145cba1a83bcc280ea95a1df5168614064ebe4cb791ecac53aa49ed60b62","observation_id":"3fd04d88-01df-4258-b64e-60ead11d9de4","resolution":{"observed_at":"2026-08-05T13:36:06.764129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-05T13:36:06.849510Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.849510Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:da9d771a7cf1ee3e63bf26a620c0d117b0321c4a90434b71c7470b679a5031ad","observation_id":"614bb375-5422-46c4-aefe-c3731c2a4587","resolution":{"observed_at":"2026-08-05T13:36:06.849510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T13:36:06.941643Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:06.941643Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:2420ef75291391f9e2e2f27acdb75e40e9758406cc94efcd029aa37aed6302b9","observation_id":"9e6d0b5e-8d39-4853-b505-3268b2b3fc68","resolution":{"observed_at":"2026-08-05T13:36:06.941643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07377","last_updated":"2023-12-14T13:18:35Z","snapshot_observed_at":"2026-08-06T20:27:39.970168Z","submitted_at":"2023-09-14T01:39:43Z","title":"Towards Universal Speech Discrete Tokens: A Case Study for ASR and TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07377","snapshot_observed_at":"2026-08-05T13:36:07.067008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.067008Z"},"links":{"cited_paper":"/paper/2309.07377","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:e1660ace5c5accfe1f5be93dc3ca2df004e71bd3f10823fa6dd16a774e64a2d5","observation_id":"c2eb171c-4775-4b73-b37b-ff90f8d713ed","resolution":{"observed_at":"2026-08-05T13:36:07.067008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T13:36:07.188114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.188114Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:bf0600dd63ef70076e3dd436b38ee721cd13e322680c6f7087b121f4a200ff17","observation_id":"a03d558c-6c2f-4275-ae38-8bca8cd10ad5","resolution":{"observed_at":"2026-08-05T13:36:07.188114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-07-06T20:34:29.976207Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-05T13:36:07.305867Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.305867Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:d99b32c78f78001c79b0dac47bcfdb547c4f81ea2580fd8bfc72586f349bf7ec","observation_id":"64546f18-8417-4c2a-b48b-0557f261eb3f","resolution":{"observed_at":"2026-08-05T13:36:07.305867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:08.607820Z","title":null,"venue":null,"work_id":"fb12da4a-0433-41bb-99a2-76dca81bafe4","year":2025},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.474855Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:a936d0897ccff2fd559a9e7bec2c7c46f622dc5436b06cd2a24b2927c6f70742","observation_id":"078bee70-5c2b-4d24-89e5-26777d351a32","resolution":{"observed_at":"2026-08-05T13:36:08.767828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:07.608698Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.608698Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:e0d7f343be787c1e1d7f747d6c4c24273ed7faf854b5f3af34d15530eb80a31e","observation_id":"9302c1b9-c8b1-4db5-9d2f-3c01d7adf463","resolution":{"observed_at":"2026-08-05T13:36:07.608698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:36:07.757161Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T13:36:07.757161Z"},"links":{"citing_paper":"/paper/2509.00503"},"observation_digest":"sha256:782b2fe8b2498d3b6028b2c5c1b453d01c4b607c21d53d385d28f0ac7a5320b5","observation_id":"0d349e1f-43df-4c7e-a2b8-a1719e756940","resolution":{"observed_at":"2026-08-05T13:36:07.757161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00503","last_updated":"2025-08-30T13:50:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T09:17:24.591916Z","submitted_at":"2025-08-30T13:50:58Z","title":"Entropy-based Coarse and Compressed Semantic Speech Representation Learning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2509.00503."}