{"as_of":"2026-08-06T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:841779cc39c7aacc7d582f9fea21b8e9bcec72074e4068dbd7eaf24afaad1687","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T00:56:43.991936Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T00:56:43.991936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-06-29T01:02:56.259099Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"cited_work":{"arxiv_id":"2606.27627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27627","snapshot_observed_at":"2026-06-29T01:02:56.259099Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","venue":"cs.LG","work_id":"c12e5b07-28ef-4f40-a6ab-31db0b3a023e","year":2026},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2606.27627","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:8956a7ffd1f14dc5b29454f45e8238a026986b476fe629971d4108941aad22e2","observation_id":"d1950611-ba4f-412e-998c-9638ef854634","resolution":{"observed_at":"2026-06-29T01:02:56.260327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.27627/citation-record","integrity":"/paper/2606.27627/integrity","json":"/paper/2606.27627/citation-record.json","paper":"/paper/2606.27627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Human language perfectly illustrates this duality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:d20227c2d5f5bb41571d66bae70433a0f55c73a066976cbeb1c0108b0deb26aa","observation_id":"1396cd70-52b3-4130-897f-96e121f66f6d","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"cited_work":{"arxiv_id":"2606.27627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.27627","snapshot_observed_at":"2026-06-29T01:02:56.259099Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","venue":"cs.LG","work_id":"c12e5b07-28ef-4f40-a6ab-31db0b3a023e","year":2026},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2606.27627","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:8956a7ffd1f14dc5b29454f45e8238a026986b476fe629971d4108941aad22e2","observation_id":"d1950611-ba4f-412e-998c-9638ef854634","resolution":{"observed_at":"2026-06-29T01:02:56.260327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Preliminaries: The FocalCodec Architecture FocalCodec [21] employs an asymmetric VQ-V AE architecture centered around a compressor-quantizer-decompressor bottle- neck","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:becdc87983e59fb2ed72dae534176fa0ceed64ee1278710f397fd101843f57fd","observation_id":"6b77d89a-8956-4bd8-94b8-ae45e20d060f","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"While we train on both thecleanandother(distorted) subsets for training, we strictly limit our evaluation to thecleantest set to maintain con- sistency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:f0cf6c6c616bcfead1079a60c79d680846c365c85e69e69d7e34b05a65b8f1f0","observation_id":"6d317008-dc95-4ec8-a805-7d81b24f93cf","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"In both scenarios, we compare our hybrid ap- proach against discrete-only baselines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:e73c7b145a92b4ff89d732df7dd06b4190f07d5d50ffd6762f78a3e5386830c7","observation_id":"b81de799-cc3b-486a-97d8-02d8b390cd80","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"By combining discrete tokens with a non-autoregressive residual pathway, we recovered high- fidelity speech details at an ultra-low temporal resolution of 6.25 Hz","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:6e270834b8ec0b6c2315cc077e77c28e95fd2b8245500101c43faa1185a495cd","observation_id":"ab02ad10-8b95-4a05-a14e-2c841dbae95c","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"LLMs have not been used to author text for the paper, except BibTeX formatting and grammar/wording revisions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:a761c659e6e059a03c5bb6ff42398496a9daaba134b8a310c5460644496f8f99","observation_id":"add55530-0e75-4f67-a0c9-12d6c2916c43","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Samir Sadok was supported by the VisaSpeech Inria Associated Team initiative","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:22a3cdb72e01e9bb481681b1bfbbdb27e1accd1395b11cf167e4133bdaaa0139","observation_id":"e6e197f8-66d1-43f0-9b72-2d34228674d9","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/neco","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T05:16:47.867627Z","title":"2011, Neural Comput., 23, 1661, 10.1162/NECO\\_a\\_00142","venue":null,"work_id":"bbc72d42-3b9b-46b0-b850-9593f3bffbf1","year":1995},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:fb85240ad2d203ecbcdf238947c1ec1b7f5b778a35e2eb10f5a08f47c31fd541","observation_id":"51d3a21b-69ca-4ed3-adae-956eacc3da62","resolution":{"observed_at":"2026-06-29T01:02:55.145770Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Attractor and integrator networks in the brain,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:f503b48ca75b75af33372f944bc8f66888a8d59ed7568869c37a421e6d0f914d","observation_id":"87c879d8-b963-4f94-9a6f-ce42a068ff01","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:5e82ebb54472a5a12f2460d6b99ec96a115dd92b6627d1dbe2b16978d25611ef","observation_id":"8992c3d6-15f1-432a-ae37-1976651b248f","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Available: https://proceedings.neurips.cc/paper/ 2017/hash/3f5ee243547dee91fbd053c1c4a845aa-Abstract.html","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:9f41685bc87ca8823cf17ae0625cd4877904f4ef43fb148063cc79113ad5febf","observation_id":"dab19b8d-c98c-4f2d-8c54-ff9216365874","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Lan- guage models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:b16b813666ec0c469c6cd93e74540c883b7db56729f1b2a370c33da0aa81dd46","observation_id":"0b7523c3-5237-4c40-80e3-db5fea85b694","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:1ee0f2e5df9f3fc95f8e6aecbcc0f095ae6ec9a489c0c89643b20a78d2db130e","observation_id":"c64e2864-52aa-49c8-a899-3aea54ce7905","resolution":{"observed_at":"2026-06-29T01:02:55.150588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:2378d4a11ba2a3032d2796ff79896c361ea7bf65e920378902fe7243c2f06343","observation_id":"27cd7f68-e3d1-4292-b91e-bec4f8c6fade","resolution":{"observed_at":"2026-06-29T01:02:56.257957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:856d28a542de058603f8d417753aac0b6df86101193d700b57d1d1610b0dc6da","observation_id":"85c32e3a-c3b5-4362-93aa-9dc259173fbb","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Discrete audio tokens: More than a survey!","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:24b3d66c64eba06f6e20a6d8756addedbb1c4f1aca2dd0883f050202dce807f4","observation_id":"f08b5e23-139b-47bf-995f-b0a0a37c2bc3","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:21eed0461a6e54b62c445f4e109e30ac8b9be50231e88414e3451c36f440722f","observation_id":"540cfd5a-6c5f-4f2c-bf84-b415042b991c","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Available: http://kyutai.org/Moshi.pdf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7d2e0fdabc49d970ab591d3c62b59e91a14db1601c8f63acd5f4340d101a401c","observation_id":"fd42ae6a-8ec9-42bf-88e9-607fb22c2833","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":"2409.05377","doi":"10.48550/arxiv.2409.05377","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":"arXiv (Cornell University)","work_id":"e9f39fd1-2fa1-42f3-a015-0c19ae2ee455","year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:31743760b832d2e2d14e6b9262be6bf4e210ef188be92ee29cc94d29256fbb41","observation_id":"e122b4f2-9d6d-4d05-8cb9-f5be44f59c89","resolution":{"observed_at":"2026-06-29T01:02:56.255534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06546","last_updated":"2023-10-26T22:17:49Z","snapshot_observed_at":"2026-07-06T15:41:13.274608Z","submitted_at":"2023-06-11T00:13:00Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","version":2},"cited_work":{"arxiv_id":"2306.06546","doi":"10.48550/arxiv.2306.06546","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.06546","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-fidelity audio compression with improved rvqgan","venue":"arXiv (Cornell University)","work_id":"377fbd72-7799-4b45-a519-e458481dbd13","year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2306.06546","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7efd9e3b50f52707047089367f92ecccb169216ae61f4f01c56ba87d062829a4","observation_id":"5d2969a1-f330-4ccb-8171-eb5121f4d6cd","resolution":{"observed_at":"2026-06-29T01:02:56.247716Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Audiolm: a language modeling approach to audio gener- ation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:2b037c5c3111b7eeeacd1dad073d5009402b6e07aa4170a8182db7d9860fb78c","observation_id":"6ad35e76-e87e-4e20-87cf-06009e901466","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:807212db34a996598025053a4a5d84bb8c8b20c1397065e312f04e05fb692448","observation_id":"2a6dc408-4768-4514-a0cf-a7f52250d2ba","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-07-06T15:29:16.851803Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":"2305.11000","doi":"10.48550/arxiv.2305.11000","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":"arXiv (Cornell University)","work_id":"003168ec-b0d0-4979-830c-7df75e11d84b","year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:d23c7f742ab526b3742c5ce8d428778bafd43036e3f220dc70cd3e386e33b34a","observation_id":"050462e5-03e9-4d0b-8e4c-9c0db67aac9e","resolution":{"observed_at":"2026-06-29T01:02:56.250216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"SUPERB: Speech Processing Universal PER- formance Benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:df774ad5f0ea95168fb7197ccd298ae7fb555dac6903ab6037c90549557def0c","observation_id":"271f33de-60cf-41a3-92ff-2bd7d8365366","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"DASB - discrete audio and speech benchmark,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:e754908982a25277f2e1b38622faba4590a883af07cae325800ca63dd30f49f7","observation_id":"535477f0-7465-4ce5-a84e-0926c2dbf303","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7f5d595af085ed4f03d1a3190cfcb25ea767ef102503174fd61f0039d4e4bac0","observation_id":"f81e9906-fbc7-48d2-b33d-e21087082546","resolution":{"observed_at":"2026-06-29T01:02:56.239274Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-05T16:46:32.517360Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:6212da39e81dda3cbd22eaeb040918e70f453dd5fc5d3ce03c48a36d6a852cb9","observation_id":"89a5f7bf-cfe4-4d3e-be39-55c2f5ca66a6","resolution":{"observed_at":"2026-06-29T01:02:56.248185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26299","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T01:02:56.251378Z","title":"Modeling strategies for speech enhancement in the latent space of a neural audio codec,","venue":null,"work_id":"6ba0e312-a3b1-4213-9d12-b029233c00a8","year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:97c3d450575f5635321fc25eff3f5a195122b4b7dfc74d68672e1a6d88fc3e87","observation_id":"ba7cebae-51c7-4511-b3e8-6a6dfd4bac52","resolution":{"observed_at":"2026-06-29T01:02:56.252829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7ddcd66e3f679717f29d7f42c925526a73c23b32c27494e70349c8d7c9fd5538","observation_id":"6150a132-e04b-47f8-9c76-c110ad196745","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Coding theorems for a discrete source with a fidelity criterion,","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:45bc7b7df1b2adf26dcb9d89b0fedf73e2fbecc39ef3d6aba052f10bdf12eb7e","observation_id":"798ef357-d2ef-4a17-986e-6b0233260419","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"FocalCodec: Low-bitrate speech coding via focal modulation networks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:feea3e64dbd8b55a380021070458dea61ba5d3dacff3363ff252c0f931f7bd9a","observation_id":"9932e1b9-0c8e-4f10-9a79-f2800364cd67","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16195","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T01:02:56.249328Z","title":"Focalcodec-stream: Streaming low-bitrate speech coding via causal distillation","venue":null,"work_id":"c3b5fd87-7878-4cac-b28e-3dccaf3d04ad","year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:e24faf4aa89ede1f418f83f5badb7a57a1f29ed52384e571c2a3610f0dc94696","observation_id":"4d2f2e5b-bad4-457d-936c-64a5e547bb9d","resolution":{"observed_at":"2026-06-29T01:02:56.250974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:606b4af6c1d321cdd78e7721d5b6b1c09a450e7fc8defc626c30dfbe467125d0","observation_id":"fd8ec7c8-7c02-4686-b147-396e908092a1","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Comparing Dis- crete and Continuous Space LLMs for Speech Recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:d626a93cfcf2893fb7002213d33e21fbeda844bd7902127f33ebc9c5e8057168","observation_id":"83abe1ca-728e-49cc-89c9-98df787f9fc2","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Clear: Continuous latent autoregressive mod- eling for high-quality and low-latency speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:a98bfcdcbb510559d24acac8739e15a91a8b9bf895c6a791fbd9c26967e97134","observation_id":"03426349-35be-4bff-bf71-99bb04a6b0cc","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Speech synthesis from continuous features using per-token latent diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:526aa621103acafc5818fa92c7cb6009f928309c534e1751cf62d502da429a7b","observation_id":"3eee0134-b875-4e3e-a468-799a1dd9f40e","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Residual to- kens enhance masked autoencoders for speech modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:36666371f03bc3d8c63f2f3cf9b5a51617e3b1069f91f98940b1a8b8953f9397","observation_id":"95804028-f92f-4c3d-8a40-8b054803054e","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"HyAR: Addressing discrete-continuous action rein- forcement learning via hybrid action representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:541647301b5fe0e566dd50835d078458d36d05f7d7fe40d394d30d503b0a73b9","observation_id":"57aca063-fceb-4306-9bd9-0d2e828c8d59","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Mixed deep reinforcement learning considering discrete-continuous hybrid action space for smart home energy management,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:177c4e454928dc90b383d9b340d0573ffd4d40ed5f5af008bf2c61e0bcc94f47","observation_id":"5f7182f3-9ff1-4dc4-997b-80a4a7c1acda","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Learning insertion primitives with discrete- continuous hybrid action space for robotic assembly tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:ec8d9b947ff43eeb5d9354f61cb2dbd224b7a4ae25817cff37f65938634c46f7","observation_id":"8e79fe7e-f068-40c4-b962-4500de8f2907","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.22510","last_updated":"2026-07-11T23:42:33Z","snapshot_observed_at":"2026-08-04T18:56:24.343928Z","submitted_at":"2025-10-26T03:24:31Z","title":"CANDI: Hybrid Discrete-Continuous Diffusion Models","version":3},"cited_work":{"arxiv_id":"2510.22510","doi":"10.48550/arxiv.2510.22510","metadata_source":"arxiv_reference","pith_arxiv_id":"2510.22510","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., and Sutskever, I","venue":"arXiv (Cornell University)","work_id":"56e87901-a9ee-4efb-ae1f-cee6f8062255","year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2510.22510","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:2e12e38b33b3e7381d16c3b02a24d0ae60c0df641916cadaeb8ce6e4da410bd7","observation_id":"d4b6fb6b-7fce-4b8a-8858-6e235ec0c0fa","resolution":{"observed_at":"2026-07-14T02:20:19.540650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Image and video tokenization with binary spher- ical quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:f86e1f5ce16f145a604b132d696be6ad07d6d3d9bf285e1f64ba9a825cdbefeb","observation_id":"ec8cbe36-7046-481d-981f-2eccba50c286","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:257f080207a11b99065eb686d7d469221ca900d2910358ab44162611b74b1960","observation_id":"35cd0084-2a09-488c-bdbf-c7a2f691a06a","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7c9f4a0b5fde6593a198ffcda3ec6aeb4659e0c42e32f543a8ecd55d932cf59c","observation_id":"71b20d04-bc2b-4344-b14b-0ef93b884a70","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"AdaSpeech: Adaptive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:10dc09ca60625698850d2e6e2fe82d321efa033e0053e0960c7c93440c667349","observation_id":"df36967b-46d4-4542-9f13-a87de240df90","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"ECAPA-TDNN Embeddings for Speaker Diarization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:925ddd33693fad90d1c4207423938acb90da8dd9d30b88d2344e0d5e4dfda910","observation_id":"ddb8454f-0248-481d-a769-4fab9bd9b294","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Open-source conversational AI with SpeechBrain 1.0,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:6270a594bb616e73091c8cfbc4142b07577a81f077bac120cc663567be1cd884","observation_id":"37b250d5-0b97-4740-bf76-dc1a11c5e220","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/2986305","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An alternative family of transformations,","venue":"Journal of the Royal Statistical Society Series C (Applied Statistics)","work_id":"9d35f3ab-9c37-4194-8817-45f74234b208","year":1980},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:2ac7f8218a1c731ba1450a64b5ec605532b5a2a58208458d9f255bccdd3da983","observation_id":"bb15759d-413d-46ab-9830-dd6a85b28934","resolution":{"observed_at":"2026-06-29T01:02:55.142333Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Librispeech: An ASR corpus based on pub- lic domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:08f62c7f78434d7d54ba52f6af5f19447aa48462cd667a1be8d89eaa183f06a6","observation_id":"9d4c94ba-063e-4457-9ae5-91abb267bdfe","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"UTMOS: UTokyo-SaruLab System for V oice- MOS Challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:acb8ff93cdd01fdeca91f88f0aa9ac8b12bcda1b26ae6f54721ad9e84559e80e","observation_id":"18a9a424-28f6-4b6f-ac50-405aa3da7ee7","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-299","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pooneh Mousavi, Gallil Maimon, Adel Moumen, Darius Petermann, Jiatong Shi, Haibin Wu, Haici Yang, Anastasia Kuznetsova, Artem Ploujnikov, Ricard Marxer, et al","venue":null,"work_id":"d5b01f56-0a72-4d6a-b3d4-271f041b7418","year":2021},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:673f8da7cfb58849796cc7690566424fc5216631d56921334084e36b02b8b472","observation_id":"7e8a4271-5683-4a03-aab9-16cf77095a6d","resolution":{"observed_at":"2026-06-29T01:02:55.147857Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T18:51:54.434381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T18:51:54.434381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:871c35c5eb942bc33e02c9be4fc173f99f5f99a1286fe0bef98f3dee0a84aa73","observation_id":"d9dc724f-e34c-40f6-a5ce-f51dba43864a","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"ChatGPT: Optimizing language models for dialogue,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:b7adbd7e5488ea8e86686f59a899ac6252b33456d2519fe1ef22d9aae1f09e2c","observation_id":"92d8060e-bfd9-48d6-8578-6bb0246cebcc","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Microsoft Copilot,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:29e0b5e930ac6754fd0f4d169b01bcc0885ffd25e19089aea13ee97fa1fe43a6","observation_id":"52e01c43-2ad4-4624-9a1c-f54ffb12fac7","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Claude 3 model family technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:389b87ef3038471b4429d36d60aea50a58839adf643b2ede12c9d51010a3a67e","observation_id":"9ad9c68e-6a2c-409d-b972-1979a279a23b","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T00:56:43.991936Z","title":"Asta: Ai research assis- tant for scientific discovery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:2c36a4149690fd64df3aae69c38e02c19d025e48a4196447f4e32e65731fcaed","observation_id":"ab0bc674-a51d-4d3f-92dd-d82c830849ad","resolution":{"observed_at":"2026-06-29T00:56:43.991936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":42,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2606.27627."}