{"as_of":"2026-08-20T13:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86aa2c7caec0223466bb3d04f755ecea538b7f49763e4ca1914adf07f2cc5114","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:39:29.000932Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:39:28.911720Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T19:39:29.056834Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"cited_work":{"arxiv_id":"2506.15456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15456","snapshot_observed_at":"2026-08-15T19:39:29.056834Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","venue":"eess.AS","work_id":"73239900-9519-4b67-adad-c0a0cf4e5c4f","year":2025},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.911720Z"},"links":{"cited_paper":"/paper/2506.15456","citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:a614a13f2b159fdc2df6db8de0f67abf76baf065d0a882245f28dddf7c0081e4","observation_id":"823089f8-397a-4d80-bc32-da4d5adb1c7f","resolution":{"observed_at":"2026-08-15T19:39:29.060642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15456/citation-record","integrity":"/paper/2506.15456/integrity","json":"/paper/2506.15456/citation-record.json","paper":"/paper/2506.15456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.305336Z","title":"hj/iAePKhU/wEzYUdFoprleUHDo=","venue":null,"work_id":"b61d0aa1-d13d-4101-9ee3-4673e953871c","year":null},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.907303Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:5084109f461a1def2cfd824544a7affeb8a67010b872f693f7533d9f5a6247af","observation_id":"17acfd32-4fc5-4f28-8271-d3a621c456be","resolution":{"observed_at":"2026-08-15T19:39:29.309084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"cited_work":{"arxiv_id":"2506.15456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15456","snapshot_observed_at":"2026-08-15T19:39:29.056834Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","venue":"eess.AS","work_id":"73239900-9519-4b67-adad-c0a0cf4e5c4f","year":2025},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.911720Z"},"links":{"cited_paper":"/paper/2506.15456","citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:a614a13f2b159fdc2df6db8de0f67abf76baf065d0a882245f28dddf7c0081e4","observation_id":"823089f8-397a-4d80-bc32-da4d5adb1c7f","resolution":{"observed_at":"2026-08-15T19:39:29.060642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.295202Z","title":"These objectives are described in detail in [3]","venue":null,"work_id":"0c0a3693-a43f-4b41-b804-6bb512a8a02e","year":null},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.915197Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:5c7ffb015e56f8c23e8bf23e03468e77228cfb8b4e6f7facf1f3649569ff7e31","observation_id":"bb2ef3d0-6154-4f9b-a418-cb28c846f132","resolution":{"observed_at":"2026-08-15T19:39:29.298909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.285002Z","title":"For evaluation, we use forced-aligned test sets from Lib- riSpeech and Multilingual LibriSpeech (MLS) [16]","venue":null,"work_id":"26c7df58-7845-4692-a2b8-88b4dbeb0f55","year":null},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.919214Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:9b47162c8730d399c29bcf5498df179a7ca32c481f69e2fc2afa6cb4ab5a9f9e","observation_id":"31996334-126a-4d2c-b4bb-afacd1786516","resolution":{"observed_at":"2026-08-15T19:39:29.288543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.274856Z","title":"Like Encodec, ST updates its codebooks via exponential moving average (EMA) and period- ically re-initializes them to maximize utilization","venue":null,"work_id":"33f93c13-b841-4a28-bcfe-88a8e5680fe5","year":null},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.922726Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:060934d6fbdaf75581370601c9baf6a32995c12294fbd03180c0e9ed6e6f6ef6","observation_id":"00a7ef10-7418-4ed1-a9c0-6f8c5c70c131","resolution":{"observed_at":"2026-08-15T19:39:29.278477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.264240Z","title":null,"venue":null,"work_id":"3e4e1835-42c7-4cf9-bdcb-0f1371d7e20f","year":2024},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.926087Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:bc474822e11cac63fd94133a93a1bc73655f9f9f5189da7bb91f690b03e74098","observation_id":"1ee2ae7a-eb97-48a4-8209-433f13449f20","resolution":{"observed_at":"2026-08-15T19:39:29.268132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:28.929045Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.929045Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:5f73a136636536f6faf43e11abe2ae27fd9b94ac03b63cc7264ba54a8967e949","observation_id":"53396364-a75e-4635-a4c2-25d8c352b34f","resolution":{"observed_at":"2026-08-15T19:39:28.929045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:28.932410Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.932410Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:978c8a05643b7a7c6afb39225db24df6fdffb1ca6613ba97c434350cd77896a1","observation_id":"6bc4daf8-cc26-4a67-8223-e769b22e9268","resolution":{"observed_at":"2026-08-15T19:39:28.932410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.241563Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"88f1182f-c1b1-4bd5-98ed-9b74f60d71cb","year":2023},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.936622Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:a6208dce59f2228b27ec29b74b9515a8598adda3a28010ffc1ce10e4e18aa72e","observation_id":"264a4ccb-060b-49f4-9e57-3b2c51b88bd8","resolution":{"observed_at":"2026-08-15T19:39:29.245002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.231690Z","title":"ESPnet-Codec: Com- prehensive training and evaluation of neural codecs for audio, mu- sic, and speech,","venue":null,"work_id":"186aa768-f470-4baf-bfac-35f4b49b9297","year":2024},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.940045Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:66e129c8106eeda4e52c534ad302c9257d99c312736d7a2247a88b743067e310","observation_id":"652621fa-0f61-442d-b083-36592251ef83","resolution":{"observed_at":"2026-08-15T19:39:29.235174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.221826Z","title":"AudioLM: a language modeling approach to audio gener- ation,","venue":null,"work_id":"a45e95e4-be1b-4ee2-8913-99b9b5398aa7","year":2023},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.943495Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:0a7bdba010714ba7871cf5dbae4ce743457eda62d7eaad7b199cac7f6eab7d64","observation_id":"45e8e3c6-cfb3-4c09-9b28-a6c3bcdb3bb6","resolution":{"observed_at":"2026-08-15T19:39:29.225363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.211383Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":"fce0b1fb-edb4-4f65-98c9-767d0a35d8c5","year":2022},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.947499Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:42e677a99462d4f3d259d07b61ae9a78fad46d52b8441e51d0c0dcde4458b054","observation_id":"8508c9a3-4bb6-4af4-9a49-a9725cf96e99","resolution":{"observed_at":"2026-08-15T19:39:29.214728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.201186Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"37b20faa-3fa7-4b7f-9a12-0a09e3db05bd","year":2025},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.950681Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:b78f16e3675481a167fff1967901bf84ab3592a8ca4ca8fefaa5d7d1344c745c","observation_id":"d0b72eda-3e21-4b8b-b60e-862d2cb91473","resolution":{"observed_at":"2026-08-15T19:39:29.204716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.189997Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"c05026d7-bc40-4bbc-997d-01f9cdf32fe0","year":2021},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.954394Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:8afaee534e6857f267ed2956e800604049a472a26fe6d23b2a510b4d469186a3","observation_id":"b0d91740-e2c2-4c09-92f9-8f502c7fdc80","resolution":{"observed_at":"2026-08-15T19:39:29.194460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.178757Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A com- parative study,","venue":null,"work_id":"a0f1ffb1-45ff-4aaf-9ad4-d76f186d05d7","year":2024},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.957711Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:af62a4359c3699d5b6a78dbf7a5e2c552bdd312aef1379e728245194c3b4ed05","observation_id":"9573b92a-6efc-4b33-bfd7-86b9ae562824","resolution":{"observed_at":"2026-08-15T19:39:29.182883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.168263Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"17850411-e0d7-4469-8aae-4fcf87b47384","year":2021},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.960865Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:e4135de6642dc77042c682eef9c5dafaedf8265e6ba01ebb4d457b1903958e2e","observation_id":"cd9498f8-6315-40f6-8fc0-77a6bc9a23cf","resolution":{"observed_at":"2026-08-15T19:39:29.172175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.157705Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":"93207228-2a87-4870-b7d0-83cef74b65f3","year":2024},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.964465Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:ae33133f88650892dd4fe53ce9a0fe1596018e0877b488d45bed863d4b9db532","observation_id":"60d3c19e-cfbb-4a10-a5fd-0fb54671810f","resolution":{"observed_at":"2026-08-15T19:39:29.161492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.147876Z","title":"Language-agnostic BERT sentence embedding,","venue":null,"work_id":"5ffa3d4d-d9ba-4579-949a-98567b556149","year":2022},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.967595Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:c507fdc46346742edb3d9f8a6a25b596f207cd6b6d0b3348ae7be70962067078","observation_id":"a98dcb61-4645-47d9-9cdb-163c652fd600","resolution":{"observed_at":"2026-08-15T19:39:29.151363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.138070Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"88674760-e14d-4b76-857b-a8f11f3d51eb","year":2020},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.971282Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:20bb3960385c98da3758ddfd7333b1a4ef515587b4e03f3704d76be9492f3b53","observation_id":"a9aec702-8656-4623-a236-301a20c4a995","resolution":{"observed_at":"2026-08-15T19:39:29.141514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:28.974547Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.974547Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:d6deee2ccb5ea07057de5187aee9fd7df0f16528b7bdeae6c1aa68fcd65c6231","observation_id":"08353250-3506-4b29-a868-7d5fe339a811","resolution":{"observed_at":"2026-08-15T19:39:28.974547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.120675Z","title":"V oxPopuli: A large-scale multilingual speech corpus for representation learning, semi-supervised learning and interpretation,","venue":null,"work_id":"9fb30546-5f9f-496a-a1bc-ef53762942f6","year":2021},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.977657Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:29b299ea8f608045321a119380ef0a14ff55dd40b53a12a74bb9ae1d66f9d1e1","observation_id":"e40a318f-ce4a-447b-b217-951b2ebc052f","resolution":{"observed_at":"2026-08-15T19:39:29.124787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.109132Z","title":"MLS: A large-scale multilingual dataset for speech research,","venue":null,"work_id":"457e8d7e-648d-4641-9272-3d2ebc64bb8f","year":2020},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.981225Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:57aa396d51a3b4e169df31caa3d0cc4782a4e4397ef99f08112ebac075b6b583","observation_id":"39bb37a1-b3a3-4fae-9eae-c7edf779f8fd","resolution":{"observed_at":"2026-08-15T19:39:29.113947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.098698Z","title":"Montreal Forced Aligner: Trainable text-speech align- ment using Kaldi,","venue":null,"work_id":"f5809458-240e-4fd5-bcc1-0143e34af15d","year":2017},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.984436Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:af00ebb017e66fbd069f14dacf30c63174e0d49fd63202f7f56d37b2d6a25784","observation_id":"3ddbe758-26de-41da-a50c-1093baa7f9e3","resolution":{"observed_at":"2026-08-15T19:39:29.102343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06371","last_updated":"2024-11-21T10:45:39Z","snapshot_observed_at":"2026-08-16T13:44:30.934751Z","submitted_at":"2024-06-10T15:32:42Z","title":"mHuBERT-147: A Compact Multilingual HuBERT Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06371","snapshot_observed_at":"2026-08-15T19:39:28.987701Z","title":"mHuBERT-147: A compact multilingual HuBERT model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.987701Z"},"links":{"cited_paper":"/paper/2406.06371","citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:d5a564a572ab7b07252cd9d207f0d0e3339c275dedd93707b957452c68c3a48e","observation_id":"86d4e17d-e9f0-42a3-92c4-72ce2bb145dc","resolution":{"observed_at":"2026-08-15T19:39:28.987701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.088413Z","title":"SAMU-XLSR: Semantically-aligned multimodal utterance-level cross-lingual speech representation,","venue":null,"work_id":"89d449de-0cb2-412e-8f6f-7d62c64e019f","year":2022},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.991280Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:46c9427fc6301be7e2b6191ab2252bc765775602364dda6c87e54580df42d8ef","observation_id":"8d28b839-019e-4593-8f9b-71982ed02adb","resolution":{"observed_at":"2026-08-15T19:39:29.091922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.077606Z","title":"Abx-discriminability measures and applications,","venue":null,"work_id":"33613129-af77-4bc5-b05b-dfd03238c51e","year":2016},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.994420Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:ae06557c76e3f87d61076898a73fc632e2a46970827172b7d8a1dedc66d4e291","observation_id":"0d202429-7ec0-4460-a16d-f29f6638cf41","resolution":{"observed_at":"2026-08-15T19:39:29.081374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14700","last_updated":"2021-08-09T19:09:58Z","snapshot_observed_at":"2026-08-16T18:28:08.515356Z","submitted_at":"2021-04-29T23:53:37Z","title":"The Zero Resource Speech Challenge 2021: Spoken language modelling","version":2},"cited_work":{"arxiv_id":"2104.14700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.14700","snapshot_observed_at":"2026-08-15T19:39:29.031179Z","title":"The Zero Resource Speech Challenge 2021: Spoken language modelling","venue":"cs.CL","work_id":"b15c89a8-5df1-43a2-a485-8f0f42b3efff","year":2021},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:28.997541Z"},"links":{"cited_paper":"/paper/2104.14700","citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:321e17b8e122f61b49c397731deeeaf5604ef93af198cd90b559ebcb629457c3","observation_id":"f3fd29c5-089d-4b1a-80f5-045b128a1dad","resolution":{"observed_at":"2026-08-15T19:39:29.036877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:39:29.067456Z","title":"Learning hierarchical dis- crete linguistic units from visually-grounded speech,","venue":null,"work_id":"201fad66-409a-4838-98a4-cb7cbd6ff01e","year":2020},"citing_paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:39:29.000932Z"},"links":{"citing_paper":"/paper/2506.15456"},"observation_digest":"sha256:0d1c70876efea06989316dae4fd56a2ca445c97d70a60f50acf37f4e21b0624d","observation_id":"19e21dc0-11c0-4e8d-a43c-a9fe40114560","resolution":{"observed_at":"2026-08-15T19:39:29.071255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.15456","last_updated":"2025-06-18T13:36:34Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-20T09:29:31.846651Z","submitted_at":"2025-06-18T13:36:34Z","title":"Factorized RVQ-GAN For Disentangled Speech Tokenization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2506.15456."}