{"as_of":"2026-08-09T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca269169a9ee7f8483441cb45f3749b31097fb5fcbff9b831be70f99e5042b4b","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:45.290095Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:42.871348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:16:45.530174Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"cited_work":{"arxiv_id":"2505.15667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15667","snapshot_observed_at":"2026-08-07T15:16:45.530174Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","venue":"eess.AS","work_id":"99b55826-e520-424d-8408-277af5286fb7","year":2025},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.871348Z"},"links":{"cited_paper":"/paper/2505.15667","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:dc405899092cc921368f587f2279b76860829c8a5647f5810c8e51b878a86540","observation_id":"9bbcac71-74b0-4c85-aebf-96dc035cd577","resolution":{"observed_at":"2026-08-07T15:16:45.591375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15667/citation-record","integrity":"/paper/2505.15667/integrity","json":"/paper/2505.15667/citation-record.json","paper":"/paper/2505.15667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.975163Z","title":null,"venue":null,"work_id":"9408edf8-acd0-4278-a008-9f0cac2c0c3b","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.724908Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:7033b4d9502af1ba43afceba2a71d99a0ec12d1e10c829050efaf4cb5f39c9a2","observation_id":"5c1a7c5a-f82f-48c0-99d1-dadd05f77c3e","resolution":{"observed_at":"2026-08-07T15:16:50.090889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.862759Z","title":"Are you kidding me?!","venue":null,"work_id":"3d2f8d1d-e52d-49c3-b4de-48e7c7346095","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.799145Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:d0d05ebb8fcc10c2ac705ec998ee44be1240ec5d94a5943523446873aeae44b4","observation_id":"c65e3999-5a0d-403a-9d95-7cd30b799efe","resolution":{"observed_at":"2026-08-07T15:16:49.909689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"cited_work":{"arxiv_id":"2505.15667","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15667","snapshot_observed_at":"2026-08-07T15:16:45.530174Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","venue":"eess.AS","work_id":"99b55826-e520-424d-8408-277af5286fb7","year":2025},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.871348Z"},"links":{"cited_paper":"/paper/2505.15667","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:dc405899092cc921368f587f2279b76860829c8a5647f5810c8e51b878a86540","observation_id":"9bbcac71-74b0-4c85-aebf-96dc035cd577","resolution":{"observed_at":"2026-08-07T15:16:45.591375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.647806Z","title":"Segmentation-Variant Codebooks We encode speech into continuous representations using the frozen HuBERT-large model [17]","venue":null,"work_id":"23b277ac-e8ba-4a0a-97fa-a315b13030ed","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:42.966193Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:18e1a2285fda05e19627257878afc0e8f23fe87ffcb339a4d43f4dfe34ed0670","observation_id":"88a1359c-8961-4727-9298-ab4f85eb3114","resolution":{"observed_at":"2026-08-07T15:16:49.763315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.457616Z","title":"Datasets and Alignment Process Naver Prosody Control [21] is a dataset designed for study- ing prosody control in TTS systems","venue":null,"work_id":"5f551110-bdda-4dca-9351-592f6889d59b","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.000083Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:26b2bb1e863c24108e064ed25e2722616d0f55d86b6f503e8e8d0ccace1d99b8","observation_id":"5ae054a2-2fe4-47d5-81a6-1155e9aade0f","resolution":{"observed_at":"2026-08-07T15:16:49.572574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.182615Z","title":null,"venue":null,"work_id":"19c47a50-db92-43ba-8a05-38c3aef8701a","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.040761Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:97c44ab356e2f0b7e20064789001cd542c3c23427d547da17702462af2b89d64","observation_id":"795a7989-4c17-4e90-b2f6-b2e979a45480","resolution":{"observed_at":"2026-08-07T15:16:49.350000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:49.012120Z","title":null,"venue":null,"work_id":"07053835-58af-4a07-8ba7-04651b098f93","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.092557Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:961480741a5053633d3c43a7fe6bf972d86f53ca953bd63f8ccd1d5a8338121b","observation_id":"ece5708e-0da5-4225-88ec-d0e7b934f5fb","resolution":{"observed_at":"2026-08-07T15:16:49.060304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.808157Z","title":"The higher the score, the better","venue":null,"work_id":"3d34f876-c523-44ef-9660-5d473db6d555","year":2000},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.197519Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:358975d7467eacfabce53dcbd83c9120a68af12a5d5690d042b408500962b30e","observation_id":"0db052a4-8a80-459f-a483-56bdb38dbcff","resolution":{"observed_at":"2026-08-07T15:16:48.907843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.602572Z","title":"This study contributes to ongoing research on the use of DSUs, demonstrating their po- tential in speech representation learning and downstream tasks","venue":null,"work_id":"f7e741f6-a48a-4abe-80e6-58b846c0b619","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.270137Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:77e89cbb111f1b1f7cedbfc690bce39f7505372d8b2524bd6a606975a7dc32d2","observation_id":"6e272bc9-7c89-410f-a156-539b597a0daa","resolution":{"observed_at":"2026-08-07T15:16:48.689125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.456199Z","title":null,"venue":null,"work_id":"f29c1e53-d820-4c9c-b8df-870500a48f47","year":null},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.351918Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:89adfb39a28efbd22bca3d1635214825a6091f4e306d31d2ce63a4110f907d8b","observation_id":"88d2db23-b85e-426a-9398-377d80e93580","resolution":{"observed_at":"2026-08-07T15:16:48.496560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:43.399696Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.399696Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:89fb2faef72468cd0bc2739677752be14a15ec7f93fc220c91d8844087b32da2","observation_id":"3f653aa5-3026-4b40-a1f9-f0df0b20afb4","resolution":{"observed_at":"2026-08-07T15:16:43.399696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.334775Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A com- parative study,","venue":null,"work_id":"085163cf-bb8f-40d7-8184-d3125b312e48","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.437788Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:89b8872dd3e18d706026931d8cf3dd6a750220020032b9b0eddc41a2ef750125","observation_id":"57c35fe4-7054-47c1-9511-7031d4396df1","resolution":{"observed_at":"2026-08-07T15:16:48.391693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.185467Z","title":"On the use of self-supervised speech representations in spontaneous speech synthesis,","venue":null,"work_id":"99e698e4-5934-4b8e-b73f-ba1215dc365b","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.481755Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:bf88f7462aa6a8e00d8a9eaba018a4279c852a999984636f1c797e489e8cdb5d","observation_id":"8b8bae58-1fa5-4470-8ac8-5a7e55fd40a7","resolution":{"observed_at":"2026-08-07T15:16:48.247460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:48.086741Z","title":"Selecttts: Syn- thesizing anyone’s voice via discrete unit-based frame selection,","venue":null,"work_id":"b93e0f9d-2092-4f36-a88a-65784a573649","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.540400Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:39381bc061235c8aadfd0e56d0327e8c30d75e8ea958c8e13a236f6ec63381f6","observation_id":"35b2e03c-73d3-467e-af37-12c1cad7df1d","resolution":{"observed_at":"2026-08-07T15:16:48.126458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.908668Z","title":"Exploration of a self- supervised speech model: A study on emotional corpora,","venue":null,"work_id":"22b120db-f31c-4313-ae6a-0b726c0dc02c","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.626702Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:7206eea3d5be348de842a5d20e973d1085dc052e61a748edf37dd63c83cd8523","observation_id":"72b2e005-e738-4c3b-a928-d33964c18e1f","resolution":{"observed_at":"2026-08-07T15:16:47.995252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.782373Z","title":"Exploring Wav2vec 2.0 fine tun- ing for improved speech emotion recognition,","venue":null,"work_id":"5dd8974d-9b0e-4b0a-811f-811ec87df9a7","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.724297Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:e19040a27a83f1d533cbd27bc85873e46afa583f1a9c529d4560959b8b1698a4","observation_id":"b188d8a3-253b-459b-801c-2ca318becb79","resolution":{"observed_at":"2026-08-07T15:16:47.865776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.646266Z","title":"Layer-wise analysis of self-supervised acoustic word embeddings: A study on speech emotion recognition,","venue":null,"work_id":"db0224e5-b5b7-4d9a-ae90-6f952e702a53","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.797913Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:5a0992d7f4ff59d8439163a0a47a6cbf5cca743fe9432fde1d2522e87cc32faa","observation_id":"d36e856a-ce21-4066-b3b0-096d6b906caa","resolution":{"observed_at":"2026-08-07T15:16:47.707895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.504189Z","title":"Crossmodal ASR error correc- tion with discrete speech units,","venue":null,"work_id":"9ea2e937-6d2e-4818-ad44-8d8df74b79c3","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.897140Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:3b88471a764d8271a3cd32b672d428404e598b1bab9c5a8dd3083ac4d5208697","observation_id":"d14d4f7f-73dd-4beb-aead-02aa54898e94","resolution":{"observed_at":"2026-08-07T15:16:47.557302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09345","last_updated":"2024-06-13T17:28:13Z","snapshot_observed_at":"2026-07-06T18:30:28.421247Z","submitted_at":"2024-06-13T17:28:13Z","title":"DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09345","snapshot_observed_at":"2026-08-07T15:16:43.941022Z","title":"Discreteslu: A large language model with self- supervised discrete speech units for spoken language understand- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.941022Z"},"links":{"cited_paper":"/paper/2406.09345","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:dc2de3312d154fb75bec19d43756b9cef8e17f010095ee3ac5c65a97c0e7b4b3","observation_id":"9c85d235-3631-4b2a-8c01-d735bd2b04d9","resolution":{"observed_at":"2026-08-07T15:16:43.941022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.324313Z","title":"Analyzing acoustic word embeddings from pre-trained self-supervised speech models,","venue":null,"work_id":"d2a2bb1f-3a94-4898-8b95-e9d64721e2ac","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:43.974819Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:f327b7f8ae52520f47df13116a3ae3b212dd95157ee2ab061e487f4e96507e3f","observation_id":"8c79a01d-fdc2-4364-a74b-257daa0a1297","resolution":{"observed_at":"2026-08-07T15:16:47.423247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.242973Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":"426e185b-d309-48ad-96a5-6c58b5faf70d","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.049595Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:774a43a51b6256666200820d2bbb28f81f3a4afc09150e88a55d77034bf442eb","observation_id":"a11d4300-c46c-4f5a-90ea-c8b1a0c6d2a0","resolution":{"observed_at":"2026-08-07T15:16:47.278145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.119013Z","title":"Emo-codec: An in-depth look at emotion preservation capacity of legacy and neural codec models with subjective and objective evaluations,","venue":null,"work_id":"ec339bde-e839-43b9-b5d9-86ef7be969b5","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.115212Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:1c09add18864021fd58e6c44f1143cece8de779bbc57c531b698e60a856f8141","observation_id":"6b5ad4b3-752d-4953-a95f-8457fd82eab2","resolution":{"observed_at":"2026-08-07T15:16:47.171102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.156454Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.156454Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:d2e4480b889d6b4cf6914da433384a691c4c9befff68a923e4545dafbbf4121b","observation_id":"bbf3e34f-2dda-491a-a99d-b68783173e64","resolution":{"observed_at":"2026-08-07T15:16:44.156454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:47.013390Z","title":"vq-wav2vec: Self- supervised learning of discrete speech representations,","venue":null,"work_id":"09d32135-9485-498c-9100-56fb51aef755","year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.199984Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:673d6fbfc1008bfbd2521cc798ecb9466a72ef9fdaa8d93857fda95d63a92bf0","observation_id":"4c0be852-d92c-423b-88e8-88c50b532cce","resolution":{"observed_at":"2026-08-07T15:16:47.047351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:16:44.240679Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.240679Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:dda27fb2c511ecb0666fed70e6e483a6c1cc161641668842495e6482ae9d23e1","observation_id":"8eafc58b-0597-44a9-ac22-ff1ceba174d8","resolution":{"observed_at":"2026-08-07T15:16:44.240679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.302788Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.302788Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:55182877b2c1b488dc9910d5b61ef69537571b1baedb43ce4c8f3c5c90bcbe25","observation_id":"4d15db86-6185-4789-8f19-c1e0798d2143","resolution":{"observed_at":"2026-08-07T15:16:44.302788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.430963Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.430963Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:98eaa3513bb04e67a1c54a4280aed898852814ab7ba1e8fa4091624e985d8356","observation_id":"a408aa65-4d83-4929-b89a-a68074fb7725","resolution":{"observed_at":"2026-08-07T15:16:44.430963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.843134Z","title":"Phonetic analysis of self-supervised representations of english speech,","venue":null,"work_id":"cb320a16-0c69-493a-bb57-fc956d221056","year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.504728Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:f562977c74468613875c010044dd896aee156e51192679901667fb585bc9bca6","observation_id":"a7b29f47-7768-4684-8867-28bd5bc6838c","resolution":{"observed_at":"2026-08-07T15:16:46.901418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.750785Z","title":"Analysing discrete self supervised speech representation for spoken language modeling,","venue":null,"work_id":"9297fd74-bfc8-408f-af79-a1c6a46f876d","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.560689Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:b6b7aaa9eb8deaef4d02e4f5b79d4a2a5bbe1dcc18a1d257b794830e305ed908","observation_id":"7d56b6eb-9f5e-466b-a8d7-2fe03012f0e7","resolution":{"observed_at":"2026-08-07T15:16:46.791664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07725","last_updated":"2024-06-11T21:08:47Z","snapshot_observed_at":"2026-08-07T12:54:42.648788Z","submitted_at":"2024-06-11T21:08:47Z","title":"The Interspeech 2024 Challenge on Speech Processing Using Discrete Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07725","snapshot_observed_at":"2026-08-07T15:16:44.632634Z","title":"The Interspeech 2024 chal- lenge on speech processing using discrete units,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.632634Z"},"links":{"cited_paper":"/paper/2406.07725","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:8feb7103d313f10c8f15968f87d2d6f1be3ec60ba53e7c30195c6ed7441730c8","observation_id":"89422f5a-da23-452f-81c1-21090ab9d992","resolution":{"observed_at":"2026-08-07T15:16:44.632634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.592920Z","title":"Controlling prosody in end-to-end TTS: A case study on contrastive focus generation,","venue":null,"work_id":"adabc90d-b04b-4202-8e23-4d0eb7919700","year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.708653Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:a9cb88995f39bc45fc5e2934e2027346ee90f792cc62282fff584ac937287741","observation_id":"65ef997c-b806-4173-ae93-9404b37028de","resolution":{"observed_at":"2026-08-07T15:16:46.672049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.767109Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.767109Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:166652d8132a8007e4da73aae43532522b5a85fba417a9f490710860a9a53064","observation_id":"11f3a1a4-3e78-4702-b64c-88b285f5efd8","resolution":{"observed_at":"2026-08-07T15:16:44.767109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.421736Z","title":"Montreal forced aligner: Trainable text-speech align- ment using Kaldi,","venue":null,"work_id":"2e0b7392-b765-4e61-aa23-5ac7613c00e7","year":2017},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.798029Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:ffbfd68834e1f422c275f3e5d4ef6c7e0fe7aeb994787ad16ea30caae6fccb72","observation_id":"d0956122-9443-4441-8c7b-08d9fa0bf926","resolution":{"observed_at":"2026-08-07T15:16:46.487028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.331684Z","title":"The HTK book,","venue":null,"work_id":"9fecc10f-7705-4b01-857b-2f822d744ee5","year":2002},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.842896Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:5a39fc17ed52ba0100c73e3dc23ee462cf4ba32ab683642bcbdc8f60fb31cddc","observation_id":"1afc9f5f-e468-4347-ba72-1dba800550b7","resolution":{"observed_at":"2026-08-07T15:16:46.363396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.900505Z","title":"k-means++: The advantages of careful seeding,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.900505Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:c32afe2b4a0be5b81f2d726b4e2637fc3172a6568e54bb9c17dc9dbbda5aad60","observation_id":"c9acfe29-2a41-421d-9171-ed54aad14be2","resolution":{"observed_at":"2026-08-07T15:16:44.900505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:44.972228Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:44.972228Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:e1e88872fbbea92ab1d6171d29ae822a247a0ed173cd17480ae45b44762e95c3","observation_id":"e277a6ef-0e09-4456-a720-351c89d10147","resolution":{"observed_at":"2026-08-07T15:16:44.972228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.162322Z","title":"Su- perb: Speech processing universal performance benchmark,","venue":null,"work_id":"e59a69ec-7d4c-481d-abcc-4b89f7975925","year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.013346Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:e5359e35c4eda4cefac0ccacde29d01b5e9c4a1cc171de37bb88db35484773e9","observation_id":"fa69722a-ed3e-4821-98c7-1861a4afbdca","resolution":{"observed_at":"2026-08-07T15:16:46.199145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-07T15:16:45.044605Z","title":"A fine-tuned Wav2vec 2.0/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.044605Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:4134e0d63ae513871b991f6e824d6074af61a6f12912809041f92ee16775eb92","observation_id":"e54207ef-db25-4e0b-9637-4f8ba3a6ea1d","resolution":{"observed_at":"2026-08-07T15:16:45.044605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:46.012627Z","title":"Speech emotion di- arization: Which emotion appears when?","venue":null,"work_id":"b5d77267-ae77-4e63-ab8e-b191e395ed11","year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.083406Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:8ee326edf3c6a8ec461e8e286bc92863b985e054588a0e6158d3bce116d50e9c","observation_id":"910719cb-7426-431a-a585-091dc3b4fa4f","resolution":{"observed_at":"2026-08-07T15:16:46.101884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14069","last_updated":"2024-10-14T07:57:06Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:47:33Z","title":"EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14069","snapshot_observed_at":"2026-08-07T15:16:45.122530Z","title":"Em- phassess: a prosodic benchmark on assessing emphasis transfer in speech-to-speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.122530Z"},"links":{"cited_paper":"/paper/2312.14069","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:83766d3eefa3074994e8e34b4e638f29fe4cb131f943db63a20847f5cf4707c6","observation_id":"88baefd7-917e-467f-99c3-cda2827ab1bc","resolution":{"observed_at":"2026-08-07T15:16:45.122530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.867082Z","title":"UTMOS: UTokyo-SaruLab system for voice- mos challenge 2022,","venue":null,"work_id":"99b2680f-5c97-4111-893c-c6de9041038f","year":2022},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.173094Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:c5ca0a3270e5411d7399a211fcfc0a9354d2159646312057a3d0e7b5bb5637ea","observation_id":"19febf02-e693-4e25-bf7f-eaebb37e1834","resolution":{"observed_at":"2026-08-07T15:16:45.932575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.726235Z","title":"A layer-wise analysis of man- darin and english suprasegmentals in ssl speech models,","venue":null,"work_id":"518cfc8f-4508-4eae-be1f-a2a8528d1bac","year":2024},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.232249Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:040815bd3c86aac823e8465a712d66db0cfe54db6e84beea516c2e21bc337cfd","observation_id":"a6a144a5-47dc-4424-ac23-037deb7e233c","resolution":{"observed_at":"2026-08-07T15:16:45.774824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:16:45.630281Z","title":"blind speech segmentation: au- tomatic segmentation of speech without linguistic knowledge,","venue":null,"work_id":"e4a24598-67cf-49c5-b5df-f7751732696b","year":1996},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.290095Z"},"links":{"citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:5cf5713cbd187b3ce3e2df134fd88dae6dc8de2b11fac8188f291528d048ee9d","observation_id":"ad4fea51-e328-4b6c-84fe-4195775c3f69","resolution":{"observed_at":"2026-08-07T15:16:45.662287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T15:10:50.439466Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2505.15667."}