{"as_of":"2026-08-08T17:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:afaf03bd97dbf5a0d55fba7d8c285db3ecd41dbbaa39a8566fa68955488a6051","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:54:07.435997Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:54:04.008475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:54:08.361418Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"cited_work":{"arxiv_id":"2506.06834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06834","snapshot_observed_at":"2026-08-07T05:54:08.361418Z","title":"Rhythm Features for Speaker Identification","venue":"eess.AS","work_id":"0e2b4dac-5838-4f60-a4a4-dda3552a092b","year":2025},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.008475Z"},"links":{"cited_paper":"/paper/2506.06834","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:696d7e89757db6f7847781ec65aef8c764f1cd7288d616e91d81eb04849c74dc","observation_id":"aa410efc-82a1-4641-9fff-3b368902c93f","resolution":{"observed_at":"2026-08-07T05:54:08.482430Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06834","snapshot_observed_at":"2026-08-01T12:12:42.171456Z","title":"Rhythm features for speaker identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19636","last_updated":"2026-07-22T00:16:09Z","snapshot_observed_at":"2026-08-01T12:12:39.989125Z","submitted_at":"2026-07-22T00:16:09Z","title":"Multimodal Speaker Verification as a Threat to Speaker Anonymization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T12:12:42.171456Z"},"links":{"cited_paper":"/paper/2506.06834","citing_paper":"/paper/2607.19636"},"observation_digest":"sha256:e53581c8215ed137c10130a2234840a06be806f81ab0eeae9ce3a2a0dd31cab5","observation_id":"0e985fe9-4c6d-4ea1-a3fc-8ccaa30980b0","resolution":{"observed_at":"2026-08-01T12:12:42.171456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06834/citation-record","integrity":"/paper/2506.06834/integrity","json":"/paper/2506.06834/citation-record.json","paper":"/paper/2506.06834"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.164982Z","title":null,"venue":null,"work_id":"6565f62e-4c94-4280-a764-81dbac644df5","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:03.435043Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:c46f99cdf890ce093cf64d6e927f2e55e2f5643d44bcc68f934fdef8c0e8f996","observation_id":"c47e5e7b-a891-4f4e-80c3-872e70f9e8fe","resolution":{"observed_at":"2026-08-07T05:54:13.271527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.967813Z","title":"For example, [11] demonstrated that human listeners were able to identify familiar speakers based on only a sinusoidal encoding of the prosodic informa- tion in speech","venue":null,"work_id":"5eda1e79-351f-4910-9136-26ff307b1bce","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:03.623277Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:79a42a75e4dbb37abaff637526d527ea05031b6f51bd42183ae681831b258630","observation_id":"a3f4dd10-0d06-474a-bb20-03f7b3ec3f38","resolution":{"observed_at":"2026-08-07T05:54:13.054283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"cited_work":{"arxiv_id":"2506.06834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06834","snapshot_observed_at":"2026-08-07T05:54:08.361418Z","title":"Rhythm Features for Speaker Identification","venue":"eess.AS","work_id":"0e2b4dac-5838-4f60-a4a4-dda3552a092b","year":2025},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.008475Z"},"links":{"cited_paper":"/paper/2506.06834","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:696d7e89757db6f7847781ec65aef8c764f1cd7288d616e91d81eb04849c74dc","observation_id":"aa410efc-82a1-4641-9fff-3b368902c93f","resolution":{"observed_at":"2026-08-07T05:54:08.482430Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.596285Z","title":"Datasets We evaluate our approach on a closed-set SI task using two pop- ular speech datasets","venue":null,"work_id":"872243d5-e0fe-4b06-a2fc-b759f1e67927","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.217453Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:45074f7532d4fc285e9f3ded4fc6b6e4d9748d5299c9a18463bfa3b19986b467","observation_id":"c6d38783-3ffe-4835-ba9f-9eb975717d90","resolution":{"observed_at":"2026-08-07T05:54:12.691984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.290777Z","title":"Additionally, it is better suited to our closed-set identi- fication task than other commonly used measures, such as equal error rate (EER)","venue":null,"work_id":"863c59eb-5f39-478f-a718-dff3143b4cec","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.600304Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:30d73ee86242babcb8dc03a959ade1ac7da305d16a12896353cb3c0b091a3775","observation_id":"c25e25d8-041c-4101-8ecc-61c15eef1b71","resolution":{"observed_at":"2026-08-07T05:54:12.366008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.044457Z","title":"Discussion Our results are consistent with prior works [2, 3] that have suggested rhythm features do convey useful information about a speaker’s identity","venue":null,"work_id":"6aaae0db-d80f-4fac-ac08-751bfd342f97","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.771338Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:9860b5fa721412a54ae3517289cfe17f8ab1c5d93b0d3c6c2d1bc321f66fa11c","observation_id":"406f3c22-f2a8-4119-bd03-8df349f8a56a","resolution":{"observed_at":"2026-08-07T05:54:12.175705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:10.556910Z","title":"Durations of context- dependent phonemes: A new feature in speaker verification,","venue":null,"work_id":"fe2bed3a-ce0e-45f4-8bbf-1b9ff862bdfc","year":2007},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.885515Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:c48c1484f3ff895262f6e3983e4103dcdc2aa9620f7c02f10c088bc1527416ad","observation_id":"53377cd6-1458-4229-96e6-f00d78470ba2","resolution":{"observed_at":"2026-08-07T05:54:10.666295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:10.330509Z","title":"Prosodic pa- rameter for speaker identification,","venue":null,"work_id":"564086b4-47c6-438a-a3eb-e3a7d5e5a6f8","year":2002},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.937445Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:34db6eca89042405272f4f3d139cf1bb1befea67036dfa28c3777bdfb1d939b9","observation_id":"028b0074-465d-45ce-b6bd-e94900cf3c93","resolution":{"observed_at":"2026-08-07T05:54:10.441207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:11.915471Z","title":"Speaker recognition by machines and humans: A tutorial review,","venue":null,"work_id":"f92f273b-6fd6-47f7-a220-c6f5d80e38eb","year":2015},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.981905Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:f06de3f0b7d57ccd8e1519b015c6ab603ec545ce71fae1fb386868fae9811cfc","observation_id":"40c9c841-afce-47e3-88d1-a9483ff02afd","resolution":{"observed_at":"2026-08-07T05:54:11.971180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.441320Z","title":"We used the pre-existing identifica- tion split, which uses roughly95%of the utterances for training and the remaining5%for testing","venue":null,"work_id":"9c473a61-d157-45b8-bba4-9c7100a068bd","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:04.381391Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:c63031d4366b246f292bde1f2cf35169d8daa2246b4a4ca86b18bb70ccfff0a2","observation_id":"ab08149a-b143-4b5d-a9dc-5e658b131205","resolution":{"observed_at":"2026-08-07T05:54:12.514529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:11.621912Z","title":"Is phoneme length and phoneme energy useful in automatic speaker recognition?","venue":null,"work_id":"2df2126a-fca6-4993-be92-c5d2307853e4","year":2014},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.128715Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:4fa765bee504acec6986029158a4c6c8b364e53c38cdb3775eb55cdd0bc62a52","observation_id":"e6651ab3-e85a-430b-beea-90175a08c77b","resolution":{"observed_at":"2026-08-07T05:54:11.788813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.783707Z","title":"Other works, however, such as [13] have found that content can have a substantial influence on certain aspects of the speaker’s prosody","venue":null,"work_id":"562e21b2-0f70-4644-a3fa-210a6dc1badc","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:03.842347Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:1d8e4126983e9c92623352cdf4d0f62e07f1eaea5c95f9ddb52084cc66809363","observation_id":"79f82602-70e2-48e3-8f0e-de41d3af3c31","resolution":{"observed_at":"2026-08-07T05:54:12.873829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:11.347443Z","title":"Intrinsic phone durations are speaker-specific,","venue":null,"work_id":"e277b69b-27b2-4503-b70b-4a6d73997016","year":2002},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.294335Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:bbada6fb8ddf75c39cb8d31182b35fed5745746e2e3f2f86e396d40eda4d77bb","observation_id":"a3fef487-3d24-482d-bc30-51e7fc883489","resolution":{"observed_at":"2026-08-07T05:54:11.491929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:11.053500Z","title":"What determines duration-based rhythm measures: text or speaker?","venue":null,"work_id":"a5d097f9-7556-48bb-8dc6-690cb5ea7dde","year":null},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.428798Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:659e0ed994d51e2adcfef21440f1f5e74a0b540da43a04fca150e215f934338d","observation_id":"878ef969-b1df-4b60-8b17-4f754decae99","resolution":{"observed_at":"2026-08-07T05:54:11.212587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:10.785289Z","title":"Extraction and representation of prosodic features for language and speaker recognition,","venue":null,"work_id":"e7c2f60d-795e-4ff6-b7be-59ec02aa70d1","year":2008},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.739504Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:6b55e7fb1bbdb771e04f58d2ba98a7d022c0897041bc1a0988f71be3acf4328f","observation_id":"3d853395-be5f-418c-93af-4b809e211051","resolution":{"observed_at":"2026-08-07T05:54:10.964542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17164","last_updated":"2024-12-22T21:18:08Z","snapshot_observed_at":"2026-07-06T20:11:51.206261Z","submitted_at":"2024-12-22T21:18:08Z","title":"Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization","version":1},"cited_work":{"arxiv_id":"2412.17164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17164","snapshot_observed_at":"2026-08-07T05:54:08.131069Z","title":"Analysis of Speech Temporal Dynamics in the Context of Speaker Verification and Voice Anonymization","venue":"eess.AS","work_id":"efe8f546-21bd-4b05-b8d2-2fa6fe84f9c2","year":2024},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.801906Z"},"links":{"cited_paper":"/paper/2412.17164","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:a85b71fead05bfe9ed0b976298faa44ed13452623a30abf38526d61a51f31183","observation_id":"ff9843ba-ad83-49a2-92a3-5a0cc28e648a","resolution":{"observed_at":"2026-08-07T05:54:08.210687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T05:54:06.944151Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.944151Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:9fa4d93b4500fde54a67bef0d4b3a7de833576abc62be93a3988eb03512c209a","observation_id":"95e1751b-1236-4cd7-9a5b-858ef3a85bc0","resolution":{"observed_at":"2026-08-07T05:54:06.944151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:10.001352Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"82960828-8127-4422-8a87-608d8c9ed9a5","year":2015},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.047270Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:621363f3da98510dd494ef0a77ef42ffb660096fcd7c6a793f9486c057caa680","observation_id":"8cd7a73f-c587-42bf-b65f-ba31151625be","resolution":{"observed_at":"2026-08-07T05:54:10.169887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.711034Z","title":"V oxceleb: a large- scale speaker identification dataset,","venue":null,"work_id":"91f8adaf-f993-487c-82ba-b9dcfe53891b","year":2017},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.126513Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:aedec8fe036f8615605971cfa063cf8e9e5c36b80ecfee3528e02c43e12cafe0","observation_id":"2cc2a9a4-e143-4516-ac91-7356b31f31f9","resolution":{"observed_at":"2026-08-07T05:54:09.869062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.519724Z","title":"On the importance of pure prosody in the perception of speaker identity,","venue":null,"work_id":"2417288a-28ed-40c6-b9e3-57002ec166de","year":2007},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.230664Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:1998a42fef5063342f3d5d223eb034723247ab1df7a216a4ac4996a919b48a52","observation_id":"22708e30-6233-4650-af6a-ecf4cd757192","resolution":{"observed_at":"2026-08-07T05:54:09.615160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5167/uzh-68554","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:07.541460Z","title":"Speaker idiosyncratic rhythmic features in the speech signal,","venue":null,"work_id":"38968a38-4d8c-4bf9-9ed7-d5d23d4152f1","year":2012},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.362057Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:ca71b309e455ff144649c35b65631364bc07b56ae39c53a7c294a66461a33f43","observation_id":"1fc3e0fc-4607-4b20-82b0-67155870bfbb","resolution":{"observed_at":"2026-08-07T05:54:07.585336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.338503Z","title":"How stable are acoustic metrics of contrastive speech rhythm?","venue":null,"work_id":"49fdd38e-423b-4586-8837-98537d626d2c","year":2010},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.451841Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:32c385e585e38beb0239cd3b8ce6967dcbba4d7262a1d28c1c3caa8adf0d1971","observation_id":"a67c0dcb-b08a-4288-aac9-bb840b46e271","resolution":{"observed_at":"2026-08-07T05:54:09.406348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.127194Z","title":"Speech rate normalization used to improve speaker verification,","venue":null,"work_id":"fb872b92-879d-4702-969e-9ad79d47862e","year":2007},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.559650Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:6180651df0403c72c0f51849116f209f8d7dd20aa7da3c4739a74cf5b0428846","observation_id":"701d603e-08e5-4652-96c2-2827259db652","resolution":{"observed_at":"2026-08-07T05:54:09.247335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:08.887594Z","title":"Phoneme duration modeling using speech rhythm-based speaker embeddings for multi-speaker speech synthesis","venue":null,"work_id":"cc94aabb-045d-43a5-bcb7-84f55c18c046","year":2021},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.735474Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:6858e471b8b1071b84e7abfe6a2d374e505c0507c3ad4cfcf043e3b713f755f7","observation_id":"a31148a8-0d21-46c6-8e8a-c7ef37354a60","resolution":{"observed_at":"2026-08-07T05:54:08.995644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:06.859629Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:06.859629Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:a33b96f7cda32f70b7a7e59d30d8873354c134a35d686a3a56e892ff470fd7e7","observation_id":"e3af9745-c40e-4454-8921-92433606a7d6","resolution":{"observed_at":"2026-08-07T05:54:06.859629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:07.029788Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.029788Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:7e036d661c81e02f77b4b80c0259e72c74ee5e9b25da1c81f898981446b3f8d4","observation_id":"a4b76104-1cff-4184-9d31-d430f5668a06","resolution":{"observed_at":"2026-08-07T05:54:07.029788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T05:54:07.103872Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.103872Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:75ab0049fdae275c1745986ed57c456b9f1d264e067baddd77145317398c91af","observation_id":"8fa06a12-12ce-44d2-a4d7-055ac1174e82","resolution":{"observed_at":"2026-08-07T05:54:07.103872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.05756","last_updated":"2020-08-13T08:41:44Z","snapshot_observed_at":"2026-08-04T11:23:04.700043Z","submitted_at":"2020-08-13T08:41:44Z","title":"Metrics for Multi-Class Classification: an Overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.05756","snapshot_observed_at":"2026-08-07T05:54:07.182515Z","title":"Metrics for multi-class classification: an overview,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.182515Z"},"links":{"cited_paper":"/paper/2008.05756","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:b9bf708f4e8d3dba32537d0875507a4e84c9c1ec924b9a94f19ef36029752cee","observation_id":"8d74c528-c8ac-4ed6-af2f-cc29a99eabe4","resolution":{"observed_at":"2026-08-07T05:54:07.182515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1303.1761","last_updated":"2013-03-07T17:33:06Z","snapshot_observed_at":"2026-07-06T03:08:12.137548Z","submitted_at":"2013-03-07T17:33:06Z","title":"Improving Automatic Emotion Recognition from speech using Rhythm and Temporal feature","version":1},"cited_work":{"arxiv_id":"1303.1761","doi":null,"metadata_source":"pith","pith_arxiv_id":"1303.1761","snapshot_observed_at":"2026-08-07T05:54:07.932401Z","title":"Improving Automatic Emotion Recognition from speech using Rhythm and Temporal feature","venue":"cs.CV","work_id":"c3eae18b-9e28-42e0-8bf9-03e97ec86bf5","year":2013},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.275427Z"},"links":{"cited_paper":"/paper/1303.1761","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:9f8f6d49b46202e0c510119d4ba888df64fef26a4a56e9fad30397a8f23592ff","observation_id":"421f1a32-f7e0-47a4-9dc3-69e2765aab3e","resolution":{"observed_at":"2026-08-07T05:54:08.006889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:08.607691Z","title":"Probing the in- formation encoded in x-vectors,","venue":null,"work_id":"421ba71b-2a3e-4e1d-a775-f4ac183be4f3","year":2019},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.324574Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:6f1e2cd645fa27cfa2bd3721aa758140f42277bb77d5c8509799b5398f708c5c","observation_id":"d64348cd-c582-481b-8c7d-222d99e010e1","resolution":{"observed_at":"2026-08-07T05:54:08.741765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03520","last_updated":"2020-04-08T01:59:48Z","snapshot_observed_at":"2026-08-01T21:29:58.493239Z","submitted_at":"2020-02-10T03:28:39Z","title":"An empirical analysis of information encoded in disentangled neural speaker representations","version":2},"cited_work":{"arxiv_id":"2002.03520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.03520","snapshot_observed_at":"2026-08-07T05:54:07.784225Z","title":"An empirical analysis of information encoded in disentangled neural speaker representations","venue":"eess.AS","work_id":"dea089f3-ecc7-46b5-b4fb-bfccfe5fe28d","year":2020},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:07.435997Z"},"links":{"cited_paper":"/paper/2002.03520","citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:4d4a1592705621264846a32418274106d7c508a9707e2ea423475525937307bd","observation_id":"8ba2e869-2962-4fd8-b72e-65056bfdd04d","resolution":{"observed_at":"2026-08-07T05:54:07.850121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1515/lp-2013-0012","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:07.651357Z","title":"Available: https://doi.org/10.1515/lp-2013-0012","venue":null,"work_id":"74d0b377-b12d-4fc8-9f79-deec8b5fdc09","year":2013},"citing_paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T05:54:05.581631Z"},"links":{"citing_paper":"/paper/2506.06834"},"observation_digest":"sha256:06fed42f83349a84b7f3d6d1928aca7bd829b54c2502e6c87985216ac98ae136","observation_id":"2e035620-68bf-4465-95bf-3bfac055ce88","resolution":{"observed_at":"2026-08-07T05:54:07.708316Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06834","last_updated":"2025-06-07T15:25:52Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T05:45:59.398950Z","submitted_at":"2025-06-07T15:25:52Z","title":"Rhythm Features for Speaker Identification"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":5,"verified_fuzzy":20},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2506.06834."}