{"as_of":"2026-08-08T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6b65a9d8fe7ba27f18da04b6917e333e941c6fd43dc50bfb25f5b5a91d4e503","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:57:58.765425Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01014/citation-record","integrity":"/paper/2506.01014/integrity","json":"/paper/2506.01014/citation-record.json","paper":"/paper/2506.01014"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-07T11:57:52.905967Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:52.905967Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:880785d26e6597ad9e6a655324362437b895e45978c02c27dc1436b36489881f","observation_id":"38d25a94-b079-4b34-b82c-8025f1e96b67","resolution":{"observed_at":"2026-08-07T11:57:52.905967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:52.955766Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:52.955766Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:3e3e767368ea2c9be718cb46d7f71cc890572650cd71d4921d35cede84dde3c0","observation_id":"c7f5f8b2-b36c-4fca-a839-3ca834b247b0","resolution":{"observed_at":"2026-08-07T11:57:52.955766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:04.274371Z","title":null,"venue":null,"work_id":"ebd96d2d-00b4-4cd9-abf1-527fd8d42b4a","year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.033119Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:8a142af3f144dc88ad3c8d32130615b9a2ace39d575e914632bc700d5c18521f","observation_id":"89ea1668-8d61-4086-a81d-24fc87b325c1","resolution":{"observed_at":"2026-08-07T11:58:04.353568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-07T11:57:53.123372Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.123372Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:3a56da1561641bce196d41139b726098f0e2fd7f175793b2ef786120236dfe3a","observation_id":"e09b1a57-04d0-49ba-8c69-0534c4b3caf5","resolution":{"observed_at":"2026-08-07T11:57:53.123372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:53.197089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.197089Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:73884c39e2efe5e4717288027b967296b76f7dd1077c6abf01b69dc5da1d1bbf","observation_id":"b817de5d-3101-42f9-a9da-6f10b7d13b94","resolution":{"observed_at":"2026-08-07T11:57:53.197089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:04.161154Z","title":null,"venue":null,"work_id":"e72b1bb9-4695-484d-913a-2cd3232da3d9","year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.280290Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:694c3e78273a77d17e07978d92d670af8c87fb76643fa9c468c3c3d22bb6f090","observation_id":"581be289-39dd-4168-85cc-453796310224","resolution":{"observed_at":"2026-08-07T11:58:04.208982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:53.363511Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.363511Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:549b89f5d366cfa7d162b74b02c6b44e790a0cba4922e837382a6264385be2e5","observation_id":"194d703a-c2d1-44d1-bd78-ab1f68270d09","resolution":{"observed_at":"2026-08-07T11:57:53.363511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:53.455534Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.455534Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:c10c0df1b12e3fb184b20009370900e824714ed66ac7f72806dc914bf4b2ae18","observation_id":"eba784b5-586e-45da-a327-4aec060f0d85","resolution":{"observed_at":"2026-08-07T11:57:53.455534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T11:57:53.579781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.579781Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:2f395043362f5366b856df5b7fe3072071c74fc314c57bf3437835ffd9062fcf","observation_id":"32bf995c-c284-45a8-a193-1b8716f26a6c","resolution":{"observed_at":"2026-08-07T11:57:53.579781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05004","last_updated":"2024-09-10T07:36:03Z","snapshot_observed_at":"2026-08-02T00:12:30.461133Z","submitted_at":"2024-09-08T07:24:03Z","title":"Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":"2409.05004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05004","snapshot_observed_at":"2026-08-07T11:57:59.298524Z","title":"Disentangling the Prosody and Semantic Information with Pre-trained Model for In-Context Learning based Zero-Shot Voice Conversion","venue":"cs.SD","work_id":"102891db-3000-49ca-be43-cf8e3fd00b44","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.676109Z"},"links":{"cited_paper":"/paper/2409.05004","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:2d82f07320f108759d1b692d9f5d622a8312170251fa6d7660071b5af87e9bdc","observation_id":"05b61b72-2870-401e-a94a-c8dcb5d5c3bd","resolution":{"observed_at":"2026-08-07T11:57:59.413191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:04.005601Z","title":null,"venue":null,"work_id":"f998d91e-92bb-4ab4-ad27-6f3bf500aaee","year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.765242Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:019484991c030f446a41e87e146f1be1e8dfa696844fa90aa4482c8dada43461","observation_id":"1ab76522-5040-4f30-b14a-b8f57a6843fd","resolution":{"observed_at":"2026-08-07T11:58:04.059432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:03.823984Z","title":null,"venue":null,"work_id":"ea909a95-da34-47bf-b3b9-277a20199910","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.827961Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:73c534fe2a26f79cff52a11e137b3e5739dc9cb44a2011778a1eef9a53eb5ec2","observation_id":"21d83468-2f73-4291-8f10-4236534ce8c9","resolution":{"observed_at":"2026-08-07T11:58:03.934643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:53.929896Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:53.929896Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:63eaa81568ad5d9bf7d778ab4787137c3c3d771dd3e04bb4f7fdb8e6dec26685","observation_id":"72551652-2fe0-4c55-82f5-946363f2de40","resolution":{"observed_at":"2026-08-07T11:57:53.929896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:03.656744Z","title":null,"venue":null,"work_id":"83b96026-dd0b-4727-a64f-dfa191290096","year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.010198Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:42738a2d81cab368aa768806e075d6ee474248ced8e093364943db44f1882a88","observation_id":"8dbd4a8f-24be-4cb8-8866-b0912b91c323","resolution":{"observed_at":"2026-08-07T11:58:03.750196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T11:57:54.139886Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.139886Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:773cfd394ab530758af9125bf41df79e94dcf18f0aa6a22ab2241903031b3806","observation_id":"d80529e1-36eb-42b1-99ba-0d879ff74356","resolution":{"observed_at":"2026-08-07T11:57:54.139886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:57:54.230519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.230519Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:f3fa53ce1c178314dc021d2ecc47dc8004604cf32a0fcdbb930a968edb7714da","observation_id":"b13031cd-a261-4688-ba61-668a843c3826","resolution":{"observed_at":"2026-08-07T11:57:54.230519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:03.507043Z","title":null,"venue":null,"work_id":"a52728da-786f-4d47-a067-e7aadac1e752","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.346880Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:977507289f210e66be3b6f7749bbe00ed9d5c438ede332a455734ddf9fb90e73","observation_id":"cf9e741a-dae9-415b-bde6-8f6513ab188c","resolution":{"observed_at":"2026-08-07T11:58:03.589436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-07T11:57:54.439796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.439796Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:4e02d2b62995a7aa6261ec128eb7e3df810d92ae9d484971b985750d8be7e69a","observation_id":"d2a71f00-d7e3-4420-8fa9-6903b4c953a9","resolution":{"observed_at":"2026-08-07T11:57:54.439796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09324","last_updated":"2019-09-04T16:31:39Z","snapshot_observed_at":"2026-07-06T07:47:18.266108Z","submitted_at":"2019-04-19T19:53:01Z","title":"Mask-Predict: Parallel Decoding of Conditional Masked Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09324","snapshot_observed_at":"2026-08-07T11:57:54.510572Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.510572Z"},"links":{"cited_paper":"/paper/1904.09324","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:4d5170db0bdd0cb42d75a9ca745ed7de452cf48eb0b0f9c85f6816a17e010072","observation_id":"27484177-5d76-43dc-9ca0-8ea5faca325b","resolution":{"observed_at":"2026-08-07T11:57:54.510572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02500","last_updated":"2021-10-06T04:29:31Z","snapshot_observed_at":"2026-07-06T11:54:50.811616Z","submitted_at":"2021-10-06T04:29:31Z","title":"MediumVC: Any-to-any voice conversion using synthetic specific-speaker speeches as intermedium features","version":1},"cited_work":{"arxiv_id":"2110.02500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.02500","snapshot_observed_at":"2026-08-07T11:57:59.024349Z","title":"MediumVC: Any-to-any voice conversion using synthetic specific-speaker speeches as intermedium features","venue":"eess.AS","work_id":"d6e98060-10e9-4584-8a42-51997260e8c8","year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.567494Z"},"links":{"cited_paper":"/paper/2110.02500","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:6741e21cbe66e23555b15b75a7546a2c150db7356d6b7b2a439763d9f27a16f9","observation_id":"f63d4f61-f714-4075-b64c-a4f4d694ea45","resolution":{"observed_at":"2026-08-07T11:57:59.123510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:54.657875Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.657875Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:1c69d1419bea32d03aa8e4624192c466d2d78a39a923af963513eae96b8cf5b8","observation_id":"51decf03-400d-4ecb-ac65-7892b518b3d7","resolution":{"observed_at":"2026-08-07T11:57:54.657875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:03.228869Z","title":null,"venue":null,"work_id":"24130f7d-9346-4939-94c3-c4905c992390","year":2016},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.756558Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:b8fc5ba595f1c9e37fe728b703c83f525d71351118ba46f02fab85b17e43af48","observation_id":"63d2ecc1-f75f-4f37-9dc0-d383d3e50e03","resolution":{"observed_at":"2026-08-07T11:58:03.383539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:54.854469Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.854469Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:e180af76c4b3504bdba4f50830d53a36f97d618d0a3fd0f45024513abfdd7210","observation_id":"1bc718d5-c30b-4b77-8886-5440106dbc00","resolution":{"observed_at":"2026-08-07T11:57:54.854469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09378","last_updated":"2024-06-02T16:11:18Z","snapshot_observed_at":"2026-07-06T17:30:12.459471Z","submitted_at":"2024-02-14T18:24:41Z","title":"MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09378","snapshot_observed_at":"2026-08-07T11:57:54.972647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:54.972647Z"},"links":{"cited_paper":"/paper/2402.09378","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:d67de30e82bf6d630700d8543cb3c9ea1d8dbc462e83603ac6822c0510f2ba4b","observation_id":"1bd65400-f89d-4084-8c85-9da96d585ee4","resolution":{"observed_at":"2026-08-07T11:57:54.972647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:02.977288Z","title":null,"venue":null,"work_id":"00e99169-8fab-4bd9-a7e9-f7a2abc8f966","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.056896Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:25911d4a0769885adf1e79e3e8a45a1cf6cac597c6a2f94cb0ef7e86ca791f02","observation_id":"5236766c-cf3b-4124-a3e3-07af62175986","resolution":{"observed_at":"2026-08-07T11:58:03.053981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:02.743106Z","title":null,"venue":null,"work_id":"dc4045e6-df59-44ce-bec5-47efd104ee2f","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.151336Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:7e570206f6feea6e83c1659067dfc10d1c0bbb00a52aa7000ec104b47451c9ec","observation_id":"a37a5b43-96e3-4b98-874c-1406d3836d09","resolution":{"observed_at":"2026-08-07T11:58:02.853345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-07T23:06:04.015261Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T11:57:55.278735Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.278735Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:0ab648c8a52f241f30ed95640084a5fb3bac0c7397d7ceadd207a3ea8df58775","observation_id":"099d9eb2-9a58-43c6-b9b0-a7be49a96e24","resolution":{"observed_at":"2026-08-07T11:57:55.278735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13612","last_updated":"2023-05-23T02:20:47Z","snapshot_observed_at":"2026-08-07T23:40:14.334287Z","submitted_at":"2023-05-23T02:20:47Z","title":"FluentSpeech: Stutter-Oriented Automatic Speech Editing with Context-Aware Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13612","snapshot_observed_at":"2026-08-07T11:57:55.376753Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.376753Z"},"links":{"cited_paper":"/paper/2305.13612","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:a98b63ff1fd2d677e16e823bfbce3350e453651038ab50da7dd50ec66de3cdc3","observation_id":"f337b738-170c-41ff-8ea0-a29a7e419edc","resolution":{"observed_at":"2026-08-07T11:57:55.376753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T11:57:55.431961Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.431961Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:c1eab2930ddc829dee2ba650a6f0878d1586c43c3f060641c83f3900e2c98367","observation_id":"4bb006b5-536b-4e8a-a5f3-a3255812c666","resolution":{"observed_at":"2026-08-07T11:57:55.431961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16083","last_updated":"2023-06-28T10:30:39Z","snapshot_observed_at":"2026-07-06T15:47:42.066252Z","submitted_at":"2023-06-28T10:30:39Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16083","snapshot_observed_at":"2026-08-07T11:57:55.516532Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.516532Z"},"links":{"cited_paper":"/paper/2306.16083","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:8afd4d7f777cfd32d6dca6220d0df2539d376ad8cd18d94696101b0b5168a11c","observation_id":"f4fbd85a-ea62-487c-91ee-c9dd51282a97","resolution":{"observed_at":"2026-08-07T11:57:55.516532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:55.648763Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.648763Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:94d264dd3745ae158e55df9fb6cc83a848dfbe66ca3fecbbec5daa12f7fdd150","observation_id":"27307b2b-e534-44a4-b1f9-18abccaca19b","resolution":{"observed_at":"2026-08-07T11:57:55.648763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:02.556474Z","title":null,"venue":null,"work_id":"acdd0d2f-12a5-4710-a0d3-3c0e4ab09883","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.757872Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:4d8d4e42cca1963d6cbc074d034b19b3d575925cd61c50b56449bf2980556d1c","observation_id":"035da5ea-36af-458d-a03b-2284abf22b93","resolution":{"observed_at":"2026-08-07T11:58:02.634045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08352","last_updated":"2022-05-04T18:16:38Z","snapshot_observed_at":"2026-08-06T07:54:31.859843Z","submitted_at":"2021-12-15T18:56:35Z","title":"Textless Speech-to-Speech Translation on Real Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08352","snapshot_observed_at":"2026-08-07T11:57:55.867593Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.867593Z"},"links":{"cited_paper":"/paper/2112.08352","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:c9ec64e44b2813a9b384ab3a66b96ed694c4d3a368e375d922da61a57f72fcc6","observation_id":"5d8f1a49-32f2-44d6-974e-2181f9e3b130","resolution":{"observed_at":"2026-08-07T11:57:55.867593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-07T11:57:55.976737Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:55.976737Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:d5fc45cae6a3df172e02212cbc01f4a10fa2cd153b379bcfc90dc52522bf6ec0","observation_id":"3cbbd4e7-709a-402c-b2e3-a61fcb7b3d06","resolution":{"observed_at":"2026-08-07T11:57:55.976737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:02.329213Z","title":null,"venue":null,"work_id":"a73bc6a4-a721-4d51-8c4a-9a1b1242b502","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.134501Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:43a1d877e00dc9512182a21d79f5da04bb4ceaf623ead97020632df816c1295f","observation_id":"1d0957c8-4229-414f-9d30-919cd3ec2fa8","resolution":{"observed_at":"2026-08-07T11:58:02.460664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T11:57:56.247088Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.247088Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:f34c7799e0a9d9fa8f8a338c579abe5857d04fbaf5cfcb332071640b5c357252","observation_id":"c4fd1e94-a673-48d0-bbbc-d0ec26c9ee8c","resolution":{"observed_at":"2026-08-07T11:57:56.247088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.02388","last_updated":"2021-01-07T06:12:28Z","snapshot_observed_at":"2026-07-06T10:30:38.112588Z","submitted_at":"2021-01-07T06:12:28Z","title":"Knowledge Distillation in Iterative Generative Models for Improved Sampling Speed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.02388","snapshot_observed_at":"2026-08-07T11:57:56.372812Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.372812Z"},"links":{"cited_paper":"/paper/2101.02388","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:47300ea86183b144d4195ec982e4c34710d6f72fdeb15523741a6a88fc37f1a8","observation_id":"3e476ba7-ba09-4448-8c7e-9ac598fdb2dc","resolution":{"observed_at":"2026-08-07T11:57:56.372812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T11:57:56.482687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.482687Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:4431edeb74a10a663f49a7ee2008cd2b427466dcc46a9f59827f808c99f8a6f3","observation_id":"3a23ebd0-dc44-4dec-b950-692437c41977","resolution":{"observed_at":"2026-08-07T11:57:56.482687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:02.073588Z","title":null,"venue":null,"work_id":"1feaffee-f636-4ec7-80ec-2b37ccaf733b","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.548014Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:2616b3d0e15784f18e4f46f69626c1b45b40fc03f8c6e437598d260cd74b5aae","observation_id":"03fb08b3-7c88-4ed6-9b0a-3e76491da0b2","resolution":{"observed_at":"2026-08-07T11:58:02.197042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:01.823652Z","title":null,"venue":null,"work_id":"cfa1d331-66bb-4b52-a7ac-2e4877a60878","year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.596232Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:85c6e321c8bf020d3e8f70de92f817956757bb97b3284c952de37d685397b9ba","observation_id":"9a656261-a28d-4979-88e0-467297e25310","resolution":{"observed_at":"2026-08-07T11:58:01.952999Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:56.668987Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.668987Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:f1dfee16f3bae1aaa2c994ace020ab88aa605d922f82c7c43eb029c21491a543","observation_id":"a5ff42f1-612c-48e7-a285-354a38602191","resolution":{"observed_at":"2026-08-07T11:57:56.668987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:56.739767Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.739767Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:1ca5f0c18890bd711bfdd873f50d94ea443e6d3777be3b4f1a120a706ccee220","observation_id":"b099018a-4dd1-4e22-b5ac-b539385b70db","resolution":{"observed_at":"2026-08-07T11:57:56.739767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-07T17:24:03.888611Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T11:57:56.791796Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.791796Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:86d6147a48ae87f1984f77e1e737a0062f1535f4d04f4ae69f8eb3046912789b","observation_id":"0e065f7e-7662-4794-9666-584dcf6a3aff","resolution":{"observed_at":"2026-08-07T11:57:56.791796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03411","last_updated":"2020-12-19T09:18:21Z","snapshot_observed_at":"2026-07-06T10:21:14.277598Z","submitted_at":"2020-12-07T01:53:45Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03411","snapshot_observed_at":"2026-08-07T11:57:56.830247Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.830247Z"},"links":{"cited_paper":"/paper/2012.03411","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:ef184b36292331148d3d18265365078d76d6ac8a4c07ebf617bdab63ab6bb152","observation_id":"98bc9301-58e2-4945-99dd-53b8f18f33e6","resolution":{"observed_at":"2026-08-07T11:57:56.830247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:56.890270Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.890270Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:33f583556701b902f4cab55d0ad19c5b235b314e331989b537c03021118d64ba","observation_id":"78a6aee9-9072-43e8-95cf-8670ba984e33","resolution":{"observed_at":"2026-08-07T11:57:56.890270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:56.944243Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.944243Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:0934db013c15793e9933f43e1475e5e429da5b908e87e2dc8f948b1bf325bb9c","observation_id":"33c6f6a0-8869-44e0-a6af-7c19e38f06fa","resolution":{"observed_at":"2026-08-07T11:57:56.944243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:01.486661Z","title":null,"venue":null,"work_id":"ab4910b5-fcd6-4b1f-998f-2a3535cfab80","year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.008061Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:1de1d6d47b4232e8d7833294ffa80661114bdef345db825c01ec1884761a0a1b","observation_id":"be88ad5e-7c92-4272-8a59-a07c08d310bc","resolution":{"observed_at":"2026-08-07T11:58:01.639144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T11:57:57.095178Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.095178Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:5a48d8bb4cf038374a8d0c3ec2d3fa8b56a9f08e5a6d4107b7882f62da4dab65","observation_id":"efc2faeb-653e-409e-a4f3-2bf05cc63a5b","resolution":{"observed_at":"2026-08-07T11:57:57.095178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:01.144421Z","title":null,"venue":null,"work_id":"8a1c2f64-723f-43e7-86ef-486dd7027341","year":2018},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.166629Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:9050f713356a721745f73567f17168a4c3d7ab9aad15d19bea2f6f70c714718d","observation_id":"f9434126-9f9e-4a0b-845e-5d9a6b67a60e","resolution":{"observed_at":"2026-08-07T11:58:01.363414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:57.217705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.217705Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:7d80caa382b75dea787514c0ea65a4e3ce58cdb99f22f80ee6959636a99a65f2","observation_id":"f995b467-7b20-41da-a231-2bae8b24c8ab","resolution":{"observed_at":"2026-08-07T11:57:57.217705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:00.828452Z","title":null,"venue":null,"work_id":"a5d42d1e-5694-482c-8048-c6f49e7d6db9","year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.297676Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:b3959929219e180ee2ffa8d892eb623ab3c3ba6b073c549c8c3cb31e356f4370","observation_id":"a100a732-360f-4f38-b10a-dac6c2826017","resolution":{"observed_at":"2026-08-07T11:58:00.961886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-07T11:57:57.479107Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.479107Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:a2142af31a7ad22a1ca04d662abaa6891205cfdecc26b816edd4e9dc7b176bc4","observation_id":"f9bf2833-ec7b-4a92-adae-8ffed977b3b7","resolution":{"observed_at":"2026-08-07T11:57:57.479107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:57.567859Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.567859Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:85b492ddc1301f5fcfcacb1a9085d906ae72b81fbf9dfc1e7bd2443f2b28e09b","observation_id":"4b9bd6df-8e10-4637-b59f-ea8c2adc5300","resolution":{"observed_at":"2026-08-07T11:57:57.567859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:00.593842Z","title":null,"venue":null,"work_id":"8cef2a68-55cd-46b4-a78f-84db2388cc8c","year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.634345Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:0fb53dc179747876ac70df9a76b229f7f7b4525d68b6dfa5c2712a78eceacce2","observation_id":"d7f4e17f-d9c7-4056-8a25-52e9869abdce","resolution":{"observed_at":"2026-08-07T11:58:00.698310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:00.369869Z","title":null,"venue":null,"work_id":"df616936-838e-4d6c-9356-0d21c454f6b3","year":2022},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.706883Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:39f31f79d0dd81edac910a1a91239aeb8c243193f59d18bf7cd073b8c3e4c899","observation_id":"faf478a8-f272-4e06-b725-4b4ec0d2d53c","resolution":{"observed_at":"2026-08-07T11:58:00.468755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T11:57:57.777008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.777008Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:57bb983f69723c3a8b7601788a4b4a78827faab5831f5f650b0a5065d56a451d","observation_id":"f6ba4eca-b7b4-4add-aca3-978fb8275282","resolution":{"observed_at":"2026-08-07T11:57:57.777008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:00.209501Z","title":null,"venue":null,"work_id":"770f3590-9d05-40e0-8e70-9d7375126418","year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.868990Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:0fd66fb651a63cf7cb21e4437f321b712343a986430db01490d701ddcb9aa4c5","observation_id":"0517771c-298a-453e-bb5b-b38d4d825bb4","resolution":{"observed_at":"2026-08-07T11:58:00.278499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04154","last_updated":"2020-06-07T14:01:16Z","snapshot_observed_at":"2026-07-06T09:26:43.943376Z","submitted_at":"2020-06-07T14:01:16Z","title":"VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04154","snapshot_observed_at":"2026-08-07T11:57:57.924644Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:57.924644Z"},"links":{"cited_paper":"/paper/2006.04154","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:3bf672e7e77160b39373d47101035b46c8702f4dc8f082cf0dd1277903c99b29","observation_id":"143d9387-a245-4dfd-a68f-a5590dced3b3","resolution":{"observed_at":"2026-08-07T11:57:57.924644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T11:57:58.032031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.032031Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:ab1b8017520096a17004ae63c3edc0f0aaa157fa5509be85270c52898a0e5247","observation_id":"4eb02c9c-0049-4412-b20a-1d0f0b385f28","resolution":{"observed_at":"2026-08-07T11:57:58.032031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14006","last_updated":"2024-07-19T03:36:48Z","snapshot_observed_at":"2026-08-04T23:04:33.326889Z","submitted_at":"2024-07-19T03:36:48Z","title":"MSceneSpeech: A Multi-Scene Speech Dataset For Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14006","snapshot_observed_at":"2026-08-07T11:57:58.145318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.145318Z"},"links":{"cited_paper":"/paper/2407.14006","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:8e350331746755fb470735c9883f97821d7c0df75c7b9b74ee492933aa4c6ee2","observation_id":"cb33f6ef-e28f-49ba-a466-cfa9380b5009","resolution":{"observed_at":"2026-08-07T11:57:58.145318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:00.017345Z","title":null,"venue":null,"work_id":"7d3df99f-10f6-4db4-b555-af8633c01158","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.273255Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:04d0410912703db42de3e583bc9357c0d01f4cc69f997afaeabb8960167af694","observation_id":"8763ebda-db9c-41a8-af97-e13d413a1377","resolution":{"observed_at":"2026-08-07T11:58:00.140176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:59.831703Z","title":null,"venue":null,"work_id":"f0fdd492-0cd8-4d77-8b63-444c3f614c04","year":2024},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.358649Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:e1e14661ae449623bd3f88f29c587b45875d5f6b7165667a7d7895841c0d9912","observation_id":"04e3382d-7c43-48f5-8415-1d473c2413f5","resolution":{"observed_at":"2026-08-07T11:57:59.914696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:59.597660Z","title":null,"venue":null,"work_id":"f9f7429b-7798-430f-a276-fcdc77ef4cbe","year":2021},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.481374Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:fe5bf096f07d21ee86199eeac30c1d86e91f7f4e9dd06c7263ad618969ae2918","observation_id":"96970e81-9e15-4472-85e1-f9dd7df7dbc4","resolution":{"observed_at":"2026-08-07T11:57:59.694346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-07-06T20:33:15.472157Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-07T11:57:58.568919Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.568919Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:925cbeace81f7f176a3e786d31b5459d646a2dec5226798b34643c169165ef65","observation_id":"69fa6331-1fd0-4995-8696-417777240f33","resolution":{"observed_at":"2026-08-07T11:57:58.568919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:58.650853Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.650853Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:83968c728d44230f2abd36f97194a4a966f9088010ef8ff59901780c5ffe379d","observation_id":"43bc621d-2fb8-4b70-b357-d1cfe5ca4e28","resolution":{"observed_at":"2026-08-07T11:57:58.650853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:57:58.765425Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:58.765425Z"},"links":{"citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:1813c6d1df44a0ed44ad35b163fca499f379d9517415a0c12ac154797ad09b2b","observation_id":"71256349-6257-4860-91a1-daafe689e080","resolution":{"observed_at":"2026-08-07T11:57:58.765425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2506.01014."}