{"as_of":"2026-08-22T23:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:117e08d7540751f223b66480d0b95f13673bc45b359accf39a42e326a8bf2c6d","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:42:51.295730Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:42:51.095849Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T00:42:51.460473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"cited_work":{"arxiv_id":"2608.11590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11590","snapshot_observed_at":"2026-08-16T00:42:51.460473Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","venue":"cs.SD","work_id":"0eda55ff-8efd-42e5-8a27-827439a50884","year":2026},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.095849Z"},"links":{"cited_paper":"/paper/2608.11590","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8efea4deb8ed43d76ee81bc859331cae057a81693b4b4c64163ff354f47883b1","observation_id":"98a2c2dc-f6b3-4b3c-8074-158163818324","resolution":{"observed_at":"2026-08-16T00:42:51.465765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.11590/citation-record","integrity":"/paper/2608.11590/integrity","json":"/paper/2608.11590/citation-record.json","paper":"/paper/2608.11590"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"cited_work":{"arxiv_id":"2608.11590","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.11590","snapshot_observed_at":"2026-08-16T00:42:51.460473Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","venue":"cs.SD","work_id":"0eda55ff-8efd-42e5-8a27-827439a50884","year":2026},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.095849Z"},"links":{"cited_paper":"/paper/2608.11590","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8efea4deb8ed43d76ee81bc859331cae057a81693b4b4c64163ff354f47883b1","observation_id":"98a2c2dc-f6b3-4b3c-8074-158163818324","resolution":{"observed_at":"2026-08-16T00:42:51.465765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.925583Z","title":"By decomposing human voice into style, content, and prosody, CookV oice successfully unifying multiple voice generation task within a unified model","venue":null,"work_id":"1da1f684-da04-4612-9c53-5e184286a86c","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.101490Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:fb7d3a61f986766b1701a32f9d6f10f35fb04c51ccba81372d07c3fd4a988494","observation_id":"b79a8942-3775-423d-b626-9630037b115d","resolution":{"observed_at":"2026-08-16T00:42:51.930837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.910102Z","title":null,"venue":null,"work_id":"970db16f-d9c4-4ed0-9958-349d7fa2b344","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.106606Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:63e77fc62b781667756197dcf54b51857d928bca15579e7e3798a4ae9935a541","observation_id":"a86d69a5-5434-405c-898d-0a53177e79d3","resolution":{"observed_at":"2026-08-16T00:42:51.914976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.895190Z","title":null,"venue":null,"work_id":"793101f0-34f5-48c8-8ff7-943338e1ccc5","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.112317Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:f4acc128225f2c5ffb5a1c4e3dee8675119a222676d3ebc9622e9e62c11efad4","observation_id":"be907e9c-246b-4088-b820-9c97f3426f48","resolution":{"observed_at":"2026-08-16T00:42:51.899631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.880596Z","title":"Problem Formulation Human V oice Generation (HVG) is to generate waveform from different modality of control signal","venue":null,"work_id":"e82de266-fcfe-4085-b3de-994e62e82faf","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.117568Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:cbaf6bb6ea8c35f02ce5f6bdcebf3f00c04f14662b3f9c64ddb5ed7953795347","observation_id":"334ab11e-101c-4624-9871-3381d6496da4","resolution":{"observed_at":"2026-08-16T00:42:51.885249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.865308Z","title":"This section will present the architecture of CookV oice in detail","venue":null,"work_id":"454c4a2e-4ed7-4a5e-8721-bb86386c901c","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.122723Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:2e5e4fd927f373ae2c55e050aa9012c67f149b1708e7a473b5011a4901f9404f","observation_id":"69ae5454-0479-4350-b803-a2ce807068bc","resolution":{"observed_at":"2026-08-16T00:42:51.870567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.850077Z","title":null,"venue":null,"work_id":"830c5c30-3508-4959-b520-4182b61330f0","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.128595Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:b50010e8e0aadde3fd91146c6c1e1bc3128fb471570032c98d6de6761a5e20b4","observation_id":"74e7d7a9-1b77-43f9-b4be-a010e1e8d6c6","resolution":{"observed_at":"2026-08-16T00:42:51.854597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.833572Z","title":null,"venue":null,"work_id":"31f93550-4d95-432c-989e-d49923c3d05e","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.134204Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8ef58114c8a711a389c2fa1160c9fe3ce77bdd33fffd1c5fb13766cf926ffb7b","observation_id":"09750361-4f73-4943-9c79-bbb85e092703","resolution":{"observed_at":"2026-08-16T00:42:51.838302Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.818159Z","title":null,"venue":null,"work_id":"269bd1f5-490d-4ffe-8178-e44f0241576a","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.139569Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:7d66da3a8b2aece3ac3602202565b9eaada83454527831bbd9f6e4621564b1a6","observation_id":"a8d7a2b9-4130-4d71-8e6e-d6c6991cb19f","resolution":{"observed_at":"2026-08-16T00:42:51.823399Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.802201Z","title":null,"venue":null,"work_id":"48248fb5-905e-4369-b3ca-f092592a2be8","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.145027Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:912f4f89b9cd1a2472e8dc29ccee6838738cab583ef7825963b1d7832020879e","observation_id":"6e6461fa-f1dd-4461-80f2-26fc76b36fa5","resolution":{"observed_at":"2026-08-16T00:42:51.807315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.785578Z","title":"First, due to re- source constraints, CookV oice has not yet been scaled up","venue":null,"work_id":"f5745c4f-39c0-4eb0-a0c3-5a1b4297977b","year":null},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.149789Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:71d19e35aa802b4dca49634ff1a18c01b8f5eb6d711d260a8deb212fc5ef9eff","observation_id":"5f72e243-2ba4-4986-88e2-d1ebb6485937","resolution":{"observed_at":"2026-08-16T00:42:51.790639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:42:51.154323Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.154323Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:5038ff787f2c3afe6003abbe595941909cdbbb965b1fcc91311bd813f64a3b37","observation_id":"a37fe608-667b-48db-bff1-6fba55f0da50","resolution":{"observed_at":"2026-08-16T00:42:51.154323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-19T06:28:38.381687Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-16T00:42:51.159376Z","title":"Indextts: An industrial-level controllable and efficient zero-shot text-to-speech system,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.159376Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:4d0e74d358c89fde6cb81096458559c4fc45325bd3c659ce165b70cb658546ce","observation_id":"fe8eb4b9-9524-4521-94c9-caab31cddeb3","resolution":{"observed_at":"2026-08-16T00:42:51.159376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.768352Z","title":"Parastyletts: Toward effi- cient and robust paralinguistic style control for expressive text-to- speech generation,","venue":null,"work_id":"dfeff345-4d86-41b1-99a5-531dccf596fe","year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.165004Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:16a57dc1b81a0ccd8aa02fb5a3fecda91e4c7b6570ed9bf3064b42780263b368","observation_id":"66c686c9-89e8-42e3-85f1-9ec539400888","resolution":{"observed_at":"2026-08-16T00:42:51.773610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.171355Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.171355Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:3f40f0a053f1407378bd75d4f01282c873fb759cdd9286817b2a21f7fef3daa7","observation_id":"cf94d5fd-9273-42d3-bb02-07f2d22d7f1c","resolution":{"observed_at":"2026-08-16T00:42:51.171355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.176021Z","title":"Diffsinger: Singing voice synthesis via shallow diffusion mechanism,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.176021Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:89c325c42f3aeafc194fb9f0f1a84fa865a9a76bc6dab5019f097b00f8a73cd3","observation_id":"fe291923-ad50-4d6d-ad76-f99a0b6b1633","resolution":{"observed_at":"2026-08-16T00:42:51.176021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.181145Z","title":"Stylesinger: Style transfer for out-of- domain singing voice synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.181145Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:2a9b15bb928ad90dc9f71b98de285425411fc6c3d0b49f09a8ceb8c4fa1e7655","observation_id":"173cc171-d93c-4ca4-baaf-67182a6f41ac","resolution":{"observed_at":"2026-08-16T00:42:51.181145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.719974Z","title":"Tcsinger: Zero-shot singing voice synthesis with style transfer and multi-level style control,","venue":null,"work_id":"8f97b329-7f7a-4316-9369-32a75d85589d","year":2024},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.185523Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:80515cb195fe99955e8996b01befd01a7b45aed25f2f4432f4b53ac4352ff420","observation_id":"009b6443-3e49-41c7-b426-14c095605731","resolution":{"observed_at":"2026-08-16T00:42:51.725858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.702808Z","title":"Vevo2: A unified and controllable framework for speech and singing voice generation,","venue":null,"work_id":"3dd4ff96-8295-489b-bdb2-c89a5b4c3b00","year":2026},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.190152Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:4ea6d4b02cfd43eeda1771f03f50a52f954c04897bc1f81af9a7ec5b4e248fbc","observation_id":"974fac2a-68cb-4534-85db-f9e026e5b2e9","resolution":{"observed_at":"2026-08-16T00:42:51.708638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.194600Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.194600Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:53ccb55e65e5f265c5ee26d701c7404398d706e5f9ba7bab1713a142d9e81a3b","observation_id":"44a02b03-9794-4069-86ee-0e291628071a","resolution":{"observed_at":"2026-08-16T00:42:51.194600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.676360Z","title":"Param- eta: Towards learning disentangled paralinguistic speak- ing styles representations from speech,","venue":null,"work_id":"7e8ed5e7-c0d1-471f-9272-24f47955b445","year":2026},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.199775Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:157a6e57d0252b9ea646a308783691c220df48c0cb04e10706d52570335b89f8","observation_id":"45d1b6a3-090a-4493-9669-e6bdd0ee010c","resolution":{"observed_at":"2026-08-16T00:42:51.681297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.204364Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.204364Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8e2e580b1d7c03139b2f8c5513b7384287b2a64d45541dac8b7b6042f7d3f5a4","observation_id":"5d62aaf7-8d75-45a5-8d63-47ff93c4e04a","resolution":{"observed_at":"2026-08-16T00:42:51.204364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-16T00:42:51.209215Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.209215Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:c42ce2d2680d02b9eff9af3e70defd63a5ffc25df69a974cad5aa853b9c609ce","observation_id":"3c36f22b-0f7b-4694-a4fc-aaa26f3db153","resolution":{"observed_at":"2026-08-16T00:42:51.209215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.214007Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.214007Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:1fe8b41e13ece5345094570839fa2893eb8b21966180b2349eedfd0899459269","observation_id":"0ccf258c-424b-447b-9257-f5ed5b413d3c","resolution":{"observed_at":"2026-08-16T00:42:51.214007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.218977Z","title":"M4singer: A multi-style, multi- singer and musical score provided mandarin singing corpus,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.218977Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:b6473335cd173156765699ff015e158cba397709ba2bc794e508a9ce32f8d10b","observation_id":"12131af5-38dc-4fe5-a1d8-9bd92cdd06e6","resolution":{"observed_at":"2026-08-16T00:42:51.218977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.629936Z","title":"Vevo: Controllable zero-shot voice imitation with self- supervised disentanglement,","venue":null,"work_id":"2708215d-042e-4050-832e-9d2247cb7188","year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.224026Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:81b820703396348f294805ffc0d182cea25a665dc9a1d896b5e5ebc799da04a4","observation_id":"6ad2d683-fcdf-47c6-9e7e-6f8e61f1bac7","resolution":{"observed_at":"2026-08-16T00:42:51.634876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.228726Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.228726Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:bcef3e887a2bac0e39fe770b1a1c280759beb16e8c4232de668eb409f68b9adb","observation_id":"d17a0e1f-4fa3-4448-8e36-28f637dd63a7","resolution":{"observed_at":"2026-08-16T00:42:51.228726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.233657Z","title":"Mpnet: Masked and permuted pre-training for language understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.233657Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8dc7ecce573646f2b25d24e57840ce8ea95a0e51ce7e8be35c3b8ab42cfdfcba","observation_id":"abd90a01-1665-4d68-b65a-076bb6eac9df","resolution":{"observed_at":"2026-08-16T00:42:51.233657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.238525Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.238525Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:d5390c98aa2e07e4344b12957a8634195c974a778d1b3a9cc8ed4522a5becb65","observation_id":"d83b9c17-b824-4ef4-926e-2b3fe6922816","resolution":{"observed_at":"2026-08-16T00:42:51.238525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08274","last_updated":"2025-04-11T06:12:57Z","snapshot_observed_at":"2026-08-16T12:42:09.083694Z","submitted_at":"2025-04-11T06:12:57Z","title":"Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation","version":1},"cited_work":{"arxiv_id":"2504.08274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.08274","snapshot_observed_at":"2026-08-16T00:42:51.386447Z","title":"Generalized Multilingual Text-to-Speech Generation with Language-Aware Style Adaptation","venue":"cs.SD","work_id":"15cc7c3f-121f-4676-885f-f2dcf559318c","year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.243406Z"},"links":{"cited_paper":"/paper/2504.08274","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:83a0508fc3838e079062a3eb272a7764c23fe1c3757fe6a31928e9af3b2c4228","observation_id":"0c328557-4944-40be-9b3c-1d8dd6b3f201","resolution":{"observed_at":"2026-08-16T00:42:51.392027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-17T12:01:30.659594Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-16T00:42:51.248293Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.248293Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:61e21d6750a24fbffcb1f2a2354edd5c4b4e00e8b8db802eb66ff7f3d463964f","observation_id":"0ca79004-7c70-42aa-a609-fc8b51d69561","resolution":{"observed_at":"2026-08-16T00:42:51.248293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.583503Z","title":"Chinese mandarin female corpus,","venue":null,"work_id":"f81a86ea-4e26-43d9-9aa6-4b7fb327eb8b","year":2020},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.253351Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8288555f00473ce0c05681b8917fda7514a37f0e05a46c5760a80669218cee05","observation_id":"217af388-708a-4e4a-b532-f2b313c347d5","resolution":{"observed_at":"2026-08-16T00:42:51.588447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.257760Z","title":"The lj speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.257760Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:5dd945793874a4f9a68156357f849990677510656bf975929d79f303b48833f4","observation_id":"b8010839-144b-4a12-9e34-729c08864903","resolution":{"observed_at":"2026-08-16T00:42:51.257760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.262378Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.262378Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:29d42b3aacb8a6f095b6d45f416467953f019b025749b0117b36a023d114a810","observation_id":"276cbf09-14fd-4586-b6b0-33106e777b4a","resolution":{"observed_at":"2026-08-16T00:42:51.262378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.266868Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.266868Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:1c85dcd9dccff276ae0aeb98cbf950c29ba989488d6fe299786200dc6d4cc698","observation_id":"b1a38fdb-4e3e-4635-8f11-f0333b8acf07","resolution":{"observed_at":"2026-08-16T00:42:51.266868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.536855Z","title":"Common phone: A multilingual dataset for robust acoustic modelling,","venue":null,"work_id":"12cf676d-6cdc-41b2-a98e-e9e664e1c337","year":2022},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.271354Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:b12b3e81c575ca14b17710453f0c4f5168f55527b6928704af64001daa306dc4","observation_id":"020e2760-ffe3-464a-b42f-3870e233481b","resolution":{"observed_at":"2026-08-16T00:42:51.541875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.520892Z","title":"Genshin voice: A multi-lingual voice dataset from Genshin Impact,","venue":null,"work_id":"bbe50aa2-f20b-4604-8af5-7e5a33bc39f6","year":2025},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.276503Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:ddcafacfbe781125ae860314e07abd6f6012c8b248077c38aeff680af2aa9b07","observation_id":"ebf432da-1285-4d7a-be81-5392174b4368","resolution":{"observed_at":"2026-08-16T00:42:51.526135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.504084Z","title":"Gtsinger: A global multi-technique singing corpus with realistic music scores for all singing tasks,","venue":null,"work_id":"4a6e2024-5a28-49a8-94a3-0c8dddbccdce","year":2024},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.281545Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:8e70a423e85540cd36b9328fed142c06da9a539c7bbfc001bf2965ac3dd7d695","observation_id":"ed5c18f1-fcf9-42c2-b65d-1ae6fa2b0bcc","resolution":{"observed_at":"2026-08-16T00:42:51.510189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.286306Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.286306Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:e3a340fadc348d35f0adad65fa2f3c6687524f4a590c562024177fd72e4d985d","observation_id":"930af073-8f3b-4301-90d2-e8ca61305640","resolution":{"observed_at":"2026-08-16T00:42:51.286306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12706","last_updated":"2026-07-15T05:16:13Z","snapshot_observed_at":"2026-08-18T17:08:39.944329Z","submitted_at":"2026-07-14T12:28:43Z","title":"AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling","version":2},"cited_work":{"arxiv_id":"2607.12706","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.12706","snapshot_observed_at":"2026-08-16T00:42:51.336583Z","title":"AutoSIFT: Automatic Style Sifting for Controllable Speech Generation with Arbitrary Style Infilling","venue":"cs.SD","work_id":"2f3323e6-7b17-4d22-92d2-314f3891f89a","year":2026},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.290965Z"},"links":{"cited_paper":"/paper/2607.12706","citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:fb27c72817d0621f15fa252ad5c1d84930eea8d4755c9029f6a813f4f87dc71b","observation_id":"78b12c8d-717f-4cf9-adfd-358121caedba","resolution":{"observed_at":"2026-08-16T00:42:51.345318Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:42:51.477915Z","title":"Denoising diffusion probabilis- tic models,","venue":null,"work_id":"6d8bd061-a08f-47bc-9c60-ad0f6737a6cc","year":2020},"citing_paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:42:51.295730Z"},"links":{"citing_paper":"/paper/2608.11590"},"observation_digest":"sha256:53ada697303f7ddbc3b1cf27286107751fbe837a356c819b33daa8fdfb588c1a","observation_id":"b2f59396-0571-4e70-9455-1eb1fe06c189","resolution":{"observed_at":"2026-08-16T00:42:51.482911Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11590","last_updated":"2026-08-13T01:32:48Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T23:10:05.678216Z","submitted_at":"2026-08-12T02:58:45Z","title":"CookVoice: Unified Framework for Style Controllable Multi-Modal Human Voice Generation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2608.11590."}