{"as_of":"2026-08-18T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e94ac95c3bb4f7414029997877143afe4037af2fc0b4aac8f66e03f2308b624a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:43:27.497465Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:43:24.605598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:43:28.653584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"cited_work":{"arxiv_id":"2608.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.00545","snapshot_observed_at":"2026-08-05T00:43:28.653584Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","venue":"cs.SD","work_id":"21303c92-3aa0-48e2-8e0e-00fa8766cb18","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.605598Z"},"links":{"cited_paper":"/paper/2608.00545","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:f5db1ebd30c141aa928f197eec72c63a1b9a515c47b738ccd4bfe9b005dd4e36","observation_id":"f2c67c2c-2d77-4bdf-84b3-e3939f851936","resolution":{"observed_at":"2026-08-05T00:43:28.743868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.00545/citation-record","integrity":"/paper/2608.00545/integrity","json":"/paper/2608.00545/citation-record.json","paper":"/paper/2608.00545"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"cited_work":{"arxiv_id":"2608.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.00545","snapshot_observed_at":"2026-08-05T00:43:28.653584Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","venue":"cs.SD","work_id":"21303c92-3aa0-48e2-8e0e-00fa8766cb18","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.605598Z"},"links":{"cited_paper":"/paper/2608.00545","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:f5db1ebd30c141aa928f197eec72c63a1b9a515c47b738ccd4bfe9b005dd4e36","observation_id":"f2c67c2c-2d77-4bdf-84b3-e3939f851936","resolution":{"observed_at":"2026-08-05T00:43:28.743868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:34.006718Z","title":"Natural-language control of speech Controllable speech generation has traditionally relied on either global style representations or explicitly defined acoustic factors","venue":null,"work_id":"fcd99faf-ccec-4307-aa0f-eedbc4917840","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.660613Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:f4a2d3ed28d64635e93b375381bacd5d6ee782f2ebcc2e217ff829c1d70e6265","observation_id":"1af93a5b-9a40-4083-b75d-02b864f15360","resolution":{"observed_at":"2026-08-05T00:43:34.011411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.990911Z","title":"Systems and generation matrix We evaluate CosyV oice3, V oxCPM2, and Fish-Speech-S2, three in- dependently developed reference-conditioned speech-generation sys- tems","venue":null,"work_id":"24e26c4d-5904-4d32-8a6f-2911319a5199","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.741939Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d5ce80618bfaca3fc2ab224acbc92dd2b6e7e1d575d317446986b2968dff478c","observation_id":"6db9e2a1-44e4-4da9-90bc-5cf3904900c8","resolution":{"observed_at":"2026-08-05T00:43:33.995825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.977003Z","title":"Target dir","venue":null,"work_id":"4b380a1f-afa2-463c-b9b6-3ac8fccd2852","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.829085Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:1b89043534cbef690c49b4e3bc83002c73858c59cc89a4ee12d1527fe7ef0700","observation_id":"f101efea-c6d6-4bf3-a55e-bb8d2bfb4899","resolution":{"observed_at":"2026-08-05T00:43:33.981480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.963197Z","title":"Eligible","venue":null,"work_id":"8f362597-c231-4c2d-9763-70cde41b8b17","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.944382Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:777e86c0b1826dc4c642934836c36a614fd4003946921cd0d42803c9bf2986c0","observation_id":"000c481e-3285-4b69-b20b-f6f44bd78ae0","resolution":{"observed_at":"2026-08-05T00:43:33.967338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.949594Z","title":"H1 evaluates whether target and off-target changes are perceptible relative to a matched baseline, while H2 compares the candidates selected by V oDER-Cal and Target-only selection","venue":null,"work_id":"40bacb76-bf7f-46c5-a081-bd767bd69a65","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.031296Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:950b76dac983966a7011a18c2548e0b98925b259ec5dfe8e4c328e95f58fc27b","observation_id":"7a20f43f-20d1-4052-b10a-4cfed696f46f","resolution":{"observed_at":"2026-08-05T00:43:33.953904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.913751Z","title":null,"venue":null,"work_id":"c9db6290-b45d-4967-be95-ed3b8cf8b7b8","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.087400Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b41b30ff4b3a0a7c5d7d6d23d68e25d1fa8c5412d7a6c1e4bc0e93290756b079","observation_id":"41c289c5-1e8c-430e-b6d0-ac3219c99aa0","resolution":{"observed_at":"2026-08-05T00:43:33.939870Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.758457Z","title":"Prompt adherence and attribute preservation are comple- mentary Prompt adherence and attribute preservation capture different aspects of controllability","venue":null,"work_id":"e64cea85-4d41-4bbe-8778-9265705078d6","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.132896Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:9ff11a2f03cca2a07c28229224e260e696aef6243bca33a343ccba09eca6056a","observation_id":"f1e88653-5ac0-4c5c-a5e3-6d7d5580e918","resolution":{"observed_at":"2026-08-05T00:43:33.793626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.554532Z","title":"When attribute-specific editing is desired, evaluation must also test whether characteristics outside the requested target remain stable","venue":null,"work_id":"af8d29ea-6805-4dab-988c-1e2016450e94","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.212378Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:e0d651a6c4f518026f57176aa7899578980b0f190b06a9bbc820ed8fcbf71e22","observation_id":"ab4a9aa8-a37a-4006-be16-2b4b6b2b442d","resolution":{"observed_at":"2026-08-05T00:43:33.617402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.335634Z","title":"PromptTTS: Controllable text-to-speech with text descriptions,","venue":null,"work_id":"d0fe9749-8368-455b-a691-6595d1ec1180","year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.300311Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d80ba4e89649897e73440069701658de2d21b6cf7046beb2295dff608ce12a36","observation_id":"7c42b87d-6d7f-47f2-8c1d-c474cba9842a","resolution":{"observed_at":"2026-08-05T00:43:33.407854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.000105Z","title":"InstructTTS: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":"e7095a7f-5589-4a4f-a6e1-5ab39ed527a1","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.376286Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:9dfc15d7b26b0f9c8734a89de9c5164ac40b80853e7800ee3240c71da39afac1","observation_id":"2b43486c-39a6-4f3f-823a-f9b0bc69cde3","resolution":{"observed_at":"2026-08-05T00:43:33.134775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.701154Z","title":"PromptTTS 2: Describing and generating voices with text prompt,","venue":null,"work_id":"8bb00495-867b-4632-878d-c36687a3421f","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.450211Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:ed35c4ccb778206603d7b7b1d7b8f851671b7e7fa10b6876a78a5e1a9620053e","observation_id":"f128f87b-acbf-468a-8894-064982a0c5d7","resolution":{"observed_at":"2026-08-05T00:43:32.848451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19522","last_updated":"2023-06-01T09:30:41Z","snapshot_observed_at":"2026-08-16T15:28:05.625617Z","submitted_at":"2023-05-31T03:16:59Z","title":"PromptStyle: Controllable Style Transfer for Text-to-Speech with Natural Language Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19522","snapshot_observed_at":"2026-08-05T00:43:25.535345Z","title":"PromptStyle: Controllable style transfer for text-to-speech with natural language descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.535345Z"},"links":{"cited_paper":"/paper/2305.19522","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d25fc281fbca2b1ac1485547cf5c3c994c7156313a8cf9a850166792112628cc","observation_id":"39ee1fe6-e0ae-4ed9-b9e4-74bdd267ec76","resolution":{"observed_at":"2026-08-05T00:43:25.535345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.395636Z","title":"PromptTTS++: Controlling speaker identity in prompt-based text-to-speech using natural language descriptions,","venue":null,"work_id":"087e35d3-8099-4d18-bfa7-d9d0507200b5","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.597367Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6ea3a4a0b90ec51b357ea656c2af8c22d2252fa8d6309984b594bbe644fec6a0","observation_id":"7567a70d-f866-4bd4-92b8-1fe4e765f6fb","resolution":{"observed_at":"2026-08-05T00:43:32.608542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.013635Z","title":"ControlSpeech: Towards simultane- ous and independent zero-shot speaker cloning and zero-shot language style control,","venue":null,"work_id":"836290f8-8e6b-4e33-8fde-551862d8e196","year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.700590Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:4f3e30cef731c6d8379fcbdd5422de8d660dff84c9dfe3e66ce6a7cf20236b61","observation_id":"a8c758e2-63a4-43ba-9829-9ab1ff2a3fd4","resolution":{"observed_at":"2026-08-05T00:43:32.189142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T00:43:25.749513Z","title":"CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.749513Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:c831dea732d35a5db097693016fa2805481e48ac1d96dd49c17b1ffd8e3b3928","observation_id":"956cd6c5-0acb-4932-b44c-d615a586d851","resolution":{"observed_at":"2026-08-05T00:43:25.749513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06928","snapshot_observed_at":"2026-08-05T00:43:25.858970Z","title":"V oxCPM2 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.858970Z"},"links":{"cited_paper":"/paper/2606.06928","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:75d2c704376af5f50709fe4f7cd751c5cc7b31e3466d3c56679071f904ab2b08","observation_id":"3284906c-4f32-48b2-b704-264a0680c73e","resolution":{"observed_at":"2026-08-05T00:43:25.858970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:25.899839Z","title":"Fish Audio S2 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.899839Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b2e8526e358f60d4af0114e983965ed0e7d19de54a2f1c2d62c8a899c5a7bc85","observation_id":"cbc6f3b1-03c7-47a1-8041-5a5499cbda76","resolution":{"observed_at":"2026-08-05T00:43:25.899839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:25.981554Z","title":"OV-InstructTTS: To- wards open-vocabulary instruct text-to-speech,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.981554Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6e09b40e881267202b8b45c24b7841ee8261062ebd505192020e516d3aea3cbd","observation_id":"5df56a05-5f12-435d-b0bd-29cf0d59075b","resolution":{"observed_at":"2026-08-05T00:43:25.981554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:26.042228Z","title":"FlexiV oice: Enabling flexible style control in zero-shot tts with natural language instructions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.042228Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d267c5c6de91a81805d51b2e58188d8a4c6401ac67219a9ab3d1639626cf609d","observation_id":"2a0cba3a-5d83-4ab8-b3f3-948da64a8d1d","resolution":{"observed_at":"2026-08-05T00:43:26.042228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16381","last_updated":"2025-06-19T15:08:01Z","snapshot_observed_at":"2026-08-16T17:50:48.232882Z","submitted_at":"2025-06-19T15:08:01Z","title":"InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16381","snapshot_observed_at":"2026-08-05T00:43:26.122470Z","title":"InstructTTSEval: Benchmarking complex natural-language in- struction following in text-to-speech systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.122470Z"},"links":{"cited_paper":"/paper/2506.16381","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:de2ac8674d66fb6052d4dd82d6d0703ab65ed44058d82a0ab05faaff22d44b62","observation_id":"5e39b400-d8f9-48ee-812f-f0de8a735222","resolution":{"observed_at":"2026-08-05T00:43:26.122470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05554","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:28.237836Z","title":"SPAM: Style prompt adherence metric for prompt-based tts,","venue":null,"work_id":"84a5b84f-c9f2-4437-8fef-a3fd97463e4f","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.187822Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:4b6f3ad7f55b5faad510d9881d6cb0bb6740a713621b398ff53d785e5c2459c6","observation_id":"83d17f93-6144-49a4-8d7e-ae14f41e4480","resolution":{"observed_at":"2026-08-05T00:43:28.270669Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.694651Z","title":"Towards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":"550bc967-e20a-4ada-a0dd-40a456212618","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.255903Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:88d1f808dc76feb4612b4b922e48066bbae937e89921f6a2e1d64991ac73362a","observation_id":"460139f4-f9ee-4b29-9205-a549ac959f73","resolution":{"observed_at":"2026-08-05T00:43:31.832623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.373563Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"c2bfa760-efcf-47be-94a0-19eb9b4e60a9","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.360938Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b21bebd20db48265a7d063d54469d3c89ed48f1db7e887a81a6c1822a4d9d469","observation_id":"6547024f-7e78-4574-b7cf-3c8e7571bfdc","resolution":{"observed_at":"2026-08-05T00:43:31.522677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.100782Z","title":"FastSpeech 2: Fast and high-quality end-to- end text to speech,","venue":null,"work_id":"b904a29e-d770-4354-950e-4cd8fc73bacd","year":2021},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.411290Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:2bc717da68374dfb0bc162a100ced501109f064caa8ea964134e8b9f77eb1027","observation_id":"26bb9f86-b1d1-4c8f-8c00-932ca589e3bb","resolution":{"observed_at":"2026-08-05T00:43:31.244938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24618","last_updated":"2026-05-23T15:01:28Z","snapshot_observed_at":"2026-08-16T06:00:14.919733Z","submitted_at":"2026-05-23T15:01:28Z","title":"FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations","version":1},"cited_work":{"arxiv_id":"2605.24618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24618","snapshot_observed_at":"2026-08-05T00:43:28.018841Z","title":"FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations","venue":"eess.AS","work_id":"5c70467b-3b70-4ef4-abd4-0eb7f2ecdb98","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.470816Z"},"links":{"cited_paper":"/paper/2605.24618","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:3b3a3e624045009d3818253ef2721b6007c33dbdef4421b8da934536ae7e259e","observation_id":"08d228ec-9df4-43f1-a5a1-a493431dfbe5","resolution":{"observed_at":"2026-08-05T00:43:28.089113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:26.523554Z","title":"DisCo-Speech: Controllable zero-shot speech generation with a disentangled speech codec,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.523554Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:c3be5de2d414bd525370a3ff4714f57b35c0b2f45502e99c8dfbf9f09a82ead2","observation_id":"c24f49b8-bcbc-4b2e-876c-343b6eb3134c","resolution":{"observed_at":"2026-08-05T00:43:26.523554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08256","last_updated":"2026-08-05T11:29:52Z","snapshot_observed_at":"2026-08-16T11:31:09.706011Z","submitted_at":"2026-07-09T09:01:03Z","title":"Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment","version":2},"cited_work":{"arxiv_id":"2607.08256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.08256","snapshot_observed_at":"2026-08-05T00:43:27.779533Z","title":"Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment","venue":"cs.CL","work_id":"66a5a290-8752-4e5f-bbd5-891647cc695a","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.559995Z"},"links":{"cited_paper":"/paper/2607.08256","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:cbe972351c51a188270b13ee04e29e24931e74ff9a00c430a1dd040223f7240f","observation_id":"3fb23b82-7194-4f52-8e32-4d7e31332b25","resolution":{"observed_at":"2026-08-05T00:43:27.825771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-13T03:10:55.584303Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"cited_work":{"arxiv_id":"2606.18323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18323","snapshot_observed_at":"2026-08-05T00:43:27.615607Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","venue":"cs.SD","work_id":"753c6b2c-a4d6-4e39-987f-e5f4d3cb9e70","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.625365Z"},"links":{"cited_paper":"/paper/2606.18323","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b0ad26cb14396fc36fb37d28ece5106b267a16af07ec3ad4b630b68e30f3b28e","observation_id":"c1353b3f-80c8-4ef5-b548-9c29d8c04e83","resolution":{"observed_at":"2026-08-05T00:43:27.679553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.763889Z","title":"librosa: Audio and music signal analysis in python,","venue":null,"work_id":"93ae3571-c27a-4543-87a4-141c2ab2f8b1","year":2015},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.695268Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b41d59a49c2f5dddbaca2f062aadc3f7ccdbcad9aed5acea9b99e4d7e83beaaf","observation_id":"9f7420a2-d0ea-42b0-aace-54fc24364f4c","resolution":{"observed_at":"2026-08-05T00:43:30.908644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.511774Z","title":"pYIN: A fundamental fre- quency estimator using probabilistic threshold distributions,","venue":null,"work_id":"9d2571e8-8741-4446-93c1-432a56eb4093","year":2014},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.779343Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:e310c6dd864115ea5ef2f3885b164d3490647eab6d87c3f311e58473aa89cf6a","observation_id":"f969820c-6a57-4b90-84b0-1c31520ec666","resolution":{"observed_at":"2026-08-05T00:43:30.637156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.326840Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"e15e5a99-5de2-473b-86f7-706b6f3e6415","year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.861123Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:9079e7e8061601414a7fe270ab3bf4b265e890f7f8a2cb9933dec0a4e8688603","observation_id":"8ade6e93-30cd-4431-8f56-649437d81dd1","resolution":{"observed_at":"2026-08-05T00:43:30.386649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.208496Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"3c36d0ce-efea-4b67-994d-88d0efd99404","year":2020},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.930724Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b9c5e1aa5723076ac37102dd41f05665410b679964aac524577cbfe70671bf09","observation_id":"9b296ea7-0a8f-4de5-9a0a-4a0ce7ef5de8","resolution":{"observed_at":"2026-08-05T00:43:30.275377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.001239Z","title":"X-vectors: Robust dnn em- beddings for speaker recognition,","venue":null,"work_id":"6a24d9f4-9891-4298-a210-b7ec49c4e5f7","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.012578Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:8c2509a924501d5f7f5ae1cd3e5d5ea86b013fb20b9e13ce37da420cfce4007e","observation_id":"e6317aef-e4d4-4892-b8e6-4361d4a938b4","resolution":{"observed_at":"2026-08-05T00:43:30.099429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.836559Z","title":"Systems and model identifiers Table 3 lists the three systems, model identifiers, and control inter- faces used for generation","venue":null,"work_id":"6c62246f-dc4d-443f-8179-4dfd8b7d3560","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.097940Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d8a547525151cc147feffb14479905beb391654ea1d56e5c23b0561b9647584a","observation_id":"679055f3-4a95-4f43-a588-f68c48c3a2ee","resolution":{"observed_at":"2026-08-05T00:43:29.911410Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.630237Z","title":"Acoustic and prosodic measurements The analysis uses F0, speaking rate, duration, RMS energy, spectral centroid, 85% spectral roll-off, spectral flatness, and zero-crossing rate","venue":null,"work_id":"d8e9e42b-ae50-456a-ac70-180bf0e7f615","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.201910Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d9221c4ab49f1953dce610f8c9db921fa8ca06249aba02015b88ac7f8ceb7b6d","observation_id":"88064882-defe-47f4-becf-8dcfc1d4f365","resolution":{"observed_at":"2026-08-05T00:43:29.748678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.436255Z","title":"Responsive","venue":null,"work_id":"bdfd3b7d-a511-4533-86e3-faea34c8de2c","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.292009Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:e5d4af681f46c678116681947f1d9126723b42e9b60248f399e98e0af4b7ffa1","observation_id":"914c2ea9-e9d4-4359-8b18-3217e9097ebc","resolution":{"observed_at":"2026-08-05T00:43:29.537975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.269393Z","title":"Policies and operating point The candidate budget counts descriptor-conditioned generations; the matched neutral baseline y0 is shared across all policies and is not included in B","venue":null,"work_id":"b9cf59e2-f76e-4e72-bbc5-c03ee51a23cd","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.356823Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:edf55348f31fa15c792b7713418d1ddec786edb79d96ef3bbaf4a036f18fd2c1","observation_id":"c28ffc11-fddb-45f8-b29e-95778b1ec6e0","resolution":{"observed_at":"2026-08-05T00:43:29.330524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.065265Z","title":"no difference","venue":null,"work_id":"436e9c61-6d95-4bfa-a9e6-8439191af309","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.439137Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:459f7e330a7b5cabb8404c4b949e98ef626596890bb6bca86e39a4a42b5ff141","observation_id":"22edf21a-4aba-4921-bd41-eb509ebf9f80","resolution":{"observed_at":"2026-08-05T00:43:29.160492Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:28.850761Z","title":"V oDER-Cal shows that preservation-aware ranking can select candidates with lower measured off-target devia- tion from a fixed pool","venue":null,"work_id":"caf4a8a8-0811-470c-abcb-a10ddb5dd666","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.497465Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:f7152a38665e517656123f13624553de6e335d3ad01ec66c67d8f0fb8b509f0e","observation_id":"b80b9f84-81a7-487f-b09f-6c15861a9567","resolution":{"observed_at":"2026-08-05T00:43:28.945666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":24},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2608.00545."}