{"as_of":"2026-08-09T16:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc4ab77d12bbe4a026c6aca28efcfba8e903db7f1f2132fb70c677d81cdce1c1","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:17:06.772619Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T12:54:20.815371Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:06:23.916814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"cited_work":{"arxiv_id":"2508.02038","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02038","snapshot_observed_at":"2026-07-02T01:06:23.916814Z","title":"Marco-voice technical report","venue":null,"work_id":"474fe862-9aef-4ff7-89b0-69c90c8d2d3f","year":2025},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2508.02038","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:6b5619224164aabc5284664afc267d4dd3f0ec60e7fc83ab08de616e481d4342","observation_id":"c5e8dea3-6b19-48c0-a1b7-2b0eca1b5b19","resolution":{"observed_at":"2026-05-18T13:01:24.323332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"cited_work":{"arxiv_id":"2508.02038","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02038","snapshot_observed_at":"2026-07-02T01:06:23.916814Z","title":"Marco-voice technical report","venue":null,"work_id":"474fe862-9aef-4ff7-89b0-69c90c8d2d3f","year":2025},"citing_paper":{"arxiv_id":"2606.01804","last_updated":"2026-06-03T03:45:51Z","snapshot_observed_at":"2026-08-02T05:33:25.305210Z","submitted_at":"2026-06-01T07:21:02Z","title":"SpeechEditBench: A Bilingual Multi-Attribute Benchmark for Instruction-Guided Speech Editing","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T12:54:20.815371Z"},"links":{"cited_paper":"/paper/2508.02038","citing_paper":"/paper/2606.01804"},"observation_digest":"sha256:87b5156fc67b8b42fed2cba424e30a3ad385b3841b883f62471a2b53e8f722aa","observation_id":"ae97962b-e266-4109-8d59-ed4aa6f9e464","resolution":{"observed_at":"2026-07-02T01:06:23.918542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02038/citation-record","integrity":"/paper/2508.02038/integrity","json":"/paper/2508.02038/citation-record.json","paper":"/paper/2508.02038"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:17:08.431361Z","title":"Barakat, O","venue":null,"work_id":"25e2f279-8867-48bf-8246-3e00c9b56129","year":2024},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.606977Z"},"links":{"citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:2b29237d574d41d01b206555c6a624ab97ff975ef9eb3ab53d19df55b4aee43d","observation_id":"d657cd9c-ea7a-489f-b957-772d85182335","resolution":{"observed_at":"2026-08-06T05:17:08.544656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00024","last_updated":"2023-06-28T19:34:16Z","snapshot_observed_at":"2026-08-04T00:44:58.442066Z","submitted_at":"2023-06-28T19:34:16Z","title":"EmoSpeech: Guiding FastSpeech2 Towards Emotional Text to Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00024","snapshot_observed_at":"2026-08-06T05:17:05.775601Z","title":"Diatlova and V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.775601Z"},"links":{"cited_paper":"/paper/2307.00024","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:2ec742af970917d53e9ac39dd2def6720f337ed696a4d98f2b5a55d09df7f2ce","observation_id":"a6328654-ac4e-4765-a3e6-51717d90e619","resolution":{"observed_at":"2026-08-06T05:17:05.775601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01198","last_updated":"2022-07-04T04:56:10Z","snapshot_observed_at":"2026-08-08T14:12:12.323514Z","submitted_at":"2022-07-04T04:56:10Z","title":"Cross-speaker Emotion Transfer Based On Prosody Compensation for End-to-End Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2207.01198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.01198","snapshot_observed_at":"2026-08-06T05:17:07.443673Z","title":"Cross-speaker Emotion Transfer Based On Prosody Compensation for End-to-End Speech Synthesis","venue":"cs.SD","work_id":"f458b570-bcf7-4302-b9ef-5801397128cc","year":2022},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.064532Z"},"links":{"cited_paper":"/paper/2207.01198","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:8f00c9c3d40710a21c83ac77558feb796c7ddd145a5a0d631660b0b7821c8dc6","observation_id":"30badf42-c085-493f-ba47-67cea15fd789","resolution":{"observed_at":"2026-08-06T05:17:07.522436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07162","last_updated":"2024-06-11T11:12:51Z","snapshot_observed_at":"2026-08-06T08:12:49.540745Z","submitted_at":"2024-06-11T11:12:51Z","title":"EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07162","snapshot_observed_at":"2026-08-06T05:17:06.215755Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.215755Z"},"links":{"cited_paper":"/paper/2406.07162","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:39f98e823f37f43cbfebcc00fcfab1d580b5f22e88477e1e3b34c0c09a9fd062","observation_id":"5128c4bc-6773-4381-bdbf-52782b84470e","resolution":{"observed_at":"2026-08-06T05:17:06.215755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01020","last_updated":"2025-06-01T14:04:08Z","snapshot_observed_at":"2026-08-08T01:41:10.761298Z","submitted_at":"2025-06-01T14:04:08Z","title":"DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation","version":1},"cited_work":{"arxiv_id":"2506.01020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01020","snapshot_observed_at":"2026-08-06T05:17:07.028665Z","title":"DS-TTS: Zero-Shot Speaker Style Adaptation from Voice Clips via Dynamic Dual-Style Feature Modulation","venue":"cs.SD","work_id":"ce108d51-a580-48f2-897b-5ab310aad9cf","year":2025},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.334514Z"},"links":{"cited_paper":"/paper/2506.01020","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:a50fae98beb09a47c5956e2b078eb04b9db9f6608fccc4e2887aa771440512ec","observation_id":"39a25de5-0fe5-4e27-b05d-6ca480cb2e41","resolution":{"observed_at":"2026-08-06T05:17:07.107479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-08T00:30:28.663818Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-06T05:17:06.401559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.401559Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:6fd7052cdc93378ec0d79b5f8ec2bad4ac9cc4d152520621e76e5438dfe204de","observation_id":"3dd2c9a9-4ed4-4bde-be05-e8b4c8dbfb64","resolution":{"observed_at":"2026-08-06T05:17:06.401559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T05:17:06.469172Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.469172Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:9a1c527469103fadef934b11f13805e1183103b8c43aab1144a6966e6148ddf1","observation_id":"6834a970-203c-428b-8fbb-b7a01beff663","resolution":{"observed_at":"2026-08-06T05:17:06.469172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-06T05:17:06.530717Z","title":"14 Marco-Voice Technical Report Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.530717Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:9db7c18626e3e6c2c270cf0f2cee572e8eca3eecc0e64e86abbce6d72b3b4254","observation_id":"9505d7d4-4fef-46d4-9a41-e7b1e62bcb5b","resolution":{"observed_at":"2026-08-06T05:17:06.530717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13336","last_updated":"2023-04-02T09:27:20Z","snapshot_observed_at":"2026-07-06T15:07:11.623462Z","submitted_at":"2023-03-23T15:17:15Z","title":"A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13336","snapshot_observed_at":"2026-08-06T05:17:06.655722Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.655722Z"},"links":{"cited_paper":"/paper/2303.13336","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:e1aeb91f46c98db0537d8e29a53779a78af93b85c25769a9c78e4155c7379915","observation_id":"605f7043-c24c-42d9-82e5-de471472d079","resolution":{"observed_at":"2026-08-06T05:17:06.655722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:17:07.961921Z","title":null,"venue":null,"work_id":"5b98eee2-8f8d-40ed-a45a-c0352cab9ec2","year":2023},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.772619Z"},"links":{"citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:db37d63de2f63154333275c856e5a51929cd2bb1307007f2dddf47fcd42fe1e8","observation_id":"e0776a0c-c7fe-4d93-9961-eff89e5c652a","resolution":{"observed_at":"2026-08-06T05:17:08.073198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:17:08.217814Z","title":null,"venue":null,"work_id":"627079c6-859f-40d4-ac73-a6940f23c7b1","year":2020},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.599240Z"},"links":{"citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:451f60da06ba3ab5dc5f40c026c85036a9b3bd71ff309c6202bfd01de99b58b1","observation_id":"88e9e5bb-5305-4156-89a3-d955a6123bc4","resolution":{"observed_at":"2026-08-06T05:17:08.328850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-02T17:41:21.677381Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-06T05:17:05.972642Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.972642Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:71e88c8e22be12a3566379fb22541ece2d1afdb861d34ff556e74f5d41be044b","observation_id":"867aa1ca-1fb9-4924-9e32-ac2e1e0b9e10","resolution":{"observed_at":"2026-08-06T05:17:05.972642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13509","last_updated":"2024-07-18T13:42:38Z","snapshot_observed_at":"2026-07-06T18:48:29.372633Z","submitted_at":"2024-07-18T13:42:38Z","title":"Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models","version":1},"cited_work":{"arxiv_id":"2407.13509","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.13509","snapshot_observed_at":"2026-08-06T05:17:07.246780Z","title":"Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models","venue":"cs.SD","work_id":"a305403f-56d9-43cf-826b-164854ad2bea","year":2024},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:06.124035Z"},"links":{"cited_paper":"/paper/2407.13509","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:5635960d77f59a5dc39e5e442d4040b672c72d0a6059f3bb9dce1b0cc93cf805","observation_id":"38364a48-0d8c-4fa9-956d-10e6cce7a254","resolution":{"observed_at":"2026-08-06T05:17:07.314148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T05:17:05.882842Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.882842Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:44c7b5302a0dd2da84d46d620600f73d87eb8ed82cf060dc7868b5390b04fabc","observation_id":"7272df6f-6938-436b-b387-22b64fdb9620","resolution":{"observed_at":"2026-08-06T05:17:05.882842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02167","last_updated":"2024-06-04T09:56:39Z","snapshot_observed_at":"2026-07-06T18:25:05.750197Z","submitted_at":"2024-06-04T09:56:39Z","title":"ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency","version":1},"cited_work":{"arxiv_id":"2406.02167","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.02167","snapshot_observed_at":"2026-08-06T05:17:07.733946Z","title":"ERes2NetV2: Boosting Short-Duration Speaker Verification Performance with Computational Efficiency","venue":"eess.AS","work_id":"94c7648f-bd82-479d-b1bb-4c8351ac7e98","year":2024},"citing_paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:17:05.681978Z"},"links":{"cited_paper":"/paper/2406.02167","citing_paper":"/paper/2508.02038"},"observation_digest":"sha256:bd9f0f0398107552e91c450bb0c207370750844542c99b7b76632b29eba2df1a","observation_id":"171d1df3-2360-4aa0-bc5b-a4d07157c2bd","resolution":{"observed_at":"2026-08-06T05:17:07.837325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.02038","last_updated":"2025-08-14T01:47:28Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T00:25:19.301459Z","submitted_at":"2025-08-04T04:08:22Z","title":"Marco-Voice Technical Report"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 2 inbound Pith citation observations for arXiv:2508.02038."}