{"as_of":"2026-08-03T21:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccc812e45ed2be4b208dfd5023e51837147ef2fdbc0dad77e3b443d4f84ac1a3","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:09:21.027609Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:09:21.027609Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-11T11:06:05.422750Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"cited_work":{"arxiv_id":"2604.10580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10580","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","venue":"cs.CL","work_id":"e325bb86-c8d9-4a23-ae83-46a01e9d9d29","year":2026},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2604.10580","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:b6438d123ff164d7b629713c1c05d75d820fee0e73a0b814aa29bc592d83fd3b","observation_id":"e1449494-7048-4ae3-987f-528810084254","resolution":{"observed_at":"2026-05-11T11:06:05.434356Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10580/citation-record","integrity":"/paper/2604.10580/integrity","json":"/paper/2604.10580/citation-record.json","paper":"/paper/2604.10580"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The manager booked the flight","venue":null,"work_id":"2e2b5e47-3275-4f6f-bf29-ceaa94eccdc6","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:682104eab3e209498d5ee4efb5fe913f48e37f40a20cdd41aff6a7892cb582a6","observation_id":"98a0d030-2482-442f-a86a-cac2d6234697","resolution":{"observed_at":"2026-05-18T07:36:04.352902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"cited_work":{"arxiv_id":"2604.10580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10580","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","venue":"cs.CL","work_id":"e325bb86-c8d9-4a23-ae83-46a01e9d9d29","year":2026},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2604.10580","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:b6438d123ff164d7b629713c1c05d75d820fee0e73a0b814aa29bc592d83fd3b","observation_id":"e1449494-7048-4ae3-987f-528810084254","resolution":{"observed_at":"2026-05-11T11:06:05.434356Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Task We consider the task of context-conditioned stress generation in TTS","venue":null,"work_id":"2d8f39c5-555b-4232-912b-89e9a1428019","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:75b53acc53e2f2941c2a66633f97e69e980861499991edb41e933020397a027b","observation_id":"ded03893-93b2-446e-988f-64b603df93ea","resolution":{"observed_at":"2026-05-18T07:36:04.344178Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluated Systems We evaluate a diverse set of TTS systems, each under the con- ditioning modes it natively supports","venue":null,"work_id":"9b672659-757f-4dc8-bb88-bc6bff8cf99a","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:91939569d7ea6fea3c01b434bc6709d59cb0736f87c7c29b24a96e0019a1285c","observation_id":"075ccf6a-4690-4403-8881-43a00aafda5b","resolution":{"observed_at":"2026-05-18T07:36:04.350200Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context-Aware Stress Realization Table 3 summarizes performance across models and input modes","venue":null,"work_id":"06c5e1c6-1b1d-484f-8a8f-f42dd2a76bd0","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:f8f018d4bae077a04866d63e174cbd70f6325ffa2ca5a20b90189b7c704f66b6","observation_id":"547eada3-d7f8-453d-bd04-fb3e04500cdc","resolution":{"observed_at":"2026-05-18T07:36:04.341271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8888fa68-0d1f-4ac6-b71b-4152e57f23e6","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:0799664290f90dec56373f8f43b05c5788a86876e94a59b83a310c42107ccba9","observation_id":"e10ed520-3fc1-4794-bab0-082e2f951aba","resolution":{"observed_at":"2026-05-18T07:36:04.323800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d66e5504-486a-4586-b91a-814ffc658808","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:68479949d5347c8122207417927dbc8c8762b37cb774b9485e857bb209b837f1","observation_id":"f80c4d76-71a6-4c09-b5ae-acf6b9d21eea","resolution":{"observed_at":"2026-05-18T07:36:04.332836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f049c0d9-8a23-4855-a670-5cd7741a301f","year":null},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:aaa3cca6c9c75c4cbd4d3dfee5a58f06daf0471251bbcfbb5b5f2ec3fd604bb1","observation_id":"b8b7b5fb-45b5-429c-98fc-834b96af2015","resolution":{"observed_at":"2026-05-18T07:36:04.326473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2374877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A theory of focus interpretation","venue":null,"work_id":"56d85096-94fc-4b6e-9d31-78a617e8cad3","year":1992},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:ae5449862a9d00107bdafb9929227e3ac4e99cae484b95cb09d63e4e5791440c","observation_id":"0f0e4e28-0312-4133-b543-9dcf3a28bb9e","resolution":{"observed_at":"2026-05-11T11:06:05.454407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"oxfordhb/9780199","doi":"10.1093/oxfordhb/9780199286546.001.0001/","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In Christopher Hitchcock & Alan Hajek, edi- tors: Oxford Handbook of Probability and Philosophy , Oxford University Press, pp","venue":null,"work_id":"14395009-699b-40c7-94de-6004ef131037","year":2008},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:c59eca399013652e912fe63a870f28833df77a822d5569316b3e4b67388100f0","observation_id":"05afb797-44a8-45ea-b75d-1c2fa24603c6","resolution":{"observed_at":"2026-05-11T11:06:05.497214Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accent is predictable (if you’re a mind- reader)","venue":null,"work_id":"3f008217-584d-4b89-abcf-77469611f9f1","year":1972},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:077ee703edf9e18f5e533084ba42d04d0adee4c1c93a417b3a2709c4df7e88b5","observation_id":"4ffa384e-b624-47c7-ae8d-f7ede0ab4e56","resolution":{"observed_at":"2026-05-18T07:36:04.338449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22765","last_updated":"2026-04-07T15:07:17Z","snapshot_observed_at":"2026-07-06T21:32:28.358564Z","submitted_at":"2025-05-28T18:32:56Z","title":"StressTest: Can YOUR Speech LM Handle the Stress?","version":3},"cited_work":{"arxiv_id":"2505.22765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22765","snapshot_observed_at":"2026-07-04T08:59:42.883665Z","title":"StressTest: Can YOUR Speech LM Handle the Stress?","venue":"cs.CL","work_id":"08c8278e-cc6f-41ce-aa92-200e02371b7d","year":2025},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2505.22765","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:49b12e64afa6ee26738b50b6dae8f210dd8c23a014df85141595585bcceddda5","observation_id":"b3e1d252-be36-442f-9592-2b39002a1514","resolution":{"observed_at":"2026-05-11T11:06:05.389620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-07-06T21:29:06.781083Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":"2505.17589","doi":"10.48550/arxiv.2505.17589","metadata_source":"pith","pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","venue":"cs.SD","work_id":"ce66e767-526a-419d-bb95-ac019edf4050","year":2025},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:9e63938e5a0515ec4fb4b4447e30684e8b23ce9271ba296d91c24639a7bb0a6c","observation_id":"906bf905-4e4c-410b-a420-194026ab11a6","resolution":{"observed_at":"2026-05-16T05:27:25.722747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.905567Z","title":"Chatterbox-TTS","venue":null,"work_id":"99c706a9-2fcc-44ab-a2c1-c7c73510c5b0","year":2025},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:dab916c17fc9fd01c76e3d4c30bdb40ccf845c939333f5c9cb62aaa6fb547446","observation_id":"84ab07b3-8eb8-4a62-a79e-06bf7b1ff994","resolution":{"observed_at":"2026-05-18T07:36:04.355717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-07-06T22:42:36.961014Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:4beac5d8b7e99aeeaafc22bc7c0a912ab7d20435495a917fc2fbe922c302c772","observation_id":"74885d97-a12e-47a7-8354-057f72d76eb5","resolution":{"observed_at":"2026-05-16T19:24:56.189411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19103","last_updated":"2025-05-25T11:45:08Z","snapshot_observed_at":"2026-07-06T21:30:04.828669Z","submitted_at":"2025-05-25T11:45:08Z","title":"WHISTRESS: Enriching Transcriptions with Sentence Stress Detection","version":1},"cited_work":{"arxiv_id":"2505.19103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whistress: Enriching transcriptions with sentence stress detection","venue":null,"work_id":"f363a2c2-0520-4516-8be4-ccea97c17cd9","year":2025},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2505.19103","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:acc80ee065ada56be284b8ade6c2fc18819a3abdc5a14c66b1d80aa0a12607e2","observation_id":"550de9f9-faa1-4d9b-87a6-05b02ba7445e","resolution":{"observed_at":"2026-05-11T11:06:05.375927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Crowd- sourced and automatic speech prominence estimation","venue":null,"work_id":"def3d315-908e-4e59-a426-edc91bb0058f","year":2024},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:0f5bc7dbe2896c2f4ccdcc5c50170630dc7ad0ef594b21fbb6d13de04c4d6943","observation_id":"8526020e-8b7c-4a8b-b960-a073633542f7","resolution":{"observed_at":"2026-05-18T07:36:04.347152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Em- phassess: a prosodic benchmark on assessing emphasis transfer in speech-to-speech models","venue":null,"work_id":"bd3ae439-d68e-4b87-9d19-701e89a4801f","year":2024},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:d4d42d11db448478a23d5e65c16f4d87cc2f6551d8d14c492876521b799c659a","observation_id":"8065e57a-1b1a-46ed-8387-a1c4b255cb0c","resolution":{"observed_at":"2026-05-18T07:36:04.308827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12057","last_updated":"2023-06-01T08:11:15Z","snapshot_observed_at":"2026-07-06T14:55:04.061802Z","submitted_at":"2023-02-23T14:30:23Z","title":"ProsAudit, a prosodic benchmark for self-supervised speech models","version":3},"cited_work":{"arxiv_id":"2302.12057","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.12057","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prosaudit, a prosodic benchmark for self-supervised speech models","venue":null,"work_id":"2e178fcc-7ad7-4999-97e0-35009ece82b0","year":2023},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/2302.12057","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:4d0e4c9b582636536ae8ed5a979bb6e62f0e57ca99c5dcf039733ab1208c0c96","observation_id":"20785ebe-2c82-4783-8f3d-c216c66663c5","resolution":{"observed_at":"2026-05-11T11:06:05.381772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style tokens: Un- supervised style modeling, control and transfer in end-to-end speech synthesis","venue":null,"work_id":"28424537-56cd-4999-b550-b74c9226a9da","year":2018},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:fdeb43196be0e13f6cd90a7a13c34525db83e126fb3ec13594faba6d7bb8e9dc","observation_id":"06d34669-4640-456c-ab76-18cada32fb39","resolution":{"observed_at":"2026-05-18T07:36:04.321271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09047","last_updated":"2018-03-24T02:52:58Z","snapshot_observed_at":"2026-08-01T19:50:07.084755Z","submitted_at":"2018-03-24T02:52:58Z","title":"Towards End-to-End Prosody Transfer for Expressive Speech Synthesis with Tacotron","version":1},"cited_work":{"arxiv_id":"1803.09047","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.09047","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards End-to-End Prosody Transfer for Expressive Speech Synthesis with Tacotron","venue":"cs.CL","work_id":"aa277207-3aac-48d3-aaa6-7fc9a670c7f3","year":2018},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"cited_paper":"/paper/1803.09047","citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:a04b2b6ec2f29b6817b500051772fa6fb87d331aba13f071dda114848efe7300","observation_id":"b8974647-ad6e-4e36-8b35-22f81580d60e","resolution":{"observed_at":"2026-05-11T11:06:05.530718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Styler: Style factor mod- eling with continuous prompt for expressive speech synthesis","venue":null,"work_id":"97acb844-6d57-457a-8d66-88ddd756112c","year":2021},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:e6b784036d3a38baca063b6003acb0196e78516fe8c78112e1a906d4234fc704","observation_id":"c2d0302b-4536-4d70-8943-892e226fe0e3","resolution":{"observed_at":"2026-05-18T07:36:04.335436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To- wards end-to-end prosody transfer for expressive speech synthesis with tacotron","venue":null,"work_id":"131203a8-27cc-4614-9044-cf75b99ee35d","year":2018},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:f68a937d5b0036299a7dd45fa0064553d93ab433b33d2f58260f9eed9cd645b5","observation_id":"1487332f-97cc-4c8b-b90b-49402ebc78d8","resolution":{"observed_at":"2026-05-18T07:36:04.318342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Word-level text markup for prosody control in speech synthesis","venue":null,"work_id":"1d65e716-f834-42ad-99c9-8323173cd526","year":2024},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:d1c25447f1a01396670b8ca6246c8c4dee33552a2e4d4b79c437de6356efe169","observation_id":"97511ef8-c786-4a96-b0d5-b7d9850b2d9d","resolution":{"observed_at":"2026-05-18T07:36:04.329765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Higgs Audio V2: Redefining Expressiveness in Au- dio Generation","venue":null,"work_id":"8feaf7d6-d9ad-42ad-9722-14ce648a2bf0","year":2025},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:18cc79fd8c2ab4d204b0ca997592b446e8498d08617115905918e6bebb383702","observation_id":"efaec3fd-8b3e-4d59-b8ac-ba03e12acd23","resolution":{"observed_at":"2026-05-18T07:36:04.314988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phonology, phonetics, and signal-extrinsic factors in the perception of prosodic prominence: Evidence from rapid prosody transcription","venue":null,"work_id":"ca636d39-90f9-4c2c-be20-528b966fdb9a","year":2020},"citing_paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:21.027609Z"},"links":{"citing_paper":"/paper/2604.10580"},"observation_digest":"sha256:f0b00629b1a01c5943a140c4b23420b121345d585297894f6a471e4f6acc5bb4","observation_id":"21d564f0-e726-4d35-bd93-13ab8c870b96","resolution":{"observed_at":"2026-05-18T07:36:04.312119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10580","last_updated":"2026-04-12T10:57:00Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T10:57:00Z","title":"Knowing What to Stress: A Discourse-Conditioned Text-to-Speech Benchmark"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":3,"verified_exact":7,"verified_fuzzy":12},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2604.10580."}