{"as_of":"2026-08-12T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e26a5176ae6ca97fa4bb3bd1eea6d06414f9fb83da841903ab998877bd21f81d","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T09:53:58.938270Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:46.946227Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:14:51.684270Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28618","snapshot_observed_at":"2026-08-04T16:29:26.523286Z","title":"Comprehensive benchmarking of long-form speech generation in diverse scenarios.arXiv preprint arXiv:2605.28618, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:26.523286Z"},"links":{"cited_paper":"/paper/2605.28618","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:c86a2487206ffcda181ef462f34b83288397547feec982b3647ff64b40fb9d8a","observation_id":"0e0c8243-7386-4c40-b7bd-586bd0385821","resolution":{"observed_at":"2026-08-04T16:29:26.523286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"cited_work":{"arxiv_id":"2605.28618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.28618","snapshot_observed_at":"2026-08-07T00:14:51.684270Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","venue":"eess.AS","work_id":"34e5c9dc-9302-43b8-8d97-f2fe01da33e3","year":2026},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.946227Z"},"links":{"cited_paper":"/paper/2605.28618","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:f39cf87223d3dbf9be2dc31cf4424fcedf97ccde4bf90a4d02f103e00a944010","observation_id":"26b3406d-42d4-44ca-bf3e-58a62695a12e","resolution":{"observed_at":"2026-08-07T00:14:51.835378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.28618/citation-record","integrity":"/paper/2605.28618/integrity","json":"/paper/2605.28618/citation-record.json","paper":"/paper/2605.28618"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:37:35.144482Z","title":"Glm-tts technical report","venue":null,"work_id":"9286edc2-ff28-47b0-8c45-98c88a384330","year":2025},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:330a7a888d18233b9eabb06fbe22238afc713d1e4e8a49e60705a65610c500f5","observation_id":"24766f33-b743-4231-8582-d411c72c6917","resolution":{"observed_at":"2026-06-29T10:03:17.334619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14713","last_updated":"2025-08-20T13:43:49Z","snapshot_observed_at":"2026-08-12T13:34:37.016882Z","submitted_at":"2025-08-20T13:43:49Z","title":"Long-Context Speech Synthesis with Context-Aware Memory","version":1},"cited_work":{"arxiv_id":"2508.14713","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.14713","snapshot_observed_at":"2026-06-29T10:03:17.337415Z","title":"Advances in neural in- formation processing systems, 36:14005–14034","venue":null,"work_id":"acf026d9-4c01-4b80-b32c-3c8fe53c9337","year":2024},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"cited_paper":"/paper/2508.14713","citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:0befb5b33c20830f09b4db0f47666af3e4465c62a1f94a651466d6abdf0fca4d","observation_id":"2c8c239b-11da-4ec3-bec8-9621819842a7","resolution":{"observed_at":"2026-06-29T10:03:17.338980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"In Interspeech, vol- ume 2017, pages 498–502","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:41177173708433e51405f3890599f672a02ae32d855e6147995933f375c09b24","observation_id":"7d128050-a2c3-4801-93d5-e14b54bad41d","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"In 2024 IEEE Spoken Language Technology Workshop (SLT), pages 766–773","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:b7846add2a9bdbc7256080ae2943cb31be18d093801e6fa8c0edaa481c9d02f7","observation_id":"f0e9f587-ca6f-43cb-83c6-85fea549dde7","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:26:13.158134Z","title":"Ttsds2: resources and benchmark for evaluating human-quality text to speech systems.arXiv preprint arXiv:2506.19441, 2025","venue":null,"work_id":"30433c88-8fe0-43cd-a24c-b47a89f55a72","year":2025},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:6699669ac51daac1bab2ab9dc039a7f567b354753aae773472122efdd71c2db8","observation_id":"59779c99-4c20-435a-b7b0-add0f9e270a1","resolution":{"observed_at":"2026-06-29T10:03:17.336301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":"1908.10084","doi":"10.48550/arxiv.1908.10084","metadata_source":"pith","pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","venue":"cs.CL","work_id":"27adfcc9-2a67-43d6-a844-78309012411f","year":2019},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:cacc2176eeb594d10ddacba1aa27147b43f021f5932133ab0b6792b6082ce9f4","observation_id":"b668a05e-2964-4c42-91ca-0e81e05789fb","resolution":{"observed_at":"2026-06-29T10:03:17.332087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:19:15.148899+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:b439e63843eee03e6d742718a59f76ecc8d94cd24cacd629d9f6b21b4eff4f11","observation_id":"3db8819a-a6db-4324-99dd-67cab17d334c","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"content\": [ {","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:7b71cb1d865a3f085757f5dbd33d467bf7fba71202237f26b3973effdf78fbe6","observation_id":"47e31db5-aa1f-43f5-a901-b614791c8d44","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"This step ensures the text re- mains natural and grammatically ﬂuid while strictly maintaining the harmlessness and anonymity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:fd370318dc8be0adeefb8d633be1e6e42874832e5c3821f196ed3adc7e71d9a1","observation_id":"c9115fe0-2dc1-4a64-a678-d6b7fc9f7c9d","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Samples deemed substan- dard or unnatural are strictly discarded","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:8845113beb1f09fc5e95d1a53bf944e2c441f5b8611f42a93b4f97f58cb09214","observation_id":"4640af23-ee48-46a2-9a68-15c9ac9b3ea9","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"These re- plenished samples undergo the same process before being added to the ﬁnal pool","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:1d7c5c4484e8af865eb9a70fe9793c5c36960dd25423cdcccec12a7d9433734f","observation_id":"25afb6ad-d4f6-4e05-9af9-c5a0b6c5f985","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Is the language vivid and rhythmically suitable for long-duration speech synthesis?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:404ffb218a13169ed23480bcfab3cabb0709cfe7f6ccf6b67d2452d9a7f96fbf","observation_id":"a41eec22-181d-4e0c-9cf4-03d6ef960ee5","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:1566b6329d369a9094b7809f6b453ae1de5348ee0a7f580ad94761574ae28fef","observation_id":"ac99821f-c7d9-4617-b3b6-040083f61927","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"• If the name belongs to a public ﬁgure (celebrity, politician, historical ﬁgure), retain it to preserve context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:7cf4e29b43098513243dfc09d3a2fd04034f998ac06f9894e2fbbb9007612010","observation_id":"180c303a-ab5e-470f-ba9f-6973d6db80e5","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:a527d9dd59e0052ac040a5a8ae952bca53f724f88b1a8d0b0c220133f51b45e2","observation_id":"a8b536a3-45ef-4f11-bd1b-d4db589e92a8","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Timbre Maintenance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:1525612017ec61b3a17e3350f08461d91120755a32871ef54f4e52b0d3b1a7a2","observation_id":"7c15244b-31a1-4c5d-90d8-3d6a928eefcb","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"In multi-speaker scenarios, this may also suggest inaccurate speaker transitions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:6157f7c124d78b1217576153599fb5df73d1a68473581ce58c82d304c98f8ffe","observation_id":"7bc31d46-8c26-4eb7-bb6f-9b79a24b529a","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:74e6ea6dc8a284224f28b8ff5f0fc1ed012644608f33e3225459c27a66e993ae","observation_id":"129b10d1-c40e-47f7-b0e4-0d7c681a7f0b","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Clarity and Fidelity","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:c4c6f8eaa9e4f758ac3fa57e2193ec2d7be426c1e452bddb95adafc65525b547","observation_id":"75a819d4-eb15-43b0-9cf7-103783a91874","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:a989f0ccb8b58ec3e9c8c896283c72086fa92cc97835c24443bd790c92c4e076","observation_id":"f437b5ed-6992-437a-b712-3a75b4424e2b","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:2feb10a96774d6ee6c6ff48463815cb65e5f1df59761b5f4e6339a81cee75528","observation_id":"c7cec463-2eec-4ee2-8cfc-f63ba7ab63fd","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"alloy”, “echo","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:e4c2ef73b8ca68b3b8eb6f4b9b2b4845318e55df82b7c47d44dfd1d2cf892516","observation_id":"4a09d481-5ef0-423c-8b60-6f6437b6c102","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:ea7e7c6ac9147cdb3a7906e8466a0557f78d2a4b9692dc3e10bcb780b7840687","observation_id":"324bd6a9-9b9d-4b06-9811-c97690e746d4","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Check for unnatural pauses, abrupt disjoints between words/phrases, and the logical ﬂow of intonation across sentence boundaries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:71d3379bd1b351d7730e811bdde4165f29ef289cc0dd60d6921f474bf6bc5658","observation_id":"abd231c6-6307-4ca7-8547-ed34761b9706","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Does the speaker correctly emphasize content words while de-emphasizing function words? Is there a natural \"melody\" (intonation contour) rather than a ﬂat or repetitive beat?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:2a38565a206a1a2a591b76f96fc4d29067b16e6ccd259778e7b8adf00abae72f","observation_id":"d2ff4e92-e39f-4b85-8e75-b7d54b21e042","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:c2a7644de0b2c6c1afed2600d3ea434b851cddb7bb97bc545d7b6ba6f1fb0ab8","observation_id":"1d7662af-dca4-4edc-8261-8d6a8d8dca67","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Overall_Impression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:3c406cace04da72df96ae4f7b8c793f1a13db13be5af555d873afdd216f7b2ec","observation_id":"13df5c37-bb01-4258-8097-1d008995bf34","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"Layering and Hierarchy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:8aba50ba10334575704dcc4581fc24f0d0b017bfe96015e18ef7fb1cde392a3f","observation_id":"a845f3df-b09c-48ec-bd4c-c8bb021a302e","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"one-note","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:fb3ed535dcd27cc7b07129555dfbb0071666cf20d9267d9a568a68d4777cf76c","observation_id":"e321883f-6343-48d7-bccc-53f9d271c474","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:1d067671e3d5d30fbf0c5da3fb433e4390ca65abde96c75054db8f72226c6b67","observation_id":"94a47788-1ab3-433b-be13-8f6ff994ddca","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:d255dd1ec70222a6257e4964d3decc149f7b083a42f694a1f45b88a890d6ee19","observation_id":"66773641-6a35-4c54-a89e-2c39a3ad9035","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T09:53:58.938270Z","title":"looping prosody","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T09:53:58.938270Z"},"links":{"citing_paper":"/paper/2605.28618"},"observation_digest":"sha256:b643cc9f9f26f5cf63875dc4224c191631ddd5a4c24b8975d2af31ccecad080d","observation_id":"3085563d-bc8c-4e50-84e1-f33705d27649","resolution":{"observed_at":"2026-06-29T09:53:58.938270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28618","last_updated":"2026-05-27T15:28:15Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T03:52:23.701192Z","submitted_at":"2026-05-27T15:28:15Z","title":"Comprehensive Benchmarking of Long-Form Speech Generation in Diverse Scenarios"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2605.28618."}