{"as_of":"2026-08-07T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3346c77e13153a8017f739139161e565d10382a78706e0ea7091831946176d49","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:07:04.687245Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.09389/citation-record","integrity":"/paper/2508.09389/integrity","json":"/paper/2508.09389/citation-record.json","paper":"/paper/2508.09389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:03.392930Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.392930Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:272dde883f911b519c904cc36346f0f0fb348444bb240cc633bad1e0e61c71d5","observation_id":"af1a2e70-ef1f-4678-9637-0e6f929c58fa","resolution":{"observed_at":"2026-08-05T21:07:03.392930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.444869Z","title":"Wagner, A","venue":null,"work_id":"9362c7f0-e9cd-491a-a5d5-91568d1da164","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.426682Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:276c07bc992ea3561fdbcad11ceba03f4b0a76e92250158e6ada3ab613472267","observation_id":"b5873b97-a4c4-4314-99f3-7984d46fb1ec","resolution":{"observed_at":"2026-08-05T21:07:08.485839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.339794Z","title":"Baevski, Y","venue":null,"work_id":"2070cb99-92a6-4e93-b07c-68bfff553902","year":2020},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.468678Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:6d4d8c804d0702de0d00b5a83dbf0a210b3cc69b1775531a66d1adf2e9c8684e","observation_id":"52a0aa08-64bc-4cd2-9676-469174888258","resolution":{"observed_at":"2026-08-05T21:07:08.399393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.182148Z","title":null,"venue":null,"work_id":"2a501847-0403-4b32-8251-b5f43fbee281","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.512136Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:affee57644b50cc9d281ced691ba551ef30d2751c9324d07a4ef728581360b38","observation_id":"30ba750f-32dc-495a-b0c0-4af55fa2fdee","resolution":{"observed_at":"2026-08-05T21:07:08.261096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:08.046495Z","title":"Jiang, Q","venue":null,"work_id":"658209e7-ef20-4634-b2e1-ac3cf8bc0612","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.556782Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:00abdffe1f19d142a011802006cc912805b82931c5d2a2fa36fc0b1edd642e63","observation_id":"073d556f-515d-4951-b668-902da2c5dd30","resolution":{"observed_at":"2026-08-05T21:07:08.129029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.910462Z","title":null,"venue":null,"work_id":"3bb33af9-1dfe-46c4-9f81-7334971db078","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.589543Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:bc86195b8078c4b61c7b45d4fb4da848235d020c86f8402997a27be049a7c9ba","observation_id":"8b485f06-3b51-41a9-9497-33afda1f5c45","resolution":{"observed_at":"2026-08-05T21:07:07.965985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.802777Z","title":null,"venue":null,"work_id":"566267fc-f2ac-4480-ae25-259509df7d36","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.625457Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:57db956d885f8760a780b256673c5d7e2eb6f10a7bc1a917c91c8ab0d1452023","observation_id":"510c333e-deb1-49cb-9811-631a0ef59daf","resolution":{"observed_at":"2026-08-05T21:07:07.854392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.724527Z","title":null,"venue":null,"work_id":"4eaa8e08-7fa6-4a10-9e5a-83889262bb08","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.662986Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:83fd58a2078fb9068a9e232551e08c9e1e09da9ea89cc1248ebd90958636546d","observation_id":"849a7761-7d76-48e1-8936-273a62fed5b9","resolution":{"observed_at":"2026-08-05T21:07:07.754490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.645220Z","title":"Chen and et al., `` WavLM : Large-scale self-supervised pre-training for full stack speech processing,'' IEEE Journal of Selected Topics in Signal Processing, vol","venue":null,"work_id":"6b2398da-0d83-4d4f-b8af-876e512dcb57","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.690668Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:0e4065a523730ccaf4352ef2647af6abed4c51104058752bca7984fd5438be7d","observation_id":"33bda1b8-93c3-48ee-a26b-0ef4fb9edb24","resolution":{"observed_at":"2026-08-05T21:07:07.675074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.559696Z","title":null,"venue":null,"work_id":"1f06a6b6-774b-4aaf-82de-32f8f1bd053a","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.723867Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:45229840b997c3e9f1d23ff481e402a56c9d51ad9e473f70fd1d82be1a74c258","observation_id":"68ce735c-3cea-4a7f-a8a8-ef00fb36557b","resolution":{"observed_at":"2026-08-05T21:07:07.574432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-05T21:07:03.766330Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.766330Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:72120f8f87d4b5bf0fabff6c19296d893e5819259ec011f468ef679e3b2beea0","observation_id":"2146cef1-0d9c-445e-8e79-3a3c1cf73e2a","resolution":{"observed_at":"2026-08-05T21:07:03.766330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.473170Z","title":null,"venue":null,"work_id":"645d2049-d0b5-4437-987d-629adbd6df86","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.800887Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:ec6828b84642f0e8f51b0280bd331df53968b3cdd28a65b37c198bed68973f55","observation_id":"ebae925a-c0c4-431a-9a5f-6daf5f8979c3","resolution":{"observed_at":"2026-08-05T21:07:07.523069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.391870Z","title":"Jaegle, S","venue":null,"work_id":"b00f6af4-bfb4-4fbc-a54c-6a174290f2c7","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.822689Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:517c07e608b1bbfe03d5348ac2070d8b6b23ce533a75e1bd3b5be197b22acd84","observation_id":"9e9cc14b-066b-44b6-927d-de7b65985e09","resolution":{"observed_at":"2026-08-05T21:07:07.433153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-05T21:07:03.845459Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.845459Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:04b45ca4ee91d89895ca04256b9094f4c8d502d6f5f53ffed904193c3730ffe6","observation_id":"8a8a0fbf-90ba-4799-b43e-99a25a9b2dc5","resolution":{"observed_at":"2026-08-05T21:07:03.845459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.326865Z","title":"Thienpondt and K","venue":null,"work_id":"ca8cfcd5-bc5e-419c-9a27-44adfc61fede","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.879763Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:252fbc3586819611c9abe1a91eb8c3a6a203e0c89ad23e52c29a4563b679fbd6","observation_id":"46bb490b-bbde-45f4-904c-71f4528fcfdc","resolution":{"observed_at":"2026-08-05T21:07:07.354116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.267356Z","title":null,"venue":null,"work_id":"518b2d4a-8636-413c-ba92-fd71ed16a4ea","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.909560Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:521abd89e1a0469208b1b69e69b8473a10544dd2018507eb7d78043e06f6708e","observation_id":"1cf83928-2b6c-4840-9b02-bc8bcb071a9c","resolution":{"observed_at":"2026-08-05T21:07:07.292966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.133632Z","title":"D \\' e fossez, G","venue":null,"work_id":"193376e9-ec70-4e10-ad2a-598c3063582c","year":2020},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.953723Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:2c6f31f9e59e113658486866b411c4cc82010bfd65d32ecb0a3647e21e42dcf3","observation_id":"4fbf5936-3483-4f98-80c6-83eea5fa60d7","resolution":{"observed_at":"2026-08-05T21:07:07.235373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.064878Z","title":"[Online]","venue":null,"work_id":"84e2bff3-a222-4754-93c4-44003837be9a","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:03.989061Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:2e105c6f74450052d2f41947fc9f491403cf0180e9eecdfee1841e5c3d39b673","observation_id":"416172af-8556-4ed3-9f76-b28532e974f2","resolution":{"observed_at":"2026-08-05T21:07:07.107419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:07.017960Z","title":"Savitzky and M","venue":null,"work_id":"a199a735-8a49-48f1-9c87-3fab8ebe48b8","year":1964},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.025652Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:c7f46fe48b24e048dcabf658f586ffbd1c824524a308047255272d49ce186af4","observation_id":"afc6c093-800b-474b-a11b-abdde27d1a8b","resolution":{"observed_at":"2026-08-05T21:07:07.041268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.963206Z","title":"McAuliffe, M","venue":null,"work_id":"f45403e6-262c-4548-a732-689954be4841","year":2017},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.063921Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:879c714bb0269e49ba87b0f8bef57e9f73abf505fa0c994c314d49335a00a541","observation_id":"0ffb8e84-dbd6-47a9-af88-b77afcc43944","resolution":{"observed_at":"2026-08-05T21:07:06.989837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.865114Z","title":null,"venue":null,"work_id":"6b0a67a9-6ee5-48d7-8b86-9148e0fedb0f","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.097536Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:81a2004b43125253e78c81153c5d2655079f38c6d3988b2997a033a7ca19cdbc","observation_id":"ebc4f2b6-ecab-416c-b742-da4688d141b8","resolution":{"observed_at":"2026-08-05T21:07:06.899480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.786043Z","title":"Ho and T","venue":null,"work_id":"323af39b-81c5-4eae-b08e-2caa1a050f39","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.133097Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:f170874e98bf02dccfb3f3efd77083793aa87ad1881f78afa86cd7c6ef339d4b","observation_id":"d78f63c6-a3a1-493e-9751-33e2ce28aa84","resolution":{"observed_at":"2026-08-05T21:07:06.819254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.700253Z","title":null,"venue":null,"work_id":"afdf2741-74a4-40b2-905c-3ff1e8239d88","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.161999Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:b0ed85103f033074208e1dd3a0c639f50e32f97df5e458c6cf007088e2a8e4f5","observation_id":"779a764b-a4ca-4ea6-9193-ebae064395b7","resolution":{"observed_at":"2026-08-05T21:07:06.732893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.587729Z","title":null,"venue":null,"work_id":"37c3cc31-e584-4f0a-9886-ed2b50d60b5d","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.184020Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:9357a7a7dfe6eb956826b77edffaa93c3e990c2d79bfb15664f5aebd43d30f5e","observation_id":"a279429e-af67-41a2-8811-3b7a78d59f09","resolution":{"observed_at":"2026-08-05T21:07:06.653050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.457506Z","title":null,"venue":null,"work_id":"06f5de1d-1810-41dd-8f47-2d397ec89ed3","year":2015},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.219170Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:d7014081e7da44ae710ae1875b280c1845d5d59470810e1d1d295b9f2ccb6093","observation_id":"4a6ac999-b6fa-47d2-a0ba-95e04b6be0cc","resolution":{"observed_at":"2026-08-05T21:07:06.514086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.280922Z","title":null,"venue":null,"work_id":"068e7053-1786-4ea9-8e0d-ded00de26bb7","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.244925Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:e5d19a1a65f620b5d35e39ecec373dde2c5c95ee3600fc1f4e1c86950c7c1caf","observation_id":"f938aa3e-05a2-4e59-b06e-1b254ccb8a0c","resolution":{"observed_at":"2026-08-05T21:07:06.350653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:06.156850Z","title":null,"venue":null,"work_id":"07fe48a2-d029-4efa-a49e-4eb2a7037469","year":2022},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.272721Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:0ddb755f0bf95aed040597fa5520c48f5af98256961efd2d3e674ec6a6bf998a","observation_id":"445d7921-3f95-4ac2-85e9-c3dd7f0b231a","resolution":{"observed_at":"2026-08-05T21:07:06.215093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.982403Z","title":"Chien and H","venue":null,"work_id":"050cb73d-3b01-47ce-a543-c2090a67df2e","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.304091Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:a2591d82c9c9f6d104ebaf008f13c0d85bf47d9646dc194c4b8b672acff546b1","observation_id":"4bbd39f6-33c2-4024-8488-2ec61a01b45e","resolution":{"observed_at":"2026-08-05T21:07:06.073832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.829599Z","title":"Raffel, B","venue":null,"work_id":"794491b4-5775-4cf8-b511-fb1052957146","year":2014},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.329730Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:cf902fd2d6ea419239719144bc52ee14566671f401115e96bd86601113ecb115","observation_id":"4b244e50-cfc9-468c-be08-82b4a237f0ab","resolution":{"observed_at":"2026-08-05T21:07:05.915428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.660043Z","title":"Kum and J","venue":null,"work_id":"280545c8-45a4-4dd0-873f-0d2684e1f6fc","year":2076},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.376099Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:9f62a68cfd0f6fedd1f759a7f5697af59d330f9000de5cc7c30a24093b8183c9","observation_id":"085fcc26-4427-4cef-97ae-1b99dfeba0b0","resolution":{"observed_at":"2026-08-05T21:07:05.717625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12258","last_updated":"2024-08-12T03:23:09Z","snapshot_observed_at":"2026-08-01T14:42:12.372500Z","submitted_at":"2023-01-28T17:30:47Z","title":"Cross-domain Neural Pitch and Periodicity Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12258","snapshot_observed_at":"2026-08-05T21:07:04.400204Z","title":"Morrison, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.400204Z"},"links":{"cited_paper":"/paper/2301.12258","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:2facccbcbbc4c8411400c3f233e55f61570e6eb17ef680fc2c954863a5cdcf6c","observation_id":"b953254c-8fb6-49bb-aab0-3c25f2473642","resolution":{"observed_at":"2026-08-05T21:07:04.400204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.556917Z","title":null,"venue":null,"work_id":"6e5b44e3-feba-4382-94aa-f8792bd88e47","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.437160Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:0c2ac78bb96d3bc43e5697d98775d03eb7ede8c348284c78c240a4e20bca95a7","observation_id":"7d9b7316-2466-46dd-8d55-e72c6777a1e8","resolution":{"observed_at":"2026-08-05T21:07:05.609688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.385961Z","title":null,"venue":null,"work_id":"e65de8c0-ed3e-4088-a91a-153884e77c8e","year":2021},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.476948Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:6c34d497f76850dc5dc1884c6bef9175de5c559b00fb2eed48a80e39e36015ac","observation_id":"757d582c-7539-4185-883e-98236c4a11f3","resolution":{"observed_at":"2026-08-05T21:07:05.453706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.197042Z","title":"gil Lee, W","venue":null,"work_id":"b56cdf4f-19a0-4f4b-b07c-808c540a1ae4","year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.502451Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:219600f678aff41a7a66c35cf4b1fbb536798f8db8cb3feba251acb8cbe4e558","observation_id":"438cf40b-a22c-46a8-924f-86339afdbdfa","resolution":{"observed_at":"2026-08-05T21:07:05.287075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.128935Z","title":null,"venue":null,"work_id":"ef676bef-5025-48ca-8ac9-359b6b22a850","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.550439Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:b9a77ebee639b6ddad52abd990655c9ebfe833eac1e93bcb9e86d383a7b4656e","observation_id":"1ff76753-3a61-4009-814b-4b9ede024937","resolution":{"observed_at":"2026-08-05T21:07:05.150939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.067029Z","title":"Casanova, K","venue":null,"work_id":"619df10c-0b48-4600-8c4d-7e3969266bcc","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.587098Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:81c4ce84a1923ebad2d344cc704e7723c04494688f52eb170910907500dd91df","observation_id":"585a22ff-5893-4dfa-a74a-fc7f4143d51c","resolution":{"observed_at":"2026-08-05T21:07:05.095755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-05T21:07:04.621533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.621533Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:f0373202c88bf47dc8eb330c5ce85d339a89e407d408f29d9c2587b8f74f7192","observation_id":"629c8f73-b06a-4b22-b96e-9b67c73425ec","resolution":{"observed_at":"2026-08-05T21:07:04.621533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:05.007983Z","title":"Peng, S.-W","venue":null,"work_id":"0f0dda4b-513e-4abf-ad49-c6de6ae022d5","year":2024},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.649558Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:d2206633dd96b7368fac95890ab7844b8a993fade1eb6f60793bbf619c19de7e","observation_id":"59de97ae-fb79-4ea4-a473-fef5f4c7a4e3","resolution":{"observed_at":"2026-08-05T21:07:05.023785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:07:04.923009Z","title":"[Online]","venue":null,"work_id":"a6f5e126-b0c9-4657-81f2-df7fc05b6610","year":2025},"citing_paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T21:07:04.687245Z"},"links":{"citing_paper":"/paper/2508.09389"},"observation_digest":"sha256:7f9e598ae8fbee5ed97a659f772481ea3910d5c5303ccd82b917e40f98b06055","observation_id":"19a7a2ec-eee2-4611-88ef-c64fb9797595","resolution":{"observed_at":"2026-08-05T21:07:04.962167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.09389","last_updated":"2025-08-12T23:12:18Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T23:08:48.237130Z","submitted_at":"2025-08-12T23:12:18Z","title":"ProMode: A Speech Prosody Model Conditioned on Acoustic and Textual Inputs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2508.09389."}