{"as_of":"2026-08-10T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14f308b546ff6c1825e9e6a9e56fe85908b46d4da9d358c45dedcf7f2a00ce0d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:50:17.390376Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:50:17.213254Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T20:50:17.551912Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"cited_work":{"arxiv_id":"2501.19258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.19258","snapshot_observed_at":"2026-08-09T20:50:17.551912Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","venue":"cs.CL","work_id":"f37b8878-1039-45e9-8df9-3ba9e0feea6f","year":2025},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.213254Z"},"links":{"cited_paper":"/paper/2501.19258","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:b4382cf0e749bc928a85cc0a9513ef4125a2f6a772ffb4ab91d5dd94ad9bca8b","observation_id":"46264d7c-d2c7-418f-8164-aa4dcda14f9b","resolution":{"observed_at":"2026-08-09T20:50:17.559362Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.19258/citation-record","integrity":"/paper/2501.19258/integrity","json":"/paper/2501.19258/citation-record.json","paper":"/paper/2501.19258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.989705Z","title":"Despite the high-quality output, the prosody of the generated speech sometimes be- comes inappropriate for the context","venue":null,"work_id":"13c7b242-499a-4a16-bd65-a560e469666f","year":null},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.207333Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:834ad6377ab09f1136be2ecc263d5329b1252ce175ae391c4506cff220cd598b","observation_id":"5a1cde93-cc78-44a7-a999-ef99aa50718d","resolution":{"observed_at":"2026-08-09T20:50:17.994955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"cited_work":{"arxiv_id":"2501.19258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.19258","snapshot_observed_at":"2026-08-09T20:50:17.551912Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","venue":"cs.CL","work_id":"f37b8878-1039-45e9-8df9-3ba9e0feea6f","year":2025},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.213254Z"},"links":{"cited_paper":"/paper/2501.19258","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:b4382cf0e749bc928a85cc0a9513ef4125a2f6a772ffb4ab91d5dd94ad9bca8b","observation_id":"46264d7c-d2c7-418f-8164-aa4dcda14f9b","resolution":{"observed_at":"2026-08-09T20:50:17.559362Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.973399Z","title":"Experimental Setup To assess the impact of visual information on speech generation performance, a dataset containing both diverse prosodic and vi- sual data is essential","venue":null,"work_id":"2efe053a-513e-47d0-9094-41de145fe96b","year":null},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.218991Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:69f6e492e41f69a8b54d61372ee7662ab24b5879831dcc4430e51e3b234de188","observation_id":"614772b2-901a-40fa-901d-0bc9060921b3","resolution":{"observed_at":"2026-08-09T20:50:17.978937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.938182Z","title":"Using two dis- tinct video feature extractors, we demonstrate that these visual features encapsulate prosodic information","venue":null,"work_id":"cc5fc97b-c58c-4795-8b98-f28cfbd3b02c","year":null},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.229624Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:f23763627e4bdca707ae532dad5ee7ed1aec945a3326cfb0f3289a9b4e70f5e1","observation_id":"b65af53c-99b6-4490-8153-84449ea9e73f","resolution":{"observed_at":"2026-08-09T20:50:17.944262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09934","last_updated":"2022-04-21T07:49:09Z","snapshot_observed_at":"2026-08-07T02:30:21.925645Z","submitted_at":"2022-04-21T07:49:09Z","title":"FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09934","snapshot_observed_at":"2026-08-09T20:50:17.254499Z","title":"FastDiff: A fast conditional diffusion model for high-quality speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.254499Z"},"links":{"cited_paper":"/paper/2204.09934","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:a57e697d70e6bee4b15be892069aa4b98f104fd0e3cb345d9efea648cba77df5","observation_id":"5116b954-f3ef-435a-bc36-ba1e01d24db1","resolution":{"observed_at":"2026-08-09T20:50:17.254499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.919592Z","title":"Deep mixture density networks for acous- tic modeling in statistical parametric speech synthesis,","venue":null,"work_id":"a7c5904a-d569-48d3-8216-6beaad87f7c4","year":2014},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.234534Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:02461d1594f92e765a3db9660156cf590e81608afb5c53ce0286225399c858ab","observation_id":"9638055a-4317-40f2-8b01-ae94bdd9e1ea","resolution":{"observed_at":"2026-08-09T20:50:17.925404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.955763Z","title":null,"venue":null,"work_id":"e531f971-71b1-4809-a965-860dc1d71a78","year":null},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.224287Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:0d4135eb4a6b3154680f4911cbf3e959a0f31af3e002ddbc6732650123085f6e","observation_id":"6ef20369-d217-483d-b630-cd32c8fcf63c","resolution":{"observed_at":"2026-08-09T20:50:17.961376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.900848Z","title":"Unidirectional long short-term memory re- current neural network with recurrent output layer for low-latency speech synthesis,","venue":null,"work_id":"0c8e5a79-ca7f-4fb5-9ebd-eb191808f938","year":2015},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.239311Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:2616213125c4a563844aec63ae1987bdb044873235dd9a3a410d2adfd4b03808","observation_id":"88fe2c5f-9cc4-4a1b-b191-bdac925e8e76","resolution":{"observed_at":"2026-08-09T20:50:17.906544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.883333Z","title":"NaturalSpeech: End-to-end text-to- speech synthesis with human-level quality,","venue":null,"work_id":"4f2c3538-858e-43d0-b0ea-726b9aecd3d8","year":2024},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.244348Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:1c853102784fe77c0b08f899da91d1868dafcbb930276d2db66dd716d6adbdf6","observation_id":"7bc7dcca-935c-4562-86a2-3d334cd4375a","resolution":{"observed_at":"2026-08-09T20:50:17.888796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.866028Z","title":"FastSpeech: Fast, robust and controllable text to speech,","venue":null,"work_id":"72a3e022-ae40-419d-9b24-126edb84317e","year":2019},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.249595Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:260899e07004c0eb8357b5b5682ca99048b623b192fa77374fe0089ebe6d6c7b","observation_id":"9d9b9273-93e7-4dd2-bef1-3602fcccba1b","resolution":{"observed_at":"2026-08-09T20:50:17.871652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.849257Z","title":"On granularity of prosodic representations in expressive text-to-speech,","venue":null,"work_id":"8d91f924-1d8c-460d-ab72-8f81eeb1426c","year":2022},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.260279Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:c7a24340d3670900df88e1c4d5d5ae7834cc77b11ce0602b037b3471eed991a7","observation_id":"6bf8f256-6251-4a71-921f-55f767396b09","resolution":{"observed_at":"2026-08-09T20:50:17.854616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-09T20:50:17.265052Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.265052Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:cc0736295bdb868315cf41aa80d7089a1af4d2d7219b1f9cec0ffaa63efe77e5","observation_id":"b3401b66-54ee-4800-a4b7-f3fed282a958","resolution":{"observed_at":"2026-08-09T20:50:17.265052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.832978Z","title":"Chive: Varying prosody in speech synthesis with a linguistically driven dynamic hierarchical conditional variational network,","venue":null,"work_id":"a118d46c-d2f4-4084-9c02-ff06adae820d","year":2019},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.275553Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:1d40fbe35f660deb2f645699ce872aa8bd47f0fbfa7f662a5266beb43deb2d47","observation_id":"0c0bffc1-dbce-4135-85f1-968810ebaf38","resolution":{"observed_at":"2026-08-09T20:50:17.838085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.280420Z","title":"Mellotron: Mul- tispeaker expressive voice synthesis by conditioning on rhythm, pitch and global style tokens,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.280420Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:d788b1a56be4cc83a14afae3b4e2293397de1dc344331a0151aa540b552a4bb8","observation_id":"d0eea874-c8af-416c-b8dc-55541afae4b7","resolution":{"observed_at":"2026-08-09T20:50:17.280420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12708","last_updated":"2024-04-21T07:17:14Z","snapshot_observed_at":"2026-08-04T00:42:56.058282Z","submitted_at":"2023-05-22T04:37:41Z","title":"ViT-TTS: Visual Text-to-Speech with Scalable Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12708","snapshot_observed_at":"2026-08-09T20:50:17.284979Z","title":"VIT-TTS: visual text-to-speech with scalable diffusion transformer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.284979Z"},"links":{"cited_paper":"/paper/2305.12708","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:7ca18b7c5ca6327e6f75360235ac05438a03df25f3c571da76c2f29c86c42aca","observation_id":"94ffe127-0a7d-4bff-af9a-4a3d08338dee","resolution":{"observed_at":"2026-08-09T20:50:17.284979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.289999Z","title":"The LJ Speech Dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.289999Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:3f109e913bafb0aaf4322d7b254db4f9645531a23f30b66a1beba3adac3c7544","observation_id":"46b094d9-a8b9-4d94-819b-d3989ab742f9","resolution":{"observed_at":"2026-08-09T20:50:17.289999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-09T20:50:17.294686Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.294686Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:82bbb5584a0bd235715a7eaf44c0887ca039ab9878b41089fcb61efcbaec2273","observation_id":"ed07cf1c-e7a6-4559-b713-9ea96e7bb626","resolution":{"observed_at":"2026-08-09T20:50:17.294686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.796049Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"b354ea15-088c-4a97-aae8-ab00facccd34","year":2022},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.300516Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:9ec8bb36026b39e2d78d9e643967e9597eb4b40e5eb35f2b3a3b1ac2a069f2a7","observation_id":"9a95dddd-a602-4907-a7dd-a1b6023ca39c","resolution":{"observed_at":"2026-08-09T20:50:17.801073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.780127Z","title":"Condensed movies: Story based retrieval with contextual embeddings,","venue":null,"work_id":"b5a2cf19-8654-498e-8231-487a1ae28728","year":2020},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.305703Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:87c8bb42b099a3043e24e0dbbcd35b838ba0e36893af74ec1df62fb3a7432f9a","observation_id":"3fab26cc-05a9-4223-80fa-deed08cd241a","resolution":{"observed_at":"2026-08-09T20:50:17.784934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.764865Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"fcd90520-9a1a-4fc3-bdc8-51aaa1f5d1fb","year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.310629Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:ee7e0a7a0fadf0f2c8af2c7d6e7b62355888b31f79a6aef150ef4eb7b7fa1169","observation_id":"c26d7058-5e60-4d59-8f14-ba95f6a3a9f1","resolution":{"observed_at":"2026-08-09T20:50:17.769915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.749489Z","title":"CMD+: A D.I.Y . Audiovisual Dataset for Multi- Speaker TTS,","venue":null,"work_id":"a2e59f9b-ab1f-4699-b086-ed4484e8d9aa","year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.316038Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:7267d4ab3eb80c0f7be175b869784fba718f36b8e59c0234a82920499af8df33","observation_id":"f03ce37d-88da-4aec-a4cd-b3e2861d5cc6","resolution":{"observed_at":"2026-08-09T20:50:17.754642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06979","last_updated":"2024-04-19T09:16:17Z","snapshot_observed_at":"2026-08-09T12:23:36.959806Z","submitted_at":"2023-08-14T07:32:03Z","title":"The Sound Demixing Challenge 2023 $\\unicode{x2013}$ Music Demixing Track","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06979","snapshot_observed_at":"2026-08-09T20:50:17.320971Z","title":"The sound demixing challenge 2023 music demixing track,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.320971Z"},"links":{"cited_paper":"/paper/2308.06979","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:8d80779249f613460f0fd498c5f6633d4b8c9c04be4703d125c0b4ea5758059e","observation_id":"ec659a45-2c03-4b10-bd2e-179f4d146a1d","resolution":{"observed_at":"2026-08-09T20:50:17.320971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.732988Z","title":"Resemblyzer,","venue":null,"work_id":"7de90749-4c4f-425a-9e2c-e8c633d94123","year":2024},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.326282Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:a5bdb29b50245ee4dddd34919da5e4c9fde680c2ea419f50adc0e0e80f722c39","observation_id":"77c18112-6f8c-482e-b89b-e2c661ee6d81","resolution":{"observed_at":"2026-08-09T20:50:17.738232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-09T20:50:17.331087Z","title":"Audiobox: Unified au- dio generation with natural language prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.331087Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:3fcfd63d78b439e33f128566276a2d14a5b295a8fb841cd0984fcc57dcb69b96","observation_id":"ba086c40-95b3-425b-8253-8c5412fe4d0d","resolution":{"observed_at":"2026-08-09T20:50:17.331087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.716103Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"ca4a9574-319a-4aeb-ae01-94561cbd304f","year":2010},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.336097Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:099ce3788fbef7b67e83774fe7fdd9b57139ab9364b20cc89ba9cf0a85380373","observation_id":"d23f2617-43ca-43af-9b6f-d7c6a5031199","resolution":{"observed_at":"2026-08-09T20:50:17.721365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.698844Z","title":"Per- ceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"47d6c73f-b3e9-46ae-be9e-f9e0ff4725cf","year":2001},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.341247Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:3cf44238f20867325b04307c5a554aa9a5ac8b3b8ecefa02f9b152874b6dd96a","observation_id":"1fc38aa8-fb53-4dd2-9a6f-7a97c3cbc26a","resolution":{"observed_at":"2026-08-09T20:50:17.705037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.681721Z","title":"SDR– half-baked or well done?","venue":null,"work_id":"d8ba951a-f959-4133-88ec-08c94a028a5e","year":2019},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.346185Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:3174595d9215f1c0b006102db9d4763d317a048f66f94e06229dd6614dcef495","observation_id":"8ac8f403-5036-45c5-b5a3-c09bb07886bd","resolution":{"observed_at":"2026-08-09T20:50:17.686765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.665203Z","title":"Torchaudio-Squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"687777f6-b9fe-444a-97a3-b64e8739f4e2","year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.350971Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:637866d15a19d4c7d6290abdc2bb1f5218f04f3035b09b0aa2249aae1391cda1","observation_id":"0f45bc67-4145-4ae8-ac5e-f4f90fd1eec3","resolution":{"observed_at":"2026-08-09T20:50:17.670742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.646401Z","title":"Omnivore: A single model for many visual modalities,","venue":null,"work_id":"84a6b57b-db4c-4806-830d-824d5d55bb75","year":2022},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.356165Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:49a2c80c2537927a7208ea5b6d86bba47080988768840df84af2f96e0215a3d3","observation_id":"d918af71-c765-4722-8453-a3ce1a8793bc","resolution":{"observed_at":"2026-08-09T20:50:17.651564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.360860Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.360860Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:cfdf630d38e3edc0ef650fd01fa36a389d22e5c312264a3062decab1e03cd3cd","observation_id":"a12931ea-8921-4708-afa1-3bc265c6a23e","resolution":{"observed_at":"2026-08-09T20:50:17.360860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T20:50:17.365484Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.365484Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:401548bc11e8ceadad3a3ecef5f71651099698515119bcde3b81b0a75f87511c","observation_id":"de6c5db6-6bc8-4274-87e0-efa7ea411131","resolution":{"observed_at":"2026-08-09T20:50:17.365484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.619705Z","title":"FastPitch: Parallel text-to-speech with pitch pre- diction,","venue":null,"work_id":"2f5f34db-97a6-4efe-b147-cd93f270d590","year":2021},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.370920Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:ef35ac0751372093187acdccbfa1ce3f8438fedeb71f5d560b135535c61469a7","observation_id":"dfe24b21-8c07-4d94-97e1-6b4b4d3a5c46","resolution":{"observed_at":"2026-08-09T20:50:17.624813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.603554Z","title":"Sonicvisionlm: Playing sound with vision language models,","venue":null,"work_id":"fd382db7-474c-4df9-b874-9fe6c9fdfa50","year":2024},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.375699Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:2d86de7090f05596ae07e1d31641adbef0bedc79fa394055917de08adca784e5","observation_id":"e3e3b893-f7fc-4721-9143-ac3f359b7a27","resolution":{"observed_at":"2026-08-09T20:50:17.608653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.588152Z","title":"End-to-end video-to-speech synthesis using gener- ative adversarial networks,","venue":null,"work_id":"e77dbcef-8fa6-4940-a04a-73e3d0dcc228","year":2022},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.380409Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:b2a182b1b418949e77935b4a80e3e96dbc618a0e9860d412924488c16eeb8634","observation_id":"4eeae4f1-ef67-4de6-8687-25c0e93965a3","resolution":{"observed_at":"2026-08-09T20:50:17.593035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19603","last_updated":"2023-05-31T07:17:32Z","snapshot_observed_at":"2026-07-06T15:35:49.019768Z","submitted_at":"2023-05-31T07:17:32Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19603","snapshot_observed_at":"2026-08-09T20:50:17.385174Z","title":"Intelligible lip-to-speech synthe- sis with speech units,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.385174Z"},"links":{"cited_paper":"/paper/2305.19603","citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:d8c6ef697cefc43336017d8cf33b85c30a35b1f2a8103525540a440ab4049ef1","observation_id":"dce0b177-93b1-4bad-ac6b-1a923b5ebdff","resolution":{"observed_at":"2026-08-09T20:50:17.385174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:50:17.572403Z","title":"Camp: a two-stage approach to modelling prosody in context,","venue":null,"work_id":"1fb543ad-7ef5-43bb-9e88-e75c91b1ca9c","year":2021},"citing_paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T20:50:17.390376Z"},"links":{"citing_paper":"/paper/2501.19258"},"observation_digest":"sha256:1e038b0f21c467020998fee1a5d0e0ac2000123d3330944bbe3305b066e7a02a","observation_id":"f82f58ef-f399-4ae2-8df7-c33c5e669b64","resolution":{"observed_at":"2026-08-09T20:50:17.577819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.19258","last_updated":"2025-08-16T21:44:41Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T20:44:21.325715Z","submitted_at":"2025-01-31T16:16:52Z","title":"VisualSpeech: Enhancing Prosody Modeling in TTS Using Video"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2501.19258."}