{"as_of":"2026-08-07T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0783a8128d930612848747f54179f0a940133879ddc7d99282e2d7b5363b27de","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:21:08.945087Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.506505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2404.18398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-07-04T19:20:06.506505Z","title":"Mm-tts: A unified framework for multimodal, prompt-induced emotional text-to- speech synthesis","venue":null,"work_id":"a2a66868-db3d-4c0c-a7f4-ea0feac17fe3","year":2024},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:ea604c84e335acb82f33bb23d559f7e41bef0a97956c02064b87103b16ac0504","observation_id":"3be1f78d-e8b2-4032-8a1d-270876184055","resolution":{"observed_at":"2026-05-23T20:33:25.607564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-08-07T11:21:08.945087Z","title":"Mm-tts: A unified framework for multimodal, prompt-induced emotional text-to- speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02742","last_updated":"2025-06-03T10:59:22Z","snapshot_observed_at":"2026-08-07T11:14:44.960159Z","submitted_at":"2025-06-03T10:59:22Z","title":"Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:08.945087Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2506.02742"},"observation_digest":"sha256:7f03ac999359adc9063a2fe30c072fb17ecdee4f6c2814a437ac74fc94a6784a","observation_id":"f07309b6-b2ef-48d8-b8e6-9e074049233b","resolution":{"observed_at":"2026-08-07T11:21:08.945087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-08-06T22:43:50.830879Z","title":"Mm-tts: A unified framework for multimodal, prompt-induced emotional text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20945","last_updated":"2025-06-26T02:23:42Z","snapshot_observed_at":"2026-08-06T22:35:06.588077Z","submitted_at":"2025-06-26T02:23:42Z","title":"A Multi-Stage Framework for Multimodal Controllable Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:43:50.830879Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2506.20945"},"observation_digest":"sha256:e3f505a2c37a8d4ee0fec7682034c4c65c7916a3355de034e8e0e392df06d6cd","observation_id":"96b659af-c3d2-464f-83f5-8ed7af6292f7","resolution":{"observed_at":"2026-08-06T22:43:50.830879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2404.18398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-07-04T19:20:06.506505Z","title":"Mm-tts: A unified framework for multimodal, prompt-induced emotional text-to- speech synthesis","venue":null,"work_id":"a2a66868-db3d-4c0c-a7f4-ea0feac17fe3","year":2024},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-02T22:28:42.271827Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:dedfe41eca8836ede645a9acf9d0aeff59786f74173dc84e26cb558ef3fa190b","observation_id":"8bded358-4646-41f1-88a6-af57105b282c","resolution":{"observed_at":"2026-05-20T21:19:03.257678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2404.18398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18398","snapshot_observed_at":"2026-07-04T19:20:06.506505Z","title":"Mm-tts: A unified framework for multimodal, prompt-induced emotional text-to- speech synthesis","venue":null,"work_id":"a2a66868-db3d-4c0c-a7f4-ea0feac17fe3","year":2024},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2404.18398","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:fe51873e669ac1498196ca46e487a27488c47ff520608751b44d1ebe3c8002de","observation_id":"a2c781c3-7c6d-4031-b415-78f7234c5ab1","resolution":{"observed_at":"2026-07-04T19:20:06.508321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.18398/citation-record","integrity":"/paper/2404.18398/integrity","json":"/paper/2404.18398/citation-record.json","paper":"/paper/2404.18398"},"outbound":[],"paper":{"arxiv_id":"2404.18398","last_updated":"2025-02-18T21:39:25Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T03:19:39Z","title":"UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2404.18398."}