{"as_of":"2026-08-11T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd3df5f071ca147b3ed94bf40b4a96a511ff0d1d6b78efa05f2ecef28997f074","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:34:07.920960Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18748/citation-record","integrity":"/paper/2412.18748/integrity","json":"/paper/2412.18748/citation-record.json","paper":"/paper/2412.18748"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.432936Z","title":"Neural dubber: Dubbing for videos according to scripts,","venue":null,"work_id":"d3dd0ed3-6dab-45df-a4cf-434bab6f6e4d","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.758539Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f7d24e961c1478aaf9b50ef9285eb62d7523431ffc766d2db26e2bdf6e6ca84a","observation_id":"1764f373-12b8-4dc3-9752-73911e284520","resolution":{"observed_at":"2026-08-11T04:34:08.436892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.419652Z","title":"Prosody Modeling with 3D Visual Information for Expressive Video Dubbing,","venue":null,"work_id":"c292c2ca-1e99-4520-8337-59552a03d989","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.763464Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:6d05fd5fcac4d32aeb5c2586c79611ead15911315319d52afb0bb8443d200343","observation_id":"ec54db63-1103-45d6-a4df-f48b18939241","resolution":{"observed_at":"2026-08-11T04:34:08.423769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12636","last_updated":"2024-07-02T03:42:36Z","snapshot_observed_at":"2026-08-10T15:59:57.529494Z","submitted_at":"2024-02-20T01:28:34Z","title":"StyleDubber: Towards Multi-Scale Style Learning for Movie Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12636","snapshot_observed_at":"2026-08-11T04:34:07.768994Z","title":"Styledubber: Towards multi-scale style learning for movie dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.768994Z"},"links":{"cited_paper":"/paper/2402.12636","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:00ba9ead5da6661e2887856e0554a9c6fc76ab69bd5964e854bc2ce451c2f12b","observation_id":"532688cd-8e25-4821-9be8-8dccc87e6896","resolution":{"observed_at":"2026-08-11T04:34:07.768994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.406292Z","title":"V2c: Visual voice cloning,","venue":null,"work_id":"69e04222-d87c-40c6-82fe-1f9fd3accff6","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.774060Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:26e186ccb959d49c2c97a37edfa45ff461c2c94f61bb7595df5d90e3b4460a94","observation_id":"d8e07d3b-dd93-47d1-a79c-27271ebc6bc6","resolution":{"observed_at":"2026-08-11T04:34:08.410226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.392546Z","title":"From speaker to dubber: Movie dubbing with prosody and duration consistency learning,","venue":null,"work_id":"cb54df0e-6e25-4d0c-8599-a9054d010d73","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.778636Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f880fab2c7a73560c03414e393d050ee3a6eb98206eb27c781c112fa081edddb","observation_id":"6d8cef30-e21c-4608-acba-195e24dab3aa","resolution":{"observed_at":"2026-08-11T04:34:08.397469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08988","last_updated":"2025-04-25T01:06:20Z","snapshot_observed_at":"2026-07-06T20:05:41.350080Z","submitted_at":"2024-12-12T06:39:49Z","title":"EmoDubber: Towards High Quality and Emotion Controllable Movie Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08988","snapshot_observed_at":"2026-08-11T04:34:07.783191Z","title":"Emodubber: Towards high quality and emotion controllable movie dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.783191Z"},"links":{"cited_paper":"/paper/2412.08988","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:90d2970510faa6b7feaf77e943839e6d3acd5409b087f9afaf2546d74d8bd8f4","observation_id":"3d42e29e-c8bc-407d-8f4b-c075f902d825","resolution":{"observed_at":"2026-08-11T04:34:07.783191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17005","last_updated":"2023-06-29T15:02:22Z","snapshot_observed_at":"2026-07-06T15:48:21.177346Z","submitted_at":"2023-06-29T15:02:22Z","title":"High-Quality Automatic Voice Over with Accurate Alignment: Supervision through Self-Supervised Discrete Speech Units","version":1},"cited_work":{"arxiv_id":"2306.17005","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.17005","snapshot_observed_at":"2026-08-11T04:34:08.110203Z","title":"High-Quality Automatic Voice Over with Accurate Alignment: Supervision through Self-Supervised Discrete Speech Units","venue":"eess.AS","work_id":"23147c2e-b629-45f0-85de-15e88f6e085a","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.788553Z"},"links":{"cited_paper":"/paper/2306.17005","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:4f1bcddbf03e47bf3baaa730e732630b2bb90698908f6b61efe5e6151859bb71","observation_id":"076a3700-5358-47d4-b854-4be31dabfaa0","resolution":{"observed_at":"2026-08-11T04:34:08.115409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08802","last_updated":"2024-06-13T04:36:34Z","snapshot_observed_at":"2026-08-04T10:22:07.789335Z","submitted_at":"2024-06-13T04:36:34Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08802","snapshot_observed_at":"2026-08-11T04:34:07.793247Z","title":"Dubwise: Video-guided speech duration control in multimodal llm- based text-to-speech for dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.793247Z"},"links":{"cited_paper":"/paper/2406.08802","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:30ed31ccade7100554ddd5ae614b8f7c3843c82d6ce6fcc96a4677de1775cb58","observation_id":"a9d75b0b-ad46-4407-adea-1b9b0a18b657","resolution":{"observed_at":"2026-08-11T04:34:07.793247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.797858Z","title":"More than words: In-the-wild visually-driven prosody for text-to-speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.797858Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:c8d7d189df1b143e60f72bcba73bcdc88872371464f04301ba8d8c4ba1a6dbca","observation_id":"10c9ed64-3d2a-46ff-baba-9e02046012bd","resolution":{"observed_at":"2026-08-11T04:34:07.797858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.369965Z","title":"Learning to dub movies via hierarchical prosody models,","venue":null,"work_id":"10cfb917-69d0-46f4-8860-7ccc308c8d7e","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.803591Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:ddaf3241a414c5d2b4b2d71376f7da5d56109a8aac7eca26b4cfe557360e13f0","observation_id":"ec185281-1a87-4f95-95d9-0d25343fd108","resolution":{"observed_at":"2026-08-11T04:34:08.374498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11593","last_updated":"2024-09-04T01:25:55Z","snapshot_observed_at":"2026-08-09T11:33:45.429496Z","submitted_at":"2024-08-21T12:59:42Z","title":"MCDubber: Multimodal Context-Aware Expressive Video Dubbing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11593","snapshot_observed_at":"2026-08-11T04:34:07.808156Z","title":"Mcdubber: Multimodal context-aware expressive video dubbing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.808156Z"},"links":{"cited_paper":"/paper/2408.11593","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:071c67968bf38089d2050950f5a1c3710b781ec03324568e0fbdaf015d27d624","observation_id":"eb396945-041d-4a16-9cc0-c33c93495eeb","resolution":{"observed_at":"2026-08-11T04:34:07.808156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.354892Z","title":"To- wards Multi-Scale Speaking Style Modelling with Hierarchical Context Information for Mandarin Speech Synthesis,","venue":null,"work_id":"1eefca02-fe36-4d7d-b727-d92ecdab27f5","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.813123Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:847224ba4768a6c5613de56c8672d9fac08c8bdf2d818d7a647427d13e4bcbe8","observation_id":"5b6c150b-4206-40f6-9818-d1ee99cd7d13","resolution":{"observed_at":"2026-08-11T04:34:08.359596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.341056Z","title":"Msstyletts: Multi-scale style modeling with hierarchical context infor- mation for expressive speech synthesis,","venue":null,"work_id":"7e7b35f8-032f-4cb8-b58c-e359aef3ad62","year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.817279Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:2832a7d01d8f0422ec50d32cdb90e420c556f8bdaf8c439f6f0cbe33bae45592","observation_id":"0d71bcdc-de81-40a7-9b32-2f5b9f125c49","resolution":{"observed_at":"2026-08-11T04:34:08.345484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.326140Z","title":"Unsupervised multi-scale expressive speaking style modeling with hierarchical context information for audiobook speech synthesis,","venue":null,"work_id":"8197bc5d-64d3-4745-8818-601c59ddac07","year":2022},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.821403Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:ec4f7dd19c77d919407551de4f2b1faa2d8887c70e8bd9e633b51aca748c2b37","observation_id":"688ab624-d08f-4aa7-9a80-136595686d56","resolution":{"observed_at":"2026-08-11T04:34:08.331259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.825600Z","title":"Mae-dfer: Efficient masked au- toencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.825600Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:e9fb3be4b6badd0c9e53fce727ac570369eb04300b93984325f1ee38ea8f8e6d","observation_id":"edfbc176-425b-45b1-8274-b302725aed01","resolution":{"observed_at":"2026-08-11T04:34:07.825600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.830150Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.830150Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:663e246c0cd79c1c99e019eef49add1450057da2317f0ac409e22244cabf425e","observation_id":"37cda586-b2a8-43b7-a36e-3a46b127c0eb","resolution":{"observed_at":"2026-08-11T04:34:07.830150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.834265Z","title":"Estimation of continuous valence and arousal levels from faces in naturalistic conditions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.834265Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:20598b93970869da76412a910d835320279b98c80fc023728f833331b8278f77","observation_id":"0a5f69df-dd96-4e6b-99c6-b53bed2baedc","resolution":{"observed_at":"2026-08-11T04:34:07.834265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03521","last_updated":"2021-04-08T05:50:09Z","snapshot_observed_at":"2026-07-06T10:57:30.968546Z","submitted_at":"2021-04-08T05:50:09Z","title":"Towards Multi-Scale Style Control for Expressive Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2104.03521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.03521","snapshot_observed_at":"2026-08-11T04:34:08.061442Z","title":"Towards Multi-Scale Style Control for Expressive Speech Synthesis","venue":"cs.SD","work_id":"d4bb2001-f1b3-449c-88d1-bd83584466f5","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.838476Z"},"links":{"cited_paper":"/paper/2104.03521","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:214d04c7ab0a838bd0dd3551027b046473335fadbd7aedb70373e4f070abb95c","observation_id":"ce456576-3b5c-4c7f-83c9-3b088757a057","resolution":{"observed_at":"2026-08-11T04:34:08.066385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.843110Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.843110Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:65af9c46e5a759f016f8c2960bb3b24f496f3f2a153b7dd476ba884f42efff4e","observation_id":"f6da0022-bbc2-459a-b689-5e853cf2a636","resolution":{"observed_at":"2026-08-11T04:34:07.843110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.277443Z","title":"Emotion-english-roberta-large,","venue":null,"work_id":"3ea95d70-b7f4-460d-b98d-8e1c9fee08a7","year":2021},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.847568Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:79a9b5e9480e7013761fc4b0b7304337fdb937aba2ec106b3535dd4d5bd29986","observation_id":"60da494e-3e91-4d06-9a2b-37f6263c0626","resolution":{"observed_at":"2026-08-11T04:34:08.281979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-11T04:34:07.851676Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.851676Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:95402ee84640866c4636b4207c16dc27e6c7389021f17a2f0e4287829a1b1203","observation_id":"8bd7cb49-60bb-4b7c-af54-203db6ed751b","resolution":{"observed_at":"2026-08-11T04:34:07.851676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.856108Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.856108Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:bbaba712e3c017c773cc6457f5cd16a8d72699a73c6ecc54e7701f41b45f0375","observation_id":"bf5a25f9-586a-43d5-b5cb-77c6bbd199c2","resolution":{"observed_at":"2026-08-11T04:34:07.856108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.860218Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.860218Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:076fd9ae8f0056a4a85b02c68887b0e6550ae2d9dbe843db38097a01387dadc1","observation_id":"0f6185fe-dba4-47dd-b786-bceae8be4482","resolution":{"observed_at":"2026-08-11T04:34:07.860218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06646","last_updated":"2024-06-10T02:08:25Z","snapshot_observed_at":"2026-07-06T18:28:24.821865Z","submitted_at":"2024-06-10T02:08:25Z","title":"Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge","version":1},"cited_work":{"arxiv_id":"2406.06646","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06646","snapshot_observed_at":"2026-08-11T04:34:08.027194Z","title":"Emotion-Aware Speech Self-Supervised Representation Learning with Intensity Knowledge","venue":"eess.AS","work_id":"e3bd0ede-9990-4144-8708-e59d45da12e0","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.863878Z"},"links":{"cited_paper":"/paper/2406.06646","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f3340db176381c40e444b6c28dc9423932992d59d9c853f59796c8210ea8fd3d","observation_id":"8f05115e-8c98-41a0-8900-5ef51a094696","resolution":{"observed_at":"2026-08-11T04:34:08.031588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10903","last_updated":"2018-02-04T19:13:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-10-30T12:41:12Z","title":"Graph Attention Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10903","snapshot_observed_at":"2026-08-11T04:34:07.868501Z","title":"Graph attention networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.868501Z"},"links":{"cited_paper":"/paper/1710.10903","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:7be409ef3f1708df1ed5b9467ddaf997dc10be471e03bcb34c591d4f226d8f59","observation_id":"98ea45bd-36ee-4d5e-83fa-c11bcb31e692","resolution":{"observed_at":"2026-08-11T04:34:07.868501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.872926Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.872926Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:ea710b5c454887da00c39f11c71ce260abf9577bd060eee45222fffefe9a1339","observation_id":"e8d6a142-b366-41a0-9501-e5f13c3e9403","resolution":{"observed_at":"2026-08-11T04:34:07.872926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.236596Z","title":"A method for fundamental frequency estimation and voicing decision: Application to infant utterances recorded in real acoustical environments,","venue":null,"work_id":"0a3321ff-d6aa-4825-8632-9ef998cdfc02","year":2008},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.877073Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:7ab5e3d32fae112a136553456d3b10f32d96d47781f9974a16f00a6e04a99cbb","observation_id":"2f32eebf-0417-427d-917a-9b4282893bbb","resolution":{"observed_at":"2026-08-11T04:34:08.241427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.222121Z","title":"Reducing f0 frame error of f0 tracking algorithms under noisy conditions with an unvoiced/voiced classification frontend,","venue":null,"work_id":"10ba46a6-e3f0-4dba-8349-c56bd9013074","year":2009},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.881464Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f55fc4adcf00c031dad53007a3b0771ec49c7672d0c779530173c3fc349e9fbd","observation_id":"bd2a6eaf-eeac-401a-9bc7-d319b635a0c3","resolution":{"observed_at":"2026-08-11T04:34:08.226734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.885819Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.885819Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:09e0e05bafcce5d5e1182a499ba1be03c2696ebd4cf5c5ffee569e0ab0c26cb3","observation_id":"6543205f-33e0-49c2-a923-6013d7cf04da","resolution":{"observed_at":"2026-08-11T04:34:07.885819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.199310Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"0eefc0f7-f2e7-4c4d-bdb6-16c7ac7e7b80","year":2020},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.890030Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:57b01444ef0eba69457ce890f50e39ff33b47635b08edd94a99850e59bdbb4ba","observation_id":"05c1dd58-9811-46ec-964f-baf9744ac89a","resolution":{"observed_at":"2026-08-11T04:34:08.203889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.894310Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.894310Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:b95247e583290b49fcff4d9f411e16d7a80075ef386705fc2e7c759c86bbf9e8","observation_id":"94fe868d-8b6d-4530-a256-6b0d5e4926d7","resolution":{"observed_at":"2026-08-11T04:34:07.894310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.177361Z","title":"Text-to-speech for low-resource agglutinative language with morphology-aware language model pre-training,","venue":null,"work_id":"e8918048-9049-4a03-8173-cd858d6a507d","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.898590Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:0c62301ea1ec10774022fafc8f4bb942bbb28b3f1615ad714a4b669a9e64212e","observation_id":"d49774c0-f3e4-4156-ad62-43b9ea9708e5","resolution":{"observed_at":"2026-08-11T04:34:08.181646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14101","last_updated":"2024-12-23T08:57:37Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T00:46:18Z","title":"Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2410.14101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14101","snapshot_observed_at":"2026-08-11T04:34:07.992797Z","title":"Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech","venue":"cs.SD","work_id":"782426f5-7c66-4b5a-ad4a-6fa581aacb39","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.902789Z"},"links":{"cited_paper":"/paper/2410.14101","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:ca7b5da9af7bc7b0dd126928662875c61fb151c8b2fa384c3f5e42d162cc3b15","observation_id":"0deab94c-ff93-4883-8c05-0eb527827fc1","resolution":{"observed_at":"2026-08-11T04:34:07.997986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11409","last_updated":"2025-01-15T01:59:02Z","snapshot_observed_at":"2026-07-06T20:07:28.545657Z","submitted_at":"2024-12-16T03:25:23Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","version":3},"cited_work":{"arxiv_id":"2412.11409","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11409","snapshot_observed_at":"2026-08-11T04:34:07.970750Z","title":"Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech","venue":"cs.CV","work_id":"ca9ed445-7bc9-4d3a-9ec6-556955fe8590","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.907336Z"},"links":{"cited_paper":"/paper/2412.11409","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:debbc68ea83c3e263cdabfef92d78fd3a4e7e1c55a4f2f4a9ad620c7fb3db025","observation_id":"6ece83f0-cdae-48d8-b707-a9faaa591b34","resolution":{"observed_at":"2026-08-11T04:34:07.977433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09524","last_updated":"2024-10-12T13:02:31Z","snapshot_observed_at":"2026-08-10T01:59:13.698673Z","submitted_at":"2024-10-12T13:02:31Z","title":"Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09524","snapshot_observed_at":"2026-08-11T04:34:07.911899Z","title":"Emphasis rendering for conversational text-to-speech with multi-modal multi-scale context modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.911899Z"},"links":{"cited_paper":"/paper/2410.09524","citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:14a8bf4ed8e71f49943184ae9eb5848215f5236c79cd6603c025fb19d79c8a08","observation_id":"6be81104-14f3-459f-ab46-f3adbaabcb2e","resolution":{"observed_at":"2026-08-11T04:34:07.911899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:07.916601Z","title":"Generative expressive conversational speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.916601Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:f2c1f95b3d330bce911b2c31550e043d6ade0ea0e78160d1ff2cb6a10cb19b09","observation_id":"e5ba2496-6766-4eea-8122-51f259e4ce91","resolution":{"observed_at":"2026-08-11T04:34:07.916601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:34:08.154604Z","title":"Fctalker: Fine and coarse grained context modeling for expressive conversational speech synthesis,","venue":null,"work_id":"db5e9ca7-9e16-4211-8534-51b726835972","year":2024},"citing_paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:34:07.920960Z"},"links":{"citing_paper":"/paper/2412.18748"},"observation_digest":"sha256:2e5ed07ba815afdf3a09e2bbc7bf6caa9255e49622ea96652519517889e570f3","observation_id":"ee44814d-3815-4c23-8edb-3d0aa133750c","resolution":{"observed_at":"2026-08-11T04:34:08.159255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18748","last_updated":"2024-12-31T07:27:26Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-11T04:28:26.087195Z","submitted_at":"2024-12-25T02:41:13Z","title":"Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":14},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2412.18748."}