{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d94dcfbe3925212b306ef0e2b99f94b098bbd233a9669cdb6cae23b4b2959a43","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:46:19.243232Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T06:04:29.936928Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T06:04:30.077501Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"cited_work":{"arxiv_id":"2507.10109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10109","snapshot_observed_at":"2026-08-06T06:04:30.077501Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","venue":"cs.MM","work_id":"bef773ce-eb93-4042-8cd4-056e9f270511","year":2025},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T20:34:36.422314Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.936928Z"},"links":{"cited_paper":"/paper/2507.10109","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:a629843157d309ae65cd404877ee041069c6ec0b2c9220296fccd4455fe5c5ac","observation_id":"9f73405d-b2d7-4205-bea6-b06ea22e0311","resolution":{"observed_at":"2026-08-06T06:04:30.083418Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10109/citation-record","integrity":"/paper/2507.10109/integrity","json":"/paper/2507.10109/citation-record.json","paper":"/paper/2507.10109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.522607Z","title":null,"venue":null,"work_id":"2141eacb-b791-4e44-abdd-1c0f1506083e","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:12.972404Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d01c12028484dbaa946e06a9fa3bf6a81d65cdd3ecf064d8c024c7bbecf48503","observation_id":"37ec9f19-0267-400f-8dc4-186cffcba3fa","resolution":{"observed_at":"2026-08-06T17:46:26.620782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.291768Z","title":null,"venue":null,"work_id":"2464b5db-08db-49e0-ab8d-6492e6a0df69","year":2020},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.063080Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:45d6ce1b769ac2fb5a31a3f3a8d02a173a6c2cb34c8d03efa457f9fc83692cb9","observation_id":"33e3d267-b0bd-4db1-9e4a-d1cc222ff02c","resolution":{"observed_at":"2026-08-06T17:46:26.409135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:26.085279Z","title":null,"venue":null,"work_id":"162e5a0d-87aa-47d8-ba0f-0202b248838d","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.181371Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:092f4ae61e45f468814b9405ddd28960350dde4a820e18e971ef73b191246797","observation_id":"279008d1-a795-4170-97b3-afdac7bdc411","resolution":{"observed_at":"2026-08-06T17:46:26.181674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-06T10:35:16.608201Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T17:46:13.348025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.348025Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:725dd82c5365d5c9cb06f0ced412201c5daf45e592a864f42717d9dbc12598a5","observation_id":"e6801440-a98a-4f92-acfd-75a1da97f3bc","resolution":{"observed_at":"2026-08-06T17:46:13.348025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T17:46:13.509047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.509047Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:476c758c31f7486903acd81d96f1a5221d9669212a55b8745df05fe80382762c","observation_id":"20b2da09-6e34-4360-a3a7-76032610e109","resolution":{"observed_at":"2026-08-06T17:46:13.509047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.941019Z","title":null,"venue":null,"work_id":"cfd24d23-ed4e-4244-a865-442d35e14cbd","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.584990Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:7a9676c80d679b661b760f2f7c4fb9016bfed23cd16c205c5d7f6bd8ff08991e","observation_id":"5fb1a958-27a4-49d4-a92e-1e2e09f2bb59","resolution":{"observed_at":"2026-08-06T17:46:26.008575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15322","last_updated":"2025-04-07T18:00:00Z","snapshot_observed_at":"2026-08-03T17:32:04.376468Z","submitted_at":"2024-12-19T18:59:55Z","title":"MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15322","snapshot_observed_at":"2026-08-06T17:46:13.686519Z","title":"Schwing, and Yuki Mitsufuji","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.686519Z"},"links":{"cited_paper":"/paper/2412.15322","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d64e6c13e54e16e2a80a77760f50ff8d1bea1ed25927a87b0b1df85b245433ee","observation_id":"713fd661-c934-40de-b955-c4023f195efc","resolution":{"observed_at":"2026-08-06T17:46:13.686519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.775695Z","title":null,"venue":null,"work_id":"2946d361-ba5e-40e0-8ed6-0b22fdd12cf6","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.792235Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:16e6404440e8cf3493c83defd58ac4c2fd3edbc6aefa41c50678a87b23fda9dc","observation_id":"96d79e06-cee1-4956-9569-cf243ea2cd07","resolution":{"observed_at":"2026-08-06T17:46:25.846602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19486","last_updated":"2025-05-30T17:57:46Z","snapshot_observed_at":"2026-07-06T19:58:44.149533Z","submitted_at":"2024-11-29T05:55:20Z","title":"V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow","version":2},"cited_work":{"arxiv_id":"2411.19486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19486","snapshot_observed_at":"2026-08-06T17:46:19.902908Z","title":"V2SFlow: Video-to-Speech Generation with Speech Decomposition and Rectified Flow","venue":"cs.CV","work_id":"4fa30ae3-e5d8-4974-a14d-2f330d729bd0","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.885497Z"},"links":{"cited_paper":"/paper/2411.19486","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:54b246465ddf06a1b8c5b95e4d68b9abbd6268bac534fbe20e374fb50145b031","observation_id":"af46798e-68a2-4bfc-a683-538e14f5b39d","resolution":{"observed_at":"2026-08-06T17:46:19.957973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.599365Z","title":null,"venue":null,"work_id":"46716336-006d-4ef3-88d1-a1780eabfc11","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.957998Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:6fece83906ec6bac55993c4dcd99e9561942a12246deb8bcb4f9568becd054eb","observation_id":"3539a8e8-b6b9-422e-b7e8-535a6d171926","resolution":{"observed_at":"2026-08-06T17:46:25.693597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.374291Z","title":null,"venue":null,"work_id":"a20c611b-9ab2-4dcc-9b44-3301503625bc","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.028538Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:11dfc368adf6e83aea7f3da366ff674e3d056272d0c37eeceef33791f1f6eb2c","observation_id":"bd1e16fc-e7a3-459a-8aa2-8b710ccffd68","resolution":{"observed_at":"2026-08-06T17:46:25.478203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:25.174781Z","title":"Russell, and Andrew Owens","venue":null,"work_id":"39b0ad6b-7387-47a7-9ce8-904826240383","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.097517Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ac6db4837626e2773386d6daaa82f9d9e14278cbde332ca11834a0c40551dd09","observation_id":"05516ffb-ffcb-411c-b448-4b524f94e2d8","resolution":{"observed_at":"2026-08-06T17:46:25.270345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T17:46:14.237637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.237637Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a41d1bbea80695450fe1a51782dacf15fe55e8dce526cd9bdfe7f3cf7ce3fb4c","observation_id":"7500dc1f-d9f1-4e22-816f-8eff8d1f2d58","resolution":{"observed_at":"2026-08-06T17:46:14.237637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:14.325703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.325703Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d58786f4862cb2cf47b85ba42509280b5035f05a4dfaa1dab88a07d11c4a9bcc","observation_id":"f60c6bcb-e0e9-4e14-a6af-32311c28ccdc","resolution":{"observed_at":"2026-08-06T17:46:14.325703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.520476Z","title":null,"venue":null,"work_id":"16a64206-0b0d-4359-a9fb-8dd326c456b4","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.470174Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:b7e7f941fcc619905cd3284006ffa65b45732808105159065f94f5c9d1d5b5a6","observation_id":"da33c1e8-ba39-4f81-b34e-d7a3e86c388c","resolution":{"observed_at":"2026-08-06T17:46:24.620552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.721251Z","title":"In IEEE International Conference on Acoustics, Speech and Signal Processing ICASSP 2023, Rhodes Island, Greece, June 4-10, 2023","venue":null,"work_id":"49eefc9c-ba93-471c-ac55-478585c545b3","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.399881Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:7612c0bd0ae55ab1aa0a03d3ae4c4127178d5c92bcc73afc06d787e0d92c1a1e","observation_id":"93b9eb47-acfb-442e-98db-12b9101fda90","resolution":{"observed_at":"2026-08-06T17:46:24.828783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10591","last_updated":"2024-06-15T10:47:36Z","snapshot_observed_at":"2026-08-04T01:51:42.072498Z","submitted_at":"2024-06-15T10:47:36Z","title":"MINT: a Multi-modal Image and Narrative Text Dubbing Dataset for Foley Audio Content Planning and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10591","snapshot_observed_at":"2026-08-06T17:46:14.616924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.616924Z"},"links":{"cited_paper":"/paper/2406.10591","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ca92d9b39b4f6940d863106499318e2f1147f913d64e96adc59addc335fe382b","observation_id":"3e0bb405-fcd7-4792-a562-d92b225e889c","resolution":{"observed_at":"2026-08-06T17:46:14.616924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.285410Z","title":"Hawley, and Jordi Pons","venue":null,"work_id":"b98fd863-83ed-43ba-9d63-4bd506f2efbe","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.542109Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:9fcf7df5db39a7e1b5f9149be89a771986f28f79ac7b674737edc0c4908b723d","observation_id":"c03ef0c9-698a-47ef-b11b-dc059e450910","resolution":{"observed_at":"2026-08-06T17:46:24.392742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07839","last_updated":"2023-04-11T22:47:19Z","snapshot_observed_at":"2026-07-06T14:05:23.547010Z","submitted_at":"2022-10-02T07:29:57Z","title":"Contrastive Audio-Visual Masked Autoencoder","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07839","snapshot_observed_at":"2026-08-06T17:46:14.781335Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.781335Z"},"links":{"cited_paper":"/paper/2210.07839","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:0dd66d3ab93509e0a2c2713a9e0787641eb907d661fb4b09393019823d295053","observation_id":"abba1354-4e34-4433-88c0-93456f3e50af","resolution":{"observed_at":"2026-08-06T17:46:14.781335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.071932Z","title":null,"venue":null,"work_id":"77432c50-9b37-4c4f-ad7d-0db11e1b5109","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.711057Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:2c9b9ecf72e7a363407676e904dbdd99f0def21ec9aa40ff17dcb3dff7f7647a","observation_id":"b9b38237-e27d-4dac-af82-ec1e839fb9f0","resolution":{"observed_at":"2026-08-06T17:46:24.175716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:14.936094Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.936094Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:044400d039d38014e96d46f69b906bd1970703658eed453c852853cd8f8fd951","observation_id":"ff0220a8-2b66-47d3-abd6-7c0f316c06f6","resolution":{"observed_at":"2026-08-06T17:46:14.936094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.851887Z","title":null,"venue":null,"work_id":"17ef2d2c-eea7-48dc-a791-f028ec65ba29","year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.853327Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4b088c159e3574797bd368261f62801172ca50b26976d943922c297d462d4907","observation_id":"1eda6f2e-526f-4acb-b809-f56b05765310","resolution":{"observed_at":"2026-08-06T17:46:23.960830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.283737Z","title":null,"venue":null,"work_id":"b6332381-b145-4a41-91ac-f6c751d42182","year":2021},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.132879Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:cbf18c7af36b2c55ed8a99b3b6b820031dbda2875a318a9966c80c749e5bffc4","observation_id":"1ee185fd-e353-4680-b406-11bc1b508eea","resolution":{"observed_at":"2026-08-06T17:46:23.412143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.573481Z","title":null,"venue":null,"work_id":"a9b7d344-7ce6-4c4d-9684-49f884e1c95a","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.031709Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4c32a6f82118b4d85b9745ed5f2630e620cf00708481292f1e4d4d02a8f21a4c","observation_id":"ce3f8763-5543-4aa8-a484-95c08a948cd2","resolution":{"observed_at":"2026-08-06T17:46:23.702173Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07218","last_updated":"2024-04-10T10:05:16Z","snapshot_observed_at":"2026-08-03T16:12:09.462591Z","submitted_at":"2023-07-14T08:21:25Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07218","snapshot_observed_at":"2026-08-06T17:46:15.334498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.334498Z"},"links":{"cited_paper":"/paper/2307.07218","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:77f28bd65b9251b07cf72a6ea85dcfbae86337aedef59b70bd343d85a720d482","observation_id":"a7780ee1-ce41-48bc-aa46-3f2993a269f1","resolution":{"observed_at":"2026-08-06T17:46:15.334498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-07-06T19:07:37.761860Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-06T17:46:15.230611Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.230611Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:41db07937ca982047880457d2946751fd36041135abb5de96eef30c7bf57bdaf","observation_id":"2292ea90-dbba-4505-9b79-ede17c98baab","resolution":{"observed_at":"2026-08-06T17:46:15.230611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-07-30T17:52:19.430476Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-06T17:46:15.533022Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.533022Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d5a60457cd63b9f0ba2953220d15adc3c8a868643550d2711de7206b4298f938","observation_id":"03647407-1f64-4c07-840f-723e7258cd1f","resolution":{"observed_at":"2026-08-06T17:46:15.533022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:23.075373Z","title":null,"venue":null,"work_id":"24a09dd4-ccf3-4904-8a99-39f6f8824bac","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.431630Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:097a279b6c94a8f11cc4808b0eb07ed24d8e1f87b05f6fd14ac510337738c88c","observation_id":"1183abe4-53c7-4251-8fd3-81917221eb3f","resolution":{"observed_at":"2026-08-06T17:46:23.177628Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.872982Z","title":"Salik, Rajiv Ratn Shah, Yifang Yin, and Roger Zimmermann","venue":null,"work_id":"00408590-88bc-448d-819f-6b2a8e6ded2d","year":2019},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.732760Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:9e2beb429004c4971e68672475e22ca4b0dc5cc86b2fdb784b04d361ec895a34","observation_id":"cb3d7ec8-f2d5-4e92-acaf-e0b4150495b1","resolution":{"observed_at":"2026-08-06T17:46:22.955376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:15.631928Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.631928Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a556bdc5fdbc72decfb9130d325a3c4661998f061123ff96c179ead9ce637de5","observation_id":"cfe93e57-9358-4e6b-ae3c-1fd69c32cc39","resolution":{"observed_at":"2026-08-06T17:46:15.631928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.471918Z","title":null,"venue":null,"work_id":"03b3dfc1-5ecc-4c0f-9dd0-08e6e8d2b513","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.965671Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:66b4fe75c1241cd2337f447f6049cb65fb0aca8edf2bd98f41aa243be6b6eaa6","observation_id":"c1b4caf5-dafc-4d0a-bb99-b0f39eb64b0c","resolution":{"observed_at":"2026-08-06T17:46:22.591730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.694723Z","title":null,"venue":null,"work_id":"b26be8ca-9868-4dc1-9d2b-cee6674a6d99","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:15.862042Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4883000771aaf1194555e6176aaf7079a7ad57b1692d0d8b00927dcfbbaeaa01","observation_id":"6f9c274d-f627-426c-829c-1842c25a0dfc","resolution":{"observed_at":"2026-08-06T17:46:22.788610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.080815Z","title":"Mandic, Wenwu Wang, and Mark D","venue":null,"work_id":"9a969694-be4e-40d3-a129-4a2149802601","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.165396Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:d3b2ed369f4915f36a5a1987b224b450f75df8afc1ac311411a3d8fa83dc4c9f","observation_id":"3f69a0db-57dc-429a-8de0-b4d50dccc736","resolution":{"observed_at":"2026-08-06T17:46:22.193356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:22.270397Z","title":"Raghavan, Gavin Mischler, and Nima Mesgarani","venue":null,"work_id":"3cd66da7-dcd4-4e94-aa37-7ac96d902700","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.059867Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:ad29476f91c7dc259ee39128ea995f1a317d28a8ce4bb9511b6934a6c36e6983","observation_id":"9cd59548-046e-4908-977a-3d14562cecff","resolution":{"observed_at":"2026-08-06T17:46:22.365402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-06T17:46:16.401709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.401709Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:247414711316fcf08ee9da253960afac6d9dfd79c7816afd9564ea71383d5960","observation_id":"e3194c8a-04cd-421e-adef-e2557f37f3b6","resolution":{"observed_at":"2026-08-06T17:46:16.401709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.917733Z","title":null,"venue":null,"work_id":"46101d9b-f562-4a02-9bc8-f59aaa8da8f5","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.281334Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:44c997899939bea6156584216c0bca1d190413b77972ee2f4d9a0aecf0d9bb6e","observation_id":"99e73ac7-28ec-4a05-8240-968939682a8b","resolution":{"observed_at":"2026-08-06T17:46:21.977075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:16.612710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.612710Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:c4e52efc6edbe4b896f3497bdc14d41e642dcee62c7fd29fe130004ed4a91e4b","observation_id":"3af9a247-6149-4362-b3ec-3b5024433dbf","resolution":{"observed_at":"2026-08-06T17:46:16.612710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.791821Z","title":null,"venue":null,"work_id":"17eb81ec-ff5e-4e40-b684-52c321d177d7","year":2021},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.513575Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:1bffe228a701ac7c5ed5707f82139d0ed9d06fad6a3f5df3b3325332dc35cfad","observation_id":"42533c02-709b-444c-ba82-f108d0b1d43e","resolution":{"observed_at":"2026-08-06T17:46:21.844207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.626529Z","title":null,"venue":null,"work_id":"3dd963b5-162b-4cf5-a17f-8afc8db5929b","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.856077Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:8e8ade9d622ba8c7b4cf7b496bde4576f359a19e78964d54967e419c1e3ae5eb","observation_id":"0c3fb29b-10e6-4788-9da2-c122d56c57c6","resolution":{"observed_at":"2026-08-06T17:46:21.699975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T17:46:16.729243Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.729243Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f6882a80ea5712234b0eb7f3f81de43f67283f941944c458f663b4f325d8d251","observation_id":"bf519b0d-1df2-45f7-a72c-fb11017f577f","resolution":{"observed_at":"2026-08-06T17:46:16.729243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.308390Z","title":null,"venue":null,"work_id":"51936307-ccfb-4b15-a7b0-023328b941e8","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.074451Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:09b88f5264b9a408863a84cab63140ca23fd0dd0470c38841145ce7e37c7ceb5","observation_id":"6d151fd1-b8cb-4da5-b6dd-dafea2042c69","resolution":{"observed_at":"2026-08-06T17:46:21.376640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.461924Z","title":null,"venue":null,"work_id":"dca2dd77-c8b0-413d-a2c0-d23f9ed65c58","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:16.972078Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:1e0deac63263549eeeb361e62610e5418f90732803556d0478db47a2aab81a76","observation_id":"d5aff840-67a9-4dbe-861c-bc0ed3ecf6f6","resolution":{"observed_at":"2026-08-06T17:46:21.517553Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11128","last_updated":"2025-09-03T01:59:58Z","snapshot_observed_at":"2026-08-01T17:30:48.444287Z","submitted_at":"2025-02-16T13:54:32Z","title":"FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11128","snapshot_observed_at":"2026-08-06T17:46:17.295613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.295613Z"},"links":{"cited_paper":"/paper/2502.11128","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:0f2283c5a19f36aa8c2c58398b9252bdba9273a28234dd270e53e344ed7573f7","observation_id":"c778f8fa-b4e8-4720-a550-e1c19f05d7d0","resolution":{"observed_at":"2026-08-06T17:46:17.295613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:46:17.194390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.194390Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:488a3585ef57a5557a484a297c26b85f3a5b578dfcadb99cf8829beb130c2391","observation_id":"13942b3b-21ae-497b-8103-3869f8f17fe3","resolution":{"observed_at":"2026-08-06T17:46:17.194390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01809","last_updated":"2023-10-03T05:53:23Z","snapshot_observed_at":"2026-08-05T12:42:38.656980Z","submitted_at":"2023-10-03T05:53:23Z","title":"Mel-Band RoFormer for Music Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01809","snapshot_observed_at":"2026-08-06T17:46:17.731914Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.731914Z"},"links":{"cited_paper":"/paper/2310.01809","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:8504d0d1223c73d10166848a47eaf2b4f2647a907bc770c8fb036495633eae66","observation_id":"5aadd354-21aa-434d-b3e4-e651d848f1c5","resolution":{"observed_at":"2026-08-06T17:46:17.731914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:21.150614Z","title":null,"venue":null,"work_id":"4bf0e004-e051-44ee-a291-adb25d52eb6d","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.454006Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a1072f0b0f0e252265fcc1c7786fb539d9439f6d74bcb4fa472019baa589a298","observation_id":"80d1a0b5-080a-4f04-8e92-8ef224a181b4","resolution":{"observed_at":"2026-08-06T17:46:21.242636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.685632Z","title":null,"venue":null,"work_id":"8a5a04ab-971c-4577-9442-b4037732b6ff","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.070098Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a526ed291af3d74961bc99d83246afca2a26962a6a11033606fbd0fa23252094","observation_id":"25de76f6-9bd3-4faa-b791-113c7b55626b","resolution":{"observed_at":"2026-08-06T17:46:20.768252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.555969Z","title":null,"venue":null,"work_id":"001a8059-e67a-499b-ad81-e297f7fb2f9c","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.195413Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:84b88b82f89e989e16cef95ead49495517f3339734d3ea969443fc614d35f6eb","observation_id":"3869cc5b-f98e-484f-8fbd-91cb5e62436a","resolution":{"observed_at":"2026-08-06T17:46:20.618868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.839089Z","title":null,"venue":null,"work_id":"854f2623-f564-486f-95d8-e288bcb8b68a","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.855498Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:abd2febec5f37bd644b2ed79977e8e1614a78c0bf8730d86fdc16671b6472945","observation_id":"91a24ba9-2e29-43ef-827b-95867ffd5fa3","resolution":{"observed_at":"2026-08-06T17:46:20.915025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-07-06T16:26:09.878745Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-06T17:46:18.500277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.500277Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a6ee01e219fcc9db40fad3b87b04d228a7ca76a18978590db3fba1a7dad65bf9","observation_id":"c6e79082-fc53-44c9-8f1e-6ec750618d11","resolution":{"observed_at":"2026-08-06T17:46:18.500277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.416513Z","title":null,"venue":null,"work_id":"36406e46-9d36-45e8-85b6-be0b2b3ed953","year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.587362Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f579346a3f1c2247bafe9dc96ad588051a112c45e3b527174d988f780aaea7cc","observation_id":"5232a114-2d96-40a1-b022-b42e42fff0c2","resolution":{"observed_at":"2026-08-06T17:46:20.489871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T17:46:18.341711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.341711Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:08c91a8644bc15fca388931ac89b1a169813cae4a24b1c767fb096b62df901f3","observation_id":"b3fbe57a-f389-445e-a3c7-8911c34f56f5","resolution":{"observed_at":"2026-08-06T17:46:18.341711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-05T08:02:17.848918Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T17:46:18.798620Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.798620Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:e7d743d72b0e2c2b32a94f63814c3e6020cdc74e3e32315a5c3ff9ab99dd6107","observation_id":"7eda949d-c7f0-4718-9603-63ce8d097b60","resolution":{"observed_at":"2026-08-06T17:46:18.798620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-03T01:05:23.269633Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T17:46:18.900460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.900460Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:5f6a2fe382b2d7c4580ad722be10ee20fd9b729e2120652155f13ca4056c5c31","observation_id":"66285bcf-7fed-49f0-8900-4f4d5a0d744f","resolution":{"observed_at":"2026-08-06T17:46:18.900460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16429","last_updated":"2023-09-28T13:26:26Z","snapshot_observed_at":"2026-08-06T23:39:18.970710Z","submitted_at":"2023-09-28T13:26:26Z","title":"Diverse and Aligned Audio-to-Video Generation via Text-to-Video Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16429","snapshot_observed_at":"2026-08-06T17:46:18.671928Z","title":"arXiv:2309.16429 [cs.LG]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.671928Z"},"links":{"cited_paper":"/paper/2309.16429","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:4ca96d9203d94d395c1ad481672385bb8e08a8f34978b65db460d4d9e5ee24a9","observation_id":"7417fdab-75af-4ed8-918e-d769dee767a7","resolution":{"observed_at":"2026-08-06T17:46:18.671928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-07-06T20:32:14.203915Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T17:46:18.709302Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.709302Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:75b06b4133b7767bee412bb2eb3531b8308736a332c7a050c261f22e8b23a05a","observation_id":"f08d860c-4432-4423-a6b6-64609e10eb18","resolution":{"observed_at":"2026-08-06T17:46:18.709302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16761","last_updated":"2025-01-28T07:32:07Z","snapshot_observed_at":"2026-07-06T20:27:14.226247Z","submitted_at":"2025-01-28T07:32:07Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","version":1},"cited_work":{"arxiv_id":"2501.16761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.16761","snapshot_observed_at":"2026-08-06T17:46:19.515364Z","title":"CosyAudio: Improving Audio Generation with Confidence Scores and Synthetic Captions","venue":"eess.AS","work_id":"b8b4082e-5b67-4d1e-a1b3-5d759ef6b240","year":2025},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.155991Z"},"links":{"cited_paper":"/paper/2501.16761","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:f9d449f0f7abf074d52c0088292400015ba2c6fce4f2ecc24ddb8aeccce99e6c","observation_id":"e39c3107-8a78-4cd1-b18b-1e2b4f16793d","resolution":{"observed_at":"2026-08-06T17:46:19.565364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:19.243232Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.243232Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:1c0746d2fd49d9965b0346e0658dc030f4e69c1732f193f6ed61d3eda2c25102","observation_id":"5b4e0a7c-e4c5-4cd3-bead-1dee93540884","resolution":{"observed_at":"2026-08-06T17:46:19.243232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.247721Z","title":null,"venue":null,"work_id":"c5e8a5b7-3203-4171-a4fb-3d86d37fb107","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:18.985234Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a3edf32acaa443a2949f9a2c7b009cf7f36b279eafb4f85bff61810ae917e16c","observation_id":"952abe25-feca-40f1-a9b9-985be6455714","resolution":{"observed_at":"2026-08-06T17:46:20.344490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.095375Z","title":null,"venue":null,"work_id":"cabbeb1a-70ba-4131-b6be-683ca6dfb14d","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:19.066327Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:05ea1e77a1a32ebee3041307a5799c1749dba8fc2b6c9e069ca49252459c75f5","observation_id":"6bed8f7c-9191-4d2a-b1a7-59f1dd70c6e5","resolution":{"observed_at":"2026-08-06T17:46:20.150751Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:24.973350Z","title":"In IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2023, Vancouver, BC, Canada, June 17-24, 2023","venue":null,"work_id":"b8e7ca3d-38ef-4490-81ef-9d4f0e02e309","year":2023},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:14.166030Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:06d6ea64b92313b0dd5cdca1d6dbd6a17362a5aa7c981c952acffc6e0fb2d0eb","observation_id":"946540d6-4f50-4a0a-bf43-337744e816ff","resolution":{"observed_at":"2026-08-06T17:46:25.054650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:46:20.977298Z","title":null,"venue":null,"work_id":"f43a5837-8fad-4439-bd54-616f52940301","year":2024},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:17.612626Z"},"links":{"citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:3ef5b7c877f02bb096d958428dc2e41035b803b290e7930ae38e31d4488ab551","observation_id":"6ecb8ab1-8022-41c7-bd52-9c10e0998921","resolution":{"observed_at":"2026-08-06T17:46:21.053627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-06T17:36:51.361009Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":2,"verified_fuzzy":7},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2507.10109."}