{"as_of":"2026-08-06T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b8393f0ef8a315ca45f689c52876fa0230d298d59979ec17ce33ada6bbafad7","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T15:20:14.761337Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.09098/citation-record","integrity":"/paper/2606.09098/integrity","json":"/paper/2606.09098/citation-record.json","paper":"/paper/2606.09098"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":"1809.00496","doi":"10.48550/arxiv.1809.00496","metadata_source":"pith","pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":"cs.CV","work_id":"2f4e32b3-48a5-4b83-946d-739ea8df5168","year":2018},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3fd70a5d782edee1abbe53e139f8f65a03aa93e2beb46462301e63f8a7238532","observation_id":"80d7d368-17f1-44c6-a4e4-bdaf4eec8890","resolution":{"observed_at":"2026-07-03T03:27:35.617364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":"2301.11325","doi":"10.48550/arxiv.2301.11325","metadata_source":"pith","pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MusicLM: Generating Music From Text","venue":"cs.SD","work_id":"15e6566e-1c36-468f-966e-823248cbf87f","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:377dc8d3ae2ffe8de74f48b82f082872cbd67b991b7f19af003770ea06a28e75","observation_id":"54af6cf5-0305-4ebe-9253-89b2556e1416","resolution":{"observed_at":"2026-07-03T03:27:35.619839Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:2f5f87eef401e22bf5c5c20219a9699b251ea5e94013b5d58e943a690cbec864","observation_id":"39d055ba-9a9b-49e1-b832-0e191ec52896","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.09636","doi":"10.48550/arxiv.2305.09636","metadata_source":"pith","pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioLM: A language modeling approach to audio generation.IEEE/ACM Trans","venue":"cs.SD","work_id":"c68926d8-7cb2-4b44-9b10-396551c6bb67","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c169ccbe61dac1ec397e071cac82cd41d0853702a5e0260892ef607beb582b7e","observation_id":"a172a72f-880c-4506-a03e-4f6720c7dea5","resolution":{"observed_at":"2026-07-03T03:27:35.652278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f667af391b047ffa660d4746fef83c85d663d2435fb922a72f2ec11b26edd855","observation_id":"5e9747ed-6d51-4057-9ad9-a6e5ea37dbb8","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:66e2f20d8562c18130cbb85cc2bbca62d68a5bebd941f855542414ee54edf660","observation_id":"cc90b911-8cc6-40ec-a3bd-dd0269f41924","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:27:35.646379Z","title":"Vssflow: Unifying video-conditioned sound and speech generation via joint learning","venue":null,"work_id":"bbb10cb7-214c-4f2f-bb19-9ac4d22ae61f","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:8f184aed2172ee0439854e6cad4981caa205bf47686e00ee5f9aa9463cc44490","observation_id":"dc224f67-8baf-4294-a191-1d633688587c","resolution":{"observed_at":"2026-07-03T03:27:35.647749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:4c4292ec40ed2d6c6ec2fc56fb363c490803baf7bc97b42881176e6f3731d1fe","observation_id":"ec9a134d-c364-4ebd-acb3-df4619dc3699","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"InProceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:6ad083680de62a0039e7abfa7cb29a696c970ab28d6cd4f09cd5057b6d35fbe0","observation_id":"e99de82d-a1ec-43bd-9c0d-4b5489ae2bb8","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:8743071e1ce265959a676673cf0d3e57a26e57df205902042934ab0dda8ec258","observation_id":"39fb70a7-3355-4d4f-a094-206115954f1e","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":"1806.05622","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-07-05T12:41:04.363820Z","title":"V oxceleb2: Deep speaker recognition","venue":"cs.SD","work_id":"34bd493f-4aed-4603-a33c-9658bfb84686","year":2018},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f405656fc147e5f8dd8b9d4e6c09642ac38d491df352090666cfc0c64c946d46","observation_id":"963bf617-6d56-47f9-91f6-1cdcf50e158d","resolution":{"observed_at":"2026-07-03T03:27:35.655302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:b3bbffd5ff37ad4305398aea0a830ab75c8cf1c58aabf1e715f900234ee633ff","observation_id":"52923315-3cf5-450e-9b30-d9aca60cfa28","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:d77880fde519e784dcc6bc5fcfc8ca0cc7d2526cb3a07578fce80236a98edb31","observation_id":"ff9a7f16-2c46-45c8-a08e-3796aaecd095","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:a7ee2f83e0f9cdf3c73e6109a8c906ad91e232500e54319afdabfb1282728dd9","observation_id":"bc3a717d-cfc4-4df3-b1d7-5fff953deedb","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:e9c232a145fda9ffb69a4b2a7d2b9fdf15966931429857ce1b221ac8e600ed47","observation_id":"170dee6d-5a24-418c-85a9-05405322760d","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:744292ccd1070587720370afd770f1839d61b41781c8697b5b2c8c369777e67a","observation_id":"ed4ce7f5-05d2-4159-9a2d-09dac914e58a","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:13fb93585e83be1bca8ec10ffcf56bd2bf2d9f2545cf3eac5885251606b1d2bf","observation_id":"9ffb4329-3caf-40c1-bf50-5a7a6d1a41df","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:6882ed2245985a6aa8f2a6e0f868f60d66e339272ea0ea6eb953e36330e82fa9","observation_id":"2530444b-0ef2-47da-be39-2cb239eb691d","resolution":{"observed_at":"2026-07-03T03:27:35.675467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c9426b3b6a38fe3e29258ae5f3896cf6c41e6e9b1dd7954313cdd16e29e00711","observation_id":"5c0a2463-f0e8-48e2-b568-851285f26dbf","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:34f573800f6124faf559a38dc2b32ffc6446a0e3d3ca02df525d5f9f2cdd6713","observation_id":"4b22dbed-fe8e-472d-bacb-74d0280e9bb0","resolution":{"observed_at":"2026-07-03T03:27:35.620602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f8c53915466b107d25a0251127b9f7d34d9566ccf445f7d8f5ed82c00b7dbd16","observation_id":"f65fc66c-a3b5-4181-a64a-8d9872206e76","resolution":{"observed_at":"2026-07-03T03:27:35.625576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3644dda93c80dc3ee226229dd2ef17a5e7bf955bd35f284107ce5373f97e7279","observation_id":"031e8125-6e54-46cf-8798-4b323ad01d04","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"InICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:20b5bcbef5c2e396b82b65d0754843f818a9b1e0bbd54d4ba608175bedb1502a","observation_id":"f9558494-816e-468e-88c9-f690ce419d9a","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:554fe7ad2ba4b6bd64c88a0c8d4c28f8b4b85e1a0fbe7731b044a60bb171aa94","observation_id":"958d2f8f-62e7-4f9f-ac72-822d7d5809dd","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3095af112d69fcc35bb5bbc35ab4c8b76a0b084c899212e23ac5752d98cea50a","observation_id":"651510cc-7438-417e-b605-ed5b15c3a581","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"InProceedings of the 31st ACM international conference on multimedia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:428acee9777bb65ebb7046a7952f42d7a58efa65e21bec2ad47193009b5584a3","observation_id":"37d25c7f-a914-4692-a34a-ed230644fab4","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:df30fd36c8375740603c04cecee47f2941cd77e2d6c47fa0c333c89d59e24b77","observation_id":"36d9ba5f-aff2-45ee-8782-99a93cecc3b9","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:4c63193440003bc2535b71b7a7341efba68d160fbb4e797fbecef722d24d601d","observation_id":"ef0d6fc6-ee5e-44df-98a1-8c166c3faaba","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":"2409.03283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-07-04T08:29:41.338585Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":"436e9370-d40e-41da-b2ca-f56199732ea1","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:6fbbc03c74f46abfe328178ce1a6356d489d5eca87bb9904846cd24f783a3371","observation_id":"0f3a401c-6ffa-45d9-8b66-5b3376effd5b","resolution":{"observed_at":"2026-07-03T03:27:35.634796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:67efc22a8e5d43f471771aaa4c2225031bc81b8f35297c278f2d66843c88f911","observation_id":"ebd7bb2f-a995-4097-a919-d73d46645e0d","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:8873436e8226f3cfc7946d7c466efb981a15aa61a03f0680efcd8933a86e6e10","observation_id":"a96a1e6e-25c5-4573-ad7d-03bba037baa1","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f56de6f42d5690f79ba118fc4897ed7ab6bf648b077a07c0491ec18b734c1f3b","observation_id":"cb84456e-ef8c-42ae-b36a-6bec764cb13e","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:0596508f41eb8d18a85e8a43c5522ccf557d61f44256f6d2ec3777e1d790d695","observation_id":"3e3859de-1679-4071-9137-11104745c44b","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3df890d09e826999d636318745821d534643234d7cbb4984cacc97ef20331b5c","observation_id":"eedf0ef6-d58e-40b0-bac1-de25619142f4","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:d2069f438e72f3c2b81b4e99ccfc0d0f56b329ff63073853d56f67cfcc65dc99","observation_id":"64bffb7d-7a08-4b7c-9fb8-020f74dd064c","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-03T05:48:47.605109Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":"2209.15352","doi":"10.48550/arxiv.2209.15352","metadata_source":"pith","pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Adi, Y","venue":"cs.SD","work_id":"e838ca5f-9409-4856-8383-f7294f30436d","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:9252fdbc0318bb7858186f36a2cf7ddb426a41b79fe20c5ebce106a49afd35ac","observation_id":"f9cb6270-4fc0-4fba-8be1-7451caaa2f12","resolution":{"observed_at":"2026-07-03T03:27:35.639979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3bb77c840871559a69675596a2755d5991f75e65a4d1a8278659ee303f65f4e7","observation_id":"c49cfb26-cbb0-4501-81ae-aab469efd8e2","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:d05e67adbd9727f4ea053e10bfa3b3c72f082f6943c9f00b1be02ab0fb1bc48d","observation_id":"c76ecad6-ae1a-47de-a6d2-55e93a7a2b2b","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.06098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:49:39.405341Z","title":"MeanAudio: Fast and faithful text-to-audio generation with mean flows","venue":null,"work_id":"0bca9067-3c78-4136-b992-ced923d3312b","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:fbe8e3b86e11531474bc228ed02c26a9121c018b234d1be9a63f019460d938e4","observation_id":"fa2f1c33-5de6-46fb-be1a-0c610cd996dd","resolution":{"observed_at":"2026-07-03T03:27:35.645157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:2df1e9819d81288db8611353d5e242b05a87c6837b59c2106f406a5fae851052","observation_id":"6b02e290-6baa-45d1-9e4d-b2fbb6d44354","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3b1a9ee8bce522ef811a6c6fbcfb16053d6a8fd8a389cd43530195b97d1d8fa7","observation_id":"568a3b66-aa16-4c2a-8c93-b7ed9ed44457","resolution":{"observed_at":"2026-07-03T03:27:35.670895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:dcab33b7e632abbb51031cadcc8980046a308e33ee182ecd272631b97f2af192","observation_id":"bc2620cd-f520-4e0a-9097-9ef173775668","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:b6019b4b795723432071f43bc10ff8e99f2a0f17dfded26920994bd45836081f","observation_id":"32e0cc43-3cf8-4d55-b6d6-749757f4ad14","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.14777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T03:27:35.621035Z","title":"arXiv preprint arXiv:2601.14777 (2026)","venue":null,"work_id":"4e8c9f37-4e53-4f26-8844-396fae067383","year":2026},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c45609c82c129c36cf7629463ba2610614890b0159558d037ba94169f558bd86","observation_id":"e6286558-f158-4634-bc2b-dc9058a338d9","resolution":{"observed_at":"2026-07-03T03:27:35.622489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f02943b775ae41b6620bf154e7c4ce6fe3ab7d43f6b62691ae70406862e2f78d","observation_id":"6a57ac6d-c5ad-41e0-949a-4c268b81d625","resolution":{"observed_at":"2026-07-03T03:27:35.628751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:1267c58e5170f7296e16db7381d8665eb7e2eb7f0cc1ad1f2d8f9b0020cf869f","observation_id":"33303afa-dbfa-4d0f-9c66-4e5028a73c99","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:631d27dc4955bf1d6f365ea912a067e778903cf7ced21a4d14a766964dea6918","observation_id":"566219a2-5266-490b-a9d0-ee3d916e6a76","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"In ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c95e8c3e9a0621f6355f70fcfc97387d1dfb066e36cd23ab7286ef31e4788683","observation_id":"a41d6c3a-10a6-4867-8d3d-ac6d25689172","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:124215c40a96e04b9fb4aa90ed60458f952102be3588db785090a45f26518962","observation_id":"27c66932-8c89-4ae4-b071-4143ca729f56","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:58:08.336166Z","title":"Semantic-vae: Semantic-alignment latent representation for better speech synthesis","venue":null,"work_id":"635253a6-c06b-42dd-a3dc-66a02d59a8e6","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:365eeb496e6a24b8d11fc356e702f1cccc580cd0f389b27d2a0dda146a526d84","observation_id":"879e34ea-0825-4489-a48e-94fa221b15fc","resolution":{"observed_at":"2026-07-03T03:27:35.631726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:76caa77d8e42da065133722a6dbb599c151ae82f3504a543645d7e70f78e990a","observation_id":"d9d511db-ffa5-4942-8152-aa390e640828","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c466d6650a6bcce0dbc437e469d1a75b3609d97c242d0b2691062cf0a61dbaa8","observation_id":"42c6e303-2cda-4745-8b19-b5db5210b1c0","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":"2508.19205","doi":"10.48550/arxiv.2508.19205","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vibevoice technical report","venue":"arXiv (Cornell University)","work_id":"6d46a99d-ed41-4221-8fbe-35859ee85e2d","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:4d74ce0bb0db41ce9170248784c78246701ab686da9b3a1050b8e7efda3e8674","observation_id":"76c794d5-9534-4c70-bbb8-f9cd85a51d13","resolution":{"observed_at":"2026-07-03T03:27:35.637338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:ed455d6b5f0ed6b83a799234d47fc50ca41590601ded027e0ac72cb9d04d38a7","observation_id":"dff74fe8-1ec6-49e3-9e99-24ef303b3fc9","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:77c9a648a8968677816564256a36b0353b712c4040312e5d4bbc8607d10486af","observation_id":"e7e26847-0e30-4470-8303-65f5e17abd85","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":"2204.02152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-07-07T14:53:55.727508Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":"cs.SD","work_id":"672f99d7-62cc-4d7d-931c-4e7b0083fcd9","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:835fa2fdb74663175020095fa94ee6dc5af129135eb067df04c000b196336b60","observation_id":"f65a8580-983e-45e2-bc34-78cadef220c0","resolution":{"observed_at":"2026-07-03T03:27:35.667011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:2f6a3fa797e8cbf24157e7fe1db03af5f9f82eef18ab14a55891512d3e340fd4","observation_id":"6da4e840-e457-4dd1-a0d6-ed4167831369","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"In2018 IEEE international conference on acoustics, speech and signal processing (ICASSP)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c68062742ef334116eb412d7c36f2dc7d4e3488af84dad351f7a9f18f9e52f07","observation_id":"4dd24823-d855-4901-b87e-60553e6af052","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-07-06T12:25:16.299659Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":"2201.02184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-07-04T08:49:41.728084Z","title":"Learning audio-visual speech representa- tion by masked multimodal cluster prediction","venue":null,"work_id":"2e8fb221-cf84-40aa-a1b3-76de79871327","year":2022},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:1320776fd05c06a085d5c9a2d0481184db24e6563ca7060f60d05fd684752a06","observation_id":"641792ed-feaf-437a-8aec-8387dd5eddc8","resolution":{"observed_at":"2026-07-03T03:27:35.642562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:61971afff4582893d9321ad13b79cb68d032f06ed0be5c7e86bce6a35459693b","observation_id":"9ade00a0-5574-4de2-b951-8a91c9a5c52e","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:5dd38c0813f40015a2ca17376a06d7b8ef4657e48112ad22d13f29ffc587809b","observation_id":"2b82e9d5-75de-4e28-92e0-d426cd8dc933","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:ec4639dba9595d01782e28ee77d9fba41512560578b20e4586f9968b7d9b8e05","observation_id":"82cdbb27-0be4-4605-910a-8ca5217ebd7e","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:f28abf690dcc97499d8d4597f065c87f8cc55ddcde78d18c3658f424c7c614b1","observation_id":"2c590f6f-ae5c-47a6-bbc3-0c9cbd2afdb7","resolution":{"observed_at":"2026-07-03T03:27:35.662075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:44de3fc535ad8c9abcaf4b1b5d0f6bff01f59f8b4f94418afbf930b80c4fd823","observation_id":"fb2b3e22-4bfe-4af9-a40f-7eb69dca2ec1","resolution":{"observed_at":"2026-07-03T03:27:35.617782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01809","last_updated":"2023-10-03T05:53:23Z","snapshot_observed_at":"2026-08-05T12:42:38.656980Z","submitted_at":"2023-10-03T05:53:23Z","title":"Mel-Band RoFormer for Music Source Separation","version":1},"cited_work":{"arxiv_id":"2310.01809","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01809","snapshot_observed_at":"2026-07-03T03:27:35.606865Z","title":"Mel-Band Roformer for music source separa- tion","venue":null,"work_id":"902aa1ac-f056-4f09-9438-b0adefbf8a1c","year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2310.01809","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:102deaceb03471547599be2b30b0686c62139e3c6edbde07db33f6d48b30cb21","observation_id":"da81b2c8-3820-41d7-bae9-82a534c4321a","resolution":{"observed_at":"2026-07-03T03:27:35.608385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-06T06:04:28.316296Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"cited_work":{"arxiv_id":"2508.00733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00733","snapshot_observed_at":"2026-07-03T03:27:35.612458Z","title":"Audiogen-omni: A unified multimodal diffusion transformer for video-synchronized audio, speech, and song generation.ArXiv, abs/2508.00733","venue":null,"work_id":"95af01a4-51cb-4df3-9c95-e85308295520","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2508.00733","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:3709fcac7cf82c8a37bc1107c23eb637b0f5558d2262209c43ddd723fbb62863","observation_id":"1ae5565b-83bd-4351-8c3a-fa0453af18b8","resolution":{"observed_at":"2026-07-03T03:27:35.615037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:c642a362320b8765837d70979fbb04b5be6dde5e5499b824f86497969da65984","observation_id":"96739f5f-c1a2-40d6-8d11-3ecb64b70cfc","resolution":{"observed_at":"2026-07-03T03:27:35.605707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:62e89f7fad3b8721ce5456e144dbfd14b6adb27ec0339f3c4cb98e9b0a034e9a","observation_id":"eb63cd64-c41f-4d99-8ea8-fcb1c16a4244","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:831e7d4a72891134f08c29af6afbbdc7d0d5a9c8d9dc21eb106ee431e2a02e27","observation_id":"94ca67c2-1a68-4ab6-a38a-4c7a2f737ac0","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:79ba695155874f7907e382a2f13ea918585db5d36ee73bf9b9d86efe6b17a5b1","observation_id":"8cbd1fc1-8f43-4ab8-9b93-261530d4c1e7","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22265","last_updated":"2025-03-28T09:29:08Z","snapshot_observed_at":"2026-07-06T21:00:12.835346Z","submitted_at":"2025-03-28T09:29:08Z","title":"DeepAudio-V1:Towards Multi-Modal Multi-Stage End-to-End Video to Speech and Audio Generation","version":1},"cited_work":{"arxiv_id":"2503.22265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.22265","snapshot_observed_at":"2026-07-03T03:27:35.609674Z","title":"Deepaudio- v1: Towards multi-modal multi-stage end-to-end video to speech and audio generation.arXiv preprint arXiv:2503.22265","venue":null,"work_id":"debeb302-6d45-47ca-b8a6-b4aa14b87c2d","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2503.22265","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:fa7e4de12d5ac96fdaba3a5460cb2e148299efacfd77dfe6a7d210a84043ce85","observation_id":"22c41ad1-d414-458e-8d08-7e50d83c24fb","resolution":{"observed_at":"2026-07-03T03:27:35.611351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:42b125d5306a8637d16c30c64babc31a03ac37e6f3bce880925a7513ca2f8b61","observation_id":"6c16536b-5431-464c-9bc3-6b2d6df8cd58","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:32e34977f4dec05d3482f16cc2253b1abeea33554a18692b5182a63f5ef8eb3f","observation_id":"237041bc-8f08-43b5-ae17-01c574b6362e","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:31c376056225ebac18cdacce5226f369996919e46d1bff12751167ddb35d3740","observation_id":"50491cdc-5be8-4f12-934c-2583d59cbf47","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23660","last_updated":"2025-03-31T01:51:09Z","snapshot_observed_at":"2026-07-06T21:01:09.057003Z","submitted_at":"2025-03-31T01:51:09Z","title":"DeepDubber-V1: Towards High Quality and Dialogue, Narration, Monologue Adaptive Movie Dubbing Via Multi-Modal Chain-of-Thoughts Reasoning Guidance","version":1},"cited_work":{"arxiv_id":"2503.23660","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23660","snapshot_observed_at":"2026-07-03T03:27:35.593492Z","title":"Deepdubber- v1: Towards high quality and dialogue, narration, monologue adaptive movie dubbing via multi-modal chain-of-thoughts reasoning guidance.arXiv preprint arXiv:2503.23660","venue":null,"work_id":"2f0f740a-e880-4d19-8a58-784f4f6299b6","year":2025},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"cited_paper":"/paper/2503.23660","citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:d1adadfd6c02c195548b0d7f8ab9580d84acac8a0e30f1dd7e27e030aefd38bd","observation_id":"bf2988f5-115d-4032-b10a-de0aed39b4fb","resolution":{"observed_at":"2026-07-03T03:27:35.596113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"Unspecified / Clean","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:8b9b9829cfddb698f17373e17dae730ac29fb1bbd6f6df814c669c4a0bee71bf","observation_id":"9baea2ff-f776-4718-a006-148675ca13d3","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:43e27a908b6c4c32d4a70508382943c92e4798cc787d0936b94a64d1b2189c94","observation_id":"b38a3556-0374-4765-879e-64385fe6ca58","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"Sound relationships: describe changes in loudness over time,layering of different sound sources, and any sense of spatial depth or distance.] Figure 4: Overview of Prompt Design","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:b101cc1531ac578cb02248c4580df4369152face1156ebf83185ff12c3bbb88f","observation_id":"420d76f0-8e53-4e78-a0ca-c623771c0458","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T15:20:14.761337Z","title":"As shown in Table 5, HoliDubber consistently outperforms the decoupled pipeline across nearly all metrics","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T15:20:14.761337Z"},"links":{"citing_paper":"/paper/2606.09098"},"observation_digest":"sha256:8bb846f96825016110c552f1cea8db0159669bacef672964c218179828d8be71","observation_id":"a17b5718-4d9d-470e-891b-836ca7c37364","resolution":{"observed_at":"2026-06-27T15:20:14.761337Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.09098","last_updated":"2026-06-08T06:49:50Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T04:42:49.906997Z","submitted_at":"2026-06-08T06:49:50Z","title":"HoliDubber: Holistic Video Dubbing for Complex Acoustic Scenes via Text-Guided Audio Synthesis"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":25,"verified_fuzzy":0},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2606.09098."}