{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:350655b98d0d9fc457887c24d1023e47c899b676e29d9240e617cfd569f4adc1","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:42.261811Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23406/citation-record","integrity":"/paper/2505.23406/integrity","json":"/paper/2505.23406/citation-record.json","paper":"/paper/2505.23406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.442441Z","title":"What is the McGurk effect?Frontiers in psychology, 2014","venue":null,"work_id":"1008409c-b4a5-4985-88c8-e19c1641f92e","year":2014},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.356103Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:66298093708529927a574b2c37eeb31a394d7c1756ef2eff3dd86c0f4c522ff2","observation_id":"f1322c27-8c34-49bc-a3e2-d2277dc5e5a7","resolution":{"observed_at":"2026-08-07T12:52:47.550883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.401611Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.401611Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:5100ad4176bbcb41aeb3015ccf8b6811992b25aff7814b0337440b20416dd958","observation_id":"ed0023cb-ac21-4f26-ac0e-4f889831d3f4","resolution":{"observed_at":"2026-08-07T12:52:38.401611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.197388Z","title":"FlowVQTalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"f04a8900-992d-49eb-831b-21060a30cbe5","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.490225Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:88adc189c2101b04b03d4f5ef423adc4aa7f53970e6f3053bcaed155bb61c3ee","observation_id":"f4a2da30-0c30-432d-8fa3-26ccf99ee105","resolution":{"observed_at":"2026-08-07T12:52:47.291421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.875664Z","title":"Diffused heads: Diffusion models beat GANs on talking-face generation","venue":null,"work_id":"c8a02795-4e0d-42c4-aa80-e6835bd63dd4","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.572440Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:ab6a4bf20197ab216f2e72d1c560ea4ac270fac45d89335040e4eb060e9d2481","observation_id":"63cc3d09-49a8-4724-a0a7-1ade0748da22","resolution":{"observed_at":"2026-08-07T12:52:46.993236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.584698Z","title":"EmoTalker: Emotionally editable talking face generation via diffusion model","venue":null,"work_id":"ccc02a71-d663-41fa-838f-af31209a7cbc","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.648541Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:4910a8d70b8b4e7bd5eda889af25ea5cf14e6a5b24f2e6b8004687c38c9d8614","observation_id":"4ac0ba71-6774-4098-9cb0-0719da40383c","resolution":{"observed_at":"2026-08-07T12:52:46.749945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:52:38.729151Z","title":"LatentSync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.729151Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:9214292fef8dadb857f1dbc3bc55b001e7117fc250933efcae6005afe9a3be1a","observation_id":"debc9947-c133-4e07-925c-1c298f9f9325","resolution":{"observed_at":"2026-08-07T12:52:38.729151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.796820Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.796820Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:d45be4ed98ce89a51da524fff48dcee86343863e45a7a7a0e823054a8e5b2505","observation_id":"2341ac32-84ad-4c94-8355-00b4dc29f8aa","resolution":{"observed_at":"2026-08-07T12:52:38.796820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.335247Z","title":"DiffDub: Person-generic visual dubbing using inpainting renderer with diffusion auto-encoder","venue":null,"work_id":"3d670a7b-823a-4a85-87de-94df742a3e9f","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.871905Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:abd9105ce9fa7173babccba5265f78f2b4fc5d7283275cb1e122602c0b442a85","observation_id":"62472101-44d6-426d-8f8d-a4f920a5d12c","resolution":{"observed_at":"2026-08-07T12:52:46.446086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T12:52:38.977281Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.977281Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:73c4862c18f03e4f075c4d23f2e36fbfd233eae3d6e2205877418b9d6c51616c","observation_id":"4ff86e3d-b9b7-4194-ac1b-24242dff3043","resolution":{"observed_at":"2026-08-07T12:52:38.977281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.079791Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.079791Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:f9ce59361329c9ffb7373013564794b3796ef937c12e9a5a8e7ca1d743309d75","observation_id":"3f4b7762-0bf8-4c58-ba33-bd1fda266a2a","resolution":{"observed_at":"2026-08-07T12:52:39.079791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.152209Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.152209Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:cbc1e3e5ab3473481b14f65ee3b60c8748d5caf007983897a9cfafc05c44097c","observation_id":"360c1290-b549-46de-9b16-2b5e828aab47","resolution":{"observed_at":"2026-08-07T12:52:39.152209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.233644Z","title":"Cascaded diffusion models for high fidelity image generation.Journal of Machine Learning Research, 23(47):1–33, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.233644Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:17bb802124bfee0c9d7e0c5f6f629299f8d961ae371abf51107f04b0c67ee10a","observation_id":"2f350542-197e-46a9-9c98-31c775b8c082","resolution":{"observed_at":"2026-08-07T12:52:39.233644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T12:52:39.322746Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.322746Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:6989af3c9af4f572809e0528ac8a218d409b940b06e2c70c7b915fae0f31671a","observation_id":"32a4212f-fed6-45b3-b3a0-678263211f86","resolution":{"observed_at":"2026-08-07T12:52:39.322746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.390957Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.390957Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:948636a809f77e4a303fbd6171b2ac3e53dacf565d8a7a7f6a62bfd98b0f7b89","observation_id":"4b42c7bd-5f60-4a3c-87e9-8465f7524021","resolution":{"observed_at":"2026-08-07T12:52:39.390957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.476990Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.476990Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:b27d70b6116eaa99cb2beb7727381444bc2c4883e0b401153576f28bb68e3974","observation_id":"2a6f6325-ce77-4944-84fe-8795c8e8529e","resolution":{"observed_at":"2026-08-07T12:52:39.476990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.964849Z","title":"Diff2lip: Audio conditioned diffusion models for lip-synchronization","venue":null,"work_id":"53f90234-61c1-4805-9545-9b6531b90cc0","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.554340Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:98a937e55b601a3b21d136e0c6880aa22d8599272d6e4cac99d27acbe97a3b91","observation_id":"717b0f2f-86bf-4bbe-b369-162ac42e22fc","resolution":{"observed_at":"2026-08-07T12:52:46.100966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.642421Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.642421Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:7cd946d50dcfeb1c1515cc9045a0d147e0da8da5f3d75e03e04aeabb1efe5197","observation_id":"bdffe128-862e-4866-83fb-2843c342e7df","resolution":{"observed_at":"2026-08-07T12:52:39.642421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.774287Z","title":"The LJ speech dataset","venue":null,"work_id":"74a064ac-17a3-4e22-a165-33f6b9d7cdc7","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.753123Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:728245886ec9d992bb92b96617a06875713c0541c0b4625d3d02bf19c0da763d","observation_id":"0e84d701-372d-474c-bd0e-be6047c1e44a","resolution":{"observed_at":"2026-08-07T12:52:45.860076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.866342Z","title":"Revise: Self-supervised speech resynthesis with visual input for universal and generalized speech regeneration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.866342Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:d39d5d0b60794bb9cf9ded85bb2d7dbdf8c9547125173172f10d83f97c1da639","observation_id":"db5ab34d-fcdc-4e82-9ce2-490e37096c24","resolution":{"observed_at":"2026-08-07T12:52:39.866342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.495451Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"8f4d6bac-0bab-4e47-a5f9-a452e2c2e3bb","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.022633Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:b90cbb6a4d167f35e1b4d652c2f23c61582f94b3ac5e3f3464539e6ade538f77","observation_id":"8d80aae8-7e19-4490-b57a-40d50b5a339c","resolution":{"observed_at":"2026-08-07T12:52:45.627811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:52:40.178453Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.178453Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1495b3d39398072ae4cb686daef0df1227d50e71af956c761cdaa78bb356f124","observation_id":"b25e0712-8975-4adc-9e60-0ef52efd1ae3","resolution":{"observed_at":"2026-08-07T12:52:40.178453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.238641Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.238641Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:50c082bf34c557eae5ed9295d8f112fe6abcba4c68be159d28f9ff432d7e22cf","observation_id":"874606e3-35a3-47dc-b410-a0c65bab477c","resolution":{"observed_at":"2026-08-07T12:52:40.238641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.270157Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"f22c3548-bd3c-4261-bdcb-ddd431b94316","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.390336Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:bb91d4589bdad3ce6ff62f2fbd31ab2943879c7f7b50e6e7b4307fa6ccb5133b","observation_id":"0ee029bc-1821-43a2-ac95-1c28bb61c2e4","resolution":{"observed_at":"2026-08-07T12:52:45.322311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T12:52:40.473619Z","title":"LRS3-TED: A large-scale dataset for visual speech recognition.arXiv preprint arXiv:1809.00496, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.473619Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:29c6da29fc9c6a91f452ba8f31d0440e520317e8b046511044cdc7eb3acdd23c","observation_id":"731d8cc2-0dde-40e9-b0b1-095232f62973","resolution":{"observed_at":"2026-08-07T12:52:40.473619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.598243Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.598243Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1d3ce1e2b8998be5c999d8bcb6a896789d550c8637163c74a6dda3bf8664b941","observation_id":"58b33779-ec12-4693-b66e-9b28acc92859","resolution":{"observed_at":"2026-08-07T12:52:40.598243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.968454Z","title":"ModeFormer: Modality-preserving embed- ding for audio-video synchronization using transformers","venue":null,"work_id":"53fc9f44-2ede-417c-880a-f0a62ad8aec6","year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.747635Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:8ca98836bd022299c6b6e2fe2d55ac7e294d729997f21375393f1c0f02688b9a","observation_id":"1abfd6bf-0f26-4ee9-91b5-d4c1a43bcf23","resolution":{"observed_at":"2026-08-07T12:52:45.092809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.913842Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.913842Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:4d71107b5ef81802b48df14b63fdda983ba88afb39a634ec088dfd4f5d321bfe","observation_id":"311cda32-899a-4641-84e7-9799e5818fac","resolution":{"observed_at":"2026-08-07T12:52:40.913842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.682526Z","title":null,"venue":null,"work_id":"5d667685-948a-4786-a42b-1d4f1ce3de7e","year":2016},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.044908Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:9ae85d5150acaf59b2b47026246cb398ebc278455c2b0fc2d3baa22d682d4ba7","observation_id":"8f242f5d-5fd3-4f4c-84e0-5c4e9edb49d1","resolution":{"observed_at":"2026-08-07T12:52:44.829616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.367555Z","title":"facenet-pytorch.https://github.com/timesler/facenet-pytorch, 2022","venue":null,"work_id":"d880c22f-3a7c-4bd7-afaf-87555848e48a","year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.157977Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:191373b0f91c4972370587ff3da15fe2fa04986b785ce67844a028cd87c2c00b","observation_id":"92283cca-4813-4ac7-89c6-c4da7cc42a43","resolution":{"observed_at":"2026-08-07T12:52:44.525468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:52:41.243738Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.243738Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:bb82ef6b7cbedbcf3f50c1e3f86032115218e54a5155dfed6f005ca5d2916210","observation_id":"deca0c92-4cf2-45b3-a204-adf4f34899d0","resolution":{"observed_at":"2026-08-07T12:52:41.243738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.109216Z","title":"Wilcoxon signed-rank test.Encyclopedia of biostatistics, 8, 2005","venue":null,"work_id":"02c1cb15-e5b2-4a39-95a0-d2dfc195491e","year":2005},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.348488Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:0c7c39aae546dbac5f664718e76a4e8fdd897b029ec836f3dd9572a5c2828ee0","observation_id":"cf48b885-2584-432c-a059-a91b939fceba","resolution":{"observed_at":"2026-08-07T12:52:44.218176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.478411Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.478411Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:c574514518e2abf9dadbc21464c8f2117b6b5d6fa126515ee5cf21d3572b8782","observation_id":"75cd4042-aefe-4483-a308-bbc18b1a57fb","resolution":{"observed_at":"2026-08-07T12:52:41.478411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.818829Z","title":"guided-diffusion.https://github.com/openai/guided-diffusion, 2021","venue":null,"work_id":"248aabfa-e417-4285-9f8e-b7bf53925e9e","year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.621165Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:2ad333dbb712b93e8135187bc25724ac9a4e3f9cdfcaf485026398eb4839ac13","observation_id":"0549e04d-a162-4e05-9cd2-b88efe32227b","resolution":{"observed_at":"2026-08-07T12:52:43.947606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.739324Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.739324Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1f68c815521c5a39e61dbf1abf3b64bd0c0a5b80e0bfd5296fe2f069b1eeec19","observation_id":"98b48bc8-d009-440e-9268-119adc32404b","resolution":{"observed_at":"2026-08-07T12:52:41.739324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.510727Z","title":"ns\" represents non-significant results (p > 0.05),","venue":null,"work_id":"bccb3cbd-79a6-4632-ab46-672e19799bf3","year":2025},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.864758Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:afede5178d22b85d98bdb6f2ce86515ef62bef50fd2b4ff3ae49d176c642df9b","observation_id":"6a5ee8b1-41f4-493e-a827-2337c89698a3","resolution":{"observed_at":"2026-08-07T12:52:43.666566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.299275Z","title":"We used a constant crop to ensure the corrupted video would not inadvertently synchronize with the audio","venue":null,"work_id":"116f7989-3c2a-40e7-bf0d-f0a67f554cd4","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.936299Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:788eda92edf06ca565e06f28527c4e85c4a5a50fccb2535ce69d7de2d1921e8b","observation_id":"d311c2f6-5179-49aa-9ab4-95197024e9fa","resolution":{"observed_at":"2026-08-07T12:52:43.377227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.910889Z","title":null,"venue":null,"work_id":"bece6a11-791e-4519-9092-c93ee8e1968e","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.078614Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:5fe9dbc42f5f4d39c55ff6bb22e6ca591d2fbe03f8b2bed5b69e0ecc66dd6959","observation_id":"0610c022-b4a9-4a17-bb58-392008b77913","resolution":{"observed_at":"2026-08-07T12:52:43.080828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.578156Z","title":"facebook/hubert-large-ll60k","venue":null,"work_id":"4ac6e7b2-8faf-4d7c-835a-14c2ca58dca0","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.261811Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:ec9a9f8cceac2d0efd18efc0b749289d5c949536415632615999341f705b204e","observation_id":"16d05ea2-2420-457f-8298-3e4e46f44ab5","resolution":{"observed_at":"2026-08-07T12:52:42.746809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2505.23406."}