{"as_of":"2026-08-21T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:022e207d0f6daaf880986e804d071a63061d2c68a0a34fa058fdb23d8326b6ef","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:35:09.332508Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:35:09.064293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T10:35:09.599954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2412.16530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16530","snapshot_observed_at":"2026-08-11T10:35:09.599954Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","venue":"cs.SD","work_id":"bade97c5-1092-4f90-9498-fe2d5e082ee9","year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.064293Z"},"links":{"cited_paper":"/paper/2412.16530","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:1a07039a2ca5ed2722cb4cab7ab4372e92cc76235d7cfe02975dabef51b6f16c","observation_id":"09b13862-6ead-4263-94e1-2b23d9679301","resolution":{"observed_at":"2026-08-11T10:35:09.611871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16530/citation-record","integrity":"/paper/2412.16530/integrity","json":"/paper/2412.16530/citation-record.json","paper":"/paper/2412.16530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.419764Z","title":"However, improving lip synchrony should not compromise translation quality and natural- ness [4, 5]","venue":null,"work_id":"0707f605-84af-4177-973d-763bb9f52f25","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.052485Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:62a3b1683a325d528d9f1c83b42cb9e764a0109488b3155f197b48b16c2090f3","observation_id":"48f01f24-b522-42a5-a818-78d0f2e95868","resolution":{"observed_at":"2026-08-11T10:35:10.426069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2412.16530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16530","snapshot_observed_at":"2026-08-11T10:35:09.599954Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","venue":"cs.SD","work_id":"bade97c5-1092-4f90-9498-fe2d5e082ee9","year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.064293Z"},"links":{"cited_paper":"/paper/2412.16530","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:1a07039a2ca5ed2722cb4cab7ab4372e92cc76235d7cfe02975dabef51b6f16c","observation_id":"09b13862-6ead-4263-94e1-2b23d9679301","resolution":{"observed_at":"2026-08-11T10:35:09.611871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.400108Z","title":"length pre- dictor","venue":null,"work_id":"eb567409-d1f5-4a9f-bb83-4f0a3dd9a49b","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.071584Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:5e7d47edd331879e1772fbdcf41a30ea1fbff0262eb189c249622296427a9bba","observation_id":"1cc8f621-11e5-4b54-b384-6f20809688a0","resolution":{"observed_at":"2026-08-11T10:35:10.407359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.376469Z","title":"Dataset We leverage LRS3 [28] which is a large-scale video data consisting of thousands of spoken sentences collected from TED talks","venue":null,"work_id":"15d53a03-ceca-45cc-bf2c-7c87cbcb9a00","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.077958Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:684af3656a0095967cb07ea90f6551a1c30d5434cf9f55697e75dfe007447e68","observation_id":"bd53b506-d9e8-459e-ad3c-e1cdb2554c6c","resolution":{"observed_at":"2026-08-11T10:35:10.383773Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.349811Z","title":"Baselines We use the latest work of A V2A V [6] as a strong baseline for this work","venue":null,"work_id":"4fb0cebe-9c5b-4485-9ae7-0c65e91be2fa","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.087546Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:2153a359b6d16ea6e7aec75da354bb0dffe33ffa8a58234c701e76560743e439","observation_id":"0e87283f-f2f5-4279-a515-02381e8255ba","resolution":{"observed_at":"2026-08-11T10:35:10.357561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.324874Z","title":"not trading off lip-synchrony improvements over speech translation quality and naturalness","venue":null,"work_id":"bc5a0fde-47bc-48de-9bba-7ff430e0a331","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.095939Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:89ffd538f36c5e771d035e78cbceebad5d1e7a4840b198918544e19171463dda","observation_id":"8157bb37-63b4-4cf8-8d26-e21d8a365cc2","resolution":{"observed_at":"2026-08-11T10:35:10.331549Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.304472Z","title":"Our A VS2S framework incorporates lip-synchrony and duration loss to enhance the alignment between speech and lip movements in audio-visual translation models","venue":null,"work_id":"65951562-fc45-4923-8297-3ed7dac8fbf4","year":null},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.104037Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:203f3663479832c855248978235586421f244ae6289a35707969ee6edd081fe9","observation_id":"b3da65a4-4462-492d-972e-228dc9eb1f3f","resolution":{"observed_at":"2026-08-11T10:35:10.310981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.270292Z","title":null,"venue":null,"work_id":"62b9a17f-ffe1-4cf5-9dbb-f78f501573d8","year":2012},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.118415Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:b98c6d4d4b915bde6cd8dac71325e554769c9581cd7759c35ae4018e1a480037","observation_id":"5b4d7f32-4bc9-47d3-ac65-249b21f5439f","resolution":{"observed_at":"2026-08-11T10:35:10.279147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.248437Z","title":"Neural dubber: Dubbing for videos according to scripts,","venue":null,"work_id":"04171d95-d778-4b1a-a52a-2a2dbcec346b","year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.131802Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:d567d274157dc4fb1f086e54b1ce5e343592d9210e6b0a76f357070a997d4ac1","observation_id":"c2e5ce6e-1e54-4ae0-85fa-ba9292f71906","resolution":{"observed_at":"2026-08-11T10:35:10.254149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.219149Z","title":"Neural style-preserving visual dubbing,","venue":null,"work_id":"b8581b8b-609b-40aa-8afd-c3341b6dc359","year":2019},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.139335Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:9523b7aad4c47cfcf372877190a33b2e4be09770a315df99f63320edb613e142","observation_id":"d87a7425-51f0-442f-b41f-85034527586e","resolution":{"observed_at":"2026-08-11T10:35:10.226639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.193385Z","title":"An empirical take on the dubbing vs. subtitling debate: An eye movement study,","venue":null,"work_id":"029138e5-77f7-4759-aaf8-72d01265b486","year":2016},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.146123Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:8ce3211bd715d51ec25fb66aa1d12dd5043959c416a45495c28d6191c75134dd","observation_id":"7bcbdedd-8edd-4c30-980d-4f51a097cae4","resolution":{"observed_at":"2026-08-11T10:35:10.202474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.163377Z","title":"Dub- bing in practice: A large scale study of human localization with insights for automatic dubbing,","venue":null,"work_id":"7db53dfa-b0a8-4c8f-8b1d-7b1ed6372fa0","year":2022},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.153496Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:0fe0e214b3d5ccf15b7166313bd6950a789b0f55519e1177ee2943e00a6a45d7","observation_id":"db58254e-3b8d-41e7-af47-0ea539b880bb","resolution":{"observed_at":"2026-08-11T10:35:10.176027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.138621Z","title":"Av2av: Direct audio-visual speech to audio-visual speech translation with unified audio-visual speech representation,","venue":null,"work_id":"f253c845-9dd5-485e-9740-bd9b5eb0c63a","year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.160001Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:c8655eae098a21fde351141a6ffb39d0e464c728a2aa2d97e4dbc9eea408b0ba","observation_id":"ae9b1e37-533a-463e-8761-e5a042b3c78b","resolution":{"observed_at":"2026-08-11T10:35:10.144852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.114790Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"a550daef-ec2b-4524-83cb-9761f82f6fc3","year":2020},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.166546Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:ca0466ab8b3176899e0f118f04f40d358c17c5340e574d7024be228fb619ebf4","observation_id":"5fc1aa79-cb70-4753-9aa0-ebeb9854336c","resolution":{"observed_at":"2026-08-11T10:35:10.125322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.085459Z","title":"Exposing lip-syncing deepfakes from mouth inconsistencies,","venue":null,"work_id":"523ba198-4a91-4ea8-a501-a70808b2d90b","year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.172234Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:42c080d025aa1d539135970ff7e6c8910b8d2ed04d81ee8b7712e1cfa89e9ac9","observation_id":"b30dd3ac-d018-4241-95a4-fc97368a5577","resolution":{"observed_at":"2026-08-11T10:35:10.091239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-11T10:35:09.178173Z","title":"The deepfake detection challenge dataset,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.178173Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:5f7cf6fb4eef7b70cc3bcd4925f03071deab24f053af0ebe93b23f53760b8a22","observation_id":"4efb3245-a2e9-4dbc-b3bd-501912ea1623","resolution":{"observed_at":"2026-08-11T10:35:09.178173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.058593Z","title":"Faces of the future: How generative ai is redefining likeness and identity in the age of artificial intelligence,","venue":null,"work_id":"aee17300-70c4-411f-99d3-979b3c4b29dc","year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.184553Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:dc7379f45fda5e7eed6f21134f6e4dfd2aa12d47876a35873459704f8fdfdd09","observation_id":"3d2f24ab-3b92-4199-98df-c3cefd8febbc","resolution":{"observed_at":"2026-08-11T10:35:10.064467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:10.027772Z","title":"Face/off: Changing the face of movies with deepfakes,","venue":null,"work_id":"d555fd70-8443-4af3-bc36-664612a1bc59","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.194328Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:4d8572e139f965fefadfa3f03d93fbaf90dc60f20984a181e2f466f91be14b9f","observation_id":"597d37e1-ed56-4bad-b3ce-5a10760bc06c","resolution":{"observed_at":"2026-08-11T10:35:10.036165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.998204Z","title":"Regu- lating deep fakes: legal and ethical considerations,","venue":null,"work_id":"cfae21ea-5813-482a-b39d-b6db3a1f0d16","year":2020},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.202548Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:1bc4ea0f640013250192c960bf32d371b2155bd5d0da9c5bcd08cdfead41e6dc","observation_id":"5ca9d8c6-0665-4be9-bb34-cad046ac5217","resolution":{"observed_at":"2026-08-11T10:35:10.007227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-08-16T14:00:25.942097Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-11T10:35:09.209823Z","title":"Vasa-1: Lifelike audio-driven talking faces gener- ated in real time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.209823Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:089e50d58072595f8441ee446b16619f12a829e3d2f802a3427e3893edcdb95a","observation_id":"e5449a1a-143f-490d-8929-bfc5e69fd43a","resolution":{"observed_at":"2026-08-11T10:35:09.209823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15403","last_updated":"2023-05-24T17:59:03Z","snapshot_observed_at":"2026-08-16T19:13:20.626369Z","submitted_at":"2023-05-24T17:59:03Z","title":"AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation","version":1},"cited_work":{"arxiv_id":"2305.15403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15403","snapshot_observed_at":"2026-08-11T10:35:09.505371Z","title":"AV-TranSpeech: Audio-Visual Robust Speech-to-Speech Translation","venue":"cs.CL","work_id":"59c8b5b2-07e0-4204-b84c-7b2d4fb99eaf","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.217279Z"},"links":{"cited_paper":"/paper/2305.15403","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:cf85c5b7c40dfb6704ceccf818f08544daadd36b6cef3eaa64f40f2f5438f6ad","observation_id":"968d1cab-5d56-4bec-bd12-ca9ff9c6e8d7","resolution":{"observed_at":"2026-08-11T10:35:09.513252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.976096Z","title":"Mixspeech: Cross-modality self-learning with audio- visual stream mixup for visual speech translation and recogni- tion,","venue":null,"work_id":"5142bb72-442b-4c7b-b6a6-5c52fa2ff11c","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.224683Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:a8c8c8c5da06e4688a8efcc919f591452e93cbed5209cb1a20e71228738555bc","observation_id":"2bcf0595-4ea8-48f0-b2a0-60dea3d0c6bf","resolution":{"observed_at":"2026-08-11T10:35:09.983616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08682","last_updated":"2022-02-17T00:42:02Z","snapshot_observed_at":"2026-08-20T05:43:05.302985Z","submitted_at":"2021-12-16T08:03:20Z","title":"Isometric MT: Neural Machine Translation for Automatic Dubbing","version":3},"cited_work":{"arxiv_id":"2112.08682","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08682","snapshot_observed_at":"2026-08-11T10:35:09.461501Z","title":"Isometric MT: Neural Machine Translation for Automatic Dubbing","venue":"cs.CL","work_id":"396b3f79-561e-4a94-a7d6-8e545f443dd3","year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.231449Z"},"links":{"cited_paper":"/paper/2112.08682","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:7be5e979985e60a724d1e9fa44edf91df39eaeb52250ac7352fda9084a8a6677","observation_id":"7856dcaa-b336-4025-9c3f-d5ab29dd9ded","resolution":{"observed_at":"2026-08-11T10:35:09.473359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.952552Z","title":"Duration modeling of neural tts for au- tomatic dubbing,","venue":null,"work_id":"73734b2d-3155-4a9d-b6ec-f984c2851618","year":2022},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.238692Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:b720036ebee0d353a3ba9cda1f1879accfd5dc2fc8e415535263119dc6eeafc2","observation_id":"a2b0c858-646d-44f2-85e3-a560cbd37672","resolution":{"observed_at":"2026-08-11T10:35:09.959827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.928276Z","title":"Prosodic alignment for off-screen automatic dubbing,","venue":null,"work_id":"8514cdfe-f332-431c-a1d8-037b3026e24d","year":2022},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.245664Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:5c16d1149992fb833e341fdd4ec25658096992cd02171841406e275423e046db","observation_id":"5a59b774-35e0-47c9-9aef-d94b44097f21","resolution":{"observed_at":"2026-08-11T10:35:09.935445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.904488Z","title":"Improving isochronous machine translation with target factors and auxil- iary counters,","venue":null,"work_id":"62b5ec79-7934-447d-b52c-8d032310f723","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.251652Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:0c88652fc493c6fe4de7878e2f42602d2a56cb38980d2ed0d20b5ebf6f74e118","observation_id":"8f9d8b29-748a-4cc4-9cd1-16e032190486","resolution":{"observed_at":"2026-08-11T10:35:09.911417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.878781Z","title":"Jointly optimizing translations and speech timing to improve isochrony in automatic dubbing,","venue":null,"work_id":"06664795-65a9-4a6b-a46f-e454487b63a0","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.258509Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:e5e7d309b1d9141cc65b589f3e080095b24655edbe7c28177b97ec5df120b3e7","observation_id":"2d7bcfbd-78ec-4504-ad66-1ba22fd1f0b5","resolution":{"observed_at":"2026-08-11T10:35:09.887262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.857691Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"0c0afc2b-39f9-4926-aa65-7f5cd9de8c00","year":2020},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.264839Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:6b3fb9c390de7bd0a4368c5d3502c40635fef3725277ed90d7ab0fb7fe0bcd3d","observation_id":"45d4c327-5039-489d-bbee-273c17c64754","resolution":{"observed_at":"2026-08-11T10:35:09.865088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.831898Z","title":"Towards realistic visual dubbing with heterogeneous sources,","venue":null,"work_id":"969748ec-023a-4669-a78c-2ca1ca6e4791","year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.270885Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:317c7783eaefebf387acecf82aed21c9497850bf9bd4f1061be2286fb40c8119","observation_id":"2f4f0e13-2e69-486b-b98c-53a90407e7b7","resolution":{"observed_at":"2026-08-11T10:35:09.838034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.795859Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"c9e000eb-61c6-4e1c-8ba0-5877657f24f9","year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.277607Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:c5e687cbabe4180ddf38205d3757e573cab154fa1ecec1c6d4a90b090e390df8","observation_id":"10b682fe-da9f-4fb1-8504-5b4ebe74edad","resolution":{"observed_at":"2026-08-11T10:35:09.804108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01831","last_updated":"2024-08-18T19:30:30Z","snapshot_observed_at":"2026-08-19T05:22:13.621049Z","submitted_at":"2023-08-03T15:47:04Z","title":"Textless Unit-to-Unit training for Many-to-Many Multilingual Speech-to-Speech Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01831","snapshot_observed_at":"2026-08-11T10:35:09.283881Z","title":"Many-to-many spoken language translation via unified speech and text representation learning with unit-to-unit translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.283881Z"},"links":{"cited_paper":"/paper/2308.01831","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:d514878c69fb54f0661b300f56800dbc6196a5687bf91ceb2eafd190cb1383fa","observation_id":"d2425594-730b-45eb-bff1-6d52f5006d3c","resolution":{"observed_at":"2026-08-11T10:35:09.283881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.771677Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"43278b76-ac18-41f5-b83b-f8aacfa26c19","year":2020},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.291223Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:f7ac737821f82c039884179f471404f1e47c1e9310776bce15f15a875b3ece1f","observation_id":"5c5933dd-6f8f-49d9-8433-a7b144d0d95d","resolution":{"observed_at":"2026-08-11T10:35:09.777830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-11T10:35:09.298096Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.298096Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:dc42dde3ae511e2849fa3ee29eea0d72aa38d82ff0cff0db6120a7832738d834","observation_id":"2c217f1f-2490-4f0c-aaac-ef9188e734cd","resolution":{"observed_at":"2026-08-11T10:35:09.298096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.739707Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"39c116ec-ec07-4f15-9596-5f57a1812373","year":2016},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.305579Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:a28e7dbe4deb67fa51001bb6afc99904528fae3cc033415cc5cf830bce9ebe6e","observation_id":"b8162e89-b6ec-434d-870d-2ca6ec764b82","resolution":{"observed_at":"2026-08-11T10:35:09.750054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.711274Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":"5acd9bb5-4c90-4de7-9832-14f120914b93","year":2018},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.311869Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:524c11c8e800a097df6bb20be22e4fffce890f6f84226ae4ced5d7978057d1aa","observation_id":"c1020e8c-7ec4-4652-9238-bbd7e7c3dfbd","resolution":{"observed_at":"2026-08-11T10:35:09.721959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.688671Z","title":"Seamlessm4t: Massively multilin- gual and multimodal machine translation,","venue":null,"work_id":"62158ce4-ca93-4556-a379-2bf4ee9f4b45","year":2023},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.318632Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:f4450dfff6229ebbeeb1a6705859d94087ab16e28ca025ed3fa20c0541077dba","observation_id":"15901fcc-e929-4b2a-8533-f827d0fe3a59","resolution":{"observed_at":"2026-08-11T10:35:09.696514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.661561Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"4fda9e78-189e-4064-8b6d-2861d63928b0","year":2002},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.325077Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:b01b4a2eb9f1c7dc0d7c7891def51508f32c014fe7c1798314a415d8598382f5","observation_id":"03b8eb3a-bd75-4700-9285-ad17a4e449cc","resolution":{"observed_at":"2026-08-11T10:35:09.669365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:35:09.633736Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"5ea0672a-b2bc-41e6-afd5-acfd2d0c7243","year":2019},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.332508Z"},"links":{"citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:e90e573be32b785efce3536b0d8b524c86b6d36560172b5a331e263ca0475cd1","observation_id":"c974c953-a91b-400b-86cd-7f22352d87eb","resolution":{"observed_at":"2026-08-11T10:35:09.643732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2412.16530."}