{"as_of":"2026-08-07T10:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dc2dca7a7b642cc6c270afcbdbe6d03a37b028f6656d0431270e014f7b3dfb3","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:19:53.157881Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00498/citation-record","integrity":"/paper/2507.00498/integrity","json":"/paper/2507.00498/citation-record.json","paper":"/paper/2507.00498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:51.147531Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.147531Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:7e796c20f1251776ff0db75f943a02891a42091c772985a2a6956b76b3f23bac","observation_id":"9291ee37-5d5e-4583-9f71-c7208b032c31","resolution":{"observed_at":"2026-08-06T21:19:51.147531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:51.171962Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.171962Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:3863bdf8408834e7339ffca00a63922137049f4570dc9c757b6779056f2e244d","observation_id":"5706bf15-168a-4b5c-b8d3-606e51028c32","resolution":{"observed_at":"2026-08-06T21:19:51.171962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T21:19:51.211857Z","title":"S.; and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.211857Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:c78809b5a3177a8e0e290355cc5dac6aec148b29f7cc6a0946992ca874684141","observation_id":"9d74eef3-79db-482a-95fc-45a46764d337","resolution":{"observed_at":"2026-08-06T21:19:51.211857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12013","last_updated":"2020-07-23T20:52:37Z","snapshot_observed_at":"2026-08-07T03:51:14.824760Z","submitted_at":"2020-06-22T05:36:16Z","title":"CLUB: A Contrastive Log-ratio Upper Bound of Mutual Information","version":6},"cited_work":{"arxiv_id":"2006.12013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.12013","snapshot_observed_at":"2026-08-06T21:19:54.109893Z","title":"CLUB: A Contrastive Log-ratio Upper Bound of Mutual Information","venue":"cs.LG","work_id":"c4977d50-afd5-40fa-bb9e-af8603fcec96","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.301107Z"},"links":{"cited_paper":"/paper/2006.12013","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:b0a96d278a448a9f8cefe0da28943c7a03a60074011294903b3893aa07b45638","observation_id":"fe53fff1-4baf-44a5-878b-030fb9ff06e0","resolution":{"observed_at":"2026-08-06T21:19:54.154005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07787","last_updated":"2023-08-15T14:07:41Z","snapshot_observed_at":"2026-07-06T16:06:26.409406Z","submitted_at":"2023-08-15T14:07:41Z","title":"DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding","version":1},"cited_work":{"arxiv_id":"2308.07787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07787","snapshot_observed_at":"2026-08-06T21:19:53.980375Z","title":"DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding","venue":"cs.SD","work_id":"af0c6edf-ef99-48cc-8ef9-37827478487b","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.343362Z"},"links":{"cited_paper":"/paper/2308.07787","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:5b6009ca997eb5a5291882df605542c220ad09539b6dcc411e2e8574661a7f18","observation_id":"f1bd61be-3db6-4f8d-9f3e-756e67d0be9a","resolution":{"observed_at":"2026-08-06T21:19:54.028479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19603","last_updated":"2023-05-31T07:17:32Z","snapshot_observed_at":"2026-07-06T15:35:49.019768Z","submitted_at":"2023-05-31T07:17:32Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19603","snapshot_observed_at":"2026-08-06T21:19:51.402047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.402047Z"},"links":{"cited_paper":"/paper/2305.19603","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:e9f18163d3053845a9e401322f8ef94f921060e86ccf9f651cf838be33aa8597","observation_id":"d0dcf465-cbdc-4f90-8470-770e0df21ade","resolution":{"observed_at":"2026-08-06T21:19:51.402047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.795425Z","title":"S.; Nagrani, A.; and Zisserman, A","venue":null,"work_id":"3378d19c-cdaa-4615-88f7-c9b994d47253","year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.480178Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:c905df5c2e3d38349dcd22970274d74b35ca8d36a41fdb3dfd30113e9bc57677","observation_id":"cdd914df-a71d-42fe-a688-a570af45917b","resolution":{"observed_at":"2026-08-06T21:19:56.919670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-07-06T09:20:55.416309Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T21:19:51.504954Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.504954Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:ebbb3d676b502a9f27ba077503017516e17a1522f9778a3c8eb48b5353529e87","observation_id":"9c492056-dde3-4364-b09b-f71204d78236","resolution":{"observed_at":"2026-08-06T21:19:51.504954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"cited_work":{"arxiv_id":"2505.17002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17002","snapshot_observed_at":"2026-08-06T21:19:53.890089Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","venue":"cs.CV","work_id":"007a814b-b543-482a-ae7e-324570921cfb","year":2025},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.555712Z"},"links":{"cited_paper":"/paper/2505.17002","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:5760385b68321dd40b30819a1644d69747fb6ef2206f8fda59e38844ad77d32b","observation_id":"cd2426c6-f426-4597-933d-b22d65292576","resolution":{"observed_at":"2026-08-06T21:19:53.919077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.597575Z","title":null,"venue":null,"work_id":"ecf40e9c-c53c-447b-9cdc-58ec2a329f23","year":2016},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.633979Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:ea61e9ed4020a25e59a1d6e92429859d0db77c6cca9338d5fb14fb7eefc5c464","observation_id":"56aaea29-bba8-449d-a66d-fb3c40cdc900","resolution":{"observed_at":"2026-08-06T21:19:56.720531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.381326Z","title":null,"venue":null,"work_id":"f4b4114f-0429-4c75-b528-b663c5652bc0","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.670519Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:f7bf1f1a2db119b52551aff8dc527274fdf55f0909c5ff20378b6986ca887aa3","observation_id":"3dd5f74d-27b0-4753-bda5-0a530fe82af2","resolution":{"observed_at":"2026-08-06T21:19:56.479759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.205900Z","title":null,"venue":null,"work_id":"cf5067d1-3e85-46ad-b5a0-71eeb7daf4de","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.730095Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:33c84ccfe5bd9811a45a5f6eafb525db50c4b4ada747b8efce07be83d16c1573","observation_id":"72acfcf5-f43a-4759-97bd-069837665ac5","resolution":{"observed_at":"2026-08-06T21:19:56.294575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-06T21:19:51.800306Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.800306Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:0d700110addca5be72ca3a09fb645055c571df5ad486a5a4b71de9fe10c0440c","observation_id":"ead1e5f4-0116-4f3a-9204-a73e4d863fef","resolution":{"observed_at":"2026-08-06T21:19:51.800306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.003595Z","title":null,"venue":null,"work_id":"5d96a83e-33f6-434d-a23c-43bece69bc73","year":2024},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.840171Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:54059fb296d477ba15904e3fdbaa030b48f7a6ca46720d9f8eccf7907f8b5ab6","observation_id":"d44b3b0f-7301-4d36-8f68-2b9e7b233f15","resolution":{"observed_at":"2026-08-06T21:19:56.104956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.791392Z","title":null,"venue":null,"work_id":"55de2d78-095a-4135-8825-679222572703","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.901215Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:019e7d9dc0ce5122cc162b8af58495e314c004beb399688ff8f6200d19765636","observation_id":"56964d59-c821-4aad-80d6-d7417c6160e2","resolution":{"observed_at":"2026-08-06T21:19:55.887753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05223","last_updated":"2025-03-07T08:21:48Z","snapshot_observed_at":"2026-07-06T20:48:22.689787Z","submitted_at":"2025-03-07T08:21:48Z","title":"DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility","version":1},"cited_work":{"arxiv_id":"2503.05223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05223","snapshot_observed_at":"2026-08-06T21:19:53.763024Z","title":"DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility","venue":"cs.SD","work_id":"21d3b8e8-cb0d-40cb-8e12-eafee4ef5baf","year":2025},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.982678Z"},"links":{"cited_paper":"/paper/2503.05223","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:935545893491c035d762037d34f18b971be44b4c2243bda932e2381ce90ee68b","observation_id":"3f95c228-93b5-4a97-a1a6-c4029cf95e2f","resolution":{"observed_at":"2026-08-06T21:19:53.799591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:19:52.026803Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.026803Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:26fa4361226d05a12cf6754072cd73e6da9bac2565dbe388b696ff79a39c3080","observation_id":"b0ef3fd9-2231-4fd7-81ed-c7e16396d90c","resolution":{"observed_at":"2026-08-06T21:19:52.026803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.490116Z","title":null,"venue":null,"work_id":"a286230f-0950-412a-9778-2e3758b8b802","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.102249Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:5bbb8de8ea9d0e9938737b3fe30db3ad739fd5d71ecbd6460bd8e12e3addc3f6","observation_id":"42454f16-fcba-4cd1-8889-8dc3634c7aaa","resolution":{"observed_at":"2026-08-06T21:19:55.650955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02058","last_updated":"2022-08-15T18:38:37Z","snapshot_observed_at":"2026-07-06T13:06:34.544826Z","submitted_at":"2022-05-04T13:34:07Z","title":"SVTS: Scalable Video-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02058","snapshot_observed_at":"2026-08-06T21:19:52.154124Z","title":"W.; and Pantic, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.154124Z"},"links":{"cited_paper":"/paper/2205.02058","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:50ede691b2034027002704b2dcef6ee117eb2a42299b0fe550dd88265dcbda0f","observation_id":"2349b402-a25c-4f30-8019-de0503723d04","resolution":{"observed_at":"2026-08-06T21:19:52.154124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.248038Z","title":null,"venue":null,"work_id":"e15fcad6-bc43-4946-b190-ed6b5053a4a5","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.238451Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:4fd821e31013762dd90519e4f67178e6a12eba6dcb27e82e37e6a32948f705c4","observation_id":"1ddb64d0-3d9b-4bab-bbd4-67d91f2768f6","resolution":{"observed_at":"2026-08-06T21:19:55.361477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08209","last_updated":"2020-05-17T10:29:19Z","snapshot_observed_at":"2026-07-30T23:40:19.839097Z","submitted_at":"2020-05-17T10:29:19Z","title":"Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2005.08209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08209","snapshot_observed_at":"2026-08-06T21:19:53.642326Z","title":"Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis","venue":"cs.CV","work_id":"d7d0a855-01fb-458e-8fba-7d255bbf9d07","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.300850Z"},"links":{"cited_paper":"/paper/2005.08209","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:bd2bd4f9eaa21e1f78dcf6bad7d37a35ce368e2e45aa0955d853e9b7b2ac36a6","observation_id":"8c51ab8f-2738-4bce-b9e7-13c903ae60b7","resolution":{"observed_at":"2026-08-06T21:19:53.678456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.119305Z","title":"R.; Mukhopadhyay, R.; Namboodiri, V","venue":null,"work_id":"887fe846-650e-46b0-b0b5-5bfa65046dba","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.373040Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:d9a40ef203e6f8c4a28177f5802b3b9476e5411125f4fa6828901f6398ed4be1","observation_id":"aa72b93c-a3f2-4fc3-b831-72dac0197c3a","resolution":{"observed_at":"2026-08-06T21:19:55.151833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T21:19:52.448733Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.448733Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:c97fcb5e669fe6d5e5f5c4e7f46179126fe5e7fdd4299d854cb1328fc40045f5","observation_id":"fc331158-e15a-4a77-a0e5-f0ce5bbd55f1","resolution":{"observed_at":"2026-08-06T21:19:52.448733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00700","last_updated":"2024-09-01T11:51:18Z","snapshot_observed_at":"2026-07-06T19:08:52.993904Z","submitted_at":"2024-09-01T11:51:18Z","title":"Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion","version":1},"cited_work":{"arxiv_id":"2409.00700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00700","snapshot_observed_at":"2026-08-06T21:19:53.508102Z","title":"Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion","venue":"cs.SD","work_id":"2b8e3cf2-3cb3-4fe6-932d-067ba3a88650","year":2024},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.494181Z"},"links":{"cited_paper":"/paper/2409.00700","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:3d30c64a88adcd3ad9e63decc065690987301c030405688320513337d1f4b8a3","observation_id":"74b17056-4bc1-417d-8f27-8f6839385594","resolution":{"observed_at":"2026-08-06T21:19:53.571796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10483","last_updated":"2021-12-20T12:33:33Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T12:33:33Z","title":"Fusion and Orthogonal Projection for Improved Face-Voice Association","version":1},"cited_work":{"arxiv_id":"2112.10483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10483","snapshot_observed_at":"2026-08-06T21:19:53.400300Z","title":"Fusion and Orthogonal Projection for Improved Face-Voice Association","venue":"cs.CV","work_id":"c0e2e0df-3475-41bc-b52a-7a2624fa4a57","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.564281Z"},"links":{"cited_paper":"/paper/2112.10483","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:c1850d85cebed9326454ed23ff741105914a4059e32b0d89b5d0eb7cdac09cf6","observation_id":"e1c57262-d27c-4f3f-85df-687f200d9f9c","resolution":{"observed_at":"2026-08-06T21:19:53.437781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.868319Z","title":null,"venue":null,"work_id":"b0c54c77-0ac6-4c23-b576-ce5bdecedc9b","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.620787Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:88066299a36ae95fb30afd26e6d2632f52ab6f53933b1c34999b924620da98b9","observation_id":"b0cc4085-4273-41c9-9173-25cbc1c6259d","resolution":{"observed_at":"2026-08-06T21:19:54.976495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-06T21:19:52.685389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.685389Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:3a6716c8d552cd391db9b47615b03eece6d7a502a9ab509dc01dd49bec5cf51e","observation_id":"3fcc39cd-9f1e-49b8-8764-0adcdd1345be","resolution":{"observed_at":"2026-08-06T21:19:52.685389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07180","last_updated":"2022-07-14T23:02:59Z","snapshot_observed_at":"2026-08-06T15:39:59.936882Z","submitted_at":"2022-05-15T04:48:41Z","title":"Learning Lip-Based Audio-Visual Speaker Embeddings with AV-HuBERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07180","snapshot_observed_at":"2026-08-06T21:19:52.752908Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.752908Z"},"links":{"cited_paper":"/paper/2205.07180","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:2e2b25b4b9eb10f3cdbb7115bb262e2707f77ea8eaa08163f4038e3e5c1429d7","observation_id":"8cb0660a-527a-42db-9ce8-43d9d600d0a5","resolution":{"observed_at":"2026-08-06T21:19:52.752908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-06T21:19:52.819201Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.819201Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:6742a24a8363abbba909df8897594e4938402ca381a4a2ca599b2d183e791e39","observation_id":"883da9ac-52a1-46e5-a25f-59b1be6e6c70","resolution":{"observed_at":"2026-08-06T21:19:52.819201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.615840Z","title":null,"venue":null,"work_id":"a73e95b2-4aaa-49c1-9c5c-9f5f3f406d6d","year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.880819Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:bf4683e253707c751bb5e2228022ec6d40d059d61a768b4839de6394fefc2c3f","observation_id":"d725aa85-d2f9-4f6f-98c3-7f58e0c27f87","resolution":{"observed_at":"2026-08-06T21:19:54.737554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.465993Z","title":"T.; Chen, X.; Liu, X.; and Meng, H","venue":null,"work_id":"c76edd78-4235-425e-8ce4-f988b9b863d9","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.983030Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:ad1778ef93dffa32770cf469752fae1957689181deaf74e6f91dde7bc8decb39","observation_id":"867fd800-a343-4e75-b653-fd511c8127b0","resolution":{"observed_at":"2026-08-06T21:19:54.506179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.343778Z","title":null,"venue":null,"work_id":"9dbdb12f-719c-42d8-ba94-c121337c9044","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.056506Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:7ba72a09f9240d6ae4695c6fa60df03aad9d2215fad84d569c962ecd26049d3c","observation_id":"0ff7a1f0-01db-4f74-b9cc-9a39661c1e70","resolution":{"observed_at":"2026-08-06T21:19:54.402901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03258","last_updated":"2024-03-28T09:35:45Z","snapshot_observed_at":"2026-07-06T15:38:54.127539Z","submitted_at":"2023-06-05T21:20:33Z","title":"LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading","version":2},"cited_work":{"arxiv_id":"2306.03258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03258","snapshot_observed_at":"2026-08-06T21:19:53.247691Z","title":"LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading","venue":"eess.AS","work_id":"58a366b0-7c37-4c2f-813a-192443510e83","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.084783Z"},"links":{"cited_paper":"/paper/2306.03258","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:b557eaddacf1fd7dcc9b1290881e30c99b8c3d5292fe9c2e8ba8a627087f182b","observation_id":"ef9ea61d-c62b-4b58-aeae-317c2391e166","resolution":{"observed_at":"2026-08-06T21:19:53.314800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.216702Z","title":null,"venue":null,"work_id":"e5bace0d-0dfd-49cf-80bd-55d3d008a7ab","year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.157881Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:50774614303766056aec9a53130b35235cf07902c7c00c01e93c0e233e207669","observation_id":"9e976be1-c64c-4263-a750-d09811322450","resolution":{"observed_at":"2026-08-06T21:19:54.271812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T21:11:21.419989Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":23,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2507.00498."}