{"as_of":"2026-08-21T05:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a16bb71066448e71262730a6913cc197be969ee34a3364e0fca279234739d447","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:00:25.409083Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:00:25.313393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T18:00:25.553973Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"cited_work":{"arxiv_id":"2507.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.19225","snapshot_observed_at":"2026-08-15T18:00:25.553973Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","venue":"cs.SD","work_id":"16fb7c7b-e1a4-434c-948f-097a2a4a1ffd","year":2025},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.313393Z"},"links":{"cited_paper":"/paper/2507.19225","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:6dfb97fc628f4af717f1a9a3f146ee83147f7e02c35d2d2254bdfd32cf4ded0a","observation_id":"2c27026a-919e-41fc-8f9f-5703037ab91b","resolution":{"observed_at":"2026-08-15T18:00:25.556673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.19225/citation-record","integrity":"/paper/2507.19225/integrity","json":"/paper/2507.19225/citation-record.json","paper":"/paper/2507.19225"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"cited_work":{"arxiv_id":"2507.19225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.19225","snapshot_observed_at":"2026-08-15T18:00:25.553973Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","venue":"cs.SD","work_id":"16fb7c7b-e1a4-434c-948f-097a2a4a1ffd","year":2025},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.313393Z"},"links":{"cited_paper":"/paper/2507.19225","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:6dfb97fc628f4af717f1a9a3f146ee83147f7e02c35d2d2254bdfd32cf4ded0a","observation_id":"2c27026a-919e-41fc-8f9f-5703037ab91b","resolution":{"observed_at":"2026-08-15T18:00:25.556673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.714876Z","title":"Early works, such as Chen et al","venue":null,"work_id":"42bceeba-87f8-4060-ae2e-5077e6560ddd","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.317314Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:1e3af63184aa419df0f4e9d806f3a2f7e2318170d67f94a47a08b48c69e9e379","observation_id":"83e6ac62-8308-42da-96c8-27038d8d0981","resolution":{"observed_at":"2026-08-15T18:00:25.717577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.708286Z","title":"The overall pipeline is illustrated in Figure 2","venue":null,"work_id":"87c6ba1e-c313-4869-a88e-f6a29b17afb9","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.321243Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:2393307b091bef3f90e78d244f9da0d0981be56c255d6c679cc2e1b6969cebab","observation_id":"22efcff7-672d-4d90-b23a-2671ebb36325","resolution":{"observed_at":"2026-08-15T18:00:25.710970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.701825Z","title":"Experimental Settings We conduct our experiments using LRS2 [25] and HDTF [26] datasets","venue":null,"work_id":"30951194-8b72-4cb6-8135-4edb45999ddb","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.325105Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:880af9689ae67b3f80d552fb175f20e26403b70c31099c5d80d6ad82ae287f0d","observation_id":"87414495-88b1-4b7b-967a-b5bb12f9c997","resolution":{"observed_at":"2026-08-15T18:00:25.704335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.688281Z","title":"Unlike prior works assuming a fixed face-to-voice mapping, we model it as a probability distribution problem, capturing natural voice variability","venue":null,"work_id":"4dc4335b-8414-4c87-8264-4a28e147d251","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.330920Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:463c516fc19d4b3749002e76a707f5ab8ec1c43a656f45f5d14fdd37c9b0e6d9","observation_id":"7e6a5e38-357c-483e-b70b-5f3f05211d08","resolution":{"observed_at":"2026-08-15T18:00:25.691237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.681170Z","title":"The authors also acknowledge CSC-IT Center for Science, Finland, for pro- viding computational resources","venue":null,"work_id":"20eb926a-0dca-458c-b670-44092d9f8e90","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.333729Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:51e92aa3e50f862c8cc53bc1ebad01a400c111ace216e6322aaaa229929e7719","observation_id":"9ee54083-5cf3-4e22-a893-571590461611","resolution":{"observed_at":"2026-08-15T18:00:25.683902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.651984Z","title":"Faces that speak: Jointly syn- thesising talking face and speech from text,","venue":null,"work_id":"c06de995-c883-405a-a763-02581894879f","year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.352417Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:1f5310ddf59ce9a12aad1951c18ae6ea310775f75b699a8ef329b89145535936","observation_id":"722461cd-aaf0-4b4a-9b9f-61a6be60a579","resolution":{"observed_at":"2026-08-15T18:00:25.654871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-17T16:29:54.452859Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-15T18:00:25.336103Z","title":"Audio2head: Audio- driven one-shot talking-head generation with natural head mo- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.336103Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:183795950fc2aded1763953eea953722e3cf80f680c1c6286a79a0e738530198","observation_id":"528e5442-e7fe-46db-9ce9-340f80441f27","resolution":{"observed_at":"2026-08-15T18:00:25.336103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.674333Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation,","venue":null,"work_id":"4fba935c-b246-4973-bd21-cc7b9fb80f19","year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.338993Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:ec63b753f4f22dbc4ec67cb18d54e9f69670bad1e1e29ecccdeaab8c4c032bef","observation_id":"de75e7c6-801e-40fe-b406-d591e6d1d665","resolution":{"observed_at":"2026-08-15T18:00:25.676872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-08-20T18:01:03.560904Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-15T18:00:25.341577Z","title":"Dreamtalk: When expressive talking head generation meets dif- fusion probabilistic models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.341577Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:93248f9241e268abbce2340c8fc7fac386c9aead850f6eab5b70be795f6a596b","observation_id":"56528005-6330-4514-844e-c815f4f267aa","resolution":{"observed_at":"2026-08-15T18:00:25.341577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-15T18:00:25.344468Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.344468Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:c646c7be30bb168e9459ebec8d9584a6280db0753579921e8f7c06a928ea9ec5","observation_id":"148e966c-0294-4380-b1ef-f250356590f6","resolution":{"observed_at":"2026-08-15T18:00:25.344468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.667347Z","title":"Edtalk: Efficient disentangle- ment for emotional talking head synthesis,","venue":null,"work_id":"6f334373-239d-4b11-94e6-1ff97fb21b92","year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.347286Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:66de9c19d22aa2d1ae428adf2c88c5aa0c6c136cf73c01b2388661f62cef234b","observation_id":"6948bfb9-8c77-415c-8015-912c09564061","resolution":{"observed_at":"2026-08-15T18:00:25.669822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.660317Z","title":"Text2video: Text- driven talking-head video synthesis with personalized phoneme- pose dictionary,","venue":null,"work_id":"a4e06d08-2271-439e-aa37-0a4b4dc441ac","year":2022},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.350020Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:362ad812f5220c530ca699e4bb724d7e44102716f113bef54e03d762a2bfd523","observation_id":"d7ff594d-5dbd-4e7e-8794-aa9fdee2c6c6","resolution":{"observed_at":"2026-08-15T18:00:25.663148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.623456Z","title":"Hierarchical cross- modal talking face generation with dynamic pixel-wise loss,","venue":null,"work_id":"2e74d334-9c48-4b49-a5b0-1e6e60266dc8","year":2019},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.370700Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:9285bc94c5e2af495a52922524591f5ea9f3f6bcbcf58e6496ac173629b1cc3c","observation_id":"67c19a2b-da6e-467c-9d6d-4c26437f3c53","resolution":{"observed_at":"2026-08-15T18:00:25.626120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06457","last_updated":"2023-08-12T03:30:49Z","snapshot_observed_at":"2026-08-21T01:54:21.298550Z","submitted_at":"2023-08-12T03:30:49Z","title":"Text-to-Video: a Two-stage Framework for Zero-shot Identity-agnostic Talking-head Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06457","snapshot_observed_at":"2026-08-15T18:00:25.354763Z","title":"Text-to-video: a two-stage framework for zero-shot identity-agnostic talking-head genera- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.354763Z"},"links":{"cited_paper":"/paper/2308.06457","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:e1ffb1735b8ea6662ccf047f5ae583304a002e2b3398205f249f79b9ee1f8956","observation_id":"bc2c698a-8c6d-40c9-8b93-1ca433a53ebb","resolution":{"observed_at":"2026-08-15T18:00:25.354763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03504","last_updated":"2023-08-02T09:39:05Z","snapshot_observed_at":"2026-08-20T18:13:47.810963Z","submitted_at":"2023-06-06T08:50:13Z","title":"Ada-TTA: Towards Adaptive High-Quality Text-to-Talking Avatar Synthesis","version":2},"cited_work":{"arxiv_id":"2306.03504","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03504","snapshot_observed_at":"2026-08-15T18:00:25.520005Z","title":"Ada-TTA: Towards Adaptive High-Quality Text-to-Talking Avatar Synthesis","venue":"cs.CV","work_id":"84c56c0d-c893-4e66-aeeb-ee144b966941","year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.357330Z"},"links":{"cited_paper":"/paper/2306.03504","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:91e0911345ea1f63b4bcf961f8752a1ef31b2f294552e7455f7d9434d44dfdcb","observation_id":"84a5a3ca-24a1-4903-a9da-8eab5a86c72c","resolution":{"observed_at":"2026-08-15T18:00:25.524927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.644971Z","title":"Uniflg: Unified facial land- mark generator from text or speech,","venue":null,"work_id":"84eaab68-54f1-4a12-a106-ff8fe107505c","year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.360567Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:e011d7fbbe6c6a9524c980d98c4656fdc51d2035f18644e6c393509e3ef76ccc","observation_id":"6f5660d3-f3e6-4c6f-a1f7-5f6c7198310e","resolution":{"observed_at":"2026-08-15T18:00:25.647710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.695344Z","title":"The results are presented in Table 2","venue":null,"work_id":"31f7cdcf-3807-4ade-bb53-7ea92793b20d","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.327800Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:d9260552ce77534f69559db0712dd7e7a1dc1acec3f581795ad3d67432c9bbf8","observation_id":"184ab4eb-47c4-46cc-bc0a-bd461d4cabc9","resolution":{"observed_at":"2026-08-15T18:00:25.697841Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.637825Z","title":"Text-driven talk- ing face synthesis by reprogramming audio-driven models,","venue":null,"work_id":"9eb781ca-ab24-4170-a3cc-39802e6df99a","year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.362816Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:90477ba3d8cd30e22a487cd0fc35deaa379cea079660f4bfea8e6d81dc9dfc65","observation_id":"46042e3d-83f1-4f93-8279-30356db2fe67","resolution":{"observed_at":"2026-08-15T18:00:25.640584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.630536Z","title":"Generating talking face with controllable eye movements by disentangled blinking feature,","venue":null,"work_id":"40bfc50a-211c-47f0-883f-62277ac0986c","year":2022},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.365391Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:f24ea17d3c89a08a79adc11da27acef5135468f00b29bb960c5f5107a93a59a8","observation_id":"20c4eb9e-8899-47ae-9cc1-30283cd3ef84","resolution":{"observed_at":"2026-08-15T18:00:25.633446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05430","last_updated":"2024-11-19T22:11:40Z","snapshot_observed_at":"2026-08-20T04:32:00.243772Z","submitted_at":"2023-12-09T01:45:16Z","title":"FT2TF: First-Person Statement Text-To-Talking Face Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05430","snapshot_observed_at":"2026-08-15T18:00:25.367836Z","title":"Ft2tf: First- person statement text-to-talking face generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.367836Z"},"links":{"cited_paper":"/paper/2312.05430","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:423f0e4f2e7f96ad2e5c10086908c305c5be97e4b5eda3a23dd5add79ac28996","observation_id":"09c8d03e-9910-49b2-92a7-c4a79a389e9e","resolution":{"observed_at":"2026-08-15T18:00:25.367836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.373254Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.373254Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:b51ef743ac441c06d5c4e773cade37822ddf57a3932f94998994050b58fb0603","observation_id":"8782ce8f-2e4e-45fe-878e-4b902f3e400b","resolution":{"observed_at":"2026-08-15T18:00:25.373254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.612755Z","title":"GAIA: Zero-shot talking avatar gener- ation,","venue":null,"work_id":"a9ec64c6-b6af-4040-bf02-ccd4fd1d2867","year":null},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.376531Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:3b47aa2e8feaa1f5c643fd25fdbb271e633e0b77a4f299adf2a7ab16728506d5","observation_id":"6ffc3daf-e65c-4dc4-98aa-2c2bd46ebec3","resolution":{"observed_at":"2026-08-15T18:00:25.615387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.379263Z","title":"Por- traittalk: Towards customizable one-shot audio-to-talking face generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.379263Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:550b5a503618fcb2d4d39cf8f26c2e3f27400bef44e7cc25283f6fa366e3ba7a","observation_id":"ca890290-afe7-4e63-a4e0-3a71afb04cd9","resolution":{"observed_at":"2026-08-15T18:00:25.379263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T18:00:25.382659Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.382659Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:b5a6b6ab60c4aa87055c64316f559337be3c045c221439c7b86e0d64514e8307","observation_id":"00b847a5-6355-4a1a-8901-76a6684e56db","resolution":{"observed_at":"2026-08-15T18:00:25.382659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.385283Z","title":"Imaginary voice: Face- styled diffusion model for text-to-speech,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.385283Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:f92b8cd4be2baf3ceed532e061e80d27646da586988401dca32b9d7c0a760e06","observation_id":"5d8ac069-c4e6-4f8e-88fa-5f9b1cfe73e3","resolution":{"observed_at":"2026-08-15T18:00:25.385283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.602623Z","title":"Fvtts: Face based voice synthesis for text-to-speech,","venue":null,"work_id":"13cc5461-8136-4bfa-bed3-215fc1ba2982","year":2024},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.387864Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:53b2944b4f4c0c9fb8a90cc449fd17787374123d802f105fb93775fce9ab71ad","observation_id":"18510ab0-9738-42ca-967c-bf720c881921","resolution":{"observed_at":"2026-08-15T18:00:25.605245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.390797Z","title":"A kernel two-sample test,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.390797Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:a698c72ebbcd0b5a45f0ad9b41d61a222b404450139e616d173bc9cda2484668","observation_id":"a5a81537-2d25-4ce3-83ce-33b928c947ee","resolution":{"observed_at":"2026-08-15T18:00:25.390797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-18T03:47:39.333317Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-15T18:00:25.393215Z","title":"Cam++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.393215Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:d17e9ed716300be290e6895560b8b27a407ae312f46f340b5fc75f8bd6a003e3","observation_id":"0e4c43a4-0897-4631-ad91-db557d188078","resolution":{"observed_at":"2026-08-15T18:00:25.393215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.591047Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"8621781a-7e43-414a-bef2-2ece94e7477d","year":2020},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.396518Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:41731311e4fff126241ee70e7728858d37798d7929938a3a05006e9965519795","observation_id":"d27484d8-f90a-420b-b452-ce83f1e295f8","resolution":{"observed_at":"2026-08-15T18:00:25.593588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.583220Z","title":"A low-complexity permutation alignment method for frequency-domain blind source separation,","venue":null,"work_id":"b7c33d37-87f1-4752-99cd-9b9ba53cdec0","year":2019},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.398894Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:2647c292daafd3c1b14f14c437f35f3bf817ee6186ba380d11fa59c772bff5fd","observation_id":"8a58124e-3080-420f-b763-787bc99da613","resolution":{"observed_at":"2026-08-15T18:00:25.586667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.574213Z","title":"Lip read- ing sentences in the wild,","venue":null,"work_id":"7dd0d67c-9bef-46eb-b88b-9be44d8d871e","year":2017},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.401287Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:211e48157591047d85f7daa8566c2045f790876f970579246befb08d6b7674e6","observation_id":"ef4bcd4f-944b-4239-b044-f38775ac6371","resolution":{"observed_at":"2026-08-15T18:00:25.577289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.566966Z","title":"Flow-guided one-shot talk- ing face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":"256ee199-e201-40b8-b843-cd06b55388b3","year":2021},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.403521Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:cd801c22e8167e208d4f553ae22aa9643d1aa9917180c21b2c23946cafb33f52","observation_id":"f19735e6-1e20-4659-95aa-7e1a785bf69b","resolution":{"observed_at":"2026-08-15T18:00:25.569588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:00:25.405874Z","title":"On estimation of a probability density function and mode,","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.405874Z"},"links":{"citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:ede59d7b0c74228515301c6cc521602caea17ddd13abe6d67553fca77cb550e5","observation_id":"6b5e534e-7341-447d-a3ce-b64e0398625b","resolution":{"observed_at":"2026-08-15T18:00:25.405874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-15T18:00:25.409083Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:25.409083Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.19225"},"observation_digest":"sha256:3cb1f76e2d0e16367bf53f942448eedf44ac17e392424927718daeaf8088e421","observation_id":"d65e1152-961a-4841-97ab-07921088c082","resolution":{"observed_at":"2026-08-15T18:00:25.409083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.19225","last_updated":"2025-07-25T12:49:06Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-20T18:14:14.279883Z","submitted_at":"2025-07-25T12:49:06Z","title":"Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2507.19225."}