{"as_of":"2026-08-22T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3053a802805d9663f0dee7554ee2e59475a82a6d173eddbe7cb9a909e76356e","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:08:32.948459Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:46.744817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:21:52.706013Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"cited_work":{"arxiv_id":"2505.01928","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.01928","snapshot_observed_at":"2026-08-07T13:21:52.706013Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","venue":"cs.CV","work_id":"60437d3f-96e6-4668-8799-f2b72f21e614","year":2025},"citing_paper":{"arxiv_id":"2505.22141","last_updated":"2025-08-27T16:33:34Z","snapshot_observed_at":"2026-08-10T20:19:26.392892Z","submitted_at":"2025-05-28T09:04:00Z","title":"FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:46.744817Z"},"links":{"cited_paper":"/paper/2505.01928","citing_paper":"/paper/2505.22141"},"observation_digest":"sha256:627ec187c078835614a1fbdc02f55d7f96a2d2dd6d36904070f717f904bcb07f","observation_id":"0f4d8eed-6231-425c-93d5-77a7b2c782fe","resolution":{"observed_at":"2026-08-07T13:21:52.787831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.01928/citation-record","integrity":"/paper/2505.01928/integrity","json":"/paper/2505.01928/citation-record.json","paper":"/paper/2505.01928"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.222565Z","title":"Openface: an open source facial behavior anal- ysis toolkit","venue":null,"work_id":"bcd1a88e-7e1e-40e2-840e-90c77c7a5037","year":2016},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.648452Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:f16a4ab06b25e87aad18b5d7cefeaf7a4be1ca4a31a750e889ec12a54ce31300","observation_id":"f6bde96a-69f0-4a47-b28e-c9a57484603b","resolution":{"observed_at":"2026-08-16T04:08:33.268964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.651790Z","title":"Dreamavatar: Text-and-shape guided 3d hu- man avatar generation via diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.651790Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:2acafb4f0935cced542b021e86044721612a30bf2e1a68c52d75d94a4e8be0ef","observation_id":"919220e9-cde1-412e-8f99-cfd7c6387c3f","resolution":{"observed_at":"2026-08-16T04:08:32.651790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19920","last_updated":"2024-04-03T02:48:47Z","snapshot_observed_at":"2026-08-18T14:53:26.290691Z","submitted_at":"2024-03-29T02:17:09Z","title":"MI-NeRF: Learning a Single Face NeRF from Multiple Identities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19920","snapshot_observed_at":"2026-08-16T04:08:32.742678Z","title":"Mi-nerf: Learning a single face nerf from multiple identities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.742678Z"},"links":{"cited_paper":"/paper/2403.19920","citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:ec294e9d51d1ffdbe4b7ccc68c4e35ce9f199f2367da6379520747ee46d6107b","observation_id":"b7d9c9d6-99f9-470f-827f-d9990d410e9c","resolution":{"observed_at":"2026-08-16T04:08:32.742678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16012","last_updated":"2024-04-25T10:25:11Z","snapshot_observed_at":"2026-08-18T20:21:31.447072Z","submitted_at":"2024-04-24T17:45:24Z","title":"GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16012","snapshot_observed_at":"2026-08-16T04:08:32.820998Z","title":"Gaus- siantalker: Real-time high-fidelity talking head synthesis with audio-driven 3d gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.820998Z"},"links":{"cited_paper":"/paper/2404.16012","citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:d7b0bbe773ddd8959fbd2722af1b45771685d37fbea5631801d6802bd7539d25","observation_id":"e59facc4-c995-4511-a342-4ffc7efab046","resolution":{"observed_at":"2026-08-16T04:08:32.820998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.209412Z","title":"Morphable face models - an open frame- work","venue":null,"work_id":"dbb6aa69-d345-4d16-9f88-8ab426c86d27","year":2018},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.902536Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:ae26f1c62259ef70b0363b1d09909845690b42e1176b220dc9df87d0cd0ec24b","observation_id":"463cdfb1-613a-4276-b807-1c124b4df3b6","resolution":{"observed_at":"2026-08-16T04:08:33.212062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.201031Z","title":"Talk-act: Enhance textural- awareness for 2d speaking avatar reenactment with diffusion model","venue":null,"work_id":"bff88252-8acf-43c5-a548-80c3842981ae","year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.906477Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:4a808b619ffaf6c74da51bb68bf77caadedc99b51419bd6e657e64ce922d5237","observation_id":"c58c29df-e5c8-4b2c-8c1f-85dbdc1fdf3a","resolution":{"observed_at":"2026-08-16T04:08:33.203612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.192747Z","title":"Ad-nerf: Audio driven neural ra- diance fields for talking head synthesis","venue":null,"work_id":"4d492978-b96b-49f7-8371-b5ebaf77a82f","year":2021},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.909567Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:4cdd4b67f35c96709d470a387ba74a0beaf4822191d4a8007f105db27ae13f54","observation_id":"f0c9f9cd-750c-44e6-b765-31f4b4843924","resolution":{"observed_at":"2026-08-16T04:08:33.195489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.184315Z","title":"Generative adversarial net- works (gans) for audio-visual speech recognition in artificial intelligence iot","venue":null,"work_id":"2f02c06e-054f-4e7a-b046-ca3d38aeafa2","year":2023},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.914030Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:60063b5e99ca7983f797d7345adab85636db8b0c7bc744515c9c8f16a7a826a5","observation_id":"fccda072-525a-4500-9468-f97fb1e837bd","resolution":{"observed_at":"2026-08-16T04:08:33.187252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.916442Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.916442Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:ac55c2aa2c2a303dd67d1447e251a35593c40014a45b9e6f653a18721d5abacc","observation_id":"4b3e175e-def5-4848-b036-011ada340d34","resolution":{"observed_at":"2026-08-16T04:08:32.916442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.173275Z","title":"A survey of audio synthesis and lip-syncing for synthetic video generation","venue":null,"work_id":"f2bc0721-4598-4653-ad6c-e2e6afa8682b","year":2021},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.919694Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:9278739f68b3954854bfc3a541405f14ce29461a40b0fcac72b01b0aeace624f","observation_id":"be010d8e-5bb0-4ede-a7b1-a1bb2bc6515c","resolution":{"observed_at":"2026-08-16T04:08:33.175515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.922374Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.922374Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:a8eee12dac6fbeb0c8c21312f24833de54ea6bd3933d7e42af6ac7fb5ed49fb7","observation_id":"155e5280-eea6-4889-85da-7e96c8afcf96","resolution":{"observed_at":"2026-08-16T04:08:32.922374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.133684Z","title":"Diff2lip: Audio conditioned dif- fusion models for lip-synchronization","venue":null,"work_id":"e61efa67-e625-4f4d-a7fa-a91bad35508e","year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.926010Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:d7bab8776be9c1a620108c7dc07ebf022d65a79e8aec3bfde0fdeeca60a5cb50","observation_id":"624a95c4-3457-40f5-ba91-63c5cc76f5d3","resolution":{"observed_at":"2026-08-16T04:08:33.164191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.929068Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.929068Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:21455442688bd083286ce8ee5ae88632da2fa9b209a4f32431baac782b9de4d6","observation_id":"b3d4ae0f-a286-4262-944e-4694dbfe03f4","resolution":{"observed_at":"2026-08-16T04:08:32.929068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.065891Z","title":"3dgs-avatar: Animatable avatars via deformable 3d gaussian splatting","venue":null,"work_id":"6ea15ce7-b6d7-4e5c-acb2-c05db3561fb9","year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.931449Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:72baaf8b7abd6bc8664898ebfaeb69a4e4f2b721e63de1d3d8737548e92695f8","observation_id":"56ccf865-76f7-4458-a05c-629d517c4dff","resolution":{"observed_at":"2026-08-16T04:08:33.085803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14639","last_updated":"2025-09-02T12:06:57Z","snapshot_observed_at":"2026-08-16T17:11:20.831006Z","submitted_at":"2022-03-28T10:53:20Z","title":"SyncNet: correlating objective for time delay estimation in audio signals","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14639","snapshot_observed_at":"2026-08-16T04:08:32.933299Z","title":"Syncnet: Using causal con- volutions and correlating objective for time delay estimation in audio signals","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.933299Z"},"links":{"cited_paper":"/paper/2203.14639","citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:c013069cbdaae5ec9a912cd12a0e5640d53d52d0d9bc737878be7025cf05109a","observation_id":"8eb210d7-1eff-4ae3-afbb-40b7feaeae13","resolution":{"observed_at":"2026-08-16T04:08:32.933299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.935914Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.935914Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:7d23ea0bc9fc26ea12a3a8deed75a407050f2aa0f15e63f685c891c126e1dfaa","observation_id":"5ff00ffa-3f77-4c24-94c5-317cd657c25f","resolution":{"observed_at":"2026-08-16T04:08:32.935914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:33.000822Z","title":"Masked lip-sync prediction by audio-visual contextual exploitation in transformers","venue":null,"work_id":"92e04177-e106-45a1-a383-2dbb5144dd3d","year":2022},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.939488Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:82e5f56c504670590825d5c11e91fce73b9941336b8fc5e7d6c85d855c27a61a","observation_id":"e4207b2b-7394-496e-a5aa-1684d574cdd4","resolution":{"observed_at":"2026-08-16T04:08:33.010326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.991986Z","title":"X2face: A network for controlling face generation using images, audio, and pose codes","venue":null,"work_id":"245f6cab-06b3-4e44-9402-3e6fec815a32","year":2018},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.942154Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:0b4c4ef658a02688806e076252516b575b17ede3cede403ceb445debe9be2b5b","observation_id":"6d58b878-16b3-4f1e-b640-c6fdb86540c1","resolution":{"observed_at":"2026-08-16T04:08:32.996210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.944881Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.944881Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:96d2a8171de66f98a1c45ca9533d16d4edd97eb40a52b65d7c3f84bbb0b0bcae","observation_id":"8203e57d-0705-4c05-94d6-d044801f0215","resolution":{"observed_at":"2026-08-16T04:08:32.944881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:08:32.948459Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:08:32.948459Z"},"links":{"citing_paper":"/paper/2505.01928"},"observation_digest":"sha256:e05b02956a05d4c43fa10fde193f45804f582ffd21ce01bef43ab5a71af2aa22","observation_id":"efa63d35-3cac-4b31-891c-2ce05e50e885","resolution":{"observed_at":"2026-08-16T04:08:32.948459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01928","last_updated":"2025-05-03T21:44:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:55:35.905805Z","submitted_at":"2025-05-03T21:44:59Z","title":"GenSync: A Generalized Talking Head Framework for Audio-driven Multi-Subject Lip-Sync using 3D Gaussian Splatting"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2505.01928."}