{"as_of":"2026-08-20T07:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2d10269fb2ff7ee1627718281750992fff2e0458f4f561d68bbb256d53fe17d","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:08:09.082079Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T09:58:37.474408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T10:01:13.556956Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":"2412.00719","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00719","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synergizing motion and appearance: Multi- scale compensatory codebooks for talking head video generation","venue":null,"work_id":"6510511d-3a7c-4458-82a0-9c27a5cc514c","year":2024},"citing_paper":{"arxiv_id":"2510.03548","last_updated":"2026-05-12T19:56:09Z","snapshot_observed_at":"2026-08-14T15:13:44.263499Z","submitted_at":"2025-10-03T22:37:03Z","title":"Unmasking Puppeteers: Leveraging Biometric Leakage to Expose Impersonation in AI-Based Videoconferencing","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T09:58:37.474408Z"},"links":{"cited_paper":"/paper/2412.00719","citing_paper":"/paper/2510.03548"},"observation_digest":"sha256:4a4177dcfccb303831b96a110da80ec017761ab66bd59e0ea492856e354a7283","observation_id":"90678adb-729c-4319-b0ae-ef67fc3e7e39","resolution":{"observed_at":"2026-05-18T10:01:13.559876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00719/citation-record","integrity":"/paper/2412.00719/integrity","json":"/paper/2412.00719/citation-record.json","paper":"/paper/2412.00719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.889951Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"9bf099f4-63be-4eda-9fad-9ea9f7c032c3","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.758730Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:cd3da5b09f8f8a397e9459ae1ebb42b7456a3305201e018047bcad5bfe949cfe","observation_id":"457be482-a979-4285-994e-daeacb801a9a","resolution":{"observed_at":"2026-08-12T05:08:09.896562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.874932Z","title":"Hyperreenact: One-shot reenactment via jointly learning to refine and retar- get faces","venue":null,"work_id":"eebe39e4-62a0-4861-af99-18d0ec156ef5","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.763185Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:833118b0b58a5fc0392a28773099eedcb259b5df65b818ac573ea5aa91eddd38","observation_id":"f93ee8ac-9559-410c-8112-159c4c7d74ae","resolution":{"observed_at":"2026-08-12T05:08:09.879576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.860896Z","title":"Learning weights for codebook in image classification and retrieval","venue":null,"work_id":"c598f1c3-51c3-45f1-beec-3d2060996259","year":2010},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.767017Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:92d72365266620a73f16d7421b5a332cc3a01861334a69f620cc5a5f5fc7955c","observation_id":"ef208e41-7fa9-4842-918f-a521b59048d5","resolution":{"observed_at":"2026-08-12T05:08:09.864562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.848001Z","title":null,"venue":null,"work_id":"b6fc5509-0a00-4786-bfe0-94918e354c40","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.771269Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:e4bcaa4c04d26a1672569819c4bfc62dfde0987c37a157bacbfd29665db4d4cc","observation_id":"e1cd4d3c-7110-4502-84aa-3cb076bc6303","resolution":{"observed_at":"2026-08-12T05:08:09.851849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.835329Z","title":"Visual categorization with bags of keypoints","venue":null,"work_id":"640bfafc-fa75-4177-95ff-26bc712aeb42","year":2004},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.775805Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:03613f9f69b9d6a17395be440ff2c4fc94634770853b7472259710813c201468","observation_id":"05575368-1370-4e4f-b4e1-3d37d9a76583","resolution":{"observed_at":"2026-08-12T05:08:09.840002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.819863Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"3ae4ab89-7646-406c-ad3a-5f046e0cf991","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.780043Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:0c2c339d638dd1821a7f65ccbee1c43464c02064d72cd1acd48cee7e92fb475c","observation_id":"65eb32e2-8d61-43a5-aad9-2fcf6cda6714","resolution":{"observed_at":"2026-08-12T05:08:09.825264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:08.783759Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.783759Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:87cf52dbd725ea7a38b1d8b896cd4c47536121b6049bf9f402a42e8af97e7211","observation_id":"2df7b810-4b4f-4ea9-89fa-539d2aefb892","resolution":{"observed_at":"2026-08-12T05:08:08.783759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.795052Z","title":"Learning an animatable detailed 3d face model from in-the- wild images","venue":null,"work_id":"326f5d0c-8afb-4cd2-b855-c92db006c695","year":2021},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.787424Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:e259ffef20f235f2a3e15bd603c58005bbfabc483f9a87c6daf20e4454653276","observation_id":"13a1f8ab-6d48-44bd-a505-ff5bb21b02c7","resolution":{"observed_at":"2026-08-12T05:08:09.799106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.780476Z","title":"High-fidelity and freely controllable talking head video generation","venue":null,"work_id":"56a24a8e-4d14-4826-9325-d24c28295b91","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.791390Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:18c5c3da25c1a81b3a2aefe7d7ebc0ba517a9f841e04862997df19f11fd51964","observation_id":"e8e39224-f1f5-4a89-9e7c-2b9c75f19ed7","resolution":{"observed_at":"2026-08-12T05:08:09.784726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.768813Z","title":"Vqfr: Blind face restoration with vector-quantized dictionary and parallel de- coder","venue":null,"work_id":"f504e5c1-907d-4fdc-95c5-99669d7368e3","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.794588Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:9c71cd9e893857b2c3aaa88f03f0864a26e3c2ac7cc8062a8025a7db864af2b5","observation_id":"48305a42-515c-4e65-a834-6d9f5033568b","resolution":{"observed_at":"2026-08-12T05:08:09.772951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-18T14:48:47.548305Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-12T05:08:08.797590Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.797590Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:e38c49b82c2fd7d07aec46d78e688348f3fa1eae7cfebb70298dd6a0a21b676b","observation_id":"7c3a3892-b365-4058-97e7-04b71c1d3502","resolution":{"observed_at":"2026-08-12T05:08:08.797590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.754447Z","title":"Marionette: Few-shot face reenact- ment preserving identity of unseen targets","venue":null,"work_id":"5a41e712-9665-49a7-8bb3-ecfe4a88cad3","year":2020},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.801854Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:c12d705a83fb82fd39ddf46e408d289bfcbe95d12c8fc9d0d3fbc30566b8d5b4","observation_id":"3030ee47-307c-454b-8fde-f534f97862f9","resolution":{"observed_at":"2026-08-12T05:08:09.759385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:08.805788Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.805788Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:a9dc456a57ee13186aca393bde0d67d581f75e187ab56592857bbe2ff5f0ea1c","observation_id":"965a01ef-e8ee-4d4a-acc3-6ed75f0f1674","resolution":{"observed_at":"2026-08-12T05:08:08.805788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.727676Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"addb4324-2bd5-4b25-93ff-6a19cb6764cf","year":2017},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.809649Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:0621c830d45cc0e7a6986192cd1655412357402dd8db8fd703c0bd41df49ef49","observation_id":"5036059c-9bb3-4c65-a393-bf6fbcf417f5","resolution":{"observed_at":"2026-08-12T05:08:09.732690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.710933Z","title":"Implicit identity representation conditioned memory compensation network for talking head video generation","venue":null,"work_id":"6a196988-cf80-4298-8b99-dffd7c66491d","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.814030Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:acadd5c9a54191ae5f94693c22a9eba0334961a6f8db3404909a58cc10f7e7ad","observation_id":"f7b3b42f-19ca-4922-9d01-8f38a54592de","resolution":{"observed_at":"2026-08-12T05:08:09.716398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.688960Z","title":"Depth-aware generative adversarial network for talking head video generation","venue":null,"work_id":"6b01ef79-70ee-4644-8563-4ab75d0fad94","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.817262Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:99daad40477a3803259f3a6ce7f8223b20f7552819a52c06998c1c355fad0c7b","observation_id":"23965dcf-4494-435a-aa6c-9a2591843213","resolution":{"observed_at":"2026-08-12T05:08:09.694114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:08.821892Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.821892Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:ec5fa8a4523aa54bad221f1fe982e316e137df14c8689232999dfead5912ea05","observation_id":"801d328f-f9db-4e11-8f87-0cbc472d3e8a","resolution":{"observed_at":"2026-08-12T05:08:08.821892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:08.826550Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.826550Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:d11096290d37802b87df8a2de2e26cd2a08f084fb9bcb919e79a80c172675eb4","observation_id":"ee736fa2-a9b7-4ef6-bd07-ec0fc4e5bbfb","resolution":{"observed_at":"2026-08-12T05:08:08.826550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.655393Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":"59fef67f-3b2f-4387-b7dc-2c49c2a743bf","year":2024},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.831907Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:4f181f2cf1fcb96f5468937c3c24958e32cce75807a2f6a55ad6f031f991ca87","observation_id":"9dfe0e4f-6b14-49b0-96d0-731a6e9b3e77","resolution":{"observed_at":"2026-08-12T05:08:09.660307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-18T23:33:12.915054Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-12T05:08:08.948729Z","title":"V oxceleb: a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.948729Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:0e88ecc5b7f156b88ecbf0b66cdcce13f07c5dca8659e50ef1b6ba210ffb362c","observation_id":"6519429d-2047-4511-bf87-66aa9e3bb24b","resolution":{"observed_at":"2026-08-12T05:08:08.948729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.640434Z","title":"Robust one-shot face video re-enactment using hybrid latent spaces of stylegan2","venue":null,"work_id":"51a13592-d6b8-4a3d-9797-edf328f8780a","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.953504Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:d7a6a56ad24f155c63b55148e56b2b7acfb4d0c11b05939ccc1583a6ceb0b83b","observation_id":"354319f3-33ed-4f4b-b526-2478c19636dc","resolution":{"observed_at":"2026-08-12T05:08:09.644596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.625265Z","title":"Li, and Shan Liu","venue":null,"work_id":"1c23304d-fbeb-4b23-8e28-47ff6ce833b9","year":2021},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.957302Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:46383ca1071aa8f641d0080ae968d7833690d539d4a3c7153dcf1ff64a30c36a","observation_id":"c2890098-5c0a-43d2-b78d-45ef1fc11249","resolution":{"observed_at":"2026-08-12T05:08:09.629760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.608445Z","title":"Animating arbitrary objects via deep motion transfer","venue":null,"work_id":"b7febb72-8358-4aa8-8262-3d13ad8c9768","year":2019},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.960985Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:f278671404a9cc8e91cc4cd8fbd40054f747747b1646ddf1d216b5e926811e9c","observation_id":"fe15d2b6-0b55-4573-911d-b19343a216ae","resolution":{"observed_at":"2026-08-12T05:08:09.613924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.594543Z","title":"First order motion model for image animation","venue":null,"work_id":"4bcbbc17-e8c2-48ea-8393-b188950f12f1","year":2019},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.964425Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:343c1be8fa6c40dc70ab235c75c5bba5576baf576ce9196a15d44dd31ac68935","observation_id":"c7c0fe6d-e9a0-411d-a25f-1eadcb403f27","resolution":{"observed_at":"2026-08-12T05:08:09.598399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.579728Z","title":"Learn- ing motion refinement for unsupervised face animation","venue":null,"work_id":"50a1b13c-f10a-4849-82be-110afb6421a4","year":2024},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.968444Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:1477c04bebf6197f585a18f7cf035ade7889dc897543c2f4ee8355ef005842e7","observation_id":"0b9a4430-799a-470b-a02d-812523e67da9","resolution":{"observed_at":"2026-08-12T05:08:09.583965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:08.972822Z","title":"Neural discrete representation learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.972822Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:f130e1955400f014c51fad834e5fb8fa39dd7b91fea545c2542a79bbb5350848","observation_id":"e0371ffc-a60f-4d77-b2e2-e811e3b3f29a","resolution":{"observed_at":"2026-08-12T05:08:08.972822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.558815Z","title":"Continuous piecewise-affine based mo- tion model for image animation","venue":null,"work_id":"8e53fc9c-ee25-4294-b99a-262beebef483","year":2024},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.977337Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:3b22ea58d26ba24e28f9089d343385322eae6b66bf24039349a6db47eda34d9b","observation_id":"863cd0ec-da15-49e4-9244-89d4354be195","resolution":{"observed_at":"2026-08-12T05:08:09.563160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.546298Z","title":"Lipformer: High- fidelity and generalizable talking face generation with a pre- learned facial codebook","venue":null,"work_id":"a3b642f4-bf7c-452d-8446-2f05eb39f7b5","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.981547Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:dda4bab7ce7092f0fc9215742769b7b6f266703f00462932a2034858f0696485","observation_id":"366d4431-7bde-4066-8503-b427502995ae","resolution":{"observed_at":"2026-08-12T05:08:09.551163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.532471Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":"36613f36-9873-486f-b86b-e675cbe49dd9","year":2021},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.984899Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:22cbbc763f13be9b94e8a7d7970635b815b59254d6000483dfde502b36f033b2","observation_id":"fc807b9e-ecbd-4c5d-8d40-290b9f49c2ef","resolution":{"observed_at":"2026-08-12T05:08:09.536511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.518440Z","title":"Recovering realistic texture in image super-resolution by deep spatial feature transform","venue":null,"work_id":"0ef8b608-04b0-41db-9f25-4e8bcb0458cf","year":2018},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.988219Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:ed41d280a68b97c8e0df4724520db53a87911938d480ea848f13b95a55737135","observation_id":"723b6630-f61d-4622-85c2-97bb194aa187","resolution":{"observed_at":"2026-08-12T05:08:09.523239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.505455Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation","venue":null,"work_id":"ed8fd605-75bc-482d-8476-cda9ead9b7a9","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.991547Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:82845960b4dfb694d8b829f8904df1140d7c51fce19c2c66ec8f3759cff1b1db","observation_id":"de0ac202-d61c-4fdc-8b2c-f08c57f49a97","resolution":{"observed_at":"2026-08-12T05:08:09.510300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-18T10:29:36.587877Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-12T05:08:08.994747Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.994747Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:1803305c408c70928284248c34374af993db1d3124c20c7c7942c7463f0b965f","observation_id":"128d418f-ce0b-4bfd-9d67-6b07a75420ec","resolution":{"observed_at":"2026-08-12T05:08:08.994747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.493328Z","title":"Reenactgan: Learning to reenact faces via boundary transfer","venue":null,"work_id":"d78c5723-5ed2-43af-b391-d4f0b7a78a7e","year":2018},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:08.998219Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:f3b67c3acbf8c2ada4dce4e306790f5fc05cc1f9bf0cabfe577665291d785375","observation_id":"6c2880a5-cba1-40b0-9052-15074a6d45f8","resolution":{"observed_at":"2026-08-12T05:08:09.497005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.482386Z","title":"Vfhq: A high-quality dataset and benchmark for video face super-resolution","venue":null,"work_id":"54810492-9cff-42a8-9e50-04b1e758baf5","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.002381Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:8cad385ef3690134faa4a7a2a25dace2a4e89703a5bf4c5423f0840cf8d64abd","observation_id":"f3c0ed68-13fe-4ffb-bd66-e2eb04bea2bc","resolution":{"observed_at":"2026-08-12T05:08:09.485924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.470236Z","title":"Mesh guided one-shot face reenactment using graph convo- lutional networks","venue":null,"work_id":"583a2ea6-99e5-4407-be93-f1a2e268d8f7","year":2020},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.006252Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:8c28ab94604680c0d9249f9e900d633e68927414b608b9f305774ee262773f14","observation_id":"f00ae37e-5c62-4ad8-818e-4360dca31d2d","resolution":{"observed_at":"2026-08-12T05:08:09.474129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.457462Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":"2092bc57-d4cc-47a7-b213-9acf4090edff","year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.013802Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:3fc2c8666c59b20b7760bfd94670d83d2fe17a337886c3373841c99e4c3f2693","observation_id":"35c8d09c-c130-4635-9c5d-18ac60a07901","resolution":{"observed_at":"2026-08-12T05:08:09.461998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.445360Z","title":"Few-shot adversarial learning of realis- tic neural talking head models","venue":null,"work_id":"b0618b74-5dab-4812-8d0b-e4afbbfb951f","year":2019},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.021322Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:b3d51674e471ef68474689e2ab9ccae8e556953ca09ba301f0f88f1e14bb77ee","observation_id":"1b6a1b13-f47b-49a2-858b-f658e2684b1f","resolution":{"observed_at":"2026-08-12T05:08:09.449492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.434233Z","title":"Fast bi-layer neural synthesis of one- shot realistic head avatars","venue":null,"work_id":"fde3ce52-39ce-430c-a326-0dc592ff3941","year":2020},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.028263Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:ac7b89efcfa5acc109fd4c08503605599ce2b9385eecefcf3cbd3ff86e7e48c8","observation_id":"b835992c-c7f9-4c28-afc5-4e2fbe7567e4","resolution":{"observed_at":"2026-08-12T05:08:09.437736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.421915Z","title":"Face animation with an attribute-guided diffusion model","venue":null,"work_id":"39de2628-4871-41fc-80ad-8497dab35a17","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.033354Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:72c4ee4ebecb99af99b620aeee3861a161de6166ecd17ad841cd74227a8019a0","observation_id":"ee9e060c-21dc-40ce-88b8-b109cfebe391","resolution":{"observed_at":"2026-08-12T05:08:09.425788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.409890Z","title":"Metaportrait: Identity-preserving talking head genera- tion with fast personalized adaptation","venue":null,"work_id":"efbe4b61-24c8-41cf-8f53-385001cd9d2b","year":2023},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.038114Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:e9f40840ed3f9c7ff88753a16f7491fab6ffedc15b411b056093f4859ca887eb","observation_id":"d4ecb74f-d32c-4dc0-9888-adde7e4ed4e3","resolution":{"observed_at":"2026-08-12T05:08:09.413662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.394933Z","title":"Learning non-redundant codebooks for classifying complex objects","venue":null,"work_id":"5b81e922-8f8a-48d2-90a4-24af5540e02d","year":2009},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.043164Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:e77f722e8f64c4c2e525ff73f8c465eccfe1e2476a5ac80d58d1898dca8afbaf","observation_id":"2e621684-5380-4f2f-959e-b5c91e384d63","resolution":{"observed_at":"2026-08-12T05:08:09.400325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.382147Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"e4a847f9-be67-470e-ac9c-90bd67565b95","year":2021},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.046925Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:3b6bb8d8613b98c11ccc5a960a6fc11679b5346907879f372fd71c61cebf3ff2","observation_id":"165df1bf-2ad8-403d-a721-096549303036","resolution":{"observed_at":"2026-08-12T05:08:09.386058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.369936Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"1456d2a8-ce0c-498c-ab33-31e420f0dd56","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.051516Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:562381e2ccab92a5d61502f69977e0cc075d580f02543abdcfe2f1b0973bb44a","observation_id":"4207affd-5a12-4db8-b0af-a80c95a41e3d","resolution":{"observed_at":"2026-08-12T05:08:09.373982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.356817Z","title":"Sparse to dense motion transfer for face image animation","venue":null,"work_id":"0c1bcd32-8202-4314-95fb-5598e83ad7f4","year":2021},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.056184Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:86067409f193d5a3bbbb0673d3cdc411420cb52c6822510eaf203805bca79416","observation_id":"201c2920-7ec1-4066-9e59-36e89f591167","resolution":{"observed_at":"2026-08-12T05:08:09.360451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.342598Z","title":"Towards robust blind face restora- tion with codebook lookup transformer","venue":null,"work_id":"1be26407-2080-409f-82b8-b49583a10486","year":2022},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.060900Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:3128de7bf8d3342c77d2167c35dd5518c5fad7c9de92c6fd1d7e24fcd3d61313","observation_id":"23af8799-ffad-419f-b9c8-c940a688c797","resolution":{"observed_at":"2026-08-12T05:08:09.346750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.330092Z","title":"Celebv- hq: A large-scale video facial attributes dataset","venue":null,"work_id":"70722ef8-f655-4c46-9822-a64bb7e34e91","year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.064745Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:0979e457cd099b39f1402bc4deee71e759d5612ac5f87b54ecde8b3793d9cc4d","observation_id":"d1c1c6f1-c072-4aaf-ace4-816921948476","resolution":{"observed_at":"2026-08-12T05:08:09.334141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.313654Z","title":"Face alignment in full pose range: A 3d total solution","venue":null,"work_id":"7b8e7915-d48e-4f54-b0b5-e1c215d19420","year":2017},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.068464Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:47f877ca8a78663ce8374bc5a07f9b3a08b0fd782a0216f7b2c49460804d0c11","observation_id":"7ef38bdf-4b69-46dc-8edd-5328bd42b993","resolution":{"observed_at":"2026-08-12T05:08:09.318424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.296399Z","title":"We employ the keypoint-based motion flow estimator from FOMM [24]","venue":null,"work_id":"7a405c49-023f-4c00-a796-a7a08686b95a","year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.072299Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:448cac11be12320fb11fb58935f8b9c7150ee77f36ddbc1667ffceac31e5bd4e","observation_id":"70cefd12-7af0-4ac6-859a-630cfd86fd08","resolution":{"observed_at":"2026-08-12T05:08:09.302741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5052.5404","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.220236Z","title":"Base- line*","venue":null,"work_id":"02d3aeb6-3ffb-44b8-993f-716900de65d8","year":1970},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.077335Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:4166b9ec729e55b13be320152265ebdbfaacf45112c32620280d352d6e38c7a8","observation_id":"2d371784-a014-4f49-8fa1-dcb061211062","resolution":{"observed_at":"2026-08-12T05:08:09.227777Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:08:09.279290Z","title":null,"venue":null,"work_id":"939c0e29-3de2-4288-aba1-a2264175ae21","year":null},"citing_paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T05:08:09.082079Z"},"links":{"citing_paper":"/paper/2412.00719"},"observation_digest":"sha256:7f0abcf93f766b74b64e83b76bcc18d632e9ed9a601e4e29400386029d7b6fcc","observation_id":"66bac68f-013a-43b2-b6d8-73d720354b72","resolution":{"observed_at":"2026-08-12T05:08:09.282853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00719","last_updated":"2025-03-25T09:48:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T09:16:57.008934Z","submitted_at":"2024-12-01T07:54:07Z","title":"Synergizing Motion and Appearance: Multi-Scale Compensatory Codebooks for Talking Head Video Generation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2412.00719."}