{"as_of":"2026-08-07T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:803135918033d02cb404517eb6efc79415139acdbf7aeff7a999b4509d695922","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:42:40.126961Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T03:30:18.645845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:31:04.271468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"cited_work":{"arxiv_id":"2506.16852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controllable and expressive one-shot video head swapping.CoRR, abs/2506.16852","venue":null,"work_id":"7045a48a-f42f-4df4-87ca-d607bc11d648","year":2025},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2506.16852","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:d439cf10e455126d941bf5eb2a8182b464f909dd1e9ae9d4e3ff682a368b6823","observation_id":"81b72779-09e7-4771-b09f-ffb12bf02ee3","resolution":{"observed_at":"2026-05-11T12:31:04.277354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16852/citation-record","integrity":"/paper/2506.16852/integrity","json":"/paper/2506.16852/citation-record.json","paper":"/paper/2506.16852"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.402237Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.402237Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0cc3441686e0c27c86a13373283fef3a951983d50bc824c1c28adc9cba5eeca4","observation_id":"2cfbf0e5-09ed-43b4-9d89-1c7cf941bd32","resolution":{"observed_at":"2026-08-06T23:42:32.402237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.479695Z","title":"Topiq: A top-down approach from semantics to distortions for image quality assessment.IEEE Transactions on Image Processing, 33:2404–2418, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.479695Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f2a5739653949e80c5371f0406828934ee84476c7db9ce8088808cf335aadafc","observation_id":"259a538d-568f-4484-9e98-dd7093dda501","resolution":{"observed_at":"2026-08-06T23:42:32.479695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T23:42:32.548945Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.CoRR, abs/2310.19512, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.548945Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a8769e46a22304f6821b575b0f98868d24380c7385a863fa1513a2ec84e26049","observation_id":"c61af588-a55d-4f4d-a299-44a33744a8d6","resolution":{"observed_at":"2026-08-06T23:42:32.548945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.651647Z","title":"Maddox, Zhiyao Duan, and Chenliang Xu","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.651647Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:e19a017e79a2fa29d9dccb89d8c87ab8bd1834cb43fadbc38be8740d555c7b37","observation_id":"c307d904-3bb3-4265-bcfc-ee3d4263fa00","resolution":{"observed_at":"2026-08-06T23:42:32.651647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.750627Z","title":"Simswap: An efficient framework for high fidelity face swapping","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.750627Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:d84f2252c9f25461e3850b249f605fbda0e4212e179e3c6cb87859c81fd52c89","observation_id":"f2e69ef8-5d75-40c2-a28b-d0108e5b0833","resolution":{"observed_at":"2026-08-06T23:42:32.750627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.878180Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.878180Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:7c74bfe88e172ab1b3532546dd28e33fadd25f0b956b7fa069d23f0df8f47cd5","observation_id":"5236d489-f8f9-4812-9aca-3209db6f2d36","resolution":{"observed_at":"2026-08-06T23:42:32.878180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:32.944909Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:32.944909Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:91fd81f542936fb12cb34285038eb2de45d48d395f3dffa848b3ccf7cfb2bcd5","observation_id":"4672616c-424d-492a-b4ef-487c0beab42e","resolution":{"observed_at":"2026-08-06T23:42:32.944909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.044754Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.044754Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:dd445cd30000251d1a23624b14f54a78b49a738270ef984f28c7bcfd102d3d63","observation_id":"f67f8e1c-ecde-45fc-bf0a-39bb3c2ff2c2","resolution":{"observed_at":"2026-08-06T23:42:33.044754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.130159Z","title":"Dreambooth++: Boosting subject-driven gen- eration via region-level references packing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.130159Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:03881787f457b43f8b8c1eacc6e312cd2b5675815c2e6789f947e16b10d4ba94","observation_id":"219a2446-5ac2-43d0-af74-ca155c66189b","resolution":{"observed_at":"2026-08-06T23:42:33.130159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.214285Z","title":"Mitra, Peter Wonka, and Jingwan Lu","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.214285Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:02537465bc41a9e1b4f341fda83658112798ff1ecea4e8e30a42262d2b523694","observation_id":"89aaa69c-b725-4ea1-88bc-dc123467a702","resolution":{"observed_at":"2026-08-06T23:42:33.214285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.329644Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style- based generator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.329644Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6f539e662fb83e3fdc3891036f47d5404465d4861397151ecefbb95adcf5be06","observation_id":"8d64a037-05c1-4950-96a8-e31367f04a20","resolution":{"observed_at":"2026-08-06T23:42:33.329644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T23:42:33.430511Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control.CoRR, abs/2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.430511Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f0b09c78f4852d8361d0b05224627eab2037ee3b8627fe7fa5eb3c6dfcec4399","observation_id":"143f50fb-185e-4309-8a31-51dc44e42202","resolution":{"observed_at":"2026-08-06T23:42:33.430511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.534991Z","title":"Ad-nerf: Audio driven neural ra- diance fields for talking head synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.534991Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:e1e91a935c838c92a83588159b8ab78f4264d13355bb87b4b49ed36e78014254","observation_id":"40c5cf49-cf58-43fd-8550-a72bb4a01ef8","resolution":{"observed_at":"2026-08-06T23:42:33.534991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.564756Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":"03a1ea7b-b97a-4bd0-9fa2-e97b1eaa45a7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.615758Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:197f24ba4f402c3ef3167ccd7d65ed3eb647f221aded6f407224fe4d2bbd52e9","observation_id":"b11ee47f-0be5-4993-930a-f0fe5b8b4564","resolution":{"observed_at":"2026-08-06T23:42:52.664738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.300089Z","title":"Latent video diffusion models for high-fidelity long video generation, 2023","venue":null,"work_id":"5b826a1f-ff06-4108-af09-90ca290c7256","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.735042Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:dce9853ded192955fd26889eea21c0805b679978a82f5ce8484efdb094340afa","observation_id":"999214f6-b915-47d7-94e1-9090b3169ea1","resolution":{"observed_at":"2026-08-06T23:42:52.384749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:52.024745Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"c81da393-cdca-4cd9-9650-80e5aa8551f7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.850081Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:93641f38d6ebcfb8b7563c24a3ca3f6a68f7b42daae693ca96b0c9c8de0d0a93","observation_id":"fa30ff21-cf89-4a8b-9e8e-fbe467b6c3c4","resolution":{"observed_at":"2026-08-06T23:42:52.155017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:33.894402Z","title":"EAMM: one-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.894402Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:3e79a0ae967dd4ab441eac87da8281b03d24bf824b5bc52f656df4a44331bc7f","observation_id":"2581ad79-21f5-4137-9746-7c360df47491","resolution":{"observed_at":"2026-08-06T23:42:33.894402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-06T23:42:33.980220Z","title":"Sapiens: Foundation for human vision mod- els.arXiv preprint arXiv:2408.12569, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:33.980220Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0b1de1e345a323625e1ffc835b9b9b5ed11132f46bcd3e34e2b0fb2c41dea157","observation_id":"e7518576-ac00-44e3-aad1-8dfeedd98dfa","resolution":{"observed_at":"2026-08-06T23:42:33.980220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.058838Z","title":"FLOAT: generative motion latent flow matching for audio-driven talk- ing portrait.CoRR, abs/2412.01064, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.058838Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6039073a341b8df325f149cb04a4fe13ba8719ccb8966702974ffdcf2ff1faa8","observation_id":"e8a74e12-11db-4b31-9b05-d6682879be38","resolution":{"observed_at":"2026-08-06T23:42:34.058838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.582857Z","title":"Smooth- swap: A simple enhancement for face-swapping with smoothness","venue":null,"work_id":"326ba8d2-88c4-4a69-bb3c-cdcfe2e36be9","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.149740Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:799ae2473d3a478d859370c94de05b0b2dff5570efa57d5e9acf46705f57a545","observation_id":"e073ba26-7869-43d0-9370-40972b71c20f","resolution":{"observed_at":"2026-08-06T23:42:51.724846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01442","last_updated":"2017-12-06T16:18:31Z","snapshot_observed_at":"2026-07-06T06:17:13.488115Z","submitted_at":"2017-12-06T16:18:31Z","title":"ObamaNet: Photo-realistic lip-sync from text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01442","snapshot_observed_at":"2026-08-06T23:42:34.233433Z","title":"Obamanet: Photo-realistic lip-sync from text.CoRR, abs/1801.01442, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.233433Z"},"links":{"cited_paper":"/paper/1801.01442","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:871944442d2198ea15951b33037bd60abd569ed3e9d61c3cf9ae309e0ef72a79","observation_id":"6da13f26-31f8-48e5-a7ba-5194f8c68188","resolution":{"observed_at":"2026-08-06T23:42:34.233433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:51.187119Z","title":"Faceinpainter: High fidelity face adaptation to hetero- geneous domains","venue":null,"work_id":"ba9e15eb-4ccc-4d09-862f-1b76e2d72a66","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.342113Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:42c4d42f253eaa9c00696db43fe0f6dd02f2b41376b033a777cb82f8cf1af462","observation_id":"ddd24a4c-626b-49bf-8bda-3a9f9b2298dd","resolution":{"observed_at":"2026-08-06T23:42:51.316705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13457","last_updated":"2020-09-15T07:43:58Z","snapshot_observed_at":"2026-07-06T08:47:53.346676Z","submitted_at":"2019-12-31T17:57:46Z","title":"FaceShifter: Towards High Fidelity And Occlusion Aware Face Swapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13457","snapshot_observed_at":"2026-08-06T23:42:34.418802Z","title":"Faceshifter: Towards high fidelity and occlusion aware face swapping.CoRR, abs/1912.13457, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.418802Z"},"links":{"cited_paper":"/paper/1912.13457","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ecf3af19b81f56f42afb426dd1e41bb9953fa12cc6700f96d72824c2558c6a1a","observation_id":"aa10127f-56cd-432a-b11e-598794618d74","resolution":{"observed_at":"2026-08-06T23:42:34.418802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.784749Z","title":"MAT: mask-aware transformer for large hole image in- painting","venue":null,"work_id":"da9a2e06-4453-4d4e-a13b-33655b0541a1","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.498581Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6ad4f53df9c3c6135191f6de64e9c2afee325fd34603c81720bfb98b45142d22","observation_id":"07303992-2d46-444d-beb8-ba6f3dc9e0cb","resolution":{"observed_at":"2026-08-06T23:42:51.025786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.433319Z","title":"MAT: mask-aware transformer for large hole image in- painting","venue":null,"work_id":"ffd57bde-e907-4922-bb6f-73f686b87a6b","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.564964Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a71f6282d83009c820a1a0d3829d2058124cfd29c6e6ac980093a70292d0b768","observation_id":"88f9c642-4cb2-45e4-a7b4-fc33961c41d9","resolution":{"observed_at":"2026-08-06T23:42:50.614752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:50.036039Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":"a852cd75-4a8b-4816-b3e8-67b67dbf2305","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.651078Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:01f9a81b7f3d653ad54503795df48ec5047f1fa14e1e8661dfffead6656c08d5","observation_id":"89ec69e1-e0d3-411d-88df-22b0a6f78f9b","resolution":{"observed_at":"2026-08-06T23:42:50.254861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.759539Z","title":"Deepfacelab: Integrated, flexible and extensible face-swapping framework.Pattern Recognit., 141:109628, 2023","venue":null,"work_id":"bce03668-319c-45ac-a871-07b9081857b7","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.724128Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:61b6f802c67ee39a1bdaefaec5bcfa5e5f28adebdda88cb51eb706cf28baa394","observation_id":"8d89407e-2e24-460b-9d67-a272c3c5ba39","resolution":{"observed_at":"2026-08-06T23:42:49.876203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.817105Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.817105Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:57c3a0daf4053a541567b6fa3942add585d635cf74384606afa14cdd433a7df7","observation_id":"804691c5-abca-40b7-af05-9f4cfca8408b","resolution":{"observed_at":"2026-08-06T23:42:34.817105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:34.898075Z","title":"Mediapipe: A framework for building perception pipelines,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.898075Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:853955de65cfd0284d9e975b33182870592aece0be9adebcc8e66016b7111aef","observation_id":"5acca453-08d7-46dc-bdec-fcffad8d11cc","resolution":{"observed_at":"2026-08-06T23:42:34.898075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.393533Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":"0e3c9167-8220-4175-a526-3f7125a118c3","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:34.984227Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:deb7bea104b35016a00da72896a86ec1db9629a0f8ba9dbc2cf3cfa344f4f333","observation_id":"ed4c5d86-9379-4a2b-a334-779c7f7a5a43","resolution":{"observed_at":"2026-08-06T23:42:49.453214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08268","last_updated":"2024-03-13T05:44:37Z","snapshot_observed_at":"2026-07-06T17:43:44.153710Z","submitted_at":"2024-03-13T05:44:37Z","title":"Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08268","snapshot_observed_at":"2026-08-06T23:42:35.066825Z","title":"Follow-your-click: Open-domain regional image animation via short prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.066825Z"},"links":{"cited_paper":"/paper/2403.08268","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0888aa8fc74365698c03f08a150b8a93a1127ef3056eb976fa369e88dc49efc9","observation_id":"3fe2b8a9-b8a0-48ec-9129-6eb84948414c","resolution":{"observed_at":"2026-08-06T23:42:35.066825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.159073Z","title":"Follow-your-emoji: Fine- controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.159073Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:7b8319bfd24109a39c2b7266ef2bad83855ea798eccf3e9a067ea6f8a7196a17","observation_id":"87a4adf4-620a-4a72-a05f-285d247dcf15","resolution":{"observed_at":"2026-08-06T23:42:35.159073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:49.108031Z","title":"V oxceleb: A large-scale speaker identification dataset","venue":null,"work_id":"0d46c60b-92dd-4828-ae62-890527ebc804","year":2017},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.245149Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ebe3f210d2b26ea25127fdc22d0a8e494ee9cad00ee252ac043cc114874b3d20","observation_id":"2826a8f9-b0cb-4fe5-83ee-2ac2baa8afa5","resolution":{"observed_at":"2026-08-06T23:42:49.187349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.861267Z","title":"Fsganv2: Im- proved subject agnostic face swapping and reenactment","venue":null,"work_id":"8ca211d8-f22f-4a9e-afae-0e2506b19684","year":null},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.339850Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2b9c22e2b9bfd30d4f097bb9d81751ff97d96dd6f2d497ee0e4d1f600938fd25","observation_id":"bd89c539-f93c-4afd-b1b3-91da8c57bc26","resolution":{"observed_at":"2026-08-06T23:42:48.944745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.596017Z","title":"DPE: disen- tanglement of pose and expression for general video portrait editing","venue":null,"work_id":"228042bb-803f-4d34-b3cb-5f9d2e3fbb47","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.447089Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:93ed19038da1ff7163f8111a757971833990ad229b16c8ed858a013ab742c3e9","observation_id":"315584a3-51a9-414f-94bc-010bb3f09a8e","resolution":{"observed_at":"2026-08-06T23:42:48.704745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.510645Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.510645Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:45c1d1520fd683c63dfeaa9ec91edf6837b4846d7418c346aa14a70c010adc88","observation_id":"dc393645-2ac5-40c6-ae47-b4db6152b927","resolution":{"observed_at":"2026-08-06T23:42:35.510645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.314752Z","title":"Nambood- iri, and C.V","venue":null,"work_id":"1f0e2728-331c-464c-8e02-7dafc281c5a8","year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.574841Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ecf318de530a987cc05b573ca119198339725459911e810094674de0d06d7ed6","observation_id":"b8943662-c49e-4515-bfa8-9df6248e61e7","resolution":{"observed_at":"2026-08-06T23:42:48.422105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.644544Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.644544Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:9a34ba30252c0ee9d9209f4be0220ad65389ec1b31f588e2c6dee154ae2bae27","observation_id":"03a2a14f-c08c-42a9-b8d5-55da8c5bacdc","resolution":{"observed_at":"2026-08-06T23:42:35.644544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:48.009718Z","title":null,"venue":null,"work_id":"7a3cda92-8800-4ccd-87a4-f87961b5e50f","year":2018},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.713788Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:0f4ac44cd509d87b4b02527135f803227e53bcdb8a1bbe93bc3a987bc3df3a2c","observation_id":"ff7755d2-20c0-4bca-aa42-573ff783d1a2","resolution":{"observed_at":"2026-08-06T23:42:48.114756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:35.792867Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.792867Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:5f5e243460ac2cfbb3a332d400eb0316d03128723746992c8b39120d5adbb745","observation_id":"e6195219-27e4-49a2-984c-390cd5f1b3bb","resolution":{"observed_at":"2026-08-06T23:42:35.792867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11263","last_updated":"2021-02-22T18:50:47Z","snapshot_observed_at":"2026-07-06T10:43:40.060681Z","submitted_at":"2021-02-22T18:50:47Z","title":"Style and Pose Control for Image Synthesis of Humans from a Single Monocular View","version":1},"cited_work":{"arxiv_id":"2102.11263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.11263","snapshot_observed_at":"2026-08-06T23:42:40.688399Z","title":"Style and Pose Control for Image Synthesis of Humans from a Single Monocular View","venue":"cs.CV","work_id":"efcb5712-bfdd-464f-acca-06bc0bd016c9","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.879400Z"},"links":{"cited_paper":"/paper/2102.11263","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:c42506c518de3ea8601f630509d68f993850fef1ec2985d89260dfafdc1558a6","observation_id":"e2a7e11b-ff34-45f8-90c7-9790293be03e","resolution":{"observed_at":"2026-08-06T23:42:40.805594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.677227Z","title":"Few-shot head swapping in the wild","venue":null,"work_id":"1cbd34d6-91f8-4ed4-a75e-3e2e58950d70","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:35.990382Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b8c7e5d81e2a30233e1cdd7a34b74b49e2103dc12a9de7b5b2960bd4b9288181","observation_id":"0aa9b03d-e743-4b47-9e72-a2cdafbc6471","resolution":{"observed_at":"2026-08-06T23:42:47.775488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.485120Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"b798d437-4d26-4930-bc5c-2a7ea8b5b2cb","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.144755Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:cba0f00d80a941248485b535fe4a534b5f0fb93e5f31cc61038d6751201458da","observation_id":"f814a81e-d8b0-4626-9e1d-6e255006cb75","resolution":{"observed_at":"2026-08-06T23:42:47.556014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.040740Z","title":"Everybody’s talkin’: Let me talk as you want.IEEE Trans","venue":null,"work_id":"da7da63a-0c99-4231-bbce-9cea3866fc5a","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.310637Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2dbecdcada138fae306d92e5cb1f1cb6dfedcb0d1aabaa160fad9b42483159f5","observation_id":"3c00f839-d2fd-43b0-bf3f-71c1ef337fcf","resolution":{"observed_at":"2026-08-06T23:42:47.129615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.838792Z","title":"Talking face generation by conditional recurrent adversarial network","venue":null,"work_id":"578eac98-007e-44c7-b148-89b4d2c75e5e","year":2019},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.402233Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2c2093867143303c122f960a1c3df04f17712d0b3d76ef4a3ee13d2963b57310","observation_id":"d8593fbe-0aa2-4f64-943d-98467d59531e","resolution":{"observed_at":"2026-08-06T23:42:46.933706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.612771Z","title":"Speech2talking-face: Inferring and driving a face with syn- chronized audio-visual representation","venue":null,"work_id":"15b2319f-5d67-4827-be57-636d88b0bcfd","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.534751Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:77818f9b9963e93e8f757b322f639f4c9b218511bc23437636d78055cc759a66","observation_id":"22f74eb7-17f4-4752-9e5e-996406c71559","resolution":{"observed_at":"2026-08-06T23:42:46.684836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.384750Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"041b972c-9d17-4d94-9dd9-200ab998c7a9","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.646100Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:72032d257bcb9b8f6cf7ed7bdc27e19385ac6bc0f5bfbc66193e2caeecfae904","observation_id":"086e9585-ac6f-4bb9-aa34-b72ebd88ef83","resolution":{"observed_at":"2026-08-06T23:42:46.496396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:46.119028Z","title":"Flowvqtalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"68471132-4e1e-4362-a093-7483fc7e81ae","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.824757Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:8a97d87ef7119d6957f8b6957f37630310a12e4ee7db61e4a7f9c090d0465557","observation_id":"e8c55433-7b48-420e-81b8-70cb42423357","resolution":{"observed_at":"2026-08-06T23:42:46.255704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.924750Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"de784a0f-f21d-4d49-80e3-3b05866fa33d","year":2020},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.944970Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f2b0f84b95fd40ee8f568588e98a3e3d9ef2a74f637ba372e20bf5b2b01f26ae","observation_id":"b8c2a4c1-d6ed-4f49-9506-698eb3e20c7a","resolution":{"observed_at":"2026-08-06T23:42:46.001561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.509057Z","title":"EMO: emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"811947d5-9635-48c8-9a87-0437cbf063eb","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.024896Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:f090115ed180b6f17a0e214da38e3113038b01b59f5ad6fbd8d35ed22b10c35b","observation_id":"5386b1de-212b-4bd4-b801-898bf6c6f6ac","resolution":{"observed_at":"2026-08-06T23:42:45.754867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.324418Z","title":"Faceverse: a fine-grained and detail- controllable 3d face morphable model from a hybrid dataset","venue":null,"work_id":"502653f7-ff7f-4209-b6e7-ef1da0c55b6a","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.136811Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:863535af40721f6a5655fdbd483c9514113621725706004d595cead7c0e8d2cd","observation_id":"3c6621db-5c41-4444-9b40-d891e8cc16e5","resolution":{"observed_at":"2026-08-06T23:42:45.436883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:45.101869Z","title":"Stylea- vatar: Real-time photo-realistic portrait avatar from a sin- gle video","venue":null,"work_id":"2662a56c-2af7-4022-b959-691a8f382479","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.255788Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:46dd5ece0ab944e7d4937fcd7637e7e9fe34d7e3bf7df065938c81fe7561b52e","observation_id":"e14facbc-0d48-4443-89b0-a60dde4f52d0","resolution":{"observed_at":"2026-08-06T23:42:45.208396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.781722Z","title":"Hs-diffusion: Semantic-mixing diffusion for head swapping, 2023","venue":null,"work_id":"50a5da74-f78a-4747-884e-503bf5f547c3","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.367418Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:7125d89fc6686cdd3560fd9f9c93035b68e482d4263b0fdd1f85e2f02556237e","observation_id":"d4b174dd-5bcd-44d8-b0b7-934b5bd63d91","resolution":{"observed_at":"2026-08-06T23:42:44.955034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:37.465605Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.465605Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:89332bfc37f377d7d9dfe20f532b7ea54c4ec34acfdba40d372bc7eded01d89d","observation_id":"582fcfd8-bcca-4ec9-a57d-c6fc3edc02ad","resolution":{"observed_at":"2026-08-06T23:42:37.465605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.434752Z","title":"Hififace: 3d shape and semantic prior guided high fidelity face swapping","venue":null,"work_id":"18cf9770-1bcf-4b36-babc-d56fae8a9cdf","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.597995Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:c30290f5fb6ca2d39443af78fa71477ea064d142839917fdc374135a211878bb","observation_id":"df3ccc09-1de0-4ddc-94d9-1e258294807a","resolution":{"observed_at":"2026-08-06T23:42:44.564755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:37.708687Z","title":"LIA: latent image animator.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.708687Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:e2c018ea90f9c1235d48f7feea55a0ed907ba5319bb75781649ce17ff0e19c1e","observation_id":"a892496d-c9d2-443e-bc9b-aaf3656ec1d8","resolution":{"observed_at":"2026-08-06T23:42:37.708687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-06T01:54:50.445862Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T23:42:37.820190Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.820190Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:1052d357f4503670832b0795060de577cbff39e379dc80b06cc0a6357f7ff0a6","observation_id":"e7768a50-d62b-4394-bd18-c1521d85f809","resolution":{"observed_at":"2026-08-06T23:42:37.820190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:44.045059Z","title":"Imitating arbitrary talking style for re- alistic audio-driven talking face synthesis","venue":null,"work_id":"d4313586-a9c2-4f47-8d65-4415892efc8f","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.924348Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:1402dd9b8d8c1e4b07a302476f3ab8ea2ac62e32d0f71515a5629d5c0b8ff798","observation_id":"4ec8e729-cc94-4959-959f-890b6709e9e9","resolution":{"observed_at":"2026-08-06T23:42:44.174833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.083908Z","title":"VFHQ: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.083908Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:cc868def87b93134548f5508a221e00898e14d7d67d7eaf8aaacf89957c30a53","observation_id":"afc9ff08-e424-494d-9dc1-b8d15cee140f","resolution":{"observed_at":"2026-08-06T23:42:38.083908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.325912Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.325912Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:fe85680b6cddb2c468631eb99b6caf4f33f4fda3e4d6bece37660327c18415fe","observation_id":"391ac3c5-08e4-47bb-a6ee-163bc9d2d9af","resolution":{"observed_at":"2026-08-06T23:42:38.325912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.535083Z","title":"Make- your-video: Customized video generation using textual and structural guidance.IEEE Trans","venue":null,"work_id":"1d2185d9-ed4b-41f2-b89d-1756bc2b0991","year":2025},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.484837Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a333f1453ae5a1a093c89b3746bf45882be495711e71698a60b4311e765432d2","observation_id":"861de74b-05ee-4937-a321-2327e5c5242e","resolution":{"observed_at":"2026-08-06T23:42:43.717793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.270034Z","title":"V ASA-1: lifelike audio-driven talking faces generated in real time","venue":null,"work_id":"9f77b171-4501-4633-8f83-0a6cee274379","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.599148Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:2579aa89a7a7cbce9dc5d48a29c9c447d1e919e260fe5a138faba4e62b5b1f26","observation_id":"cb249c73-bd87-4283-aab0-a3c1be1c4302","resolution":{"observed_at":"2026-08-06T23:42:43.394846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:43.091801Z","title":"High-resolution face swapping via latent semantics disentanglement","venue":null,"work_id":"788d7e2a-98cb-4c94-add7-9c9bcc61a566","year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.724749Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:3ca2434fcf18efb5af86f54c909cbfd4192cc7580b4082d975a7aec5ab2352a7","observation_id":"20316304-2696-464b-a312-7a236b1a73d3","resolution":{"observed_at":"2026-08-06T23:42:43.167772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:38.883309Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:38.883309Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:3bd81f99bc3129b3b686494365f9a133b140be9344808cd5f8ad75b0788a578b","observation_id":"4162a006-e639-4859-8ec3-ae821548b1a3","resolution":{"observed_at":"2026-08-06T23:42:38.883309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T23:42:39.049844Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models.CoRR, abs/2308.06721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.049844Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:a4bac45f189e440dff5ce92c0e0493ef66564ec77e1cac5b030cd07a7f9b545b","observation_id":"fdcb9b24-858c-4abe-ade1-f7f043b8020f","resolution":{"observed_at":"2026-08-06T23:42:39.049844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.766530Z","title":"Metaportrait: Identity-preserving talking head gener- ation with fast personalized adaptation","venue":null,"work_id":"00e66ad7-d074-4e24-83d6-dda170aa9bb5","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.165036Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:df1fa3797e3783c2fedbfff9b37fe53007289318f6a7d7e42c53d41f6bcf1fb0","observation_id":"594b1f39-6b30-43ea-a961-8a36cae0dc05","resolution":{"observed_at":"2026-08-06T23:42:42.900327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.282275Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.282275Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b535b27e49c0d39a31a392616b1ff58b46a3777302a0fca9c7ebc77c78633a36","observation_id":"69cd3129-4ef4-4942-8d90-58236e9d0cc8","resolution":{"observed_at":"2026-08-06T23:42:39.282275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.476106Z","title":"Personatalk: Bring attention to your persona in vi- sual dubbing","venue":null,"work_id":"18054778-ebfe-4a41-9491-22dbd18b089a","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.364749Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:49839057166b6ba508777e00f39c7efa3c3e084af8f034991dece15365b7c7c7","observation_id":"d5b385df-6682-4194-b051-e9a3f0114460","resolution":{"observed_at":"2026-08-06T23:42:42.593289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:39.524838Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.524838Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:ec8389e64a1707f89ef027aa28e01038eea3bd96bf85dd4216cac52d6d6057e6","observation_id":"a48a6aa1-34e0-4db4-90db-83fc5818cc48","resolution":{"observed_at":"2026-08-06T23:42:39.524838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:42.226225Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":"f157389d-6f44-4937-afb3-2bebaf0780a7","year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.749317Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:b78bc06e0216b634c1221e12a18ea2e1f98c100ef834e7adf7e19f9a64674b03","observation_id":"46c9cf21-dfa9-4ec0-a6ce-de706a7d7882","resolution":{"observed_at":"2026-08-06T23:42:42.366312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.974510Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"262f7901-ba2f-4813-864f-b0cbdcd93616","year":2021},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.856920Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:470c57ad86de1ecb4be09a651a42721e0053f53aaa08503e98ce090402d2e75f","observation_id":"548df4c3-6e3b-4f4e-9f23-aa45eb39320e","resolution":{"observed_at":"2026-08-06T23:42:42.064766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:41.654751Z","title":"Diffswap: High-fidelity and controllable face swapping via 3d-aware masked diffusion","venue":null,"work_id":"27934ce8-74af-46d8-9e02-4d9cc8f825a7","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:39.997239Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:06f7ac9c72b87fc38cbc1fa4d4f49710d0512d65e70cf17345117b52e63d3716","observation_id":"648ed58d-8c6b-4e0f-af43-7ed09662dc3b","resolution":{"observed_at":"2026-08-06T23:42:41.751835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-06T23:42:40.126961Z","title":"Magicvideo: Efficient video generation with latent diffusion models.CoRR, abs/2211.11018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:40.126961Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:4a7c36f210cb73ad31dfc33cb11494ea9ccf52ae8e96d3de480508e81cd606cb","observation_id":"073b2f1d-b80b-4e60-aac7-e1e6132236d0","resolution":{"observed_at":"2026-08-06T23:42:40.126961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:42:47.233865Z","title":null,"venue":null,"work_id":"5397c198-a913-4e71-9027-768c87da674b","year":2023},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:36.214754Z"},"links":{"citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:6d7c5041750eef5930c71f07e6ffb9a74decedb28812e20d11d08fd9048314a6","observation_id":"2e9389a7-80c6-4e61-b0a4-dc087ac437b5","resolution":{"observed_at":"2026-08-06T23:42:47.308399Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:34:39.691210Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":36,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2506.16852."}