{"as_of":"2026-08-08T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da593164e337d18c849b188e93cfdbab46d6d8b8c5902892989f80c4424789af","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T10:56:11.553110Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.22347/citation-record","integrity":"/paper/2606.22347/integrity","json":"/paper/2606.22347/citation-record.json","paper":"/paper/2606.22347"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"ACM Transactions on Graphics (TOG) , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:bc2519ea120cd186721e4d4b721802a309fbd01e7ceb87eade589ff10638d64e","observation_id":"1fd5fb58-9efe-4be9-a339-ca90535354ca","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"cited_work":{"arxiv_id":"2411.17440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17440","snapshot_observed_at":"2026-07-04T08:49:42.422443Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":"d7ca39b6-2e47-4bd9-877c-9cfadb2997e7","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2411.17440","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:919777fe3c04158cb6ee3b2544d14e5fd93b1552b2d7bd00a53e0cf43cf238b2","observation_id":"2819a73a-0c3c-428b-8e6b-a5cfa6e6ec2d","resolution":{"observed_at":"2026-07-04T08:49:42.423833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17816","last_updated":"2026-05-05T15:27:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-23T06:48:31Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","version":3},"cited_work":{"arxiv_id":"2504.17816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17816","snapshot_observed_at":"2026-07-04T08:49:42.382712Z","title":"Learning Zero-Shot Subject-Driven Video Generation Using 1% Compute","venue":"cs.CV","work_id":"b528209a-45c7-47ce-b8de-0c37b27fcf5a","year":2025},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2504.17816","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:38ad1de49589508ab37bb7a8cb2cd117940c0928392e762a90d2610f6a4ea282","observation_id":"d7c2ffb6-aa09-4de1-9252-a1f648985572","resolution":{"observed_at":"2026-07-04T08:49:42.384238Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":"2404.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-07-04T21:10:09.688336Z","title":"Id- animator: Zero-shot identity-preserving human video gener- ation","venue":null,"work_id":"e92e42cf-1216-4226-a583-07ff26a3de66","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:4ccd237f82c84e9935f9c81cc6e98de43e6cacbff916725de03ea97ed6ed4b2b","observation_id":"ae822a72-b1e8-40e0-9631-ea6788fbffc8","resolution":{"observed_at":"2026-07-04T08:49:42.401705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11638","last_updated":"2025-02-04T02:08:27Z","snapshot_observed_at":"2026-07-06T20:07:41.462631Z","submitted_at":"2024-12-16T10:27:48Z","title":"IDProtector: An Adversarial Noise Encoder to Protect Against ID-Preserving Image Generation","version":2},"cited_work":{"arxiv_id":"2412.11638","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11638","snapshot_observed_at":"2026-07-04T08:49:42.419943Z","title":"arXiv preprint arXiv:2412.11638 , year=","venue":null,"work_id":"414b897f-fc24-48a5-994a-2713fefe55ee","year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2412.11638","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:9b22b2bbdf982b756c5216ec3bf561013026f0eb572b5eadc978f1188b426e76","observation_id":"0c3d7567-8f67-401c-aae1-5149aaae2876","resolution":{"observed_at":"2026-07-04T08:49:42.421353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17048","last_updated":"2025-03-16T01:40:29Z","snapshot_observed_at":"2026-07-06T19:57:01.568072Z","submitted_at":"2024-11-26T02:25:38Z","title":"PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation","version":2},"cited_work":{"arxiv_id":"2411.17048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.17048","snapshot_observed_at":"2026-07-04T08:49:42.365917Z","title":"Hengjia Li, Haonan Qiu, Shiwei Zhang, Xiang Wang, Yujie Wei, Zekun Li, Yingya Zhang, Boxi Wu, and Deng Cai","venue":null,"work_id":"b79bbc5a-95ac-49f7-b5ad-a6e58dfd2fa9","year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2411.17048","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:254aec1fbe2bfa35cf8318d54f8bee5a7188c79adaedc0dd342491997b217b6d","observation_id":"ef318b3f-586e-476c-bd42-9504b920420b","resolution":{"observed_at":"2026-07-04T08:49:42.368355Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:469cfe3da82eb0341dbbd4ecda422759ce84632809df5767be9092a07082d527","observation_id":"9ecf49ff-e3b5-479b-aa9f-82d73534ddf9","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20974","last_updated":"2025-01-13T05:06:17Z","snapshot_observed_at":"2026-07-06T19:40:44.012201Z","submitted_at":"2024-10-28T12:46:05Z","title":"MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis","version":2},"cited_work":{"arxiv_id":"2410.20974","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20974","snapshot_observed_at":"2026-07-04T08:49:42.388257Z","title":"Moviecharacter: A tuning-free framework for controllable character video synthesis","venue":null,"work_id":"a93fe30a-9030-4e78-a064-1d5e6cd7ffa3","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2410.20974","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:ca0096f01dd1de3ad228a725bba2230645d6f55e72533d6eef2de024c5614b7b","observation_id":"42878e7f-002f-47a7-8bba-952bfcc84e5a","resolution":{"observed_at":"2026-07-04T08:49:42.389774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:635cc83bc83bd2174be13f0bc2cd9e1300882775fcc3eee93f9e5acbf0550fbd","observation_id":"d5061a59-5449-43ad-9f7c-ed83366d2db0","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":"2208.01618","doi":"10.48550/arxiv.2208.01618","metadata_source":"pith","pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","venue":"cs.CV","work_id":"ca618c21-3ba6-448e-bd86-bcecff3cdeb5","year":2022},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:80e0ade8c813c38b8fb24aa15d8f9053170a1267a2528e31a810c0667339beab","observation_id":"ff5e3902-9ceb-4c1f-89c7-ef20aaf1f50c","resolution":{"observed_at":"2026-07-04T08:49:42.402961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-07-06T20:16:09.014564Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":"2501.01790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-07-04T08:49:42.414270Z","title":"Ingredients: Blending custom photos with video diffusion transformers.arXiv preprint arXiv:2501.01790, 2025a","venue":null,"work_id":"87dfa8d0-3218-4ef4-9c1f-cbb3547159cc","year":2025},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:32a63d2aae38996559e577403247bcb168c2bf5c58143efa2909b545cc54864b","observation_id":"e7151946-fa92-4f59-af59-a6ab207ad4ff","resolution":{"observed_at":"2026-07-04T08:49:42.415744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10391","last_updated":"2025-03-13T14:07:58Z","snapshot_observed_at":"2026-08-07T17:07:00.747879Z","submitted_at":"2025-03-13T14:07:58Z","title":"CINEMA: Coherent Multi-Subject Video Generation via MLLM-Based Guidance","version":1},"cited_work":{"arxiv_id":"2503.10391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.10391","snapshot_observed_at":"2026-07-04T21:10:09.682483Z","title":"Cinema: Coherent multi-subject video generation via mllm-based guidance","venue":null,"work_id":"1820a399-b3ca-48c7-aaf0-dd2a7dff2e4b","year":2025},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2503.10391","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:0ca6f558f3c88d3962f7cd63067a98e6330dc5f61ecef78140d43781d3b3763f","observation_id":"3d29057a-593a-41ea-925b-47a9414aae75","resolution":{"observed_at":"2026-07-04T08:49:42.380535Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:6a82508b4be60c5fd8ae017ba7588456fb3b9e3c55f780aece5df054a9f69752","observation_id":"60e14c93-3857-434b-aff6-f863e3dad976","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:9260ea431a4eede9cc748fa1b151fdc2e973e2cb1d78e26fafa4b8f4205afa94","observation_id":"26070b29-0cbf-4b5f-bc03-27b33a6f6203","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:0fb3c637f935ca9180b5cdde3edd5a88f9bb5dfa0e52174f05c1380a57029604","observation_id":"2e1f3032-f5d7-419a-bedd-260f58eac3d6","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":"2401.07519","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-07-04T10:19:46.873019Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","venue":"cs.CV","work_id":"85490b0d-f13f-4217-a587-51a62742c242","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:72140af2d049ca7ee7b15e2f895c4b35f55c3a20ea736cc9f274e21962cf9e89","observation_id":"5cdbc4cd-2efc-4ae4-a702-02cd7520806a","resolution":{"observed_at":"2026-07-04T08:49:42.419091Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:4283640c849c7f4f6c0a10fbae20a1b9a7268669852577c30ca4fcb9ed55650b","observation_id":"7435d5eb-9a25-4954-a6db-a742adba7081","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03374","last_updated":"2024-02-27T02:45:34Z","snapshot_observed_at":"2026-08-05T15:36:02.045738Z","submitted_at":"2023-05-05T09:08:25Z","title":"DisenBooth: Identity-Preserving Disentangled Tuning for Subject-Driven Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2305.03374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03374","snapshot_observed_at":"2026-07-04T08:49:42.391190Z","title":"Disenbooth: Disentangled parameter-efficient tuning for subject-driven text-to-image generation","venue":null,"work_id":"53a63122-dc79-4ad7-819c-ee610fa522d3","year":2023},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2305.03374","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:e6e5c6d0e9808ca36a20115a692ee4ea5c48bf21c3e94abd40a9c17a125cc321","observation_id":"648d868b-3148-4bb1-8d73-ad8a46a78eff","resolution":{"observed_at":"2026-07-04T08:49:42.392781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19427","last_updated":"2024-04-30T10:16:21Z","snapshot_observed_at":"2026-07-06T18:07:34.924208Z","submitted_at":"2024-04-30T10:16:21Z","title":"InstantFamily: Masked Attention for Zero-shot Multi-ID Image Generation","version":1},"cited_work":{"arxiv_id":"2404.19427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19427","snapshot_observed_at":"2026-07-04T08:49:42.415003Z","title":"Instantfamily: Masked attention for zero-shot multi-id image generation","venue":null,"work_id":"0ec0ce70-053f-4a32-a340-8a7395f2dbf9","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2404.19427","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:e489e025ba177a6b48bcb3b0b9423d52d624ee3a23d38b5499c2f44a8b536ecc","observation_id":"59f01cbd-16fe-437f-a692-97b9fae7a5cb","resolution":{"observed_at":"2026-07-04T08:49:42.416369Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":"2308.06721","doi":"10.48550/arxiv.2308.06721","metadata_source":"pith","pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","venue":"cs.CV","work_id":"98e51b10-54bd-4251-8a2d-f79bd6215c19","year":2023},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:c5583b8fdd8ef25415ed63506a13fe3e2f8e88ee4cd87646a34dce86dabc9f1b","observation_id":"fea64d9c-dd4b-4fa2-891c-1ddb488ba325","resolution":{"observed_at":"2026-07-04T08:49:42.413805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:20:08.139662+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:241b8650ed0818a210199089e0dc678bde900fccaff082a724ba042395bf748a","observation_id":"c87cbce1-4a21-48d6-889e-0887023245aa","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:08ce27924e48d39083915f6a23dee25f2e834209e3722836d1e8521130136645","observation_id":"feb9c5ea-4702-45b8-a2af-65150cd91f1e","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:f2e614119c986c170a304ef98031beb58014cf55f9bcadf8de46c91c771e0d61","observation_id":"907ad126-71ab-4fa3-84b8-f2a4762ad71e","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:e0c927ed75ee8d0575d58db1f614e7ba7813c99371e69c54f4256ed84b601c01","observation_id":"ef69d63f-14cd-441b-b1f1-3e09f8c59a73","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:d634d578890c6cd6c1aaac649c397eb3c4215cdbe3fd844f811de08a3a5f0c42","observation_id":"917a4e05-25b2-440b-a6c5-53954ad9fba8","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:cf9d32b7ba08864a1b9312f2a567944ce1809bc9722e1a592742db02ee81bccd","observation_id":"0b74ad29-f1f0-4b27-b7f3-0c3ea136bd0e","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:5d784d65d9a87670a2617407b46a2e5339def21b2d0d3ce2e0c4247a3f1f68cb","observation_id":"260f0693-4f7c-48b7-837d-3554d1b2ffbe","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:0a6d7d8662588458e61c4ec3bb9259dbe476988fad1a1db257d46e0829c15d15","observation_id":"2b2d96b3-6852-41d6-abdd-4daad6ba6d5c","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":"2010.02502","doi":"10.48550/arxiv.2010.02502","metadata_source":"pith","pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Denoising Diffusion Implicit Models","venue":"cs.LG","work_id":"8fa2128b-d18c-405c-ac92-0e669cf89ac0","year":2020},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:64eeccd9c7e65c1a847e2837c59499a38d39665029e2a49fd62c189cdf27ab31","observation_id":"62746e16-c431-48de-bf67-dc8473aaabc2","resolution":{"observed_at":"2026-07-04T08:49:42.400465Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:41.147667+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Forty-first international conference on machine learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:a41d6426583ec5f1f6d97c045bc6c7cd37e9027c786f1b0b839f40994cb41470","observation_id":"8663c700-e1dc-4632-9a01-b1a0bd9b8d65","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:a71e4af18bf100f5e89433290c5aca8c0f6cd51c0a8b2bae7da08810f4437cff","observation_id":"362402d6-5155-4450-92ac-b45be3f1fd1d","resolution":{"observed_at":"2026-07-04T08:49:42.381378Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:c9efd1673e620614d5ffd030cf1d3fe4e18151860bd12c3ded47dcbfac5841ec","observation_id":"c7c9982c-8282-461d-8399-9b07583f14a4","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:e280dff621e6d6ded5b75ecf7058341cc9f22ec1ea5d0e0f8411d00f6d83f5cf","observation_id":"dbfa7bf1-0ccd-4aaf-bcce-5f63e3a7d4a3","resolution":{"observed_at":"2026-07-04T08:49:42.410469Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":"2205.15868","doi":"10.48550/arxiv.2205.15868","metadata_source":"pith","pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","venue":"cs.CV","work_id":"2dbd6bcd-fc98-4fbf-b586-f6d94fe1abd2","year":2022},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:8f64d54e3765eb469a4d074e26ded5f2aebd614a9d07435b2d9cd2c71c6e5ab7","observation_id":"9a6190cd-51f0-4b78-8304-697bfd9a20ae","resolution":{"observed_at":"2026-07-04T08:49:42.395667Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:f72851a6b1ff606e5f9da66ed64939df80ac6e7580fbc62c19c5c5bfbb05eb9c","observation_id":"0a4852fa-62c2-44b8-a0a7-bbf1513aad7f","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:ea2ccbb529d476a9a288e2a3e6280a646a2c1111e188bab92ad4dde7e91c5647","observation_id":"119bc739-ebbd-4946-89e8-fb3c737e304d","resolution":{"observed_at":"2026-07-04T08:49:42.395481Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:8f8f7db43849c58209cefe8a1b22b209dd84808055708613542a1cc98d02099a","observation_id":"53745157-00bd-49d6-9fba-821523954ae7","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:9340964043166bb5ef0405e52076b9d6021b453131165e6a1ad36dd3fc4b0862","observation_id":"23a05bc6-3a3e-45a6-99b0-137084a0d455","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.596069Z","title":"arXiv preprint arXiv:2512.01311 , year=","venue":null,"work_id":"6df072b6-3a26-434d-bdf6-1e93dfe798f7","year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:e510104ccfb709b3529b7b31db18fd4a3176e1ec80ed303f7402ce35c3f4b889","observation_id":"1096b1e1-30de-406e-b7e4-f4d79bc85d4e","resolution":{"observed_at":"2026-07-04T08:49:42.405620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:08720bd9c049edd3aa3a13fbd7b4110e8d5605899a2f76eb022f69a5fcdd7997","observation_id":"022d5d22-559d-4094-b3f6-6b8f4d661bec","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":3},"cited_work":{"arxiv_id":"2603.28489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.28489","snapshot_observed_at":"2026-07-04T08:49:42.589192Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","venue":"eess.IV","work_id":"a7aca896-f124-4681-8d70-aaf3642085c4","year":2026},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2603.28489","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:6b433853be0356e55a792e4e764755f4c243a2d6bd9e2d1eb8c98e38cfa5f96e","observation_id":"37236391-583e-4eba-bc89-50f272411f75","resolution":{"observed_at":"2026-07-04T08:49:42.407023Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09844","last_updated":"2025-01-19T15:03:39Z","snapshot_observed_at":"2026-07-06T20:06:21.957662Z","submitted_at":"2024-12-13T04:27:08Z","title":"Real-time Identity Defenses against Malicious Personalization of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2412.09844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09844","snapshot_observed_at":"2026-07-04T08:49:42.593658Z","title":"Real-time identity defenses against malicious personalization of diffusion models","venue":null,"work_id":"8ce63cf4-d4bb-49dd-b6f8-da34cfd058dc","year":2024},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"cited_paper":"/paper/2412.09844","citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:0b5b2477d12d230149915b91476e8ef52e621442cd6aeaa4688b0b887accd1b3","observation_id":"170f1313-06e1-4271-91dc-ea8ad79dc4a2","resolution":{"observed_at":"2026-07-04T08:49:42.408122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T10:56:11.553110Z","title":"2025 IEEE International Conference on Robotics and Automation (ICRA) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T10:56:11.553110Z"},"links":{"citing_paper":"/paper/2606.22347"},"observation_digest":"sha256:1ed44cde7ff7f3b03ebbc829c37eea0db9be5031aa92714cb074c394a1cb0fbd","observation_id":"5ed08625-b845-4193-8c87-d8e3680bb788","resolution":{"observed_at":"2026-06-26T10:56:11.553110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.22347","last_updated":"2026-06-21T05:56:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:56:28Z","title":"Customizing Video Portraits via Identity-ActionDecoupling"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":18,"parse_uncertain":0,"unresolved":22,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.22347."}