{"as_of":"2026-08-04T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:81d261c27c5793602e07e9bc727c20bbcbe3e827e215c19f6baef1050c8ba2f5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T17:40:00.224358Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.04702/citation-record","integrity":"/paper/2605.04702/integrity","json":"/paper/2605.04702/citation-record.json","paper":"/paper/2605.04702"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:baf4a953a2dd6bd9c3381df6bf1f31e29f029aea5d8d24144222ad5579647508","observation_id":"fbbcac54-57a7-407c-8dd4-8b430059df6c","resolution":{"observed_at":"2026-05-11T17:21:09.757564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.817115Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"466a3f28-f5e8-456f-9a6a-a6b0fdb10a43","year":2019},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:41e6718a380c9306d692dce5bb18dc259302365b742fddc8bfa8422f8107fae5","observation_id":"7f8e9674-6220-4c54-90a8-7b2270b1f39a","resolution":{"observed_at":"2026-05-26T07:06:53.178132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MAGREF: Masked guidance for any-reference video generation with subject disentanglement","venue":null,"work_id":"f998b8ba-aed8-4a59-807d-753b8b892645","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:faed08480b201269e32dbca5accce5e1a2a6020af9b8910e039f5a668d90675c","observation_id":"12029f05-a048-4628-bd03-749f2bbf486b","resolution":{"observed_at":"2026-05-26T07:06:53.186716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-modal alignment using representation codebook","venue":null,"work_id":"637ab2d0-3f1a-40fa-ad81-ec724ac9a890","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:f344adbf75104e22f35e66f5ab175bd4eb85951f3f19276689d2834353209219","observation_id":"765045bf-6e38-4193-aba7-e9eb7353fa92","resolution":{"observed_at":"2026-05-26T07:06:53.182769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-02T14:38:26.145151Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2504.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-07-04T21:10:09.697793Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":"68c0143f-c4c7-49b9-8128-0d821f39406e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d422281d0ced652fb7d639550706cbfa1c2b9ac587cccb3b1004acc103d1926a","observation_id":"9aa3b2cc-8c15-4372-9f55-8689061fc327","resolution":{"observed_at":"2026-05-11T17:21:09.728834Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-07-11T01:07:45.150925Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d11d37d1c15d39e0ad7bf0caadb370d1dd579a43c521196f8a839bc5f414e09a","observation_id":"89687e5c-e8b8-42a1-8b3c-2d45f07fbade","resolution":{"observed_at":"2026-05-11T17:21:09.707923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"6f95d6d1-6874-4e47-a6bf-64124ee6f2ab","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:190fca6d50f2ad5d96855e7b06c309bac22d3cc15b22e11bd30399864204dc7c","observation_id":"53dc44fc-2817-47c4-916e-0b8d34d8d2cf","resolution":{"observed_at":"2026-05-26T07:06:53.155857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":"2404.15275","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-07-04T21:10:09.688336Z","title":"Id- animator: Zero-shot identity-preserving human video gener- ation","venue":null,"work_id":"e92e42cf-1216-4226-a583-07ff26a3de66","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:4085621c49851a3ec38824fedaa23be2063b61a523d969287839319d0e010e92","observation_id":"23dd55bd-314d-43b2-923d-38a59b2215ec","resolution":{"observed_at":"2026-05-11T17:21:09.676043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"6d rotation representation for uncon- strained head pose estimation","venue":null,"work_id":"859a74a3-3f9f-482d-8f48-fbb4d01a2ce1","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:5fce90d4445b6808d60c473450f8208a270aba47b79a925cae0a4233b2857158","observation_id":"78fb6144-415d-43df-a3da-cfc963b8d37f","resolution":{"observed_at":"2026-05-26T07:06:53.144253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":"2ba675ee-312c-4a36-9834-714070f30cd6","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:9360803ea3a22c57c419e80615f963b0cfef715ea130658c18a3f37d12c7f5cb","observation_id":"a760f99b-8358-4587-8a4b-326603b8f39d","resolution":{"observed_at":"2026-05-26T07:06:53.167192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:47:03.857862Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30","venue":null,"work_id":"32c02792-a0f3-4b5e-8609-8e836c289269","year":2017},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:fc6519f5cfa6f8587e7505bf144251b27b3e2ae1aa5e9b6a0c8377a504c0011d","observation_id":"185970f0-0c96-4a4f-b18a-b8c343a60b69","resolution":{"observed_at":"2026-05-26T07:06:53.152107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:37:16.225324Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"82ba805b-3e59-43c6-b37f-3aa1940eea68","year":2020},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:c16f0696b061f0282b876988e451ae6c2ffa0243935dcfa9c71697b74fafc58c","observation_id":"1174907c-e48a-453d-b847-7ebbf1416952","resolution":{"observed_at":"2026-05-26T07:06:53.128168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"b18966d5-e223-4cc2-bda2-d0fc9781132d","year":2022},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:1dca722377fe1f8320bf8ab1092f8eba56aa9d54b012f90e122ddc23f1a379aa","observation_id":"949b0a25-5458-46b0-81bc-e7348ddb142a","resolution":{"observed_at":"2026-05-26T07:06:53.170525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-07-06T21:20:22.224369Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":"2505.04512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-07-04T21:10:09.669744Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation","venue":null,"work_id":"206c3d53-d8c1-441e-a421-19e52b8080c4","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:8a45424cf75760b4efa701d4cf94980c060e48e6ccb6550e0e4292211fec9794","observation_id":"f3ac5160-9ad1-4dfb-b028-b606168c8028","resolution":{"observed_at":"2026-05-11T17:21:09.751609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curricularface: adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":"c293c981-5374-4e51-8e47-af3b98c78ebb","year":2020},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:5ffac8a5495f56e9b609c0db44478c53c3a33266f48a370546722ec09f0b3058","observation_id":"dee4ee4f-e39e-4ab2-954a-8a953b8cc97f","resolution":{"observed_at":"2026-05-26T07:06:53.163170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Insightface.https://github.com/deepinsight/insightface","venue":null,"work_id":"3dcb0dc0-8527-4b9e-a336-b05cbfbf007b","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:a9214e92af7ab1a8c811d36b879b11818680ec07d621b9cee0757cd9a16bbb65","observation_id":"eb0ddb3c-429f-4d93-8591-dfea890d962d","resolution":{"observed_at":"2026-05-26T07:06:53.173918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:64cbb86776572ee72df99a0e657a6502b5806ff6eef9ec9780e8526547d04fce","observation_id":"81bbf863-0aa4-4dcd-acf8-90681eed9b22","resolution":{"observed_at":"2026-05-16T00:53:54.408026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling.https://klingai.com/","venue":null,"work_id":"b4e49b8b-1a00-4386-94de-341e83a3c4fd","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:ca2fe5b03ee9c403ac148dbb596fe72bf9400e0e32881cd4bd71f79e39285f02","observation_id":"00adccf1-65e8-48f9-8c2c-3d304857a1f7","resolution":{"observed_at":"2026-05-26T07:06:53.159374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:5a87802189a341a39e67cba0b6485ed96bd9d07b93315ba3b263577b9b12b5b7","observation_id":"8d1ee74c-6026-4059-8a81-a85a433d5112","resolution":{"observed_at":"2026-05-11T17:21:09.737135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T04:34:31.638937Z","title":"Flow matching for generative modeling","venue":null,"work_id":"389643c2-1b27-48ab-b13f-9a3d35873834","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:6091bc65b3ac2df22a2e9dc1744be484c6a8981518e200c9878e36404f9eb90f","observation_id":"6c7f579e-0bbc-4ec1-8a61-9a6fa2086a3e","resolution":{"observed_at":"2026-05-26T07:06:53.123617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-07-06T20:37:18.647879Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":"2502.11079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-07-04T03:19:30.378145Z","title":"Fuchen Long, Zhaofan Qiu, Ting Yao, and Tao Mei","venue":null,"work_id":"1891d2ef-583f-4198-adb8-2659c05eb052","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:e1a3dd797af4133392096bf35ff70d14dcc20ea2dde2a1c9289b04b8476e667c","observation_id":"9c0c0c03-b5a1-479c-bb2b-3fd35485b6c0","resolution":{"observed_at":"2026-05-11T17:21:09.635204Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"6323655c-be92-4672-92e5-18c08ef7cebf","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:9e0011cedddef4a61bf1e4805425c6075e088b73fcb528543c2a7bc1b12c15b9","observation_id":"c9bd44f1-6758-4995-8d30-07ba4dbc572c","resolution":{"observed_at":"2026-05-26T07:06:53.132760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using t-sne.Journal of machine learning research, 9(Nov):2579–2605","venue":null,"work_id":"b6fa0f3a-1eef-43fe-af8d-9bcb7d545529","year":2008},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:1e7c6b1a8f7a1cf09d093624a712e8dbc82ef3817d10cd99efa03fb7bd1c5367","observation_id":"9db3c201-110a-4800-b6ef-2562b936f3ca","resolution":{"observed_at":"2026-05-26T07:06:53.136470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:8fc28edbaeccc40d107914691f7ea357dec896e1cfe7809a4c29a4e5eaf5b6e6","observation_id":"135d11dd-a2ca-40cd-9171-558284697ba2","resolution":{"observed_at":"2026-05-11T17:21:09.690058Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:27:53.186413Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"0c67bec8-6388-449f-9600-64c8ea9bc79f","year":2023},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:22653b49ce5937fda9638d27a3a7ed55a5aacb8d5178ab18b47dfceafeef0578","observation_id":"065ebace-007b-444b-af15-469cdc579a30","resolution":{"observed_at":"2026-05-26T07:06:53.115146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika.https://pika.art/","venue":null,"work_id":"5c43d9d3-3d28-4db3-8d21-328fcc72ac3e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d7a0798d6d9d066891f6951c0d2c29adf4dc932f2cda4451e319f174639dffc7","observation_id":"f45dc90b-e883-4e82-b0e7-10a4ec53a60e","resolution":{"observed_at":"2026-05-26T07:06:53.110867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-07-10T13:47:05.847810Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:1ba8f6cd7f412f4d73abb559592849c5ac5ae014474bc5a69e93e76aab69b058","observation_id":"c7f5d3f9-bded-4ad0-90ae-ba2c57433cb3","resolution":{"observed_at":"2026-05-11T17:21:09.619551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:16:04.687562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"ad3e05b3-af3a-4fa2-ab30-c45f9f403277","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:478d5e67f137543d21eba968cc77d9ae7977e25732eaa97ed52d9b62381dc30c","observation_id":"d79c68df-9488-4afe-aaf8-e04ec233c114","resolution":{"observed_at":"2026-05-26T07:06:53.140501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.855747Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":"53bea94a-9a2e-4bd5-8f7c-d6551201a3ad","year":2021},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:39e8438516c2f4063ad6378c600b76bbf04b6c4e7c012ee8eaeaf4981b5df61e","observation_id":"0988ecdd-0060-4cb8-89ea-0f04cc09243c","resolution":{"observed_at":"2026-05-26T07:06:53.095788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.273951Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"6b8f31f9-c772-4a80-96d6-8c7aaa28f2b5","year":2016},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:265f3ac962b7cb9ae11c2db229e42de6c98a1c0ab4567ac9ecaf4be312c1e22c","observation_id":"38ded714-c060-4fb4-a9f9-8e15186aa872","resolution":{"observed_at":"2026-05-26T07:06:53.148227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.961552Z","title":"Neural discrete representation learning.Advances in neural information processing systems, 30","venue":null,"work_id":"fc5f624c-48dd-4025-98ca-bbad7482fd3d","year":2017},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:f8caa7dd8011ea047c4eed2db97c4c14da0d31210ee764816729e6142369d670","observation_id":"e8579b8a-6008-47d1-b459-b2d60391b7f3","resolution":{"observed_at":"2026-05-26T07:06:53.119592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidu.https://www.vidu.com","venue":null,"work_id":"ba00ad5d-af15-469e-b779-5bc56a32ccbc","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:be860f3026fb7dd5c5b33409229cf3e6f5b9ef1a546a71f4a02dfb4e0b405b89","observation_id":"9adaa16d-fa54-4699-a679-006886495c34","resolution":{"observed_at":"2026-05-26T07:06:53.091555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d3fccb3d9e21648fe372229f1b3538132767ca5d65b74ce2d9183879876f65d4","observation_id":"0ff9871a-32ed-497c-941a-65bae6ace92f","resolution":{"observed_at":"2026-05-11T17:21:09.667511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stand-in: A lightweight and plug-and-play identity control for video generation","venue":null,"work_id":"870690ae-30e9-4e9d-bbb3-c99a0f330c38","year":2026},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:e65c7f65fc4c9cc87de473249a9907cf0fcc51ac552a749f3e566ea094dc4d90","observation_id":"40e450a7-bab1-4f51-a7a3-62b50a7b3581","resolution":{"observed_at":"2026-05-26T07:06:53.103746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"8b8f343e-c3eb-470a-99e5-31ba7d9fc72b","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:0d865e9e35b9387a536cf48b4acd15b277f50f94483e41329fa803a50b382484","observation_id":"cedfcbf5-35a9-4b93-9e4f-384488db6e0f","resolution":{"observed_at":"2026-05-26T07:06:53.088139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Identity-preserving text-to-video generation by frequency decomposition","venue":null,"work_id":"ab627a04-a30f-4d08-8b99-e644cd00fe9e","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:1f81a83e9355cb9ef0489cccceac09be6e4e7274ed43b7ca1e1b230a39d4da53","observation_id":"f5708b11-20df-489b-96b3-ba05f5c48c0b","resolution":{"observed_at":"2026-05-26T07:06:53.099734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03931","doi":"10.48550/arxiv.2501.03931","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Magic mirror: Id-preserved video generation in video diffusion transformers","venue":null,"work_id":"5bd233f7-ea9b-4049-9470-b73f605dbd64","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:b4ad664b1a82eebf5e883fb509f218f2ad2c12a6fa1a29e0d94f144f61934772","observation_id":"627ff383-d7dd-467b-834c-f723f9f7223f","resolution":{"observed_at":"2026-05-11T17:21:09.611345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13995","last_updated":"2025-02-19T06:50:27Z","snapshot_observed_at":"2026-07-06T20:39:24.018489Z","submitted_at":"2025-02-19T06:50:27Z","title":"FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation","version":1},"cited_work":{"arxiv_id":"2502.13995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.13995","snapshot_observed_at":"2026-07-03T08:17:45.953172Z","title":"Fantasyid: Face knowledge enhanced id-preserving video generation","venue":null,"work_id":"bbc145ce-4b5c-43fb-9577-0ad2cd487a72","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2502.13995","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:df7bf29c66b6931a073978ef7800fdc4e9fe2a051a6f70586be962f003a41b2b","observation_id":"9867d69f-0d4c-48c3-916c-b76dbe9897dc","resolution":{"observed_at":"2026-05-11T17:21:09.650401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14151","last_updated":"2025-07-02T11:55:35Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T11:17:32Z","title":"Concat-ID: Towards Universal Identity-Preserving Video Synthesis","version":3},"cited_work":{"arxiv_id":"2503.14151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14151","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Concat-id: Towards universal identity-preserving video synthesis","venue":null,"work_id":"29be33ec-795b-4a87-bffc-dfc03f14abe8","year":2025},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"cited_paper":"/paper/2503.14151","citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:9c5c0c573a79bd6fe54cea3c725666b314b0393e6be3c9bb312c52c19e45e76b","observation_id":"0d578b82-3343-4763-8d87-b3e2c458e3d6","resolution":{"observed_at":"2026-05-11T17:21:09.700191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"open grassy field","venue":null,"work_id":"ec54c983-74d0-44ee-a49d-6cd88b506125","year":2048},"citing_paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T17:40:00.224358Z"},"links":{"citing_paper":"/paper/2605.04702"},"observation_digest":"sha256:d03bef042e878dd4abe63e35095e44275ac528e5d626ca3436db88155c1eaf1a","observation_id":"be746d51-9e02-444f-bcdb-d632cd000b4d","resolution":{"observed_at":"2026-05-26T07:06:53.107366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04702","last_updated":"2026-05-06T09:54:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T09:54:09Z","title":"FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":26},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2605.04702."}