{"as_of":"2026-08-10T20:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32af83bcf6762c63e919bb08d50ca17c152cd17d83f92cb54fedacad5a88833e","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:24:53.085968Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20247/citation-record","integrity":"/paper/2607.20247/integrity","json":"/paper/2607.20247/citation-record.json","paper":"/paper/2607.20247"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-01T10:24:51.212845Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.212845Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:2b9e2a1b194cc12af2b2aebdf970f1397c27f0b61694d5ebea2a586237547e90","observation_id":"315dfcf2-70d0-4604-9e61-8e4115d760bb","resolution":{"observed_at":"2026-08-01T10:24:51.212845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-01T10:24:51.543552Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion.arXiv preprint arXiv:2208.01618,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.543552Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:7d891558e0dfe38a30c801ed6aba8773fd2fe2c4cbca9deadd7fb9435308843f","observation_id":"63f82126-28d8-43ee-9bfc-28b4245cae95","resolution":{"observed_at":"2026-08-01T10:24:51.543552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-01T10:24:51.968372Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.968372Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:d906511298fb0cc772909a97d291f5596459f60a2d777f971f48e0ad2cf81b43","observation_id":"249a2d8c-6110-4890-b45d-3afe48eeaa8d","resolution":{"observed_at":"2026-08-01T10:24:51.968372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:24:52.051573Z","title":"Personalvideo: High id-fidelity video customization without dynamic and semantic degradation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.051573Z"},"links":{"citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:fb62143124aea014bac9d1add66bbcf509bb25944ae97750988ac2bb01c0d3ee","observation_id":"bde8b202-a6ec-4b6a-8ec7-b043ad19c7b9","resolution":{"observed_at":"2026-08-01T10:24:52.051573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-01T10:24:52.205314Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.205314Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:cb6b71ead1b0eafec37c5ec80a0459cb0b389b7176f9c8661acb1ae1f0b08587","observation_id":"84560b64-d2f0-4069-97c8-7bc7e167534b","resolution":{"observed_at":"2026-08-01T10:24:52.205314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T10:24:52.309206Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.309206Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:7f96629caf2adb46c68653bd4b04e1cf2260ee782a5bc7d4c745db45530b0edc","observation_id":"11a89f03-c485-49f7-828d-bf5f5d10fc88","resolution":{"observed_at":"2026-08-01T10:24:52.309206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07519","last_updated":"2024-02-02T16:15:22Z","snapshot_observed_at":"2026-08-06T23:08:20.817133Z","submitted_at":"2024-01-15T07:50:18Z","title":"InstantID: Zero-shot Identity-Preserving Generation in Seconds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07519","snapshot_observed_at":"2026-08-01T10:24:52.494342Z","title":"Instantid: Zero-shot identity-preserving generation in seconds.arXiv preprint arXiv:2401.07519,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.494342Z"},"links":{"cited_paper":"/paper/2401.07519","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:735509eefccfa1d38bd5b03bbef0ca600be2819e3d4bb896714cf13523dbac0d","observation_id":"d29268ba-5950-404d-beb0-c2e763df1b49","resolution":{"observed_at":"2026-08-01T10:24:52.494342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:24:52.663258Z","title":"Stand-in: A lightweight and plug-and-play identity control for video generation.arXiv preprint arXiv:2508.07901,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.663258Z"},"links":{"citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:b2677b8429a789a59388d3e41c2c2be1a92900602d4ecd37e97eda1cf7be1b27","observation_id":"7876d346-5773-4c61-9a71-df24a10b6114","resolution":{"observed_at":"2026-08-01T10:24:52.663258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-01T10:24:52.778376Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.778376Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:6104adfeb33fb8f6d31a0aa4a0fe67cc1cf66a3b0fdd819f5e1ee9be9ce5f1c7","observation_id":"932d1348-844f-4a9b-a8c3-c84823b04011","resolution":{"observed_at":"2026-08-01T10:24:52.778376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-01T10:24:52.866755Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models.arXiv preprint arXiv:2308.06721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.866755Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:a9a591606dc386240dbe15d7925270bf66a9ff7c296e2577190483549cfa1359","observation_id":"1a6e65e1-f66b-4ac9-a6db-fd17b80e97c6","resolution":{"observed_at":"2026-08-01T10:24:52.866755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-07T13:53:16.552171Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-08-01T10:24:52.920746Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.920746Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:8fce44bdeb5170cb6779b0e105bfe471fc80f0038e3e196e071fcaa8f37f8587","observation_id":"276855ba-c617-4634-a6d8-21ed7da399bb","resolution":{"observed_at":"2026-08-01T10:24:52.920746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-01T10:24:52.977000Z","title":"Open-sora: Democratizing efficient video production for all.arXiv preprint arXiv:2412.20404,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.977000Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:c9e2c3a99f5aae059bcab47f2aa65aa6864a0fb17397314e779fc184239a439e","observation_id":"0166147c-abe2-4c68-9a4e-026c2359476a","resolution":{"observed_at":"2026-08-01T10:24:52.977000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:24:53.085968Z","title":"13 B Data Construction Pipeline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:53.085968Z"},"links":{"citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:59b2a0b4dd05597fdafa70285574cc9a7d17a18e135b8bc954e17cfd75244b19","observation_id":"d3384ebc-b5ce-4088-8fc5-d9a5d9f8304e","resolution":{"observed_at":"2026-08-01T10:24:53.085968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01125","last_updated":"2024-06-03T09:10:44Z","snapshot_observed_at":"2026-08-10T10:06:50.769308Z","submitted_at":"2024-06-03T09:10:44Z","title":"$\\Delta$-DiT: A Training-Free Acceleration Method Tailored for Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01125","snapshot_observed_at":"2026-08-01T10:24:51.295347Z","title":"∆-DiT: A training-free acceleration method tailored for diffusion transformers.arXiv preprint arXiv:2406.01125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.295347Z"},"links":{"cited_paper":"/paper/2406.01125","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:3030c225597eb78e3da0730bf38968fa7295a9a479401b940396cd4a35ba5005","observation_id":"cfb1cbda-66b6-474d-81eb-6237a10e5ba0","resolution":{"observed_at":"2026-08-01T10:24:51.295347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04698","last_updated":"2025-05-13T06:42:52Z","snapshot_observed_at":"2026-08-08T15:16:50.023350Z","submitted_at":"2025-01-08T18:59:01Z","title":"ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04698","snapshot_observed_at":"2026-08-01T10:24:51.877301Z","title":"Conceptmaster: Multi-concept video customization on diffusion transformer models without test-time tuning.arXiv preprint arXiv:2501.04698,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.877301Z"},"links":{"cited_paper":"/paper/2501.04698","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:884050c2859a26a7da4b1bc3327a2a783a340a63d2c6829bb210ee50a7db0558","observation_id":"bdb58df2-513b-4a68-b6e3-380c51764cea","resolution":{"observed_at":"2026-08-01T10:24:51.877301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:24:51.629545Z","title":"Wildactor: Unconstrained identity-preserving video generation.arXiv preprint arXiv:2603.00586,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.629545Z"},"links":{"citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:ccd9f4353fd94c01c54e9860981f5041be25f1fc91c9474c6957f1f036a412c1","observation_id":"ece63959-334f-4a90-b363-54727ed064ff","resolution":{"observed_at":"2026-08-01T10:24:51.629545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-01T10:24:52.113163Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:52.113163Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:4b57323ec1b974e31de0c5c5028b3a7a7ddbfe3efb92ba065d48de9446bec6c4","observation_id":"d590d70b-5d89-41fe-99fa-fffec5bdcd60","resolution":{"observed_at":"2026-08-01T10:24:52.113163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-10T20:05:48.970997Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-01T10:24:51.795042Z","title":"Id- animator: Zero-shot identity-preserving human video generation.arXiv preprint arXiv:2404.15275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.795042Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:c94c9838ea84cb4035f48b752ec87b4b2ff7bf0732b3ed1aa9483204462f8a3f","observation_id":"aeb7224b-b83a-4479-b6c3-5c87ee3dc7a0","resolution":{"observed_at":"2026-08-01T10:24:51.795042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-10T20:05:35.593944Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-01T10:24:51.437202Z","title":"Skyreels-a2: Compose anything in video diffusion transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.437202Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:85ba0401f019d125d9059b79deb608cab18e9a0be10c94f24615c4b55796f219","observation_id":"36060856-f20e-4f5f-8a43-15ad641130d3","resolution":{"observed_at":"2026-08-01T10:24:51.437202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-01T10:24:51.714101Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:51.714101Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2607.20247"},"observation_digest":"sha256:9a6a700ec0862d9f3fc29a4b8a8fdab7b636690c98c4f5f4c2c73b409cc5a54a","observation_id":"aa84978c-817e-496d-9cf0-e952a5d71f92","resolution":{"observed_at":"2026-08-01T10:24:51.714101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20247","last_updated":"2026-07-22T15:08:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:59:00.018749Z","submitted_at":"2026-07-22T15:08:30Z","title":"Vera: Identity-Faithful Human Subject-to-Video Generation"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.20247."}