{"as_of":"2026-08-07T18:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f768f2d8d594aebcf6d49b339ae9291546f331e8de741620cf4a5e2fbc61af3e","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:12.762375Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00334/citation-record","integrity":"/paper/2507.00334/integrity","json":"/paper/2507.00334/citation-record.json","paper":"/paper/2507.00334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.059967Z","title":"Fouhey, Ivan Laptev, Josef Sivic, Abhinav Gupta, and Alexei A","venue":null,"work_id":"1ab3fab5-9928-4860-985f-23e5d5d37c12","year":2012},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.687060Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:97892827855e43a6e8913f1a0ce934e8baf103220d38568c5e9e35c8ce320051","observation_id":"d2c00502-cd33-45ef-9bfe-2ffe5bd25e96","resolution":{"observed_at":"2026-08-06T21:23:13.063341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10474","last_updated":"2024-03-26T01:11:52Z","snapshot_observed_at":"2026-07-06T15:28:53.270447Z","submitted_at":"2023-05-17T17:59:16Z","title":"Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10474","snapshot_observed_at":"2026-08-06T21:23:12.697903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.697903Z"},"links":{"cited_paper":"/paper/2305.10474","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:e7962997bd050ae635196b63210e788c4eabc97d373a468ed5e6ed000a86003c","observation_id":"49c61981-868b-4297-82cc-18e96dff7a58","resolution":{"observed_at":"2026-08-06T21:23:12.697903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-07-06T20:33:43.357335Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-06T21:23:12.708601Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance.arXiv preprint arXiv:2502.06145,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.708601Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:e7f555820d3c84e8d283e7024870bfd013b389e337d5e22c4ed71d87ec96fcee","observation_id":"c25ede42-3767-4ac1-8629-05fa90181633","resolution":{"observed_at":"2026-08-06T21:23:12.708601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08333","last_updated":"2025-08-11T11:45:30Z","snapshot_observed_at":"2026-08-06T18:36:43.603092Z","submitted_at":"2025-01-14T18:59:59Z","title":"DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08333","snapshot_observed_at":"2026-08-06T21:23:12.712364Z","title":"David: Modeling dynamic affordance of 3d objects using pre-trained video diffusion models, 2025.https://arxiv.org/abs/2501.08333","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.712364Z"},"links":{"cited_paper":"/paper/2501.08333","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:16840f5d51bef86c3f91c0bea0769a0cd0eaf4fe0fd8e7efe078b61a2c182bf6","observation_id":"f64611c1-989b-4065-a6af-33dbb54fbe1c","resolution":{"observed_at":"2026-08-06T21:23:12.712364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T21:23:12.721211Z","title":"14 Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.721211Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:f139af2784a928ab3174c3bd47406bf935c7a39acdb4c7b961361f6f1dc00c57","observation_id":"62a50608-7b31-4e50-a1fd-98ee4c5747bd","resolution":{"observed_at":"2026-08-06T21:23:12.721211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14579","last_updated":"2024-09-26T16:25:33Z","snapshot_observed_at":"2026-07-06T17:07:02.626339Z","submitted_at":"2023-12-22T10:15:15Z","title":"Synthesizing Environment-Specific People in Photographs","version":2},"cited_work":{"arxiv_id":"2312.14579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.14579","snapshot_observed_at":"2026-08-06T21:23:12.937606Z","title":"Synthesizing Environment-Specific People in Photographs","venue":"cs.CV","work_id":"c2886246-ba37-4166-948c-ba5441297d5d","year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.728400Z"},"links":{"cited_paper":"/paper/2312.14579","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:4148d7cea6c30bd95b09d4e4627edda345bb60d4d3eb9080a673ec91f213e2ed","observation_id":"257b1446-f133-4fbe-9d3a-a6d3b4b6b768","resolution":{"observed_at":"2026-08-06T21:23:12.941665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T21:23:12.731808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.731808Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:6bc34ce72c595ad979f0f974d9f01f1200a374763aaa26c61806c53e574269a1","observation_id":"93484021-023b-4bf8-b5db-e9eec2f6ad75","resolution":{"observed_at":"2026-08-06T21:23:12.731808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-04T02:26:31.748049Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T21:23:12.735107Z","title":"Weiming Ren, Harry Yang, Ge Zhang, Cong Wei, Xinrun Du, Stephen Huang, and Wenhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.735107Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:cce13c6fc1715a9dee0072e4aa3f50d2ac517fbe6a0c4ff3ee9ef5949fd376b3","observation_id":"a2aed091-cead-4adc-91d6-3e620802ca67","resolution":{"observed_at":"2026-08-06T21:23:12.735107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10958","last_updated":"2024-07-15T17:55:09Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:55:09Z","title":"InVi: Object Insertion In Videos Using Off-the-Shelf Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10958","snapshot_observed_at":"2026-08-06T21:23:12.738455Z","title":"Nirat Saini, Navaneeth Bodla, Ashish Shrivastava, Avinash Ravichandran, Xiao Zhang, Abhinav Shrivastava, and Bharat Singh","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.738455Z"},"links":{"cited_paper":"/paper/2407.10958","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:53397cb290ca25cc53ae3498e92e40fd5186b47c640bfbfd5ea5233244a9f3f8","observation_id":"94434dd0-0ad6-458c-94ec-7aad763aed84","resolution":{"observed_at":"2026-08-06T21:23:12.738455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:12.741893Z","title":"Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, Devi Parikh, Sonal Gupta, and Yaniv Taigman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.741893Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:5d9786dbb33054d9bd61089d8a4040c2ab342336fa4a5095114e7faaea3dd14c","observation_id":"75d06842-c7b2-4987-8b31-20e8e90525cf","resolution":{"observed_at":"2026-08-06T21:23:12.741893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-07-06T13:08:41.837840Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-06T21:23:12.745181Z","title":"Tran, Xavier Garcia, Jason Wei, Xuezhi Wang, Hyung Won Chung, Siamak Shakeri, Dara Bahri, Tal Schuster, Huaixiu Steven Zheng, Denny Zhou, Neil Houlsby, and Donald Metzler","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.745181Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:d5187aea65ccd1d3716f58014f4f8e29faec78ea0a8053bd869bdfbbdb17183b","observation_id":"4d6b4ed2-1c92-4488-b1ec-a1dd95fee2c0","resolution":{"observed_at":"2026-08-06T21:23:12.745181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01430","last_updated":"2023-09-04T08:26:47Z","snapshot_observed_at":"2026-08-02T15:35:11.118369Z","submitted_at":"2023-09-04T08:26:47Z","title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01430","snapshot_observed_at":"2026-08-06T21:23:12.752065Z","title":"Dat++: Spatially dynamic vision transformer with deformable attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.752065Z"},"links":{"cited_paper":"/paper/2309.01430","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:c0c341138a603d27d500fc218f5ecc55741ab9db2211bc0465d71dfac3f41c27","observation_id":"0ab42c9e-6dae-4de6-bf30-21f072092da2","resolution":{"observed_at":"2026-08-06T21:23:12.752065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01502","last_updated":"2024-09-02T23:59:01Z","snapshot_observed_at":"2026-07-06T19:09:27.758765Z","submitted_at":"2024-09-02T23:59:01Z","title":"AMG: Avatar Motion Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2409.01502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01502","snapshot_observed_at":"2026-08-06T21:23:12.810405Z","title":"AMG: Avatar Motion Guided Video Generation","venue":"cs.CV","work_id":"30c201c4-dd1a-42d9-9159-ba0a36e740b9","year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.756044Z"},"links":{"cited_paper":"/paper/2409.01502","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:8b943b5cd47040680272b76e001df9ee7951acb7c4c9d8ed2d87971bd6849bab","observation_id":"9cea3e29-550c-4d6b-8a8e-b62f6ee3c1b6","resolution":{"observed_at":"2026-08-06T21:23:12.814830Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10982","last_updated":"2023-11-18T06:25:58Z","snapshot_observed_at":"2026-07-06T16:49:21.314063Z","submitted_at":"2023-11-18T06:25:58Z","title":"Make Pixels Dance: High-Dynamic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10982","snapshot_observed_at":"2026-08-06T21:23:12.759230Z","title":"Make pixels dance: High-dynamic video generation.arXiv:2311.10982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.759230Z"},"links":{"cited_paper":"/paper/2311.10982","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:bf7b7e5f74c3d09c06495aeaac1596fe28834b3b53ca9426a8364a04ea02ccab","observation_id":"afc3823d-ff8f-4963-a9ce-6039fa11997e","resolution":{"observed_at":"2026-08-06T21:23:12.759230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.050604Z","title":"Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, and Siyu Zhu","venue":null,"work_id":"e76ea08e-afd3-4d3c-9d0c-d384072642d5","year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.762375Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:7d7b84aaef9277201ff8ca5c26d915dd9898e573b1222d64815907128e0fd7c9","observation_id":"ceb6a3c0-c822-45b2-a3fc-e5bdec43865e","resolution":{"observed_at":"2026-08-06T21:23:13.054043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-06T21:23:12.716870Z","title":"Max Ku, Cong Wei, Weiming Ren, Harry Yang, and Wenhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.716870Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:308d2277c4a176f4fc1c3b6a40385a0c1db349e8ffe9262788f2393c59a205f9","observation_id":"e35b201a-a990-4add-a86a-7cc744d679ba","resolution":{"observed_at":"2026-08-06T21:23:12.716870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-06T21:23:12.701371Z","title":"Photorealistic video generation with diffusion models, 2023.https://arxiv.org/abs/2312.06662","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.701371Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:1c2d70d44222659f2ca94ac33db88e6a1fc9c9ab4feb2a903c9c7e997f284701","observation_id":"1909a206-97fe-472a-ac8f-167bc2ca06ff","resolution":{"observed_at":"2026-08-06T21:23:12.701371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:23:12.690412Z","title":"ISBN 978-3-642-33783-3","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.690412Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:67fe4810ad0f854c3c2515bbca204ddc717a4c00c49613a5f233e7d4abe012ac","observation_id":"620ed033-fd70-4614-88da-2ba92398777f","resolution":{"observed_at":"2026-08-06T21:23:12.690412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T21:23:12.748660Z","title":"Modelscope text-to-video technical report, 2023a.https://arxiv.org/abs/2308.06571","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.748660Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:fba6df5b7d644f3dd4c3e10553ebeb20b5212e1967e4853d1f83b067b2c5cab1","observation_id":"b7dd9eae-fa44-4463-9bda-7f23d84e4b93","resolution":{"observed_at":"2026-08-06T21:23:12.748660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-06T21:23:12.682484Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.682484Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:7377ec3d3200e46b2ba83197a13d99f66bf525a8dd51cdbc5c666db39deba9af","observation_id":"74a42b92-080c-404c-a25d-ed8b1516d290","resolution":{"observed_at":"2026-08-06T21:23:12.682484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:23:12.693914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.693914Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:7108ba35232cb180c58c5447727fbc165d6b0a22f33154a2e05530e1dda3f8af","observation_id":"980abd31-064a-4b46-bc7d-3dfcd4079937","resolution":{"observed_at":"2026-08-06T21:23:12.693914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-06T21:23:12.725035Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.725035Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:bf145892792b66544e83ac615b57d464ab21b4f484627745546ce1c05196a863","observation_id":"8d11e3cc-a032-4197-bf32-4e8ae0c94b9a","resolution":{"observed_at":"2026-08-06T21:23:12.725035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T21:23:12.705127Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.705127Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:663f8466be992d5660e500eda7bb57c18231b951f025cd63e97f893ced578b7a","observation_id":"3dbc78da-5f3a-41b8-b3be-4d77d77789c1","resolution":{"observed_at":"2026-08-06T21:23:12.705127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07507","last_updated":"2025-06-03T00:03:07Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:41:26Z","title":"Flow map matching with stochastic interpolants: A mathematical framework for consistency models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07507","snapshot_observed_at":"2026-08-06T21:23:12.674110Z","title":"Boffi, Michael S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.674110Z"},"links":{"cited_paper":"/paper/2406.07507","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:f9453e7a4287ea8c66671043323f92179fe05281dfe98b8fd0a21f9e445d506a","observation_id":"ffc8f9e7-cb9e-492a-af0e-0bccb47cd800","resolution":{"observed_at":"2026-08-06T21:23:12.674110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.069571Z","title":null,"venue":null,"work_id":"54a1c673-d310-42f7-affb-a99d6be0a915","year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.669420Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:8a43c6c4ed30a13b4d985fb6baf78a178628eb470ab1ee4e5c43083143058cba","observation_id":"38463b39-f0da-4dd0-bc6e-d479b6d341fd","resolution":{"observed_at":"2026-08-06T21:23:13.072739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715140.https://doi.org/10.1145/3715140","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:12.787109Z","title":"doi: 10.1145/3715140.https://doi.org/10.1145/3715140","venue":null,"work_id":"be16e1cd-5525-46c9-8c55-8ecdbee8b0b8","year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.678507Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:3f66e2d8e8c8b93cef7cd3bce006612e5762545106756b56a8c4427ac81b0402","observation_id":"c9db72b1-ff8b-4e03-9fa0-216c54c3cc74","resolution":{"observed_at":"2026-08-06T21:23:12.791955Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:16:02.755483Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2507.00334."}