{"as_of":"2026-08-07T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76731bb807a4c959932d99a4798ef50fea2d2c26cf94f03cac6ed0680492f814","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:25:29.212390Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T16:19:51.348169Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:28:38.518422Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"cited_work":{"arxiv_id":"2507.02857","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02857","snapshot_observed_at":"2026-07-03T16:28:38.518422Z","title":"arXiv preprint arXiv:2507.02857 (2025)","venue":null,"work_id":"8a6710d7-b3be-4460-94ed-ce786d78ee87","year":2025},"citing_paper":{"arxiv_id":"2607.01869","last_updated":"2026-07-02T08:25:38Z","snapshot_observed_at":"2026-07-07T00:07:23.664493Z","submitted_at":"2026-07-02T08:25:38Z","title":"QWERTY: Training-Free Motion Control via Query-Warped Video Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T16:19:51.348169Z"},"links":{"cited_paper":"/paper/2507.02857","citing_paper":"/paper/2607.01869"},"observation_digest":"sha256:b5fa366ab6d3d88974ec32d3bf6b7f42dfc211a9a29dce3740b7cc9c8eb23a65","observation_id":"bd2c33f3-ad0b-4654-8b84-00132bccf2f5","resolution":{"observed_at":"2026-07-03T16:28:38.520077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02857/citation-record","integrity":"/paper/2507.02857/integrity","json":"/paper/2507.02857/citation-record.json","paper":"/paper/2507.02857"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T20:25:24.234995Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.234995Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:859f5d549cebf2499357432e19e13b80c8919bc6232f653836662203ed12a1c1","observation_id":"1fed75c3-b20c-4f6b-96ac-78b1a717cd86","resolution":{"observed_at":"2026-08-06T20:25:24.234995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.389702Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"58370bea-a0a5-4ad6-b507-b0976226df30","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.323877Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:eb9d5728f1d6f0ba24169114ef95c0a508f1baa1ef3ff36b6719bafce231e60a","observation_id":"88234fc6-27ef-4f33-83cd-dc35b5f64f2a","resolution":{"observed_at":"2026-08-06T20:25:34.460141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.263832Z","title":"A unified 3d human motion synthesis model via conditional variational auto-encoder","venue":null,"work_id":"489748d0-88c7-4506-ae0b-02eb7a7f904b","year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.413431Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:c8eddb1259d44098a19d2e9e95c4c2af3865f14aff66add6de791c0fcc7496be","observation_id":"efdf9c10-8737-47a9-a29a-4edda0d43b45","resolution":{"observed_at":"2026-08-06T20:25:34.328860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-08-06T20:25:24.503120Z","title":"Videocrafter1: Open diffusion models for high-quality video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.503120Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:42744b50929ef41207d0b78516903cef0cdec95c2bdcaa6a4a79abe695c3685f","observation_id":"47fb6f8e-8c13-427a-8c2c-c82e2e41c664","resolution":{"observed_at":"2026-08-06T20:25:24.503120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:34.058888Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"bd0b32a6-4181-4eaa-bbe1-2aeac59923bf","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.594083Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a26098bcb9ee4d0f2bd59526a5fc62c810defc8828c7e40766722e4ff0e221b9","observation_id":"537051c3-c895-478e-8dab-e699d1e73474","resolution":{"observed_at":"2026-08-06T20:25:34.189521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.935427Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"fae34b24-b373-41fd-ba28-249bc5a88e84","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.679423Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:6f019558e253d54309106d8255fc0ab8afb3ec7359e8c1c02ab3b84f64da73b7","observation_id":"78f7342e-fe75-436f-8721-6dfd29aad377","resolution":{"observed_at":"2026-08-06T20:25:33.997665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T20:25:24.769350Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.769350Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:21bc326bef5ce0545f2bffe70e9726bb38e303c21fb698c4cc3233a056bbbf65","observation_id":"8991ac9c-0e5e-49cd-86b0-9fe1b6ca30f8","resolution":{"observed_at":"2026-08-06T20:25:24.769350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.783019Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"6b23d0b7-7b96-47cb-902f-af33664660a1","year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.884766Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a35d462ec13a4e8ce5387adf0fdcdc78a067354dc13a451c3827e07ccd402e8c","observation_id":"35b70089-05a0-4fa1-8c2b-22c36faedc0e","resolution":{"observed_at":"2026-08-06T20:25:33.854495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-06T20:25:24.979478Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:24.979478Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:623d6f76683d5bf11064525aadc42107d568bfbd0e6ceec608d6307e6cfa48b2","observation_id":"84520573-1143-4c07-b930-d1d95e56baa1","resolution":{"observed_at":"2026-08-06T20:25:24.979478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-07-06T14:22:24.004857Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-06T20:25:25.057827Z","title":"Latent video diffusion models for high-fidelity long video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.057827Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:4b41cc340775d6322c4b892211e09ecf7bd39055c61b6859148536d081e34ba3","observation_id":"00467e71-d160-4147-9adc-40188cf446b9","resolution":{"observed_at":"2026-08-06T20:25:25.057827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-06T20:25:25.140993Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.140993Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:42a16b745b3b511222bb3150b12917a13964dcf752fc7c79ce3b4ae63224c992","observation_id":"c424eb1b-8aa8-43b4-960f-411cbbdaba4e","resolution":{"observed_at":"2026-08-06T20:25:25.140993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.576045Z","title":"Video diffusion models","venue":null,"work_id":"01dd119e-e68b-4d56-a63f-1224bb4eae3d","year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.240688Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:dc8e2b1918c85430f00d64a75edfe39a5a0a168885e95d44297dab73020eae21","observation_id":"4a3287ac-ad55-4777-a748-4f898526342c","resolution":{"observed_at":"2026-08-06T20:25:33.684728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T20:25:25.318105Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.318105Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:755144acc316f88a11593319ee2c1aa62af1764bbae87e2ac0487d058641b7ee","observation_id":"c3b78684-d66f-476e-bafb-695ab7fa9ace","resolution":{"observed_at":"2026-08-06T20:25:25.318105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.433835Z","title":"Cocktail: Mixing multi-modality control for text-conditional image generation","venue":null,"work_id":"01c3fb8a-e709-4694-b081-a707abeeb34b","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.380684Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:bf75230a15b84811f154df7a3daf677c0422d62e830662e6dd5c2184745b6e21","observation_id":"9fddd0ee-b922-46d1-9b73-51842255c65b","resolution":{"observed_at":"2026-08-06T20:25:33.505365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-07-06T15:58:43.241452Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-08-06T20:25:25.466570Z","title":"Videocontrolnet: A motion-guided video-to-video translation framework by using diffusion model with controlnet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.466570Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:77d03fc7ead8fef5a91bdfa4b8530e9b0ce83b961075565637e455058734bd78","observation_id":"475fe6c3-411c-4d7c-be8a-a8000066e717","resolution":{"observed_at":"2026-08-06T20:25:25.466570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.322605Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"0064b5e0-cd22-4605-9565-0b29ed710569","year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.558706Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:d0ede10476657fee81603ef2e510d0ad85c351945987b44bdcded1040bfbc26e","observation_id":"bc66d003-8b0c-4769-bb91-666dc3eb6548","resolution":{"observed_at":"2026-08-06T20:25:33.367870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:33.152008Z","title":"Cotracker: It is better to track together","venue":null,"work_id":"08b20110-ff09-4ca2-ba8b-6dc24523027b","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.679527Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:3d4a566595f5e688525ce2c14b73878ff9f43524c4b9fb25fdcae62aadc8c22f","observation_id":"d19d4810-6fc5-4c9f-a904-61b8c942574f","resolution":{"observed_at":"2026-08-06T20:25:33.236726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:25.815397Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.815397Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:5c9916ad6d90f737adfaf3308b42c3aa09e63c667af71511809d1f8e4c02cad5","observation_id":"79574eae-be01-4584-ad52-ea507b4c5876","resolution":{"observed_at":"2026-08-06T20:25:25.815397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15194","last_updated":"2025-08-26T04:40:29Z","snapshot_observed_at":"2026-07-06T15:32:35.999476Z","submitted_at":"2023-05-24T14:31:20Z","title":"DiffBlender: Composable and Versatile Multimodal Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15194","snapshot_observed_at":"2026-08-06T20:25:25.914025Z","title":"Diffblender: Scalable and composable multimodal text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:25.914025Z"},"links":{"cited_paper":"/paper/2305.15194","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:81bbafadb198c96bf277854d9db8f6b1ed205d2479ff614b351eeabb172dd002","observation_id":"b8490783-78ba-40ff-bd46-73591113df79","resolution":{"observed_at":"2026-08-06T20:25:25.914025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09048","last_updated":"2024-01-17T08:30:47Z","snapshot_observed_at":"2026-08-06T18:16:18.072404Z","submitted_at":"2024-01-17T08:30:47Z","title":"Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis","version":1},"cited_work":{"arxiv_id":"2401.09048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09048","snapshot_observed_at":"2026-08-06T20:25:29.799831Z","title":"Compose and Conquer: Diffusion-Based 3D Depth Aware Composable Image Synthesis","venue":"cs.CV","work_id":"b7cbf160-ce5b-488c-97df-afdb2f600c25","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.042201Z"},"links":{"cited_paper":"/paper/2401.09048","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:237048e06b0848a5c7c657a1fd8777b56b77b8c35fe25380979d3c4b1c5b4fbc","observation_id":"f0a79e52-683e-471f-834b-a8b00b4bf615","resolution":{"observed_at":"2026-08-06T20:25:29.851895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15339","last_updated":"2024-06-21T17:55:05Z","snapshot_observed_at":"2026-07-06T18:35:00.245966Z","submitted_at":"2024-06-21T17:55:05Z","title":"Image Conductor: Precision Control for Interactive Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15339","snapshot_observed_at":"2026-08-06T20:25:26.170396Z","title":"Image conductor: Precision control for interactive video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.170396Z"},"links":{"cited_paper":"/paper/2406.15339","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:9284c2c06b41dfbacbd7c39a1e908c1198fea2d6bc0da0b36e3bbd044587d52f","observation_id":"d3b52798-77ba-4689-a296-1a3266b80d7b","resolution":{"observed_at":"2026-08-06T20:25:26.170396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09711","last_updated":"2024-05-28T07:04:03Z","snapshot_observed_at":"2026-08-03T07:06:32.760790Z","submitted_at":"2023-10-15T02:39:25Z","title":"LOVECon: Text-driven Training-Free Long Video Editing with ControlNet","version":3},"cited_work":{"arxiv_id":"2310.09711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09711","snapshot_observed_at":"2026-08-06T20:25:29.661242Z","title":"LOVECon: Text-driven Training-Free Long Video Editing with ControlNet","venue":"cs.CV","work_id":"c79779fb-1e14-49e0-b756-ebe47dbc3c72","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.239158Z"},"links":{"cited_paper":"/paper/2310.09711","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:3cc133421a795d54acaf4f2271003b93a5757be9c62317124d586215ee682584","observation_id":"5feeba51-a878-426d-afe4-e1017b07d665","resolution":{"observed_at":"2026-08-06T20:25:29.716487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.955112Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":"74df7234-5695-4cf9-9a69-ad49ce885975","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.320914Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:419f924c29cf535b070520f5238573bead26be45d7992e7e73ea107587d7561f","observation_id":"00524d34-72b6-4ca3-a573-6b5d1407a5dc","resolution":{"observed_at":"2026-08-06T20:25:33.012633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.801683Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"313f36a4-baf6-4cb2-b28e-54e828db8ba3","year":1967},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.403459Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e4c64a4416610cd24317da0a52124e638f9b06b21720f3cac76d7a0569dbeb19","observation_id":"e796bd06-2fb9-498a-8b85-e3ccb432bbb7","resolution":{"observed_at":"2026-08-06T20:25:32.881148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.655576Z","title":"Large-scale video panoptic segmentation in the wild: A benchmark","venue":null,"work_id":"68bd689b-4e55-42fb-860d-6072edc16025","year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.474151Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:272ae5d2173a2278a810c843a41ece08d6a1187800900f97913ff47f3d7c636b","observation_id":"661d2f45-91d9-4fc7-9bda-a2cced54d8c5","resolution":{"observed_at":"2026-08-06T20:25:32.735514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.501136Z","title":"Freecontrol: Training-free spatial control of any text-to-image diffusion model with any condition","venue":null,"work_id":"d3ceed85-f15a-4bac-af75-06735e089ee8","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.553258Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e97d0c75d88183225dd3651ffe68b70826e9290eea03d44950c67edbb6f76083","observation_id":"d73ee21d-b3cd-43af-97c1-0bea7ea1e6ca","resolution":{"observed_at":"2026-08-06T20:25:32.562331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04989","last_updated":"2025-02-25T17:27:47Z","snapshot_observed_at":"2026-08-04T03:59:52.003288Z","submitted_at":"2024-11-07T18:56:11Z","title":"SG-I2V: Self-Guided Trajectory Control in Image-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04989","snapshot_observed_at":"2026-08-06T20:25:26.611739Z","title":"Sg-i2v: Self-guided trajectory control in image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.611739Z"},"links":{"cited_paper":"/paper/2411.04989","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:05029f0ba497a47849998e91b684f081ca698e49abce2c2fd637161a47333c77","observation_id":"8526d6aa-bf06-4f6b-85a0-d2c9887d5ca2","resolution":{"observed_at":"2026-08-06T20:25:26.611739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.337371Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":"673bc3ad-2c8d-4e1a-bb5f-d9c08f44e178","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.685839Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e6d3d5cf72bf1f367071afe7e46eb8479d8ca5f83b712b0b8a9346887b4247ff","observation_id":"0afba912-7f85-4603-bfd0-d1ec67db126d","resolution":{"observed_at":"2026-08-06T20:25:32.433431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.165082Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":"27051190-7f40-4d6d-b10e-0c30de66f607","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.760190Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a18dce2b2ae507ef9f6c3b4018be81c76073b623d2454aac6a2a4d63601ba6fb","observation_id":"92e86803-561b-43a2-b383-9cdfb26ad7d8","resolution":{"observed_at":"2026-08-06T20:25:32.218979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11147","last_updated":"2023-11-02T17:59:06Z","snapshot_observed_at":"2026-08-06T14:12:33.767391Z","submitted_at":"2023-05-18T17:41:34Z","title":"UniControl: A Unified Diffusion Model for Controllable Visual Generation In the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11147","snapshot_observed_at":"2026-08-06T20:25:26.818684Z","title":"Unicontrol: A unified diffusion model for controllable visual generation in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.818684Z"},"links":{"cited_paper":"/paper/2305.11147","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:3935c4bba580530b54cc8e384493a5b99a462b33b3c37fc32e9abb956ae099dc","observation_id":"38b44cb9-bcc3-40a5-8436-4c7176e5d212","resolution":{"observed_at":"2026-08-06T20:25:26.818684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16863","last_updated":"2024-06-24T17:59:56Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:59:56Z","title":"FreeTraj: Tuning-Free Trajectory Control in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16863","snapshot_observed_at":"2026-08-06T20:25:26.881733Z","title":"Freetraj: Tuning-free trajectory control in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.881733Z"},"links":{"cited_paper":"/paper/2406.16863","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:69b7dcfa80fd040fc94a9f8ebddf5b25a57b27ab5fae583042dde4e93158864b","observation_id":"42402254-5ab4-4997-be70-b199df2bf15c","resolution":{"observed_at":"2026-08-06T20:25:26.881733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:26.900124Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.900124Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a2c6716a268711a4363c2d83d55e51219eb3044de5e259ea6ba1c9bc0adb4d59","observation_id":"baed88d4-efb6-4686-a27d-15a66c5355a1","resolution":{"observed_at":"2026-08-06T20:25:26.900124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:32.030701Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":"5c003880-678d-4f14-853f-b2827d85f63c","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:26.970264Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:2a06d4ef6bc34110df6879ad3ba4cb8d33faac4864bea8fd7dbb17bf7edc5d18","observation_id":"fd175d70-34e2-448a-b6f4-b2577bf1b0ce","resolution":{"observed_at":"2026-08-06T20:25:32.068727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.910721Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":"9c3ab27b-dea0-4f61-b1eb-871ba6b940c6","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.078636Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:837f9c20fdf39090817720e01d653737a8d796a1ecd0253159fe36302063df40","observation_id":"15eb4f40-dd58-403c-b2c4-ed011779c61b","resolution":{"observed_at":"2026-08-06T20:25:31.963843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14555","last_updated":"2024-06-20T17:58:52Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:58:52Z","title":"A Survey of Multimodal-Guided Image Editing with Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14555","snapshot_observed_at":"2026-08-06T20:25:27.267209Z","title":"A survey of multimodal-guided image editing with text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.267209Z"},"links":{"cited_paper":"/paper/2406.14555","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:738f16e287d3c81c863b3d0ca890cd09289a971e5a515ad50f88147597d74890","observation_id":"40b743f7-bc70-444f-8b57-053c8fc6fc83","resolution":{"observed_at":"2026-08-06T20:25:27.267209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:27.408167Z","title":"Free-form motion control: A synthetic video generation dataset with controllable camera and object motions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.408167Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:1db7a747fb9460b0499ab4722e87caef9efd5c040ada3b806b212b2670a28d94","observation_id":"32df7593-0501-4d21-bc58-60be5e71da60","resolution":{"observed_at":"2026-08-06T20:25:27.408167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T20:25:27.446167Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.446167Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:ddb69becfc43aa3c0b0317cb566de26c35ae7a693943632ca70c2f5ad48b3c86","observation_id":"d3201c98-aac7-4366-8a95-f8f259a0d87d","resolution":{"observed_at":"2026-08-06T20:25:27.446167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T20:25:27.533479Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.533479Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e6b619ca19de6a8898928a5396fd05ccb065734c73b3dff013e5fb30b8bfdd48","observation_id":"b5292019-0b83-4721-be2b-ae7ff2d5fb28","resolution":{"observed_at":"2026-08-06T20:25:27.533479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.744382Z","title":"Anycontrol: create your artwork with versatile control on text-to-image generation","venue":null,"work_id":"86016459-f6dc-451d-9d97-ef77d06534aa","year":2025},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.623943Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:343a0e75f382a0a2bdd18c9e67be9d5aa59c69e9caf0dc1946995e5a2895d9fd","observation_id":"f6a8d720-8439-483d-a44e-83d33bed5481","resolution":{"observed_at":"2026-08-06T20:25:31.798937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.592617Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"dcd3f61e-1eb0-4ceb-a7e0-5f697b31e695","year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.774197Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e93cf52eb13cc62716a1e7166324041d3694ba7ac666354e384b7f96ea5883db","observation_id":"27c0b93b-146f-400e-91c5-0aa28818b3fd","resolution":{"observed_at":"2026-08-06T20:25:31.654118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T20:25:27.903864Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:27.903864Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:741a30f868e12bdf5b32ed21ad709cde0b8d3faf7df8211644ca09e606dc2893","observation_id":"d3771b2c-ec8f-4c5b-af71-83e19304621e","resolution":{"observed_at":"2026-08-06T20:25:27.903864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01566","last_updated":"2024-02-02T16:59:48Z","snapshot_observed_at":"2026-08-05T10:16:25.180895Z","submitted_at":"2024-02-02T16:59:48Z","title":"Boximator: Generating Rich and Controllable Motions for Video Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01566","snapshot_observed_at":"2026-08-06T20:25:28.032439Z","title":"Boximator: Generating rich and controllable motions for video synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.032439Z"},"links":{"cited_paper":"/paper/2402.01566","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:61ce229dc91a2adbcd87dc7650f6e4bf350806681a88b2e861619c4f77220b03","observation_id":"ef2b81e3-e487-4b92-a6da-fb15b3fc5765","resolution":{"observed_at":"2026-08-06T20:25:28.032439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.441870Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"c0dc1369-4202-43d4-9704-9c42c8a525cf","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.197918Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:e055d0cde582e7a142210da2ff65a30f987639dee77eaa05ee951a5900a80c6d","observation_id":"d856d6b6-8afc-4eee-a71d-a74b60ec6519","resolution":{"observed_at":"2026-08-06T20:25:31.526763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:31.069240Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"fd391ef8-614a-4c50-96a7-c37169892537","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.282240Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:1a19d84bd780fd227d0023c40f4556d6933239f480348ea8562c9b38424bd8fe","observation_id":"37898861-1e15-4fec-b544-e391ee84143d","resolution":{"observed_at":"2026-08-06T20:25:31.177524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07721","last_updated":"2025-06-24T17:19:15Z","snapshot_observed_at":"2026-07-06T20:04:48.422043Z","submitted_at":"2024-12-10T18:14:30Z","title":"ObjCtrl-2.5D: Training-free Object Control with Camera Poses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07721","snapshot_observed_at":"2026-08-06T20:25:28.341243Z","title":"Objctrl-2.5 d: Training-free object control with camera poses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.341243Z"},"links":{"cited_paper":"/paper/2412.07721","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:19e372443721a8afa5be21fcb4118b9ec335feec149e936f682a29d374e87aa5","observation_id":"c9840de4-56e8-4fd6-9acd-8ff050e23d5c","resolution":{"observed_at":"2026-08-06T20:25:28.341243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.799014Z","title":"Motionctrl: A unified and flexible motion controller for video generation","venue":null,"work_id":"ad8624fa-a3f3-4651-977f-894af90e9f3a","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.415133Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:75d5aa0fc4762c3bd62581f4e1b32cfc264c23f8bb29eff4ed7b6f5998f8e1ba","observation_id":"91b33beb-3f62-4ddb-969e-f0e49dd75f68","resolution":{"observed_at":"2026-08-06T20:25:30.904545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.519420Z","title":"Principal component analysis","venue":null,"work_id":"99e29fbd-3dc8-4cbe-991c-f2d404f16a01","year":1987},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.525885Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:797383d937a3d325187ce21bdc92eb7dd922cc6f008c14f87e95d146f1f94912","observation_id":"396d7879-b606-43e1-a74c-6cba50ac1ae1","resolution":{"observed_at":"2026-08-06T20:25:30.631228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17758","last_updated":"2024-10-29T11:56:27Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T17:42:25Z","title":"MotionBooth: Motion-Aware Customized Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17758","snapshot_observed_at":"2026-08-06T20:25:28.608683Z","title":"Motionbooth: Motion-aware customized text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.608683Z"},"links":{"cited_paper":"/paper/2406.17758","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a92202058af280f35432e53af875b96a0788e9a96def6008a34bbc0ce509c3d2","observation_id":"39f036ab-5588-464d-8392-59af76ab3bf2","resolution":{"observed_at":"2026-08-06T20:25:28.608683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.280878Z","title":"Draganything: Motion control for anything using entity representation","venue":null,"work_id":"b096c3db-cf06-4b2c-8971-a99616f4ff89","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.647601Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:509d248d045efa859da06a64f29325dc08cca762daee073d759766ef99a28332","observation_id":"15b79da1-3c97-477f-b11c-507de6af68ec","resolution":{"observed_at":"2026-08-06T20:25:30.383936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14864","last_updated":"2024-11-12T01:31:41Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:59:40Z","title":"Video Diffusion Models are Training-free Motion Interpreter and Controller","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14864","snapshot_observed_at":"2026-08-06T20:25:28.728755Z","title":"Video diffusion models are training-free motion interpreter and controller","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.728755Z"},"links":{"cited_paper":"/paper/2405.14864","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:063c73a3183032bb5362cd703d82987f56ac7989716a2410732249fd1d68cd62","observation_id":"d8787f87-8def-4463-8b24-f76278b73f0c","resolution":{"observed_at":"2026-08-06T20:25:28.728755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:28.790311Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.790311Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:a108444b8621b9d46bc648a687354fe5658bde7f302f7b5dc34018d76c68d1a9","observation_id":"4ab67a9c-61ea-49c4-a657-7d1bc1f651b0","resolution":{"observed_at":"2026-08-06T20:25:28.790311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:30.000642Z","title":"Direct-a-video: Customized video generation with user- directed camera movement and object motion","venue":null,"work_id":"988f66eb-32de-413c-909f-3a7fffbfb0b4","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.847157Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:3be4c19541f6ab2df6e72ae6832ecee5511b863009d6a11666b60120e07c98e7","observation_id":"ec32a8f0-e334-4054-882a-570f449f538f","resolution":{"observed_at":"2026-08-06T20:25:30.116321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-06T20:25:28.946126Z","title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.946126Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:87ce633a695cbf5cca8fba78536ce736b386af13dd79d506716de517d294824b","observation_id":"695822a8-cc50-409c-8cf6-d9736a99a273","resolution":{"observed_at":"2026-08-06T20:25:28.946126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:25:28.992068Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:28.992068Z"},"links":{"citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:c6f3e36f080aaebe32efec825d58860197d6fa94e5f6e0d81a89627a4e497d9b","observation_id":"5b748225-0f62-4468-8f00-57e762518ba8","resolution":{"observed_at":"2026-08-06T20:25:28.992068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-07T10:11:05.104768Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-06T20:25:29.057301Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.057301Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:63b13c85d860566bb0f5f6549274f60d30f677772892e3c0fdc0bbcfdf8f5dcd","observation_id":"1dc34cde-99a8-4f00-8daa-3face3f52316","resolution":{"observed_at":"2026-08-06T20:25:29.057301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-07-06T18:55:07.177656Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-06T20:25:29.127199Z","title":"Tora: Trajectory-oriented diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.127199Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:2fd842161c54faf2bf3a132beb55276e207d1d9dcd96c3c06b620e90ce5d4c06","observation_id":"1351d6ee-1961-4baa-95d3-85db563283d7","resolution":{"observed_at":"2026-08-06T20:25:29.127199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11475","last_updated":"2025-01-05T08:45:44Z","snapshot_observed_at":"2026-07-06T19:03:56.484389Z","submitted_at":"2024-08-21T09:42:04Z","title":"TrackGo: A Flexible and Efficient Method for Controllable Video Generation","version":3},"cited_work":{"arxiv_id":"2408.11475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.11475","snapshot_observed_at":"2026-08-06T20:25:29.329857Z","title":"TrackGo: A Flexible and Efficient Method for Controllable Video Generation","venue":"cs.CV","work_id":"e66c984b-afe4-41e9-ac6d-49a5696c0bc0","year":2024},"citing_paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:25:29.212390Z"},"links":{"cited_paper":"/paper/2408.11475","citing_paper":"/paper/2507.02857"},"observation_digest":"sha256:29c6fe50a1d0d63267b1b0b8c65c8a58a16ceaaeaa30ec9010a9a88b45969791","observation_id":"cdcdc99d-47e6-4ea1-8476-9548690d5220","resolution":{"observed_at":"2026-08-06T20:25:29.416173Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02857","last_updated":"2025-07-03T17:59:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:46:47.815022Z","submitted_at":"2025-07-03T17:59:02Z","title":"AnyI2V: Animating Any Conditional Image with Motion Control"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2507.02857."}