{"as_of":"2026-08-09T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dc9a8335928497397aed75bccaf1b19f22360a81d96dbe36cbb946a65ffeeee","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:20:07.678576Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03732/citation-record","integrity":"/paper/2607.03732/integrity","json":"/paper/2607.03732/citation-record.json","paper":"/paper/2607.03732"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Recammaster: Camera-controlled generative rendering from a single video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:887c5a2de0be93a7f6da0d29c6c2054cc416da29ffa8c1ae678d7ec8bc0828c6","observation_id":"fd8b637b-8427-4448-a3a5-fb994b2897fe","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Syncammaster: Synchronizing multi-camera video generation from diverse viewpoints","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:fb84c69ff8471a876921b01f3da888cc785a826bca21d4148bc5224b4a9ea760","observation_id":"12a18ca6-f87f-495e-b428-69d7e10c5ab6","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:bd422bb748b80604053da89fe92e5d97b3d3cb671ab791b6fd12008ba3c11b3f","observation_id":"3a222a54-281a-455a-a8ee-a5af31ae5411","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:f2d522bf3779146f1f18954315629f8d8d591ad7935e6f5712283ccb2ccfad20","observation_id":"314f3c41-297f-45e7-9ef5-2d01f11ebd6a","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:f4a7eafe2db911227d9eb7f547c097ceaa6e2fd4457e9276accb60adafb07af6","observation_id":"378ae616-9050-4513-b137-a53892aff550","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Uni3c: Unifying precisely 3d-enhanced camera and human motion controls for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:fca1775fde8bdf6a50585d47df80998d067a28174ad1873b72efb211e1fe4128","observation_id":"1314f55f-35e2-4997-b33f-25846836c328","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Sam 3: Segment anything with concepts.arXiv preprint arXiv:2511.16719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:6d2b349e888b5c14d7d927cfa8aa741b9632d0bc628eb835bbdaaa03319f8fcc","observation_id":"86b37901-ddd1-404e-850c-60fe9a6b53c2","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:65527ef53732b699113c7d9e9f4129e4101c26fe71ca3fa3fe89862194104afa","observation_id":"3a66d623-d32a-479f-8875-603db3510795","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Everybody dance now","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:a7cfbe3c35244ae10063d137f8a7475d5bf284df3ed5cf2e3761671936ba2294","observation_id":"691f867b-2aa5-432a-9501-b1c5cc363246","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19512","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Videocrafter1: Open diffusion models for high-quality video generation.arXiv preprint arXiv:2310.19512, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2310.19512","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:a137d833cce3522fc4107f91170f7cc698023c235fe2722247b32a8890e1453b","observation_id":"b8824b7b-8171-458a-8764-21fe31dd8414","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Control-a-video: Controllable text-to-video diffusion models with motion prior and reward feedback learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:9ea34aec96f38b40d6172f193de9014ea2c1b506c4b106d0bbcd2c5378459959","observation_id":"b4e447db-5098-4f67-821a-ffa928fca6d2","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Contextflow: Training-free video object editing via adaptive context enrichment.arXiv preprint arXiv:2509.17818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:be0371ea022fa9b4ec0c74ae4b44b8786abc2dd95a7d15da185a02c602cc2e3b","observation_id":"15fd7550-3ea3-4a38-8bda-968f023dc361","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-07-06T16:30:00.114521Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing.arXiv preprint arXiv:2310.05922, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:58fd14e30d3059f97f379d0c9f55edd69c09e65a7ceaa39a1c4d5daae019aaf8","observation_id":"59356fea-8d70-42aa-a30c-0fb943475787","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:11ada941d351b120fbca1dbff503d7f7159b664fab8c86545b46ec7763857899","observation_id":"464394d9-9b16-46e8-b7c6-297ded0f160b","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Tokenflow: Consistent diffusion features for consistent video editing.arXiv preprint arXiv:2307.10373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:18eba50782a99786f1fc15c8fd89335c83c38cd8a71e5fb060fb931f7527e520","observation_id":"d7df88e3-87e2-49f3-9acd-347846e31961","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Videoswap: Customized video subject swapping with interactive semantic point correspondence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:f9d19edec411aa5cad74c795c959273e76ecec4556bbe3009fe02635f4599916","observation_id":"009a454b-fab9-4578-811b-8ece647c50c4","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:068785233a5d84c27a8cdbcf39f5b6401812f97340a13f97605185cc51cb3c27","observation_id":"01e272f7-979d-427f-8981-2d6a525d56b2","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Cameractrl: Enabling camera control for text-to-video generation.arXiv preprint arXiv:2404.02101, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:2580e49580077dfc00d786b1e7aa293fc05a69e46d072a466e21113c7ae6017e","observation_id":"d0d6d2f4-debb-451c-bc8c-c627a18071ff","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:e3b69cc0f9471b4e88a6671b169eef5afc72e4eec93b4936619b3fd692e7b484","observation_id":"c573e014-ed88-4851-8ca7-3d80c6809ece","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:14bd48c18b0bf7d14e2a632530b9570c451864ef0a97b81553a53f1e54544779","observation_id":"faad6ad0-45c9-492c-8323-5485359b3e68","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:616f1484a3d0105246ea8b703366b464e6ddd999718366d72241724ecf4c1da7","observation_id":"1476997a-31c7-4ae6-a894-3e8890208fdf","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:c9285ad1dd7649b4e5895f5764d0eba51f33a19f43d93aa2d030739c5922e998","observation_id":"cacdf6a5-9209-4cd9-b4e5-31b961b03388","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14073","last_updated":"2023-08-03T09:34:24Z","snapshot_observed_at":"2026-07-06T15:58:43.241452Z","submitted_at":"2023-07-26T09:50:44Z","title":"VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14073","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Videocontrolnet: A motion-guided video-to-video translation frame- work by using diffusion model with controlnet.arXiv preprint arXiv:2307.14073, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2307.14073","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:6e3dbe3e8b43602a6f6766f1241b47c62085d18a08bafc2be77e0bdfe2aa52b7","observation_id":"61537e8e-e366-47d9-9ff8-782f7e0629f1","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"VBench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:b22b86a31ad1520be5a92fc72ee9ed046f3b27349e6daeb5b4cbb5162a1a9414","observation_id":"3eaf7651-354b-438f-8ca7-ddb4f69a8e9f","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"VBench++: Comprehensive and versatile benchmark suite for video generative models.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:97895b9e1ac9e4b31e45f26ba7f5e04b7495c221d0386591089fc8e2c92c97e7","observation_id":"0fb3863f-197e-4a0a-b993-6be7eac19c40","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models.arXiv preprint arXiv:2309.14509, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:ab8833c912ba892dd231524f8bd6b9784ece141928239628640935fe193b092c","observation_id":"2682e5a1-23aa-405d-9b0d-28f7bca5023c","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Vace: All-in- one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:e14d293ccdc6a0cd35cbe7d82a4aada5b77e73cdea9e0e98ef1363016036cc57","observation_id":"da85769d-2e33-475d-a19e-54c7f173d08b","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Rave: Randomized noise shuffling for fast and consistent video editing with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:807bcbda2193bdeb9d039a54fd220128c90481e4f8f51affcf79a3ebf7e851ec","observation_id":"830300b6-6d4d-48d7-83bf-b061ee603aae","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Text2video-zero: Text-to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:f70e29de933c7d061de2e932ec2bc7badd5e1c8aeeaae834f768744b9b1580f6","observation_id":"3a7c597b-f6de-4ed6-9192-0f93effe2025","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07205","last_updated":"2025-06-08T16:12:13Z","snapshot_observed_at":"2026-08-07T05:37:11.793176Z","submitted_at":"2025-06-08T16:12:13Z","title":"TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07205","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Tv-live: Training-free, text-guided video editing via layer informed vitality exploitation.arXiv preprint arXiv:2506.07205, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2506.07205","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:82ae83029b7e6cdb2c77371e5cabc1661eff6df96f7cf6d04c047caeca59b057","observation_id":"ea642c03-7030-4d19-bcec-7a22bb36391e","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Target-aware video diffusion models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:af555c52a3beec39fcb66b07f8b6852e426d3480b667de4c899c95e3aef7bd1c","observation_id":"fc98fd43-296d-4c8e-8bc7-ce85bd9b38ea","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:56403b3e0eba348e33bc3ec1e208ac8ff053cd4a79bfd5488b36c8a8724628db","observation_id":"a08f88ea-b43b-43bb-a119-80b9c371c228","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Flowedit: Inversion-free text-based editing using pre-trained flow models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:16322631846efeb3fa73a3a0610d097ae9a3ae2de8c86d85847f94670861e524","observation_id":"d9d8ebe5-4d70-4ea8-9942-0f7e1efb89c5","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Flowdirector: Training-free flow steering for precise text-to-video editing.arXiv preprint arXiv:2506.05046, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:8f34a976b960cc6bfbcc328ad3610e6d0b56480f7b8aa6596736345b140c5a1e","observation_id":"da60bc29-4f89-4a1a-864a-ae7c3faca46d","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Trackdiffusion: Tracklet-conditioned video generation via diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:01c3e9d71bd9914d3addbd10f3c4f48b0916aeb8cdc8b1c9a90206e0088eeca0","observation_id":"72061261-d17f-457b-a42d-a95d727a42ce","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Towards an end-to- end framework for flow-guided video inpainting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:8ea7dda6a253b406b98b61499299245c1bb48fd8b7cb9aa830d71f79677c476a","observation_id":"b769454e-407e-4fe8-8e60-148706630b7d","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Lipman, Ricky T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:68e3cb2ae246f6587265dd745df3b1998d1a59e932d5787c79743210b7c69eb7","observation_id":"e89717ca-1606-4bc7-aa75-2b91143254c6","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Fuseformer: Fusing fine-grained information in transformers for video inpainting","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:3911ce3562314d89765094f97058d3ec5464020b4f0e81fbafbf966f49d4ea7b","observation_id":"dd913e53-ecda-4496-8e36-df72a580a213","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:c4a731eac8d1a1f5e7ea26fdea5f084a56513145a04506db0f163b78d68fbca0","observation_id":"c752f37a-7b36-4bff-8ffd-a1fc94fb2667","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:9434112912f2aa6ca5dade4613b838093eb31d71716d56590e16b848fab4b831","observation_id":"2b96fb31-e21a-4b11-9bb6-3f1173a10051","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:1f3911572a196b3750ce8eb93d70f127cbb6b1ccf2af7b7252942f2bc0461659","observation_id":"bbe68898-f137-421f-be97-fc367d188095","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:c2ce34a92c3efb9975e868fef4a313b622ddf6940b151f5774938e43f66d5f97","observation_id":"c18fcc80-8473-4e88-af08-89c8710ff58d","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Motionflow: Attention-driven motion transfer in video diffusion models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:3780f3de63f10504c3ac8b0a9cdaaeba305e6a3c9ebf5b0a996796298ee9e98f","observation_id":"6a0244f1-6d41-4956-aedb-7c697010a090","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Dreamix: Video diffusion models are general video editors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:866a0ba342ecee5e2a079625aab651e30d743a8b79f9739f77efc66d40ec96ab","observation_id":"27340133-435a-448d-9386-8b228a0e8c71","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Optical-flow guided prompt opti- mization for coherent video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:1e6dfd24ae7ea64c34cd469f8f191d265cfffed62fe2323ad1991c9a6b864582","observation_id":"016deb82-3649-4847-b1e0-fa4dc08ef3f7","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"I2vedit: First-frame-guided video editing via image-to-video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:15e9498d0eb155fa292cfb5e193d1bf42c587740ba1263f387371da9100be535","observation_id":"046063f6-dcc6-4ab0-ad37-5ce80536946a","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Blattmann, Tim Dockhorn, Jonas Muller, Joe Penna, and Robin Rombach","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:0a5484fcc6f0ca2fc0c492b3653a221e3d1cc22f51988c2cc430300aee93c87b","observation_id":"c5b66a13-1101-4ba9-b80e-ac15094bf825","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Video motion transfer with diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:2aef2c6ecce269decff07b984898a52108a6043ff0340e932173473f8f0d6f56","observation_id":"b81b3454-12f8-4ce3-a4c4-1cf37cf8d2f9","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:6354c4b25ba5db4f6b89e289ed2d9c40584a8fe26945aeef19ae708b39312249","observation_id":"4eeb650e-b1d2-48b7-bff6-6f1ded25f914","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Blattmann, Dominik Lorenz, Patrick Esser, and B","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:60da61afe56ab24a2996c8f09411c468a5b252096d5f7d30d8d9fc1e55c10884","observation_id":"14b19eee-9030-4764-930a-88e358809879","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:b1eec5e451007a6db9db6fa734de393fc858b7f38956402977e8184cdb6dcc9c","observation_id":"d2c390c7-41c7-4f87-930e-b4556311b5f4","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"First order motion model for image animation.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:b7d7771dea39ce2a22f6367abd5466925f88b5266bd60d61f69fd2aa8b31b44d","observation_id":"5e80a598-1103-4e8c-b5a3-beed7188c83c","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:bb3e32d905c80abb7aabfd80a51508879a580309ef008c9a2fbf2176bc86d11b","observation_id":"eb0612f2-426b-400b-b080-486915b8d748","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:ce9c2086b927c1b0a2a8a3f78c761af72536828ad7c20085cac2357befc62db8","observation_id":"bb2151e9-e1ea-4317-bb8b-703ad46d5270","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:c336c6de11e1ba7354110137c9e5386a26d1037f9a535d2fb6d7e250d4a72013","observation_id":"db7d340a-97d5-4197-a84e-b9726f89f0aa","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Modelscope text-to-video technical report.arXiv preprint arXiv:2308.06571, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:118e0b49ef339893620d1369fe7fdcc7d8b7c478dd9749d92c26e6aee8ec2422","observation_id":"d36201ad-4760-47d7-a5e7-4f98b599fcb5","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-08T21:00:07.723397Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation.arXiv preprint arXiv:2401.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:da1afb3609213ee42f2267f8dba7b085c5a69198d8daa970e8cde85cf71e5726","observation_id":"a68d882a-d7fe-460c-a35e-3ba96aa598f5","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17599","last_updated":"2024-01-04T01:30:50Z","snapshot_observed_at":"2026-07-06T15:10:15.773528Z","submitted_at":"2023-03-30T17:59:25Z","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17599","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Zero-shot video editing using off-the-shelf image diffusion models.arXiv preprint arXiv:2303.17599, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2303.17599","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:3c03de27f92f29ec6dbbf4ed06e570a8b13863047dd542374b92ef86dd3995b8","observation_id":"4441d9a9-e3a1-4dce-a925-beb12575e235","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:dee1529d4917e8863d1fb0716fa87700ce034034f401d1a194634b47fc84a5cc","observation_id":"77bbddaa-6d09-472f-b6aa-d72a273e5568","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Videodirector: Precise video editing via text-to-video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:b0169736abe00b484efe9d236a3a7d1ad1f04a039a1e42ba6e259fedcb396677","observation_id":"1f30eb94-ee28-43ac-ad06-5b0f50e78476","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:ab9620b55875a5bca4af6382631a2105991d953159a2dde8674dd591d4c34638","observation_id":"aebdc81e-3156-4fc1-855e-31fedfdc8643","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Omnivdiff: Omni controllable video diffusion for generation and understanding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:bbd8158eac1b342ad1890529d0b5413adc26cb9922be578f9dfce5c340494f2c","observation_id":"1b87f0a1-9d6e-4702-82b7-5db560bcbf94","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:78c3630c067367ef9cb6b8d796fc2c3d3e643013b25428d3caa020de94a77873","observation_id":"2fdeb9a5-bb4c-463f-a839-d9cd9bd2c631","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:d8ea696d11d55412610a4d4c09002c2dc32ca15eff9423accdef0a0439ee7759","observation_id":"5c46055e-4bf9-4dd0-abe8-c4efee28b4ac","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:bfc4b1ed3e7fecb6935c4c8715f4afe79c359eab03417091f05a39c897f1030f","observation_id":"3ca4e414-0a3d-44c1-95af-45f3a070dfc4","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:a1cc96aa737db32039f82f0c60d2bc7d3ddbc158085fa26e1b64657349fb2908","observation_id":"be69b146-9a51-4801-8af0-c32df74e4f77","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Posecrafter: One-shot personalized video synthesis following flexible pose control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:16dd7508a461144ddd51ca20506179f87fa9218bc48ce608b083f20e3f6b79e3","observation_id":"3f778f4e-4f24-4ffd-b87d-7d45bafdde92","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Propainter: Improving propagation and transformer for video inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:42ad22dd65b7c87cd246b7c7e8bbd005df03514233feb2969504cfb9b42b47ae","observation_id":"a4b307da-8a15-4fb4-ae19-ab46ee90768b","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:20:07.678576Z","title":"Few-step flow for 3d generation via marginal-data transport distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T00:20:07.678576Z"},"links":{"citing_paper":"/paper/2607.03732"},"observation_digest":"sha256:48af182ceac930d5b2e6cc4352845b5134a4b4f4c7756da31db67fa3c1d44b08","observation_id":"9f2bc41d-c338-4c46-aaef-d4c31bd6b000","resolution":{"observed_at":"2026-07-12T00:20:07.678576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03732","last_updated":"2026-07-04T06:39:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T19:44:12.162762Z","submitted_at":"2026-07-04T06:39:40Z","title":"ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2607.03732."}