{"as_of":"2026-08-17T22:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ba1f90fe201963566157a5a664263008bf93f23a9b2fe1d06f18d53201c784","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:55:14.031288Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.14335/citation-record","integrity":"/paper/2504.14335/integrity","json":"/paper/2504.14335/citation-record.json","paper":"/paper/2504.14335"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.366876Z","title":"Stable diffusion inpainting","venue":null,"work_id":"afc3bdc9-1e1d-4a28-8b2d-2b621a27e678","year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.655438Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:a46043eb1766952f6b2e206826593298600a86a3c67e4495811559b334d7a5c3","observation_id":"49345296-23b0-42ba-b8db-94d690046a83","resolution":{"observed_at":"2026-08-16T11:55:15.372248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.661194Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.661194Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:a8c17a968c77a2a8133df24bba6f1c8f5be53734775be0c199a74bd10bf027c9","observation_id":"3d3d9aae-917d-4d9c-b083-cb3ac981520c","resolution":{"observed_at":"2026-08-16T11:55:13.661194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.340255Z","title":"Visual prompting via image inpaint- ing","venue":null,"work_id":"b0f8a40f-63a3-421a-b3ff-8a0b9f4f7f10","year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.666817Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:2c62d8797f6f712a482f8c77877079b200022ca6a88870735bd833df9a13467a","observation_id":"0c5b6675-6220-4c9b-935e-7424edb26b46","resolution":{"observed_at":"2026-08-16T11:55:15.345384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.672128Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.672128Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:2276aac13e770d278660cc402f37bfd506460b36ca71fcb306db857c3fd72d76","observation_id":"064b0a73-3143-4e05-ae87-584b00b2a020","resolution":{"observed_at":"2026-08-16T11:55:13.672128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-16T11:55:13.678492Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.678492Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:541da802bc0368100bb8a26b94bbc4f5a8c9098d947c9d86137d574a9f1d8287","observation_id":"21d208c1-3676-458e-9a46-94ec9f517079","resolution":{"observed_at":"2026-08-16T11:55:13.678492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.312614Z","title":"Bayesian inference in statistical analysis","venue":null,"work_id":"9425ed09-f3ad-4160-9b42-3d5c40cf5992","year":2011},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.684833Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:c312864a82e2315cfc63a423d6ccaff62de8e2f4c30f7cdd0fd48ab7de1605c8","observation_id":"c44997d7-3a48-4ddd-bbfa-620e6bc77226","resolution":{"observed_at":"2026-08-16T11:55:15.317794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.295111Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"ffc65837-75e8-422a-8d27-d6b83c3e1a79","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.690571Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:0cb75dc9a6bb335b3f9939af38e289c8f58af1c09aa4cdf44366060d73aa0fab","observation_id":"0dc172b3-8af1-4be4-b56e-a5e3e90ba3d5","resolution":{"observed_at":"2026-08-16T11:55:15.300522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.695593Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.695593Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1671fb66a511317825c631345903f98f07d215e9e5a299e0df7c235356fcd5a2","observation_id":"3b1e862d-f96b-407a-b9e0-5468f01a65b5","resolution":{"observed_at":"2026-08-16T11:55:13.695593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-16T14:53:43.757992Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-16T11:55:13.701403Z","title":"Flatten: optical flow- guided attention for consistent text-to-video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.701403Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1aeccb5aab8000df8a64c5cfccc68330d32f61502d1fb93842fbfee78d756998","observation_id":"1388db1f-75c8-4575-be14-83b16a875666","resolution":{"observed_at":"2026-08-16T11:55:13.701403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.267992Z","title":"Videdit: Zero-shot and spatially aware text-driven video editing","venue":null,"work_id":"ea8d3a90-7ffb-4993-8da7-18c6eb50db45","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.707593Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:e9fbc4b50765f12a11be970856fa134524afc7669abe9a6e9d3af73eab4eedc5","observation_id":"0b0fbcb7-3437-443c-b7c6-75c0e021e8db","resolution":{"observed_at":"2026-08-16T11:55:15.272796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02216","last_updated":"2024-07-22T05:25:28Z","snapshot_observed_at":"2026-08-17T17:58:01.113325Z","submitted_at":"2023-12-03T10:41:06Z","title":"DragVideo: Interactive Drag-style Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02216","snapshot_observed_at":"2026-08-16T11:55:13.713124Z","title":"Dragvideo: Interactive drag-style video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.713124Z"},"links":{"cited_paper":"/paper/2312.02216","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:ac257cf70d899d3c241b4b96c0e18ce3a38fc152203a09fff22900f84dedf583","observation_id":"5e24fa35-7986-4f97-896a-01ddb86337c1","resolution":{"observed_at":"2026-08-16T11:55:13.713124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.252361Z","title":"Videoshop: Localized semantic video editing with noise-extrapolated diffusion inversion","venue":null,"work_id":"83068ca9-3492-46b4-a56a-57a228038b51","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.718745Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:fe14bb61fc625c605f15b2941b5dea6df490404cdd9bf2fe4953d04b2ec6543f","observation_id":"30889e77-31b7-422b-9425-52ebda6c4e6e","resolution":{"observed_at":"2026-08-16T11:55:15.257395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.236167Z","title":"Distribution-aligned diffusion for human mesh recovery","venue":null,"work_id":"26a9bbac-ef66-4a36-8325-4385feb8cd23","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.723899Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:8879138c6c1555e12f45cbe4fb4011603bc3605ab23f89ad9bc0c66b10475b58","observation_id":"2625632e-103d-4bc8-9f00-56ab5f9bd185","resolution":{"observed_at":"2026-08-16T11:55:15.241195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14177","last_updated":"2025-01-19T17:43:30Z","snapshot_observed_at":"2026-08-16T15:05:27.971981Z","submitted_at":"2023-08-27T18:38:57Z","title":"AI-Generated Content (AIGC) for Various Data Modalities: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14177","snapshot_observed_at":"2026-08-16T11:55:13.729084Z","title":"Ai-generated content (aigc) for various data modalities: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.729084Z"},"links":{"cited_paper":"/paper/2308.14177","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:3eda7fec8dee9e1074adec50b688abdc0e4c51c7e46e4fe9277232b6b1c8f70e","observation_id":"b958b60c-ffd6-4a24-bf72-5ebcf5add634","resolution":{"observed_at":"2026-08-16T11:55:13.729084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.219070Z","title":"Action detection via an image diffusion process","venue":null,"work_id":"1e28b138-1674-4f7b-9742-699b12524504","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.734347Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:2c725dca8c4e5a20660dfe17505b04beb8a3aa053c18f20e924bae2b3f3222da","observation_id":"1affcb41-d87a-43b1-aedf-ecdb57bcc143","resolution":{"observed_at":"2026-08-16T11:55:15.224778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.202391Z","title":"Avatar concept slider: Controllable editing of concepts in 3d human avatars, 2025","venue":null,"work_id":"bfab6b47-bd97-448c-ab01-78d9b803ca04","year":2025},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.739375Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:84cd8b3093afff969264d1f4d96dc5f043d14c1c7373c06c451d75255147b8bc","observation_id":"b84d3e95-d894-4106-87a8-794c8dffa861","resolution":{"observed_at":"2026-08-16T11:55:15.207476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.185447Z","title":"Escap- ing from saddle points—online stochastic gradient for ten- sor decomposition","venue":null,"work_id":"8ae630f8-b1e9-4002-881e-b19e41b1365f","year":2015},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.744020Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:7cd1d01100ef448e047f958af215df8e234e824b8e26306800359a92ec3a21d2","observation_id":"9eef3965-f2a2-402e-a37f-81388edbca1c","resolution":{"observed_at":"2026-08-16T11:55:15.190738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-16T11:55:13.748725Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.748725Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:007853b206c17a96835575f124379db1ec50da393e4311d8b8574b3c366780f0","observation_id":"b056f0f9-f07a-43f5-b84f-98f0fbe4fcc7","resolution":{"observed_at":"2026-08-16T11:55:13.748725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.169112Z","title":"Diffpose: Toward more reliable 3d pose estimation","venue":null,"work_id":"6b085a1f-89c9-4727-9bc7-c5592c0200bc","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.753963Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:0e9c839861dd17aed9a6db02cb4969f4857bb69dff1312643244511bbc303692","observation_id":"3485869e-2ea0-447d-98c6-d26ef12920c3","resolution":{"observed_at":"2026-08-16T11:55:15.174323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.152460Z","title":"Videoswap: Customized video subject swapping with interactive semantic point cor- respondence","venue":null,"work_id":"79836d67-adb6-47ab-9882-687f803c4147","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.758790Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:d5029d6d0ea58421687b6f2b9edbd2427eab48ab9f5b9f8e45ff8e277136f781","observation_id":"b50658f0-f044-49d0-b513-375c19c962d7","resolution":{"observed_at":"2026-08-16T11:55:15.158515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10316","last_updated":"2024-05-16T17:59:21Z","snapshot_observed_at":"2026-08-16T13:52:04.290821Z","submitted_at":"2024-05-16T17:59:21Z","title":"Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model","version":1},"cited_work":{"arxiv_id":"2405.10316","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.10316","snapshot_observed_at":"2026-08-16T11:55:14.594185Z","title":"Analogist: Out-of-the-box Visual In-Context Learning with Image Diffusion Model","venue":"cs.CV","work_id":"d7c00c0e-353f-4179-b538-e1beaf09f933","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.763379Z"},"links":{"cited_paper":"/paper/2405.10316","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:5136c3a51b43c088510098a99f4fd89b7c476494f5e132cfd3fb57c8f554c6b9","observation_id":"81c6d7b8-6eeb-492b-bdd9-30889a277c86","resolution":{"observed_at":"2026-08-16T11:55:14.599905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-16T11:55:13.768246Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.768246Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:8f9c607f19a89d627fae32d3bd4078ff70d582a1605235036b84912b1a512844","observation_id":"65d4a145-c13e-46b4-929e-e7c2f264f12f","resolution":{"observed_at":"2026-08-16T11:55:13.768246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02358","last_updated":"2025-07-22T13:47:07Z","snapshot_observed_at":"2026-08-17T04:43:13.939941Z","submitted_at":"2025-02-04T14:43:26Z","title":"MotionLab: Unified Human Motion Generation and Editing via the Motion-Condition-Motion Paradigm","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02358","snapshot_observed_at":"2026-08-16T11:55:13.773539Z","title":"Mo- tionlab: Unified human motion generation and editing via the motion-condition-motion paradigm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.773539Z"},"links":{"cited_paper":"/paper/2502.02358","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:d0f47c990e2e0f11ef61ed10c864005cd3fb010d565d59a4e6eb4ea9bb3674eb","observation_id":"6678af0d-a1cd-487b-9844-610444ec79bc","resolution":{"observed_at":"2026-08-16T11:55:13.773539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.136165Z","title":"Tstmotion: Training- free scene-aware text-to-motion generation","venue":null,"work_id":"f564f4f6-2e85-4034-bbb4-3bc16ba4988a","year":2025},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.778663Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1ca0d95aeaee25bf52484d65981396d5ff9b21e6e3a443a67a53d80f1a588754","observation_id":"5b9be722-e56b-4bf6-9be0-24328c43e1bf","resolution":{"observed_at":"2026-08-16T11:55:15.141434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-08-17T00:44:11.103098Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-16T11:55:13.783297Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.783297Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:d28dbe86cb7c234d882a4db1455aa518811c1a9ad65062b60b0d61eda6065331","observation_id":"086b56d6-0192-4fbc-9c00-34d463e5ba2e","resolution":{"observed_at":"2026-08-16T11:55:13.783297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.788224Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.788224Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:35569c881a953be9c389bc1d31f83af7df01ad0d39ff95f6fcd3337e101ec063","observation_id":"7be5351c-1e6f-41e4-84dc-861529bc0aa4","resolution":{"observed_at":"2026-08-16T11:55:13.788224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.106884Z","title":"Tifa: Accu- rate and interpretable text-to-image faithfulness evaluation with question answering","venue":null,"work_id":"d3655a10-49e6-416f-ae41-8ea2d3a8d51e","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.793060Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:dd0049d49ab2acfdf87d3d0f1f605bb81ac4f84fd7b5f884137c0d0df9b25ee6","observation_id":"d7615f0e-6bed-4c8f-b940-a9a284781402","resolution":{"observed_at":"2026-08-16T11:55:15.112078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01107","last_updated":"2024-02-24T19:39:37Z","snapshot_observed_at":"2026-08-17T13:14:38.486899Z","submitted_at":"2023-10-02T11:28:37Z","title":"Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01107","snapshot_observed_at":"2026-08-16T11:55:13.797755Z","title":"Ground-a-video: Zero- shot grounded video editing using text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.797755Z"},"links":{"cited_paper":"/paper/2310.01107","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:7a3c8e4c82996c1679738650daf7751695f9e6c53863bb2e28718e29f136c2ea","observation_id":"c55b63af-0521-40bf-a1fb-8e5b488e07e4","resolution":{"observed_at":"2026-08-16T11:55:13.797755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.088915Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"ce392767-cfe1-46fd-904a-72e714c944cf","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.802767Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:49a1778b9cb9af9ba0c0119e08cb1dde5ea8804d997a811b2cabe2f0229d95db","observation_id":"13be9857-a41c-4092-a584-5ab7c75e5e97","resolution":{"observed_at":"2026-08-16T11:55:15.094436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05735","last_updated":"2024-08-30T13:28:38Z","snapshot_observed_at":"2026-08-16T14:28:19.328959Z","submitted_at":"2024-01-11T08:36:15Z","title":"Object-Centric Diffusion for Efficient Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05735","snapshot_observed_at":"2026-08-16T11:55:13.807482Z","title":"Object- centric diffusion for efficient video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.807482Z"},"links":{"cited_paper":"/paper/2401.05735","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:c4950e61e1c9aff74681b7b720414e1bef0a39a5a9cebe85b8da40ae73726b45","observation_id":"96bb5c5b-30a4-42a4-b591-bc08f2fa2ef7","resolution":{"observed_at":"2026-08-16T11:55:13.807482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.812814Z","title":"Rave: Randomized noise shuf- fling for fast and consistent video editing with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.812814Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:c735a13a56055c1200c9bca0572061a285f3a3147e036f2c1525a7da01b7e645","observation_id":"8a0648ea-3e59-4ef4-9f29-12b6e8a5f5f6","resolution":{"observed_at":"2026-08-16T11:55:13.812814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-16T15:16:08.062270Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-16T11:55:13.817905Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.817905Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:02fa69e136e8e28ed732289dd12fc4591da062ef6d6280fe46480aeb63bc8f73","observation_id":"ad2659cf-1361-4032-be83-c83a518a6529","resolution":{"observed_at":"2026-08-16T11:55:13.817905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.058822Z","title":"Lay- ered neural atlases for consistent video editing","venue":null,"work_id":"cb1b0c27-cfda-4d1c-b1c0-28773d09dc15","year":2021},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.822851Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:b51e996d7e25554d3cb830e2924523591f8a7f8d47b2e3fba0fa65e751763e9b","observation_id":"ad47a7a6-e1f6-4e41-8867-7e53e9b8abd2","resolution":{"observed_at":"2026-08-16T11:55:15.064659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.040697Z","title":"Collaborative score distilla- tion for consistent visual editing","venue":null,"work_id":"e977a171-a01f-496b-b627-3ed3b70868a0","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.827283Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:f398ad4b3b45ce7e68f11ab08bed08ab258daf9601ce2d8a91cfa3792b0e331f","observation_id":"5110a5d5-4338-401c-814f-d9edeae182bf","resolution":{"observed_at":"2026-08-16T11:55:15.046278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.023823Z","title":null,"venue":null,"work_id":"ad4edc5b-ceb7-445d-b232-32ac38771a01","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.832247Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:be22446387e07027c2fbc3e3062207594604529a7d7220eb3b20e2e9e25395eb","observation_id":"c2088506-9f4e-4dd6-aca1-5ad64bb08e1e","resolution":{"observed_at":"2026-08-16T11:55:15.029462Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-16T14:07:39.359261Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-16T11:55:13.837079Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.837079Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:222e822ebe7ca7ec2442952ac4df0edc493307b217656f99454289cac8c94abe","observation_id":"0cbbcc47-3203-4d14-841d-853e0fce2ed6","resolution":{"observed_at":"2026-08-16T11:55:13.837079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:15.007398Z","title":"Shape-aware text-driven lay- ered video editing","venue":null,"work_id":"0a84e051-62a7-40f1-9c56-c69547751b90","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.842367Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:e2ab510b8020b2b28e52bb73d31d0f7ec03afb1b645bb4a692a8aa62c99cb917","observation_id":"7641546b-bb7b-45cf-b1a6-bed8cc012baf","resolution":{"observed_at":"2026-08-16T11:55:15.012620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03992","last_updated":"2024-11-17T14:27:58Z","snapshot_observed_at":"2026-08-16T15:17:45.825615Z","submitted_at":"2023-07-08T14:59:41Z","title":"Stimulating Diffusion Model for Image Denoising via Adaptive Embedding and Ensembling","version":5},"cited_work":{"arxiv_id":"2307.03992","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.03992","snapshot_observed_at":"2026-08-16T11:55:14.458511Z","title":"Stimulating Diffusion Model for Image Denoising via Adaptive Embedding and Ensembling","venue":"cs.CV","work_id":"4036ed8a-1cd5-441d-8b6a-688a8011218b","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.847036Z"},"links":{"cited_paper":"/paper/2307.03992","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:4413da46a5ba51efd2edc03e07b2070f1d431ea909fe7ee8abcdd0f5f6a97c98","observation_id":"a45cd8ea-2fd1-410d-93a8-6d274ceb84e5","resolution":{"observed_at":"2026-08-16T11:55:14.463759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14749","last_updated":"2023-08-28T17:56:22Z","snapshot_observed_at":"2026-08-16T15:05:10.876982Z","submitted_at":"2023-08-28T17:56:22Z","title":"MagicEdit: High-Fidelity and Temporally Coherent Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14749","snapshot_observed_at":"2026-08-16T11:55:13.852232Z","title":"Magicedit: High-fidelity and temporally coherent video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.852232Z"},"links":{"cited_paper":"/paper/2308.14749","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:6d7aa2553997ed290a49e103c65f0f37e4e8f43ea4530aecf7fc7ae5f0e786d5","observation_id":"b7f4d2ca-1fad-4467-bcfe-d42428b76e3a","resolution":{"observed_at":"2026-08-16T11:55:13.852232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.990051Z","title":"Stein variational gradient de- scent: A general purpose bayesian inference algorithm","venue":null,"work_id":"7e6b7936-b933-4a76-9109-7ef2fb1fec42","year":2016},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.858502Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:02282cc67b41625876cd216034555e82476c74b7fef760824be05eb8a10053f0","observation_id":"81ddce93-2ed5-4ce5-90f6-fa8c21acb2c0","resolution":{"observed_at":"2026-08-16T11:55:14.995900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.972774Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"ef2a9c0a-9a97-4f01-9520-a6c661dfbd4b","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.863222Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:8f47c34efc892b190321788f6a0704a10ab08f9cb74da7c7fdae8ddfdbd3412a","observation_id":"5a223621-a027-416f-9c06-2da7aaed7fdb","resolution":{"observed_at":"2026-08-16T11:55:14.977934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-16T11:55:13.867910Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.867910Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:2c182cae0cb2bfbbb83217c1980bd3955c346f3dbe8c422691e019734be156b7","observation_id":"46f29573-d854-4696-bafd-67df0d94bc30","resolution":{"observed_at":"2026-08-16T11:55:13.867910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03047","last_updated":"2024-11-18T15:39:00Z","snapshot_observed_at":"2026-08-16T14:37:25.035297Z","submitted_at":"2023-12-05T17:58:06Z","title":"MagicStick: Controllable Video Editing via Control Handle Transformations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03047","snapshot_observed_at":"2026-08-16T11:55:13.873069Z","title":"Magic- stick: Controllable video editing via control handle transfor- mations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.873069Z"},"links":{"cited_paper":"/paper/2312.03047","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:7014b3318d5702d7b99243e8569074f1a47ce9ae0bb219b2519003c6cf1018b0","observation_id":"ebd078d5-ba6c-449d-ac2d-f173b05ce303","resolution":{"observed_at":"2026-08-16T11:55:13.873069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.878200Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.878200Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:4472ea7a4e81711bc6e2022bf895c230b8d58c448395f1ba2245f55189a72567","observation_id":"55660102-9577-49e0-9536-d2882d64079f","resolution":{"observed_at":"2026-08-16T11:55:13.878200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13865","last_updated":"2024-05-22T17:46:08Z","snapshot_observed_at":"2026-08-16T13:50:31.799300Z","submitted_at":"2024-05-22T17:46:08Z","title":"ReVideo: Remake a Video with Motion and Content Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13865","snapshot_observed_at":"2026-08-16T11:55:13.882904Z","title":"Revideo: Remake a video with motion and content control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.882904Z"},"links":{"cited_paper":"/paper/2405.13865","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:397716c91bd00bf8617f75127d2d1ab7270723bb234310f2ee7e5bdd10a5ec58","observation_id":"642bfb64-9593-4b26-b588-d417e955821d","resolution":{"observed_at":"2026-08-16T11:55:13.882904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.947172Z","title":null,"venue":null,"work_id":"47ba8f67-a623-415e-a244-f9a56dc7e492","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.888031Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:5186704a3b1d8a3b968864b327510df13cd22c653a441061d69966d9554b17b3","observation_id":"08b824d6-166f-4183-bcc8-c8e7379d6f66","resolution":{"observed_at":"2026-08-16T11:55:14.952141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.892741Z","title":"Codef: Content deformation fields for temporally consistent video processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.892741Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:3f50d330a1e5d39b6e15d421f7762915212fea3622abd78eb6c2638d876f79bc","observation_id":"248b3916-3401-4e66-a3ce-fd950ab96ed5","resolution":{"observed_at":"2026-08-16T11:55:13.892741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.920731Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"ab8aa2e9-489d-486d-b007-7ccc4b8a3575","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.897612Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:ac22b93cd7a4e0ac8e30990ef061f3d4719ed0313ae9fada62e34c2b2b6a910f","observation_id":"243cd074-8f83-40d5-99ff-a787de9d891a","resolution":{"observed_at":"2026-08-16T11:55:14.925985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.903954Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"60eeac13-3f12-4ad1-bc54-a4a5fae9fe4e","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.902372Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:b80ed6c2b9c1a5b469f9c02862c46c63789bdc8cacd6f1de5345d98d3e83e1d4","observation_id":"ddb665d6-74d6-4015-9e64-d6e72bb8fba5","resolution":{"observed_at":"2026-08-16T11:55:14.909834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.906949Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.906949Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:72f47083348bbe07078d3160d9a591dfda6c7943174072872ac418204153d516","observation_id":"eadd4d1b-ffef-46b1-b820-a2bb5ea59549","resolution":{"observed_at":"2026-08-16T11:55:13.906949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14780","last_updated":"2024-08-28T01:13:44Z","snapshot_observed_at":"2026-08-16T14:16:08.555625Z","submitted_at":"2024-02-22T18:38:48Z","title":"Customize-A-Video: One-Shot Motion Customization of Text-to-Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14780","snapshot_observed_at":"2026-08-16T11:55:13.911636Z","title":"Customize-a-video: One-shot motion customization of text- to-video diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.911636Z"},"links":{"cited_paper":"/paper/2402.14780","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:72f5c28d2c6830d26d03c6eafd3ebb35fbaf43ebce04fb99955f47ca31be0e67","observation_id":"2757fe69-b552-4734-9385-ac799969b6c7","resolution":{"observed_at":"2026-08-16T11:55:13.911636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.916510Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.916510Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:cd7ff27de0b6920346f75a0d3770edf9b0a78d71f6cc8c4116d7e1f5edc9924b","observation_id":"7ef59e88-69cb-4bf6-8669-7d40bc0d86e0","resolution":{"observed_at":"2026-08-16T11:55:13.916510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.921324Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.921324Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:db00fa5c797563fa706397244013644fe88070768d4ed835558ee4d1a82e6d9b","observation_id":"e9dac269-fe50-401c-aa38-5c777ae88141","resolution":{"observed_at":"2026-08-16T11:55:13.921324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.854809Z","title":"Edit-a-video: Single video editing with object-aware consistency","venue":null,"work_id":"da61717e-10b3-48d6-8513-60a9e7f73bbc","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.925848Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:9aa4b0fb80cfa57868ad522714e04643173935777d6e347120547d6ffa6739c8","observation_id":"92c32bf8-9adc-4676-ae5d-8f65f348da0b","resolution":{"observed_at":"2026-08-16T11:55:14.860622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T11:55:13.930610Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.930610Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1ee2c70f81143bb540d5bdfa6438ad2facd103cf8eb3d4dc71cb19216779efce","observation_id":"78d6c605-4b0b-494c-8226-3eb422ea61cb","resolution":{"observed_at":"2026-08-16T11:55:13.930610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-16T11:55:13.935631Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.935631Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:639a3eda88586b68a5e0e4cdf646d066a594fc319f1d5f552aeb991b8aea5790","observation_id":"efdde4b9-29f2-4335-a4be-e07465a2e4b6","resolution":{"observed_at":"2026-08-16T11:55:13.935631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-08-15T07:00:23.337991Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-16T11:55:13.940478Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.940478Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:d05cad3eb9a6fb117f01186281dd725fdfaa61b93d0760c629bd4ac482540dcf","observation_id":"5d229202-7884-47f8-88cf-f074f63253c8","resolution":{"observed_at":"2026-08-16T11:55:13.940478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.945392Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.945392Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1b2b61bf18b15a60a1b54fdc82cb79ade617f8a835ac861cd6ff7b3a29fb311a","observation_id":"0bacfb9b-7419-4c53-bb73-c693a24ada09","resolution":{"observed_at":"2026-08-16T11:55:13.945392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-16T11:55:13.950329Z","title":"Modelscope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.950329Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:40cd7d092be9d8fda2d562657574098be5ae07281396502ba2f3cd2ebeac48f0","observation_id":"5829f992-2e42-4062-bf1e-eaf58e5afeb4","resolution":{"observed_at":"2026-08-16T11:55:13.950329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.827689Z","title":"Projected wasser- stein gradient descent for high-dimensional bayesian infer- ence","venue":null,"work_id":"8bbd6786-9956-48fd-8494-c46d042d1807","year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.955239Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:202e7dafc13ce7ef196e2e85dc75b660b8f130a61c39337ada40d80602578d06","observation_id":"ec69dc55-001f-4450-9026-96447911a919","resolution":{"observed_at":"2026-08-16T11:55:14.833316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.809641Z","title":"Cinematic sequence for video blog using multimedia development life cycle.Journal of Information System and Technology (JOINT), 2(2):16–48,","venue":null,"work_id":"37a7823d-a097-495a-91dd-ebf308e3a97e","year":null},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.959873Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:a326a5c534c68781c81a0d3614f3928be5a8826d7b4f7f6cc51fa690fc4fa5eb","observation_id":"6b0ef725-5ddc-4677-8050-cade631f523f","resolution":{"observed_at":"2026-08-16T11:55:14.815070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.792131Z","title":"Analyzing elements of style in annotated film clips","venue":null,"work_id":"814c4289-fb56-4df8-b442-739027113200","year":2017},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.964685Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:f80cb3f720e3e8f5c6bcafbad6f34951069748756d58ba17b4935ef888e69a17","observation_id":"8768f716-4656-48ee-bc0d-255b53c04420","resolution":{"observed_at":"2026-08-16T11:55:14.797595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.969542Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.969542Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:6dca8782914bec12f28287aa410669f8cee9452108ef5efbc76743f39fd7f119","observation_id":"90a7d24f-3ed8-472e-a59a-1a119a26678b","resolution":{"observed_at":"2026-08-16T11:55:13.969542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.974804Z","title":"Simda: Simple diffusion adapter for efficient video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.974804Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:82655416cafbf483de96d65dbdcee5a4dee5e0542ba9eab307ac50df60eb99d1","observation_id":"3d5e91df-d0b2-4dd2-bab1-052a3c6756d4","resolution":{"observed_at":"2026-08-16T11:55:13.974804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04965","last_updated":"2023-12-07T18:58:27Z","snapshot_observed_at":"2026-08-16T14:36:44.425924Z","submitted_at":"2023-12-07T18:58:27Z","title":"Inversion-Free Image Editing with Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04965","snapshot_observed_at":"2026-08-16T11:55:13.979742Z","title":"Inversion-free image editing with natural language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.979742Z"},"links":{"cited_paper":"/paper/2312.04965","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:d5e042eff7d95b3dc2767c02c357dc21285ce487c6d7424a20cd646666b76ed0","observation_id":"0b248854-18d7-45e2-8563-ca60ca91a522","resolution":{"observed_at":"2026-08-16T11:55:13.979742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13395","last_updated":"2024-08-23T22:16:34Z","snapshot_observed_at":"2026-08-16T13:24:13.239069Z","submitted_at":"2024-08-23T22:16:34Z","title":"Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing","version":1},"cited_work":{"arxiv_id":"2408.13395","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13395","snapshot_observed_at":"2026-08-16T11:55:14.270391Z","title":"Task-Oriented Diffusion Inversion for High-Fidelity Text-based Editing","venue":"cs.CV","work_id":"df8e0b3a-3fb3-4503-a5d4-0dd2d70e6d53","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.984844Z"},"links":{"cited_paper":"/paper/2408.13395","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:cd34227a27e81c656b677fb589b5c5e94e39807a274eec726bbc4fc97fedc5be","observation_id":"7f7858cc-6fda-451d-9cb9-331a4d90fc48","resolution":{"observed_at":"2026-08-16T11:55:14.276086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.990092Z","title":"Ad- vancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.990092Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:1bbd1138188f525cba3e8cdc8d45a2abec4b2b587a89e6baace0eb153c1b0721","observation_id":"41a28cc6-526d-4de5-b502-dc2aaeb32615","resolution":{"observed_at":"2026-08-16T11:55:13.990092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:13.994676Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.994676Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:f6220b8487c030d30d01c140f9c808c15f404d1a0c13e97482b8ced55eba9afb","observation_id":"c0e515f6-314a-4287-bc59-7869e3af5c84","resolution":{"observed_at":"2026-08-16T11:55:13.994676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.728377Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"2673bb91-1455-40fe-b466-c5b08e242a32","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:13.999065Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:37401315b42fcdf49620cfa63e4c027afcbab6cc05c3a43178a75c5d5925e1a2","observation_id":"a8aa328c-af82-41f8-9f5f-3c1034311dd8","resolution":{"observed_at":"2026-08-16T11:55:14.734592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.003628Z","title":"Raccoon: Remove, add, and change video content with auto-generated narratives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.003628Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:bdaad913508c17dc662c6b837dde252a3b96dddeadb2ed487f5589dde1643e61","observation_id":"92599c9b-0e49-4a5d-a52b-0c7ce6ffad3c","resolution":{"observed_at":"2026-08-16T11:55:14.003628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.711252Z","title":"Zhang, J","venue":null,"work_id":"811defeb-0477-43f0-8d9a-2b559a473bf6","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.008164Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:dd9a696f0d59f4b61c5ec0944728b21a380322eda289bee16f6bc09840d78c27","observation_id":"200703ed-150b-4947-87a5-077dcb0942bc","resolution":{"observed_at":"2026-08-16T11:55:14.716793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.695538Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing","venue":null,"work_id":"7506da7e-c3c0-477b-9b9b-5e838dadddb8","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.012656Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:a4be7b678a0a3f18b44791d9cabb326e6b2df4e21e9d6af21bf15dc859ef7cee","observation_id":"34937eec-83ec-44ec-99f4-6694c4c1686d","resolution":{"observed_at":"2026-08-16T11:55:14.700589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-16T11:55:14.017171Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.017171Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:40a0ad993d92a3062e3b40f2f3c9556c0460f1757bd115efb68ab68c41c0dc3a","observation_id":"a2e2e9e9-6c1e-4ea6-ac0a-c3e001855f66","resolution":{"observed_at":"2026-08-16T11:55:14.017171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06269","last_updated":"2024-11-18T23:08:21Z","snapshot_observed_at":"2026-08-16T14:11:11.810273Z","submitted_at":"2024-03-10T17:12:01Z","title":"FastVideoEdit: Leveraging Consistency Models for Efficient Text-to-Video Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06269","snapshot_observed_at":"2026-08-16T11:55:14.022036Z","title":"Fastvideoedit: Leveraging consistency models for efficient text-to-video editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.022036Z"},"links":{"cited_paper":"/paper/2403.06269","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:64512bc28f4e805c1be56592d31e7d37ee656287fe919cd07ac091713c0a2f55","observation_id":"0258418e-636c-4dda-acce-2ed7461446aa","resolution":{"observed_at":"2026-08-16T11:55:14.022036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.04888","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:55:14.145430Z","title":"Zero-shot video editing through adaptive sliding score distillation","venue":null,"work_id":"01bd0407-8405-4118-a3ab-50b987f8697a","year":2024},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.026886Z"},"links":{"citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:adfc82178c41face0065731e4ce51d1d8782668cc765c0987c2015fb1189ef01","observation_id":"aa1e03d4-b650-429b-ab75-b8cffc916cc5","resolution":{"observed_at":"2026-08-16T11:55:14.153612Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11697","last_updated":"2023-11-20T12:00:06Z","snapshot_observed_at":"2026-08-16T14:41:53.401815Z","submitted_at":"2023-11-20T12:00:06Z","title":"Cut-and-Paste: Subject-Driven Video Editing with Attention Control","version":1},"cited_work":{"arxiv_id":"2311.11697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11697","snapshot_observed_at":"2026-08-16T11:55:14.069530Z","title":"Cut-and-Paste: Subject-Driven Video Editing with Attention Control","venue":"cs.CV","work_id":"07c43914-d782-434d-81d9-889857d7eb7a","year":2023},"citing_paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T11:55:14.031288Z"},"links":{"cited_paper":"/paper/2311.11697","citing_paper":"/paper/2504.14335"},"observation_digest":"sha256:5b8fe167c59adbec7dc2627bea29835ff22818a28fce9ba9179b6cff2271b560","observation_id":"9d45e807-9b85-48c8-97a0-99895b8a6709","resolution":{"observed_at":"2026-08-16T11:55:14.077376Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14335","last_updated":"2025-04-19T16:00:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T09:19:34.293715Z","submitted_at":"2025-04-19T16:00:47Z","title":"Visual Prompting for One-shot Controllable Video Editing without Inversion"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":5,"verified_fuzzy":29},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2504.14335."}