{"as_of":"2026-08-11T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3179b6ab938fdbf211a339ec31563dbcf91eff0a9391e249a6ea7fbe55c065ab","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:41:23.282342Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.04325/citation-record","integrity":"/paper/2501.04325/integrity","json":"/paper/2501.04325/citation-record.json","paper":"/paper/2501.04325"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.985264Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":"12bbdcdb-e71c-4057-880b-8f9f76dae323","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.048302Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e4becb0c8826e5464958acf627e3e06be5dec14c0d453fdbc00e798ac0102389","observation_id":"42b8a104-7d5a-4122-9737-66354e2c9150","resolution":{"observed_at":"2026-08-10T21:41:23.989202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.974384Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"5988b34f-f91f-4b98-a733-aebd72b317a1","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.053362Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:79cf70e4dbd8a4cc3950c8f6b073fe2bd78f96dd25c3d2e1adb4b99ab2a0f2c9","observation_id":"9cb97f2d-8cf6-42a1-a1c2-d3eb9da35884","resolution":{"observed_at":"2026-08-10T21:41:23.978351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.964025Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"38829795-5836-4ca9-8c1f-0ff0ac86445e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.057864Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:7a04100a1c9a5ff7bcc23ebd67fdec02a3721fad313b66d3488ada4a2f6a1ecc","observation_id":"0fcf37a5-6e79-4c3b-99c2-d52311add416","resolution":{"observed_at":"2026-08-10T21:41:23.967675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.952743Z","title":"Pix2video: Video editing using image diffusion","venue":null,"work_id":"0988e488-3829-426f-af5c-e338f068fe56","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.063303Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:4d658812539bdd76e1f065b5182226404e2faafb77d176ed500200e394fcd5b6","observation_id":"3e7be476-1869-486d-9b28-9808f15909bb","resolution":{"observed_at":"2026-08-10T21:41:23.956733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.939804Z","title":"Stable- video: Text-driven consistency-aware diffusion video edit- ing","venue":null,"work_id":"0edcae4c-dd64-42da-b80a-dfab47e5cfe6","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.069225Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:55dcc8c2ef69f2a1d56c2f00ff08f2ff825603abeb5890e9a8409266f68d7173","observation_id":"3fa87c73-9e85-4344-8e4e-48911593c4de","resolution":{"observed_at":"2026-08-10T21:41:23.944429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07547","last_updated":"2024-06-11T17:59:51Z","snapshot_observed_at":"2026-08-09T13:29:49.581575Z","submitted_at":"2024-06-11T17:59:51Z","title":"Zero-shot Image Editing with Reference Imitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07547","snapshot_observed_at":"2026-08-10T21:41:23.074303Z","title":"Zero-shot image editing with reference imitation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.074303Z"},"links":{"cited_paper":"/paper/2406.07547","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:71dc86c74e2ff97cbf03c6f500a5cd5b92d8e534296d538a58aa557a1491a925","observation_id":"a0f5fde4-86e9-4423-b57e-e194863c68c0","resolution":{"observed_at":"2026-08-10T21:41:23.074303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.925621Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"785cee98-b0b6-4742-964a-4e7fccbb12e4","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.079713Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:010f97e72abfce7dc54dd6ada9757f1635d01703eec3b8fc716f502d52dee2f1","observation_id":"0e6f196c-371a-4f18-81ea-501dc8838046","resolution":{"observed_at":"2026-08-10T21:41:23.931085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.913387Z","title":"Compvis/stable-diffusion: A latent text-to- image diffusion model","venue":null,"work_id":"90605a50-e267-45cd-8159-38f9c7cb6dcf","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.084951Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:05bacb77d3c587d61c80a5ef122524ee0f019ba6f7660977fc1df47cf21e9873","observation_id":"cc5a1e3d-7f05-402e-9b34-ebf73f9ca1d0","resolution":{"observed_at":"2026-08-10T21:41:23.918275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11427","last_updated":"2022-10-20T17:16:37Z","snapshot_observed_at":"2026-08-01T15:07:11.635426Z","submitted_at":"2022-10-20T17:16:37Z","title":"DiffEdit: Diffusion-based semantic image editing with mask guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11427","snapshot_observed_at":"2026-08-10T21:41:23.090284Z","title":"Diffedit: Diffusion-based seman- tic image editing with mask guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.090284Z"},"links":{"cited_paper":"/paper/2210.11427","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:c0c1412e37c735fca60dfba5ba407ef10e8aa0979d08c8d5b0a1dc1a6d167285","observation_id":"392b5eee-b0e5-4756-9ac6-ae9d16393a0d","resolution":{"observed_at":"2026-08-10T21:41:23.090284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.902178Z","title":"Videdit: Zero-shot and spatially aware text-driven video editing.IEEE Trans","venue":null,"work_id":"5008e2f5-0c69-4140-9e6c-f2e4ae440bf6","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.095632Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a5cbab9e82452900c1c832686da7a0fa6f683860d178f04f6668369e2ebbbdb5","observation_id":"8e3650e1-78ba-4ee5-bcdf-3b5ca474cc2a","resolution":{"observed_at":"2026-08-10T21:41:23.906371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.890699Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"ba2adae7-e9ee-4fa6-9ed9-bb2fc562afee","year":2021},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.100475Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:353f38061d847ab54396f4d8295c2726a4a3731c98b9732aadf0836d43ecebe0","observation_id":"12e6d0ba-8e2b-4c86-b713-2e5465bd330a","resolution":{"observed_at":"2026-08-10T21:41:23.894691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.878805Z","title":"Editanything: Empower- ing unparalleled flexibility in image editing and generation","venue":null,"work_id":"4d6be6f5-9f58-480b-9008-d8ff51470428","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.104235Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:f13ed28a79c9716136c7224fb47865641878e8d729e633a340436fead3b04257","observation_id":"b9ff7a3d-bf18-4496-8175-a42f42c738b5","resolution":{"observed_at":"2026-08-10T21:41:23.882900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-06T08:12:35.134201Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-10T21:41:23.107577Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.107577Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:36d92c8ebf8ba15ca2b4ae0c20f4b955a629e69282122afef171c158f9c0f3c9","observation_id":"499e42d0-3b1c-4c68-be94-31de4bc362c1","resolution":{"observed_at":"2026-08-10T21:41:23.107577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-10T21:41:23.111674Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.111674Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e453adaff27179c0504d8e965f2856d24e3717aea46b4bb17d474e1be2f26b81","observation_id":"c61d8e86-da4b-49e6-a4c5-6cf38dbfbb06","resolution":{"observed_at":"2026-08-10T21:41:23.111674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.868255Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"f1f7cee8-b63e-4860-bec7-ca88c731a5e1","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.117261Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a461e39558526fb2d298b781ec54e983f44e8c95344425e9d3c3b63e87de4d92","observation_id":"f1c5f390-96dd-4313-b408-6294732e2a52","resolution":{"observed_at":"2026-08-10T21:41:23.871666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.858249Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"5e3ca09d-f155-4e4b-bb7c-a0f1496306f5","year":2020},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.121491Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:fb2fedc95cb27270cefc0ae7d278e5907113d6468cd9454dddf1b5eba36f1c7f","observation_id":"0bad9104-fd8f-40cb-b153-c7c5ddda50a0","resolution":{"observed_at":"2026-08-10T21:41:23.861625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.846744Z","title":"Gritsenko, William Chan, Mohammad Norouzi, and David J","venue":null,"work_id":"7c0d3d29-d1ca-4985-9614-a6cc4eb289ad","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.125562Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:5d75a6c5c41550c991309cc4327120dafec3caa2e5d7cb6e030ee525fa68eacd","observation_id":"70106e01-8634-4d2a-a464-c6636c5f02f8","resolution":{"observed_at":"2026-08-10T21:41:23.850704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.834168Z","title":"Lite- flownet: A lightweight convolutional neural network for op- tical flow estimation","venue":null,"work_id":"635a3cf3-5dc5-4fd7-a0f6-bf225daf7d46","year":2018},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.130447Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:2ca189ff8f16f08f62d461857775f70ed37e4e030661aa0400424e762f724986","observation_id":"22eb0cd0-27e1-4441-a6ff-efafc57f659a","resolution":{"observed_at":"2026-08-10T21:41:23.838500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.820685Z","title":"Vmc: Video motion customization using temporal attention adap- tion for text-to-video diffusion models","venue":null,"work_id":"f11fc2bd-290a-4f0c-87b5-89d70d896ca2","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.135093Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:7739ac9bc8e385cb58238d6aac359acb685768652d47f305268390af0117aedc","observation_id":"303cfef8-470b-4e47-955a-e4b3ab7fedd8","resolution":{"observed_at":"2026-08-10T21:41:23.825108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.808283Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"4934d235-3da8-45a7-b796-8e48aa1d993b","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.139775Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:0bcae46c18ddd45db8c9e17378746853d2b840e14457f564ae99b93eeeabfb76","observation_id":"2fbb744c-715f-4aa0-a16d-64183e423ae0","resolution":{"observed_at":"2026-08-10T21:41:23.813063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.796453Z","title":"Dif- fusionclip: Text-guided diffusion models for robust image manipulation","venue":null,"work_id":"71c7a395-05d5-4bfb-996d-fbe713153ccf","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.144193Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b96015e6f831282a61fa7554286342299b2852d3ea1489c7922649180681fa14","observation_id":"ba7ee9c9-93c2-4980-818b-b5d2eec3005a","resolution":{"observed_at":"2026-08-10T21:41:23.800802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.784566Z","title":"Segment any- thing","venue":null,"work_id":"d414a955-442d-4c2e-bae4-c67ff3f8a9d7","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.148464Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:3b5e461f84997a544d8944cc3b47c7e6677a2a885529353fba3a3a62d9e23bb6","observation_id":"21d1b036-6e13-49c2-9cfa-3c7771612fc2","resolution":{"observed_at":"2026-08-10T21:41:23.788808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.772278Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"5c385c7b-8b7c-4fd7-9cb1-83ae9a9952e0","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.152779Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:154579b656fedb4a5cb13da0768e90f0a16be2f49961843cc9078a1af16687ca","observation_id":"1c400dbe-334a-4ce3-bc64-2226a555fd0a","resolution":{"observed_at":"2026-08-10T21:41:23.776350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.760131Z","title":"Learning blind video temporal consistency","venue":null,"work_id":"e7fa3ace-7914-4163-b38d-a94ae4bdb59f","year":2018},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.157139Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b9770094a0838c9e1c563e4a6424e6727b3548cb293916ec59beb473ef5769bc","observation_id":"28fe7f0e-30d1-4f9b-a908-377f16bc1f8a","resolution":{"observed_at":"2026-08-10T21:41:23.764665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.746207Z","title":"Generative image dynamics","venue":null,"work_id":"c38365c7-3214-4533-b896-c0c226770530","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.161189Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b1d4d99f01b41fb9a25cc5e7c6a93e0eaf3ab40272809ff07998f7e383169866","observation_id":"7b8feac7-bac0-47ea-910b-a825789673d9","resolution":{"observed_at":"2026-08-10T21:41:23.750869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.731092Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"b21915c3-ce48-42aa-899c-273e9be0fb87","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.165082Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:acb18728438b49285059f74094f2d0aae5a31207321ca1e7a9a9bcd7375fc7b9","observation_id":"6bf4ffda-2075-41f3-9724-4cd81b2aed1c","resolution":{"observed_at":"2026-08-10T21:41:23.735746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.717042Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"e78cfe9f-14c7-47f9-a7cd-7414f40bf072","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.169506Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:6d7ec1e0310b748d4c7c4bd439f75d4c4f4c93a034e73f4a0baccf71979f8c6a","observation_id":"351b6968-a739-4a8d-9c88-5f125db30d89","resolution":{"observed_at":"2026-08-10T21:41:23.721659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01329","last_updated":"2023-02-02T18:58:58Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:58Z","title":"Dreamix: Video Diffusion Models are General Video Editors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01329","snapshot_observed_at":"2026-08-10T21:41:23.174350Z","title":"Dreamix: Video diffusion models are general video editors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.174350Z"},"links":{"cited_paper":"/paper/2302.01329","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:3aa92c9e2d33165ce322caa81d6e74c95b416a840918bc6d3506e329faa23a8d","observation_id":"b7d3f3d1-ae61-48c9-8b46-e5f3b9286c63","resolution":{"observed_at":"2026-08-10T21:41:23.174350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-10T21:41:23.178964Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.178964Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:1c3f3aee782e6081f18242504ef170eb14b35a1ac163c95c5e1e1e3ba5d27776","observation_id":"ff936bca-0c05-49c4-b8f1-d60b135f20cb","resolution":{"observed_at":"2026-08-10T21:41:23.178964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.702631Z","title":"The best free stock photos, royalty free images & videos shared by creators","venue":null,"work_id":"77ee8e32-b38e-4b2d-85ff-6b8651e3e736","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.183312Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a41d1944f21b1175e107ffa363350167d2a9327766c90e3417f86fec602945c9","observation_id":"517e7d7a-a1e1-41e9-8386-0a1cad6064ae","resolution":{"observed_at":"2026-08-10T21:41:23.707660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.689237Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"d91339ea-1d6a-45e3-86b5-3f81eac17e7e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.186953Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:91e4d5b704843219329db4dee135f32f96f6107b94c5106857abd91aa12d5043","observation_id":"cff524ce-59b4-409a-95cb-5f344c834a7f","resolution":{"observed_at":"2026-08-10T21:41:23.694231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.675646Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"500e70b8-3342-4dd2-96f6-b1ea76d37ac8","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.189983Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:a25a85d9cc15c3cf176ac06fde9352a2a0ba96fa1236342387421e91bb1eb454","observation_id":"e44e7ee3-8a06-474e-841b-62de9cf95fcd","resolution":{"observed_at":"2026-08-10T21:41:23.680598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.193229Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.193229Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e19a8707663d3cc7bf6fbad8761cd35cd812dc68d52d2282b7b4cf51f1e26bd5","observation_id":"f95c7446-3d04-448c-94d5-0893dc9c7a6a","resolution":{"observed_at":"2026-08-10T21:41:23.193229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.654741Z","title":"Motion-i2v: Consistent and controllable image-to-video generation with explicit motion modeling","venue":null,"work_id":"9d2c4ea2-401b-4322-8826-422c27fdcde8","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.197259Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e632e226321b0b8e4f1b1a40fd77625a132d1e3928bda60068b729da03090c2d","observation_id":"318fe1bd-0d9b-4182-a75b-4daf35332f0c","resolution":{"observed_at":"2026-08-10T21:41:23.658961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.642137Z","title":"Dragdiffusion: Harnessing diffusion models for interactive point-based image editing","venue":null,"work_id":"7de6c905-19ad-409d-9a52-b28e41cd3a64","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.201069Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:8b13708e5663cd9ceb5ab76f34372cfebed7e1fe62b2df83a20aa869915bb192","observation_id":"25c25d60-4a7e-4505-91ac-52ecb2aad6a5","resolution":{"observed_at":"2026-08-10T21:41:23.647253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-10T21:41:23.205165Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.205165Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:7484d676bf847aca5d865ee932a4cf8a5073366860cbbc7d4673d2fd5576b450","observation_id":"8536298f-97f5-47d7-8605-5557146a5510","resolution":{"observed_at":"2026-08-10T21:41:23.205165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T21:41:23.210493Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.210493Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:712e5c43b46784e90551fe5544d6ab22445ee72d832a77982652bebad2af84ad","observation_id":"083f91fd-af46-4d96-9ebc-9182b87255c9","resolution":{"observed_at":"2026-08-10T21:41:23.210493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.630146Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"57dca760-2695-4dee-a96d-1000691e8327","year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.214836Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:3fc97f654b82220024b179a2a881a782864f7f0d19eb33a73569cb5f93e2fe3c","observation_id":"c352fc04-3141-449a-adb6-56113b1a92d3","resolution":{"observed_at":"2026-08-10T21:41:23.634223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.612428Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"a7051418-4f76-415c-bcfd-383a2595e4de","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.218661Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:5995ecd64f53754ac9b4b730a55ac4a3460ff28f3ef54895568d3a00802abf93","observation_id":"502916d0-8bbb-479d-8e24-5307fb3577bb","resolution":{"observed_at":"2026-08-10T21:41:23.618168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17599","last_updated":"2024-01-04T01:30:50Z","snapshot_observed_at":"2026-08-10T14:48:14.307906Z","submitted_at":"2023-03-30T17:59:25Z","title":"Zero-Shot Video Editing Using Off-The-Shelf Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17599","snapshot_observed_at":"2026-08-10T21:41:23.222710Z","title":"Zero-shot video editing using off-the-shelf image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.222710Z"},"links":{"cited_paper":"/paper/2303.17599","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:01f290ac59d63f96dd74599487bf8164756cdbc9eefecd284a8e04eb7fea7949","observation_id":"ab4bff79-767a-4a6e-b913-a29a6cfb6975","resolution":{"observed_at":"2026-08-10T21:41:23.222710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09043","last_updated":"2022-03-17T02:45:34Z","snapshot_observed_at":"2026-08-11T08:19:57.218427Z","submitted_at":"2022-03-17T02:45:34Z","title":"Latent Image Animator: Learning to Animate Images via Latent Space Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09043","snapshot_observed_at":"2026-08-10T21:41:23.227332Z","title":"Latent image animator: Learning to ani- mate images via latent space navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.227332Z"},"links":{"cited_paper":"/paper/2203.09043","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:c7c6d8fb09d61ea4510a70eb6ee42f57348a024980c58f96094e86eb84875eb7","observation_id":"70055fc3-79bc-432d-a0cc-067148524f7c","resolution":{"observed_at":"2026-08-10T21:41:23.227332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.600235Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":"09ae5556-8007-4c5c-9b18-34185a6fc8ee","year":2025},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.231637Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:845c1d88c0e452fc1b2a901c0f30990a92dfcdd0d3ea988d3f357892f1384a23","observation_id":"199495d0-fb7e-4021-9684-0400d74f479a","resolution":{"observed_at":"2026-08-10T21:41:23.604875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.586240Z","title":"Gmflow: Learning optical flow via global matching","venue":null,"work_id":"6e123c45-25b4-455a-913e-358bdaf9bc38","year":2022},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.235517Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:0df1e089955d0af1c03b63d137fd5f0d8ddb3fc96dc6a6872dbb61dfbfcff53d","observation_id":"1d8ae152-cffd-4991-a443-6e2d8181d4d4","resolution":{"observed_at":"2026-08-10T21:41:23.591772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00908","last_updated":"2023-09-02T11:13:29Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T11:13:29Z","title":"MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation","version":1},"cited_work":{"arxiv_id":"2309.00908","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00908","snapshot_observed_at":"2026-08-10T21:41:23.345954Z","title":"MagicProp: Diffusion-based Video Editing via Motion-aware Appearance Propagation","venue":"cs.CV","work_id":"1b6d71a2-b047-47b2-bf92-f30c74813e82","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.239654Z"},"links":{"cited_paper":"/paper/2309.00908","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:b3dc347e98db0a505187c06e43f74a5893829db9e0041000d60e22a6f073659f","observation_id":"9910b07b-a008-48bb-9a9e-ae9c377efd05","resolution":{"observed_at":"2026-08-10T21:41:23.352369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18827","last_updated":"2023-11-30T18:59:06Z","snapshot_observed_at":"2026-08-09T15:22:42.770366Z","submitted_at":"2023-11-30T18:59:06Z","title":"Motion-Conditioned Image Animation for Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18827","snapshot_observed_at":"2026-08-10T21:41:23.244051Z","title":"Motion-conditioned image animation for video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.244051Z"},"links":{"cited_paper":"/paper/2311.18827","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:72171d707fca120b0854f239c7c74f45af8d379b89306b2bea42def587d122ce","observation_id":"c0ed8248-855a-4756-8e54-53116e186248","resolution":{"observed_at":"2026-08-10T21:41:23.244051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.571308Z","title":"Paint by example: Exemplar-based image editing with diffusion models","venue":null,"work_id":"e8737c02-808b-45a4-ac52-f08fab0887dc","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.248392Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:c2a7e79fcf4a7f9a82d6d594c2cf4e74357b9842c9265b37556990bb8f8b4808","observation_id":"b5c1d703-ac6c-4917-83d6-66ab981fce06","resolution":{"observed_at":"2026-08-10T21:41:23.576761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.555769Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"a284729d-6f53-43fc-94ec-ce7be7345cf9","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.252222Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:55944c66e4cb900b111368230beed37a0534c34cfc3375fcbe0bad2af241085d","observation_id":"2c8b40b6-e398-46f4-a5b6-572285736344","resolution":{"observed_at":"2026-08-10T21:41:23.561239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.542868Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"5826120d-9c91-4664-9925-84718ed4f78c","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.256073Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:e4696a989c9cc670e78a7091647080665912e1207edf3aabf3cd3b52a26cf603","observation_id":"d8a2c9ab-1301-4f81-9103-53f53e9856b8","resolution":{"observed_at":"2026-08-10T21:41:23.547123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-10T21:41:23.259850Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.259850Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:fa5b6bad119fdef8bd77f6ab4ad9ed93d56f6e5babb627465f3a5d9be8896eb6","observation_id":"c8588efb-512a-4e5b-b889-c58d44f1794e","resolution":{"observed_at":"2026-08-10T21:41:23.259850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.530447Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"d7fe6b6b-d89a-458c-ac3c-7cc252751e1a","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.264348Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:01f140f2ee828b909ea459b9c28363365800fe2c9fe4cd8e774c1dfdc3fa3015","observation_id":"0171d1bb-3607-4c92-97a5-a5bcbec45c7a","resolution":{"observed_at":"2026-08-10T21:41:23.534380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.518484Z","title":"Sine: Single image editing with text-to-image diffusion models","venue":null,"work_id":"ec9a8401-86aa-4acc-8a5d-a8a13cb9be6e","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.268609Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:2d161fe02038088e3b0684868f7822b69e4abbff6c0c1bd4392feed71edbad56","observation_id":"9dd04a1e-5fb1-45db-877a-6230a2db62ba","resolution":{"observed_at":"2026-08-10T21:41:23.522591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.504030Z","title":"Avid: Any-length video inpainting with dif- fusion model","venue":null,"work_id":"6633c47e-0cff-4fde-b3f0-8c235bf34924","year":2024},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.273112Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:4a13dbd0d9f7afdf0f512acf05d37f0afc5b397c6857c41c6d786d97596b7625","observation_id":"9c9fb6a3-1622-4fcc-9732-5645b813b3f3","resolution":{"observed_at":"2026-08-10T21:41:23.509453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.489666Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":"6ed86a7c-fd55-4f66-a382-e3e13360e1bb","year":2025},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.277490Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:887de743495826da8359759af5d0b3df2a75abc0279b3bb5f9c4a5f54ed8394c","observation_id":"655872eb-92ff-4783-a0db-3fd0baa50417","resolution":{"observed_at":"2026-08-10T21:41:23.494936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:41:23.475484Z","title":"clip-score: CLIP Score for Py- Torch","venue":null,"work_id":"8dc7e70b-c709-4890-863f-b683643db14f","year":2023},"citing_paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T21:41:23.282342Z"},"links":{"citing_paper":"/paper/2501.04325"},"observation_digest":"sha256:aa6e1a8bae41d0bad4b9cddf6664224963cafb8e0bf4cd81d698170578f9bee5","observation_id":"b79f31ca-b2ec-4a36-9ceb-54da19575f76","resolution":{"observed_at":"2026-08-10T21:41:23.480291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.04325","last_updated":"2025-01-08T07:52:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:33:34.936229Z","submitted_at":"2025-01-08T07:52:12Z","title":"Edit as You See: Image-guided Video Editing via Masked Motion Modeling"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2501.04325."}