{"as_of":"2026-08-16T09:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ffc9253ecb7ad81ed11ddff21765b95d880934c4bf9a681606f5274e3ea0582a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:14:36.146697Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01113/citation-record","integrity":"/paper/2608.01113/integrity","json":"/paper/2608.01113/citation-record.json","paper":"/paper/2608.01113"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:35.975532Z","title":"Scaling instruction-based video editing with a high-quality synthetic dataset.arXiv preprint arXiv:2510.15742, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.975532Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:256fc04f343849044cf28d1c8d273ad8ef4f36952a8864c521c868e2cf63ea8e","observation_id":"657b10a4-a0bb-42b0-8f78-5823b143d706","resolution":{"observed_at":"2026-08-15T15:14:35.975532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.983653Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"93ba9512-0879-4cf5-bad1-ba3eeaee5b0b","year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.979280Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:fbf7df7cca49cf5e71f7ff123e94ddc2c257967dc759cf33b9415af4a5fc5e2b","observation_id":"1856cfa5-fccf-4d0a-825a-d496f3c5a391","resolution":{"observed_at":"2026-08-15T15:14:36.987406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T15:14:35.982238Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.982238Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:ff0ffc0ed97643ab1b6f9b08259d6b7cb47a9fcf767dfac40715dcb75aeb72ba","observation_id":"408e0bc6-58b0-4827-b1be-96613547c5e7","resolution":{"observed_at":"2026-08-15T15:14:35.982238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00213","last_updated":"2023-12-01T11:41:34Z","snapshot_observed_at":"2026-08-15T18:06:40.958559Z","submitted_at":"2023-11-01T01:20:12Z","title":"Consistent Video-to-Video Transfer Using Synthetic Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00213","snapshot_observed_at":"2026-08-15T15:14:35.986744Z","title":"Consistent video- to-video transfer using synthetic dataset.arXiv preprint arXiv:2311.00213, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.986744Z"},"links":{"cited_paper":"/paper/2311.00213","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:7e91510271bbc5106599d9ad2e070852dfea8193ba4357b0b6fc5a0412595760","observation_id":"18f9807a-5d72-4114-a3c3-70770a3eedaf","resolution":{"observed_at":"2026-08-15T15:14:35.986744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.972707Z","title":"Rass: Improving denoising diffusion sam- plers with reinforced active sampling scheduler","venue":null,"work_id":"c8dc66ad-20d0-4973-8646-ede5e44c52ab","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.990411Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:914275999a83d52ab262f53d51b74e7468934317aa0a2290cc21c9fae61e539f","observation_id":"b75ff8c6-70e0-4f0d-9f67-4e751ab27f24","resolution":{"observed_at":"2026-08-15T15:14:36.976630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.961998Z","title":"Why compress what you can generate? when gpt-4o generation ushers in image compression fields","venue":null,"work_id":"bdd74ad8-aa41-418f-afc2-24acaed121bf","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.994108Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:d6e4bc104f65d2d037c6ef0dd51439258b6d3a1a3ee0f8eabbeda2abb4152957","observation_id":"db7eded1-6605-4037-9244-54308783348a","resolution":{"observed_at":"2026-08-15T15:14:36.966130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-13T00:13:26.846718Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-08-15T15:14:35.997634Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing.arXiv preprint arXiv:2405.04007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:35.997634Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:d513a12e63a1afc10d02266f26a2b1f172945c1d6df0fbdda455ae4b37df8c62","observation_id":"c7e8d454-32fa-46ec-9c31-56a81201e8ce","resolution":{"observed_at":"2026-08-15T15:14:35.997634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.949430Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":"7db1e440-dc82-461d-afbd-e0b6403b95d6","year":2021},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.001663Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:1f3b5f18042807d52648e069b6658e4107aaccbee9dc22fe821f1eb60baae4dc","observation_id":"eb512c56-8fb9-4959-b4af-05742885a328","resolution":{"observed_at":"2026-08-15T15:14:36.953342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-15T15:14:36.005696Z","title":"Imagen video: High definition video generation with diffusion mod- els.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.005696Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:02ed8ba8ae87a5d342b5e783d3c1b99fa85ec84457193512ac55c4fb4442b71e","observation_id":"48d98d9a-6c21-44d9-86c0-995bf19d8587","resolution":{"observed_at":"2026-08-15T15:14:36.005696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.009394Z","title":"Video dif- fusion models.Advances in neural information processing systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.009394Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:bccdb98cfc2897a79c210bf8996ff5e70cd3b7ad4a192c7bee1baffb26d1c987","observation_id":"f8cba0fc-3fa7-4c3d-93bf-6345952e11fa","resolution":{"observed_at":"2026-08-15T15:14:36.009394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-15T15:14:36.012707Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.012707Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:0307ae1f1ae055c27bb4fc6068b72f8f9dc7b6b543c55376c9ba6f119b1b9d7e","observation_id":"25ef2ba6-7d42-469c-831d-7876d2fdfc32","resolution":{"observed_at":"2026-08-15T15:14:36.012707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.930476Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"5d189417-732b-462c-a9c0-f890941a50f3","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.016317Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3351fc66a25858034e89db5b053b5e55c30873c1831146f8cea9a7b285df0639","observation_id":"c1b5049f-49ca-4103-864e-8cf6af35b0b1","resolution":{"observed_at":"2026-08-15T15:14:36.934410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-15T23:24:13.384254Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-15T15:14:36.019799Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video gener- ation.arXiv preprint arXiv:2505.04512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.019799Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:09084bd14cea7ef514025114bd859d7dbed1abacfb357169c768f8ce58310254","observation_id":"49884281-ad6b-42ba-a8a2-3f56dd32d611","resolution":{"observed_at":"2026-08-15T15:14:36.019799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.023233Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.023233Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:aa7a327c6fde0e9d4c14f9ba023c454df92ed86be0cdd2af24f34d3a978263a2","observation_id":"7cde7cc7-1d24-4b9c-aac6-7a87e4f26e5f","resolution":{"observed_at":"2026-08-15T15:14:36.023233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.026401Z","title":"Anyedit: Edit any knowledge encoded in language models.arXiv preprint arXiv:2502.05628, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.026401Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:86509051c9fada43e7c5070607ed65b5fe6fce8c9555a79d10f3c5e1a339b931","observation_id":"4dd9d16c-bfc1-46db-894b-b7216878607e","resolution":{"observed_at":"2026-08-15T15:14:36.026401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.029525Z","title":"Vace: All-in-one video creation and editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.029525Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:031498eb5c67959628f4f67c43bb82a2ae95a6e526a26aec3ebc94867eacb172","observation_id":"c4b2e429-8f5b-4a6f-b212-61d7d3bcaf88","resolution":{"observed_at":"2026-08-15T15:14:36.029525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.032244Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.032244Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:de7511f732bc27db6aab012cdc589a20868a631ef9edb79162e2deb7c83c7a39","observation_id":"e2c88d85-f4ca-499b-becf-0f87bb95e566","resolution":{"observed_at":"2026-08-15T15:14:36.032244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T15:14:36.035188Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.035188Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:464b45d5a68dcf10bc90371c5d958650d084251b0c339fb5a67e2e7a751fab3f","observation_id":"0242e969-b0d2-454e-8224-5ea3437cee65","resolution":{"observed_at":"2026-08-15T15:14:36.035188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-14T08:56:25.336901Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-15T15:14:36.039061Z","title":"Anyv2v: A tuning-free framework for any video-to- video editing tasks.arXiv preprint arXiv:2403.14468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.039061Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:e8f4fb89d05036ba598d55fba33ff67ccdad321c0797e9d6f4cff93003bace79","observation_id":"05eb5eef-d43d-4443-912a-ad663df13610","resolution":{"observed_at":"2026-08-15T15:14:36.039061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-08-08T20:24:18.281655Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01801","snapshot_observed_at":"2026-08-15T15:14:36.042340Z","title":"Omniv2v: Versatile video generation and edit- ing via dynamic content manipulation.arXiv preprint arXiv:2506.01801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.042340Z"},"links":{"cited_paper":"/paper/2506.01801","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:5fe6912b1d5c489ce93022ceef68a4568f9822edc9ed06e0e2adf2f8134f8f62","observation_id":"e3f22532-7f1b-41d9-85ae-d90033f338a7","resolution":{"observed_at":"2026-08-15T15:14:36.042340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19650","last_updated":"2024-09-29T10:46:19Z","snapshot_observed_at":"2026-08-12T22:35:11.430462Z","submitted_at":"2024-09-29T10:46:19Z","title":"Grounding 3D Scene Affordance From Egocentric Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19650","snapshot_observed_at":"2026-08-15T15:14:36.046347Z","title":"Grounding 3d scene affordance from egocentric interactions.arXiv preprint arXiv:2409.19650, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.046347Z"},"links":{"cited_paper":"/paper/2409.19650","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:470120425f521bb86d44b6f56511262c2707121c0bc04f76672ddafc87bebeb2","observation_id":"4c7772c1-8450-4621-a2fe-7362429c370a","resolution":{"observed_at":"2026-08-15T15:14:36.046347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.900425Z","title":"Stablev2v: Stabilizing shape consistency in video-to- video editing.IEEE Transactions on Circuits and Systems for Video Technology, 2025","venue":null,"work_id":"4b1d9150-1df1-4779-b1d8-8ce85f75350a","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.049901Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:88eefc0bc043321c8d94b61dff9f70ec901d3ceb628bbee0d2cdc4e9f74fdcd6","observation_id":"b1fa8719-768e-4bd2-bd97-7155ad412c6f","resolution":{"observed_at":"2026-08-15T15:14:36.904108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.890194Z","title":"The health- wealth gradient in labor markets: Integrating health, in- surance, and social metrics to predict employment density","venue":null,"work_id":"af4e57a1-4faf-42b2-afb0-593ff7bdaddb","year":2026},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.052062Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:c242c69d72a8c766b7f1d7339f52c1a239be7134d6655b6f9fd1cea56af47c54","observation_id":"409ef355-6b9c-41e2-945a-6a7dd9d41699","resolution":{"observed_at":"2026-08-15T15:14:36.893023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.054760Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.054760Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:b064d41ad6d381f8835f75981f1a1df28ead8d671ea19e2ca0af37277b45e1a9","observation_id":"4f40e9e3-6641-4c18-a16c-9f04c1aa84a9","resolution":{"observed_at":"2026-08-15T15:14:36.054760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.057103Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.057103Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:2d60e6da877d6de430aba9ee6df72c7e14912126aefbe68f8f4125d435560b8e","observation_id":"34839ddd-5a94-46ac-b8ce-f8a987f2cca6","resolution":{"observed_at":"2026-08-15T15:14:36.057103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.863675Z","title":"Magic- stick: Controllable video editing via control handle transfor- mations","venue":null,"work_id":"7b132ae1-132a-452a-9b54-e5b8bfffd3df","year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.059802Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:3d90346a79b72edb45fe595ea90901810e9db90cc30cd337c0889178f0cda43e","observation_id":"5be0a624-c720-4b35-ab97-43354a0f784d","resolution":{"observed_at":"2026-08-15T15:14:36.868611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.062312Z","title":"In- structx: Towards unified visual editing with mllm guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.062312Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:4c337c95a26c6c5b5b25ac1d0c13f9a7d56951916d1d3a1a449f0e1e4feb617d","observation_id":"6d48c170-3a29-4bf3-98e0-67d67d71e691","resolution":{"observed_at":"2026-08-15T15:14:36.062312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.851251Z","title":"Occluded video instance segmentation: A bench- mark.International Journal of Computer Vision, 130(8): 2022–2039, 2022","venue":null,"work_id":"aac95df6-c78e-4874-8d4a-b77edcffc530","year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.064649Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:dbcfb549a72f95338f0a97049b57b2a06061c0b0e23d4a5335c6d516f64c51ac","observation_id":"d2585ad4-dec7-4090-9764-6c2391d8a21d","resolution":{"observed_at":"2026-08-15T15:14:36.855427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.840717Z","title":"Instructvid2vid: Controllable video editing with natural language instructions","venue":null,"work_id":"a4394b52-4c80-4258-a1a1-3a3ff22201ba","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.067106Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:ddfb811ddc4ce7fe8660f723fd1fb489165dba8cf65a7c8ee2de584be0c678e1","observation_id":"98cde1d6-e308-4324-ab13-0f0a5d78d10a","resolution":{"observed_at":"2026-08-15T15:14:36.843912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.829213Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"c3d4e7dd-4398-4dd3-aa9b-99b8b5923576","year":2020},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.069273Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:ff610975e0952df19da475a03141e97884dfbc541f60c1c38f17f2e26114ddab","observation_id":"64bf5aa5-8938-4b18-8474-807bb8e824c3","resolution":{"observed_at":"2026-08-15T15:14:36.832657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T15:14:36.071477Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.071477Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:a9f6b00235e6a526412b5d3288534361e41b732ba48204ec391e460da18f776c","observation_id":"2141106f-c39d-43ae-bfa7-3cc3fee87fb2","resolution":{"observed_at":"2026-08-15T15:14:36.071477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.818435Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"3fd2f691-1d23-4c0b-b6a1-cefc983faf01","year":2022},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.075387Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:4f8cf9eea8bdc207c1601d5997a539d9cd13baf434f7724459f3e130d5437f08","observation_id":"3fcd91b3-7f33-49e9-8c2f-baff1f40219b","resolution":{"observed_at":"2026-08-15T15:14:36.821389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.078800Z","title":"Omni-video: Democratizing uni- fied video understanding and generation.arXiv preprint arXiv:2507.06119, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.078800Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:31e0be22f3668f6338ffa35b7830578cb937c0e3cb6be32a7f4cc90fc8f808e2","observation_id":"83fff1b4-c3a0-4f43-bf40-4a6491434b31","resolution":{"observed_at":"2026-08-15T15:14:36.078800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.808125Z","title":"Lucy edit: Open-weight text-guided video editing, 2025","venue":null,"work_id":"e0554366-93d0-4e41-a368-176cd7015cce","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.081791Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:9d0b7e5b5a44086a8e2d909e24564bfaed56b20505885ff31d118956e62748be","observation_id":"af04fc58-2e23-4c2a-bbe7-cc285382811b","resolution":{"observed_at":"2026-08-15T15:14:36.811263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T15:14:36.085011Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.085011Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:30c9ff40c087e58abf0d18b921aa02355336b6613a992e944071a563913b12b7","observation_id":"d0dc72c7-8972-4b1e-bc7e-45e9454f15ff","resolution":{"observed_at":"2026-08-15T15:14:36.085011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.796958Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"05fc3e45-214b-49bf-9824-553110196e5f","year":2019},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.088655Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:96beade541e17d4748aa99bdc3b82ee0a18a53b6e557bab625ebfc931d05e073","observation_id":"57023dca-7e67-4dd7-8704-606aa4574292","resolution":{"observed_at":"2026-08-15T15:14:36.800032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-15T15:14:36.091525Z","title":"Phenaki: Variable length video generation from open domain textual description.arXiv preprint arXiv:2210.02399, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.091525Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:f1b2b5dc79f2c0f09035a4fe0d91c0db0ba01033d78d3661e126b75595fbcf5e","observation_id":"9ab29126-2f77-4800-ae0e-3ff4fbd845f6","resolution":{"observed_at":"2026-08-15T15:14:36.091525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-15T15:14:36.096079Z","title":"Modelscope text-to-video technical report.arXiv preprint arXiv:2308.06571, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.096079Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:b53a5b31328ebe617a725d492a687c70cd586e44b7cc5f0e81f5158b489a25b8","observation_id":"3cb4d851-d6ff-425f-9239-27bf6f9efad8","resolution":{"observed_at":"2026-08-15T15:14:36.096079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.784802Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":"3318bb09-f9ee-4fbf-a339-c413bfd95c10","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.099979Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:d4d191e46b8eb953f50fddbe5fd536cd5a59bf66f076567ee5eaeb9f1cb41abf","observation_id":"e663e69f-bf22-4cbb-9f2b-755e9db47ae8","resolution":{"observed_at":"2026-08-15T15:14:36.788680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.774108Z","title":"Tiv-diffusion: Towards object-centric movement for text-driven image to video gen- eration","venue":null,"work_id":"1b72604b-6d36-41dc-9b5c-383d77b440cf","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.103092Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:a003bc3fe5616cc53456b7a45df567728125298db8d69528ff273811a01db442","observation_id":"8fb1b249-ffac-4e93-a955-c98c5a7a2aa0","resolution":{"observed_at":"2026-08-15T15:14:36.778051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.762271Z","title":"Re-attentional con- trollable video diffusion editing","venue":null,"work_id":"b216fd1d-e5a5-4c24-aed0-743d46ce0385","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.106568Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:cbab9b1e568c7da48d3a4911b5434003561d9f6e7f2329c903369bff8b08fa70","observation_id":"f013a9ff-17b8-40ca-9547-f6c71f7c7fc6","resolution":{"observed_at":"2026-08-15T15:14:36.765446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.751959Z","title":"Training-free controllable text-guided video editing.IEEE Transactions on Circuits and Systems for Video Technology, 2026","venue":null,"work_id":"113e5ca0-1bf3-4a1e-8ed1-cfd994622bd8","year":2026},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.109921Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:45717fa7f69630a0078ef077bf5f0646697e76b3e57347afc85665ad0473b51e","observation_id":"43379ae1-bdc5-4091-8111-ffe361a8a947","resolution":{"observed_at":"2026-08-15T15:14:36.755803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.741427Z","title":"Phrasecut: Language-based image segmen- tation in the wild","venue":null,"work_id":"be68f9ed-7695-4e46-abbd-84057b1d28bd","year":2020},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.112795Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:c71c8d555e24a45fd0ebdd2320ce15096b9a41052e58012b70e3a649ee54e963","observation_id":"d7a7aec6-83e1-4638-adb3-63faecad4f77","resolution":{"observed_at":"2026-08-15T15:14:36.745577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.729388Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"e05d87c1-4f28-4aff-a143-84393bb74c16","year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.115970Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:04a723a70cc2fd4fa4a7809b467eb703506a9556f37cc080f284ca678365aa60","observation_id":"c685c6db-e0dd-4fca-b8ee-7b27984456af","resolution":{"observed_at":"2026-08-15T15:14:36.733642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.717489Z","title":"Insvie-1m: Effective instruction-based video editing with elaborate dataset construction","venue":null,"work_id":"8ce2a9e9-bb5a-48d5-a7a9-33704a861172","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.119760Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:b33356e8b3364c83df04c7bcc025d26db1cfe15a569f6a1bded262d964b14d0d","observation_id":"2f70e7ea-a7e9-4628-b819-5d9dc8fb09d1","resolution":{"observed_at":"2026-08-15T15:14:36.721670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.122798Z","title":"Veg- gie: Instructional editing and reasoning video concepts with grounded generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.122798Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:f20f80f5ca3423271023fbd7e32601e7023b7e32e5f489a342536d0e045c0c15","observation_id":"67b4273c-b3c0-4edc-8f4b-aa0bce3e75e6","resolution":{"observed_at":"2026-08-15T15:14:36.122798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.700543Z","title":"Editworld: Simulating world dynamics for instruction- following image editing","venue":null,"work_id":"790fdce1-b4d1-4edb-b6ab-f96af65af0c0","year":null},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.125635Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:042a58ea59e6ffa60de49ad65b4418ec64acc50f1d8bd276f8b825ffadb4c74a","observation_id":"222f1b9e-0d29-495a-98a4-845715a0059e","resolution":{"observed_at":"2026-08-15T15:14:36.704257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-15T15:14:36.128527Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.128527Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:76bda0ac10da2ddf6fab2e23dca644476c73bb42e55862c0976019e87da3560a","observation_id":"8ba8b5ea-f2e3-400f-bd20-5da9728d9eab","resolution":{"observed_at":"2026-08-15T15:14:36.128527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11568","last_updated":"2024-06-05T07:05:15Z","snapshot_observed_at":"2026-08-16T09:44:12.764252Z","submitted_at":"2024-03-18T08:42:08Z","title":"EffiVED:Efficient Video Editing via Text-instruction Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11568","snapshot_observed_at":"2026-08-15T15:14:36.132218Z","title":"Effived: Efficient video editing via text-instruction diffusion models.arXiv preprint arXiv:2403.11568, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.132218Z"},"links":{"cited_paper":"/paper/2403.11568","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:a347800bc33449ed92aa3faedba79ec436a98c3a4031db1a8de97003c0720690","observation_id":"89c0ee69-c1c6-411c-8e1c-6e5af7d15788","resolution":{"observed_at":"2026-08-15T15:14:36.132218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.689748Z","title":"Motionpro: A precise mo- tion controller for image-to-video generation","venue":null,"work_id":"935f5fd5-e898-4ec8-b024-2754bbfb87d0","year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.135815Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:13ddbef2b13c6f9bb593c8b525cc8a32832b0bca43ceec1407d60d38a9f57e4a","observation_id":"106458a7-e319-4faf-9c0d-7a77c611b3f4","resolution":{"observed_at":"2026-08-15T15:14:36.693440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.678795Z","title":"Ultraedit: Instruction-based fine-grained im- age editing at scale.Advances in Neural Information Pro- cessing Systems, 37:3058–3093, 2024","venue":null,"work_id":"5217e8eb-7c09-4c43-8fc2-a0918bc62f2c","year":2024},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.139111Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:1f6b87a75b79a8427df82c82d4bc95ed120ad5d2273fcb7be46a7fd312dac60d","observation_id":"892ca003-1808-4665-9ca2-76f4c6b06c01","resolution":{"observed_at":"2026-08-15T15:14:36.681969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:14:36.666517Z","title":"Semantic under- standing of scenes through the ade20k dataset.International journal of computer vision, 127(3):302–321, 2019","venue":null,"work_id":"f9cab4ab-d01d-4e05-b8ef-95e1ad3fdb4c","year":2019},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.142912Z"},"links":{"citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:de308c9e1f7375c62a052e707a0f4c9f776c3b479c9f844496122a9cac67cb3c","observation_id":"6937549a-7058-4ae0-a562-31ce580c7c73","resolution":{"observed_at":"2026-08-15T15:14:36.670892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06734","last_updated":"2025-03-12T07:47:48Z","snapshot_observed_at":"2026-08-13T19:05:32.473398Z","submitted_at":"2025-02-10T17:58:22Z","title":"Se\\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06734","snapshot_observed_at":"2026-08-15T15:14:36.146697Z","title":"Se\\˜ norita-2m: A high-quality instruction- based dataset for general video editing by video specialists","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:14:36.146697Z"},"links":{"cited_paper":"/paper/2502.06734","citing_paper":"/paper/2608.01113"},"observation_digest":"sha256:fb67fc291727317525f391b0082c7d05cb88c5c0cba36cbeb954989b94b8bd46","observation_id":"f2bbfc9a-9c3a-44b6-b89a-7f1cfbfb6813","resolution":{"observed_at":"2026-08-15T15:14:36.146697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01113","last_updated":"2026-08-02T09:20:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T15:09:42.160504Z","submitted_at":"2026-08-02T09:20:15Z","title":"CoT-Edit: Let CoT Guide Instruction Video Editing"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.01113."}