{"as_of":"2026-08-12T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be75e2988cb36046a16aafd759b1cd3a9f3e75b6b9dc4f2190fc2a127f7a410f","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:08:09.479706Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T21:17:34.738412Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-07-13T22:08:47.493022Z","title":"Unified video editing with temporal reasoner.arXiv preprint arXiv:2512.07469, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.19226","last_updated":"2026-07-02T17:59:52Z","snapshot_observed_at":"2026-08-06T17:22:57.751005Z","submitted_at":"2026-03-19T17:59:45Z","title":"Under One Sun: Multi-Object Generative Perception of Materials and Illumination","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T22:08:47.493022Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2603.19226"},"observation_digest":"sha256:529c28d15c182e4295ae93eea8dad89ab344217bce1209c895a1e962875489b9","observation_id":"673a51e5-62a2-41cd-92b7-fcbab60ac582","resolution":{"observed_at":"2026-07-13T22:08:47.493022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2604.17021","last_updated":"2026-04-18T15:09:01Z","snapshot_observed_at":"2026-08-11T09:37:14.154640Z","submitted_at":"2026-04-18T15:09:01Z","title":"LIVE: Leveraging Image Manipulation Priors for Instruction-based Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:41.483427Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2604.17021"},"observation_digest":"sha256:e7d5b7291d079abece57b6b3090a2021a13da720e468948aa10b6e5f1311110d","observation_id":"d9264289-77db-42ec-9c64-29fddbeb4f75","resolution":{"observed_at":"2026-05-10T07:21:55.092748Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.02442","last_updated":"2026-05-04T10:42:26Z","snapshot_observed_at":"2026-07-30T10:52:38.632184Z","submitted_at":"2026-05-04T10:42:26Z","title":"Measuring AI Reasoning: A Guide for Researchers","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-08T18:53:18.586923Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.02442"},"observation_digest":"sha256:17c29004c65c6edfa0096fb87754d4a62ad33e607b492ac2903bf97f3c71616d","observation_id":"e0c24c1c-a013-4152-b8b2-53ce3796af44","resolution":{"observed_at":"2026-05-09T06:05:36.822341Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.14664","last_updated":"2026-05-26T03:55:48Z","snapshot_observed_at":"2026-08-02T00:36:02.181810Z","submitted_at":"2026-05-14T10:19:19Z","title":"MiVE: Multiscale Vision-language features for reference-guided video Editing","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T05:23:20.179387Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.14664"},"observation_digest":"sha256:b8614aeb99c8eb772fdb0fbb72cfd9bb6e72c7d9564da94992c837f678d6ddf6","observation_id":"203ddc51-f257-408c-ae8a-59db90273322","resolution":{"observed_at":"2026-05-15T05:25:03.025027Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.18748","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-08-12T08:57:41.001844Z","submitted_at":"2026-05-18T17:59:03Z","title":"Aurora: Unified Video Editing with a Tool-Using Agent","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T10:47:05.038308Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.18748"},"observation_digest":"sha256:5406ee5f28045bd498bfdb070f3e8f692d6f4e59a7300d36a069b9e784fd9fda","observation_id":"7a4df6b6-ac20-4692-b2a6-c6abc1c1f795","resolution":{"observed_at":"2026-05-20T10:48:12.748155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.22051","last_updated":"2026-05-21T06:38:22Z","snapshot_observed_at":"2026-07-06T23:32:25.286443Z","submitted_at":"2026-05-21T06:38:22Z","title":"EasyVFX: Frequency-Driven Decoupling for Resource-Efficient VFX Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T06:30:18.961069Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.22051"},"observation_digest":"sha256:ef081ee3eb04ce70c04e0fe6e01fdb5756c4a3b86b4e7fc5dc5624e5756bdbb3","observation_id":"687fce77-0416-4785-abb2-7bc08afa245a","resolution":{"observed_at":"2026-05-22T06:31:09.866436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.23192","last_updated":"2026-05-27T07:47:23Z","snapshot_observed_at":"2026-07-06T23:33:24.215365Z","submitted_at":"2026-05-22T03:19:24Z","title":"Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-25T05:00:31.868653Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.23192"},"observation_digest":"sha256:f5aa77ccb0958c5788e1711ac823940760e84b47e13ae41b41bf678b14541076","observation_id":"1167479a-0673-4405-8f4c-d74c30f72bdf","resolution":{"observed_at":"2026-05-25T05:06:38.710940Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2605.25193","last_updated":"2026-05-29T13:55:41Z","snapshot_observed_at":"2026-08-02T06:28:29.008131Z","submitted_at":"2026-05-24T17:50:45Z","title":"SpongeBob: Sync-Aware Harmonious Audio-Visual Generative Editing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T12:07:44.914337Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2605.25193"},"observation_digest":"sha256:cd93330865d289f77eccbe1e186db7de969004e1fe793a4e8cbc3663cc5ef6bb","observation_id":"f6fa1b44-63cb-48fa-ae9a-013a038b7493","resolution":{"observed_at":"2026-06-30T12:34:39.551643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2606.08514","last_updated":"2026-08-04T12:17:45Z","snapshot_observed_at":"2026-08-11T09:27:50.623738Z","submitted_at":"2026-06-07T08:40:43Z","title":"OmniTryOn: Video Try-On Anything at Once!","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T19:00:44.243335Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2606.08514"},"observation_digest":"sha256:9fd6decd0034ac998b56075565dc4137a8cb0616c41e7029a5a907b54060fa73","observation_id":"468483f5-cd51-401d-8f50-5da5ee91d5c8","resolution":{"observed_at":"2026-07-02T22:17:26.370481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2606.26740","last_updated":"2026-07-13T08:24:23Z","snapshot_observed_at":"2026-08-02T18:32:08.335509Z","submitted_at":"2026-06-25T08:24:03Z","title":"LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-26T05:26:40.872369Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2606.26740"},"observation_digest":"sha256:9880afda76e2823454498dfa9eacaeaa3a0a5df47dbee27f4c3a578a9d03d65c","observation_id":"35f9c6f4-cb62-4e04-b491-6e1687670602","resolution":{"observed_at":"2026-07-04T13:09:51.194717Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-07-14T17:15:17.609282Z","title":"Unified video editing with temporal reasoner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26740","last_updated":"2026-07-13T08:24:23Z","snapshot_observed_at":"2026-08-02T18:32:08.335509Z","submitted_at":"2026-06-25T08:24:03Z","title":"LiveEdit: Towards Real-Time Diffusion-Based Streaming Video Editing","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-14T17:15:17.609282Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2606.26740"},"observation_digest":"sha256:4656bd71c656916fff1e705d559efbf9c76e53e665a033e6c9eb067b7d0919cc","observation_id":"8028b77a-6563-40bd-9016-47798f857e36","resolution":{"observed_at":"2026-07-14T17:15:17.609282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":"2512.07469","doi":"10.48550/arxiv.2512.07469","metadata_source":"pith","pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","venue":"cs.CV","work_id":"41eadf73-66bd-4058-9dc2-d9d37bc8f31b","year":2025},"citing_paper":{"arxiv_id":"2606.30003","last_updated":"2026-06-29T09:12:20Z","snapshot_observed_at":"2026-08-02T20:40:04.994972Z","submitted_at":"2026-06-29T09:12:20Z","title":"GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-30T06:48:44.049285Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2606.30003"},"observation_digest":"sha256:d18d3c62b99b8bdd67cac7cc31e8402436b0c5ebe6e81ee8563b6f4fae2231e5","observation_id":"7c326e98-7de6-428a-8ba9-84a5b6eebf0c","resolution":{"observed_at":"2026-06-30T06:54:20.585047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.412777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-03T03:17:59.749692Z","title":"arXiv preprint arXiv:2512.07469 (2025) 2, 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29627","last_updated":"2026-07-31T16:59:46Z","snapshot_observed_at":"2026-08-05T23:16:09.548439Z","submitted_at":"2026-07-31T16:59:46Z","title":"FlexComposer: Unified Video Compositing from Images to Dynamic Footage with Flexible Trajectory Control","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T03:17:59.749692Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2607.29627"},"observation_digest":"sha256:66e1abf342e72a3adc4ebcf7cd48073bf914fbd64fcab7918f203b8bfdfc9a70","observation_id":"d2b4d114-0e43-4588-a215-2f901cf30948","resolution":{"observed_at":"2026-08-03T03:17:59.749692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07469","snapshot_observed_at":"2026-08-04T21:17:34.738412Z","title":"Unified video editing with temporal reasoner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01771","last_updated":"2026-08-03T06:45:00Z","snapshot_observed_at":"2026-08-07T23:24:08.857147Z","submitted_at":"2026-08-03T06:45:00Z","title":"LiveLight: Real-time Streaming Video Relighting with Interactive Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T21:17:34.738412Z"},"links":{"cited_paper":"/paper/2512.07469","citing_paper":"/paper/2608.01771"},"observation_digest":"sha256:be1a85e85bf10c3b52885ca91afaf8a5a2aee5b34e20431ce794b3cd4419ff97","observation_id":"969f71ca-41fe-44dc-816a-47bb1b84cb88","resolution":{"observed_at":"2026-08-04T21:17:34.738412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.07469/citation-record","integrity":"/paper/2512.07469/integrity","json":"/paper/2512.07469/citation-record.json","paper":"/paper/2512.07469"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.05639","last_updated":"2025-04-09T02:05:33Z","snapshot_observed_at":"2026-08-10T18:38:14.532829Z","submitted_at":"2025-03-07T17:59:46Z","title":"VideoPainter: Any-length Video Inpainting and Editing with Plug-and-Play Context Control","version":3},"cited_work":{"arxiv_id":"2503.05639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05639","snapshot_observed_at":"2026-06-29T14:33:31.380708Z","title":"Videopainter: Any- length video inpainting and editing with plug-and-play con- text control","venue":null,"work_id":"a4ebf1f7-e530-4267-80f6-a857b089fc96","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2503.05639","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:78f6e7eb2842e507298886acafeff1b0e53989641716d0141e2f8b8e5377a798","observation_id":"24983313-b784-4d27-9919-9789569b95a9","resolution":{"observed_at":"2026-05-17T00:08:43.083519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- structpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"234a8dd3-99e2-44fd-8cf0-046da30de45d","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f983286f00560a2d952026135100b6e5a894f7887086f8133569a1c9f38b05d3","observation_id":"ad412ef4-1c94-4a36-975e-7ae2ddf56006","resolution":{"observed_at":"2026-05-17T00:08:43.954205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"8a5a47d5-320f-431e-953a-e774104b82a0","year":2021},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:93dd3cc82cafa296d06ad42846dee0467fca79b336c7f06f8c05b85b174f2986","observation_id":"f2040738-bd9b-4c94-ba93-3037299365e3","resolution":{"observed_at":"2026-05-17T00:08:43.948974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21760","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T19:16:00.489699Z","title":"Univid: Unifying vi- sion tasks with pre-trained video generation models","venue":null,"work_id":"0a3fddd4-73e3-45bd-836e-95863155332e","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:fcc4e2b23d971e0fac4c1805efe6d138ab2da833a767a1e0156a2a0c58abdda2","observation_id":"0ca5f318-158b-4d61-bbe1-95ef2bcc86bc","resolution":{"observed_at":"2026-05-17T00:08:43.073082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00213","last_updated":"2023-12-01T11:41:34Z","snapshot_observed_at":"2026-08-10T22:56:45.468777Z","submitted_at":"2023-11-01T01:20:12Z","title":"Consistent Video-to-Video Transfer Using Synthetic Dataset","version":3},"cited_work":{"arxiv_id":"2311.00213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00213","snapshot_observed_at":"2026-07-04T13:09:51.162552Z","title":"arXiv preprint arXiv:2311.00213 , year=","venue":null,"work_id":"d795adb5-f50a-4e89-a8a5-46b3551f6485","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2311.00213","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:0f6df120ba9936a2af4caaa7b95d21b9cf443b159352eac53a4c37773ae53317","observation_id":"77ffe354-5319-49b2-a487-fc6440eff0a0","resolution":{"observed_at":"2026-05-17T00:08:43.097889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flatten: Optical flow- guided attention for consistent text-to-video editing","venue":null,"work_id":"a7012f3d-4765-461c-aa1e-4b94ddd12acb","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:d38c9509cb267e343fbbf843560e9e68b12bb0bdf459343959cdb22863bdb33e","observation_id":"4f981e02-b927-44ee-ad1d-fc24ef2bb5bd","resolution":{"observed_at":"2026-05-17T00:08:44.006260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoswap: Customized video subject swapping with interactive semantic point cor- respondence","venue":null,"work_id":"70db9eec-0975-4758-a24e-56849dfe55a0","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:06eb8ac158995bb7ea69feb14fa180fef556ca99c14a551416b2f00cd02c0614","observation_id":"e7dbb8cd-7315-4e68-9f19-336d4727f1e1","resolution":{"observed_at":"2026-05-17T00:08:44.053998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion with offset noise.https: //www.crosslabs.org/blog/diffusion-with- offset-noise","venue":null,"work_id":"a995df29-3313-40fd-992f-9511ce524f39","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:50014a134485bf2116d3bdf8d751012999abdbea11379bd9f9c2b621a8e181cd","observation_id":"5a7303d2-593a-4dc5-803d-e594ad5eab8f","resolution":{"observed_at":"2026-05-17T00:08:43.978680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23775","last_updated":"2024-11-05T06:41:27Z","snapshot_observed_at":"2026-07-06T19:42:47.238254Z","submitted_at":"2024-10-31T09:45:00Z","title":"In-Context LoRA for Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2410.23775","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.23775","snapshot_observed_at":"2026-07-04T20:10:08.832341Z","title":"In-context lora for diffusion transformers.arXiv preprint arXiv:2410.23775, 2024a","venue":null,"work_id":"135ddfe7-494d-4ec1-a27b-18a1ed8687f6","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2410.23775","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:0c1f80d1be629fe464c631c8a5900e789580cdd1eb15d4a37a988678d8e7a497","observation_id":"4d1af17a-580a-4876-9af3-a7f0ee6b4962","resolution":{"observed_at":"2026-05-17T00:08:43.185450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f082518c0f2efca7192f9945b998140a7949045ea9759aad07517062a0ee0ae8","observation_id":"9e14df94-c459-452c-9053-756506091b4c","resolution":{"observed_at":"2026-05-17T00:08:43.153322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"cited_work":{"arxiv_id":"2509.20360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20360","snapshot_observed_at":"2026-07-04T13:09:51.206475Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","venue":"cs.CV","work_id":"3100bcea-8034-4051-8a0c-f45cde73d2d6","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2509.20360","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:b602ea91ae21ff9879817e76adb3de46a30e6a8f2fb63b9842f3dd51bf0f6816","observation_id":"c5c27957-f624-4d49-8138-e2ead4cb1868","resolution":{"observed_at":"2026-05-17T00:08:43.194748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19907","last_updated":"2025-03-25T17:59:06Z","snapshot_observed_at":"2026-08-07T16:37:34.121844Z","submitted_at":"2025-03-25T17:59:06Z","title":"FullDiT: Multi-Task Video Generative Foundation Model with Full Attention","version":1},"cited_work":{"arxiv_id":"2503.19907","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19907","snapshot_observed_at":"2026-07-03T17:08:42.921278Z","title":"Fulldit: Multi-task video genera- tive foundation model with full attention","venue":null,"work_id":"d3c75fb5-7649-4107-aec0-9801737dfb8e","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2503.19907","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:8df38c72fe3b81497a04e0b7901462874224531ace2669aa88bd952cac6e4635","observation_id":"af9e40fa-91d3-4906-8109-06af2f550f28","resolution":{"observed_at":"2026-05-17T00:08:43.140676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are zero-shot reasoners.Advances in neural information pro- cessing systems, 35:22199–22213","venue":null,"work_id":"462278cf-cd9e-4543-9c96-26f57fe3171e","year":2022},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:971ec74c754f90deac5ad5ede5286841c109236d75a8f04b9ebc06c6e00256d5","observation_id":"f3237c0e-0d4a-421b-8e60-9b1bb2866cc4","resolution":{"observed_at":"2026-05-17T00:08:44.023691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:62792bb5ec8f245f11fad78990b903b80feafcbe6d0ca87bc2b3b6dc283663fa","observation_id":"93f590a6-4fe2-488f-b5eb-3577149b11c0","resolution":{"observed_at":"2026-05-17T00:08:43.104090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viescore: Towards explainable metrics for conditional image synthesis evaluation","venue":null,"work_id":"bfb2e43f-4cd4-46b0-9609-85bf697bdb6f","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f2567ef19d20d7cb9885e3ab3268cab3daa1639d5132c5a2f171c27b19721125","observation_id":"3fb94218-4595-4e30-ad50-5731aa387a6b","resolution":{"observed_at":"2026-05-17T00:08:44.027691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14119","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nohumansrequired: Autonomous high-quality image editing triplet mining","venue":null,"work_id":"eeea2750-0651-4dc8-8a2a-17d8d7380032","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:29a5a50db573c43b8722ef7be0069b61571a4b18a33b0f0cb1c28ca82bed06b5","observation_id":"fae751eb-3108-480d-afc6-a5bdc72422f1","resolution":{"observed_at":"2026-05-17T00:08:43.165603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13684","last_updated":"2025-07-21T19:42:08Z","snapshot_observed_at":"2026-08-07T16:56:42.188613Z","submitted_at":"2025-03-17T19:47:41Z","title":"FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models","version":2},"cited_work":{"arxiv_id":"2503.13684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13684","snapshot_observed_at":"2026-07-01T07:55:30.911426Z","title":"Five: A fine-grained video editing benchmark for evaluating emerging diffusion and rectified flow models","venue":null,"work_id":"29bf032f-b7d8-4f1f-a0fe-da225aa14e11","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2503.13684","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:43ffc35fb15aa8deaa0a85cde3651071730b9a35b4dd017ffc7aa1647b0d762c","observation_id":"3666236b-3960-4264-aed0-c9d749ce80ab","resolution":{"observed_at":"2026-05-17T00:08:43.219033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10018","last_updated":"2025-01-17T08:03:02Z","snapshot_observed_at":"2026-08-11T19:37:20.531989Z","submitted_at":"2025-01-17T08:03:02Z","title":"DiffuEraser: A Diffusion Model for Video Inpainting","version":1},"cited_work":{"arxiv_id":"2501.10018","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.10018","snapshot_observed_at":"2026-07-01T21:56:16.292788Z","title":"Diffueraser: A diffusion model for video inpainting","venue":null,"work_id":"da6ed59a-1887-4660-9404-d89f2ab8ca7c","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2501.10018","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:9bcfb356d252f1acfb8f6d9ae2ccd66767c4a124b235386485f8d94768c2e377","observation_id":"9ed335ba-8981-4794-ac3c-36143253f143","resolution":{"observed_at":"2026-05-17T00:08:43.204466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14648","doi":"10.48550/arxiv.2510.14648","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.14648 , year=","venue":"arXiv (Cornell University)","work_id":"bb8da1ea-a54e-48c3-b9b4-789e33744d25","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:70c4ede78d234b4369f468c6ce6055c7d058aa4d73e66d64a39d48f9c8344a10","observation_id":"f2aa8407-93a7-4630-ba7d-0987b34d26fc","resolution":{"observed_at":"2026-05-17T00:08:43.147130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:04a12e47aa5e3d5f20b55ef6838cc07487ff39f75a0f39a3bfad463ec941252f","observation_id":"787a979a-c575-4cf3-9fd9-133c45fc1164","resolution":{"observed_at":"2026-05-17T00:08:43.089794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:25:09.340142Z","title":"Instructx: Towards unified visual editing with mllm guidance.https://arxiv.org/abs/2510.08485","venue":null,"work_id":"1a3cea2f-0aa0-4f3a-95e4-31bae330525d","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:cd17b464544a26d690cf29ad7ae1463b9beb71b24a6b886af493fe8d388f7b1a","observation_id":"f4b68a9f-950e-4b99-bd8f-4092461c8479","resolution":{"observed_at":"2026-05-17T00:08:43.180527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello gpt-4o","venue":null,"work_id":"8ffa358f-ddb1-450b-8965-8b81bc992830","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f23024b63526930da1a13a9e8fc829b368bf3a9bbbb8f4cdba6f126ba9ca8562","observation_id":"546c69e1-23b6-42be-ae52-a983b0d1d40d","resolution":{"observed_at":"2026-05-17T00:08:44.036656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pexels: Free stock photos, royalty free stock images & videos.https://www.pexels.com/","venue":null,"work_id":"65ca3b8b-f932-4d39-b21f-69b4ab1b66db","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:5050b3061291ff3ff7e1b2d8e2cbd230c0da58cd39ea517bae2b99f16787fe61","observation_id":"23745039-9a83-4be7-83d9-0dd89f92a940","resolution":{"observed_at":"2026-05-17T00:08:44.042414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"d7229f0d-b762-4072-b9bc-7b045947c6d5","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:68b690ba88fa1e65ff7b77aa4cb7d4f6c055f79b26840709ab86f52c16f8cf9e","observation_id":"6b073207-e4d6-4890-ae78-da06f1fb31d8","resolution":{"observed_at":"2026-05-17T00:08:44.010437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:17:33.931222Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"05644b85-8aaa-4cb3-8f21-4ce50a3822a5","year":2021},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:7168c907155f1fc9214db8028a225ed8f96d44960c25cfefd12745d1c66408dc","observation_id":"394da20e-9970-498c-88d2-8f326b291c60","resolution":{"observed_at":"2026-05-17T00:08:43.959157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":"6042f50c-ea88-4a56-acbc-4ada3003433c","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:790e9be76b0449c323549023971a11953ca8f3f4e2eedb45e1bd40bab955a0f6","observation_id":"61080623-4165-4b41-9059-7392a41fcf33","resolution":{"observed_at":"2026-05-17T00:08:43.964654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large-scale text-to-image model with inpainting is a zero-shot subject-driven image generator","venue":null,"work_id":"87720a40-cb8a-43a2-b170-b0aabca75f52","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:25d972fbf29052190e23f54b66a77f894e3956403dac0be1239526094f2ff8bd","observation_id":"25da115f-c3de-48c1-8d76-8e76db11810f","resolution":{"observed_at":"2026-05-17T00:08:43.973860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roformer: Enhanced transformer with 9 rotary position embedding.Neurocomputing, 568:127063","venue":null,"work_id":"bb49de1d-e488-4eac-b3e3-9053e8e081fa","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:61c82b8b426d12d9673803f18efa6addaaf10a4c974c2314cec3c2a6ab84b73c","observation_id":"dae9b83c-59f0-49bd-a86c-58e7f6ce1b9c","resolution":{"observed_at":"2026-05-17T00:08:44.002063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07111","last_updated":"2024-06-26T04:58:39Z","snapshot_observed_at":"2026-07-06T18:43:51.723237Z","submitted_at":"2024-06-26T04:58:39Z","title":"Diffusion Model-Based Video Editing: A Survey","version":1},"cited_work":{"arxiv_id":"2407.07111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07111","snapshot_observed_at":"2026-07-04T03:29:29.539815Z","title":"Diffusion model-based video editing: A survey","venue":null,"work_id":"863e4945-5bd6-4521-957f-2ab931bb18df","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2407.07111","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:541afb17d4dd9f8d13912ff2a0a332b40c22d0cbdb2fe328c3c5b1b87e161b2e","observation_id":"21ebd04c-2c7b-4a67-b92a-0ca511ab399c","resolution":{"observed_at":"2026-05-17T00:08:43.209681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lucy edit: Open-weight text-guided video editing","venue":null,"work_id":"6e98db73-692e-4f12-b5ab-b8fea2e079b0","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:bc767f3acb3312e6e84156a42fe1dea1c352d156f47f5c20caf8b533d68f9ba7","observation_id":"5294bddc-1102-487a-931b-529c6914b929","resolution":{"observed_at":"2026-05-17T00:08:43.997352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoanydoor: High-fidelity video ob- ject insertion with precise motion control","venue":null,"work_id":"fd90735a-9ac7-4fb1-bb78-086ec2988995","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:003282e3a968bb6b783ea53e9dfc37d5cb2247d9992c55a44c4b814c9c5bd380","observation_id":"995fed61-e690-4b5c-861d-537517ef5000","resolution":{"observed_at":"2026-05-17T00:08:44.048300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:63bce0d5b39c7479b7acb9620285aaf23919c08b4ad78355cedd897cfa65d7a2","observation_id":"a7a58fcd-3357-416d-b73a-5e996a72fa9d","resolution":{"observed_at":"2026-05-17T00:08:43.110939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:db4aa23c0ebff6855b6f14c9971a194e11df148ea1ff8d47bf672723d4c7078f","observation_id":"5ae6775b-48a3-4fc2-8f53-ebb8e161fd02","resolution":{"observed_at":"2026-05-17T00:08:43.199216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-07T16:29:46.498912Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:166d7994124052812417d160b5ee3c87f6fd1dae164539d70ba8dbe82898a4f4","observation_id":"aa5d514e-1975-4f61-8e4c-313360402fc6","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models.Advances in neural information processing systems, 35:24824–24837","venue":null,"work_id":"aa0b0925-14cc-4784-90d9-7cd92b1fb7da","year":2022},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:57a1f13cb1210f642d3b4aeaa398745b159ca6bf24dfeb639f7513b24a9dc74c","observation_id":"8988fa94-58b1-432b-b4df-d75527ebb0e0","resolution":{"observed_at":"2026-05-17T00:08:43.988027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:9e23cb1c3166969f8db049085c4add2036ce9bbdd9e42c25cc824045b40fcba8","observation_id":"297246b8-0278-49a7-862c-6a00eee4c807","resolution":{"observed_at":"2026-05-17T00:08:43.190117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"9cbe70fb-b45a-483a-8617-5ff3225f4e8a","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:a6c3dbcde7f4f3ea292e337296549b2bcc37d5c05b37ac6116dde7386735c6b2","observation_id":"f2174355-d5fc-4653-94ab-de160dbc436f","resolution":{"observed_at":"2026-05-17T00:08:44.014347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"32be19d2-e8ed-463b-9821-47a33da907c8","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:d2aa9af7de867d9ee2a9e56f707bd9ac19c2ecf7317f1d84cf68bf44292d69aa","observation_id":"c1379aef-08e4-4a99-9f65-ce1d4fa61883","resolution":{"observed_at":"2026-05-17T00:08:44.017714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-01T15:51:11.290263Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":"2310.16003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2310.16003 (2023)","venue":null,"work_id":"81510b39-7fe6-4ade-a71e-e3f97344dba9","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:4a97d959c6992bf8a69e4c4ddeeec1443ecbc0cdbcf993beff056e1412779b98","observation_id":"e486ffe6-e184-41d6-a45f-07952551adaf","resolution":{"observed_at":"2026-05-17T00:08:43.133685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnigen: Unified image genera- tion","venue":null,"work_id":"a2d76dd4-34c5-4618-b637-9382906db448","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:c5a08f69183121c0cb7689192d39d3324c43148292cfa870b36abf122dcc2944","observation_id":"18d35ffd-8acb-414b-829b-7e4ff2896ddd","resolution":{"observed_at":"2026-05-17T00:08:44.020696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videograin: Modulating space-time attention for multi- grained video editing","venue":null,"work_id":"e0dd91b4-f159-4b0e-9048-e8976df25978","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:7ad214407b1a8cf4ab0c222878cb25963eaca07e8f7d1c43d59f2b8e1503f3f4","observation_id":"7cb4444c-6dc3-4bde-9b8d-a35530101e3c","resolution":{"observed_at":"2026-05-17T00:08:43.992785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:54f6b3c6a47d6dfe693bbc3bc12c515e261262f300a7bf7989de1407cb99dbb1","observation_id":"c816e038-7e25-49c8-9877-69224d7c49d9","resolution":{"observed_at":"2026-05-17T00:08:43.214097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-08-08T15:17:23.629862Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"cited_work":{"arxiv_id":"2506.04216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04216","snapshot_observed_at":"2026-07-04T16:29:56.632377Z","title":"Unic: Unified in-context video editing","venue":null,"work_id":"309245ca-25dd-4058-af47-e373bcbb1fdf","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2506.04216","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:41f0d45aa832ade2d1055e5e8125851155c770e7e6d18cc6d99197d68e5e6d5c","observation_id":"96dde5aa-0da4-4082-940d-1a865389f1e6","resolution":{"observed_at":"2026-05-17T00:08:43.170899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylemaster: Stylize your video with artistic generation and translation","venue":null,"work_id":"47d9ddf0-99c4-40f3-8302-98f4b858434f","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:87a4965963cb659eb10e965140fecc6eba9cf95d880422d00ccf8427623a34a5","observation_id":"5c2454df-683b-4a8d-bbc0-a7863ed44bd2","resolution":{"observed_at":"2026-05-17T00:08:43.982948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veg- gie: Instructional editing and reasoning video concepts with grounded generation","venue":null,"work_id":"f71d7372-65c0-4c2d-9acc-ffe00a13d6b5","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:4ca5fab60288b222d43a7d81c0d5a2359c61636988b462b00f2114921f96e187","observation_id":"970e3d17-06a1-4a95-8163-fc93ec600468","resolution":{"observed_at":"2026-05-17T00:08:44.051069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Magicbrush: A manually annotated dataset for instruction- guided image editing.Advances in Neural Information Pro- cessing Systems, 36:31428–31449","venue":null,"work_id":"9c4852fb-f0ae-483d-a723-7fe59147fbb1","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:336fcce240e2aa961a848012ace468e31df9d5f8f8f39bb7900d5b90cf33c049","observation_id":"c4e97427-255b-42f1-85ad-26a1d6f75b08","resolution":{"observed_at":"2026-05-17T00:08:44.030299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"599bfa67-f24d-4f2f-898e-e990d1185484","year":2023},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:d5c7d26a1fd7c6f7348a21d12f141255c48d7391409feca5ead013edce9f5975","observation_id":"e03b67f2-7064-4772-a0e4-d66492c6e29e","resolution":{"observed_at":"2026-05-17T00:08:44.033655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2504.20690","doi":"10.48550/arxiv.2504.20690","metadata_source":"pith","pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","venue":"cs.CV","work_id":"8cafd680-1279-4695-8156-9079db325469","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:70ea57b2d7729803f49b2429a04a3efb060c7c6f54aff600fe9d577e4c09bf6a","observation_id":"f8f6aad9-39fe-4095-a602-e80f570d8d51","resolution":{"observed_at":"2026-05-17T00:08:43.175348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-08-12T07:26:46.273952Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"cited_work":{"arxiv_id":"2505.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24873","snapshot_observed_at":"2026-07-02T02:16:26.810645Z","title":"arXiv preprint arXiv:2505.24873 , year=","venue":null,"work_id":"dec9d560-3598-49d7-804a-99efdf9eba09","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2505.24873","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:6ef8cd1ad0d7a9907789e648b854d8634870637fb4cf90c4603a0900c0fd343f","observation_id":"6ce213fa-17fa-43a7-88b8-e1248e6da60f","resolution":{"observed_at":"2026-05-17T00:08:43.159407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06734","last_updated":"2025-03-12T07:47:48Z","snapshot_observed_at":"2026-08-09T23:56:56.358848Z","submitted_at":"2025-02-10T17:58:22Z","title":"Se\\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","version":3},"cited_work":{"arxiv_id":"2502.06734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06734","snapshot_observed_at":"2026-07-01T07:55:30.838800Z","title":"A golden retrieverwearing a red harness is walking slowly with its nose close to the dry, leaf-covered ground in a fenced yard next to a bush and a road in the background","venue":null,"work_id":"253001b7-ac44-4784-9ad1-3b9b33928ca7","year":2025},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"cited_paper":"/paper/2502.06734","citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:25f563b20d2b7cd105a5de2ba2c688291d3ffc43dd569ed13be4330cb32a35e4","observation_id":"7253c983-e39d-4c33-a4fa-3823e6bc0878","resolution":{"observed_at":"2026-05-17T00:08:43.126418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7, we provide a detailed breakdown of the results across four distinct tasks: Object Removal, Object Addition, Object Swap, and Local Style Transfer","venue":null,"work_id":"1d3b5aec-73df-44ee-9baa-865420f705f5","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:2fea06dcb1e294959c908d1821e80b227723dabede64c9961833c2d7e8e2e10d","observation_id":"09281e92-8cc9-4df5-9609-ca9451cd8a2d","resolution":{"observed_at":"2026-05-17T00:08:43.969065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2818.9737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A video sequence showing three parts: first the original scene, then grounded{ground instruction}, and finally the same scene but{edit instruc- tion}","venue":null,"work_id":"a0e1ad13-b1f6-472b-8622-c703056fdfe9","year":1918},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:191cbbb187f77e004973de06576c69ba58668063a27576439267a480c020876b","observation_id":"3f8e3cca-9ae8-4531-837a-e214219dffb9","resolution":{"observed_at":"2026-05-17T00:08:43.224148Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training Dataset To equip our model with robust instruction-following ca- pabilities, we constructed a unified chain-of-frames video editing dataset comprising 50k video pairs","venue":null,"work_id":"0fe78257-dcd4-4d39-986c-4df53a354b0a","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:f2edbac580f5f6cc66370666beab7afb89c078ce9073203503c3df8df1265515","observation_id":"6d160dbc-f948-4c9e-816f-ae70c465e62b","resolution":{"observed_at":"2026-05-17T00:08:44.057731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ecfd40e3-4964-4540-9634-d6515a5ff22a","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:71917619c956e01d4973c163afb0e434ec94602198548e8098da83cd0dc81718","observation_id":"41532f1e-5c68-4e5d-9056-51fc16de026f","resolution":{"observed_at":"2026-05-17T00:08:44.039539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"reasoning-then-editing","venue":null,"work_id":"1b2d1db8-c691-43b1-a83d-09af6f9ca2fe","year":null},"citing_paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T00:08:09.479706Z"},"links":{"citing_paper":"/paper/2512.07469"},"observation_digest":"sha256:263d9a1f20e0f6b8e3361dedf0dc6283808648a37554a43256ab649ee9303c17","observation_id":"1755ecb3-b197-4e45-89cb-3f8bd676b1ca","resolution":{"observed_at":"2026-05-17T00:08:44.045493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.07469","last_updated":"2026-04-05T12:30:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:31:06.721415Z","submitted_at":"2025-12-08T11:50:18Z","title":"VideoCoF: Unified Video Editing with Temporal Reasoner"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":24,"verified_fuzzy":28},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 14 inbound Pith citation observations for arXiv:2512.07469."}