{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:SDGRJCKKGEWK6PIMDGDNQIQWQQ","short_pith_number":"pith:SDGRJCKK","schema_version":"1.0","canonical_sha256":"90cd14894a312caf3d0c1986d82216843981cfdf1949c0de3a5ebabe32b9d435","source":{"kind":"arxiv","id":"2411.15260","version":2},"attestation_state":"computed","paper":{"title":"VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Boyuan Jiang, Di Zhang, Fei Yang, Jiahao Hu, Pengfei Wan, Tianxiong Zhong, Xingye Tian, Xuebo Wang","submitted_at":"2024-11-22T10:04:05Z","abstract_excerpt":"Diffusion-based image editing models have made remarkable progress in recent years. However, achieving high-quality video editing remains a significant challenge. One major hurdle is the absence of open-source, large-scale video editing datasets based on real-world data, as constructing such datasets is both time-consuming and costly. Moreover, video data requires a significantly larger number of tokens for representation, which substantially increases the training costs for video editing models. Lastly, current video editing models offer limited interactivity, often making it difficult for us"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.15260","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-11-22T10:04:05Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"185561cbd78bee00caed011dcafcc05e40dd0e87a8a112fc02106c0aed9f7211","abstract_canon_sha256":"aa7685fc6b2abebfc1451e51c6aaeb6d4f122c9f7df17bc1a68d9f0903cd79c0"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:36:25.830130Z","signature_b64":"EUcED5udfdiPt59zN8S0h3A4ZU44scCrv16zx6Zp9/74fpXQJKvn+9GQFDyaadhPPJeHR2vu9ak5eI7+JK5+AA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"90cd14894a312caf3d0c1986d82216843981cfdf1949c0de3a5ebabe32b9d435","last_reissued_at":"2026-07-05T11:36:25.829624Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:36:25.829624Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VIVID-10M: A Dataset and Baseline for Versatile and Interactive Video Local Editing","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Boyuan Jiang, Di Zhang, Fei Yang, Jiahao Hu, Pengfei Wan, Tianxiong Zhong, Xingye Tian, Xuebo Wang","submitted_at":"2024-11-22T10:04:05Z","abstract_excerpt":"Diffusion-based image editing models have made remarkable progress in recent years. However, achieving high-quality video editing remains a significant challenge. One major hurdle is the absence of open-source, large-scale video editing datasets based on real-world data, as constructing such datasets is both time-consuming and costly. Moreover, video data requires a significantly larger number of tokens for representation, which substantially increases the training costs for video editing models. Lastly, current video editing models offer limited interactivity, often making it difficult for us"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.15260","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.15260/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.15260","created_at":"2026-07-05T11:36:25.829687+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.15260v2","created_at":"2026-07-05T11:36:25.829687+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.15260","created_at":"2026-07-05T11:36:25.829687+00:00"},{"alias_kind":"pith_short_12","alias_value":"SDGRJCKKGEWK","created_at":"2026-07-05T11:36:25.829687+00:00"},{"alias_kind":"pith_short_16","alias_value":"SDGRJCKKGEWK6PIM","created_at":"2026-07-05T11:36:25.829687+00:00"},{"alias_kind":"pith_short_8","alias_value":"SDGRJCKK","created_at":"2026-07-05T11:36:25.829687+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23254","citing_title":"SteerVTE: Seamless Video Text Editing with Style and Glyph Control","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03578","citing_title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2509.20360","citing_title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2603.09283","citing_title":"From Ideal to Real: Stable Video Object Removal under Imperfect Conditions","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14664","citing_title":"MiVE: Multiscale Vision-language features for reference-guided video Editing","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ","json":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ.json","graph_json":"https://pith.science/api/pith-number/SDGRJCKKGEWK6PIMDGDNQIQWQQ/graph.json","events_json":"https://pith.science/api/pith-number/SDGRJCKKGEWK6PIMDGDNQIQWQQ/events.json","paper":"https://pith.science/paper/SDGRJCKK"},"agent_actions":{"view_html":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ","download_json":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ.json","view_paper":"https://pith.science/paper/SDGRJCKK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.15260&json=true","fetch_graph":"https://pith.science/api/pith-number/SDGRJCKKGEWK6PIMDGDNQIQWQQ/graph.json","fetch_events":"https://pith.science/api/pith-number/SDGRJCKKGEWK6PIMDGDNQIQWQQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ/action/storage_attestation","attest_author":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ/action/author_attestation","sign_citation":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ/action/citation_signature","submit_replication":"https://pith.science/pith/SDGRJCKKGEWK6PIMDGDNQIQWQQ/action/replication_record"}},"created_at":"2026-07-05T11:36:25.829687+00:00","updated_at":"2026-07-05T11:36:25.829687+00:00"}