{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:C7O3X2F23Y3UOBHUU73BFQP6U7","short_pith_number":"pith:C7O3X2F2","schema_version":"1.0","canonical_sha256":"17ddbbe8bade374704f4a7f612c1fea7d7f8b7008969ee074294208711a7e470","source":{"kind":"arxiv","id":"2310.01107","version":2},"attestation_state":"computed","paper":{"title":"Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","stat.ML"],"primary_cat":"cs.CV","authors_text":"Hyeonho Jeong, Jong Chul Ye","submitted_at":"2023-10-02T11:28:37Z","abstract_excerpt":"Recent endeavors in video editing have showcased promising results in single-attribute editing or style transfer tasks, either by training text-to-video (T2V) models on text-video data or adopting training-free methods. However, when confronted with the complexities of multi-attribute editing scenarios, they exhibit shortcomings such as omitting or overlooking intended attribute changes, modifying the wrong elements of the input video, and failing to preserve regions of the input video that should remain intact. To address this, here we present a novel grounding-guided video-to-video translati"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2310.01107","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2023-10-02T11:28:37Z","cross_cats_sorted":["cs.AI","cs.LG","stat.ML"],"title_canon_sha256":"464722eaa904debfa145307ad49d601ddc528fd1409f44709cb6a7836de74630","abstract_canon_sha256":"bd607d11cdbd94505379e1f5766943293f1b8a250d41066adeff82dfeb0b9704"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:48:48.567704Z","signature_b64":"1JaXPTKcE9CjDRtevNaStagwsnXNZYOsGOOQlx9oO5NFCKZJXjwN8/lZUSI61QGnTlAVARVJOKbs3KuF4WgkBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"17ddbbe8bade374704f4a7f612c1fea7d7f8b7008969ee074294208711a7e470","last_reissued_at":"2026-07-05T07:48:48.567228Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:48:48.567228Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Ground-A-Video: Zero-shot Grounded Video Editing using Text-to-image Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","stat.ML"],"primary_cat":"cs.CV","authors_text":"Hyeonho Jeong, Jong Chul Ye","submitted_at":"2023-10-02T11:28:37Z","abstract_excerpt":"Recent endeavors in video editing have showcased promising results in single-attribute editing or style transfer tasks, either by training text-to-video (T2V) models on text-video data or adopting training-free methods. However, when confronted with the complexities of multi-attribute editing scenarios, they exhibit shortcomings such as omitting or overlooking intended attribute changes, modifying the wrong elements of the input video, and failing to preserve regions of the input video that should remain intact. To address this, here we present a novel grounding-guided video-to-video translati"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2310.01107","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2310.01107/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2310.01107","created_at":"2026-07-05T07:48:48.567296+00:00"},{"alias_kind":"arxiv_version","alias_value":"2310.01107v2","created_at":"2026-07-05T07:48:48.567296+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2310.01107","created_at":"2026-07-05T07:48:48.567296+00:00"},{"alias_kind":"pith_short_12","alias_value":"C7O3X2F23Y3U","created_at":"2026-07-05T07:48:48.567296+00:00"},{"alias_kind":"pith_short_16","alias_value":"C7O3X2F23Y3UOBHU","created_at":"2026-07-05T07:48:48.567296+00:00"},{"alias_kind":"pith_short_8","alias_value":"C7O3X2F2","created_at":"2026-07-05T07:48:48.567296+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22042","citing_title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19676","citing_title":"TeleMorpher: Toward Robust Simultaneous Motion-Location Editing","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2504.17180","citing_title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18010","citing_title":"Functionalization via Structure Completion and Motion Rectification","ref_index":274,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13509","citing_title":"DiT as Real-Time Rerenderer: Streaming Video Stylization with Autoregressive Diffusion Transformer","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7","json":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7.json","graph_json":"https://pith.science/api/pith-number/C7O3X2F23Y3UOBHUU73BFQP6U7/graph.json","events_json":"https://pith.science/api/pith-number/C7O3X2F23Y3UOBHUU73BFQP6U7/events.json","paper":"https://pith.science/paper/C7O3X2F2"},"agent_actions":{"view_html":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7","download_json":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7.json","view_paper":"https://pith.science/paper/C7O3X2F2","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2310.01107&json=true","fetch_graph":"https://pith.science/api/pith-number/C7O3X2F23Y3UOBHUU73BFQP6U7/graph.json","fetch_events":"https://pith.science/api/pith-number/C7O3X2F23Y3UOBHUU73BFQP6U7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7/action/storage_attestation","attest_author":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7/action/author_attestation","sign_citation":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7/action/citation_signature","submit_replication":"https://pith.science/pith/C7O3X2F23Y3UOBHUU73BFQP6U7/action/replication_record"}},"created_at":"2026-07-05T07:48:48.567296+00:00","updated_at":"2026-07-05T07:48:48.567296+00:00"}