{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:7FJCKBCHGPHCMXMYQXI6RWH5SC","short_pith_number":"pith:7FJCKBCH","schema_version":"1.0","canonical_sha256":"f95225044733ce265d9885d1e8d8fd90a8f699409a65cab05193d4113a413734","source":{"kind":"arxiv","id":"2505.12237","version":1},"attestation_state":"computed","paper":{"title":"From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Feng Tian, Haojun Xu, Yuzhi Li","submitted_at":"2025-05-18T05:25:11Z","abstract_excerpt":"Large Language Models (LLMs) and Vision-Language Models (VLMs) have demonstrated remarkable reasoning and generalization capabilities in video understanding; however, their application in video editing remains largely underexplored. This paper presents the first systematic study of LLMs in the context of video editing. To bridge the gap between visual information and language-based reasoning, we introduce L-Storyboard, an intermediate representation that transforms discrete video shots into structured language descriptions suitable for LLM processing. We categorize video editing tasks into Con"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.12237","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-18T05:25:11Z","cross_cats_sorted":[],"title_canon_sha256":"c02629b3d32d3a4f2bab367486161d907d86fed83bd392eef48094d42ee5ffff","abstract_canon_sha256":"bae177776e91cf1ce7129fc3e11523b44a16428dfc5bee221e78cfa76fe63cc7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:05:25.172873Z","signature_b64":"uSmuNN4lgRgMiFnrCCyn09StIPdGPeyHsTFGWLTTbst2sW8aliVmrUU+3XEizUhjzsOzoFsylem+WrXhG1DXAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f95225044733ce265d9885d1e8d8fd90a8f699409a65cab05193d4113a413734","last_reissued_at":"2026-07-05T11:05:25.172418Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:05:25.172418Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Feng Tian, Haojun Xu, Yuzhi Li","submitted_at":"2025-05-18T05:25:11Z","abstract_excerpt":"Large Language Models (LLMs) and Vision-Language Models (VLMs) have demonstrated remarkable reasoning and generalization capabilities in video understanding; however, their application in video editing remains largely underexplored. This paper presents the first systematic study of LLMs in the context of video editing. To bridge the gap between visual information and language-based reasoning, we introduce L-Storyboard, an intermediate representation that transforms discrete video shots into structured language descriptions suitable for LLM processing. We categorize video editing tasks into Con"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.12237","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.12237/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.12237","created_at":"2026-07-05T11:05:25.172477+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.12237v1","created_at":"2026-07-05T11:05:25.172477+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.12237","created_at":"2026-07-05T11:05:25.172477+00:00"},{"alias_kind":"pith_short_12","alias_value":"7FJCKBCHGPHC","created_at":"2026-07-05T11:05:25.172477+00:00"},{"alias_kind":"pith_short_16","alias_value":"7FJCKBCHGPHCMXMY","created_at":"2026-07-05T11:05:25.172477+00:00"},{"alias_kind":"pith_short_8","alias_value":"7FJCKBCH","created_at":"2026-07-05T11:05:25.172477+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.27067","citing_title":"BEAT: Rhythm-Elastic Alignment for Agentic Music-guided Movie Trailer Generation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05076","citing_title":"GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15127","citing_title":"MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production","ref_index":13,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC","json":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC.json","graph_json":"https://pith.science/api/pith-number/7FJCKBCHGPHCMXMYQXI6RWH5SC/graph.json","events_json":"https://pith.science/api/pith-number/7FJCKBCHGPHCMXMYQXI6RWH5SC/events.json","paper":"https://pith.science/paper/7FJCKBCH"},"agent_actions":{"view_html":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC","download_json":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC.json","view_paper":"https://pith.science/paper/7FJCKBCH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.12237&json=true","fetch_graph":"https://pith.science/api/pith-number/7FJCKBCHGPHCMXMYQXI6RWH5SC/graph.json","fetch_events":"https://pith.science/api/pith-number/7FJCKBCHGPHCMXMYQXI6RWH5SC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC/action/storage_attestation","attest_author":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC/action/author_attestation","sign_citation":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC/action/citation_signature","submit_replication":"https://pith.science/pith/7FJCKBCHGPHCMXMYQXI6RWH5SC/action/replication_record"}},"created_at":"2026-07-05T11:05:25.172477+00:00","updated_at":"2026-07-05T11:05:25.172477+00:00"}