{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:IYFUPKGKOIMDFC6K5LMRPGBMLB","short_pith_number":"pith:IYFUPKGK","schema_version":"1.0","canonical_sha256":"460b47a8ca7218328bcaead917982c586d42138e5e24643022a9417e7d320fbc","source":{"kind":"arxiv","id":"2403.01422","version":5},"attestation_state":"computed","paper":{"title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chenchen Wang, Chi Zhang, Jiamu Sheng, Jiayuan Fan, Shengji Tang, Tao Chen, Zhende Song","submitted_at":"2024-03-03T07:43:39Z","abstract_excerpt":"Recent large vision-language models (LVLMs) for video understanding are primarily fine-tuned with various videos scraped from online platforms. Existing datasets, such as ActivityNet, require considerable human labor for structuring and annotation before effectively utilized for tuning LVLMs. While current LVLMs are primarily trained on existing datasets in broad, general-purpose settings, adapting them to specific downstream scenarios remains challenging, as collecting and annotating task-specific videos is highly labor-intensive and time-consuming. To address this issue, we propose a three-s"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2403.01422","kind":"arxiv","version":5},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-03-03T07:43:39Z","cross_cats_sorted":[],"title_canon_sha256":"d3c23905d578f95814fc71e5f5f76b9d14ef3cfd59040fe865f158bdee5c5f89","abstract_canon_sha256":"683edf0d315c399421e6ec63bf03ff2fb19ab249a78bc172ca86a26e01e51ca7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:59.617591Z","signature_b64":"GHFFhgnrwJo9LevnEA3RnWpDQI+4gGKqRoU9UNsdzHrjmYZUZP/B81bNd4hZA/iD/42pSsrXGv4v7XUPL+yRDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"460b47a8ca7218328bcaead917982c586d42138e5e24643022a9417e7d320fbc","last_reissued_at":"2026-07-05T11:51:59.617063Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:59.617063Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chenchen Wang, Chi Zhang, Jiamu Sheng, Jiayuan Fan, Shengji Tang, Tao Chen, Zhende Song","submitted_at":"2024-03-03T07:43:39Z","abstract_excerpt":"Recent large vision-language models (LVLMs) for video understanding are primarily fine-tuned with various videos scraped from online platforms. Existing datasets, such as ActivityNet, require considerable human labor for structuring and annotation before effectively utilized for tuning LVLMs. While current LVLMs are primarily trained on existing datasets in broad, general-purpose settings, adapting them to specific downstream scenarios remains challenging, as collecting and annotating task-specific videos is highly labor-intensive and time-consuming. To address this issue, we propose a three-s"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2403.01422","kind":"arxiv","version":5},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2403.01422/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2403.01422","created_at":"2026-07-05T11:51:59.617123+00:00"},{"alias_kind":"arxiv_version","alias_value":"2403.01422v5","created_at":"2026-07-05T11:51:59.617123+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2403.01422","created_at":"2026-07-05T11:51:59.617123+00:00"},{"alias_kind":"pith_short_12","alias_value":"IYFUPKGKOIMD","created_at":"2026-07-05T11:51:59.617123+00:00"},{"alias_kind":"pith_short_16","alias_value":"IYFUPKGKOIMDFC6K","created_at":"2026-07-05T11:51:59.617123+00:00"},{"alias_kind":"pith_short_8","alias_value":"IYFUPKGK","created_at":"2026-07-05T11:51:59.617123+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21734","citing_title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","ref_index":152,"is_internal_anchor":false},{"citing_arxiv_id":"2605.31069","citing_title":"Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2406.04264","citing_title":"MLVU: Benchmarking Multi-task Long Video Understanding","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11283","citing_title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","ref_index":29,"is_internal_anchor":false},{"citing_arxiv_id":"2501.13106","citing_title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","ref_index":149,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB","json":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB.json","graph_json":"https://pith.science/api/pith-number/IYFUPKGKOIMDFC6K5LMRPGBMLB/graph.json","events_json":"https://pith.science/api/pith-number/IYFUPKGKOIMDFC6K5LMRPGBMLB/events.json","paper":"https://pith.science/paper/IYFUPKGK"},"agent_actions":{"view_html":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB","download_json":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB.json","view_paper":"https://pith.science/paper/IYFUPKGK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2403.01422&json=true","fetch_graph":"https://pith.science/api/pith-number/IYFUPKGKOIMDFC6K5LMRPGBMLB/graph.json","fetch_events":"https://pith.science/api/pith-number/IYFUPKGKOIMDFC6K5LMRPGBMLB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB/action/storage_attestation","attest_author":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB/action/author_attestation","sign_citation":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB/action/citation_signature","submit_replication":"https://pith.science/pith/IYFUPKGKOIMDFC6K5LMRPGBMLB/action/replication_record"}},"created_at":"2026-07-05T11:51:59.617123+00:00","updated_at":"2026-07-05T11:51:59.617123+00:00"}