{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:VY5URRDWPWWSXTC67UJLZOYLM6","short_pith_number":"pith:VY5URRDW","schema_version":"1.0","canonical_sha256":"ae3b48c4767dad2bcc5efd12bcbb0b67b2904a54f0f3e93696f93f9815f1947f","source":{"kind":"arxiv","id":"2505.15529","version":1},"attestation_state":"computed","paper":{"title":"Clapper: Compact Learning and Video Representation in VLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fuzheng Zhang, Hongzhi Zhang, Jianzhao Huang, Jingyuan Zhang, Kunze Li, Lingyu Kong, Qi Wang","submitted_at":"2025-05-21T13:52:17Z","abstract_excerpt":"Current vision-language models (VLMs) have demonstrated remarkable capabilities across diverse video understanding applications. Designing VLMs for video inputs requires effectively modeling the temporal dimension (i.e. capturing dependencies across frames) and balancing the processing of short and long videos. Specifically, short videos demand preservation of fine-grained details, whereas long videos require strategic compression of visual information to handle extensive temporal contexts efficiently. However, our empirical analysis reveals a critical limitation: most existing VLMs suffer sev"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.15529","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-21T13:52:17Z","cross_cats_sorted":[],"title_canon_sha256":"fb902f5a0024eb24cfa288b0df8a439f6b989688801f4b6b97ee6a4d2d461370","abstract_canon_sha256":"b849281c40b7f70facc98ba2b01849c64ed5d79311324869e7aa9b0423aee132"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:06:47.303745Z","signature_b64":"iGvrKHvhw52y6sSvOE6NDBXyO+3szAG+FJhhxC6qMATk6Qy76WDsbyYYcACKJkPyULR48vNow+ptefwpMjb8AQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ae3b48c4767dad2bcc5efd12bcbb0b67b2904a54f0f3e93696f93f9815f1947f","last_reissued_at":"2026-07-05T11:06:47.303165Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:06:47.303165Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Clapper: Compact Learning and Video Representation in VLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Fuzheng Zhang, Hongzhi Zhang, Jianzhao Huang, Jingyuan Zhang, Kunze Li, Lingyu Kong, Qi Wang","submitted_at":"2025-05-21T13:52:17Z","abstract_excerpt":"Current vision-language models (VLMs) have demonstrated remarkable capabilities across diverse video understanding applications. Designing VLMs for video inputs requires effectively modeling the temporal dimension (i.e. capturing dependencies across frames) and balancing the processing of short and long videos. Specifically, short videos demand preservation of fine-grained details, whereas long videos require strategic compression of visual information to handle extensive temporal contexts efficiently. However, our empirical analysis reveals a critical limitation: most existing VLMs suffer sev"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.15529","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.15529/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.15529","created_at":"2026-07-05T11:06:47.303223+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.15529v1","created_at":"2026-07-05T11:06:47.303223+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.15529","created_at":"2026-07-05T11:06:47.303223+00:00"},{"alias_kind":"pith_short_12","alias_value":"VY5URRDWPWWS","created_at":"2026-07-05T11:06:47.303223+00:00"},{"alias_kind":"pith_short_16","alias_value":"VY5URRDWPWWSXTC6","created_at":"2026-07-05T11:06:47.303223+00:00"},{"alias_kind":"pith_short_8","alias_value":"VY5URRDW","created_at":"2026-07-05T11:06:47.303223+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6","json":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6.json","graph_json":"https://pith.science/api/pith-number/VY5URRDWPWWSXTC67UJLZOYLM6/graph.json","events_json":"https://pith.science/api/pith-number/VY5URRDWPWWSXTC67UJLZOYLM6/events.json","paper":"https://pith.science/paper/VY5URRDW"},"agent_actions":{"view_html":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6","download_json":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6.json","view_paper":"https://pith.science/paper/VY5URRDW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.15529&json=true","fetch_graph":"https://pith.science/api/pith-number/VY5URRDWPWWSXTC67UJLZOYLM6/graph.json","fetch_events":"https://pith.science/api/pith-number/VY5URRDWPWWSXTC67UJLZOYLM6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6/action/storage_attestation","attest_author":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6/action/author_attestation","sign_citation":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6/action/citation_signature","submit_replication":"https://pith.science/pith/VY5URRDWPWWSXTC67UJLZOYLM6/action/replication_record"}},"created_at":"2026-07-05T11:06:47.303223+00:00","updated_at":"2026-07-05T11:06:47.303223+00:00"}