{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:Q5RBXVK6DHGT33NCWQNDRM5XR3","short_pith_number":"pith:Q5RBXVK6","schema_version":"1.0","canonical_sha256":"87621bd55e19cd3deda2b41a38b3b78eeed3dbb3ed506c19ad9193e1b6e53100","source":{"kind":"arxiv","id":"2503.15973","version":2},"attestation_state":"computed","paper":{"title":"STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bing Su, Jiahuan Zhou, Kunlun Xu, Xu Zou, Yuxin Peng, Zichen Liu","submitted_at":"2025-03-20T09:16:20Z","abstract_excerpt":"Pre-trained on tremendous image-text pairs, vision-language models like CLIP have demonstrated promising zero-shot generalization across numerous image-based tasks. However, extending these capabilities to video tasks remains challenging due to limited labeled video data and high training costs. Recent video prompting methods attempt to adapt CLIP for video tasks by introducing learnable prompts, but they typically rely on a single static prompt for all video sequences, overlooking the diverse temporal dynamics and spatial variations that exist across frames. This limitation significantly hind"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.15973","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-03-20T09:16:20Z","cross_cats_sorted":[],"title_canon_sha256":"0859f662eeee491fbfaffd66647ca8ea47148568acd9947d94e119fb6e67256d","abstract_canon_sha256":"4c13663441057ec093d9eb2540c2107db50db9d45147cc13fff2eb0654f06a63"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:38:44.777803Z","signature_b64":"FUusPSJ5HFG1LUVHuMAQcBacxxW3RHAzXaTxK0a9pL2i5m1vS6LieEoFF2nBfGnHKLnj6awvZfsgs1LxKkuGBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"87621bd55e19cd3deda2b41a38b3b78eeed3dbb3ed506c19ad9193e1b6e53100","last_reissued_at":"2026-07-05T10:38:44.777301Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:38:44.777301Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"STOP: Integrated Spatial-Temporal Dynamic Prompting for Video Understanding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Bing Su, Jiahuan Zhou, Kunlun Xu, Xu Zou, Yuxin Peng, Zichen Liu","submitted_at":"2025-03-20T09:16:20Z","abstract_excerpt":"Pre-trained on tremendous image-text pairs, vision-language models like CLIP have demonstrated promising zero-shot generalization across numerous image-based tasks. However, extending these capabilities to video tasks remains challenging due to limited labeled video data and high training costs. Recent video prompting methods attempt to adapt CLIP for video tasks by introducing learnable prompts, but they typically rely on a single static prompt for all video sequences, overlooking the diverse temporal dynamics and spatial variations that exist across frames. This limitation significantly hind"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.15973","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.15973/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.15973","created_at":"2026-07-05T10:38:44.777366+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.15973v2","created_at":"2026-07-05T10:38:44.777366+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.15973","created_at":"2026-07-05T10:38:44.777366+00:00"},{"alias_kind":"pith_short_12","alias_value":"Q5RBXVK6DHGT","created_at":"2026-07-05T10:38:44.777366+00:00"},{"alias_kind":"pith_short_16","alias_value":"Q5RBXVK6DHGT33NC","created_at":"2026-07-05T10:38:44.777366+00:00"},{"alias_kind":"pith_short_8","alias_value":"Q5RBXVK6","created_at":"2026-07-05T10:38:44.777366+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2508.19024","citing_title":"ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrieval","ref_index":29,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3","json":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3.json","graph_json":"https://pith.science/api/pith-number/Q5RBXVK6DHGT33NCWQNDRM5XR3/graph.json","events_json":"https://pith.science/api/pith-number/Q5RBXVK6DHGT33NCWQNDRM5XR3/events.json","paper":"https://pith.science/paper/Q5RBXVK6"},"agent_actions":{"view_html":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3","download_json":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3.json","view_paper":"https://pith.science/paper/Q5RBXVK6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.15973&json=true","fetch_graph":"https://pith.science/api/pith-number/Q5RBXVK6DHGT33NCWQNDRM5XR3/graph.json","fetch_events":"https://pith.science/api/pith-number/Q5RBXVK6DHGT33NCWQNDRM5XR3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3/action/storage_attestation","attest_author":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3/action/author_attestation","sign_citation":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3/action/citation_signature","submit_replication":"https://pith.science/pith/Q5RBXVK6DHGT33NCWQNDRM5XR3/action/replication_record"}},"created_at":"2026-07-05T10:38:44.777366+00:00","updated_at":"2026-07-05T10:38:44.777366+00:00"}