{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:BPFZGUSKFFGPRCCRTYM6VDJMJE","short_pith_number":"pith:BPFZGUSK","schema_version":"1.0","canonical_sha256":"0bcb93524a294cf888519e19ea8d2c491bf5d1c08ad73f9d184595c2dddefc08","source":{"kind":"arxiv","id":"2502.05173","version":3},"attestation_state":"computed","paper":{"title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dahua Lin, Haodong Duan, Jian Tong, Jiaqi Wang, Pan Zhang, Qipeng Guo, Xiaoran Liu, Xiaoyi Dong, Xilin Wei, Xipeng Qiu, Yuhang Cao, Yuhang Zang","submitted_at":"2025-02-07T18:56:04Z","abstract_excerpt":"While Rotary Position Embedding (RoPE) and its variants are widely adopted for their long-context capabilities, the extension of the 1D RoPE to video, with its complex spatio-temporal structure, remains an open challenge. This work first introduces a comprehensive analysis that identifies four key characteristics essential for the effective adaptation of RoPE to video, which have not been fully considered in prior work. As part of our analysis, we introduce a challenging V-NIAH-D (Visual Needle-In-A-Haystack with Distractors) task, which adds periodic distractors into V-NIAH. The V-NIAH-D task"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.05173","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-02-07T18:56:04Z","cross_cats_sorted":[],"title_canon_sha256":"a6884595f640859f4bbe0e34b31d557809326ec89d9600702498dd786dce7232","abstract_canon_sha256":"e9deb1156c55d42fdbfc2041d34158a30606e96f14f4d7323fb2844da94a2182"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:12:25.710626Z","signature_b64":"taVEh9xc8zB30PQVoYIuiO0bMLbyxk6BkICzLjSjX15gXh7fZ7LKBKl/+KKFLQAIE2tKKJ6pd2OqY6KD595OBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0bcb93524a294cf888519e19ea8d2c491bf5d1c08ad73f9d184595c2dddefc08","last_reissued_at":"2026-07-05T11:12:25.710024Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:12:25.710024Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dahua Lin, Haodong Duan, Jian Tong, Jiaqi Wang, Pan Zhang, Qipeng Guo, Xiaoran Liu, Xiaoyi Dong, Xilin Wei, Xipeng Qiu, Yuhang Cao, Yuhang Zang","submitted_at":"2025-02-07T18:56:04Z","abstract_excerpt":"While Rotary Position Embedding (RoPE) and its variants are widely adopted for their long-context capabilities, the extension of the 1D RoPE to video, with its complex spatio-temporal structure, remains an open challenge. This work first introduces a comprehensive analysis that identifies four key characteristics essential for the effective adaptation of RoPE to video, which have not been fully considered in prior work. As part of our analysis, we introduce a challenging V-NIAH-D (Visual Needle-In-A-Haystack with Distractors) task, which adds periodic distractors into V-NIAH. The V-NIAH-D task"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.05173","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.05173/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.05173","created_at":"2026-07-05T11:12:25.710091+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.05173v3","created_at":"2026-07-05T11:12:25.710091+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.05173","created_at":"2026-07-05T11:12:25.710091+00:00"},{"alias_kind":"pith_short_12","alias_value":"BPFZGUSKFFGP","created_at":"2026-07-05T11:12:25.710091+00:00"},{"alias_kind":"pith_short_16","alias_value":"BPFZGUSKFFGPRCCR","created_at":"2026-07-05T11:12:25.710091+00:00"},{"alias_kind":"pith_short_8","alias_value":"BPFZGUSK","created_at":"2026-07-05T11:12:25.710091+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.21734","citing_title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","ref_index":130,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09250","citing_title":"LiteVSR: Lightweight Adaptation of Frozen Diffusion Transformers for Video Super-Resolution","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03578","citing_title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16416","citing_title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2505.05472","citing_title":"Mogao: An Omni Foundation Model for Interleaved Multi-Modal Generation","ref_index":83,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00968","citing_title":"Adaptive 3D-RoPE: Physics-Aligned Rotary Positional Encoding for Wireless Foundation Models","ref_index":9,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE","json":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE.json","graph_json":"https://pith.science/api/pith-number/BPFZGUSKFFGPRCCRTYM6VDJMJE/graph.json","events_json":"https://pith.science/api/pith-number/BPFZGUSKFFGPRCCRTYM6VDJMJE/events.json","paper":"https://pith.science/paper/BPFZGUSK"},"agent_actions":{"view_html":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE","download_json":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE.json","view_paper":"https://pith.science/paper/BPFZGUSK","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.05173&json=true","fetch_graph":"https://pith.science/api/pith-number/BPFZGUSKFFGPRCCRTYM6VDJMJE/graph.json","fetch_events":"https://pith.science/api/pith-number/BPFZGUSKFFGPRCCRTYM6VDJMJE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE/action/storage_attestation","attest_author":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE/action/author_attestation","sign_citation":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE/action/citation_signature","submit_replication":"https://pith.science/pith/BPFZGUSKFFGPRCCRTYM6VDJMJE/action/replication_record"}},"created_at":"2026-07-05T11:12:25.710091+00:00","updated_at":"2026-07-05T11:12:25.710091+00:00"}