{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:HJIIE7CPUZBCPMJ4PXXD2J7DCU","short_pith_number":"pith:HJIIE7CP","schema_version":"1.0","canonical_sha256":"3a50827c4fa64227b13c7dee3d27e31522e18f40e1b40cc001bd428b5d8af123","source":{"kind":"arxiv","id":"2307.07635","version":3},"attestation_state":"computed","paper":{"title":"CoTracker: It is Better to Track Together","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Andrea Vedaldi, Benjamin Graham, Christian Rupprecht, Ignacio Rocco, Natalia Neverova, Nikita Karaev","submitted_at":"2023-07-14T21:13:04Z","abstract_excerpt":"We introduce CoTracker, a transformer-based model that tracks a large number of 2D points in long video sequences. Differently from most existing approaches that track points independently, CoTracker tracks them jointly, accounting for their dependencies. We show that joint tracking significantly improves tracking accuracy and robustness, and allows CoTracker to track occluded points and points outside of the camera view. We also introduce several innovations for this class of trackers, including using token proxies that significantly improve memory efficiency and allow CoTracker to track 70k "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.07635","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.CV","submitted_at":"2023-07-14T21:13:04Z","cross_cats_sorted":[],"title_canon_sha256":"b45aa1f98d35a066de6e1640f2c2dba714be3f003b59c229135bf8e6b63f95df","abstract_canon_sha256":"fe4a9fb10c75981ef1a165c2ae30f7e7bebd1f6c53250caee2c1553829488b4b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:13:47.154891Z","signature_b64":"5kBFy8h3nfvh8em0ajvghcVZRxEFwNwgertMARmVgZx1Vi2khNpxJAiVnkmh+IPJYiGiv1gO8tOC7WfnPX4dDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3a50827c4fa64227b13c7dee3d27e31522e18f40e1b40cc001bd428b5d8af123","last_reissued_at":"2026-07-05T09:13:47.154401Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:13:47.154401Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CoTracker: It is Better to Track Together","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Andrea Vedaldi, Benjamin Graham, Christian Rupprecht, Ignacio Rocco, Natalia Neverova, Nikita Karaev","submitted_at":"2023-07-14T21:13:04Z","abstract_excerpt":"We introduce CoTracker, a transformer-based model that tracks a large number of 2D points in long video sequences. Differently from most existing approaches that track points independently, CoTracker tracks them jointly, accounting for their dependencies. We show that joint tracking significantly improves tracking accuracy and robustness, and allows CoTracker to track occluded points and points outside of the camera view. We also introduce several innovations for this class of trackers, including using token proxies that significantly improve memory efficiency and allow CoTracker to track 70k "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.07635","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.07635/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.07635","created_at":"2026-07-05T09:13:47.154460+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.07635v3","created_at":"2026-07-05T09:13:47.154460+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.07635","created_at":"2026-07-05T09:13:47.154460+00:00"},{"alias_kind":"pith_short_12","alias_value":"HJIIE7CPUZBC","created_at":"2026-07-05T09:13:47.154460+00:00"},{"alias_kind":"pith_short_16","alias_value":"HJIIE7CPUZBCPMJ4","created_at":"2026-07-05T09:13:47.154460+00:00"},{"alias_kind":"pith_short_8","alias_value":"HJIIE7CP","created_at":"2026-07-05T09:13:47.154460+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.20781","citing_title":"World Action Models: A Survey","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08828","citing_title":"Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2606.28128","citing_title":"PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2412.03077","citing_title":"RoDyGS: Robust Dynamic Gaussian Splatting for Casual Videos","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16530","citing_title":"SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18010","citing_title":"Functionalization via Structure Completion and Motion Rectification","ref_index":154,"is_internal_anchor":false},{"citing_arxiv_id":"2408.16061","citing_title":"3D Reconstruction with Spatial Memory","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2401.00025","citing_title":"Any-point Trajectory Modeling for Policy Learning","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2409.01652","citing_title":"ReKep: Spatio-Temporal Reasoning of Relational Keypoint Constraints for Robotic Manipulation","ref_index":144,"is_internal_anchor":false},{"citing_arxiv_id":"2412.10345","citing_title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2409.16283","citing_title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10333","citing_title":"Zero-shot World Models Are Developmentally Efficient Learners","ref_index":53,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU","json":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU.json","graph_json":"https://pith.science/api/pith-number/HJIIE7CPUZBCPMJ4PXXD2J7DCU/graph.json","events_json":"https://pith.science/api/pith-number/HJIIE7CPUZBCPMJ4PXXD2J7DCU/events.json","paper":"https://pith.science/paper/HJIIE7CP"},"agent_actions":{"view_html":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU","download_json":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU.json","view_paper":"https://pith.science/paper/HJIIE7CP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.07635&json=true","fetch_graph":"https://pith.science/api/pith-number/HJIIE7CPUZBCPMJ4PXXD2J7DCU/graph.json","fetch_events":"https://pith.science/api/pith-number/HJIIE7CPUZBCPMJ4PXXD2J7DCU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU/action/storage_attestation","attest_author":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU/action/author_attestation","sign_citation":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU/action/citation_signature","submit_replication":"https://pith.science/pith/HJIIE7CPUZBCPMJ4PXXD2J7DCU/action/replication_record"}},"created_at":"2026-07-05T09:13:47.154460+00:00","updated_at":"2026-07-05T09:13:47.154460+00:00"}