{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2BBY3AZ33EB5EFAWQC3YWE4U7G","short_pith_number":"pith:2BBY3AZ3","schema_version":"1.0","canonical_sha256":"d0438d833bd903d2141680b78b1394f9b1af73f44abf97aac51d1d5146a8b94d","source":{"kind":"arxiv","id":"2404.12281","version":3},"attestation_state":"computed","paper":{"title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Cewu Lu, Chenxi Wang, Hao-Shu Fang, Hongjie Fang","submitted_at":"2024-04-18T15:57:19Z","abstract_excerpt":"Precise robot manipulations require rich spatial information in imitation learning. Image-based policies model object positions from fixed cameras, which are sensitive to camera view changes. Policies utilizing 3D point clouds usually predict keyframes rather than continuous actions, posing difficulty in dynamic and contact-rich scenarios. To utilize 3D perception efficiently, we present RISE, an end-to-end baseline for real-world imitation learning, which predicts continuous actions directly from single-view point clouds. It compresses the point cloud to tokens with a sparse 3D encoder. After"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.12281","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-04-18T15:57:19Z","cross_cats_sorted":[],"title_canon_sha256":"c60eec17f5731a768e663e26a0aa366d9c8288098c793ad4de59a3a4d65c60b0","abstract_canon_sha256":"d080a56348947a7c2aa3f7f5fb31b8d8858927fa481e7d94fda058eff35f2ff3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:05:14.377895Z","signature_b64":"3Dn12yikHXwcMLVjH2kztBlSImPCExs7Bhithm1VB3YQcdUjVI92LoRaZaSK++67MReMBI16u6yM/tRXHZrQAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d0438d833bd903d2141680b78b1394f9b1af73f44abf97aac51d1d5146a8b94d","last_reissued_at":"2026-07-05T09:05:14.377436Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:05:14.377436Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RISE: 3D Perception Makes Real-World Robot Imitation Simple and Effective","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Cewu Lu, Chenxi Wang, Hao-Shu Fang, Hongjie Fang","submitted_at":"2024-04-18T15:57:19Z","abstract_excerpt":"Precise robot manipulations require rich spatial information in imitation learning. Image-based policies model object positions from fixed cameras, which are sensitive to camera view changes. Policies utilizing 3D point clouds usually predict keyframes rather than continuous actions, posing difficulty in dynamic and contact-rich scenarios. To utilize 3D perception efficiently, we present RISE, an end-to-end baseline for real-world imitation learning, which predicts continuous actions directly from single-view point clouds. It compresses the point cloud to tokens with a sparse 3D encoder. After"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.12281","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.12281/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.12281","created_at":"2026-07-05T09:05:14.377491+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.12281v3","created_at":"2026-07-05T09:05:14.377491+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.12281","created_at":"2026-07-05T09:05:14.377491+00:00"},{"alias_kind":"pith_short_12","alias_value":"2BBY3AZ33EB5","created_at":"2026-07-05T09:05:14.377491+00:00"},{"alias_kind":"pith_short_16","alias_value":"2BBY3AZ33EB5EFAW","created_at":"2026-07-05T09:05:14.377491+00:00"},{"alias_kind":"pith_short_8","alias_value":"2BBY3AZ3","created_at":"2026-07-05T09:05:14.377491+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26800","citing_title":"SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26800","citing_title":"SSI-Policy: Learning Structured Scene Interfaces for Vision-Language Robotic Manipulation","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13428","citing_title":"SID: Sliding into Distribution for Robust Few-Demonstration Manipulation","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10201","citing_title":"HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10201","citing_title":"HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions","ref_index":46,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G","json":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G.json","graph_json":"https://pith.science/api/pith-number/2BBY3AZ33EB5EFAWQC3YWE4U7G/graph.json","events_json":"https://pith.science/api/pith-number/2BBY3AZ33EB5EFAWQC3YWE4U7G/events.json","paper":"https://pith.science/paper/2BBY3AZ3"},"agent_actions":{"view_html":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G","download_json":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G.json","view_paper":"https://pith.science/paper/2BBY3AZ3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.12281&json=true","fetch_graph":"https://pith.science/api/pith-number/2BBY3AZ33EB5EFAWQC3YWE4U7G/graph.json","fetch_events":"https://pith.science/api/pith-number/2BBY3AZ33EB5EFAWQC3YWE4U7G/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G/action/storage_attestation","attest_author":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G/action/author_attestation","sign_citation":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G/action/citation_signature","submit_replication":"https://pith.science/pith/2BBY3AZ33EB5EFAWQC3YWE4U7G/action/replication_record"}},"created_at":"2026-07-05T09:05:14.377491+00:00","updated_at":"2026-07-05T09:05:14.377491+00:00"}