{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:FZD6HX5FQPBP42UOUXFGFFT7CB","short_pith_number":"pith:FZD6HX5F","schema_version":"1.0","canonical_sha256":"2e47e3dfa583c2fe6a8ea5ca62967f10586539e7a0830853ef05a3b51a3b8439","source":{"kind":"arxiv","id":"2412.06782","version":3},"attestation_state":"computed","paper":{"title":"CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Donglin Wang, Mingyang Sun, Pengxiang Ding, Shangke Lyu, Siteng Huang, Wei Zhao, Zhaoxin Fan, Zhefei Gong","submitted_at":"2024-12-09T18:59:18Z","abstract_excerpt":"In robotic visuomotor policy learning, diffusion-based models have achieved significant success in improving the accuracy of action trajectory generation compared to traditional autoregressive models. However, they suffer from inefficiency due to multiple denoising steps and limited flexibility from complex constraints. In this paper, we introduce Coarse-to-Fine AutoRegressive Policy (CARP), a novel paradigm for visuomotor policy learning that redefines the autoregressive action generation process as a coarse-to-fine, next-scale approach. CARP decouples action generation into two stages: first"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.06782","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-12-09T18:59:18Z","cross_cats_sorted":["cs.CV"],"title_canon_sha256":"f2699117bd53f50397184772f85bd8cc0a178dfcaf3375546607ec4a2702467d","abstract_canon_sha256":"0d76e3b06489ccae0437da71e5a94509a58d3cc14bd2e449a7b1ecc30d4161c1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:51:19.796688Z","signature_b64":"6uVh7/OYmcbqjkXTHmO1PwahdVhxIOS2WfnDGeKiEf47u0MhIVUdunM/+uzZR6R+6Sxpu/QbOgmQY3jQydjBDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2e47e3dfa583c2fe6a8ea5ca62967f10586539e7a0830853ef05a3b51a3b8439","last_reissued_at":"2026-07-05T11:51:19.796054Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:51:19.796054Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CARP: Visuomotor Policy Learning via Coarse-to-Fine Autoregressive Prediction","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV"],"primary_cat":"cs.RO","authors_text":"Donglin Wang, Mingyang Sun, Pengxiang Ding, Shangke Lyu, Siteng Huang, Wei Zhao, Zhaoxin Fan, Zhefei Gong","submitted_at":"2024-12-09T18:59:18Z","abstract_excerpt":"In robotic visuomotor policy learning, diffusion-based models have achieved significant success in improving the accuracy of action trajectory generation compared to traditional autoregressive models. However, they suffer from inefficiency due to multiple denoising steps and limited flexibility from complex constraints. In this paper, we introduce Coarse-to-Fine AutoRegressive Policy (CARP), a novel paradigm for visuomotor policy learning that redefines the autoregressive action generation process as a coarse-to-fine, next-scale approach. CARP decouples action generation into two stages: first"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.06782","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.06782/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.06782","created_at":"2026-07-05T11:51:19.796122+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.06782v3","created_at":"2026-07-05T11:51:19.796122+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.06782","created_at":"2026-07-05T11:51:19.796122+00:00"},{"alias_kind":"pith_short_12","alias_value":"FZD6HX5FQPBP","created_at":"2026-07-05T11:51:19.796122+00:00"},{"alias_kind":"pith_short_16","alias_value":"FZD6HX5FQPBP42UO","created_at":"2026-07-05T11:51:19.796122+00:00"},{"alias_kind":"pith_short_8","alias_value":"FZD6HX5F","created_at":"2026-07-05T11:51:19.796122+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.29570","citing_title":"Hierarchical Policy Learning via Spectral Decomposition","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06067","citing_title":"HiPolicy: Hierarchical Multi-Frequency Action Chunking for Policy Learning","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05544","citing_title":"Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB","json":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB.json","graph_json":"https://pith.science/api/pith-number/FZD6HX5FQPBP42UOUXFGFFT7CB/graph.json","events_json":"https://pith.science/api/pith-number/FZD6HX5FQPBP42UOUXFGFFT7CB/events.json","paper":"https://pith.science/paper/FZD6HX5F"},"agent_actions":{"view_html":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB","download_json":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB.json","view_paper":"https://pith.science/paper/FZD6HX5F","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.06782&json=true","fetch_graph":"https://pith.science/api/pith-number/FZD6HX5FQPBP42UOUXFGFFT7CB/graph.json","fetch_events":"https://pith.science/api/pith-number/FZD6HX5FQPBP42UOUXFGFFT7CB/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB/action/timestamp_anchor","attest_storage":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB/action/storage_attestation","attest_author":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB/action/author_attestation","sign_citation":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB/action/citation_signature","submit_replication":"https://pith.science/pith/FZD6HX5FQPBP42UOUXFGFFT7CB/action/replication_record"}},"created_at":"2026-07-05T11:51:19.796122+00:00","updated_at":"2026-07-05T11:51:19.796122+00:00"}