{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:UREFRX4Z2RZMLRNA6VXPHRWZTX","short_pith_number":"pith:UREFRX4Z","schema_version":"1.0","canonical_sha256":"a44858df99d472c5c5a0f56ef3c6d99df635f73986a716c80cd2aa5627b4d7cf","source":{"kind":"arxiv","id":"2410.10088","version":1},"attestation_state":"computed","paper":{"title":"The Ingredients for Robotic Diffusion Transformers","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Mohan Kumar Srirama, Oier Mees, Sebastian Zhao, Sergey Levine, Sudeep Dasari","submitted_at":"2024-10-14T02:02:54Z","abstract_excerpt":"In recent years roboticists have achieved remarkable progress in solving increasingly general tasks on dexterous robotic hardware by leveraging high capacity Transformer network architectures and generative diffusion models. Unfortunately, combining these two orthogonal improvements has proven surprisingly difficult, since there is no clear and well-understood process for making important design choices. In this paper, we identify, study and improve key architectural design decisions for high-capacity diffusion transformer policies. The resulting models can efficiently solve diverse tasks on m"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.10088","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-10-14T02:02:54Z","cross_cats_sorted":["cs.AI","cs.CV","cs.LG"],"title_canon_sha256":"e2e56102b565d5293bf5f1ace3167c14d79b735760a80fbc69cdacb0c34dafa8","abstract_canon_sha256":"181c4bde4ede5ff72f9af7c753b5bdc5fac5625df274d856d552de35b05d7972"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:20:10.933492Z","signature_b64":"mYSyYMNG7sNKTkFy0tlCiqFryLKxY7i1IcAtvkux01kFNX4gXhe0pFdMBBpxCJqGJK70NgakD9NAj+MeMtO3Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a44858df99d472c5c5a0f56ef3c6d99df635f73986a716c80cd2aa5627b4d7cf","last_reissued_at":"2026-07-05T09:20:10.932937Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:20:10.932937Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"The Ingredients for Robotic Diffusion Transformers","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Mohan Kumar Srirama, Oier Mees, Sebastian Zhao, Sergey Levine, Sudeep Dasari","submitted_at":"2024-10-14T02:02:54Z","abstract_excerpt":"In recent years roboticists have achieved remarkable progress in solving increasingly general tasks on dexterous robotic hardware by leveraging high capacity Transformer network architectures and generative diffusion models. Unfortunately, combining these two orthogonal improvements has proven surprisingly difficult, since there is no clear and well-understood process for making important design choices. In this paper, we identify, study and improve key architectural design decisions for high-capacity diffusion transformer policies. The resulting models can efficiently solve diverse tasks on m"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.10088","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.10088/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.10088","created_at":"2026-07-05T09:20:10.933008+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.10088v1","created_at":"2026-07-05T09:20:10.933008+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.10088","created_at":"2026-07-05T09:20:10.933008+00:00"},{"alias_kind":"pith_short_12","alias_value":"UREFRX4Z2RZM","created_at":"2026-07-05T09:20:10.933008+00:00"},{"alias_kind":"pith_short_16","alias_value":"UREFRX4Z2RZMLRNA","created_at":"2026-07-05T09:20:10.933008+00:00"},{"alias_kind":"pith_short_8","alias_value":"UREFRX4Z","created_at":"2026-07-05T09:20:10.933008+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":11,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.16917","citing_title":"Unified Motion-Action Modeling for Heterogeneous Robot Learning","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06281","citing_title":"Multi-Resolution Tactile Imitation Learning for Contact-Rich Robotic Manipulation","ref_index":48,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00110","citing_title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","ref_index":105,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29407","citing_title":"Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01151","citing_title":"Lagrangian Perturbation Diffusion Steering: Latent Reinforcement Learning for Generative Policies","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18556","citing_title":"Key-Gram: Extensible World Knowledge for Embodied Manipulation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2509.21983","citing_title":"Hybrid Diffusion for Simultaneous Symbolic and Continuous Planning","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2506.15799","citing_title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2502.05855","citing_title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2504.02792","citing_title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05672","citing_title":"A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX","json":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX.json","graph_json":"https://pith.science/api/pith-number/UREFRX4Z2RZMLRNA6VXPHRWZTX/graph.json","events_json":"https://pith.science/api/pith-number/UREFRX4Z2RZMLRNA6VXPHRWZTX/events.json","paper":"https://pith.science/paper/UREFRX4Z"},"agent_actions":{"view_html":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX","download_json":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX.json","view_paper":"https://pith.science/paper/UREFRX4Z","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.10088&json=true","fetch_graph":"https://pith.science/api/pith-number/UREFRX4Z2RZMLRNA6VXPHRWZTX/graph.json","fetch_events":"https://pith.science/api/pith-number/UREFRX4Z2RZMLRNA6VXPHRWZTX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX/action/storage_attestation","attest_author":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX/action/author_attestation","sign_citation":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX/action/citation_signature","submit_replication":"https://pith.science/pith/UREFRX4Z2RZMLRNA6VXPHRWZTX/action/replication_record"}},"created_at":"2026-07-05T09:20:10.933008+00:00","updated_at":"2026-07-05T09:20:10.933008+00:00"}