{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:OWOIWDFAQ2EQ7ZGTRLSQJDF4ED","short_pith_number":"pith:OWOIWDFA","schema_version":"1.0","canonical_sha256":"759c8b0ca086890fe4d38ae5048cbc20f96730003b75bd25804f34ec9f89082d","source":{"kind":"arxiv","id":"2507.01961","version":3},"attestation_state":"computed","paper":{"title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Chengkai Hou, Chenyang Gu, Han Jiang, Jiaming Liu, Lily Li, Pengwei Wang, Renrui Zhang, Shanghang Zhang, Sixiang Chen, Siyuan Qian, Zhongyuan Wang, Zhuoyang Liu","submitted_at":"2025-07-02T17:59:54Z","abstract_excerpt":"Recently, mobile manipulation has attracted increasing attention for enabling language-conditioned robotic control in household tasks. However, existing methods still face challenges in coordinating mobile base and manipulator, primarily due to two limitations. On the one hand, they fail to explicitly model the influence of the mobile base on manipulator control, which easily leads to error accumulation under high degrees of freedom. On the other hand, they treat the entire mobile manipulation process with the same visual observation modality (e.g., either all 2D or all 3D), overlooking the di"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.01961","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-07-02T17:59:54Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"e41d28cc993dc9cfcf7d8dabc972b242218bf5ba89065421e3578a1f3a205b18","abstract_canon_sha256":"a75de80518dbe6b558765440fd3ce50adaf1ffe6d1ae1d8d7db19482d1bd97ae"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:32:33.572958Z","signature_b64":"gqjbI51Q2/FFxWhvVRc+9znRr5tSJc+YdPvXu4ZGwCsbxOxtSlsAqiSpjhIPJ1FYS17JrR0OiZ3akLH5xOIiCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"759c8b0ca086890fe4d38ae5048cbc20f96730003b75bd25804f34ec9f89082d","last_reissued_at":"2026-07-05T11:32:33.572451Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:32:33.572451Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"AC-DiT: Adaptive Coordination Diffusion Transformer for Mobile Manipulation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Chengkai Hou, Chenyang Gu, Han Jiang, Jiaming Liu, Lily Li, Pengwei Wang, Renrui Zhang, Shanghang Zhang, Sixiang Chen, Siyuan Qian, Zhongyuan Wang, Zhuoyang Liu","submitted_at":"2025-07-02T17:59:54Z","abstract_excerpt":"Recently, mobile manipulation has attracted increasing attention for enabling language-conditioned robotic control in household tasks. However, existing methods still face challenges in coordinating mobile base and manipulator, primarily due to two limitations. On the one hand, they fail to explicitly model the influence of the mobile base on manipulator control, which easily leads to error accumulation under high degrees of freedom. On the other hand, they treat the entire mobile manipulation process with the same visual observation modality (e.g., either all 2D or all 3D), overlooking the di"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.01961","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.01961/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.01961","created_at":"2026-07-05T11:32:33.572510+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.01961v3","created_at":"2026-07-05T11:32:33.572510+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.01961","created_at":"2026-07-05T11:32:33.572510+00:00"},{"alias_kind":"pith_short_12","alias_value":"OWOIWDFAQ2EQ","created_at":"2026-07-05T11:32:33.572510+00:00"},{"alias_kind":"pith_short_16","alias_value":"OWOIWDFAQ2EQ7ZGT","created_at":"2026-07-05T11:32:33.572510+00:00"},{"alias_kind":"pith_short_8","alias_value":"OWOIWDFA","created_at":"2026-07-05T11:32:33.572510+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.07308","citing_title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2602.23024","citing_title":"InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07308","citing_title":"AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15281","citing_title":"R3D: Revisiting 3D Policy Learning","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED","json":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED.json","graph_json":"https://pith.science/api/pith-number/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/graph.json","events_json":"https://pith.science/api/pith-number/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/events.json","paper":"https://pith.science/paper/OWOIWDFA"},"agent_actions":{"view_html":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED","download_json":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED.json","view_paper":"https://pith.science/paper/OWOIWDFA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.01961&json=true","fetch_graph":"https://pith.science/api/pith-number/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/graph.json","fetch_events":"https://pith.science/api/pith-number/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/action/storage_attestation","attest_author":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/action/author_attestation","sign_citation":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/action/citation_signature","submit_replication":"https://pith.science/pith/OWOIWDFAQ2EQ7ZGTRLSQJDF4ED/action/replication_record"}},"created_at":"2026-07-05T11:32:33.572510+00:00","updated_at":"2026-07-05T11:32:33.572510+00:00"}