{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:RRYJSN66UATIMTI57E3EGCB5OI","short_pith_number":"pith:RRYJSN66","schema_version":"1.0","canonical_sha256":"8c709937dea026864d1df93643083d7203d7cd47b51a08ff7b571b94b1090f59","source":{"kind":"arxiv","id":"2410.05260","version":3},"attestation_state":"computed","paper":{"title":"DartControl: A Diffusion-Based Autoregressive Motion Model for Real-Time Text-Driven Motion Control","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.GR"],"primary_cat":"cs.CV","authors_text":"Gen Li, Kaifeng Zhao, Siyu Tang","submitted_at":"2024-10-07T17:58:22Z","abstract_excerpt":"Text-conditioned human motion generation, which allows for user interaction through natural language, has become increasingly popular. Existing methods typically generate short, isolated motions based on a single input sentence. However, human motions are continuous and can extend over long periods, carrying rich semantics. Creating long, complex motions that precisely respond to streams of text descriptions, particularly in an online and real-time setting, remains a significant challenge. Furthermore, incorporating spatial constraints into text-conditioned motion generation presents additiona"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2410.05260","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-10-07T17:58:22Z","cross_cats_sorted":["cs.GR"],"title_canon_sha256":"babfc68010e9b7200391b7939e32539d142aab11754a2b103cefe7d73d1d2b0b","abstract_canon_sha256":"eb3e2d8aceb1953d7486654a0c97174272233e8824416c048b17df07fb6ab52d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:48:19.943949Z","signature_b64":"Yip7foHUA7VC2RTJCmzZSqLCfTdw0D5GQ2QhT7MbWJAlilwo9X8tHBtcioHrGQC6qZW9KT7UW2SNBLH7IgQWDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8c709937dea026864d1df93643083d7203d7cd47b51a08ff7b571b94b1090f59","last_reissued_at":"2026-07-05T10:48:19.943486Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:48:19.943486Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DartControl: A Diffusion-Based Autoregressive Motion Model for Real-Time Text-Driven Motion Control","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.GR"],"primary_cat":"cs.CV","authors_text":"Gen Li, Kaifeng Zhao, Siyu Tang","submitted_at":"2024-10-07T17:58:22Z","abstract_excerpt":"Text-conditioned human motion generation, which allows for user interaction through natural language, has become increasingly popular. Existing methods typically generate short, isolated motions based on a single input sentence. However, human motions are continuous and can extend over long periods, carrying rich semantics. Creating long, complex motions that precisely respond to streams of text descriptions, particularly in an online and real-time setting, remains a significant challenge. Furthermore, incorporating spatial constraints into text-conditioned motion generation presents additiona"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2410.05260","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2410.05260/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2410.05260","created_at":"2026-07-05T10:48:19.943540+00:00"},{"alias_kind":"arxiv_version","alias_value":"2410.05260v3","created_at":"2026-07-05T10:48:19.943540+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2410.05260","created_at":"2026-07-05T10:48:19.943540+00:00"},{"alias_kind":"pith_short_12","alias_value":"RRYJSN66UATI","created_at":"2026-07-05T10:48:19.943540+00:00"},{"alias_kind":"pith_short_16","alias_value":"RRYJSN66UATIMTI5","created_at":"2026-07-05T10:48:19.943540+00:00"},{"alias_kind":"pith_short_8","alias_value":"RRYJSN66","created_at":"2026-07-05T10:48:19.943540+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2512.04678","citing_title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","ref_index":95,"is_internal_anchor":false},{"citing_arxiv_id":"2604.03799","citing_title":"Next-Scale Autoregressive Models for Text-to-Motion Generation","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05544","citing_title":"Referring-Aware Visuomotor Policy Learning for Closed-Loop Manipulation","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13581","citing_title":"SocialMirror: Reconstructing 3D Human Interaction Behaviors from Monocular Videos with Semantic and Geometric Guidance","ref_index":71,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI","json":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI.json","graph_json":"https://pith.science/api/pith-number/RRYJSN66UATIMTI57E3EGCB5OI/graph.json","events_json":"https://pith.science/api/pith-number/RRYJSN66UATIMTI57E3EGCB5OI/events.json","paper":"https://pith.science/paper/RRYJSN66"},"agent_actions":{"view_html":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI","download_json":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI.json","view_paper":"https://pith.science/paper/RRYJSN66","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2410.05260&json=true","fetch_graph":"https://pith.science/api/pith-number/RRYJSN66UATIMTI57E3EGCB5OI/graph.json","fetch_events":"https://pith.science/api/pith-number/RRYJSN66UATIMTI57E3EGCB5OI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI/action/storage_attestation","attest_author":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI/action/author_attestation","sign_citation":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI/action/citation_signature","submit_replication":"https://pith.science/pith/RRYJSN66UATIMTI57E3EGCB5OI/action/replication_record"}},"created_at":"2026-07-05T10:48:19.943540+00:00","updated_at":"2026-07-05T10:48:19.943540+00:00"}