{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:DXGUZQA3OHGWECCXAQUNF2N2PL","short_pith_number":"pith:DXGUZQA3","schema_version":"1.0","canonical_sha256":"1dcd4cc01b71cd6208570428d2e9ba7ad518140ff4ad8ee032a5a04dd81f24db","source":{"kind":"arxiv","id":"2502.04296","version":1},"attestation_state":"computed","paper":{"title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Chaoqi Liu, Kevin Zhao, Lirui Wang, Xinlei Chen","submitted_at":"2025-02-06T18:38:26Z","abstract_excerpt":"We propose Heterogeneous Masked Autoregression (HMA) for modeling action-video dynamics to generate high-quality data and evaluation in scaling robot learning. Building interactive video world models and policies for robotics is difficult due to the challenge of handling diverse settings while maintaining computational efficiency to run in real time. HMA uses heterogeneous pre-training from observations and action sequences across different robotic embodiments, domains, and tasks. HMA uses masked autoregression to generate quantized or soft tokens for video predictions. \\ourshort achieves bett"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.04296","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-02-06T18:38:26Z","cross_cats_sorted":["cs.CV","cs.LG"],"title_canon_sha256":"944d46c8a08513f13687b3ce4fef4c878eaf4d57f87c798ff1686bb8d4c1fa34","abstract_canon_sha256":"1ae2c925c8c5fde790450877be3ec1145328cc6a13b7bad44233103511cc25a4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:10:36.306661Z","signature_b64":"2+95j3rDSwf5ufWYUe3HrGXZsgW9j9EuXHujfgcDVTpsZKwUT7uMFfMsuQVp6fkhJzKBpbXiouw1vWpDLCgyAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1dcd4cc01b71cd6208570428d2e9ba7ad518140ff4ad8ee032a5a04dd81f24db","last_reissued_at":"2026-07-05T10:10:36.306205Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:10:36.306205Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CV","cs.LG"],"primary_cat":"cs.RO","authors_text":"Chaoqi Liu, Kevin Zhao, Lirui Wang, Xinlei Chen","submitted_at":"2025-02-06T18:38:26Z","abstract_excerpt":"We propose Heterogeneous Masked Autoregression (HMA) for modeling action-video dynamics to generate high-quality data and evaluation in scaling robot learning. Building interactive video world models and policies for robotics is difficult due to the challenge of handling diverse settings while maintaining computational efficiency to run in real time. HMA uses heterogeneous pre-training from observations and action sequences across different robotic embodiments, domains, and tasks. HMA uses masked autoregression to generate quantized or soft tokens for video predictions. \\ourshort achieves bett"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.04296","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.04296/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.04296","created_at":"2026-07-05T10:10:36.306256+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.04296v1","created_at":"2026-07-05T10:10:36.306256+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.04296","created_at":"2026-07-05T10:10:36.306256+00:00"},{"alias_kind":"pith_short_12","alias_value":"DXGUZQA3OHGW","created_at":"2026-07-05T10:10:36.306256+00:00"},{"alias_kind":"pith_short_16","alias_value":"DXGUZQA3OHGWECCX","created_at":"2026-07-05T10:10:36.306256+00:00"},{"alias_kind":"pith_short_8","alias_value":"DXGUZQA3","created_at":"2026-07-05T10:10:36.306256+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01060","citing_title":"RoboWorld: Fast and Reliable Neural Simulators for Generalist Robot Policy Evaluation","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00113","citing_title":"World Models for Robotic Manipulation: A Survey","ref_index":34,"is_internal_anchor":false},{"citing_arxiv_id":"2512.21898","citing_title":"Flexible Multitask Learning with Factorized Diffusion Policy","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2602.06949","citing_title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","ref_index":95,"is_internal_anchor":false},{"citing_arxiv_id":"2505.11709","citing_title":"EgoDex: Learning Dexterous Manipulation from Large-Scale Egocentric Video","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2603.09030","citing_title":"PlayWorld: Learning Robot World Models from Autonomous Play","ref_index":88,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL","json":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL.json","graph_json":"https://pith.science/api/pith-number/DXGUZQA3OHGWECCXAQUNF2N2PL/graph.json","events_json":"https://pith.science/api/pith-number/DXGUZQA3OHGWECCXAQUNF2N2PL/events.json","paper":"https://pith.science/paper/DXGUZQA3"},"agent_actions":{"view_html":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL","download_json":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL.json","view_paper":"https://pith.science/paper/DXGUZQA3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.04296&json=true","fetch_graph":"https://pith.science/api/pith-number/DXGUZQA3OHGWECCXAQUNF2N2PL/graph.json","fetch_events":"https://pith.science/api/pith-number/DXGUZQA3OHGWECCXAQUNF2N2PL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL/action/storage_attestation","attest_author":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL/action/author_attestation","sign_citation":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL/action/citation_signature","submit_replication":"https://pith.science/pith/DXGUZQA3OHGWECCXAQUNF2N2PL/action/replication_record"}},"created_at":"2026-07-05T10:10:36.306256+00:00","updated_at":"2026-07-05T10:10:36.306256+00:00"}