{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2SGHLGDVN7RQSWRHWTFRMI2WXA","short_pith_number":"pith:2SGHLGDV","schema_version":"1.0","canonical_sha256":"d48c7598756fe3095a27b4cb162356b82b9947cc246cd5ba41414a01c7f7ed84","source":{"kind":"arxiv","id":"2411.00785","version":1},"attestation_state":"computed","paper":{"title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Chuheng Zhang, Derek Cathera Yang, Jiang Bian, Junliang Guo, Li Zhao, Pushi Zhang, Tianyu He, Xiaoyu Chen","submitted_at":"2024-10-17T13:41:16Z","abstract_excerpt":"We introduce Image-GOal Representations (IGOR), aiming to learn a unified, semantically consistent action space across human and various robots. Through this unified latent action space, IGOR enables knowledge transfer among large-scale robot and human activity data. We achieve this by compressing visual changes between an initial image and its goal state into latent actions. IGOR allows us to generate latent action labels for internet-scale video data. This unified latent action space enables the training of foundation policy and world models across a wide variety of tasks performed by both r"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2411.00785","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-10-17T13:41:16Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"abf44e970d40c4eb5ceaf4836d2e0c329fb4f875c72ac755095b45214dca9fc6","abstract_canon_sha256":"05c2e79f95bf01a0000f774b8420cef6948d15ebe4a0a0b590c59abef36b35b4"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:29:50.425884Z","signature_b64":"D/knTRthaHWCtObtXfKg5J2jWpqtLgt8t4EgXBu4/4lSJf7XJ7doYr9OZLQOEIDLM4iAsqXcVeFWfhCUN679Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d48c7598756fe3095a27b4cb162356b82b9947cc246cd5ba41414a01c7f7ed84","last_reissued_at":"2026-07-05T09:29:50.425376Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:29:50.425376Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"IGOR: Image-GOal Representations are the Atomic Control Units for Foundation Models in Embodied AI","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Chuheng Zhang, Derek Cathera Yang, Jiang Bian, Junliang Guo, Li Zhao, Pushi Zhang, Tianyu He, Xiaoyu Chen","submitted_at":"2024-10-17T13:41:16Z","abstract_excerpt":"We introduce Image-GOal Representations (IGOR), aiming to learn a unified, semantically consistent action space across human and various robots. Through this unified latent action space, IGOR enables knowledge transfer among large-scale robot and human activity data. We achieve this by compressing visual changes between an initial image and its goal state into latent actions. IGOR allows us to generate latent action labels for internet-scale video data. This unified latent action space enables the training of foundation policy and world models across a wide variety of tasks performed by both r"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2411.00785","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2411.00785/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2411.00785","created_at":"2026-07-05T09:29:50.425442+00:00"},{"alias_kind":"arxiv_version","alias_value":"2411.00785v1","created_at":"2026-07-05T09:29:50.425442+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2411.00785","created_at":"2026-07-05T09:29:50.425442+00:00"},{"alias_kind":"pith_short_12","alias_value":"2SGHLGDVN7RQ","created_at":"2026-07-05T09:29:50.425442+00:00"},{"alias_kind":"pith_short_16","alias_value":"2SGHLGDVN7RQSWRH","created_at":"2026-07-05T09:29:50.425442+00:00"},{"alias_kind":"pith_short_8","alias_value":"2SGHLGDV","created_at":"2026-07-05T09:29:50.425442+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":27,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26095","citing_title":"Learning Action Priors for Cross-embodiment Robot Manipulation","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2606.21672","citing_title":"Imitation from Heterogeneous Demonstrations using Grounded Latent-Action World Models","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18955","citing_title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.18955","citing_title":"Motion-Focused Latent Action Enables Cross-Embodiment VLA Training from Human EgoVideos","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07100","citing_title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.04130","citing_title":"CLAW: Learning Continuous Latent Action World Models via Adversarial Latent Regularization","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07100","citing_title":"LARA: Latent Action Representation Alignment for Vision-Language-Action Models","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00054","citing_title":"From Human Videos to Robot Manipulation: A Survey on Scalable Vision-Language-Action Learning with Human-Centric Data","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2506.14135","citing_title":"GAF: Gaussian Action Field as a 4D Representation for Dynamic World Modeling in Robotic Manipulation","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24681","citing_title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20223","citing_title":"Why Latent Actions Fail, and How to Prevent It","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15725","citing_title":"DiLA: Disentangled Latent Action World Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15735","citing_title":"UAM: A Dual-Stream Perspective on Forgetting in VLA Training","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15733","citing_title":"Structure Abstraction and Generalization in a Hippocampal-Entorhinal Inspired World Model","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2602.06949","citing_title":"DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2507.23682","citing_title":"villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2602.20231","citing_title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10819","citing_title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13403","citing_title":"RotVLA: Rotational Latent Action for Vision-Language-Action Model","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14803","citing_title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","ref_index":93,"is_internal_anchor":false},{"citing_arxiv_id":"2505.06111","citing_title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10819","citing_title":"ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24681","citing_title":"Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06175","citing_title":"VLA-GSE: Boosting Parameter-Efficient Fine-Tuning in VLA with Generalized and Specialized Experts","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22615","citing_title":"GazeVLA: Learning Human Intention for Robotic Manipulation","ref_index":14,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA","json":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA.json","graph_json":"https://pith.science/api/pith-number/2SGHLGDVN7RQSWRHWTFRMI2WXA/graph.json","events_json":"https://pith.science/api/pith-number/2SGHLGDVN7RQSWRHWTFRMI2WXA/events.json","paper":"https://pith.science/paper/2SGHLGDV"},"agent_actions":{"view_html":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA","download_json":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA.json","view_paper":"https://pith.science/paper/2SGHLGDV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2411.00785&json=true","fetch_graph":"https://pith.science/api/pith-number/2SGHLGDVN7RQSWRHWTFRMI2WXA/graph.json","fetch_events":"https://pith.science/api/pith-number/2SGHLGDVN7RQSWRHWTFRMI2WXA/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA/action/storage_attestation","attest_author":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA/action/author_attestation","sign_citation":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA/action/citation_signature","submit_replication":"https://pith.science/pith/2SGHLGDVN7RQSWRHWTFRMI2WXA/action/replication_record"}},"created_at":"2026-07-05T09:29:50.425442+00:00","updated_at":"2026-07-05T09:29:50.425442+00:00"}