{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:NZD34S44KD7BGNYG5V34KVOCOC","short_pith_number":"pith:NZD34S44","schema_version":"1.0","canonical_sha256":"6e47be4b9c50fe133706ed77c555c27094e36333d8e25af452a826edaac56f80","source":{"kind":"arxiv","id":"2203.04955","version":2},"attestation_state":"computed","paper":{"title":"Temporal Difference Learning for Model Predictive Control","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.LG","authors_text":"Hao Su, Nicklas Hansen, Xiaolong Wang","submitted_at":"2022-03-09T18:58:28Z","abstract_excerpt":"Data-driven model predictive control has two key advantages over model-free methods: a potential for improved sample efficiency through model learning, and better performance as computational budget for planning increases. However, it is both costly to plan over long horizons and challenging to obtain an accurate model of the environment. In this work, we combine the strengths of model-free and model-based methods. We use a learned task-oriented latent dynamics model for local trajectory optimization over a short horizon, and use a learned terminal value function to estimate long-term return, "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2203.04955","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2022-03-09T18:58:28Z","cross_cats_sorted":["cs.RO"],"title_canon_sha256":"4b26da0b243c31acc9fb2b680db307306686bbeaf69759c4f5abbdddda5b30f5","abstract_canon_sha256":"7249dd15b3c4617247d1ce77c557bd67958c3b98c6aee21dd19e5031167a06bc"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:41:54.745696Z","signature_b64":"a2JTw4nx8Tg+670JtqZrYwrQEkyULlr+Mlj5IsKF33uNUbSUsrNf0jxXJuMbKCKcF2GuICN17NPUTzTazGL4Ag==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6e47be4b9c50fe133706ed77c555c27094e36333d8e25af452a826edaac56f80","last_reissued_at":"2026-07-05T04:41:54.745221Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:41:54.745221Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Temporal Difference Learning for Model Predictive Control","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.RO"],"primary_cat":"cs.LG","authors_text":"Hao Su, Nicklas Hansen, Xiaolong Wang","submitted_at":"2022-03-09T18:58:28Z","abstract_excerpt":"Data-driven model predictive control has two key advantages over model-free methods: a potential for improved sample efficiency through model learning, and better performance as computational budget for planning increases. However, it is both costly to plan over long horizons and challenging to obtain an accurate model of the environment. In this work, we combine the strengths of model-free and model-based methods. We use a learned task-oriented latent dynamics model for local trajectory optimization over a short horizon, and use a learned terminal value function to estimate long-term return, "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2203.04955","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2203.04955/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2203.04955","created_at":"2026-07-05T04:41:54.745277+00:00"},{"alias_kind":"arxiv_version","alias_value":"2203.04955v2","created_at":"2026-07-05T04:41:54.745277+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2203.04955","created_at":"2026-07-05T04:41:54.745277+00:00"},{"alias_kind":"pith_short_12","alias_value":"NZD34S44KD7B","created_at":"2026-07-05T04:41:54.745277+00:00"},{"alias_kind":"pith_short_16","alias_value":"NZD34S44KD7BGNYG","created_at":"2026-07-05T04:41:54.745277+00:00"},{"alias_kind":"pith_short_8","alias_value":"NZD34S44","created_at":"2026-07-05T04:41:54.745277+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":25,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24991","citing_title":"Solving Markov Decision Processes with Future Information via MPC","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12195","citing_title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2607.00917","citing_title":"Valdi: Value Diffusion World Models","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26282","citing_title":"Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26478","citing_title":"Efficient On-policy Visual-RL via Stochastic Decoupled Policy Gradient","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29360","citing_title":"MiraBench: Evaluating Action-Conditioned Reliability in Robotic World Models","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30928","citing_title":"Enhancing Human-Likeness in Reinforcement Learning Agents via Hierarchical Macro Action Quantization","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2510.03508","citing_title":"D2 Actor Critic: Diffusion Actor Meets Distributional Critic","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2511.05963","citing_title":"Next-Latent Prediction Transformers Learn Compact World Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2605.21800","citing_title":"stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16054","citing_title":"Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making","ref_index":300,"is_internal_anchor":false},{"citing_arxiv_id":"2506.05762","citing_title":"BiTrajDiff: Bidirectional Trajectory Generation with Diffusion Models for Offline Reinforcement Learning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2506.10137","citing_title":"Self-Predictive Representations for Combinatorial Generalization in Behavioral Cloning","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2509.17387","citing_title":"High-Precision and High-Efficiency Trajectory Tracking for Excavators Based on Closed-Loop Dynamics","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2509.20869","citing_title":"Model-Based Reinforcement Learning under Random Observation Delays","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2411.04983","citing_title":"DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2510.10125","citing_title":"Ctrl-World: A Controllable Generative World Model for Robot Manipulation","ref_index":20,"is_internal_anchor":false},{"citing_arxiv_id":"2506.07339","citing_title":"Real-Time Execution of Action Chunking Flow Policies","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14304","citing_title":"Matrix-Space Reinforcement Learning for Reusing Local Transition Geometry","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.13013","citing_title":"JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2601.16163","citing_title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27450","citing_title":"RAY-TOLD: Ray-Based Latent Dynamics for Dense Dynamic Obstacle Avoidance with TDMPC","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01950","citing_title":"TRAP: Tail-aware Ranking Attack for World-Model Planning","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07079","citing_title":"Learning Visual Feature-Based World Models via Residual Latent Action","ref_index":60,"is_internal_anchor":false},{"citing_arxiv_id":"2506.09985","citing_title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","ref_index":29,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC","json":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC.json","graph_json":"https://pith.science/api/pith-number/NZD34S44KD7BGNYG5V34KVOCOC/graph.json","events_json":"https://pith.science/api/pith-number/NZD34S44KD7BGNYG5V34KVOCOC/events.json","paper":"https://pith.science/paper/NZD34S44"},"agent_actions":{"view_html":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC","download_json":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC.json","view_paper":"https://pith.science/paper/NZD34S44","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2203.04955&json=true","fetch_graph":"https://pith.science/api/pith-number/NZD34S44KD7BGNYG5V34KVOCOC/graph.json","fetch_events":"https://pith.science/api/pith-number/NZD34S44KD7BGNYG5V34KVOCOC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC/action/storage_attestation","attest_author":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC/action/author_attestation","sign_citation":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC/action/citation_signature","submit_replication":"https://pith.science/pith/NZD34S44KD7BGNYG5V34KVOCOC/action/replication_record"}},"created_at":"2026-07-05T04:41:54.745277+00:00","updated_at":"2026-07-05T04:41:54.745277+00:00"}