{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2019:4XR7UYOR74U653H43PPY2EGIM3","short_pith_number":"pith:4XR7UYOR","schema_version":"1.0","canonical_sha256":"e5e3fa61d1ff29eeecfcdbdf8d10c866f297abd078d24ab1fbe89000b038fb66","source":{"kind":"arxiv","id":"1909.06153","version":2},"attestation_state":"computed","paper":{"title":"HJB Optimal Feedback Control with Deep Differential Value Functions and Action Constraints","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Boris Belousov, Debora Clever, Jan Peters, Kim Listmann, Michael Lutter","submitted_at":"2019-09-13T11:34:40Z","abstract_excerpt":"Learning optimal feedback control laws capable of executing optimal trajectories is essential for many robotic applications. Such policies can be learned using reinforcement learning or planned using optimal control. While reinforcement learning is sample inefficient, optimal control only plans an optimal trajectory from a specific starting configuration. In this paper we propose deep optimal feedback control to learn an optimal feedback policy rather than a single trajectory. By exploiting the inherent structure of the robot dynamics and strictly convex action cost, we can derive principled c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"1909.06153","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-09-13T11:34:40Z","cross_cats_sorted":["cs.RO","stat.ML"],"title_canon_sha256":"1a82ad7f4385f751d2e75d8bc0aa79c1101c57223332fea05f0c5c5365405ed8","abstract_canon_sha256":"b6a7077f3bcd7ca24639b3e80674cdb4a6dcc9aab0cd763e77c3919615bec061"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T00:11:22.228622Z","signature_b64":"aSg9ry5tkmG8BNKKdNitMFJ9mF3HhZwjbd1+QumFPNOyYaCFj7aa5/FZkP1chxe/4YjzC5id4SsIfr0SlKMeCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e5e3fa61d1ff29eeecfcdbdf8d10c866f297abd078d24ab1fbe89000b038fb66","last_reissued_at":"2026-07-05T00:11:22.228198Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T00:11:22.228198Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HJB Optimal Feedback Control with Deep Differential Value Functions and Action Constraints","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.RO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Boris Belousov, Debora Clever, Jan Peters, Kim Listmann, Michael Lutter","submitted_at":"2019-09-13T11:34:40Z","abstract_excerpt":"Learning optimal feedback control laws capable of executing optimal trajectories is essential for many robotic applications. Such policies can be learned using reinforcement learning or planned using optimal control. While reinforcement learning is sample inefficient, optimal control only plans an optimal trajectory from a specific starting configuration. In this paper we propose deep optimal feedback control to learn an optimal feedback policy rather than a single trajectory. By exploiting the inherent structure of the robot dynamics and strictly convex action cost, we can derive principled c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1909.06153","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/1909.06153/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"1909.06153","created_at":"2026-07-05T00:11:22.228254+00:00"},{"alias_kind":"arxiv_version","alias_value":"1909.06153v2","created_at":"2026-07-05T00:11:22.228254+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1909.06153","created_at":"2026-07-05T00:11:22.228254+00:00"},{"alias_kind":"pith_short_12","alias_value":"4XR7UYOR74U6","created_at":"2026-07-05T00:11:22.228254+00:00"},{"alias_kind":"pith_short_16","alias_value":"4XR7UYOR74U653H4","created_at":"2026-07-05T00:11:22.228254+00:00"},{"alias_kind":"pith_short_8","alias_value":"4XR7UYOR","created_at":"2026-07-05T00:11:22.228254+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3","json":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3.json","graph_json":"https://pith.science/api/pith-number/4XR7UYOR74U653H43PPY2EGIM3/graph.json","events_json":"https://pith.science/api/pith-number/4XR7UYOR74U653H43PPY2EGIM3/events.json","paper":"https://pith.science/paper/4XR7UYOR"},"agent_actions":{"view_html":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3","download_json":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3.json","view_paper":"https://pith.science/paper/4XR7UYOR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=1909.06153&json=true","fetch_graph":"https://pith.science/api/pith-number/4XR7UYOR74U653H43PPY2EGIM3/graph.json","fetch_events":"https://pith.science/api/pith-number/4XR7UYOR74U653H43PPY2EGIM3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3/action/storage_attestation","attest_author":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3/action/author_attestation","sign_citation":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3/action/citation_signature","submit_replication":"https://pith.science/pith/4XR7UYOR74U653H43PPY2EGIM3/action/replication_record"}},"created_at":"2026-07-05T00:11:22.228254+00:00","updated_at":"2026-07-05T00:11:22.228254+00:00"}