{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2020:7SODFRMO4QP7DFKWVEJWBOYZIC","short_pith_number":"pith:7SODFRMO","schema_version":"1.0","canonical_sha256":"fc9c32c58ee41ff19556a91360bb1940ac514a7953b556b4f16ac827f9f44392","source":{"kind":"arxiv","id":"2008.07284","version":2},"attestation_state":"computed","paper":{"title":"Forward and inverse reinforcement learning sharing network weights and hyperparameters","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.LG","authors_text":"Eiji Uchibe, Kenji Doya","submitted_at":"2020-08-17T13:12:44Z","abstract_excerpt":"This paper proposes model-free imitation learning named Entropy-Regularized Imitation Learning (ERIL) that minimizes the reverse Kullback-Leibler (KL) divergence. ERIL combines forward and inverse reinforcement learning (RL) under the framework of an entropy-regularized Markov decision process. An inverse RL step computes the log-ratio between two distributions by evaluating two binary discriminators. The first discriminator distinguishes the state generated by the forward RL step from the expert's state. The second discriminator, which is structured by the theory of entropy regularization, di"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2008.07284","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2020-08-17T13:12:44Z","cross_cats_sorted":["cs.AI","cs.RO"],"title_canon_sha256":"8b38d39babf18a1705e6db2e9a79dce2ae4b450e670f7f81f72d531afec67079","abstract_canon_sha256":"8ac9c2be9192e26449d2a40b9d173e69681df82d648771da1cb88a29213b1e0a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:27:41.311728Z","signature_b64":"AdM+uiOumJH8QmVQHGadbDhWcQXPs1nDhTqN+X5eaC16ZcASJhKQglpGllZ/4Zjuq/4MM/Nqt22K8Kb0IFxgCw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fc9c32c58ee41ff19556a91360bb1940ac514a7953b556b4f16ac827f9f44392","last_reissued_at":"2026-07-05T04:27:41.311305Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:27:41.311305Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Forward and inverse reinforcement learning sharing network weights and hyperparameters","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.RO"],"primary_cat":"cs.LG","authors_text":"Eiji Uchibe, Kenji Doya","submitted_at":"2020-08-17T13:12:44Z","abstract_excerpt":"This paper proposes model-free imitation learning named Entropy-Regularized Imitation Learning (ERIL) that minimizes the reverse Kullback-Leibler (KL) divergence. ERIL combines forward and inverse reinforcement learning (RL) under the framework of an entropy-regularized Markov decision process. An inverse RL step computes the log-ratio between two distributions by evaluating two binary discriminators. The first discriminator distinguishes the state generated by the forward RL step from the expert's state. The second discriminator, which is structured by the theory of entropy regularization, di"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2008.07284","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2008.07284/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2008.07284","created_at":"2026-07-05T04:27:41.311364+00:00"},{"alias_kind":"arxiv_version","alias_value":"2008.07284v2","created_at":"2026-07-05T04:27:41.311364+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2008.07284","created_at":"2026-07-05T04:27:41.311364+00:00"},{"alias_kind":"pith_short_12","alias_value":"7SODFRMO4QP7","created_at":"2026-07-05T04:27:41.311364+00:00"},{"alias_kind":"pith_short_16","alias_value":"7SODFRMO4QP7DFKW","created_at":"2026-07-05T04:27:41.311364+00:00"},{"alias_kind":"pith_short_8","alias_value":"7SODFRMO","created_at":"2026-07-05T04:27:41.311364+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC","json":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC.json","graph_json":"https://pith.science/api/pith-number/7SODFRMO4QP7DFKWVEJWBOYZIC/graph.json","events_json":"https://pith.science/api/pith-number/7SODFRMO4QP7DFKWVEJWBOYZIC/events.json","paper":"https://pith.science/paper/7SODFRMO"},"agent_actions":{"view_html":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC","download_json":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC.json","view_paper":"https://pith.science/paper/7SODFRMO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2008.07284&json=true","fetch_graph":"https://pith.science/api/pith-number/7SODFRMO4QP7DFKWVEJWBOYZIC/graph.json","fetch_events":"https://pith.science/api/pith-number/7SODFRMO4QP7DFKWVEJWBOYZIC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC/action/storage_attestation","attest_author":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC/action/author_attestation","sign_citation":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC/action/citation_signature","submit_replication":"https://pith.science/pith/7SODFRMO4QP7DFKWVEJWBOYZIC/action/replication_record"}},"created_at":"2026-07-05T04:27:41.311364+00:00","updated_at":"2026-07-05T04:27:41.311364+00:00"}