{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:QYYAZYPGRAABPANMYXIQXDTD7D","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"6e4f33e002d18b0770bf71fd57da3f15226bf8057bf29abfc8dffa1256dc4617","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-06-20T02:58:25Z","title_canon_sha256":"c16a6fa2b0690bdb5dd7ee0c3a860b48730cc296f2cd7d23df35b4756783de8e"},"schema_version":"1.0","source":{"id":"2306.11246","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2306.11246","created_at":"2026-07-05T12:09:08Z"},{"alias_kind":"arxiv_version","alias_value":"2306.11246v3","created_at":"2026-07-05T12:09:08Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2306.11246","created_at":"2026-07-05T12:09:08Z"},{"alias_kind":"pith_short_12","alias_value":"QYYAZYPGRAAB","created_at":"2026-07-05T12:09:08Z"},{"alias_kind":"pith_short_16","alias_value":"QYYAZYPGRAABPANM","created_at":"2026-07-05T12:09:08Z"},{"alias_kind":"pith_short_8","alias_value":"QYYAZYPG","created_at":"2026-07-05T12:09:08Z"}],"graph_snapshots":[{"event_id":"sha256:54d889203dcc7bf4e1928c295313de2a4a105f4f563669356582ca5b65625f55","target":"graph","created_at":"2026-07-05T12:09:08Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2306.11246/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We argue that inventory management presents unique opportunities for the reliable application of deep reinforcement learning (DRL). To enable this, we emphasize and test two complementary techniques. The first is Hindsight Differentiable Policy Optimization (HDPO), which uses pathwise gradients from offline counterfactual simulations to directly and efficiently optimize policy performance. Unlike standard policy gradient methods that rely on high-variance score-function estimators, HDPO computes gradients by differentiating through the known system dynamics. Via extensive benchmarking, we show","authors_text":"Daniel Russo, Matias Alvo, Minuk Lee, Yash Kanoria","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-06-20T02:58:25Z","title":"Deep Reinforcement Learning for Inventory Networks: Toward Reliable Policy Optimization"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2306.11246","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:a1d61422b2e20bf7a0eef62cb2ed16d664fe205fdffc0b64f2af332d30ed9297","target":"record","created_at":"2026-07-05T12:09:08Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"6e4f33e002d18b0770bf71fd57da3f15226bf8057bf29abfc8dffa1256dc4617","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-06-20T02:58:25Z","title_canon_sha256":"c16a6fa2b0690bdb5dd7ee0c3a860b48730cc296f2cd7d23df35b4756783de8e"},"schema_version":"1.0","source":{"id":"2306.11246","kind":"arxiv","version":3}},"canonical_sha256":"86300ce1e688001781acc5d10b8e63f8f4a7c4a636e3ace46db27733792bae89","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"86300ce1e688001781acc5d10b8e63f8f4a7c4a636e3ace46db27733792bae89","first_computed_at":"2026-07-05T12:09:08.776215Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T12:09:08.776215Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"zP4/C3+Hz+OAbAsEzbo+wtAPVZl583JIgJD0Mf49zi+w6tMggNeXXIEcYZsE8WnlaHQ005kwyU+tB3DBVe+8AA==","signature_status":"signed_v1","signed_at":"2026-07-05T12:09:08.776722Z","signed_message":"canonical_sha256_bytes"},"source_id":"2306.11246","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:a1d61422b2e20bf7a0eef62cb2ed16d664fe205fdffc0b64f2af332d30ed9297","sha256:54d889203dcc7bf4e1928c295313de2a4a105f4f563669356582ca5b65625f55"],"state_sha256":"185cb2e6ba2febbd0ddcecfbf05616d5192aed725a17ad46669556cfb855590c"}