{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2019:VZTCFMIWXDX24WMNLNGENMU22X","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"0b08e013fda4138a200c5692f272bf87d9b894cc91dd3e85749b2e48b4939657","cross_cats_sorted":["cs.AI","math.OC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-11-24T23:49:48Z","title_canon_sha256":"e489c3609d96c07a75f53f79a90e304faeb296b3856b1a276714331971905732"},"schema_version":"1.0","source":{"id":"1911.10641","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"1911.10641","created_at":"2026-07-05T00:23:09Z"},{"alias_kind":"arxiv_version","alias_value":"1911.10641v2","created_at":"2026-07-05T00:23:09Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.1911.10641","created_at":"2026-07-05T00:23:09Z"},{"alias_kind":"pith_short_12","alias_value":"VZTCFMIWXDX2","created_at":"2026-07-05T00:23:09Z"},{"alias_kind":"pith_short_16","alias_value":"VZTCFMIWXDX24WMN","created_at":"2026-07-05T00:23:09Z"},{"alias_kind":"pith_short_8","alias_value":"VZTCFMIW","created_at":"2026-07-05T00:23:09Z"}],"graph_snapshots":[{"event_id":"sha256:f30f4726fde067209f27ee2a1e73300a1e4027f13ed27604ff88bf002a972612","target":"graph","created_at":"2026-07-05T00:23:09Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/1911.10641/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning (RL) has achieved state-of-the-art results in domains such as robotics and games. We build on this previous work by applying RL algorithms to a selection of canonical online stochastic optimization problems with a range of practical applications: Bin Packing, Newsvendor, and Vehicle Routing. While there is a nascent literature that applies RL to these problems, there are no commonly accepted benchmarks which can be used to compare proposed approaches rigorously in terms of performance, scale, or generalizability. This paper aims to fill that gap. For each problem we appl","authors_text":"Alvaro Maggiar, Andreas Damianou, Arpit Jain, Balakrishnan Narayanaswamy, Bharathan Balaji, Chun Ye, Enes Bilgin, Jordan Bell-Masterson, Pablo Moreno Garcia, Runfei Luo","cross_cats":["cs.AI","math.OC"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-11-24T23:49:48Z","title":"ORL: Reinforcement Learning Benchmarks for Online Stochastic Optimization Problems"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"1911.10641","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:88c2010e97968f6c47261de6d00580dd4225ea34623de1eb0c3ecf459ed6f2c0","target":"record","created_at":"2026-07-05T00:23:09Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"0b08e013fda4138a200c5692f272bf87d9b894cc91dd3e85749b2e48b4939657","cross_cats_sorted":["cs.AI","math.OC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2019-11-24T23:49:48Z","title_canon_sha256":"e489c3609d96c07a75f53f79a90e304faeb296b3856b1a276714331971905732"},"schema_version":"1.0","source":{"id":"1911.10641","kind":"arxiv","version":2}},"canonical_sha256":"ae6622b116b8efae598d5b4c46b29ad5dfe4e233b35716d4dab147d1b39a9729","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"ae6622b116b8efae598d5b4c46b29ad5dfe4e233b35716d4dab147d1b39a9729","first_computed_at":"2026-07-05T00:23:09.219670Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T00:23:09.219670Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"1k2dkNoH7b0yfjc/YrA1UPDGbI2n5gd2JlGQGyXa4QWrBTxR7e13VvJ+jL+3FzLx0T0rI+341Jbdt8eID3Q4DQ==","signature_status":"signed_v1","signed_at":"2026-07-05T00:23:09.220076Z","signed_message":"canonical_sha256_bytes"},"source_id":"1911.10641","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:88c2010e97968f6c47261de6d00580dd4225ea34623de1eb0c3ecf459ed6f2c0","sha256:f30f4726fde067209f27ee2a1e73300a1e4027f13ed27604ff88bf002a972612"],"state_sha256":"1d7fafa477ffa65d40db3320667b7d007a94bed2eeb9301e40a10af97b48f356"}