{"as_of":"2026-08-14T19:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d079e8638121128b55eb5910e5dbc1727ea632e59fd27921caf2d51ab04dca3","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T05:19:09.239168Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:22:09.716785Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T13:25:20.593899Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01500","snapshot_observed_at":"2026-08-12T05:22:09.716785Z","title":"rlpyt: A research code base for deep reinforcement learning in pytorch,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.00534","last_updated":"2024-11-30T16:56:29Z","snapshot_observed_at":"2026-08-12T17:35:18.641190Z","submitted_at":"2024-11-30T16:56:29Z","title":"Towards Fault Tolerance in Multi-Agent Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T05:22:09.716785Z"},"links":{"cited_paper":"/paper/1909.01500","citing_paper":"/paper/2412.00534"},"observation_digest":"sha256:3172665d7e4435d0ccff916f97629980a1df8dcad8a0c3c96827d067155728b2","observation_id":"5130b66b-b7bf-41fc-a2e8-19851e9801e3","resolution":{"observed_at":"2026-08-12T05:22:09.716785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"cited_work":{"arxiv_id":"1909.01500","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.01500","snapshot_observed_at":"2026-08-11T13:25:20.593899Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","venue":"cs.LG","work_id":"46215338-1efd-4947-8703-f2bbc783135f","year":2019},"citing_paper":{"arxiv_id":"2412.13184","last_updated":"2024-12-17T18:58:00Z","snapshot_observed_at":"2026-08-13T19:09:19.533191Z","submitted_at":"2024-12-17T18:58:00Z","title":"Tilted Quantile Gradient Updates for Quantile-Constrained Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T13:25:20.502923Z"},"links":{"cited_paper":"/paper/1909.01500","citing_paper":"/paper/2412.13184"},"observation_digest":"sha256:d9dd30dccb248c818c583c068a0488ba3d98c52cb25d39f0e397cba10da0af84","observation_id":"b0bd5300-83ce-46a4-98d1-076dbd8826fe","resolution":{"observed_at":"2026-08-11T13:25:20.601321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.01500/citation-record","integrity":"/paper/1909.01500/integrity","json":"/paper/1909.01500/citation-record.json","paper":"/paper/1909.01500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-14T05:19:09.072128Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.072128Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:6a60a37cebbf4f4fbd68d38d5a5f4f59c853abb3a1439a00d868d4260a6e827b","observation_id":"ee727af1-0c2d-4cf6-8fd0-270121f07507","resolution":{"observed_at":"2026-08-14T05:19:09.072128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.078409Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.078409Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:cecc783dc66bf96e420856f0b937f635658040cd205c81f135c6b50de66c0717","observation_id":"4c79b4e0-7a25-4270-98e1-6f6823e0cc88","resolution":{"observed_at":"2026-08-14T05:19:09.078409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.083402Z","title":"Automatic differentiation in PyTorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.083402Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:a224044bb83cb65aa6775039972d8ab858eaabd4dd67b990fd1fb32883d9f9e9","observation_id":"40dfdb77-ff30-4630-9d08-5721f4fe8af0","resolution":{"observed_at":"2026-08-14T05:19:09.083402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.769098Z","title":"Alphastar","venue":null,"work_id":"83ec11aa-5017-4c23-baf2-990d2e8ba84b","year":2019},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.088307Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:ee59f198cfe338440dc83df7db5fbcc8981c66595f9fcd932f92139c70f3c0fb","observation_id":"0ce29919-2576-4037-89bd-dfdadb2617f1","resolution":{"observed_at":"2026-08-14T05:19:09.774152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.093052Z","title":"Openai ﬁve","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.093052Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:439694957440663be798169315c6a0274effc05ae53ce35d444f1a9026e1be95","observation_id":"7341aaff-8341-4d70-a4f8-7a0501821e62","resolution":{"observed_at":"2026-08-14T05:19:09.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.742848Z","title":"Recurrent experience replay in distributed reinforcement learning","venue":null,"work_id":"ae516e58-31f8-47af-97a6-c4825208d070","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.097276Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:1132654738c28e73b0f4101eeef425fc03d515a76bce91686d9facca46aa9f30","observation_id":"532c3c91-0ed4-417b-8fda-182bfec2589a","resolution":{"observed_at":"2026-08-14T05:19:09.747802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.102296Z","title":"Openai gym, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.102296Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:aeca7fbdf77bf985fb15d1476ca1ae9853c500462a0d12ee06dbd8d05ea6eb80","observation_id":"05be1ce0-186d-4ea7-8abd-cdabb46eced9","resolution":{"observed_at":"2026-08-14T05:19:09.102296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.106629Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.106629Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:3424daba02ab901b819a9503ec1e96dde4e4b8ed3182312ab4e5628849ba4836","observation_id":"91b2453c-1b24-42e0-bb52-358795a52a8f","resolution":{"observed_at":"2026-08-14T05:19:09.106629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-14T05:19:09.111092Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.111092Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:b15724a3342e99d30738cb80e84215ddba01a0d96171b92a388ca879bce4ec70","observation_id":"433f9895-e312-4791-b09f-f74779a9cc46","resolution":{"observed_at":"2026-08-14T05:19:09.111092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.707585Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"bde2ab4f-8edd-4ce3-bce2-2fb5efc4c413","year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.115999Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f851722170c6529eb4502016328e46bc506c43330952dac8d158b0b9095f5e50","observation_id":"31e71905-a7b0-4fc4-ad7d-06ce1bd82dec","resolution":{"observed_at":"2026-08-14T05:19:09.712516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06581","last_updated":"2016-04-05T09:03:06Z","snapshot_observed_at":"2026-08-10T06:38:22.014739Z","submitted_at":"2015-11-20T13:07:54Z","title":"Dueling Network Architectures for Deep Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06581","snapshot_observed_at":"2026-08-14T05:19:09.121127Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.121127Z"},"links":{"cited_paper":"/paper/1511.06581","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:b714f68cb700786b76e66b979d15a32e51e2e1f41a51a1779b9597f22bccae4c","observation_id":"ac7a8f62-c5ea-4d1e-9fe4-c26c5c789f60","resolution":{"observed_at":"2026-08-14T05:19:09.121127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.692030Z","title":"A distributional perspective on reinforce- ment learning","venue":null,"work_id":"33fe4429-3168-4622-9e9b-95ab64dc0db3","year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.126224Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:e11c0b2669c80b0a51865a0e8195feb4895c266bad3528a23992274ced4a4771","observation_id":"8067a7a9-2fed-4f15-b86b-375b2c35d75b","resolution":{"observed_at":"2026-08-14T05:19:09.697643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.674994Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"198c1e6a-7406-4a30-8d8a-40c6a4b043f8","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.130655Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:716948db0a8ce25cdafa196001b78f197f7cdc38dbd51477abacc5a51a63d94d","observation_id":"2cb9aac9-b65d-4d20-a1f5-711632c8cb6d","resolution":{"observed_at":"2026-08-14T05:19:09.680384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-08-14T19:40:13.717780Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-14T05:19:09.134917Z","title":"Distributed prioritized experience replay","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.134917Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:cd8ed580ce7f412c429d4582597cc48872adb18d0c8ca946d72d11e8e992a255","observation_id":"20c04ee0-549f-4d4d-93a7-531168ba3ab4","resolution":{"observed_at":"2026-08-14T05:19:09.134917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06923","last_updated":"2018-06-14T14:28:37Z","snapshot_observed_at":"2026-08-14T19:03:40.723256Z","submitted_at":"2018-06-14T14:28:37Z","title":"Implicit Quantile Networks for Distributional Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06923","snapshot_observed_at":"2026-08-14T05:19:09.139219Z","title":"Implicit quantile networks for distributional reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.139219Z"},"links":{"cited_paper":"/paper/1806.06923","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:1a73382361c3087aeaa156f17a405fefa59d732684c67ce226cba9fb62025788","observation_id":"d8e12ed6-839e-455c-a176-fc0925a7dd36","resolution":{"observed_at":"2026-08-14T05:19:09.139219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.144002Z","title":"Continuous deep q-learning with model-based acceleration","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.144002Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f728e1f41e8a3292829061e9e637f9bcca3ba63320723565e1d3b8da96c63c34","observation_id":"db2b5157-2bbd-472a-a24d-654f0c7d5180","resolution":{"observed_at":"2026-08-14T05:19:09.144002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09477","last_updated":"2018-10-22T17:37:07Z","snapshot_observed_at":"2026-08-14T19:42:01.132248Z","submitted_at":"2018-02-26T17:54:49Z","title":"Addressing Function Approximation Error in Actor-Critic Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.09477","snapshot_observed_at":"2026-08-14T05:19:09.148298Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.148298Z"},"links":{"cited_paper":"/paper/1802.09477","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:b9a86c9ca6f1a09ecfe993e20ae0e26fc4ca6edb80d278ab0dd8cae35780cee3","observation_id":"9753ee44-b572-4930-9919-d3b185e347d4","resolution":{"observed_at":"2026-08-14T05:19:09.148298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-14T05:19:09.153918Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.153918Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:32973da8b07017b14b87aad83a19e5f91429aa320a756c5c19b54a6d51779861","observation_id":"42ad99cc-37ac-44f4-808c-feb29af19c4b","resolution":{"observed_at":"2026-08-14T05:19:09.153918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-14T05:19:09.159727Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.159727Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:cc3c7351dc5b23c54d786005f4b2c3cf24afe7722a9c6d4f3a870a79a73ffd49","observation_id":"dd02575e-29ed-425d-a429-d737560c5d33","resolution":{"observed_at":"2026-08-14T05:19:09.159727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08617","last_updated":"2018-04-23T11:57:21Z","snapshot_observed_at":"2026-08-14T19:23:07.555873Z","submitted_at":"2018-04-23T11:57:21Z","title":"Distributed Distributional Deterministic Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.08617","snapshot_observed_at":"2026-08-14T05:19:09.165087Z","title":"Distributed distributional deterministic policy gradients","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.165087Z"},"links":{"cited_paper":"/paper/1804.08617","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:c4b6a324535b986836050d7f355b1d18c889770331647d0ae2f96111da433b23","observation_id":"c8413eae-e346-4bcd-8e46-3e269d1fa5cb","resolution":{"observed_at":"2026-08-14T05:19:09.165087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-12T23:53:55.764215Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-14T05:19:09.170057Z","title":"Prioritized experience replay","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.170057Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:d82c63ef9d060f52cf39509d04d0f75418b0d6649d47520a95dbdb80dcad168e","observation_id":"7bc417dd-f7dc-4eaa-9d4a-58301850b34d","resolution":{"observed_at":"2026-08-14T05:19:09.170057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.174352Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.174352Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:4d308cec4730ba8c0a66f835ddf2d0a6ae3040c6836e074a196bdb0ae8285758","observation_id":"8db25fa9-0c94-4297-919e-579686a8bd8e","resolution":{"observed_at":"2026-08-14T05:19:09.174352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.178979Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.178979Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:031391dbe24e4d9045d6514cd3887fc08976a2e4d15591f0ffe8da684135d5d4","observation_id":"98c0d123-7b6c-40aa-98f9-fa478a6dd09d","resolution":{"observed_at":"2026-08-14T05:19:09.178979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02811","last_updated":"2019-01-10T20:48:11Z","snapshot_observed_at":"2026-08-14T19:38:28.064874Z","submitted_at":"2018-03-07T18:39:12Z","title":"Accelerated Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02811","snapshot_observed_at":"2026-08-14T05:19:09.183570Z","title":"Accelerated methods for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.183570Z"},"links":{"cited_paper":"/paper/1803.02811","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:1bfe714e5587f7c442b0062a87e949554e6989569a947a15255c26f39c1c5af7","observation_id":"2b9a4144-fef1-4762-9cb8-74f30c148890","resolution":{"observed_at":"2026-08-14T05:19:09.183570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.630117Z","title":"Openai spinning up","venue":null,"work_id":"820834ed-d08d-4b9a-a593-58d1d79a507b","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.188465Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:23e8b555154f83bd84fd594b8515a647f00f2b861daf26b656bd9b7ec2d66885","observation_id":"4f22f19d-c9e5-4953-802e-27a8fea1562f","resolution":{"observed_at":"2026-08-14T05:19:09.635508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.5590","last_updated":"2012-11-23T20:42:41Z","snapshot_observed_at":"2026-08-10T08:36:18.532239Z","submitted_at":"2012-11-23T20:42:41Z","title":"Theano: new features and speed improvements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.5590","snapshot_observed_at":"2026-08-14T05:19:09.193455Z","title":"Theano: new features and speed improvements","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.193455Z"},"links":{"cited_paper":"/paper/1211.5590","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:81370ad55f942c1c8dcfa470ad779234ca827cbc4a73d5ad755aeb25500d24a9","observation_id":"89e8521c-c76f-4522-a235-5b25ad259f33","resolution":{"observed_at":"2026-08-14T05:19:09.193455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06162","last_updated":"2018-12-14T20:49:09Z","snapshot_observed_at":"2026-08-14T17:43:20.166812Z","submitted_at":"2018-12-14T20:49:09Z","title":"An Empirical Model of Large-Batch Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06162","snapshot_observed_at":"2026-08-14T05:19:09.198199Z","title":"An empirical model of large-batch training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.198199Z"},"links":{"cited_paper":"/paper/1812.06162","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f80da72686d92f22c0e0bdcab725bf69c2ae33341e386f4b8c75ff58e159273f","observation_id":"608edfe3-7719-4b08-bf07-bfc6426c76be","resolution":{"observed_at":"2026-08-14T05:19:09.198199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.202760Z","title":"Benchmarking deep reinforcement learning for continuous control","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.202760Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:7cd5ca6490254ced618765d860c920cece771310e78b92e9aeead20918442635","observation_id":"1ebe22d1-d061-47ae-9489-d88134d99935","resolution":{"observed_at":"2026-08-14T05:19:09.202760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.605379Z","title":"Openai baselines","venue":null,"work_id":"0b756797-81c2-4bd3-9820-9860f47aa020","year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.207543Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:f2d3a5bc2f685d32e5a426715ac5ed7314dc92d982a4eae7c4a53db9a57059ff","observation_id":"0de24811-f854-4f53-8642-34621f9224a2","resolution":{"observed_at":"2026-08-14T05:19:09.609831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06110","last_updated":"2018-12-14T19:03:38Z","snapshot_observed_at":"2026-08-14T19:03:45.460809Z","submitted_at":"2018-12-14T19:03:38Z","title":"Dopamine: A Research Framework for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06110","snapshot_observed_at":"2026-08-14T05:19:09.211753Z","title":"Dopamine: A research framework for deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.211753Z"},"links":{"cited_paper":"/paper/1812.06110","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:e1797f2f11f622f1b6e6b0bdf248097c10c659d8dee02a49b6c249408bc9f584","observation_id":"79b021e3-4ea5-4886-b20f-e5b9d1ff7f70","resolution":{"observed_at":"2026-08-14T05:19:09.211753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.590099Z","title":"Tensorﬂow: A system for large-scale machine learning","venue":null,"work_id":"7f3a881a-a4a1-47e5-8740-5ef781bc6182","year":2016},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.215961Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:cd975fa45a26db2872c52f5f81204ae2a3a574ac60132eff3c7cbad8fd6e5786","observation_id":"b0761670-d21a-4574-b7d2-54a1d3ef2a3c","resolution":{"observed_at":"2026-08-14T05:19:09.594816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.09381","last_updated":"2018-06-29T00:19:24Z","snapshot_observed_at":"2026-08-05T03:37:42.195185Z","submitted_at":"2017-12-26T19:43:59Z","title":"RLlib: Abstractions for Distributed Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.09381","snapshot_observed_at":"2026-08-14T05:19:09.220509Z","title":"Ray rllib: A composable and scalable reinforcement learning library","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.220509Z"},"links":{"cited_paper":"/paper/1712.09381","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:dfff5e82fba9a594e9dc7510178b4ac93aaf47fe43837eb859a3948a1f69dffa","observation_id":"723cded4-26b8-4ade-a27c-b71d298e3f7f","resolution":{"observed_at":"2026-08-14T05:19:09.220509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.574999Z","title":"Ray: A distributed framework for emerging{AI} applications","venue":null,"work_id":"1fedcd60-f5dc-4385-88ca-4fbab75e9c42","year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.225505Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:a2c1b31212b9dacad68343b0dee1020b5aa6a4cd7f3cbfad4decf46d697011af","observation_id":"19b4a751-53ef-4531-8ffc-363a2908f03a","resolution":{"observed_at":"2026-08-14T05:19:09.580166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00260","last_updated":"2019-09-04T19:30:00Z","snapshot_observed_at":"2026-08-14T19:23:21.694743Z","submitted_at":"2018-11-01T07:02:45Z","title":"Horizon: Facebook's Open Source Applied Reinforcement Learning Platform","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00260","snapshot_observed_at":"2026-08-14T05:19:09.230237Z","title":"Horizon: Facebook’s open source applied reinforcement learning platform","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.230237Z"},"links":{"cited_paper":"/paper/1811.00260","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:10ea56b2281e25f54e2bff353ddc200bd6a94c7a7717b8fab0872507f29989db","observation_id":"3f75761d-a2b1-46fb-8592-5ef783c64fe5","resolution":{"observed_at":"2026-08-14T05:19:09.230237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T05:19:09.556124Z","title":"Hogwild: A lock-free approach to parallelizing stochastic gradient descent","venue":null,"work_id":"1b2bb886-c856-485a-820c-60a0a95b1349","year":2011},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.235111Z"},"links":{"citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:4064a99a73e0986330e2aed98a67233469bf723277de597ce2e5ae4ee3b852e2","observation_id":"21dae2e6-90c6-4ae4-b291-86cce34f19dd","resolution":{"observed_at":"2026-08-14T05:19:09.563270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.0759","last_updated":"2014-12-18T01:13:16Z","snapshot_observed_at":"2026-08-12T16:41:16.972891Z","submitted_at":"2014-10-03T06:16:43Z","title":"cuDNN: Efficient Primitives for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1410.0759","snapshot_observed_at":"2026-08-14T05:19:09.239168Z","title":"cudnn: Efﬁcient primitives for deep learning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T05:19:09.239168Z"},"links":{"cited_paper":"/paper/1410.0759","citing_paper":"/paper/1909.01500"},"observation_digest":"sha256:fa736ae9fa77e0678b084d6ebaca7bad3fa5f943e6d8ced1ff50c48c99b4bf52","observation_id":"0ce2a332-97e6-4e8b-a248-e6440d32b5c1","resolution":{"observed_at":"2026-08-14T05:19:09.239168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1909.01500","last_updated":"2019-09-24T06:22:31Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T14:58:02.543459Z","submitted_at":"2019-09-03T23:57:13Z","title":"rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:1909.01500."}