{"as_of":"2026-08-15T14:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67a3bff62256db291d9baabd34621b2f81a3620cb584633c4ceabfa561c6c547","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:56:51.152652Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.06937/citation-record","integrity":"/paper/2501.06937/integrity","json":"/paper/2501.06937/citation-record.json","paper":"/paper/2501.06937"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.593311Z","title":null,"venue":null,"work_id":"4b09e385-165f-415a-8683-545b4ac7dd25","year":2001},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.042565Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:fd86c4b8397572b8230feffa00a308f3e83ceb7744d4912566f421e8a02b32f9","observation_id":"be150886-de80-4762-a6a8-42644b6bad6c","resolution":{"observed_at":"2026-08-10T20:56:51.596693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.585022Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":"ca49f641-dda0-4fc2-8eb6-6b395f2fa59a","year":2013},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.046887Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:8b712d66a1b1ee577af63c5ad6c977d8fda6d825261af8ae29788e21a489c569","observation_id":"93c12656-9030-4f74-8e1f-8cba2be7ec58","resolution":{"observed_at":"2026-08-10T20:56:51.587835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-10T20:56:51.050601Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.050601Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:5c6c0b7675f0e096031563c54534b3d1e85aff6763d58e3c18b2ee59314276a8","observation_id":"d14898ed-0568-4795-a409-d931006dbf8c","resolution":{"observed_at":"2026-08-10T20:56:51.050601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.575750Z","title":null,"venue":null,"work_id":"684f721f-1233-4331-b339-6cec88c47358","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.055134Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:d23a65df99ad7d0fa7a1b5c51fd62d7aaadbe954be1ac1289bcdc28b9badba44","observation_id":"cbe57015-1b5f-430c-b418-b5b2bd07c762","resolution":{"observed_at":"2026-08-10T20:56:51.579136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06782","last_updated":"2017-11-18T00:53:20Z","snapshot_observed_at":"2026-08-14T20:12:24.918223Z","submitted_at":"2017-11-18T00:53:20Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06782","snapshot_observed_at":"2026-08-10T20:56:51.059025Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.059025Z"},"links":{"cited_paper":"/paper/1711.06782","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:16fb249a830c6bfe908fc1055ca0251c606bfffa75bd07ca0ca085cc22b5ca37","observation_id":"d2fb5b3c-811c-4c25-bd61-bc90e63e0b63","resolution":{"observed_at":"2026-08-10T20:56:51.059025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.062911Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.062911Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:8da781d96800a75a13ff3e54bd1bcedaabf006664cb8a3b0723e1f7414e8c64b","observation_id":"4da91d0c-c520-49ec-9ea2-c098833d9a8e","resolution":{"observed_at":"2026-08-10T20:56:51.062911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.560697Z","title":"and Petrik, M","venue":null,"work_id":"01df76f1-5a1d-435d-b7b6-4c46e96f0f22","year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.067089Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:e6045443f4dda149f5b95a1326624e9cd7b7f2a1e48341cb14a1d9b1f44d76a2","observation_id":"e803cdbb-79e9-457f-8208-ec2546712ee9","resolution":{"observed_at":"2026-08-10T20:56:51.564149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:56:51.070550Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.070550Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:37a8410f3ab5406b3de809983ed4e1c54332bbc7075d849f6438cc4b72d15262","observation_id":"cbebf486-942b-40e4-9eb7-2f4cadf725a9","resolution":{"observed_at":"2026-08-10T20:56:51.070550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01972","last_updated":"2024-08-04T09:26:00Z","snapshot_observed_at":"2026-08-12T23:08:58.826177Z","submitted_at":"2024-08-04T09:26:00Z","title":"RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01972","snapshot_observed_at":"2026-08-10T20:56:51.074552Z","title":"and Ono, I","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.074552Z"},"links":{"cited_paper":"/paper/2408.01972","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:139e24204898612eb1fb71ed61a3ac874f3835724269b0f0b2d969dee5110135","observation_id":"3577ed12-96a2-4ede-afe8-fbe2a3f4b295","resolution":{"observed_at":"2026-08-10T20:56:51.074552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-15T12:04:28.662048Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-10T20:56:51.078679Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.078679Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:9eb80605cc1d63d829e5c08a27cc2e2c4a61b4d6aeaa234fa614232a0504237b","observation_id":"5c5ea7ba-f326-4ded-8cca-75798e2af797","resolution":{"observed_at":"2026-08-10T20:56:51.078679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03442","last_updated":"2021-11-01T03:53:25Z","snapshot_observed_at":"2026-08-13T20:29:37.715438Z","submitted_at":"2021-06-07T09:19:42Z","title":"Average-Reward Reinforcement Learning with Trust Region Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03442","snapshot_observed_at":"2026-08-10T20:56:51.082564Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.082564Z"},"links":{"cited_paper":"/paper/2106.03442","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:392ad67e2a47a7d9dcd6f4c529ed01eeb7ac1e3191b66801ce8d87e3f47364f6","observation_id":"0bc6b9d6-5972-481e-acdd-4019b2ad8d9a","resolution":{"observed_at":"2026-08-10T20:56:51.082564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.087603Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.087603Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:dff7d4bc5ebb72b280b61a2be4a44cc68b5cc3145624c50526d156a2edf9c551","observation_id":"835823a5-df91-487b-a6f5-ab970128cb0b","resolution":{"observed_at":"2026-08-10T20:56:51.087603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09999","last_updated":"2024-10-30T14:18:42Z","snapshot_observed_at":"2026-08-13T00:05:55.230456Z","submitted_at":"2024-05-16T11:33:49Z","title":"Reward Centering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09999","snapshot_observed_at":"2026-08-10T20:56:51.090784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.090784Z"},"links":{"cited_paper":"/paper/2405.09999","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:f085cc183331d368e27b4bc6fc4695f1ea8fee29949962204637dbec1467751b","observation_id":"9f9ef73d-43e4-433f-be92-dde05275b5d1","resolution":{"observed_at":"2026-08-10T20:56:51.090784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06306","last_updated":"2020-02-15T02:43:16Z","snapshot_observed_at":"2026-08-02T20:55:21.409228Z","submitted_at":"2020-02-15T02:43:16Z","title":"Jelly Bean World: A Testbed for Never-Ending Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06306","snapshot_observed_at":"2026-08-10T20:56:51.094911Z","title":"A., Saparov, A., and Mitchell, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.094911Z"},"links":{"cited_paper":"/paper/2002.06306","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:098bd320963297628f52c56888d52fcde42c1fe4e6997d7a8ceb8c988d9faf9d","observation_id":"9822b3bd-4d1c-4ac9-84f5-6723d589abaa","resolution":{"observed_at":"2026-08-10T20:56:51.094911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.545443Z","title":null,"venue":null,"work_id":"500a4843-442d-453d-b186-1c2b4cfbf0d8","year":2014},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.098506Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:177f41f644a4145860b7021b8a25f5492bb8729713b03014d394f24cc93419db","observation_id":"b3a91d80-5572-4fc1-a42c-e842cb5e85ba","resolution":{"observed_at":"2026-08-10T20:56:51.549244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.535232Z","title":null,"venue":null,"work_id":"8a252b40-f707-495b-b1ee-87bb22e5aa01","year":2023},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.101851Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:9c74aba7971e0b8d09b57048a9912c4bf0a5c160ada2fe6d3e64f8b954e7eb1c","observation_id":"b351cda6-3d10-4448-9656-c9523f29e2ad","resolution":{"observed_at":"2026-08-10T20:56:51.538881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:56:51.104986Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.104986Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:f495e0a5715d4dea030d2b2afb5ebeb202be470bd1012714f7f2345d75fb0117","observation_id":"519c400b-9380-42fe-89b6-375b81f9ba7a","resolution":{"observed_at":"2026-08-10T20:56:51.104986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.524996Z","title":null,"venue":null,"work_id":"9d09ba68-32c0-4efb-857d-e54c54934881","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.108332Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:22c16eabf1eb36fa2057deda5fa46ccd0fc4fb86ce4bc6fe90cc6fa1fa869798","observation_id":"f765d528-5c76-4c55-892f-ea08522312a1","resolution":{"observed_at":"2026-08-10T20:56:51.528853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.515121Z","title":null,"venue":null,"work_id":"86c92b04-e345-43a9-b642-81614802ce54","year":2022},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.111420Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:25d43f8832844ae2a62a420f906e57a84c89ba17ec4ffa22438730696656f9b9","observation_id":"7d38b37d-f827-444a-9ddb-b1a33c365145","resolution":{"observed_at":"2026-08-10T20:56:51.518642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.114743Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.114743Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:69e5cbd5045ae581020049e832e2d47fd013b25648969bd55f0fcced087efc36","observation_id":"fb175955-ecca-48b7-8b67-7ef70bbd0fc0","resolution":{"observed_at":"2026-08-10T20:56:51.114743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.117972Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.117972Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:3f3a7d0485c268249af3465cc1116282bd5666c3f3aa6cd2da6e8e4b6813b3ff","observation_id":"a58ef605-33d2-43b5-97bb-51781700d1d0","resolution":{"observed_at":"2026-08-10T20:56:51.117972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-10T20:56:51.121085Z","title":"U., De Cola, G., Deleu, T., Goul \\ a o, M., Kallinteris, A., Krimmel, M., KG, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.121085Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:61c2ec8ba987b6fed26751ca49bf028d200c4b961732a2d99f434a1b04d30da2","observation_id":"3fcd1410-718a-4941-88da-70582473c74f","resolution":{"observed_at":"2026-08-10T20:56:51.121085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.494870Z","title":null,"venue":null,"work_id":"0a22eaf2-4455-41a2-97dc-727f025e1595","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.124304Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:50103ef658ba9293c9c35470cb1592ce6de1712e401b31bbcc7c3f2112a1b0dc","observation_id":"32099d3d-34fd-4afb-9ad3-424c62f33400","resolution":{"observed_at":"2026-08-10T20:56:51.498595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.484109Z","title":"and Ross, K","venue":null,"work_id":"7065b9d3-c897-4644-a0c1-9f511c26f7ee","year":2021},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.127557Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:895bbdd897ff0c322b674aeced0bc1577ceb01504994abff4f972049e2442c68","observation_id":"c768aa35-d9c8-4e8c-b19c-23112d861c4f","resolution":{"observed_at":"2026-08-10T20:56:51.488242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.473346Z","title":null,"venue":null,"work_id":"5598b9e8-884d-4286-8e36-a9988a13759b","year":2022},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.130679Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:7e1d7541c0ed418c7f1aef183b35d781d0588e7b51815acc4899ce02442e9dd3","observation_id":"05517a7e-0d4f-4860-88f3-f56349d0ec11","resolution":{"observed_at":"2026-08-10T20:56:51.477254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12570","last_updated":"2020-04-27T03:36:10Z","snapshot_observed_at":"2026-08-09T09:30:54.167911Z","submitted_at":"2020-04-27T03:36:10Z","title":"The Ingredients of Real-World Robotic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.12570","snapshot_observed_at":"2026-08-10T20:56:51.133757Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.133757Z"},"links":{"cited_paper":"/paper/2004.12570","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:b5c8fb1b811bb75b4cb83187c64ed2a17afc3456fa76489674da978f4c4666a8","observation_id":"3c0fb13f-2a7f-4cd3-ae6c-34f461c50e48","resolution":{"observed_at":"2026-08-10T20:56:51.133757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03814","last_updated":"2024-09-02T05:18:49Z","snapshot_observed_at":"2026-08-13T05:08:31.715251Z","submitted_at":"2023-12-06T18:29:23Z","title":"Pearl: A Production-ready Reinforcement Learning Agent","version":2},"cited_work":{"arxiv_id":"2312.03814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03814","snapshot_observed_at":"2026-08-10T20:56:51.348417Z","title":"Pearl: A Production-ready Reinforcement Learning Agent","venue":"cs.LG","work_id":"113d8411-736b-4e02-b2f3-c20e20f2380b","year":2023},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.137298Z"},"links":{"cited_paper":"/paper/2312.03814","citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:422c0f7d5434bec92697aa4561de7455a2bb4e184567ff4cb2d41a28d3829d39","observation_id":"47f1ddd2-023b-4c39-8c16-9f6ae5e4777a","resolution":{"observed_at":"2026-08-10T20:56:51.352949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.141171Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.141171Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:ff936d1541e8f5519dd7afbad521eaafc60d0de313354cdcb93e15c47106207e","observation_id":"e88cee22-f087-413d-a8ff-26293f0d462b","resolution":{"observed_at":"2026-08-10T20:56:51.141171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.145296Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.145296Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:56dea87ad2c246265db4703fec6e0617aeb69549a20e5c211f34eae49c78b9c1","observation_id":"432d02ac-23d8-4d74-b0e4-b4f2566d4be1","resolution":{"observed_at":"2026-08-10T20:56:51.145296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.149172Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.149172Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:95c3042f6d7fde8b8a1e9614ec5ff5edfc7592e92923567dcfbe974a0d191a68","observation_id":"0c86f820-0284-474a-ba05-541e0913f5ac","resolution":{"observed_at":"2026-08-10T20:56:51.149172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"refactor/0000775","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:56:51.331009Z","title":"yF࡞g5. t]k e_kx kϣ], [#>3,>Mj <3oseӡ؎O޲ 7v 10 ΓZ Snc ay xط<Xت֬2/̡ Z̄峖G?Y[x=S c _ZSFX3#v)7n֎a | t 6IͰ|q֎Ğb /eev .Jj 6 4^ D[OVY L |axj ?#+#ڱ 44 . T c 7 W O &# O` !ң ծ [bY ncMj .0^?","venue":null,"work_id":"3f608554-68e5-46c8-aa3b-6f0fe02712b1","year":null},"citing_paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:56:51.152652Z"},"links":{"citing_paper":"/paper/2501.06937"},"observation_digest":"sha256:5eace5a200e228a672097f6d825a2337fc70e957b447ccd145dd29ceaf72f685","observation_id":"152e618d-2879-4b74-bba0-39abe64e30a6","resolution":{"observed_at":"2026-08-10T20:56:51.337592Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06937","last_updated":"2025-01-12T21:24:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T14:32:10.018340Z","submitted_at":"2025-01-12T21:24:27Z","title":"An Empirical Study of Deep Reinforcement Learning in Continuing Tasks"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2501.06937."}