{"as_of":"2026-08-16T19:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b20aceca9cecf83c09acdb5f29303ab68baf5e82720d643de0ef24a7d7413d4","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:23:12.792191Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21443/citation-record","integrity":"/paper/2508.21443/integrity","json":"/paper/2508.21443/citation-record.json","paper":"/paper/2508.21443"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:16.635514Z","title":"Human- level control through deep reinforcement learning,","venue":null,"work_id":"52cd2f46-033b-48d1-927d-b57d6cf39c95","year":2015},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:09.753161Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:43171f3a8681f46ef7583e24249ff1f1ec74d04fe92ed99c92a595a030e59886","observation_id":"99c67e3f-93a2-4f96-ad99-6f4c30902898","resolution":{"observed_at":"2026-08-05T14:23:16.727422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:16.464904Z","title":"Benchmarking deep reinforcement learning for continuous control,","venue":null,"work_id":"cb1134ce-c847-4eba-a356-5af3022ba926","year":2016},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:09.806178Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:cccd9057c46edc572959bc8a5834439352ed27642b826b3024a589af0e820dc0","observation_id":"4f849639-2619-4e83-a01b-bd67c1b4310c","resolution":{"observed_at":"2026-08-05T14:23:16.518368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:16.350410Z","title":"Research priorities for robust and beneficial artificial intelligence,","venue":null,"work_id":"fa0de399-b08c-4b7d-9f33-684e3694e2db","year":2015},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:09.942629Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:a7a74fa3cbf021737aeb6eadb6cae9da23ee5590c12170b4bcf65d776f1509f5","observation_id":"e88dae6b-4ef8-43df-a770-9381aeba42f5","resolution":{"observed_at":"2026-08-05T14:23:16.375126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-05T14:23:10.073115Z","title":"Concrete problems in AI safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.073115Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:5385acc746efcf4c5ea3cb01c50636d2c08f33dd6109b7dd8ec96a79c0f512d0","observation_id":"8b4efd2d-524a-437c-aca8-8bd0763ecbee","resolution":{"observed_at":"2026-08-05T14:23:10.073115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01647","last_updated":"2018-12-04T19:39:53Z","snapshot_observed_at":"2026-08-14T17:48:30.845139Z","submitted_at":"2018-12-04T19:39:53Z","title":"Rigorous Agent Evaluation: An Adversarial Approach to Uncover Catastrophic Failures","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01647","snapshot_observed_at":"2026-08-05T14:23:10.172323Z","title":"Rigorous agent evaluation: An adversarial approach to uncover catastrophic failures,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.172323Z"},"links":{"cited_paper":"/paper/1812.01647","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:a0ceb8e4b5a357818d85ecb327d119dc8b57a4d58c30aef501e17556a35b5ae9","observation_id":"29b1a652-9c0a-4afd-8728-4f4773efaf9d","resolution":{"observed_at":"2026-08-05T14:23:10.172323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:10.288361Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.288361Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:299bcbf8c0b30f6038e5cd41b566b86ca560e4456a902f0e96dd1e5160d76d5e","observation_id":"f5870618-a950-4566-b73e-3cc5c7324a69","resolution":{"observed_at":"2026-08-05T14:23:10.288361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:10.405961Z","title":"Bertsekas, Reinforcement Learning and Optimal Control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.405961Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:a978b63c8d5ac3c228278b2126c9ab91a477ca9a6076d4bbe0c0521e364357ad","observation_id":"0b4b4b84-1086-4b56-a809-c853c4c5293f","resolution":{"observed_at":"2026-08-05T14:23:10.405961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:16.207295Z","title":"Reinforcement learning with non-ergodic reward in- crements: robustness via ergodicity transformations,","venue":null,"work_id":"cbd29d2d-710e-4df7-8df0-9d285ec505db","year":2025},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.518051Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:0a512ac04b9fd1a5afeef28fc253a3beb42d58e527205dac859ac4c6d7fccb1f","observation_id":"f2ee9982-9bc0-4cee-8352-15813493aff4","resolution":{"observed_at":"2026-08-05T14:23:16.263825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:16.130769Z","title":"Linearly-solvable markov decision problems,","venue":null,"work_id":"8a9f1e98-9a69-4520-b80d-f69aba257713","year":2006},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.621757Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:285266685aca9c06a96f8866256eaa0ff326c16eb7ee2987a45d5371b92b885a","observation_id":"5b91cb89-0bfe-46c0-b32c-929af9a18041","resolution":{"observed_at":"2026-08-05T14:23:16.162010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.928688Z","title":"A theory of regularized Markov decision processes,","venue":null,"work_id":"28419f64-1591-4c1a-9c01-625de0641d1b","year":2019},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.719957Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:5c5c1c7d28f0902e2182c3c81cb00a00b9014503670dc9c3ccb959ef4304060d","observation_id":"9a1d85f1-1d73-4396-985a-fb0d9b0e7f7e","resolution":{"observed_at":"2026-08-05T14:23:16.032142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.839174Z","title":"Approximate modified policy iteration and its application to the game of tetris","venue":null,"work_id":"2ef69ca3-0f48-487d-a8a7-f28d81bbd263","year":2015},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.847778Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:db788d51afee4b7f31e30f74f83e74b81aaf8ce41286ac4f2fe929ba631009a4","observation_id":"e77cda3b-c52f-4351-84de-5f764dbd789d","resolution":{"observed_at":"2026-08-05T14:23:15.881505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.721867Z","title":"Munchausen reinforcement learning,","venue":null,"work_id":"39dc8f06-0ee2-4891-9086-e5ba40ee9e63","year":2020},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:10.991122Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:96bad52a86f7677a76e00298d89474aa28b757df7f4162273da88a7c12928e2c","observation_id":"3b2f7ae1-5ec8-449b-90df-fff9d6b77d6b","resolution":{"observed_at":"2026-08-05T14:23:15.762341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-08-15T08:36:52.193486Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-05T14:23:11.102414Z","title":"Maximum a posteriori policy optimisation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.102414Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:9fe349c8a2a7d4a4222640e89d0d51a8ba5bb52feb9426888f52001cd92e4ed8","observation_id":"fe9d1c02-fa7a-405a-aacf-8bc83e35b612","resolution":{"observed_at":"2026-08-05T14:23:11.102414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.585804Z","title":"Leverage the average: an analysis of KL regularization in reinforcement learning,","venue":null,"work_id":"d105c79e-6799-4c09-8619-0f44904108fe","year":2020},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.163630Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:c881cb6fb1b3c4d086efb0008ce69fb2efaeb6df9fa62a2ac09403ed4efc3765","observation_id":"37475928-ea80-4620-b75d-a97fed392256","resolution":{"observed_at":"2026-08-05T14:23:15.633431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.466026Z","title":"Incremental multi-step q-learning,","venue":null,"work_id":"6cffcc4c-2cd0-43d8-a4c6-fd7da78462ea","year":1994},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.223547Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:e06ee2d6040b8f839caa09e72b16b5ea08aebecff233d6f066cafc3d63cf770a","observation_id":"d340f80d-c6b6-4000-a8ef-b7a9cd3b862a","resolution":{"observed_at":"2026-08-05T14:23:15.516046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.349787Z","title":"Multi- step reinforcement learning: A unifying algorithm,","venue":null,"work_id":"5e3b4930-a78d-4538-8626-d6398fe21d3c","year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.298837Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:e47b44fec4bd48faae8c54b79448a6f78616b6404a396563abf976956f53b243","observation_id":"9d80eb6e-7a80-493b-94db-6a6d18fb2dd8","resolution":{"observed_at":"2026-08-05T14:23:15.406979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16819","last_updated":"2023-09-28T19:56:31Z","snapshot_observed_at":"2026-08-16T14:56:43.249220Z","submitted_at":"2023-09-28T19:56:31Z","title":"Multi-Bellman operator for convergence of $Q$-learning with linear function approximation","version":1},"cited_work":{"arxiv_id":"2309.16819","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16819","snapshot_observed_at":"2026-08-05T14:23:13.073113Z","title":"Multi-Bellman operator for convergence of $Q$-learning with linear function approximation","venue":"cs.LG","work_id":"0bb4e794-3d5e-4b1a-90cc-850b5423c340","year":2023},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.426915Z"},"links":{"cited_paper":"/paper/2309.16819","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:92333c04601c9eb5dfe090b0eb519ae9bc48112c416c51bcf6dd19921e2d1d5b","observation_id":"d44e8e4c-aef5-45a9-9d6d-861a865a1590","resolution":{"observed_at":"2026-08-05T14:23:13.133448Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.227745Z","title":"A novel multi-step q-learning method to improve data efficiency for deep reinforcement learning,","venue":null,"work_id":"792f38bf-3d97-4afc-8c19-5862248fd9e1","year":2019},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.557222Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:70128023f196a577a6d49e7d9b0854a6d7febd4f7d6840c712527e8e726821aa","observation_id":"176002bd-bd9d-46f3-8e54-c5231c0efe9b","resolution":{"observed_at":"2026-08-05T14:23:15.292218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:15.097735Z","title":"Rainbow: Combining improvements in deep reinforcement learning,","venue":null,"work_id":"791aa50c-d174-4e30-8e58-775fdb6b5e50","year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.622988Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:fee5b072e580bd5f9a32aaf2996dfff1a591679d4390b32cd373e4b83f232d89","observation_id":"9ead2d0e-8c2c-4029-a97a-f9adbda5bed2","resolution":{"observed_at":"2026-08-05T14:23:15.176986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.962942Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping,","venue":null,"work_id":"c5ee67f7-4ffa-492a-9106-d1b3df9a8a17","year":1999},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.691962Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:4789c30add8d5e40e6ea452ccff930445a9ed5aeb5c7caa1c1efc98d1f454445","observation_id":"8b2937fa-e06b-47d8-9fb3-80102323141c","resolution":{"observed_at":"2026-08-05T14:23:15.033813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.800988Z","title":"Self- supervised online reward shaping in sparse-reward environments,","venue":null,"work_id":"d3f3bdd0-e497-4254-aa8f-19fc3c3cacfa","year":2021},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.767253Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:f1a9e934844eb5ca84f1f34d1137f5b6b87577a89533673975dbc58166ce5f31","observation_id":"b115652d-26c2-4aaa-9bf6-ad36573eec73","resolution":{"observed_at":"2026-08-05T14:23:14.907088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.614818Z","title":"On learning intrinsic rewards for policy gradient methods,","venue":null,"work_id":"69094818-63f2-4003-8df5-a09b9c545c7b","year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.856828Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:33da3832485731d5d01b95ff1aad6d4720a339472769b7f89e97d23d092cc6c3","observation_id":"cfc613d6-3c2c-4231-a5ce-395deac298a2","resolution":{"observed_at":"2026-08-05T14:23:14.705725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.442495Z","title":"Microfoun- dations of discounting,","venue":null,"work_id":"e9e61b6b-461e-4e89-87c8-2d723d0fad44","year":2021},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:11.931008Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:c894a3760ad255352c7ce88bd01ccfd038f2e748b8e70012099e72cbd8219ff4","observation_id":"63a95a3f-c7cf-41c3-8739-cd423be75372","resolution":{"observed_at":"2026-08-05T14:23:14.508866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.03680","last_updated":"2021-02-28T19:53:04Z","snapshot_observed_at":"2026-08-16T16:29:49.533715Z","submitted_at":"2018-01-11T09:16:55Z","title":"The time interpretation of expected utility theory","version":2},"cited_work":{"arxiv_id":"1801.03680","doi":null,"metadata_source":"pith","pith_arxiv_id":"1801.03680","snapshot_observed_at":"2026-08-05T14:23:12.899986Z","title":"The time interpretation of expected utility theory","venue":"econ.GN","work_id":"dbc02103-e025-4077-966a-31a187f4fde8","year":2018},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.015329Z"},"links":{"cited_paper":"/paper/1801.03680","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:959e58ae047d114e7467abd3fe9276bf77c7b644db532b068b9279b7c85e26ce","observation_id":"51f104c9-7e90-4b61-b2c8-39faabb455d8","resolution":{"observed_at":"2026-08-05T14:23:12.989244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.265807Z","title":"On-policy deep reinforcement learning for the average-reward criterion,","venue":null,"work_id":"621ecf7e-8eb7-4bcf-b1c4-a92dbb15ba4d","year":2021},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.109419Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:a82b0ea2f5c8d0732ea134a3c24896030fbe3583981e6095e1b24a81e5a5c5d9","observation_id":"0d7c7bd7-6180-4222-b328-314c3c7ec392","resolution":{"observed_at":"2026-08-05T14:23:14.318428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:14.107915Z","title":"A provably-efficient model-free algo- rithm for infinite-horizon average-reward constrained markov decision processes,","venue":null,"work_id":"a9e21dc8-6e4a-4a58-9221-3a17461debbe","year":2022},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.185584Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:07dc37b6c0b83bd9480fe7dcb785f0c12326209dd9b4551a0d0f55461b97b30a","observation_id":"fca3c8ce-c7e5-424c-a0f9-526e21c89b17","resolution":{"observed_at":"2026-08-05T14:23:14.193869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:13.919462Z","title":"Robust average-reward markov decision processes,","venue":null,"work_id":"df702609-6a69-442d-8dec-4666f1f8d56c","year":2023},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.260190Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:684031245fcd0415c599368648b91f95d23f7c9d99ef3867aee4f631e303c342","observation_id":"1f56c440-556a-4953-9a7a-3bd54f3c865a","resolution":{"observed_at":"2026-08-05T14:23:14.026163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:13.753596Z","title":"Proof of the ergodic theorem,","venue":null,"work_id":"1ba42e71-66b0-4cad-9c12-03f4b687b99b","year":1931},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.291154Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:5115567d3050a39b76777d5a206736d769d7d244247105ba202a1c5c86b3c1b1","observation_id":"5631c70d-22e9-478c-b473-ccc365ac65df","resolution":{"observed_at":"2026-08-05T14:23:13.832657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:13.556177Z","title":null,"venue":null,"work_id":"aca9af08-eb4f-4590-9e67-42140e2287f8","year":2017},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.377413Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:b0a69b1c33aebd6b2c4597ca6a1256b005c4ed1c629e33d0282292fa154a04e8","observation_id":"7942132c-9b81-4527-b2ba-087db936646b","resolution":{"observed_at":"2026-08-05T14:23:13.646460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:13.409840Z","title":"Finite-time analysis of natural actor- critic for POMDPs,","venue":null,"work_id":"11bae419-dfe5-4788-b5df-c04d08337d76","year":2024},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.443375Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:28a757f66876f16af1a9440c8808d4b3b1d5c8e59a49749fe38fb986c5af899c","observation_id":"8eb43f76-1e2c-411e-b29c-d9923c1b49fc","resolution":{"observed_at":"2026-08-05T14:23:13.471063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:13.260491Z","title":"The ergodicity solution of the cooperation puzzle,","venue":null,"work_id":"84b02034-52c9-4728-985a-7fc6703609dc","year":2022},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.612348Z"},"links":{"citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:4fe8a55758fccde71ed4e7de0e000cbfb2d0bc67a0138fa8d98c13f6ecba5e11","observation_id":"f10314ca-72c1-4a23-894e-793bd3b5506b","resolution":{"observed_at":"2026-08-05T14:23:13.314948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-05T14:23:12.734177Z","title":"OpenAI Gym,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.734177Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:4a8767065d07b80db7c8519d5621cb5110f22017b65971c4d6ad0906b52e221d","observation_id":"6e6a2025-1cc9-4354-bdb9-4830d8a86c19","resolution":{"observed_at":"2026-08-05T14:23:12.734177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T14:23:12.792191Z","title":"Playing Atari with deep reinforce- ment learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:12.792191Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2508.21443"},"observation_digest":"sha256:b57aafd193e64dd1dc24944358cc4a1d707c2541b2696896b1da58c32362f5d3","observation_id":"2d3fdd08-294a-437c-bd82-77dfd1264619","resolution":{"observed_at":"2026-08-05T14:23:12.792191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.21443","last_updated":"2025-08-29T09:12:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T08:37:32.754093Z","submitted_at":"2025-08-29T09:12:41Z","title":"Beyond expected value: geometric mean optimization for long-term policy performance in reinforcement learning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2508.21443."}