{"as_of":"2026-08-17T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a7de8587745f81a3b2b951dac560c50fb65ce78fd557b17f84f59a849e6bfc52","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:47:07.351175Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08988/citation-record","integrity":"/paper/2505.08988/integrity","json":"/paper/2505.08988/citation-record.json","paper":"/paper/2505.08988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.158678Z","title":null,"venue":null,"work_id":"310c5549-5f68-467e-ab07-3d4beeef0be9","year":2023},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.130984Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:4e3aca471f407232a74ac5f90c8037f70cf9254363395a326a12537ddb53e562","observation_id":"d82ff2b3-fa06-4470-a12e-02448f1270f1","resolution":{"observed_at":"2026-08-15T21:47:08.162151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.148424Z","title":null,"venue":null,"work_id":"90520dee-1578-47a4-a264-6a48f887847c","year":1965},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.135534Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:c8d78a462098d4a5ae6ea8f5ec0ef3c22cd1abb90395a0405ff863e9420b2437","observation_id":"3823713c-be70-48be-ae89-22938791cab1","resolution":{"observed_at":"2026-08-15T21:47:08.152094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.138248Z","title":"G., Naddaf, Y., Veness, J., and Bowling, M","venue":null,"work_id":"d157bd21-cbc1-48fd-9d17-32f278d1f40f","year":2013},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.139560Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:ee1968418a7fb66d8b9569aeacc2cc90bacdb6ade6da0ce153177255eefc39e1","observation_id":"eecb9100-b8a2-4578-b192-7bbc3d64f27e","resolution":{"observed_at":"2026-08-15T21:47:08.141705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.126428Z","title":"G., Candido, S., Castro, P","venue":null,"work_id":"471d91be-6eb3-4b19-88a8-5cc0f5b79520","year":2020},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.143764Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:ed43a6c8a75c0cb8dd3d3550ad384be0bada13ea0e94b8a93671ca6b705ae3c7","observation_id":"354b8630-54da-40a6-9649-c588213075c7","resolution":{"observed_at":"2026-08-15T21:47:08.130655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.114310Z","title":"and Kalaba, R","venue":null,"work_id":"6882a1ef-82ef-428c-8360-e7ecd1c46336","year":1957},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.147580Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:2318589260ea168b0eb02d0eeb1b6b7cc2d61790ac8d39c8853a28f2a6f6b149","observation_id":"336fba4c-2f9b-4366-b0df-292317fb0b86","resolution":{"observed_at":"2026-08-15T21:47:08.118066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.103480Z","title":null,"venue":null,"work_id":"c9b41551-f736-406c-8f34-591e6432e48b","year":2007},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.151384Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:20088a2e1ea3bf1418074e14706cce5ba5c89b806c310df76f4c0b13de332d49","observation_id":"fb148dc5-b4f6-4fbd-8d6d-14d7548c5e3c","resolution":{"observed_at":"2026-08-15T21:47:08.107064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.092752Z","title":"and Moore, A","venue":null,"work_id":"f1e2435c-97af-430a-8b5c-aed2c877392c","year":1994},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.155414Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:317b52f59046cfcf8f90685e26b7e506529244e23fdd6ae8e400a0ff8e7dfe3b","observation_id":"6af679e9-5bd7-45fc-b4a3-ec78a24c7419","resolution":{"observed_at":"2026-08-15T21:47:08.096618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.081789Z","title":"and Bowling, M","venue":null,"work_id":"caef8de9-6608-4d10-8fc6-6e5c3565b1dd","year":2012},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.159225Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:8b1f85368950e48a1a4e0e014914c8ea7c9c1183f66e7346d4ec284e5444540c","observation_id":"cd83ef03-08a9-4806-b6fc-40bba50d76c3","resolution":{"observed_at":"2026-08-15T21:47:08.085324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03906","last_updated":"2025-05-01T05:05:06Z","snapshot_observed_at":"2026-08-16T13:27:54.867293Z","submitted_at":"2024-08-07T17:10:55Z","title":"Achieving Human Level Competitive Robot Table Tennis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03906","snapshot_observed_at":"2026-08-15T21:47:07.162783Z","title":"B., Abeyruwan, S., Graesser, L., Iscen, A., Amor, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.162783Z"},"links":{"cited_paper":"/paper/2408.03906","citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:b1fd26ef6869233d000073a44895e7be85434ed49145b7e9dded292f8d5a6234","observation_id":"8dbd63c3-9e55-4e3c-a0e3-995398e4a32e","resolution":{"observed_at":"2026-08-15T21:47:07.162783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.070835Z","title":null,"venue":null,"work_id":"7a486a44-f666-41f2-9fee-97cf548bef2e","year":2011},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.166700Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:0c7f2dce4edddb9b67754ccd542b8415d1ba120f427431162daae0bf61234438","observation_id":"b2a5e190-1f7c-4d9a-86fe-35a11e93ef7f","resolution":{"observed_at":"2026-08-15T21:47:08.074569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.170391Z","title":"F., Lan, Q., Rahman, P., Mahmood, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.170391Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:f5e81005bb1c8d0124ae953d0f5368d25f0e326ff86f654d2a28506244b80248","observation_id":"1b0f0c4d-1079-4a20-a3c3-c4a048a57c69","resolution":{"observed_at":"2026-08-15T21:47:07.170391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.053341Z","title":"and Mahmood, A","venue":null,"work_id":"71b195b9-e1a0-4adc-8a31-6e68aebc2226","year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.174266Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:bb4878e37041aae65f972c43742fbfe32f9a237ee39f6b5f2669dbd2bd899dfb","observation_id":"eb7d6265-5514-428f-b62e-b34dd9327059","resolution":{"observed_at":"2026-08-15T21:47:08.056838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.042855Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":"0675ac19-0ead-49cd-84d0-e2108fd79443","year":2005},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.177745Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:427321823f4eaf5bfb6beb10ea515b76d747647a3ee5cc26019b360b66d17c6d","observation_id":"94d1eaea-7e97-4b83-9bee-99e6eeda8308","resolution":{"observed_at":"2026-08-15T21:47:08.046362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.032525Z","title":"A., Gao, J., Ryan, M","venue":null,"work_id":"0867d55d-9415-4dc5-8746-d10309137d6c","year":2023},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.181229Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:678dabcd6eb11595eeaee322255314c9ef00e8ca7bd93a675c52f145ec2d3501","observation_id":"b358b926-dca7-46ee-9ea4-00496f410a45","resolution":{"observed_at":"2026-08-15T21:47:08.035919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.022257Z","title":"G., Piot, B., Menick, J., Hessel, M., Osband, I., Graves, A., Mnih, V., Munos, R., Hassabis, D., Pietquin, O., Blundell, C., and Legg, S","venue":null,"work_id":"098ba8c1-9eda-41e5-be37-95fcfb0f545a","year":2018},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.184861Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:a316526862c8f62362774561fc3c8cabc73e4e7bb00e3af922b8eda0a02a9f5f","observation_id":"bde34070-23f4-4b75-ad22-3abba4481bd6","resolution":{"observed_at":"2026-08-15T21:47:08.025745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.012517Z","title":"Deep sparse rectifier neural networks","venue":null,"work_id":"94effa73-97b8-454a-8ee3-8521b363ee89","year":2011},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.188890Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:f1b184402d7f4368d7e70cc66fc5b0c01be329c7777b849bf7421c4fb9ae7b44","observation_id":"8688646f-4f73-4e75-bf08-0f35ba752a8e","resolution":{"observed_at":"2026-08-15T21:47:08.015931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:08.002331Z","title":null,"venue":null,"work_id":"43865483-5338-4858-8f71-50f23c218c5f","year":1995},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.192183Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:98f19a01a071bc7bb797fba24daaca7f64120981af38640be6d420d674ca9195","observation_id":"29538e85-bb34-4dc1-8402-13423427ab59","resolution":{"observed_at":"2026-08-15T21:47:08.005693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.992553Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"64dea50e-69d8-4aa0-afb1-57f4cba42c63","year":2018},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.195569Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:6e00a8b3021f171bccbbf876689a60d01abcf4ce03b38cd3cd3cb80fedd03553","observation_id":"e8ef3d02-97d5-4104-8bd2-33dbe594c0ce","resolution":{"observed_at":"2026-08-15T21:47:07.996024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.982596Z","title":"Dream to C ontrol: Learning behaviors by latent imagination","venue":null,"work_id":"8dec9774-4171-4bff-8c26-0c103a95e2c1","year":2020},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.199347Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:5d06f4609a29d8ac38cbe73da9bf33b6ccf563c2c66018c98d30c3d969bc1253","observation_id":"810ad188-70fc-4b94-849b-0c0ce74e03c0","resolution":{"observed_at":"2026-08-15T21:47:07.986116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.972842Z","title":null,"venue":null,"work_id":"eb551f71-53dc-4477-96f4-628e9ac96301","year":1960},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.203111Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:6c2ac0c8d80a6d8d5c7af4c8527b2e255595791fd34f95ba8bc3abb30d7dfa5d","observation_id":"f09024d7-a4aa-4a46-908c-4aa3ddefbd40","resolution":{"observed_at":"2026-08-15T21:47:07.976141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.962371Z","title":"Practical confidence and prediction intervals","venue":null,"work_id":"7d826284-3ae4-47db-ae3b-7dec88599125","year":1996},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.206304Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:fc4be0cccec516150acdff3837b73f6df8d53505794689b27a14d9e2ec21ed38","observation_id":"917b3a2b-a6ba-4e8f-8820-6faad26ca30e","resolution":{"observed_at":"2026-08-15T21:47:07.965918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.951066Z","title":"K., Shah, H., White, M., Miahi, E., Machado, M","venue":null,"work_id":"94fa18c3-2b0b-4098-af2d-2e14d39def56","year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.209751Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:e6d924c73946a117720380d3fb44ea2e64b4903c7e8dd430b9bb5c1391f3a12d","observation_id":"c6cd7478-420e-4f4e-8724-184b5e3882eb","resolution":{"observed_at":"2026-08-15T21:47:07.954855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.940052Z","title":"Monotonic robust policy optimization with model discrepancy","venue":null,"work_id":"5f171072-0466-4136-b167-406532cd21a6","year":2021},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.213551Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:16c8154ce15f2bbb9736e0c1dbe34d57d002f5f7b2d4a78047bce8abf4cc74e2","observation_id":"f6a0ef6d-16af-4445-b98c-f4dba4780ba6","resolution":{"observed_at":"2026-08-15T21:47:07.943911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16772","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.533239Z","title":"E., and Bowling, M","venue":null,"work_id":"6da9de33-de6f-481c-ba42-1a777ed19166","year":2025},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.217225Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:ff88efc3c8d987b95e91f9957e2b9568fe0d40fb5b369d52acd7b709fd918a94","observation_id":"249eaf64-a47e-49e1-a1db-fed5f7ad051c","resolution":{"observed_at":"2026-08-15T21:47:07.540313Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.929534Z","title":null,"venue":null,"work_id":"5fab6dd0-49fa-406c-9838-540ed6ea9494","year":2015},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.221119Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:36163ca6fbef2ac7fd75e6ea3e4cc864942c49f018717d23fa0f279fa25d77eb","observation_id":"0482a36a-284e-4a56-bdf2-2fb5ca15d45c","resolution":{"observed_at":"2026-08-15T21:47:07.932910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.919354Z","title":"and Tsitsiklis, J","venue":null,"work_id":"c980f9e1-a522-4b2a-934c-c5b0b24c2cd7","year":1999},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.224754Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:ca5793558bf68185b1d1ec1778c76ce42beb26628eb2b879e4611cfbf5b3a3fc","observation_id":"bc7242ad-7b45-4682-9473-54a7fd109f59","resolution":{"observed_at":"2026-08-15T21:47:07.922694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.908824Z","title":"Learning robust policy against disturbance in transition dynamics via state-conservative policy optimization","venue":null,"work_id":"5eb7e53d-5a4c-45c1-9148-7654d0ed505f","year":2022},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.228471Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:c571980c70177fed0d80fb8e19e611574a1464a7196258c29ec03e01b978c7e2","observation_id":"184915e2-7e04-4c28-bd79-399cfa7a215a","resolution":{"observed_at":"2026-08-15T21:47:07.912648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.896663Z","title":"and Sutton, R","venue":null,"work_id":"cafc3178-d4e8-4eb5-a129-0943200239da","year":1996},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.232506Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:1d9e3c78cf9824573fb7a55958b74d82564f8eaf8626309bd1f661d982821944","observation_id":"2798b3e2-cc81-4155-945a-11f75e7c7420","resolution":{"observed_at":"2026-08-15T21:47:07.901586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.886230Z","title":"Simple and scalable predictive uncertainty estimation using deep ensembles","venue":null,"work_id":"5bf3ab84-579d-468d-a07f-f7b1ecd0bb77","year":2017},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.236247Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:cbcfc4554ee1c993c5cfe60e2f06cb6c592f565e914dd3e2fa2df31afe494a84","observation_id":"85caa2ef-9217-4f60-abc8-e539ec8fb9d5","resolution":{"observed_at":"2026-08-15T21:47:07.889853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.239845Z","title":"Batch reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.239845Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:fe75f9d22fc0bda8ce097242d81ec5ab5d603f61341ee2179348749e97ef52e7","observation_id":"4b6977ae-3626-4301-9fc0-359bd4231a7c","resolution":{"observed_at":"2026-08-15T21:47:07.239845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.869680Z","title":"Sunrise: A simple unified framework for ensemble learning in deep reinforcement learning","venue":null,"work_id":"036a8611-f5ce-4282-9112-65d59e618ebe","year":2021},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.243496Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:b38eae3ce5eb31becfd9162fb35e25d68b02535834b20b7139e0cb950a41ff87","observation_id":"b7f23f2c-f3e9-45d3-a7ee-dd07c0614408","resolution":{"observed_at":"2026-08-15T21:47:07.873131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.859013Z","title":"and Koltun, V","venue":null,"work_id":"2f628022-170d-4e9e-896b-70c4b6d3b142","year":2013},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.247218Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:0bc767aa473fb0296debd8193685e500e3213bc47ce2c1e5908c4b0d02f08c92","observation_id":"b7805f87-b0b5-45f4-a2a3-0c32f5981092","resolution":{"observed_at":"2026-08-15T21:47:07.862780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.846819Z","title":"and Van Roy, B","venue":null,"work_id":"6a6f7f78-a406-4bc4-b88c-8b39272be353","year":2017},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.250882Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:e916dadf0d167d16e9642852d37d4c016192ae5ab667f73b37d9e28e77f7e6a2","observation_id":"0d1a10e5-8ef3-435d-886b-9734a1ed668b","resolution":{"observed_at":"2026-08-15T21:47:07.850878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.835144Z","title":"Playing A tari with deep reinforcement learning","venue":null,"work_id":"f7b916d2-06b8-4745-9de7-5d15028751a5","year":2013},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.254743Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:b6e4d53840849905411191be09d857180abec9043009e459eeb398d112acf81f","observation_id":"32badb92-10b2-49cb-966a-8741cb2a3400","resolution":{"observed_at":"2026-08-15T21:47:07.838913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.823423Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"22eda897-415d-4e82-8007-4341e40881b6","year":2015},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.258471Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:139cf7745e711742bde4ff6cbb6339702c89a8baa904a93fd894d9a516755ed1","observation_id":"0789bdaa-0d1e-4434-bee2-c0afa4068ca8","resolution":{"observed_at":"2026-08-15T21:47:07.827185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2110.15907","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.457405Z","title":"Learning to be cautious","venue":null,"work_id":"e003ff3e-6a19-443b-a2ff-4b3239a68473","year":2021},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.262372Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:90419618fcbbcefbd2bca32d03ba363d6f8d17ec036a9db5d56d293683db1f62","observation_id":"88ae68e0-44df-4638-8460-dbe65f8875c7","resolution":{"observed_at":"2026-08-15T21:47:07.464585Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.812074Z","title":"Deepstack: E xpert-level artificial intelligence in heads-up no-limit poker","venue":null,"work_id":"b7b47b5e-0551-457e-9cf9-243d2174fb4a","year":2017},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.265899Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:33d95e8c098503bb054d49283a122abc35b1ea138541b49e44841bde350b5fa3","observation_id":"9a37ab3d-58bc-4112-8f77-65f594e44090","resolution":{"observed_at":"2026-08-15T21:47:07.816036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.799408Z","title":"Deep reinforcement learning with plasticity injection","venue":null,"work_id":"8cc5be43-8db8-4710-89c7-6709ec2f7073","year":2023},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.269745Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:be90eeb3ca41b831e86efbebca38ebded2f79d7c74f0b06d537874968d090632","observation_id":"9096c9b4-7b38-43a4-8d58-ffa7b7d3bfa2","resolution":{"observed_at":"2026-08-15T21:47:07.804140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.787714Z","title":"J., and Wen, Z","venue":null,"work_id":"d0f02ed9-a7e5-4c49-a5e5-cd019a05d000","year":2019},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.273620Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:e64a87e07ca7b94c74da20b77be21b030bfd457bece345d199b9cf686a6629f4","observation_id":"0e4a4cdf-896f-4fae-baa1-e772776fe1e6","resolution":{"observed_at":"2026-08-15T21:47:07.791470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.774170Z","title":"M., Dwaracherla, V., Ibrahimi, M., Lu, X., and Van Roy, B","venue":null,"work_id":"f4a5e03d-2d3b-4991-900c-fbb96a532fb9","year":2023},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.277756Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:217f9968344a5673f07deaa34c7e08ccd2e902cbb4fe0ab922f4411babbf5d34","observation_id":"14314164-d60a-40e6-9a8e-161cb3068d66","resolution":{"observed_at":"2026-08-15T21:47:07.779145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.761237Z","title":null,"venue":null,"work_id":"e3a25f11-1e55-4973-8daa-ff09d60ef928","year":1999},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.281500Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:290d692d26f4b500b19d84debcfe48b7704d44b8646aa9bd1917747c319c9d25","observation_id":"acd6da3f-7897-4b24-8a00-86baacc7c544","resolution":{"observed_at":"2026-08-15T21:47:07.765374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.747293Z","title":"Beyond optimism: Exploration with partially observable rewards","venue":null,"work_id":"83c4822e-c5b6-4d5c-b21b-549c42ba05e6","year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.285479Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:a402114f2dfb09ecbb063b86e16eef66accddee08cec6a44491f3d93c53e91d1","observation_id":"905c0a5e-c1c7-4a9d-8a2a-db8f52f4c1a7","resolution":{"observed_at":"2026-08-15T21:47:07.751601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.733825Z","title":"E., and Bowling, M","venue":null,"work_id":"292043a9-b76e-46ee-b123-efa5554f41b9","year":2024},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.289095Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:df9ea1f61a14de4c3f63acc0f1491b6d66d24f4fa01e5c2400dd54dcf9a8aef3","observation_id":"0f108d7d-5b6b-4fbb-b08b-cbc70909ef61","resolution":{"observed_at":"2026-08-15T21:47:07.738103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.720940Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"b2de5c11-e9c7-4b68-a7f1-84784bdeea29","year":2017},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.292917Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:e41d6454acd141f66e4ab4c89e002c153ccbff7005f536669233dadfab152857","observation_id":"4e355904-cde8-44b3-ba21-c1c15aeca52a","resolution":{"observed_at":"2026-08-15T21:47:07.724699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.707441Z","title":"Bayesian neural network ensembles","venue":null,"work_id":"626a5e6b-d14b-4c87-b67d-580846545521","year":2018},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.297428Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:023e7a325475967fb4e8ead731a3eb9d14087f8eef78e8f6e9af5bc03ae84109","observation_id":"7c6a8102-6571-439a-954c-5f1c07135d18","resolution":{"observed_at":"2026-08-15T21:47:07.711967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.694430Z","title":"M., Dawson, M","venue":null,"work_id":"3dfb50a8-7f56-4f32-b84e-0bcd4596aff4","year":2011},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.301259Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:b884c68e91327950e142689ebe63425a1d988d2c671c99ce231c44014d80de8f","observation_id":"87a794b0-0b5a-47b5-b65c-e1e8860dda3b","resolution":{"observed_at":"2026-08-15T21:47:07.698185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04870","last_updated":"2020-10-10T01:53:37Z","snapshot_observed_at":"2026-08-16T19:14:33.348965Z","submitted_at":"2020-10-10T01:53:37Z","title":"Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04870","snapshot_observed_at":"2026-08-15T21:47:07.304850Z","title":"H., Benosman, M., and Van Baar, J","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.304850Z"},"links":{"cited_paper":"/paper/2010.04870","citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:cb7131b0e16cb2621fe7dfa1065f385a28293ba210bd851783d9c2b3ba52f6a6","observation_id":"93f7e214-aab1-44ae-9d48-002ef742e691","resolution":{"observed_at":"2026-08-15T21:47:07.304850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.682515Z","title":"Trust region policy optimization","venue":null,"work_id":"978f33e4-803c-4425-b160-fecf124e72b8","year":2015},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.308982Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:c261966632c27bb25b08afa22935a27c90e4f747dc10738ccbaaa772dc756be7","observation_id":"ae4719a4-a73a-43d4-9225-b3815c9f6e9c","resolution":{"observed_at":"2026-08-15T21:47:07.686474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:47:07.312620Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.312620Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:604b849a80e45d4e5ad3053a33ababfd9b36e8d46368c17e2daf6c477a9f898d","observation_id":"4102145d-18bb-461c-9568-de2c662f1efd","resolution":{"observed_at":"2026-08-15T21:47:07.312620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.670070Z","title":"J., Guez, A., Sifre, L., Van Den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., et al","venue":null,"work_id":"7838b75e-a7c9-4e4a-9b11-4b6d987c8910","year":2016},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.316497Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:0910358b1148fe722cda0b1c4bc251391cde7785c93b5ab3186ab3a66f990f68","observation_id":"145501ac-e543-4306-bf53-598c887dfb6f","resolution":{"observed_at":"2026-08-15T21:47:07.674063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.320151Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.320151Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:9161597f755db8ed6eb64d3ff1bd63fac88d1a4e892a59717b143cb4edb40e84","observation_id":"1d171351-377f-430c-9be5-a0f3de90a1ae","resolution":{"observed_at":"2026-08-15T21:47:07.320151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.649251Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"8a1b60de-cc3f-4f10-a508-a19ecf1fa889","year":1999},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.324124Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:040c8b6727a3b1dc3e35acc4a1464cfd9570540d05d69729d8dc1bf0131d8ddb","observation_id":"48d3e88c-23e9-40dc-aa41-9e841ed7449f","resolution":{"observed_at":"2026-08-15T21:47:07.653486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.634286Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"a58b9ad6-1770-4dcf-a479-8099e8cf0321","year":2000},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.327793Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:1ef387dff60b021d233b15fef9c4a203149b2159f8a978d342a314cf6137c2ec","observation_id":"122c242e-96c4-424d-ad8e-7d40fb33e135","resolution":{"observed_at":"2026-08-15T21:47:07.639143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.621925Z","title":"S., Szepesv \\'a ri, C., Geramifard, A., and Bowling, M","venue":null,"work_id":"122ae23d-7c51-48e6-8df4-e9fe1bb9051d","year":2008},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.331569Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:7f1af814ffd35c0ec4614f592729924bb0d53b8b3654dba655fb8bf68ffc9477","observation_id":"f670cc6b-c839-4522-9ca1-4ebed538b1b5","resolution":{"observed_at":"2026-08-15T21:47:07.626317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.609114Z","title":"A comparison of some error estimates for neural network models","venue":null,"work_id":"cc0c834e-cf08-4f12-aed3-e793759f641c","year":1996},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.335313Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:32cd18ae987ef675de15013bf0e6e45953d18ac64d67a595c67ceeda827f48f2","observation_id":"454e582f-7504-4747-8bd2-5534df8125ce","resolution":{"observed_at":"2026-08-15T21:47:07.613542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.596347Z","title":"M., Mathieu, M., Dudzik, A., Chung, J., Choi, D","venue":null,"work_id":"1c0beb47-a14c-4994-ad68-96b29808109d","year":2019},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.338896Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:2e9e8e1e5c01a6b3d32703044985422d8dbce5af49cced2a9868aa092c127529","observation_id":"f38c0021-5492-4afc-b45b-6fb46ef9b837","resolution":{"observed_at":"2026-08-15T21:47:07.600442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.581771Z","title":"R., Barrett, S., Kawamoto, K., MacGlashan, J., Subramanian, K., Walsh, T","venue":null,"work_id":"bb949f06-095f-443a-a065-fba81af4ebd3","year":2022},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.342826Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:698592b75cf61a391a374b6a5bd9286bd10ce3f0c59f11d8e1636a4410755881","observation_id":"b25c04ed-409c-43d5-9225-b5be64742e18","resolution":{"observed_at":"2026-08-15T21:47:07.586591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.346387Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.346387Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:8907ba5de171441e2cbd8ca1a7376d7da8713c39166e57fe1b21be664c0acf08","observation_id":"e11f9a3a-f364-4e22-b6b7-2eb9f4d43170","resolution":{"observed_at":"2026-08-15T21:47:07.346387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:47:07.351175Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T21:47:07.351175Z"},"links":{"citing_paper":"/paper/2505.08988"},"observation_digest":"sha256:071121298f41e1577db57cf0ea481ac7357b5aefbfd300b1500eb4f04874b7a7","observation_id":"85c8219f-7c44-497e-881d-9e0f592383a7","resolution":{"observed_at":"2026-08-15T21:47:07.351175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.08988","last_updated":"2025-05-13T21:58:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T21:40:52.442608Z","submitted_at":"2025-05-13T21:58:25Z","title":"Generalization in Monitored Markov Decision Processes (Mon-MDPs)"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.08988."}