{"as_of":"2026-08-21T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa63b5db257555eb09129dc44b8c50dab50fe394230097b0d7254398a3494b31","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:06:50.537588Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02034/citation-record","integrity":"/paper/2608.02034/integrity","json":"/paper/2608.02034/citation-record.json","paper":"/paper/2608.02034"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.116931Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.116931Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:6233d226ff53240d0356deb8239eb78a828e81c4f74135946146adfb280d212b","observation_id":"834b2273-932a-4e92-9cc3-494e444867e1","resolution":{"observed_at":"2026-08-15T15:06:50.116931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.125517Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.125517Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:1b288dbd2cf7e97f4eb0765a4958cc18f8fec09b3267f94b7d2aaa83a2e7376d","observation_id":"12bd851b-be0c-4587-a88e-8e5045eada13","resolution":{"observed_at":"2026-08-15T15:06:50.125517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.131429Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.131429Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:4c6e7adfe8719f6a7eb8107d792ebcef90fd2a0ae5ebb7996ea4d73a2e6a494b","observation_id":"91ab2b70-7529-4ade-9d3c-4bb6132cd5af","resolution":{"observed_at":"2026-08-15T15:06:50.131429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.139308Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.139308Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:0c5ba19f6559c7ae94d243268f0d4577bad0305c93ad1350632a01cd13e7b2d0","observation_id":"8b6cf0aa-46b9-4a19-b996-e39a565683c4","resolution":{"observed_at":"2026-08-15T15:06:50.139308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.634101Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":"30e9c028-5a79-493e-ad5f-3fb3aa90f373","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.146215Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:4665dac9c42c104a1237db1b2e355723c9322294eee98addd2b6cdb0b5a471da","observation_id":"debd968b-cac0-4fde-9d45-b8718bb7b4a3","resolution":{"observed_at":"2026-08-15T15:06:52.640450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.593619Z","title":"and Singh, Satinder P","venue":null,"work_id":"be5ac9fd-c7bb-47c9-ac94-69fb56c460cf","year":2000},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.151699Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:686a12b476198a176441c01832255480965f7070275e9ca37d6eeb9d727ea659","observation_id":"b877c83e-c40e-43f4-a674-5abb61ebcb15","resolution":{"observed_at":"2026-08-15T15:06:52.609883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.158210Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.158210Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:7a42bdcb022801fc3e2d86b12ccc8996080f6491e3446c0b7d0be5ec9520b979","observation_id":"7a8c56f3-2484-4e55-a04c-f82d8f81af14","resolution":{"observed_at":"2026-08-15T15:06:50.158210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.163562Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.163562Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:214afd565037f3622fda54ddbcd2e93c4d5b1f2c3db8254877fda50f6322bb02","observation_id":"e8636fba-5dfa-4f57-aa4a-d8842223c53d","resolution":{"observed_at":"2026-08-15T15:06:50.163562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01606","last_updated":"2016-11-05T05:42:40Z","snapshot_observed_at":"2026-08-17T11:47:33.997576Z","submitted_at":"2016-11-05T05:42:40Z","title":"Learning to Play in a Day: Faster Deep Reinforcement Learning by Optimality Tightening","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01606","snapshot_observed_at":"2026-08-15T15:06:50.170813Z","title":"arXiv preprint arXiv:1611.01606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.170813Z"},"links":{"cited_paper":"/paper/1611.01606","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:c9eef8795125815e2ddc0edefc7cd8f06607f6d578535658bab9ffda7806e331","observation_id":"86945018-3bd9-4ed1-9d3b-8a656a86de69","resolution":{"observed_at":"2026-08-15T15:06:50.170813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-08-11T13:36:41.746341Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":2},"cited_work":{"arxiv_id":"2605.05812","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05812","snapshot_observed_at":"2026-08-15T15:06:50.957941Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","venue":"cs.AI","work_id":"4f03c927-ab06-47a2-8979-563a47297cda","year":2026},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.178184Z"},"links":{"cited_paper":"/paper/2605.05812","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:d28d1fc135bc987833454afed12691d704aee7c879ee028464d57a167e7da34b","observation_id":"e25c9158-9fed-4f50-b4a8-a1f00e1ef290","resolution":{"observed_at":"2026-08-15T15:06:50.980075Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-15T15:06:50.184883Z","title":"arXiv preprint arXiv:2110.06169 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.184883Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:a5ec24ae1f6094688ca20244488e5e97b93a9353a34275146d74f45c5ef5dc96","observation_id":"66e53fed-4356-44a0-808e-a68d3b469e54","resolution":{"observed_at":"2026-08-15T15:06:50.184883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02328","last_updated":"2023-02-28T22:14:18Z","snapshot_observed_at":"2026-08-19T19:59:14.746219Z","submitted_at":"2023-01-05T23:14:38Z","title":"Extreme Q-Learning: MaxEnt RL without Entropy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02328","snapshot_observed_at":"2026-08-15T15:06:50.191923Z","title":"arXiv preprint arXiv:2301.02328 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.191923Z"},"links":{"cited_paper":"/paper/2301.02328","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:e74f2b64042e84f9f21dac4b244990650229209ec5b72ad355d9fec4f457e4ae","observation_id":"20012c6e-ff60-40d2-8d45-2a8968370b20","resolution":{"observed_at":"2026-08-15T15:06:50.191923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.199804Z","title":"Econometrica: Journal of the Econometric Society , pages=","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.199804Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:02902402a683a8539a81b00cef5b90c3718be545f001ae6c3363c660f9ebb35f","observation_id":"419d81fd-c36a-4ca0-8778-2907a4590fd6","resolution":{"observed_at":"2026-08-15T15:06:50.199804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.206054Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.206054Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:081c97fab6d49fd2ef9fd0b2eeed2df3681c2810cff0fea2d9ea9c66d60fca10","observation_id":"68355baa-5fdd-4f87-a493-481468fe76aa","resolution":{"observed_at":"2026-08-15T15:06:50.206054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.484582Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"40996c54-bbd4-45a7-906e-e65c71a329e0","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.211907Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:143a4dbd3154ac574a830eec493153e0d20d2e056921ed8d5d7a4396212037ed","observation_id":"cb32992d-f383-4c1f-841e-67b1e79c1627","resolution":{"observed_at":"2026-08-15T15:06:52.492116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.226614Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.226614Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:6871dd9fcc18d0a179518020b078c29081b3e3fdb7c02f9f989f1de5fda60a6f","observation_id":"dab51c5b-b274-4c6b-a9a5-8c193c8191d0","resolution":{"observed_at":"2026-08-15T15:06:50.226614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.232980Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.232980Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:64fefa73f7869a9d446d20616b983f4fb56d963185d24a11f179829adf1642e6","observation_id":"496826eb-b602-4b24-8e85-a4cf9ca15887","resolution":{"observed_at":"2026-08-15T15:06:50.232980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03298","last_updated":"2021-09-25T00:37:01Z","snapshot_observed_at":"2026-08-14T11:25:08.505775Z","submitted_at":"2021-08-06T20:48:30Z","title":"What Matters in Learning from Offline Human Demonstrations for Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.03298","snapshot_observed_at":"2026-08-15T15:06:50.239968Z","title":"arXiv preprint arXiv:2108.03298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.239968Z"},"links":{"cited_paper":"/paper/2108.03298","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:0d32cbb720bf6a3e2d5cdf79dcc97d2a5ad919c81de1dd30f32e8caf6b4b5b9b","observation_id":"a9994f8e-f09f-4a61-92c5-328bb4e16d45","resolution":{"observed_at":"2026-08-15T15:06:50.239968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.383399Z","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning , url =","venue":null,"work_id":"f3b18915-3923-49f0-b4d5-1042eb5841dc","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.245634Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:2dfa481a604ea224664a9fd3fc3a618d7e9e308da5a8dd09d82f77ce73baa382","observation_id":"74d2f582-6ada-4aa0-a076-048f86a3b609","resolution":{"observed_at":"2026-08-15T15:06:52.394137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T15:06:50.252484Z","title":"arXiv preprint arXiv:2210.02747 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.252484Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:b699ea34ebe59298f9739fe8e8455c2ab8df261a47227c4c69a5da53df9b272c","observation_id":"1a4c69b9-d45d-4b90-b579-d46226570b7c","resolution":{"observed_at":"2026-08-15T15:06:50.252484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.259885Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.259885Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:e036636b8e095bd7ef149ce347735722651eb2e6598ffc7817b8defd079f2880","observation_id":"da4a590a-0071-4cb1-856d-543180428c75","resolution":{"observed_at":"2026-08-15T15:06:50.259885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.333036Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"3e3fd4a4-1bb7-4c7c-8dad-0968dd93f849","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.272737Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:41c66de2f36d6a33b885b626f6bcb717d3bcfc1356558ed579ce420069d305be","observation_id":"d44ecb98-a287-4476-b206-a7317ecaea3c","resolution":{"observed_at":"2026-08-15T15:06:52.343344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.289740Z","title":"2026 , eprint=","venue":null,"work_id":"80ece4a3-c968-47b7-afc1-cc1ae5ec8799","year":2026},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.278592Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:6c98f86c78e865fcf91da31708cf6b700e7cda5b83491f548f89270b82861854","observation_id":"09f93716-0152-4043-acce-878b7557a259","resolution":{"observed_at":"2026-08-15T15:06:52.307860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.261129Z","title":"Value-Based Deep","venue":null,"work_id":"4c393b28-93d0-4d91-8ab3-4ff764ff50da","year":2025},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.286476Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:1b645e7c34b949c12f8e127ca2fb850abb4bd72f125c9659678410eaa9109c07","observation_id":"f64bd37b-89ba-43af-a3ed-b828eaf18312","resolution":{"observed_at":"2026-08-15T15:06:52.269376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.226394Z","title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"614c03c6-d27f-443e-a32c-6d3f215c3ee7","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.291836Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:120494f5e803d1b389cf60d5c1d6ad08350440c2023e73c4503b2aeebc67499c","observation_id":"c8cacb51-39ac-41e3-a043-5315563beba8","resolution":{"observed_at":"2026-08-15T15:06:52.238878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.299033Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.299033Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:2a9aeed20a399e6508cdc851eb8a39e46b0dae6d3a40d1702002c6df7bb174e1","observation_id":"568ff334-8390-46a4-aad1-9113bf014708","resolution":{"observed_at":"2026-08-15T15:06:50.299033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i15.29633","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.597670Z","title":null,"venue":null,"work_id":"954ff67a-a476-4891-a563-31fa72cd9ce9","year":2024},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.304764Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:3c1273ab205fcb34272b82f5969048b61cd700b78a2196740c763a8e655db2f4","observation_id":"c18b6e6e-fa65-438d-90cc-923ebd1e319d","resolution":{"observed_at":"2026-08-15T15:06:50.607406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.187285Z","title":", title =","venue":null,"work_id":"fc2b9f64-0859-4040-b8cc-dc314ab105c9","year":2024},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.310504Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:9430e3b0f6f2059f85950ef701a777eab9cbec6606ec88117d35cd7eea625738","observation_id":"d987d442-2f46-478f-a807-7d643c09c539","resolution":{"observed_at":"2026-08-15T15:06:52.193012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.159054Z","title":"2024 , eprint=","venue":null,"work_id":"84cb920c-fd46-42a6-95c2-a8b8eb240134","year":2024},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.316061Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:b5174b2dde7d3ee7576097c3af3a280dffb771051b2b61ca74c1ffd6ce0fc7b7","observation_id":"d2c3ccf7-3683-4645-9b9c-429042cf6316","resolution":{"observed_at":"2026-08-15T15:06:52.166940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.132815Z","title":"2026 , eprint=","venue":null,"work_id":"5358be5c-23c7-48b9-9b46-7f4752714a37","year":2026},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.321895Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:875f688768c173fca09d828675144f19088c49ab20f076e9ac8bc605a850ec49","observation_id":"ccb1c3ed-fea9-4510-8a41-81a05f66daf8","resolution":{"observed_at":"2026-08-15T15:06:52.141488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-18T08:00:35.342323Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-15T15:06:50.327384Z","title":"arXiv preprint arXiv:1812.02648 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.327384Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:4397cb724e4844795b62443b8976512c7d276164761a8c5343dd80fafc4de1eb","observation_id":"4fb82770-ea45-40ee-bee7-975f24d000fb","resolution":{"observed_at":"2026-08-15T15:06:50.327384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.095513Z","title":"Proceedings of the 1993 connectionist models summer school , pages=","venue":null,"work_id":"90ca665a-efff-4f8e-83e3-05c8e1089be4","year":1993},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.332550Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:7715751018ae4a3f20523b150fcd894980deeb57be77a6645eef6adf4942bdd0","observation_id":"90f1bccf-156c-42cf-b501-0f374521c707","resolution":{"observed_at":"2026-08-15T15:06:52.106774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:52.054304Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"e7208fea-0bdd-47a2-8b33-685c119ccec2","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.337580Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:1f19e5735224a2032a9d7ff3105232fe17d410fcd93f385dd1dc2b0b020447b5","observation_id":"0b1eadec-d416-4fd4-adab-c085986120e4","resolution":{"observed_at":"2026-08-15T15:06:52.062103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.342760Z","title":"Sur les op","venue":null,"work_id":null,"year":1922},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.342760Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:e0ac444ac56f55f8ff3f1c27cc6ec56bdfa40571f94c6551dd4af5b6078c49e7","observation_id":"4ec39e56-1621-4dd7-a174-a7a0c921eaac","resolution":{"observed_at":"2026-08-15T15:06:50.342760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.347855Z","title":"2014 , publisher=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.347855Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:887723018ae8f7e29f2112c9d2e9c3c8e2202e039ffb4468478eb0e89ad11f3a","observation_id":"a5460b76-d901-4b88-89f4-4135348ed60a","resolution":{"observed_at":"2026-08-15T15:06:50.347855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.352937Z","title":"Generalized quantiles as risk measures , journal =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.352937Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:4f3cb644b37b507e37e3c2a26f236ff3fa4dab12a3496aa8cb079e0bed8e8054","observation_id":"b0b8dddb-085d-4aa2-8ea1-4c3a6c988b37","resolution":{"observed_at":"2026-08-15T15:06:50.352937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:50.357612Z","title":"2013 , month =","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.357612Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:5cdc73157a733f75774bd413149423a2130b5b28ffad3140abb2ebd88f3080ef","observation_id":"d657fc87-5285-4c5d-935c-3156b5ec8352","resolution":{"observed_at":"2026-08-15T15:06:50.357612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-15T15:06:50.362872Z","title":"arXiv preprint arXiv:2005.01643 , year =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.362872Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:b145ec45bfaa19a5116773f4b4f973f1b664c11b62b4e85866c50cf4507deba0","observation_id":"5e126664-4372-44f1-8a2f-6d1917e4f7c5","resolution":{"observed_at":"2026-08-15T15:06:50.362872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.973911Z","title":"Proceedings of the 36th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"9e29d1bf-279a-4e52-9055-9e003b648ddd","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.368514Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:c4b8e0aa44e9545af771e136d90524c4b34ca872bdd78d1973b42fce0e059a10","observation_id":"51363595-7795-464a-9960-2014b44e4987","resolution":{"observed_at":"2026-08-15T15:06:51.982027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.946030Z","title":"Advances in Neural Information Processing Systems 32 (NeurIPS) , year =","venue":null,"work_id":"3f959234-14c1-4f78-ad16-92150e608bb6","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.373398Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:c547047f994d32b4163a7e8fcc19fb960062330a61c6fa36f9e2c0e943a235d0","observation_id":"04dce202-6b9d-4b43-81c4-a6c53edf6386","resolution":{"observed_at":"2026-08-15T15:06:51.952488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.916440Z","title":"Advances in Neural Information Processing Systems 33 (NeurIPS) , year =","venue":null,"work_id":"10e05508-e307-4196-b264-ecebb83e4fba","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.378202Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:d772fd5909056f54509cb7e0843872e9937c214e2e82da96d63a8916c9dadcb5","observation_id":"584a5242-24fa-4346-9059-c24d2a2f407d","resolution":{"observed_at":"2026-08-15T15:06:51.923532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.891535Z","title":"Advances in Neural Information Processing Systems 34 (NeurIPS) , year =","venue":null,"work_id":"c807f7bf-e6e9-420d-8862-d091fa655db4","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.384263Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:d2659d254986cff96f2b9af88fac9093af28238fba024391385832097f63f027","observation_id":"e44361ea-def0-4f0f-af68-0cbfb2be80b8","resolution":{"observed_at":"2026-08-15T15:06:51.898227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.865865Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"200c463a-fca0-47dd-b627-20d21fbde27a","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.389719Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:bf3fd5414deda4fdddd1f1e46f53c753dff407e9b471630b5bae9e8197cb4f92","observation_id":"7febf1af-9dde-4909-a21f-586a98d3f19a","resolution":{"observed_at":"2026-08-15T15:06:51.875190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.826592Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"0962a3fb-1541-40f2-9c5f-90b191f78b7f","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.395788Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:58c1edb1b22c2966babf534336901d41f54e33c984404339965e27c03ace2b48","observation_id":"f191590c-e1dc-4e78-bf6c-f7a0d6f0489f","resolution":{"observed_at":"2026-08-15T15:06:51.833757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.797074Z","title":"Advances in Neural Information Processing Systems 35 (NeurIPS) , year =","venue":null,"work_id":"a79a7f45-daf3-42c3-a9bd-799b5e65fd00","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.400726Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:18e1f97ad9d3cfb034336837fc33aa65adb022347580c3c6849b3b7549d9a35a","observation_id":"89319c69-97f7-4606-a6ce-d3faec6eef93","resolution":{"observed_at":"2026-08-15T15:06:51.807942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.766236Z","title":"Offline Reinforcement Learning as Anti-Exploration , booktitle =","venue":null,"work_id":"665aa264-bb9d-452d-882c-241f02aa03f3","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.406133Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:87e193f97efe3ae80d3b7be4da7ca2556247e2616dc02bb52265e6d1abdf32df","observation_id":"ac5e6bf4-0354-4fbc-b3dd-dd336d88f302","resolution":{"observed_at":"2026-08-15T15:06:51.773722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.740330Z","title":"Proceedings of the 40th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"f3c14220-1057-4d75-b59d-d18203950b59","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.411207Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:79421d3399f64a9e3d5a9b7b9fe6d7ab735bdef1640050a0f8cc66799f452498","observation_id":"b2cdb4a7-f0f9-472e-a7a4-112f3396bbc7","resolution":{"observed_at":"2026-08-15T15:06:51.746685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.706783Z","title":"Proceedings of the 38th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"4ece2130-38c9-4ad3-8b00-78cd4e53b317","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.416116Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:4026e923fda6a7e21b7d8e229a7202fb1c41133d144a9cca8ee5e5d3e1c05868","observation_id":"ab042adc-a7c6-412f-b1f8-2eb7a29ffcfe","resolution":{"observed_at":"2026-08-15T15:06:51.715621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.670064Z","title":"Advances in Neural Information Processing Systems 34 (NeurIPS) , year =","venue":null,"work_id":"4a41f868-0231-43ea-b1fe-b254da76c597","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.422817Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:875ecdb68f007c904e38e57343e016fdf948906257248b4a6bc418c8a958bd7c","observation_id":"5842a013-6e7a-4a2f-bc18-2744fa0eb4f2","resolution":{"observed_at":"2026-08-15T15:06:51.680986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.642079Z","title":"Proceedings of the 35th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"4a8587b7-a519-40ed-a550-ea98ce85304e","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.427509Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:868f9a1a2a38d14e50c28fee2e6866614dfb21cdca32850d5ddf36d5d984d3f9","observation_id":"3a063cd4-19df-4bcd-8aa6-9244456288f8","resolution":{"observed_at":"2026-08-15T15:06:51.648641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.609250Z","title":"Proceedings of the 37th International Conference on Machine Learning (ICML) , year =","venue":null,"work_id":"597f5125-fbc7-4c52-953b-6a039710b109","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.432448Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:20ee48c20c280c1c2e6013288aea5d579e1b5cf2ba74bd5467ec5494005d5242","observation_id":"f72edb3c-a79a-46cc-80a0-7570cc6b2ef4","resolution":{"observed_at":"2026-08-15T15:06:51.616154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.578012Z","title":"Revisiting","venue":null,"work_id":"82a5c349-3a86-4ee8-b3ae-7353215b425d","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.437973Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:50a65562f6f5ec1f514fc5558a97646747b4ecd0e316fa759e7319a595787bfc","observation_id":"4cfd3ffa-40db-4761-9787-4ac0b52919a1","resolution":{"observed_at":"2026-08-15T15:06:51.587948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.538698Z","title":"Advances in Neural Information Processing Systems 38 (NeurIPS) , year =","venue":null,"work_id":"46cbdc8b-1892-4afc-b461-5704d2cc8e8d","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.442654Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:ce0074b09594dd5b716b8a3c8cc1025aaea600e5e9151b87f8b8619a3a999044","observation_id":"d4f97450-5921-4a03-8ad3-c1241a9a3717","resolution":{"observed_at":"2026-08-15T15:06:51.552686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.489421Z","title":"and Munos, R","venue":null,"work_id":"756b0568-5425-4ba2-b46b-abcc173efde0","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.447393Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:c8242fd072f086c6432de3d8d4841b9ad3ce0691b6675ac111777fcdbc32fb45","observation_id":"c4301007-bce7-4822-b88c-31f0c0d25283","resolution":{"observed_at":"2026-08-15T15:06:51.513390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.449325Z","title":"Statistics and Samples in Distributional Reinforcement Learning , booktitle =","venue":null,"work_id":"a046ed0b-f7c8-47a2-b659-f31a8f794344","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.452227Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:999d7182600fe7896d41f9f3e6a59fd8fd5465e287a45de6fe84be2b62003efa","observation_id":"e47060d1-6c2b-4120-86cf-347cfc7966fd","resolution":{"observed_at":"2026-08-15T15:06:51.456611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.424063Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"1f2d95ca-a06e-49ca-baf6-5f9d46ccb1c1","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.456880Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:74e64d6af1a7a7546f0869302bdf119046a90a20a0b065539afde662847596db","observation_id":"e848eb86-a4b3-430a-aa00-676d2b8aa517","resolution":{"observed_at":"2026-08-15T15:06:51.430630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.398317Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"d961e701-17d0-42f2-b7d1-d4a478565012","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.466583Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:e9646de4eda2ec55d10dc9f8697aada1254e4f395cab8dfdf38dc50a8c65a3c0","observation_id":"33ded815-72d9-416e-a63f-8e8804e547fc","resolution":{"observed_at":"2026-08-15T15:06:51.403649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.374765Z","title":"and Zhou, Mingyuan , title =","venue":null,"work_id":"10fa1c0a-34c1-44e3-8f38-e40b270dea4b","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.473296Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:519b4b008ede26dc72ba7c699e8557bb30dcc0cc24a12b54c2ea23dccae72f1f","observation_id":"670b1a81-6766-4050-ba76-1cf70d38fee3","resolution":{"observed_at":"2026-08-15T15:06:51.382181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.348745Z","title":"and Kumar, Vikash and Levine, Sergey and Finn, Chelsea , title =","venue":null,"work_id":"7e19fd9a-c41d-4b6c-8e3d-cf8099e0ff45","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.478163Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:713647228c8709380ac5f72bb7bc2db0bf98a31e5770601e28df219191b2b5da","observation_id":"a72d2690-b344-4752-ae67-70ee42ca6f48","resolution":{"observed_at":"2026-08-15T15:06:51.358454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-08-16T17:53:54.636855Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-15T15:06:50.483090Z","title":"arXiv preprint arXiv:2410.24164 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.483090Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:bb05474df8556ad795343c013079c03125bad5c1d9d5ac65acbf6d3221bcc601","observation_id":"a67bb99a-ebe4-4c44-8289-3586cbede48f","resolution":{"observed_at":"2026-08-15T15:06:50.483090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.314114Z","title":"Advances in Neural Information Processing Systems 36 (NeurIPS) , year =","venue":null,"work_id":"feac01da-598c-4f21-a7c0-c24550d8d55c","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.493387Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:434a547d39d9ecacab8831c41d4d4c01b964cc0a12908c4a72461629a3d599c2","observation_id":"b159dcac-838a-448f-9c8b-ea97161450e4","resolution":{"observed_at":"2026-08-15T15:06:51.325830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.266503Z","title":"and Smith, Laura and Kostrikov, Ilya and Levine, Sergey , title =","venue":null,"work_id":"adb33e2d-bbc7-4145-9337-d804fc69a06b","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.499712Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:2d49ba11c0c1ad5da679e7876c35b090570a6585cccd6b595bb9500cc3afba13","observation_id":"9a7f8a6a-1557-4061-8488-4eaf0592c0d5","resolution":{"observed_at":"2026-08-15T15:06:51.276547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.238710Z","title":"and Bellemare, Marc G","venue":null,"work_id":"56b31a2a-2b3f-442d-a9a0-2dcecacbc096","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.505717Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:0cf5a86d334947281816302180f803b18fb7a136112262a3a228e2c86bcc0e75","observation_id":"174d633a-e74d-4d99-9707-6fb712d0387c","resolution":{"observed_at":"2026-08-15T15:06:51.247226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.192518Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume =","venue":null,"work_id":"0c5271a0-9eb4-4c70-9efa-fb36de35a81b","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.511800Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:98a54bf320f8f4d497dc3ec41c85ef4c0e3e697b679b8525a04a0b0e026b5eef","observation_id":"6b04cae4-6669-4745-a134-b74f16b7b5cc","resolution":{"observed_at":"2026-08-15T15:06:51.207655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.145088Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume =","venue":null,"work_id":"8f3250b3-ad64-49d2-9371-fbf3e7b3fa77","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.517833Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:a3f38a986d06d1d325a48661b3d22609dc63c84e600819eb2b40d493c6914295","observation_id":"4e9b1ee6-c62b-4dea-acdb-6b592f06a8f2","resolution":{"observed_at":"2026-08-15T15:06:51.156893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.112297Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"f6e0b32a-5ea3-40db-9270-dd0f72889a8c","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.523422Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:9c7325a88be06aba3129a778ec4a630ed35642666020f8b52310e136060b2819","observation_id":"ab82142d-8529-443d-84e3-95f35dbfd25b","resolution":{"observed_at":"2026-08-15T15:06:51.120731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.081159Z","title":"Advances in Neural Information Processing Systems 37 (NeurIPS) , year =","venue":null,"work_id":"88486965-f3bc-443d-b78a-5a1e588740e7","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.530052Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:d9625c2eacab9b40634d26f1d91f115dd3cd765695644c46105ae15f356b960e","observation_id":"8e1bd23b-ad48-41e2-a5c0-b5d1b711de30","resolution":{"observed_at":"2026-08-15T15:06:51.090106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:06:51.049216Z","title":"Atti del Congresso Internazionale dei Matematici, Bologna , volume =","venue":null,"work_id":"500f88d3-b4f0-44a6-8640-7a983587f01d","year":null},"citing_paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T15:06:50.537588Z"},"links":{"citing_paper":"/paper/2608.02034"},"observation_digest":"sha256:1cdc9afc810161290e1e3f2ec0c91675e174bca7cb86238b3d60a18b2cb7dfef","observation_id":"f33cebe7-29a0-40cf-ac69-445cb37dc799","resolution":{"observed_at":"2026-08-15T15:06:51.060220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02034","last_updated":"2026-08-03T10:30:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-21T03:59:16.139395Z","submitted_at":"2026-08-03T10:30:56Z","title":"Upper-Expectile Multi-Step Q-Learning for Off-Policy Reinforcement Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":42},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2608.02034."}