{"as_of":"2026-08-12T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5259476297550bec9f75c8763ca7998cc9759e770fe0766bf96d7a758b26d039","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T07:46:20.289421Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.22711/citation-record","integrity":"/paper/2605.22711/integrity","json":"/paper/2605.22711/citation-record.json","paper":"/paper/2605.22711"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to achieve goals","venue":null,"work_id":"e82f8e57-8cf4-4f68-b057-34576c7f791b","year":1993},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:a7b8a856f68333e4075431af532fd121bd305d8b9dc1c2bdbac42c00d079622b","observation_id":"fcbf8917-a44c-45f6-a2fa-418a20312a24","resolution":{"observed_at":"2026-05-22T08:06:16.714279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal value function approxi- mators","venue":null,"work_id":"f9dc2c10-ac9b-4e13-9b90-550e6a8e5879","year":2015},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:0de16693edd1ea2f838f2dff5ba4cd6f8561545cb6c321c972123113d2162c4f","observation_id":"a4a4f3d2-acd3-45ca-927b-4e69af28d3b4","resolution":{"observed_at":"2026-05-22T08:06:16.682669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:43f0411c254e0563da6ca4261ab75d63038958ff230681c4c292fec5da22f504","observation_id":"aa4726ca-7294-4998-b9b7-664d7204e41a","resolution":{"observed_at":"2026-05-22T07:51:16.435624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12543","last_updated":"2021-10-24T22:33:52Z","snapshot_observed_at":"2026-08-12T01:21:11.091892Z","submitted_at":"2021-10-24T22:33:52Z","title":"Understanding the World Through Action","version":1},"cited_work":{"arxiv_id":"2110.12543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.12543","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the World Through Action, October 2021","venue":null,"work_id":"306ea834-0a10-4ea3-8b04-69b47b9f549c","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2110.12543","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:1f52a4f8a766eba07078c23ff1d416ccce440555c4181b7c68504f7d48c82ee6","observation_id":"5177c369-e874-4405-b84c-90252e5d2498","resolution":{"observed_at":"2026-05-22T07:51:16.430322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-08-09T00:27:34.912875Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:efd29a76720ce942cc06c365080bc12b327ffcebffdbe4f16901226043f5512a","observation_id":"68eaf269-05be-4142-b8dd-52ae9d8b9432","resolution":{"observed_at":"2026-05-22T07:51:16.424773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.325026","doi":"10.1109/tnnls.2023.3250269","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.1109/TNNLS.2023.3250269","venue":"IEEE Transactions on Neural Networks and Learning Systems","work_id":"1d4b2fb0-2610-4deb-a67f-f4f71fb99d92","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:a652260904fff82a0653f3b4c74579b4cf3062b23307fd86ed41ec0ae82b6412","observation_id":"d764c1be-3a1b-4cc9-a6ad-b995f7f8964c","resolution":{"observed_at":"2026-05-22T07:51:15.286394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-30T11:55:14.504526+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T11:55:14.504526+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:6e2fbbec24b3d6c4e3c67dddae850d749f4205546146d95926b5e466a9867715","observation_id":"92e13170-33b8-4903-b4e4-56cf37ebfb05","resolution":{"observed_at":"2026-05-22T07:51:16.641165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:6086be193dbbf4c7f21ec632f0d6666222979d8798c56401acc7a7ef5e494a2a","observation_id":"adc95831-6a56-4005-b662-987fcfe72c55","resolution":{"observed_at":"2026-05-22T07:51:16.635295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09836","last_updated":"2023-10-24T09:10:03Z","snapshot_observed_at":"2026-08-09T16:16:18.244483Z","submitted_at":"2023-05-16T22:37:01Z","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.09836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.09836","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Revisiting the Minimalist Approach to Offline Reinforcement Learning, October 2023","venue":null,"work_id":"08ad3e5a-4806-4a75-b300-70d46dafd1a0","year":2023},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2305.09836","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:34767f9a8f7c05a2e53fa10d8bcf2a961c3f8b4dc8fcab5eda5a6f004361a0db","observation_id":"961bcf7d-6779-45d9-80f6-d5ab4545ef13","resolution":{"observed_at":"2026-05-22T07:51:16.629858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-07-06T07:49:17.886466Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1904.12901","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-07-03T12:48:11.128704Z","title":"Challenges of Real-World Reinforcement Learning","venue":"cs.LG","work_id":"fc99449a-80f4-4f37-a028-7b3774c78bf6","year":2019},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:62c1912ec1d1d3c954c3b2508a154f3daed2981ae420ec8eb092381fdd3cdb59","observation_id":"a1598660-f353-440c-975e-4a371a192175","resolution":{"observed_at":"2026-05-22T07:51:16.624073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09329","last_updated":"2024-10-28T23:33:19Z","snapshot_observed_at":"2026-08-10T00:32:45.181466Z","submitted_at":"2024-06-13T17:07:49Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?","version":2},"cited_work":{"arxiv_id":"2406.09329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is Value Learning Really the Main Bottleneck in Offline RL?, October 2024","venue":null,"work_id":"b30f8cbc-35db-4657-bc36-55f1e3b02c9f","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2406.09329","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:84e6041dcb9b655adce1e9b679a2bc9b97ca7af50eed76106ddcfe43d7abf608","observation_id":"36c580df-c18e-4b42-a49a-79faaefd2165","resolution":{"observed_at":"2026-05-22T07:51:16.619148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.04168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:17:36.873024Z","title":"Horizon reduction makes rl scalable","venue":null,"work_id":"db2ae55e-02f3-419b-a8bd-b9e557314eb0","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:65941d5ca5eaafa0cefedf724818ede7937cd8b45ac99c670a364f83983631e6","observation_id":"5a8387a0-abaf-46c9-8338-7fe458418401","resolution":{"observed_at":"2026-05-22T07:51:16.613464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0004-3702(99)00052-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":"Artificial Intelligence","work_id":"2653811b-4672-478c-9c59-58cc2798c3ec","year":1999},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:86c4705dbbafa4445e2e6d737c60fbd9a9f6b30b1c5fee1e08b1325a36a21fe2","observation_id":"98361091-8d67-41e2-a9c2-67b8a67c4df9","resolution":{"observed_at":"2026-05-22T07:51:15.290801Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-16T19:50:32.448246+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T19:50:32.448246+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feudal networks for hierarchical reinforcement learning","venue":null,"work_id":"e2e23918-4535-4af0-8639-506a65dcfd82","year":2017},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:8055ec329132fb5e0c15f4ba2a6d1f1d12be5d67a92dcb44cd9a9c437f44eea0","observation_id":"d2122a0b-5a16-4da6-8e38-eb86db5b5ed2","resolution":{"observed_at":"2026-05-22T08:06:16.679649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c2c02a1d-0aac-4d90-9b0e-28c6f23dfe23","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:fe80bc5d82d39bd9785c1aeab85c758565975f140733a80b044698d25524e2ea","observation_id":"2f096f01-0c67-4c69-9e63-8bbb2a7c4034","resolution":{"observed_at":"2026-05-22T08:06:16.704196Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07339","last_updated":"2025-12-05T07:35:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T01:01:59Z","title":"Real-Time Execution of Action Chunking Flow Policies","version":2},"cited_work":{"arxiv_id":"2506.07339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07339","snapshot_observed_at":"2026-07-10T19:47:32.556301Z","title":"Real-Time Execution of Action Chunking Flow Policies","venue":"cs.RO","work_id":"a1af107b-7760-4a6c-858c-9ad27ce9eed2","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2506.07339","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7027f752ae5a0c64cbbf5b76bc07d933a0f88a3eec33813c44032f7e6ef77cc7","observation_id":"cb262baf-ff93-46a9-8c5d-7a522ca053fb","resolution":{"observed_at":"2026-05-22T07:51:16.607761Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable Offline Model- Based RL with Action Chunks, December 2025","venue":null,"work_id":"2a8c83f8-98a7-44ba-806e-4d44940c8cf0","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:0daeb749bc2535cf41a08b55a491b280a3dbb996f72f35c1f63d5fbf2c604ce1","observation_id":"3b241c59-7c4b-4896-a468-132d688f6fb5","resolution":{"observed_at":"2026-05-22T07:51:16.601532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13478","last_updated":"2021-05-02T16:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-27T21:09:51Z","title":"Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges","version":2},"cited_work":{"arxiv_id":"2104.13478","doi":"10.48550/arxiv.2104.13478","metadata_source":"pith","pith_arxiv_id":"2104.13478","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges","venue":"cs.LG","work_id":"5e909969-dcfb-40f6-9099-241ea6f18350","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2104.13478","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:f0d2a0b57b6c97fabecba04e6d04c742f58f8aaa10b7ea807cddd3c2d658f818","observation_id":"58ccb305-5dd0-4103-b2af-7882204efcbc","resolution":{"observed_at":"2026-05-22T07:51:16.596065Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16139","last_updated":"2025-07-22T01:13:45Z","snapshot_observed_at":"2026-08-11T16:27:00.723685Z","submitted_at":"2025-07-22T01:13:45Z","title":"Equivariant Goal Conditioned Contrastive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.16139","doi":"10.48550/arxiv.2507.16139","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16139","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Equivariant goal conditioned contrastive reinforcement learning","venue":"ArXiv.org","work_id":"8c497af0-ff78-48ac-9368-e949ca02b45a","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2507.16139","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:685a8c379837cf7bb4aeaa109f9700cc094b37540e20ad5f8d692acdaa63f0ab","observation_id":"1c76bcec-6df0-4551-8b3e-3f1ad8010346","resolution":{"observed_at":"2026-05-22T07:51:15.297560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-30T11:55:15.336921+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T11:55:15.336921+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Riedmiller","venue":null,"work_id":"1d09b1e0-fc7c-4085-b4a9-a9718f027fa1","year":2012},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:a132329804d875a9cfa34fb39a65580304c60c3b456bc332b5603f1ecc5b5430","observation_id":"06568a53-1fe3-4df0-a7d9-a45d2c0e6d72","resolution":{"observed_at":"2026-05-22T08:06:16.691723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:05:56.259739Z","title":"Sutton and Andrew G","venue":null,"work_id":"48d7a4c7-5639-447c-bcf9-1ab1b26f352f","year":2018},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:3d04f176c255e446b96c3e8dc6dc1469cba9d30c090e443c9c4dda63e46f9deb","observation_id":"845905e7-99e0-45df-a245-2889189cf6f5","resolution":{"observed_at":"2026-05-22T08:06:16.698606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1206.6262","last_updated":"2012-06-27T13:27:56Z","snapshot_observed_at":"2026-08-08T22:32:05.836920Z","submitted_at":"2012-06-27T13:27:56Z","title":"Scaling Life-long Off-policy Learning","version":1},"cited_work":{"arxiv_id":"1206.6262","doi":null,"metadata_source":"pith","pith_arxiv_id":"1206.6262","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Life-long Off-policy Learning","venue":"cs.AI","work_id":"32408783-471a-40bc-8568-44d981f3e9d6","year":2012},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1206.6262","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:641fa9fcaec00778c022cea25b915ea97840b28f60e8d37ab5a56cdc3ce09b39","observation_id":"03c1c226-f725-477f-96d6-b44808b6c064","resolution":{"observed_at":"2026-05-22T07:51:16.591344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":"1707.01495","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-07-09T02:25:55.908762Z","title":"Hindsight Experience Replay","venue":"cs.LG","work_id":"a7ba78be-3bef-4f48-b954-7a5dfbc0d5b6","year":2017},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:a22da86b7a01d3f3a1fdace00bf63a1332ece1e27c56f687507bd8f7b7f64724","observation_id":"bd4ef190-0bd4-47b6-820c-7d7f670a2440","resolution":{"observed_at":"2026-05-22T07:51:16.585969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11949","last_updated":"2024-03-10T04:26:48Z","snapshot_observed_at":"2026-08-08T03:20:22.696625Z","submitted_at":"2023-07-22T00:17:36Z","title":"HIQL: Offline Goal-Conditioned RL with Latent States as Actions","version":4},"cited_work":{"arxiv_id":"2307.11949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11949","snapshot_observed_at":"2026-07-02T02:46:27.854515Z","title":"HIQL: Offline Goal- Conditioned RL with Latent States as Actions, March 2024","venue":null,"work_id":"223fd109-3216-49d2-b93f-64a41b2027d1","year":2023},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2307.11949","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:b98382e64b6087b6c69256054b62363bc318b4d8775e7d0bb4c044c588df978d","observation_id":"967ca42f-56e3-4e18-866d-c82355edd8e0","resolution":{"observed_at":"2026-05-22T07:51:16.581187Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2006.04779","doi":"10.48550/arxiv.2006.04779","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conservative Q-Learning for Offline Reinforcement Learning, August 2020","venue":"arXiv (Cornell University)","work_id":"50cd3da1-adab-415b-ab3c-123ba918dbd4","year":2020},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:5421d3ac26b2d33240900d6e8eb9c5e7c12ff2a393bb27190341dbc317117a00","observation_id":"91af34ea-1812-483d-9e44-00cd4875c82b","resolution":{"observed_at":"2026-05-22T07:51:16.575399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01548","last_updated":"2021-10-05T05:06:01Z","snapshot_observed_at":"2026-08-11T11:30:03.105063Z","submitted_at":"2021-10-04T16:40:13Z","title":"Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble","version":2},"cited_work":{"arxiv_id":"2110.01548","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.01548","snapshot_observed_at":"2026-07-03T11:58:05.719255Z","title":"Uncertainty-Based Offline Reinforcement Learning with Diversified Q-Ensemble, October 2021","venue":null,"work_id":"2a0668f3-341f-4e64-8865-04231203155a","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2110.01548","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:c17e334cee7808a9cef4d5a51e88ba54542021238ad76559225719579f1ad998","observation_id":"30b9fe42-f41f-49ba-94d0-ba300624c751","resolution":{"observed_at":"2026-05-22T07:51:16.569287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07568","last_updated":"2023-02-17T21:53:23Z","snapshot_observed_at":"2026-08-10T06:31:03.163535Z","submitted_at":"2022-06-15T14:34:15Z","title":"Contrastive Learning as Goal-Conditioned Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2206.07568","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07568","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive Learning as Goal-Conditioned Reinforcement Learning, February 2023","venue":null,"work_id":"9efb4c81-e179-4600-b943-c50ee8982a2a","year":2023},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2206.07568","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:685f2c3a0da2fd8f511c3a0817ae7e5e4a35ea2bc597cb5b628d6d2c6b467a0c","observation_id":"e7cd1b31-8a6e-4d93-994c-cc1191d1722c","resolution":{"observed_at":"2026-05-22T07:51:16.563270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06860","last_updated":"2021-12-03T18:58:09Z","snapshot_observed_at":"2026-07-06T11:18:40.627866Z","submitted_at":"2021-06-12T20:38:59Z","title":"A Minimalist Approach to Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2106.06860","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.06860","snapshot_observed_at":"2026-07-03T15:48:35.790054Z","title":"A Minimalist Approach to Offline Reinforcement Learning, December 2021","venue":null,"work_id":"36b41186-78d1-478f-b0bf-a6628dca536a","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2106.06860","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:44eaf66ff050583057f8fbbb72903cbd6177ae0caafe3a35c27fe5b050056696","observation_id":"9a684a99-7f3b-44ab-81da-afe85ad7232c","resolution":{"observed_at":"2026-05-22T07:51:16.557654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.11091","last_updated":"2021-01-13T19:11:34Z","snapshot_observed_at":"2026-08-10T09:38:10.975128Z","submitted_at":"2020-07-21T21:13:02Z","title":"EMaQ: Expected-Max Q-Learning Operator for Simple Yet Effective Offline and Online RL","version":2},"cited_work":{"arxiv_id":"2007.11091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.11091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emaq: Expected-max q-learning operator for simple yet effective offline and online RL.CoRR, abs/2007.11091","venue":null,"work_id":"f807fb43-9817-49e5-9399-fe5c0fc4a0ed","year":2007},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2007.11091","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:f1be50116a980efe64e57171e7e909a7253cde887f97f13594908cf0beb1d49e","observation_id":"42acfa00-10cb-44a1-9353-437dd73ac8d8","resolution":{"observed_at":"2026-05-22T07:51:16.552201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Option-Critic Architecture, December","venue":null,"work_id":"4b7af04f-c5df-45e3-8cb5-70909c865bb3","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:085f03df02c4883364286cead393b2ef513c82a55fcd8d318aaba9dfcc7c5abd","observation_id":"dae6d8e1-bc45-4c00-b156-9a16bb69a7a8","resolution":{"observed_at":"2026-05-22T08:06:16.726563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.05140","last_updated":"2016-12-03T02:47:51Z","snapshot_observed_at":"2026-07-06T05:11:07.847464Z","submitted_at":"2016-09-16T17:05:55Z","title":"The Option-Critic Architecture","version":2},"cited_work":{"arxiv_id":"1609.05140","doi":"10.48550/arxiv.1609.05140","metadata_source":"pith","pith_arxiv_id":"1609.05140","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"The Option-Critic Architecture","venue":"cs.AI","work_id":"99477323-1630-4c53-aa1a-c631d93e7fc2","year":2016},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1609.05140","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:ccbd6e36a68db0f1712bb7740ab9a655c4a9a6a453e777177761dc5c9c3ea4f7","observation_id":"a29fed8b-62ad-44f0-b7f8-c8526f5a8ec2","resolution":{"observed_at":"2026-05-22T07:51:16.545835Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07744","last_updated":"2025-07-07T14:23:25Z","snapshot_observed_at":"2026-08-07T05:24:28.028829Z","submitted_at":"2025-06-09T13:26:23Z","title":"Graph-Assisted Stitching for Offline Hierarchical Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2506.07744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07744","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Graph-Assisted Stitching for Offline Hierarchical Reinforcement Learning, June 2025","venue":null,"work_id":"a82c33e0-b1c6-4109-a47a-946c19dde588","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2506.07744","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:2d3a2958040a3b0d6369be14e488b02d819eae08ab9cfd045b5902e17df2017f","observation_id":"e7505b51-cb54-4ea0-9da9-3ca2d8cd13c8","resolution":{"observed_at":"2026-05-22T07:51:16.540813Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intra-Option Learning about Temporally Abstract Actions","venue":null,"work_id":"cfc197f9-132f-4e4e-8aa1-67484fad870b","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:a1ee0742a3244848bfe782b69d75abaddee9621bf64adfc6644322a0ad22ee82","observation_id":"f0a75844-4e58-44a9-a9f1-d1047259d396","resolution":{"observed_at":"2026-05-22T08:06:16.673493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2dbc42c5-0a43-4caf-a280-8dde509a1d6f","year":2003},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7d52bff6da2c386c4dc1b6630c0e412257d261847148f6bb52e59a23954ad9c0","observation_id":"5b922b75-9a58-4877-92d7-3317e80815f1","resolution":{"observed_at":"2026-05-22T08:06:16.701413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08296","last_updated":"2018-10-05T12:39:37Z","snapshot_observed_at":"2026-08-09T05:06:18.670488Z","submitted_at":"2018-05-21T21:33:44Z","title":"Data-Efficient Hierarchical Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1805.08296","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.08296","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-Efficient Hierarchical Reinforcement Learning","venue":"cs.LG","work_id":"abbd5688-4d82-4027-979d-6c1dd9303cd7","year":2018},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1805.08296","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:2abf5f842c09155a6ea943e02f81d626f25ba3810b9f93fe3b8b288863ae5bfb","observation_id":"97af16e3-57f0-4e95-b45e-d1a0b03a4dcc","resolution":{"observed_at":"2026-05-22T07:51:16.535293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.01257","last_updated":"2019-01-09T16:00:49Z","snapshot_observed_at":"2026-07-06T07:05:38.801141Z","submitted_at":"2018-10-02T14:00:14Z","title":"Near-Optimal Representation Learning for Hierarchical Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1810.01257","doi":null,"metadata_source":"pith","pith_arxiv_id":"1810.01257","snapshot_observed_at":"2026-07-03T02:07:34.154221Z","title":"Near-Optimal Representation Learning for Hierarchical Reinforcement Learning","venue":"cs.AI","work_id":"571a74da-b89e-4c95-b8d0-f091097e623b","year":2018},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1810.01257","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7a5a55d3057c86dbc2dffa3798ee3862bf12ac0299aa64f608295ad2164cd9b5","observation_id":"c2946719-8979-4fb7-b88f-b90275c49b94","resolution":{"observed_at":"2026-05-22T07:51:16.529792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00948","last_updated":"2019-09-03T21:05:21Z","snapshot_observed_at":"2026-08-06T00:36:08.175723Z","submitted_at":"2017-12-04T08:18:08Z","title":"Learning Multi-Level Hierarchies with Hindsight","version":5},"cited_work":{"arxiv_id":"1712.00948","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1712.00948","snapshot_observed_at":"2026-07-03T02:07:34.156817Z","title":"Learning Multi-Level Hi- erarchies with Hindsight, September 2019","venue":null,"work_id":"610e4e55-7fea-4113-bbed-a6a8ca756e07","year":2017},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1712.00948","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:686d2d0119df211ecf8cbcb6a5dfbc2512b2e8fe0c03593ceb06c51bf5e4ce44","observation_id":"11ae49c6-7149-4f27-829e-509333980c88","resolution":{"observed_at":"2026-05-22T07:51:16.522569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"008aa543-fff3-439d-89bb-a1007dec18ed","year":2001},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:3b954b00ad03c1f1d70670074687ab0ee1e6133e0aaf61201885d7503838bbc3","observation_id":"9c96ac77-f8ad-44e1-8d75-725914f54521","resolution":{"observed_at":"2026-05-22T08:06:16.670256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning options in reinforcement learning","venue":null,"work_id":"3bf58421-5bc3-46e1-bac7-e97890f90665","year":2002},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:f4d42f2542222fea7e7cac37ffe9d69bc4a2f2aaa95af27d213163e133e6dc71","observation_id":"51774ece-c80d-4819-9210-3f6f07557c5c","resolution":{"observed_at":"2026-05-22T08:06:16.676808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical planning through goal-conditioned offline reinforcement learning","venue":null,"work_id":"adf525b8-ca39-4394-8044-527d8d4d0242","year":2022},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:3bf1083909c49439fad043c70d57872f5d8f43cf07f2de7ec4c3d2ea7c9915b3","observation_id":"7f730393-593e-4afa-84d0-ebf6a7ffc9c2","resolution":{"observed_at":"2026-05-22T08:06:16.667096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards a Unified Theory of State Abstraction for MDPs","venue":null,"work_id":"85aa02d0-d2de-4f94-80a6-91262228ceec","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7df36eb420603e209a259c702bec89106dabb83b86b4a0661bdf05e11ac376cf","observation_id":"a9657b27-731f-4ea8-b007-c828a52ad564","resolution":{"observed_at":"2026-05-22T08:06:16.688746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1207.4114","last_updated":"2012-07-11T14:43:04Z","snapshot_observed_at":"2026-07-06T02:52:02.941345Z","submitted_at":"2012-07-11T14:43:04Z","title":"Metrics for Finite Markov Decision Processes","version":1},"cited_work":{"arxiv_id":"1207.4114","doi":null,"metadata_source":"pith","pith_arxiv_id":"1207.4114","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Metrics for Finite Markov Decision Processes","venue":"cs.AI","work_id":"2edbcc67-3a14-4383-89d2-05cfda14c834","year":2012},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1207.4114","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:c4c4c59132ef87b8c5ff46a5b1680c48193e56533a1c117c5741f641982665b2","observation_id":"f24f5adc-2de7-46bd-a733-af71cf354a62","resolution":{"observed_at":"2026-05-22T07:51:16.517022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Representations via a Robust Behavioral Metric for Deep Reinforcement Learning","venue":null,"work_id":"bca6de64-82da-4d02-b552-beef1fb86216","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:7b4b5c672f990bf49265195d7300dbe2992ab0fb6cf6e95734f832090e9cce8a","observation_id":"f9243d5a-e4ad-4e8d-b411-6e37128e3770","resolution":{"observed_at":"2026-05-22T08:06:16.707173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17518","last_updated":"2025-06-20T23:47:04Z","snapshot_observed_at":"2026-08-10T10:35:48.301748Z","submitted_at":"2025-06-20T23:47:04Z","title":"A Survey of State Representation Learning for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.17518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17518","snapshot_observed_at":"2026-07-04T07:59:40.694649Z","title":"A Survey of State Representation Learning for Deep Reinforcement Learning, June 2025","venue":null,"work_id":"27e3bbd8-8b1c-4b24-9add-ee93fbad104e","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2506.17518","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:df46dd9a2594f6067c1cc3d653c55d13716adbd27a0d0cdb9cd9cc97914d56fc","observation_id":"6f8e3d58-0158-49b3-bc5a-a4fbcba1d4c5","resolution":{"observed_at":"2026-05-22T07:51:16.511799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phd thesis, University College London","venue":null,"work_id":"c36789c1-d218-4617-b07e-b76ae6c6d90b","year":2003},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:f7fa4624e17747fa601c0b219835005e534acd94470111b53bd4693f4779653f","observation_id":"257eea23-8077-40f4-9a73-88e3b81553c4","resolution":{"observed_at":"2026-05-22T08:06:16.723091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite-Time Bounds for Fitted Value Iteration","venue":null,"work_id":"7e54992a-0e23-4af6-9b60-d2e98c098959","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:2ff3832e1ec4281c3740e6ea77252ff70378968117e48a52c9ceac82715a6ae9","observation_id":"2d77abf6-907e-4a7e-b205-929f0174bb9d","resolution":{"observed_at":"2026-05-22T08:06:16.695346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1202.3890","last_updated":"2012-02-17T11:59:55Z","snapshot_observed_at":"2026-08-01T05:55:12.717107Z","submitted_at":"2012-02-17T11:59:55Z","title":"PAC Bounds for Discounted MDPs","version":1},"cited_work":{"arxiv_id":"1202.3890","doi":null,"metadata_source":"pith","pith_arxiv_id":"1202.3890","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PAC Bounds for Discounted MDPs","venue":"cs.LG","work_id":"2e7c7fb3-d1d2-467c-ab19-1de6025ce666","year":2012},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1202.3890","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:dbb874f1193c7c2930f78452cc7ec087ef64bf8ea82e2eb756ded652d641edf4","observation_id":"4f99cb7e-8d9f-4f19-8ad9-99138bde01c6","resolution":{"observed_at":"2026-05-22T07:51:16.505739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample Complexity of Goal-Conditioned Hierarchical Reinforcement Learning","venue":null,"work_id":"b1f177d9-c806-4ec2-80c9-21c797657821","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:5d55118e1a42583be5f33b6fb0943941fff4d671ecc067dc75ceb0de365b17d8","observation_id":"3bbee3e0-9172-4e6c-a174-a617bef7b9c7","resolution":{"observed_at":"2026-05-22T08:06:16.663674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transitive RL: Value Learn- ing via Divide and Conquer, February 2026","venue":null,"work_id":"66aa4222-d8de-4644-90e2-efed1b14bde8","year":2026},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:d4a5742121a6c6f7e6bd303c666c2fb3cf765edf4a6cd85961610e3d67a35d2f","observation_id":"81e8a703-9183-4090-97e2-609cbb8c5686","resolution":{"observed_at":"2026-05-22T07:51:16.500762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04782","last_updated":"2023-04-10T17:59:05Z","snapshot_observed_at":"2026-07-06T15:14:06.328855Z","submitted_at":"2023-04-10T17:59:05Z","title":"Reinforcement Learning from Passive Data via Latent Intentions","version":1},"cited_work":{"arxiv_id":"2304.04782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2304.04782","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement Learning from Pas- sive Data via Latent Intentions, April 2023","venue":null,"work_id":"609bca87-5a36-4a49-a99d-c23882d16bc6","year":2023},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2304.04782","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:1ee69259a54dc5b5ec1612c9c85001c0fe4f18546118310d7cd2446f29dc84fa","observation_id":"349592fc-9b42-48e1-93a9-cd9c859f3614","resolution":{"observed_at":"2026-05-22T07:51:16.495087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08323","last_updated":"2023-04-05T04:58:45Z","snapshot_observed_at":"2026-08-12T03:14:50.114740Z","submitted_at":"2022-10-15T15:54:28Z","title":"A Policy-Guided Imitation Approach for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2210.08323","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.08323","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A policy-guided imitation approach for offline reinforcement learning","venue":null,"work_id":"1a1cbaca-93e4-46de-9099-d8263eaec5d3","year":2023},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2210.08323","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:c156bfaf1eeef0b88295b80d3c1400e43072df44b0557f65de1c2371c8e61121","observation_id":"586fda6b-8f06-4f7b-b297-2bb70c52b169","resolution":{"observed_at":"2026-05-22T07:51:16.489572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning at the edge of the statistical precipice.Advances in Neural Information Processing Systems","venue":null,"work_id":"6920f131-e44f-4686-8f6b-2095406d982e","year":2021},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:314c6b1e2ffe6c04f692ba705d57a05f2eee676030f6a1a68300afc1ca5ef0e8","observation_id":"96923287-9fb2-4900-baf3-5f02670420b7","resolution":{"observed_at":"2026-05-22T08:06:16.719462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11453","last_updated":"2025-04-15T17:59:05Z","snapshot_observed_at":"2026-08-07T16:02:04.620546Z","submitted_at":"2025-04-15T17:59:05Z","title":"A Clean Slate for Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2504.11453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.11453","snapshot_observed_at":"2026-06-30T16:14:53.452702Z","title":"A Clean Slate for Offline Reinforcement Learning, April 2025","venue":null,"work_id":"ea1eb486-9c12-486b-829e-008774d7260a","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2504.11453","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:4b6ef0fcf88c2f98c780be5f4293f648092b62eb674ab7515b1d30a37c9f6277","observation_id":"37a01df8-4a66-4638-84ea-57b387be753f","resolution":{"observed_at":"2026-05-22T07:51:16.484768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:29019236bc5f7af41577db8f66db83b444f663b5a16cb4322f178f2d9d9bda2e","observation_id":"4f47fa5e-dbfa-4c14-ae36-95c0f7336288","resolution":{"observed_at":"2026-05-22T07:51:16.479367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.14858","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:24:57.657883Z","title":"1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities, February 2026","venue":null,"work_id":"5d7fa63f-ff36-48ec-98ad-45661408e1ea","year":2026},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:d1675d97c1c8ae18630505141be0c6fc378f874386460f968376d3668840733d","observation_id":"c62e827a-694d-4048-bd2e-62e5940ab89a","resolution":{"observed_at":"2026-05-22T07:51:16.474324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":"2412.06264","doi":"10.48550/arxiv.2412.06264","metadata_source":"pith","pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching Guide and Code","venue":"cs.LG","work_id":"2be93143-ab6f-48d6-96d5-3e85d7246f07","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:fd0d454aa80486570dd0aed69b8d9f4f66c52afeb326920749d962438744aedc","observation_id":"50ac6e59-8c51-4a53-8b29-de1f7c13a18d","resolution":{"observed_at":"2026-05-22T07:51:16.468754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual Goal Representations, February","venue":null,"work_id":"fde7226e-d319-4f99-a698-dbfe65013edb","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:79ed4ee46f0c16524522050138cdc52f19bf27b38b19697edfa632c965d01f66","observation_id":"d5be0bc9-8e4f-4ef9-947d-d6fb154911c1","resolution":{"observed_at":"2026-05-22T08:06:16.685839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:27.875517Z","title":"arXiv:2510.06714 [cs]","venue":null,"work_id":"66b3efdd-1dcb-4f4d-9171-5b69bd711056","year":2025},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:8227628be7ce5af766dda2573ae939e4c5f0d51c0eef41faea610ea771bc48ab","observation_id":"12253bbf-6d0b-4a49-972d-a67d5e4ecb7f","resolution":{"observed_at":"2026-05-22T07:51:16.464164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:bf9fbbdcc73a3b8d5d1a7a99ede4bc039b3d4671259afb0b482dbd2580b45ecf","observation_id":"12027911-1874-436c-9969-0b495e0b58b6","resolution":{"observed_at":"2026-05-22T07:51:16.457747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T04:19:02.139595Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:c2e6a09d63e553cac84988398f7f800d1bb0214ecba25593e4333aca604982ca","observation_id":"7ff9557a-0121-4b94-9db2-f317ec17ab1a","resolution":{"observed_at":"2026-05-22T07:51:16.452420Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:71646530b4e746a262de57c2a244bb4c637780b6fab72951c73f8f0d733386db","observation_id":"1cb285bd-6a3c-45c0-8fbc-1bfede5f0140","resolution":{"observed_at":"2026-05-22T07:51:16.447394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10295","last_updated":"2022-07-21T04:12:48Z","snapshot_observed_at":"2026-07-06T13:33:39.335167Z","submitted_at":"2022-07-21T04:12:48Z","title":"Addressing Optimism Bias in Sequence Modeling for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2207.10295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.10295","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addressing optimism bias in sequence modeling for reinforcement learning","venue":null,"work_id":"fe81ed84-e956-449e-9474-559c58e58174","year":2022},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2207.10295","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:0d18b1599adbebf7265c7d0a8e5168f5365fb1709723969df2f74b95c89fc3fe","observation_id":"8bfb6577-6d7b-416b-8078-3e66a43ebf3e","resolution":{"observed_at":"2026-05-22T07:51:16.441348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e478689b-061c-4174-b608-e9dc53341219","year":null},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:8a187251f670c53a88764749a1a7d2dfea458c72cd143d8effce0a124360c26b","observation_id":"51449718-5ca5-4438-9cbe-3cc21615e971","resolution":{"observed_at":"2026-05-22T08:06:16.660587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":4,"verified_exact":38,"verified_fuzzy":16},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2605.22711."}