{"as_of":"2026-08-07T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0da4495de71f9d971674bf0700a7a36882a33c755934fe10ab98795555c3884","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T00:19:48.053466Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.20627/citation-record","integrity":"/paper/2604.20627/integrity","json":"/paper/2604.20627/citation-record.json","paper":"/paper/2604.20627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.445392Z","title":"Option-aware temporally abstracted value for offline goal-conditioned reinforcement learning","venue":null,"work_id":"262685e5-c397-4484-b255-ffb30545579c","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:90807c0144af81249a9f73c2b38e8f297730ce19e426d346018d5b24c64c8bc5","observation_id":"0e2ccc47-1dc8-44f4-bf9f-7eda98aeaa9c","resolution":{"observed_at":"2026-05-10T00:24:47.170209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12416","last_updated":"2024-04-18T00:05:57Z","snapshot_observed_at":"2026-07-06T18:02:23.732670Z","submitted_at":"2024-04-18T00:05:57Z","title":"Full Shot Predictions for the DIII-D Tokamak via Deep Recurrent Networks","version":1},"cited_work":{"arxiv_id":"2404.12416","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12416","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Full shot pre- dictions for the diii-d tokamak via deep recurrent networks.arXiv preprint arXiv:2404.12416","venue":null,"work_id":"e948b24b-1231-4b3a-b9ec-c35e4348575e","year":null},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2404.12416","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:7cf5934aad8f185a009aef9d9261c758d8f19af9a5fc8cd861d3eaa73f9004f2","observation_id":"630a03f4-edb0-4c48-ae11-d9505cb420a5","resolution":{"observed_at":"2026-05-10T00:24:47.167457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09817","last_updated":"2025-03-12T20:30:07Z","snapshot_observed_at":"2026-08-07T17:08:58.265485Z","submitted_at":"2025-03-12T20:30:07Z","title":"Temporal Difference Flows","version":1},"cited_work":{"arxiv_id":"2503.09817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.09817","snapshot_observed_at":"2026-06-29T22:54:01.362950Z","title":"arXiv preprint arXiv:2503.09817 , year=","venue":null,"work_id":"fe684128-4dac-48bb-94e5-6dac013ade36","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2503.09817","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:61033262ba25713f324d9fe576bcbd76a275461d54ce93b398d5341d392f211f","observation_id":"721e048f-2b44-4b89-bbe9-2ad1e1b410c5","resolution":{"observed_at":"2026-05-10T00:24:47.158900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2004.07219","doi":"10.48550/arxiv.2004.07219","metadata_source":"pith","pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","venue":"cs.LG","work_id":"47082e4e-a4a5-418b-bf4f-4667355065fc","year":2020},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:1015054c6655933c06c4fab71d490515a139f8ea32f64937982004d202d5306d","observation_id":"c66bfe18-9a1c-4107-a25b-10e7dd7c5f43","resolution":{"observed_at":"2026-05-12T23:19:17.477461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.08225","last_updated":"2020-02-14T10:16:54Z","snapshot_observed_at":"2026-07-06T08:08:41.493066Z","submitted_at":"2019-07-18T18:07:47Z","title":"Dynamical Distance Learning for Semi-Supervised and Unsupervised Skill Discovery","version":4},"cited_work":{"arxiv_id":"1907.08225","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.08225","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:1907.08225 , year=","venue":null,"work_id":"bf808270-76e7-49a5-af17-2cbb29b44948","year":1907},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/1907.08225","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:098f02d785c185aa34cef3c27ff41b68695b931d92467019d45d23a10e4aaa41","observation_id":"838fc5f5-88e3-4bcb-b5fd-9b32323775de","resolution":{"observed_at":"2026-05-10T00:24:47.189847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":"1606.08415","doi":"10.18653/v1/n19-1122","metadata_source":"pith","pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gaussian Error Linear Units (GELUs)","venue":"cs.LG","work_id":"0466fd22-03a1-4a61-af0a-a900e77bb023","year":2016},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:83afbe3208b76212a3121f46809b6f28f63873dfbb624c759a57332804b0687c","observation_id":"8e04f272-435f-4266-9128-b8bbae6c1b1d","resolution":{"observed_at":"2026-05-10T00:24:47.184872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14496","last_updated":"2021-11-29T00:51:39Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:54:12Z","title":"Generative Temporal Difference Learning for Infinite-Horizon Prediction","version":4},"cited_work":{"arxiv_id":"2010.14496","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.14496","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gamma-models: Generative temporal difference learning for infinite-horizon prediction.Advances in neural information processing systems, 33: 1724–1735, 2020a","venue":null,"work_id":"bd3375e5-f555-4dd7-9154-9f9af678fc99","year":2010},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2010.14496","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:6bcd42cf5a91fb2eb6b13022444d10f64cd790a57266962b4b1856b066f169dc","observation_id":"5c2e4c50-ad5f-47de-83c6-2097faf5b1e8","resolution":{"observed_at":"2026-05-10T00:24:47.173297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:b9ce26794c82f3f3548e11155d30eb3bf2aec59e018965bbb14d68f45dac05e9","observation_id":"b88afb4c-37a2-4c18-a19b-ddda345e0476","resolution":{"observed_at":"2026-05-10T00:24:47.182085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":"2110.06169","doi":"10.48550/arxiv.2110.06169","metadata_source":"pith","pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","venue":"cs.LG","work_id":"4adca4ff-8975-49b3-aee4-2ef7e0f95275","year":2021},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:a2ab32d52399a54a81ab159406edb60204395d70c5ca86a50eefb4abb294c57d","observation_id":"9697fd0e-9aa8-4ef5-8e08-8d09afd4f69f","resolution":{"observed_at":"2026-05-12T08:47:05.700994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11478","last_updated":"2025-09-09T17:06:56Z","snapshot_observed_at":"2026-08-07T15:44:34.612798Z","submitted_at":"2025-05-16T17:40:01Z","title":"Automatic Reward Shaping from Confounded Offline Data","version":2},"cited_work":{"arxiv_id":"2505.11478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11478","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic reward shaping from confounded offline data","venue":null,"work_id":"aeb2700f-1190-440c-bb83-85175390ad2b","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2505.11478","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:4a0e7dc0c4ca85ac4142f202a285544c6572bb88b42d3c984879381166991104","observation_id":"71b73c5c-1ee4-444b-8cca-8a06710a8f94","resolution":{"observed_at":"2026-05-10T00:24:47.192353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:6daba442e1a684ff79aa1787509aecdb90b11f032f70492f0e4d166c7872c998","observation_id":"93c2582f-c78e-4842-832f-deb3e4f6e6ff","resolution":{"observed_at":"2026-05-10T00:24:47.194847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":"2412.06264","doi":"10.48550/arxiv.2412.06264","metadata_source":"pith","pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching Guide and Code","venue":"cs.LG","work_id":"2be93143-ab6f-48d6-96d5-3e85d7246f07","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:85896a3f7b6fb8a64bd586fc58f23405b7b5500c342668002b457fef20933268","observation_id":"721075b8-417a-4601-8da8-6fc2a3cbe5dd","resolution":{"observed_at":"2026-05-12T10:28:14.320594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T13:49:33.385348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08299","last_updated":"2022-09-02T10:46:40Z","snapshot_observed_at":"2026-07-06T12:29:20.225445Z","submitted_at":"2022-01-20T17:06:42Z","title":"Goal-Conditioned Reinforcement Learning: Problems and Solutions","version":3},"cited_work":{"arxiv_id":"2201.08299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2201.08299","snapshot_observed_at":"2026-07-08T03:24:28.836511Z","title":"Goal-conditioned reinforcement learning: Problems and solutions","venue":"cs.AI","work_id":"49912572-a2f0-40c7-a997-487d1ad01cb7","year":2022},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2201.08299","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:2088bfc2ec57c96c502075fe6c0e78931df6a11aec27b92d91175d0eea718127","observation_id":"56a29c79-bb3c-482c-925d-d536bda25bad","resolution":{"observed_at":"2026-05-10T00:24:47.179747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03029","last_updated":"2025-02-28T12:21:00Z","snapshot_observed_at":"2026-07-06T18:57:22.433852Z","submitted_at":"2024-08-06T08:22:16Z","title":"Highly Efficient Self-Adaptive Reward Shaping for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"2408.03029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.03029","snapshot_observed_at":"2026-07-04T09:59:44.620366Z","title":"Highly efficient self-adaptive reward shaping for reinforcement learning.arXiv preprint arXiv:2408.03029","venue":null,"work_id":"519a984d-cd89-4dc1-b5ee-af4130eaf11f","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2408.03029","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:c3c2ef39f88d473f8b047ac99b865bb6fec1207d0d429ab8b049c3297824ec62","observation_id":"3e597636-2626-49ea-8caf-c9ffcbacd396","resolution":{"observed_at":"2026-05-10T00:24:47.176236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09159","last_updated":"2023-02-06T13:33:53Z","snapshot_observed_at":"2026-07-06T10:50:28.215577Z","submitted_at":"2021-03-16T15:56:57Z","title":"Learning to Shape Rewards using a Game of Two Partners","version":5},"cited_work":{"arxiv_id":"2103.09159","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.09159","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to shape rewards using a game of switching controls.arXiv preprint arXiv:2103.09159","venue":null,"work_id":"a98a85e8-ff51-4e48-b0f6-90c130254b33","year":null},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2103.09159","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:fe638552ef7713a27f7b452fa15be431bd32bf67f88d99f831f0ac884dea2ddd","observation_id":"3215fa87-042d-4aa9-8040-ebc2e2211928","resolution":{"observed_at":"2026-05-10T00:24:47.226301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:943a7693535a4d4b5c50f8f21d100e3e8b4eff0c90b4a37d1820836de1f2decc","observation_id":"52b4f72d-a89e-4d2c-b643-2cc6aaad9b70","resolution":{"observed_at":"2026-05-10T00:24:47.205459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2402.10820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T18:00:01.593139Z","title":"Learning goal-conditioned policies from sub-optimal offline data via metric learning","venue":null,"work_id":"fd9f1617-8478-4b24-b805-e11cf7badf17","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:a63ae3e1fd48a165add20654438411cd618086cbfda82581c2cb92f47e7fabeb","observation_id":"7e2a2e4a-26d9-45ed-9d73-15404fe13326","resolution":{"observed_at":"2026-05-10T00:24:47.210600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00653","last_updated":"2018-03-01T22:50:35Z","snapshot_observed_at":"2026-07-06T06:26:13.397923Z","submitted_at":"2018-03-01T22:50:35Z","title":"Semi-parametric Topological Memory for Navigation","version":1},"cited_work":{"arxiv_id":"1803.00653","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.00653","snapshot_observed_at":"2026-07-03T21:48:59.198078Z","title":"Semi-parametric Topological Memory for Navigation","venue":"cs.LG","work_id":"df2cbd8c-0a39-4ad1-8284-4c63c6ad85e0","year":2018},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/1803.00653","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:92643ba59ea9ea5b789ff767137c06669c3de1c225706119ed610edc90fa66e8","observation_id":"766122dd-1a85-40bc-a3d4-6c5163bbb1b5","resolution":{"observed_at":"2026-05-10T00:24:47.213063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.12163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bellman diffusion models.arXiv preprint arXiv:2407.12163","venue":null,"work_id":"d965a53a-4d68-4ab9-95bb-0cab124db135","year":null},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:37680ccf1ec07cc3afbc02c741e8a9eef1212eedbf3dd301110401cf3a43be0b","observation_id":"1c069c93-9628-42a0-bf15-9fb229571ed1","resolution":{"observed_at":"2026-05-10T00:24:47.218256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08560","last_updated":"2024-01-26T16:58:26Z","snapshot_observed_at":"2026-08-06T13:14:58.048540Z","submitted_at":"2023-02-16T20:10:06Z","title":"Dual RL: Unification and New Methods for Reinforcement and Imitation Learning","version":3},"cited_work":{"arxiv_id":"2302.08560","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.08560","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2302.08560 , year=","venue":null,"work_id":"d32bb1f0-575a-4709-8e4d-febc40d9f634","year":2023},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2302.08560","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:5b8b05dcbff5da36f63760b7f2be5765b27442808153cf68324cf24e30b6ce75","observation_id":"70989f6e-e878-4c1b-a5ec-6c1d25947041","resolution":{"observed_at":"2026-05-10T00:24:47.200049Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04478","last_updated":"2022-02-14T04:26:50Z","snapshot_observed_at":"2026-07-06T12:36:04.284368Z","submitted_at":"2022-02-09T14:17:05Z","title":"Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL","version":2},"cited_work":{"arxiv_id":"2202.04478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.04478","snapshot_observed_at":"2026-06-29T06:53:12.433161Z","title":"arXiv preprint arXiv:2202.04478 , year=","venue":null,"work_id":"b1ac1c8a-9d92-496d-b4f2-4aa59ebf87ac","year":2022},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2202.04478","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:28cc22d2595b02e0f82ae2460947c7620272d71bf756ae6ace57e144f27b2c41","observation_id":"872eb0cf-fa4a-44df-b35d-076ed3bc29ea","resolution":{"observed_at":"2026-05-10T00:24:47.220742Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15421","last_updated":"2025-06-18T12:46:39Z","snapshot_observed_at":"2026-08-06T23:54:17.271522Z","submitted_at":"2025-06-18T12:46:39Z","title":"Reward Models in Deep Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":"2506.15421","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15421","snapshot_observed_at":"2026-07-04T13:29:50.941267Z","title":"Reward models in deep reinforcement learning: A survey","venue":null,"work_id":"06baa68d-907b-4b0e-8ebe-783f606e1cbf","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2506.15421","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:270e71076527435f39bc403edb44399677a0655913052183fea1acbd5a27d076","observation_id":"e53582ca-beba-4ed5-90ca-36d1efeb6910","resolution":{"observed_at":"2026-05-10T00:24:47.223690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2310.20141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive difference predictive coding.arXiv preprint arXiv:2310.20141, 2023a","venue":null,"work_id":"e4659fbd-7caf-4ada-a893-729ff1d9cb3b","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:4dc1ae878833af506e4c32d3dcfa49f9145b69cf094c2cb02d6899343bd5cb4a","observation_id":"fc2a4c6e-4f7f-453c-89cf-8aed4763308a","resolution":{"observed_at":"2026-05-10T00:24:47.197432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.08021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can a MISL fly? analysis and ingredients for mutual information skill learning","venue":null,"work_id":"f42dd043-7be3-4d38-b967-880f7d9286d7","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:75e7c75f43231bd0ba363af766dc34fd669971e756bc91e4bcdf14f8c7fba20c","observation_id":"259cb14f-5fd5-4920-8c06-0f0295387358","resolution":{"observed_at":"2026-05-10T00:24:47.207972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.467015Z","title":"Flattening hierarchies with policy bootstrapping","venue":null,"work_id":"d06abc5c-9007-4e05-9f7b-bb36b8b9782f","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:83d8d1ff799649462928bc8abdc7eb15e5535d5d677675572f89986ce813dddb","observation_id":"388c40ac-3e7e-437c-a9ee-6c140f4adc41","resolution":{"observed_at":"2026-05-10T00:24:47.202852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0b158954-e20a-4f91-bacf-da8963bd4bfe","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:00962d02a1b6e846c6c6dbb795bada301a7e51a57e4eec519c152440ef3f4b41","observation_id":"270f7ae4-d91b-451c-8b1e-fc875d5e52d9","resolution":{"observed_at":"2026-05-23T11:27:55.427758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"394ae3ce-cf6c-420d-b94d-5e21f11c5318","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:550de074c588eca637ba25dc6c7ae15840d03475b4bce8892dabd9d945d30c21","observation_id":"ef940040-5477-4b6f-abca-0042b9f320cc","resolution":{"observed_at":"2026-05-23T11:27:55.420385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ec37377-54f3-4965-be2b-91c97aab7bb1","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:d64352080b026a6df61bfff07d4ef6ff0657ab111fc7b176a2212283fe8ae2af","observation_id":"d2afbd84-a533-45aa-9292-360d046cdb1f","resolution":{"observed_at":"2026-05-23T11:27:55.437349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We start from the definition of squared Wasserstein-2 distance in Sec","venue":null,"work_id":"71fbac19-8411-4bfe-8877-9234166b492e","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:c22a45f19d3b67a069c37affa1ba8a086d0d5dfdeeaac06f13e56a151deb58b5","observation_id":"cddef896-1a37-4cb8-9382-b8f9bd875b09","resolution":{"observed_at":"2026-05-23T11:27:55.430729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cd54235a-caf3-44f9-a4ec-bb93a128781d","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:a8cd51da38274393f10f07925397c47acd6bfe76c3ca097fd0787546e22e4090","observation_id":"bc841a1e-55db-4637-af32-a94ff0bfc09c","resolution":{"observed_at":"2026-05-23T11:27:55.407343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"So we can lower bound the entire difference: V π∗ W (s1, g)−V π∗ W (s2, g)≥γ k−1 ·0 + k−2X t=0 γt(1−γ)∆ Φ = (1−γ)∆ Φ k−2X t=0 γt = (1−γ)∆ Φ 1−γ k−1 1−γ = (1−γ k−1)∆Φ","venue":null,"work_id":"51cfd854-1742-4b41-94e9-4f3cc04ed969","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:b423c6423d0cc69be391698f99b60b5c094cba301eb2d5d63b404dcd6762bd11","observation_id":"10c45c45-08f8-48a9-a921-269add10669e","resolution":{"observed_at":"2026-05-23T11:27:55.441151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Both antmaze-large-navigateandantmaze-giant-navigateare collected with noisy expert SAC policies that repeatedly move towards randomly sampled goals (Park et al., 2024a)","venue":null,"work_id":"5708f6fd-4761-4f2e-9b2e-b38767bed693","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:e929c0155b917c934f68676613074c1deb9ce5f02fafc502bdcabf33ceee4942","observation_id":"b39f773b-00a8-4d0c-bad3-d5d2d382020d","resolution":{"observed_at":"2026-05-23T11:27:55.434156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We use a dataset of raw sensor and actuator data collected from the DIII-D tokamak located in San Diego, CA, USA","venue":null,"work_id":"92a38752-232b-461d-a024-a730a4a6e04c","year":2023},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:c8d0c3407f02958725bc20d646abbcab1fa9aab3d8973864feabe716fddb2dab","observation_id":"8873b6f1-c9e9-45a9-9ea9-661a625fb312","resolution":{"observed_at":"2026-05-23T11:27:55.448423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each RL algorithm was evaluated based on how closely it tracks a given goal state of the plasma","venue":null,"work_id":"3046f091-2ab4-43da-8c04-ca44ad04cb8f","year":2020},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:8f89f60ab5d1f32a87fa8d5632bdc1c70a7e90488988effa5477f208f67e8ed5","observation_id":"f7cd042f-2e5f-4ce4-8c31-ff552912e6b6","resolution":{"observed_at":"2026-05-23T11:27:55.455107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6ae4181-c77b-4583-9b69-dab723365018","year":1987},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:4220587c42791fb3c5bded770146ca843e0b9a6fbbe3f07f0808f2d50a74acac","observation_id":"4585f1b1-d50d-422e-9d83-e4cb18f56f39","resolution":{"observed_at":"2026-05-23T11:27:55.451431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We increased the R-Net size to an MLP of 64 units (we did not see an improvement in classification accuracy for large sizes) and used a local distance thresholdτ= 10 on all tasks","venue":null,"work_id":"7b1d4866-00ca-4def-b0b8-65bebdc7e597","year":2023},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:255aa9ac2e5df46406198179e2801f1af5e38af1ac13740530b78b7e291e009a","observation_id":"3704338f-0131-4f86-8d8f-f08aed0d6565","resolution":{"observed_at":"2026-05-23T11:27:55.424707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We provide the specific hyperparameters used for each task in Table","venue":null,"work_id":"8650df0c-39a9-40c6-9e4a-53b270fceb0c","year":2025},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:7f014b31496a0a78a49b7cb48469efc9434e389acfa6ac44f2d4b4c48e67e24d","observation_id":"4cebef7f-36d7-44eb-8f69-eefa3872dd4f","resolution":{"observed_at":"2026-05-23T11:27:55.444953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3.2 and Sec","venue":null,"work_id":"f5e52a03-e7ce-4c93-aa87-37beff3fa1fc","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:43af7b9ec6f3b88fab7b63a5466d1e0bee8418fac62839694cb12a881b1c3aff","observation_id":"891ed8b7-99b1-4166-96c8-84111c2ecdb0","resolution":{"observed_at":"2026-05-23T11:27:55.410453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"4.1 for next next 1M epochs, however we did not see any consistent improvements from doing this","venue":null,"work_id":"33cabfe8-1709-45b9-928b-96b8059ae024","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:d7add03756109d93f64456179b9ffce21007788359bd989d9b2da8e2ac9b9385","observation_id":"4ac5fb54-4063-4c28-8a80-89f0be19e082","resolution":{"observed_at":"2026-05-23T11:27:55.413770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For default GCIQL, policy training takes 7.2 ms per iteration","venue":null,"work_id":"6b395e86-3272-4746-9623-b3e03cce5616","year":2026},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:3215b2c25d463a2201f90fe7e22db7558250f79b222b746e85807276cb2ddd50","observation_id":"e1b78d31-c015-4789-9914-acfa1db7bc03","resolution":{"observed_at":"2026-05-23T11:27:55.417304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":23,"verified_fuzzy":10},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2604.20627."}