{"as_of":"2026-08-07T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6bc45e5705ff1a7b33b72b25bc4d7a329f28b283f05876506b5f14bc594754b","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T11:34:21.873504Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.18530/citation-record","integrity":"/paper/2604.18530/integrity","json":"/paper/2604.18530/citation-record.json","paper":"/paper/2604.18530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.humov.2015.07.007","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Human Movement Science , author =","venue":"Human Movement Science","work_id":"0b0c1466-6eab-433a-a183-70db0243fc0e","year":2015},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:cf995550d9e0741b8b3201a59c0b14cdfae6c779d2a2b1fd38efdee4a32c0446","observation_id":"d3e90a94-4a82-4e02-9d76-153895a628e8","resolution":{"observed_at":"2026-07-05T11:41:02.369400Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9538.369956","doi":"10.1145/3699538.3699567","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Student-","venue":null,"work_id":"a8c046bc-deb4-49b7-be6b-72c7ef135628","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:e575e34d4c59191df5250118825c0c7e8e588ef5406fc83c0272289d479e9004","observation_id":"06a15945-28c8-4ea8-8f33-15e4accfe24d","resolution":{"observed_at":"2026-07-05T11:41:02.350723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T06:31:59.764391Z","title":null,"venue":null,"work_id":"2fe75418-e464-4895-a47b-52ff37e94b8a","year":1983},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ab772c1cc7aea60e72d1603c60cd92e5b29d47c8d1887c136eb39e872f2ab3cf","observation_id":"b4f9968c-22a9-4d3c-bad4-7c4def275b99","resolution":{"observed_at":"2026-07-05T11:41:03.210807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.102287","doi":"10.1016/j.ssaho.2025.102287","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ChatGPT as a cognitive crutch: Evidence from a randomized controlled trial on knowledge retention","venue":"Social Sciences & Humanities Open","work_id":"5c43e411-a288-4f7e-9c09-8314d8bf432a","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:603f482e15fcced8fbe37340d21f14333ae74ae40d46db75714e6285eaa4130c","observation_id":"6602eb7f-748a-4315-8489-213c2bb3092c","resolution":{"observed_at":"2026-07-05T11:41:02.455461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.206234Z","title":"James, and Nadia Polikarpova","venue":null,"work_id":"f162244e-bf3e-48f4-9987-07f0cf09a327","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:c53c55b615b9823f92dadacd472411389ffe300caee6245e1fdc0a042283e2c7","observation_id":"582eb544-5298-4de5-b130-ef6fe2311355","resolution":{"observed_at":"2026-07-05T11:41:03.207434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3394.249340","doi":"10.1145/2493394.2493404","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Basawapatna, Alexander Repenning, Kyu Han Koh, and Hilarie Nickerson","venue":null,"work_id":"2813741b-f593-465a-9830-864a9f57580c","year":2013},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:4d368bc241cb85084c7ad5935dfc9f1c764befa543275df95f30b0f10a0e4c93","observation_id":"a6652daa-c149-4835-9c0f-7824fcc553d7","resolution":{"observed_at":"2026-07-05T11:41:02.389236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.211320Z","title":"2004.Extreme Programming Explained: Embrace Change","venue":null,"work_id":"16cd80bb-a039-4f8b-b3f7-bb5dda3e6f60","year":2004},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:25fa46dc545c74c5bbfa480ed67feb429f0f59c16c52c479e267f1a2f6b1b68f","observation_id":"1dac3af9-3e1e-4700-9a60-a7f5f744254d","resolution":{"observed_at":"2026-07-05T11:41:03.212460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5945.356975","doi":"10.1145/3545945.3569750","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Becker, Paul Denny, James Finnie-Ansley, Andrew Luxton-Reilly, James Prather, and Eddie Antonio Santos","venue":null,"work_id":"8e55265e-2c9b-4fd7-99d6-124ba23e2418","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:91017e3b15f096cd5b6e177b9e3c1cba2a1309f6e2b0938fe1bb9eae8cc51ce6","observation_id":"4daff6a4-b53a-4d30-a77a-d70845676d36","resolution":{"observed_at":"2026-07-05T11:41:02.463794Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21105/joss.02815","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ben-Shachar, Daniel Lüdecke, and Dominique Makowski","venue":"The Journal of Open Source Software","work_id":"4f16b1ce-6c03-4e3d-9305-454582a05d98","year":2020},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:144a990a5a8431bb546d77f3a7e88a48339f004e89fb4a9699d8ff11d2141867","observation_id":"5b84cd19-28e7-4fdc-a871-65796c5c748c","resolution":{"observed_at":"2026-07-05T11:41:02.426744Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.197575Z","title":null,"venue":null,"work_id":"8c73a84b-75f5-44e6-8953-0e0a8ea70303","year":1995},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:3c7df6904e554eef58aa2fe564ff98f337b17f414b30a9e3772dd4adc5995dc0","observation_id":"6777f65e-457f-4d72-8bf1-6f281cdb21cb","resolution":{"observed_at":"2026-07-05T11:41:03.200321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.214803Z","title":null,"venue":null,"work_id":"b7ec8f7e-51ef-4530-ab16-a407458a3cac","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:2ebbce2f601f716581bf6db68865009f4ffdd1ba858b8ea80d1f10a580065d4b","observation_id":"30fc8b8f-c58d-4ebf-9038-88ec432c0279","resolution":{"observed_at":"2026-07-05T11:41:03.216032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.241843Z","title":null,"venue":null,"work_id":"4b23eb8b-710b-4762-b6e3-b09962eee060","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:92613ba9990304d880ef55d4ad8907f90b562da59ef5c38310866ba3038cec5d","observation_id":"965f043b-6d87-466a-be5e-5850dca2e9dd","resolution":{"observed_at":"2026-07-05T11:41:03.243032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.240003Z","title":null,"venue":null,"work_id":"16d1bf77-f471-44e3-b3f3-5a68312d66c0","year":1994},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:3205e8186d974bd7bc6f069239b3ac4180c17928bd73bf9ef8d38b5dd3b182ac","observation_id":"c48f2040-e6e5-4333-9781-7da2e1348b18","resolution":{"observed_at":"2026-07-05T11:41:03.241120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.236816Z","title":"Colin Cameron, Jonah B","venue":null,"work_id":"60bf01a0-726c-497c-9b03-078f4af8673d","year":2008},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ac8e1f4ac0c60199fa9f8cf36e0f1f57ae1e975eb6db9b75585c05923cc7951c","observation_id":"7be7773a-953b-40ad-a078-0800fad73708","resolution":{"observed_at":"2026-07-05T11:41:03.237866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.238427Z","title":"Colin Cameron and Douglas L","venue":null,"work_id":"60a73254-1323-4425-b905-9ccb4e72aa39","year":2015},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:9dd8d919dc2d8d353006bc89f061de5c24d6797d68fb9045931530dfab4f6366","observation_id":"5a5a8d79-976a-4db5-9492-964bac409f1b","resolution":{"observed_at":"2026-07-05T11:41:03.239465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:63df8c0f766a39cc7413b2d35a0da2806517631dd953b6d635bac52a62eb0eee","observation_id":"3c2fb870-6d91-4636-a2c5-e44d1432c714","resolution":{"observed_at":"2026-07-05T11:41:02.685721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01395","doi":"10.48550/arxiv.2510.01395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cheng Myra, Lee Cinoo, Khadpe Pranav, Yu Sunny, Han Dyllan, Jurafsky Dan","venue":"ArXiv.org","work_id":"83f353d2-68e8-4e22-94d6-e14f16a24cb9","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:43b46ebca76a9c90b198abd16a76bf0a308956ebb173d2be87d230c501350de2","observation_id":"ed113479-9c6f-41db-bc66-357392ff6068","resolution":{"observed_at":"2026-07-05T11:41:02.403937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.234859Z","title":"2013.Statistical power analysis for the behavioral sciences","venue":null,"work_id":"b6fb81e0-fce9-4163-a10a-d1d0e29a95d1","year":2013},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:9d14328b4c3be5131f25b76510b9b965af39e7bcd42e66177365bc495008569a","observation_id":"a2c6fc07-ab95-4f3c-b519-2e2fea6ff6ad","resolution":{"observed_at":"2026-07-05T11:41:03.236166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3758/s13423-010-0041-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Livesey, and Justin A","venue":"Psychonomic Bulletin & Review","work_id":"2fe88d04-cd78-47ce-9e95-c0b67d1f1685","year":2011},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:eba7505723498b99af68af0ee8144197aa9ee45bad37fbc9889b4e6b965f2121","observation_id":"cd58aced-7032-4a38-bc41-6b9fbb7b0d3b","resolution":{"observed_at":"2026-07-05T11:41:02.391683Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4324/9780203807002","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2013.Understanding the new statistics: Effect sizes, confidence intervals, and meta-analysis","venue":null,"work_id":"bd125395-fa99-4156-9e46-7a9232281812","year":2013},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:24aaaeae62b923ac796f5231dd9753cfe7676ee9ca1b1c43ea5f15420934996f","observation_id":"fddf91bc-12be-48ff-8f07-88bfa1662f07","resolution":{"observed_at":"2026-07-05T11:41:02.337258Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.233013Z","title":null,"venue":null,"work_id":"c3cb3a60-c720-4dd2-ad4f-9d1de9613520","year":2016},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:f767380008a0ebe1165a38c7d7289fcf47ae8386edb250c76514afa034d7b49c","observation_id":"03be9d07-64f3-46fc-a02a-112bfa91a07a","resolution":{"observed_at":"2026-07-05T11:41:03.234192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6252.363090","doi":"10.1145/3626252.3630909","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Becker, and Brent N","venue":null,"work_id":"0395c3ac-9ee3-4b3a-a1ef-31ed09367171","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:03499710f5dbe552d56f9466ff804b86cc29774a0728ec114e597338a65537d3","observation_id":"c06312bf-24b8-404c-a56f-f83e00968e43","resolution":{"observed_at":"2026-07-05T11:41:02.394777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T08:48:56.984427+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T08:48:56.984427+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3624720","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Computing education in the era of generative AI","venue":"Communications of the ACM","work_id":"8aef5815-9cd7-43fc-b57c-508d3be1226f","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:3e8be3fb0bb2f7b1512739ebd3f888f25ea01b28b54cb37e1b8adfe04154be4d","observation_id":"46fea5d1-345d-4883-96d2-7b0c065617c1","resolution":{"observed_at":"2026-07-05T11:41:02.334863Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T00:08:12.994753+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T00:08:12.994753+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.01415","doi":"10.3389/fpsyg.2016.01415/full","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":null,"venue":null,"work_id":"9dbf0bb1-b2e0-47f2-8601-d191909d332d","year":2016},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a84a28ecef8fcee5ff03f2d29022398641ff7c5e2c87af0a4430910a36132fee","observation_id":"05d2512b-4d17-4f3b-af52-6a7d947ac737","resolution":{"observed_at":"2026-07-05T11:41:02.438082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s40594-025-00537-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"International Journal of STEM Education , author =","venue":"International Journal of STEM Education","work_id":"10d47140-9bad-4334-a098-cf1a6a7bc5b8","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ced18cf40de4f6c449f55f6ac7dd380799dc00cf3791b6146af942a43cfca0df","observation_id":"8dd3ddda-11d9-4922-b978-e2415d988e56","resolution":{"observed_at":"2026-07-05T11:41:02.406097Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6123.357613","doi":"10.1145/3576123.3576133","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Becker, et al","venue":null,"work_id":"c68abcf2-a22a-498c-8499-f4a0d920cbcf","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ad9ccddb43f153deab24ee791021e69593b34a7322326f3d6d1317ecd8b3d68d","observation_id":"070ea894-1396-43a0-b9fe-6fd65fe436e8","resolution":{"observed_at":"2026-07-05T11:41:02.323921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T21:56:40.523999+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T21:56:40.523999+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.226763Z","title":"2004.The Midnight Disease: The Drive to Write, Writer’s Block, and the Creative Brain","venue":null,"work_id":"80c324d1-78a9-410d-bd33-fc823e4e86ef","year":2004},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:0805045c0926769316d416485a81a6ddd45f126e01076f02893724fe31a0fbc6","observation_id":"cdfea934-cf43-4fb6-8073-ca6a8f855606","resolution":{"observed_at":"2026-07-05T11:41:03.228163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.228991Z","title":null,"venue":null,"work_id":"490bf811-1fc3-4512-86e4-3b5280906f95","year":2021},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:e9d28dcde418fb27c99e31613a457630b188864f27dc3c268a70586e78672876","observation_id":"9f2b1d45-1639-4e09-9fd1-bd40e5cf8259","resolution":{"observed_at":"2026-07-05T11:41:03.230262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9217.365361","doi":"10.1145/3649217.3653615","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"month = jul, year =","venue":null,"work_id":"0c1d2ab4-ab10-4941-b690-bde96c067d4a","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:d385a2c3c416d74660a9d027d04a9659f72d2dba93c3b6c6ac8c36c8a975a801","observation_id":"55a8788b-0835-4659-9352-4f515b8de2c1","resolution":{"observed_at":"2026-07-05T11:41:02.400625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9994.377001","doi":"10.1145/3769994.3770015","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 25th","venue":null,"work_id":"0791b90e-bdd6-4efd-98e0-569ad003b8d4","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a6db3b25738de29a77cec9d404919ba94c1da74d016347b1896582cddfbea9b9","observation_id":"023f7476-abc1-458b-a0ef-155460ed55fe","resolution":{"observed_at":"2026-07-05T11:41:02.416629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0602.2023","doi":"10.1109/asew60602.2023.00016","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"a7e04c66-4f46-4ea4-8ca2-61c22ac8e3c8","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:bf3419e3374b6a5a4d7ac21f775543b367f1736f78c5de5d3ee1172d9c00b7a4","observation_id":"d7c66e1b-85f4-45c6-b958-96af2217fdc7","resolution":{"observed_at":"2026-07-05T11:41:02.356011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.222943Z","title":null,"venue":null,"work_id":"e9cf8577-2742-4be4-996c-8eeeda8a6c49","year":2011},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:4c2dbfe4538850c5217cdd7ee4d18c55ffa5f643c5868752fc074059386cdc3c","observation_id":"163ab527-0323-4051-af99-784010c9b08e","resolution":{"observed_at":"2026-07-05T11:41:03.224282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.infsof.2009.02.001","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hannay, Tore Dybå, Erik Arisholm, and Dag I","venue":"Information and Software Technology","work_id":"73d81b25-92d9-40e2-a6a8-49b5bc53e165","year":2009},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:fae2f3e01f139d4d493223d4ebdf66849aee953a7d4854c7de06e901169c9724","observation_id":"149d85b0-7e5a-4397-80da-4c849f4e890d","resolution":{"observed_at":"2026-07-05T11:41:02.446566Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.224918Z","title":"Hart and Lowell E","venue":null,"work_id":"337af856-c799-4824-a954-a50835f258ab","year":1988},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:4c081362207a7c64302bd52f211bfa00d3fc41ae79653ca17af4b063b986e6df","observation_id":"383e726e-d2b9-4d4b-8437-40474a12fd62","resolution":{"observed_at":"2026-07-05T11:41:03.226172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3408.2022","doi":"10.1080/08993408.2022.2039504","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Computer Science Education","work_id":"0730e10a-007b-4bed-a96a-c4d573d1f2a2","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:27928300535975b834be3cf7801dc16a015245f6e7affe98aa0dab97a17bcf31","observation_id":"ba065d91-7c90-48dc-8e98-a9deb0ba14a2","resolution":{"observed_at":"2026-07-05T11:41:02.316376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.231006Z","title":null,"venue":null,"work_id":"a7ecf0ac-549d-4db1-8d17-4080fe4dd8bb","year":2016},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a64c4b846daa2f6c229c5ec5c6fe24bc9d07bd5cf3184bb65c43caac3b4da8aa","observation_id":"319d82e4-5e42-4a11-93c1-ed0cf882bb53","resolution":{"observed_at":"2026-07-05T11:41:03.232390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4363.372902","doi":"10.1145/3724363.3729024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"97b68c94-31fd-4578-b652-7a2cd141922a","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:47a9aa445a0145ec08b904a6170522cc4fd036153e3a8a3f8e6eb3b9c5472629","observation_id":"52a7400e-6567-4a2f-8e55-e3887ce675d7","resolution":{"observed_at":"2026-07-05T11:41:02.469565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6243.363624","doi":"10.1145/3636243.3636244","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"https: //doi.org/10.1145/3636243.3636249","venue":null,"work_id":"3c2ce779-f5f4-4742-9f9f-a33a83f28759","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:0de34a3117a1ac056b458bae5fd798990476dbfd46f5622037ad5c156ea67764","observation_id":"b30999ef-a18c-4893-a593-6c199ed53e62","resolution":{"observed_at":"2026-07-05T11:41:02.466558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8600.1996","doi":"10.1080/10618600.1996.10474692","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Journal of Computational and Graphical Statistics , publisher =","venue":"Journal of Computational and Graphical Statistics","work_id":"9688233d-e128-4b0f-8a72-9101f6c4a7b9","year":1996},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:35f7ace35cee94b2dd19a3a8a5d51fd109cf240ade421b20acbfd266bf91e276","observation_id":"2a3d832c-bc84-425d-8159-a8d13f76bbc7","resolution":{"observed_at":"2026-07-05T11:41:02.385593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:19:05.89809+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:19:05.89809+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9694.377112","doi":"10.1145/3769694.3771124","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Premature","venue":null,"work_id":"11d8c6bf-ff58-43f5-83f2-29b654ac2c50","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:cc0b194720b4592f28b849ce309c2cb3e54db4d8e490532bfca0947da0081683","observation_id":"ae53793d-4913-451c-90a1-64b05c1dc342","resolution":{"observed_at":"2026-07-05T11:41:02.397733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7927.353280","doi":"10.1145/3527927.3532801","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cracking the code","venue":"Creativity and Cognition","work_id":"435cd577-4eb8-4ba4-b823-449038111fb8","year":2022},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ab9ff5ea548d445bfd9f18834e1e7de51e98eff44046a2e03b683a4f8755cdb7","observation_id":"e971f1d6-91df-414c-9833-18c8723916cd","resolution":{"observed_at":"2026-07-05T11:41:02.367030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/app14104115","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Applied Sciences","work_id":"20ee459a-761e-46b2-8807-bd603d01f761","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:acbfed8fa25273489e8cff15ab78643f713771192b3eced9eb274c54563865dc","observation_id":"a7142a55-91c6-4fda-916d-7420dd5a8e18","resolution":{"observed_at":"2026-07-05T11:41:02.474406Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2652.374422","doi":"10.1145/3702652.3744220","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttp://dx.doi.org/10.1145/3702652.3744220","venue":null,"work_id":"cb280e32-6e88-457b-96f8-24037de2bffd","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:c5dda23e6d9fefb9e0c46f3269ee3234f4c1dc23009acfbdac81da7f80f4ed8a","observation_id":"9d91b8ab-a5bc-4988-9692-28aa4d96fbd7","resolution":{"observed_at":"2026-07-05T11:41:02.359378Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4548.358091","doi":"10.1145/3544548.3580910","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ericson, David Weintrop, and Tovi Grossman","venue":null,"work_id":"d5a95498-18e9-4b72-86d9-4711ce3596b4","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:201849f320ea9d164d80b3aa161e062ccfb9db2715d74a676d8611a8699b12ca","observation_id":"baa03abe-be5f-4b06-b10a-c0194ffe1590","resolution":{"observed_at":"2026-07-05T11:41:02.443854Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-15T00:21:56.178792+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T00:21:56.178792+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1802.363180","doi":"10.1145/3631802.3631806","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What skills do you need when developing software using ChatGPT? (discussion paper)","venue":null,"work_id":"7659c084-8bf8-4866-9606-c6e2fc3e7d3f","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:e8df862bb671f4530783f966dca1d25c107e582785532bb37b59bb8683a70a62","observation_id":"a85622de-5b81-4c10-a47f-03b2ac22bfb4","resolution":{"observed_at":"2026-07-05T11:41:02.449538Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:49:54.339445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:49:54.339445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3904.364277","doi":"10.1145/3613904.3642771","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wong, Steven Jackson, Sabine Junginger, Margaret D","venue":null,"work_id":"87155e09-fcf0-4dee-a362-65f94f44b1e6","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a8300cbbfda86224a953479a9aa6976147d0d565d17d0852f87b32333a8048b9","observation_id":"2d91fa8e-116f-46d4-bad2-633714130135","resolution":{"observed_at":"2026-07-05T11:41:02.472497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.255365","doi":"10.1080/0142159x.2025.2553658","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Academic performance and progression among near-peer tutors","venue":"Medical Teacher","work_id":"3a22c7aa-4450-4374-9f06-dd9af43faeca","year":2026},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:1f7f5f375f8b99217f0188d9c76a440ff5437f37013937cc8f8c42ed16d3d1a5","observation_id":"ec01aaa2-057f-488a-9022-915b3c449ef8","resolution":{"observed_at":"2026-07-05T11:41:02.411160Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1764.344565","doi":"10.1145/3411764.3445650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Herbsleb, Alexandra Holloway, and Scott Davidoff","venue":null,"work_id":"5e2124e0-ed49-48aa-b934-e5bf9c9fead0","year":2021},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:61c1794cffcbfb3b6b6788a1ab995d0fc7db9fb1ac889deff67d0d993a88c527","observation_id":"e2081897-4bfa-4cd3-9f0c-94bf418d0722","resolution":{"observed_at":"2026-07-05T11:41:02.419209Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7503.360812","doi":"10.1145/3597503.3608128","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liang, Chenyang Yang, and Brad A","venue":null,"work_id":"63f2d17f-5bb1-4c99-a332-29e7459afbe5","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:87665765ad927407332b0aaea774b1fc0b3c25617a8cf6e3b792537d6eab3e9a","observation_id":"421527f6-e59a-47ff-a537-29c608c08eb0","resolution":{"observed_at":"2026-07-05T11:41:02.346527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-20T19:52:52.149931+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T19:52:52.149931+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1802.363183","doi":"10.1145/3631802.3631830","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the 23rd","venue":null,"work_id":"f4908541-1bfc-477d-93a0-e0032636218c","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:ddfd8d108969ed0ef95345a374613401f21650941081872068baace0021a1c29","observation_id":"e9a50cb0-20f0-48d0-89f5-b490c7e224f7","resolution":{"observed_at":"2026-07-05T11:41:02.421747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8205.372954","doi":"10.1145/3698205.3729544","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"732ba6dc-d284-4485-a6da-81fe871c19d0","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:37306c85c74a86b971f99cedc32183b9eb894d0ea63fec20770d244f068f7b48","observation_id":"9b01da40-41b7-4370-a65a-e20e457f30fe","resolution":{"observed_at":"2026-07-05T11:41:02.379422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/jae.2969","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MacKinnon, Morten Ørregaard Nielsen, and Matthew D","venue":"Journal of Applied Econometrics","work_id":"7c4740fd-373f-4460-9ef9-e81e4f69ff5c","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:b446676afb081996397dc642110fb8c02b9f8f33733021786012095740a5b5d0","observation_id":"a81e43dd-16ed-4a1d-85ab-c845edc16323","resolution":{"observed_at":"2026-07-05T11:41:02.376346Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9217.365362","doi":"10.1145/3649217.3653621","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Margulieux, James Prather, Brent N","venue":null,"work_id":"5e34f5c1-23f4-421f-bc97-ee2749a86054","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:76fdea161f210a8e4d321cc68af0e95f2e879879bc449252aac61fe8239bb447","observation_id":"a7b0c9f9-04f5-4678-9a88-777e9ebd4ee5","resolution":{"observed_at":"2026-07-05T11:41:02.332325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7503.363918","doi":"10.1145/3597503.3639180","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hellendoorn, Bogdan Vasilescu, and Brad A","venue":null,"work_id":"43b6b197-bcce-457b-b58b-3fe570b220b6","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:99902aea0d4f0691dee8eabf418a03486f12b4b21a3fad485188dc990e72f44e","observation_id":"22760f8b-8ef8-4b7e-a478-0b075725425a","resolution":{"observed_at":"2026-07-05T11:41:02.458633Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T22:52:57.600285+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T22:52:57.600285+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.218657Z","title":"Akilan, P","venue":null,"work_id":"d93b0ea7-e647-4a63-b656-2f6ec8efcfc4","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:9418e3d9c7f037dcc104db3b0f7c5eafadd21cb201444b51b3d956c7c92d47dc","observation_id":"771733b7-4898-490f-8cb8-60a7eb40eda9","resolution":{"observed_at":"2026-07-05T11:41:03.220133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.216755Z","title":"2021.The Extended Mind: The Power of Thinking Outside the Brain","venue":null,"work_id":"a2278e20-1b3a-4926-8d67-e3c00235ee93","year":2021},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:9187361ccfdb4985f4dc4b766005db9364dd4491c3487b43c6bde69389d77105","observation_id":"daa5fa44-a4da-4f9f-99a1-8cda56f5a257","resolution":{"observed_at":"2026-07-05T11:41:03.218105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10648-006-9029-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Educational Psychology Review , author =","venue":"Educational Psychology Review","work_id":"e3e38a34-2b09-4044-b8cb-4e25c7fae026","year":2006},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:b03e44e5235b2d2958b70e9789fdb5ec72123cdef3b322c6f374f45229202f9b","observation_id":"735809e6-c1ea-45f9-9516-3b979cf665ef","resolution":{"observed_at":"2026-07-05T11:41:02.435161Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10648-024-09909-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Educational Psychology Review , author =","venue":"Educational Psychology Review","work_id":"7a5d1113-2bd5-452d-bb71-e416a3323423","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:61f1b844b1c30bf624adeac941e16227d9aaf4f959afe2d75bf62a3ec13cc65a","observation_id":"d967fe46-e930-4e69-bcd1-70281c6c74d9","resolution":{"observed_at":"2026-07-05T11:41:02.326630Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6181.374716","doi":"10.1145/3736181.3747165","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding","venue":null,"work_id":"d447d0af-9b99-4a80-80cf-29a4f620b58d","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a1a9d6fc49f856cad0b33ff501a77715a812c5f9ab2920131795f8c160f9bab2","observation_id":"0419d646-d81f-4ee0-b2f3-59062f74c6f1","resolution":{"observed_at":"2026-07-05T11:41:02.440847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-16T21:21:30.413494+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T21:21:30.413494+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9187.370961","doi":"10.1145/3689187.3709614","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reeves, Jaromir Savelka, IV Smith, David H., Sven Strickroth, and Daniel Zingaro","venue":null,"work_id":"99a4bdb9-a99b-46cf-a2b7-6b4ea1af22d4","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:5d150a75669cd357009938ca4117cb9ec48b792d653a74b8d67d28929a3c1922","observation_id":"39205cfb-31e0-4988-aac6-08e1431c007d","resolution":{"observed_at":"2026-07-05T11:41:02.382386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T21:49:55.74579+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T21:49:55.74579+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3617367","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"It’s Weird That It Knows What I Want","venue":"ACM Transactions on Computer-Human Interaction","work_id":"22d4f2ca-92c6-4b4e-8e7a-f79006d008bc","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:60d86c5f022e54c9125a1206fe30055a3ffc8fbcac239e181897cf97e46e39bb","observation_id":"e4111591-9e46-44ac-8b5c-0e997ca79dc8","resolution":{"observed_at":"2026-07-05T11:41:02.373644Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-20T19:52:54.146971+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T19:52:54.146971+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2620.367111","doi":"10.1145/3632620.3671112","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reeves, Juho Leinonen, Stephen MacNeil, Arisoa S","venue":null,"work_id":"a2169b10-8bb3-410a-a705-12219c064ad9","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a7074266977d45951461557037ec17394ab19001afcf129d7410b2c6ae7f24a0","observation_id":"48c765d1-c822-435f-82de-81b59bf8c4ab","resolution":{"observed_at":"2026-07-05T11:41:02.340828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1080/026999396380240","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cognition & Emotion , author =","venue":"Cognition & Emotion","work_id":"2e7debed-f4ea-438f-9068-a39ae55939ed","year":1996},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:5b78e3ef74e90714dc91661988648b21d9d9f74a3f92d349f46185930355f320","observation_id":"98087de8-36d0-4238-948b-493503f05a08","resolution":{"observed_at":"2026-07-05T11:41:02.413726Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1641.358403","doi":"10.1145/3581641.3584034","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ross, Fernando Martinez, Stephanie Houde, Michael Muller, and Justin D","venue":null,"work_id":"e56ff959-2b3e-4a23-b088-0dccb3bf22f0","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:c3a3455de10cf1266a44e8ba722afeacbe41a5d1d2063be23fa0f7129c1c6939","observation_id":"1994bde3-64e6-4549-b8a9-39b4e4324fbe","resolution":{"observed_at":"2026-07-05T11:41:02.433072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.220710Z","title":null,"venue":null,"work_id":"6e871bf5-ae10-4b8a-b8cb-4f57db645aaa","year":1980},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:4333c4882f400f7d2cf07b99572e85b905dd549f519d1f013fc01e8aea260f0a","observation_id":"24e4dd69-1018-415f-98b9-5940d4e09534","resolution":{"observed_at":"2026-07-05T11:41:03.222238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tse.2010.59","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE Transactions on Software Engineering","work_id":"55aeff68-daa3-4c2f-a65a-ee47189db73e","year":2011},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:85d178bd146a37e7d39eafcf3a52f8ccbbb6f75a101bd5aa37bfec5a66f96d7f","observation_id":"10c05ccf-d5f0-46cb-81ab-03bb065c5e35","resolution":{"observed_at":"2026-07-05T11:41:02.424588Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/cogs.70061","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sharpe and Ian Tyndall","venue":"Cognitive Science","work_id":"15dfab54-a8d2-49f1-b6d8-1890878601f2","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:7e29132653ff81916c85d14b52ee9c35fd30a301eef1b568c0cad5afd4ef3ad7","observation_id":"f0e805fb-a0bc-4b29-8312-df5b2abf37df","resolution":{"observed_at":"2026-07-05T11:41:02.352769Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3628162","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"ACM Transactions on Computing Education","work_id":"75dcfbd7-d7b9-4d31-b83d-a518fc0343d2","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:e3eac3cfabb64a1eafbc2f87e2de2027715f6722f3ce6bf10d518e335d2f893d","observation_id":"c552b037-fdf3-41dd-89f8-2dd7bc335601","resolution":{"observed_at":"2026-07-05T11:41:02.408191Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.58680/ccc198015930","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Revision","venue":"College Composition and Communication","work_id":"9aee191f-3f16-4882-b1a8-aa2feb2a4954","year":1980},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:676c0d6554e290ccf9f1b0fece8e2c73f051154d726a1c8d95235ab67a613539","observation_id":"6185c5de-c4fb-49a8-a6a0-568dca671dec","resolution":{"observed_at":"2026-07-05T11:41:02.312590Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.58680/ccc198215854","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Responding to","venue":"College Composition and Communication","work_id":"31d2fd9b-161b-421c-9827-7c36856a72b6","year":1982},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:17067eb7e90278d1a35d4f9c194aa2e695290d452604b827af5bad7d631963e4","observation_id":"a1381a29-233c-46b7-bd7f-f204ce2f0a46","resolution":{"observed_at":"2026-07-05T11:41:02.460628Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.202789Z","title":"Son and Rajiv Sethi","venue":null,"work_id":"275644e6-ca4c-4573-957c-1166babffad8","year":2006},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:fbc548987fb8309e57537629b012526c8eae7c48ca302bf4e7e49aa426c6b51d","observation_id":"7df82942-9bcd-4ce9-9cc6-fcd11f1a357e","resolution":{"observed_at":"2026-07-05T11:41:03.203858Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2782.340628","doi":"10.1145/3372782.3406281","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":null,"work_id":"2ed4d620-0fd1-4ebb-8270-6e5fed1152a7","year":2020},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:4bd8f1a17cae6bd102c6ecb26b18bcdc18684ad3f7b36909ff4d603bfc41c47d","observation_id":"6fc586ec-5a2c-485a-9a00-e8815c29e64d","resolution":{"observed_at":"2026-07-05T11:41:02.477037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.204441Z","title":null,"venue":null,"work_id":"ca9b7e0c-8657-4631-b877-2d455960dcec","year":2011},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:d85c881c04a5c1fad8fe5281520c4ddebd0cc719927387135baa4287f2a0c663","observation_id":"5f24196b-d3db-4bd4-91e1-4ae2f42f54c1","resolution":{"observed_at":"2026-07-05T11:41:03.205622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.208003Z","title":"Ritzhaupt","venue":null,"work_id":"7669ec89-c583-4b10-9fb1-6bb719e3a3d2","year":2017},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:2d53ca45c3e4326d2dff4eeabccb1932b3c7e762befc0fc3c32d31296cc079f8","observation_id":"05d56f7e-5bc9-4bd2-8cbc-d97632aa0a45","resolution":{"observed_at":"2026-07-05T11:41:03.209128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9217.365358","doi":"10.1145/3649217.3653584","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith IV, Mounika Padala, Christine Alvarado, Jamie Gorson Benario, and Leo Porter","venue":null,"work_id":"5c8f73b0-263b-465f-9fa9-32e61625b311","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:a5ee9ac06ff37eff5300dc1893e367d14ba12ef2f624a23aff305f45470023fa","observation_id":"23d2072b-f1d8-4ff5-9886-fe1b10e966ab","resolution":{"observed_at":"2026-07-05T11:41:02.320437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-21T03:52:59.987018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T03:52:59.987018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8846.2023","doi":"10.1109/icsme58846.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Palacio, Dipin Khati, Henry Burke, and Denys Poshyvanyk","venue":null,"work_id":"2c79d8dc-be8b-4e20-80a6-f50e134150b3","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:5b55f69f5e3adc78464f1867f65458eb5b330ab187d7dc8987fc80d9c886f39c","observation_id":"7cc10e45-e17a-43d4-b441-909d82aa1162","resolution":{"observed_at":"2026-07-05T11:41:02.363090Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:56:43.833596Z","title":"Vygotsky","venue":null,"work_id":"db10827b-d566-4156-9a63-ea265ca7df56","year":1978},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:aebcedd19085701b17222255b85c11f57eb127c7bea1c14795ffacdc0ac76b72","observation_id":"4ce3d9c7-9ac1-4a19-9a0c-ce8c5b58a34a","resolution":{"observed_at":"2026-07-05T11:41:03.202026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/caje.12661","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Canadian Journal of Economics/Revue canadienne d'économique , author =","venue":"Canadian Journal of Economics/Revue canadienne d économique","work_id":"8308e247-f7cc-4e1a-9617-27ca6e445067","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:58089dee2adecfeda0865b45f64cdb35b834e91751e8f4db5f0396f99d131abf","observation_id":"17d4abc3-5ba4-43d7-8e9f-9c4f651b0bf3","resolution":{"observed_at":"2026-07-05T11:41:02.328991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3397481","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Weisz, Michael Muller, Michael Muller, Michael Muller, Stephanie Houde, John T","venue":null,"work_id":"47c00851-ee9d-48cb-a251-fa694c6f1ba5","year":2021},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:f99f3ea5a11545a4624a82197bc4f1450b56478c08bd0484ff4be0ea8b0dc03f","observation_id":"7d0497c0-46c1-4eb9-b3c5-2f2e98b9fc58","resolution":{"observed_at":"2026-07-05T11:41:02.343434Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T16:19:24.245793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T16:19:24.245793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9474.364007","doi":"10.1145/3639474.3640072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bai, Robert Tairas, and Yu Huang","venue":null,"work_id":"d7007f7b-1530-49bd-ba65-0181cd91e5dd","year":2024},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:0d98708368effec96bec00bfd5ca06ef8a75d18d73cf183e686309354b520196","observation_id":"3c977074-45d5-4263-bca4-20a06d3a8105","resolution":{"observed_at":"2026-07-05T11:41:02.452171Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.190810Z","title":null,"venue":null,"work_id":"68ce39e7-136e-48ce-a7ef-0bde7e64f29a","year":2022},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:587af145d43b7b8bd8e44647200b8eb63abb1bd6dd7eceb139de323d042e1aed","observation_id":"4c65db95-f400-4ef5-aace-741d7d52693e","resolution":{"observed_at":"2026-07-05T11:41:03.193000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.100147","doi":"10.1016/j.caeai.2023.100147","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Computers and Education: Artificial Intelligence 4, 100147 (2023)","venue":"Computers and Education Artificial Intelligence","work_id":"665514d6-5af0-4001-a601-4a15f44b14bc","year":2023},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:3b32c76b262e726ea79f544c4b9a3b49b38910be353907975f46487f7916af81","observation_id":"3769bb30-1b59-473c-8717-0c4b3c979fe8","resolution":{"observed_at":"2026-07-05T11:41:02.429963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-25T23:53:29.141495+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T23:53:29.141495+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.193566Z","title":null,"venue":null,"work_id":"2bc0e026-be7a-46fe-ac74-727270ac6992","year":2004},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:8ad745f89cd2f9ec8aeb9918a27d29d42ec652a7a64ebed4bb492c0199910a6c","observation_id":"03868288-85cf-4601-9fca-5fa4c6755a98","resolution":{"observed_at":"2026-07-05T11:41:03.194852Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.195414Z","title":null,"venue":null,"work_id":"6894c837-0ee9-42b8-ad23-7d51c9ecc310","year":2002},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:3b9b9ce4a2d946752f5250e5df9a053f8c94925eab8b05b69887d7149874079a","observation_id":"9928fab6-acdd-4dd3-a317-b7187a492ced","resolution":{"observed_at":"2026-07-05T11:41:03.196597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:03.213014Z","title":null,"venue":null,"work_id":"ff9607b2-41eb-425c-81e0-f19fa117a41e","year":2020},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-05T11:34:21.873504Z"},"links":{"citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:5cab62160fa3c079c4be243ca4d17e3cee02d9cc754c77a8539c6fbda520baa9","observation_id":"3ebe1615-dad2-41db-aba1-bdc6e3ec064d","resolution":{"observed_at":"2026-07-05T11:41:03.214235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":15,"verified_exact":44,"verified_fuzzy":11},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2604.18530."}