{"as_of":"2026-08-05T06:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85e2bfd0e5599614af087378e34472be60bb0e4622c82945a0e91fa9aedbe13b","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:53:02.820543Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:36:23.165454Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.677897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-08-04T10:36:23.165454Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09517","last_updated":"2026-07-02T09:56:45Z","snapshot_observed_at":"2026-08-04T10:36:20.713563Z","submitted_at":"2025-10-10T16:28:43Z","title":"StatEval: A Comprehensive Benchmark for Large Language Models in Statistics","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:36:23.165454Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2510.09517"},"observation_digest":"sha256:9cf4b60525e25f478b28820251fabfb888b281b4b2e1b3e4ddf650f8acceb1b4","observation_id":"09f464ea-0ad7-4475-8c3d-19cd3b1ec900","resolution":{"observed_at":"2026-08-04T10:36:23.165454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.12632","last_updated":"2026-04-14T12:03:17Z","snapshot_observed_at":"2026-08-03T05:40:03.205960Z","submitted_at":"2026-04-14T12:03:17Z","title":"Calibration-Aware Policy Optimization for Reasoning LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T15:40:24.396851Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.12632"},"observation_digest":"sha256:ede3e8b227ff23313ff1a4bea221872faa6887a685d90b7a32959ec6a9728d67","observation_id":"93ca5813-c903-41f5-8c9b-4dd664148796","resolution":{"observed_at":"2026-05-11T10:06:01.061297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:31341a3b0a4574d608cbf329c50a4b57243b1337eb289cb1cda7e11aef44c484","observation_id":"c50ad9dd-2bad-4881-a5e8-43369204a2e7","resolution":{"observed_at":"2026-05-10T05:36:01.999728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T07:00:32.206081Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:ecb0f3477ab8a65fcf9e85afd3e8eeb89ecfd4d1c2133456149dc5938c576135","observation_id":"45a82209-4970-43e8-9141-2cf073ebb7ec","resolution":{"observed_at":"2026-05-12T10:11:28.843337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T23:47:53.282259Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:dfc7eb3888d9389cd767748677dd856d806857657435abb65f9ba0a2dbc22f17","observation_id":"368f6c5e-2403-4604-9882-89a8c77393e9","resolution":{"observed_at":"2026-05-20T23:49:14.899678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:b7790ddf25f47e0e16aae8746b814e75ce067eef0085aab079d817cc29a1536b","observation_id":"236cf7f9-3abe-43d0-8427-5a59be816a68","resolution":{"observed_at":"2026-05-12T06:06:25.142345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:fdc7c5e8a79494d70116a4434de87038f63494d6c02e6ebab84bdd014d4f8d66","observation_id":"9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3","resolution":{"observed_at":"2026-05-12T06:01:24.281809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-02T08:39:07.747479Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:a1e508f06ab1880675af56628bb5733640e8978879a3e0353bd460954bded700","observation_id":"3039b200-07d3-4b2c-a9be-e5fcab8a40e4","resolution":{"observed_at":"2026-05-13T01:57:06.101531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.05800","last_updated":"2026-06-04T07:29:43Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T07:29:43Z","title":"SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:53:22.159132Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.05800"},"observation_digest":"sha256:dd035cc218c8a13ac251393bfc7a31a7e2039edcf70b5c60312262a51b10a229","observation_id":"1358ee36-5a8f-4a5b-a9b9-66951295ece0","resolution":{"observed_at":"2026-07-02T11:46:56.173296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:7dfc820ef86fb3d8ce2c2fe39bd180547d888a5bea91c45cdb7d6432c3148635","observation_id":"92d15d31-edab-49ac-955e-6afb9bba302f","resolution":{"observed_at":"2026-07-04T07:59:40.656115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.24994","last_updated":"2026-06-23T15:51:39Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T15:51:39Z","title":"ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T00:23:16.499175Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.24994"},"observation_digest":"sha256:1ca3e30a16e6da2022f75d6246ad274eb97b844692bbb71a76460977f25dbc6b","observation_id":"59aabf2b-ef39-4e89-967b-6d107da89b62","resolution":{"observed_at":"2026-07-04T16:39:57.679442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09675/citation-record","integrity":"/paper/2509.09675/integrity","json":"/paper/2509.09675/citation-record.json","paper":"/paper/2509.09675"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-07-06T11:43:15.244747Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-04T18:53:02.597599Z","title":"A survey of exploration methods in reinforcement learning.arXiv preprint arXiv:2109.00157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.597599Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:d6eb251fd1d2af434c64f23a23a9a6931eaf9f911e311f30441614ba5580e8b3","observation_id":"7c8d4574-d36e-4a66-9513-d4dc796d50d7","resolution":{"observed_at":"2026-08-04T18:53:02.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.820543Z","title":"std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.820543Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:fe2b2ef42fb5f9542692e0d3eaabd2c9ec308b826c6260053805e8a23851af74","observation_id":"7086f6d9-3732-48fc-84fc-8e693773f390","resolution":{"observed_at":"2026-08-04T18:53:02.820543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.813713Z","title":"Qwen3-4B-Base-GRPO","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.813713Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:35120f95c240f45817d74c702b95602775488b72c95d12d69c6acda506dd2923","observation_id":"5aa8ec28-2077-4742-851a-d95c0b788c38","resolution":{"observed_at":"2026-08-04T18:53:02.813713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-04T18:53:02.638102Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.638102Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:fc5790a6ddee20501b082f4d393dc49bbda2115c6d3a1d6d97dc8b8f992f44af","observation_id":"e18ab364-7475-43b4-9f0e-aa8b67c2eb79","resolution":{"observed_at":"2026-08-04T18:53:02.638102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03714","last_updated":"2025-07-07T04:11:47Z","snapshot_observed_at":"2026-07-06T21:04:28.540046Z","submitted_at":"2025-03-28T16:23:59Z","title":"Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03714","snapshot_observed_at":"2026-08-04T18:53:02.644861Z","title":"Breach in the shield: Unveiling the vulnera- bilities of large language models.arXiv preprint arXiv:2504.03714, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.644861Z"},"links":{"cited_paper":"/paper/2504.03714","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e6755f96f9f74473fbbae2e68f1dc57cc5a2f875dc3f5ed66387227b40422c8d","observation_id":"6747d781-40bb-453b-a586-a9ba2a630f5f","resolution":{"observed_at":"2026-08-04T18:53:02.644861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-04T18:53:02.672697Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.672697Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:a12c2c3505356b6e8b802c67ecd8378942fba6b013a635e9fc787b384d2c5e5c","observation_id":"b7a85f9e-f9a8-4575-8593-467edb25e281","resolution":{"observed_at":"2026-08-04T18:53:02.672697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T18:53:02.690293Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.690293Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:525f9218a4d92b22ba4254266ad310b62f8b87a7730c20b3e3338172dfb8d448","observation_id":"edf8c7ba-09fc-4dea-9987-691406fe9548","resolution":{"observed_at":"2026-08-04T18:53:02.690293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T18:53:02.696442Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.696442Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e94b8140618673b841d547332e585ebfa2cc82233fce8758621575e16d1ae5f1","observation_id":"82224b45-c9a0-41ba-b27b-66d47ad1791c","resolution":{"observed_at":"2026-08-04T18:53:02.696442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-04T18:53:02.713848Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.713848Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:bdd8f36ad1fe840c74f19ebb3c32e9be1419488b49f8b02810ceaf1d0d5f9945","observation_id":"a6d24b4f-2202-4ed8-8b6c-22d35406aa26","resolution":{"observed_at":"2026-08-04T18:53:02.713848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-04T18:53:02.719173Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.719173Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:c0263cf42bbabacffd6c90ceea0bdaf0acef29553e08b1a2aee63479acd5c568","observation_id":"90686f68-f452-49b0-a015-954971bc96dc","resolution":{"observed_at":"2026-08-04T18:53:02.719173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T18:53:02.725388Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.725388Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f6ed550fa8e0ade4ad21d87dfff49f061960d80bb3b22c8b26583a51ebc60eca","observation_id":"c3fe07f1-8719-4bc0-9cad-4ef046aac618","resolution":{"observed_at":"2026-08-04T18:53:02.725388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T18:53:02.730852Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.730852Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:79008527ba1abb6805bed5005955f28da2b57ba1b596a1ec7f146fbe26f4b017","observation_id":"0d2781dd-027f-4a65-a4c0-b329ef2326e0","resolution":{"observed_at":"2026-08-04T18:53:02.730852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.736661Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.736661Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:a24a0082a44d8ad0e6e5edba966f296cd6688cf7bd822694d01d572947653336","observation_id":"85d9f907-6cf2-486c-9306-6d340ed9c89a","resolution":{"observed_at":"2026-08-04T18:53:02.736661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08819","last_updated":"2024-06-27T16:30:32Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-02-20T04:13:48Z","title":"Thermometer: Towards Universal Calibration for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08819","snapshot_observed_at":"2026-08-04T18:53:02.742636Z","title":"Thermometer: Towards universal calibration for large language models.arXiv preprint arXiv:2403.08819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.742636Z"},"links":{"cited_paper":"/paper/2403.08819","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:34bf0599c8249557fa326fa096bb21f50dd0d589e9dc38b07387b4e1f4f511f0","observation_id":"5f4aa9d9-897b-4962-9273-2271b2e68222","resolution":{"observed_at":"2026-08-04T18:53:02.742636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-04T18:53:02.748248Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.748248Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:ae6129e16d957720ceb1ab11ed198c06d08295b7ca475128b2874fa628880cb1","observation_id":"555c6c82-7c77-4038-a2f9-43400cb59813","resolution":{"observed_at":"2026-08-04T18:53:02.748248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00320","last_updated":"2024-06-29T05:14:04Z","snapshot_observed_at":"2026-07-06T18:38:50.347241Z","submitted_at":"2024-06-29T05:14:04Z","title":"LiteSearch: Efficacious Tree Search for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00320","snapshot_observed_at":"2026-08-04T18:53:02.763705Z","title":"Litesearch: Efficacious tree search for llm.arXiv preprint arXiv:2407.00320, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.763705Z"},"links":{"cited_paper":"/paper/2407.00320","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:0280b22fe2eb2f3f4298a3a1ac694ccf9b9f6412ed447a75664330ecfe13c5fb","observation_id":"f22aacd1-a65f-4627-9d38-08d962735cec","resolution":{"observed_at":"2026-08-04T18:53:02.763705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06508","last_updated":"2024-10-09T03:20:02Z","snapshot_observed_at":"2026-08-05T03:22:34.062603Z","submitted_at":"2024-10-09T03:20:02Z","title":"Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06508","snapshot_observed_at":"2026-08-04T18:53:02.770333Z","title":"Towards self-improvement of llms via mcts: Leveraging stepwise knowledge with curriculum preference learning.arXiv preprint arXiv:2410.06508, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.770333Z"},"links":{"cited_paper":"/paper/2410.06508","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:9d8ac58711949c3c700f1ef7c187bd5e12810b7c1a3ab8c4365862bbca87f1e0","observation_id":"beefff04-48de-4cf9-b381-03c75111e970","resolution":{"observed_at":"2026-08-04T18:53:02.770333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T18:53:02.782542Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.782542Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:247d7a2b05e784bef5494812e53c3b38e50785f0e2684470571d67566d512ae6","observation_id":"c00dd1be-6d63-497a-aaf2-83d01e19e1ec","resolution":{"observed_at":"2026-08-04T18:53:02.782542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T18:53:02.789262Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.789262Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:943c5be6b64f26f6dd21999c1588c3b836cd1ebab86de9032080ba1cb854f355","observation_id":"14604fba-6511-4875-b9b9-6e734e0d09cb","resolution":{"observed_at":"2026-08-04T18:53:02.789262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T18:53:02.795969Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.795969Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:2162eeae1d6659627c504f8a23d7033c7c15a6b5435d9e5e3a231e8b2e23c960","observation_id":"785be2f1-8e1f-4b8f-86da-ff8b432162eb","resolution":{"observed_at":"2026-08-04T18:53:02.795969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-07-06T21:55:50.206625Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08794","snapshot_observed_at":"2026-08-04T18:53:02.802208Z","title":"One token to fool llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.802208Z"},"links":{"cited_paper":"/paper/2507.08794","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:3413daf1d6b95ab1cc1416160b71fc19e7d1ff39b86238fa8cd2e752aa2eced9","observation_id":"0f693e32-c32b-4e35-8cc7-c3c537d19128","resolution":{"observed_at":"2026-08-04T18:53:02.802208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-07-06T21:28:01.596548Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-08-04T18:53:02.808040Z","title":"Learning to reason via mixture-of-thought for logical reasoning.arXiv preprint arXiv:2505.15817, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.808040Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:212f812fc200900fdc1cc4841ce6916bc8245824048881bfea22e15a175c820c","observation_id":"832c0674-f33c-4253-8d81-84f819a15d64","resolution":{"observed_at":"2026-08-04T18:53:02.808040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-04T18:53:02.654971Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.654971Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:b22288123b8afda61c0766c762b6a881e9028bbb9154c8c91532e914b4df224c","observation_id":"398b7170-af66-43e5-b8c6-f39c12d228aa","resolution":{"observed_at":"2026-08-04T18:53:02.654971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-04T18:53:02.707977Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.707977Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f7055bb0f3779c1a060621b9357925cd51fd22f8b6033fa319915fdd713662de","observation_id":"b36915be-0427-4923-9bf1-971eaa09ee47","resolution":{"observed_at":"2026-08-04T18:53:02.707977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.666926Z","title":"Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.666926Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:56bd17a8873e0ef21246cc92d9e43e4ab14fabfc49b8280c9bbe74d6c538e343","observation_id":"d9bacd8f-e76d-40d2-82f6-9ca30d510465","resolution":{"observed_at":"2026-08-04T18:53:02.666926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T18:53:02.702231Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.702231Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:9f69edf0ba4d1a0274c7fc0ebd84df42f8a45641dd13bdeb5c91618585d16012","observation_id":"1c617351-2487-4a29-9d57-4246570be9c3","resolution":{"observed_at":"2026-08-04T18:53:02.702231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T18:53:02.684631Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.684631Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:ebba14486a2c6385bca4322f208802ded77527c4f0e373309c3174cd6f9aeb3c","observation_id":"12a00344-c489-4e71-83da-94b86ecbb9da","resolution":{"observed_at":"2026-08-04T18:53:02.684631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T18:53:02.630026Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.630026Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:bc882162a1a041d6e2b3b9debca426df4db5466038a31a10753e6112c18d4625","observation_id":"5d9c5d8f-b005-415a-a257-49ea048cacfc","resolution":{"observed_at":"2026-08-04T18:53:02.630026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13957","last_updated":"2026-05-16T17:37:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:56:03Z","title":"Supervising the search process produces reliable and generalizable information-seeking agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13957","snapshot_observed_at":"2026-08-04T18:53:02.776951Z","title":"Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.776951Z"},"links":{"cited_paper":"/paper/2502.13957","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:d61d5bd922026958b00446e134125f399eedac468f16fd2761f17fa95ba8d2e3","observation_id":"2fe00bae-31bc-4acd-938e-f62307b1658f","resolution":{"observed_at":"2026-08-04T18:53:02.776951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-07-06T20:24:17.280431Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-08-04T18:53:02.606163Z","title":"Online prefer- ence alignment for language models via count-based exploration.arXiv preprint arXiv:2501.12735,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.606163Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:7f67832e2a5d832be45dba96b0b448b16354f75d02cb48662169c0ec89547129","observation_id":"f0ebcc62-be89-4ba5-b101-e6d25f04a06e","resolution":{"observed_at":"2026-08-04T18:53:02.606163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05973","last_updated":"2024-03-09T17:46:24Z","snapshot_observed_at":"2026-08-03T13:53:10.794810Z","submitted_at":"2024-03-09T17:46:24Z","title":"Calibrating Large Language Models Using Their Generations Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05973","snapshot_observed_at":"2026-08-04T18:53:02.754686Z","title":"Calibrating large language models using their generations only.arXiv preprint arXiv:2403.05973,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.754686Z"},"links":{"cited_paper":"/paper/2403.05973","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:85ffb94304d48882421fe733cfbbc29cf119e26e6cfee7510da696147503ac03","observation_id":"3cdec345-3fa4-4bd6-ba62-80192386feb1","resolution":{"observed_at":"2026-08-04T18:53:02.754686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-02T03:10:09.020351Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-04T18:53:02.660976Z","title":"Deep think with confidence.arXiv preprint arXiv:2508.15260,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.660976Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:1dfb0aa4069bf7ccc3e60628b7393e6aca17f446d8ae0e671d949ddfa5fd5438","observation_id":"c8f1606b-f184-41d0-b092-a942c03e5d23","resolution":{"observed_at":"2026-08-04T18:53:02.660976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T18:53:02.678938Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.678938Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:8e50ed47aa92e321c85ab4f778f7b2c1396f17f9c463ffe1f501e747bf563165","observation_id":"7fce78d2-28a7-4bd5-b754-c5491bdec338","resolution":{"observed_at":"2026-08-04T18:53:02.678938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-04T18:53:02.613187Z","title":"Exploration by random network distillation.arXiv preprint arXiv:1810.12894,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.613187Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:74d30975128bb0ae52b9e2aeb89db5dbc773401fad584340dadf64aa7c7a3f7e","observation_id":"5a58071c-5895-4ae0-ab48-1c5826335408","resolution":{"observed_at":"2026-08-04T18:53:02.613187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T18:53:01.484898Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2509.09675."}