{"as_of":"2026-08-08T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:587d940f96a7b614a6fb352856a5da0f35cbbbc3cd6d85e5aa45e432e490a587","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:47:53.026897Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:15:59.069553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.165966Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-04T08:15:59.069553Z","title":"Rlep: Reinforcement learning with experience replay for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-04T08:15:30.884838Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:59.069553Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:8cafdf4f0c7fb72b9ab1a39f3a6d0fd55fbe1337739ab84b830fa871b0be701a","observation_id":"dac9cfc3-8c42-440f-ae91-ff827c37b32c","resolution":{"observed_at":"2026-08-04T08:15:59.069553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2604.16893","last_updated":"2026-04-18T07:56:32Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:56:32Z","title":"EasyVideoR1: Easier RL for Video Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T07:41:27.231098Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2604.16893"},"observation_digest":"sha256:d2ffbfc8387eb0cdeec91991e2a07b6430a6daca2364e6ff2b5d9b335157b2fe","observation_id":"d7f21a67-f54a-4b20-ac92-4d3c06536a5d","resolution":{"observed_at":"2026-05-10T07:42:06.748293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2604.20733","last_updated":"2026-04-22T16:20:41Z","snapshot_observed_at":"2026-07-06T23:07:25.185196Z","submitted_at":"2026-04-22T16:20:41Z","title":"Near-Future Policy Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T00:51:36.580600Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2604.20733"},"observation_digest":"sha256:270a5cec7adb68fbb486dbc456eeed7c33ba08cae941e8e5a9755df8c5e497f6","observation_id":"2092eeef-c21b-4e07-9145-e23e6f9a9eaa","resolution":{"observed_at":"2026-05-10T00:54:48.603133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2605.07331","last_updated":"2026-05-08T06:35:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T06:35:02Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T01:19:58.448344Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2605.07331"},"observation_digest":"sha256:cad5ebc41046ebf888f927514b5428e4b059bcd7d6737e936375aadf687530f7","observation_id":"a8b9d20c-620a-4815-9db1-9c01ea163064","resolution":{"observed_at":"2026-05-11T04:30:55.227343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":275,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:283f4edb2ecf4216d7184e1c685d23c9f9e802aba4301fb5f8c0fdc0b8ef60c8","observation_id":"ac6c1eb1-842d-4db9-8521-9f10ca992b96","resolution":{"observed_at":"2026-07-01T20:56:13.655426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:9dd8efd23f8044030e1477999d6ce02ad185daed467c5910d39a19329745a338","observation_id":"c4d71b5c-3edd-49e8-8ea1-e94e8cbd8310","resolution":{"observed_at":"2026-07-01T21:16:13.343127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.03087","last_updated":"2026-06-02T03:17:34Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:17:34Z","title":"Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-06-28T11:50:00.954670Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.03087"},"observation_digest":"sha256:7a476177fc3cbb57174016c235e52eb4d51c3974a115b0d1f408870b841c2377","observation_id":"7e06d7af-d662-47fa-95f4-a09215f3a59b","resolution":{"observed_at":"2026-07-02T01:36:25.002327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-08T02:18:13.870572Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:cbeadd3eaa697dc54443edc8e6c80430c20dd90cd47f6163deb1a42dc21ac17c","observation_id":"ddd15fc1-9f0d-44a3-8ea3-1575dfdde3e1","resolution":{"observed_at":"2026-07-02T06:06:41.007463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:998aad77cad6a218d378a33bb651f76fa3c2246170b22304def427a25d6a8926","observation_id":"ceee3d62-14e9-492e-b822-b47524bb934e","resolution":{"observed_at":"2026-07-03T20:48:56.024146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":261,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:6ed3791d10460eb9be30d09ddf150367dd698f089c9e3c91f0e41e554d753d74","observation_id":"08963af0-1e52-4b44-8a39-67a91b27948b","resolution":{"observed_at":"2026-07-04T07:59:40.167556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.30345","last_updated":"2026-06-29T14:20:47Z","snapshot_observed_at":"2026-08-01T20:13:14.564783Z","submitted_at":"2026-06-29T14:20:47Z","title":"DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T07:19:00.012926Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.30345"},"observation_digest":"sha256:ba2c5f4067439970ff9a7307d3787ffa1d8a30aab428b95761da5e4b9ef69855","observation_id":"cd42a4e4-5c79-42c5-b36b-22bfd527b87d","resolution":{"observed_at":"2026-06-30T07:24:21.451888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2507.07451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-04T07:59:40.165966Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":"78156f60-89d9-4f68-b818-e652a48d63eb","year":2025},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T06:52:55.368187Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:a9fcad8eb78d31d68d20ad43a9478b2ca55d0313273c58dc2126fc61bab32b18","observation_id":"6e9c4b3e-42fc-4ebd-b38b-3d63fb707d2e","resolution":{"observed_at":"2026-06-30T06:54:20.299729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-02T09:32:16.230452Z","title":"Rlep: Reinforcement learning with experience replay for llm reasoning.arXiv preprint arXiv:2507.07451, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:16.230452Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:9600828ff88f567356efc965cf28d377233197a79640682478daee6e87f26e44","observation_id":"e9e37322-2c65-4c7c-9231-098e61e842ed","resolution":{"observed_at":"2026-08-02T09:32:16.230452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-07-14T11:23:30.063231Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-14T11:23:30.063231Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:873d12478772ead23499859c1189d4be4f5e948a1788c8a0d863ea771bc03f09","observation_id":"501b1519-0b51-4cc8-9d05-ace24da922c5","resolution":{"observed_at":"2026-07-14T11:23:30.063231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-02T07:23:29.013207Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.013207Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f0e0665d6ac8a0f61fbc7599f90a4bd10a148c14838ff03f8ebe32ff4b3acf8f","observation_id":"e769e426-7214-4d05-bd84-4105242bdd2e","resolution":{"observed_at":"2026-08-02T07:23:29.013207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.07451/citation-record","integrity":"/paper/2507.07451/integrity","json":"/paper/2507.07451/citation-record.json","paper":"/paper/2507.07451"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:53.575524Z","title":null,"venue":null,"work_id":"03668f9b-0046-4bca-8e77-0909dada63d7","year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.741698Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:3074e58730a3165998359d1ffc4b99288981de85daa59fce112f67c76e124140","observation_id":"b088bdc2-b2a5-4392-a83f-8feaf9ade318","resolution":{"observed_at":"2026-08-06T18:47:53.580139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:52.863138Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.863138Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:775f06a000564c654bb6405ae6b0e9b7cd0176f80da805e1dded7975cbf168d6","observation_id":"73a3f962-c41a-4bd2-91c6-7e2c8e929205","resolution":{"observed_at":"2026-08-06T18:47:52.863138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:53.561116Z","title":null,"venue":null,"work_id":"7f44d0dd-f559-4617-bf3b-2ca0e4d0d0e7","year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.963492Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:679b7bead49c3c697aa11330786ec98c23b9a20eb9adc99fcb3ffc60d6328abe","observation_id":"e44144e7-bbef-4dc3-abaf-78aa41bf1c3f","resolution":{"observed_at":"2026-08-06T18:47:53.565275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:47:52.967896Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.967896Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:f643421695db8b6085a503d0a8f730721f4a93a062c79f464e177f4fee2f373d","observation_id":"b559eaa4-2bff-45fc-9c63-92603b92741b","resolution":{"observed_at":"2026-08-06T18:47:52.967896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:52.972497Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.972497Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:222cf34432b198d481d5175af05190ff670593370ed20dc70eede1b713d5c378","observation_id":"52e57824-a06d-481f-b04a-5e8790af495b","resolution":{"observed_at":"2026-08-06T18:47:52.972497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T18:47:52.976774Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.976774Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:03663ee53835ff1486782681378e854b20a051a38d2790f3dc8b7309700784ef","observation_id":"474fbb0d-2761-4a12-a0ba-c3bdcad7ada2","resolution":{"observed_at":"2026-08-06T18:47:52.976774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:53.545801Z","title":null,"venue":null,"work_id":"8c69dbf4-c484-4189-af9e-a4a9aa60a3cd","year":2015},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.981900Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:82a656ba454e6726fcd82fcd512a14680442fee3a2a790aab08f9fb91fe6fd93","observation_id":"9507fb39-46cf-407e-afec-818af53a1e7e","resolution":{"observed_at":"2026-08-06T18:47:53.550737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:53.528916Z","title":"Openai o1 system card","venue":null,"work_id":"78a1617b-0b2c-4180-9a16-e12b46d66d8f","year":2024},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.986066Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:88b7504094987c85ee876151d0152890e4da9c92ff19fa944cd2222010362943","observation_id":"9477c727-1f68-498f-820c-9995f14a3279","resolution":{"observed_at":"2026-08-06T18:47:53.534839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-07-06T04:37:00.543211Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-06T18:47:52.990150Z","title":"Schaul, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.990150Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:e200f5b057133afaf9b6ad51cbae42b0f610b3a1cbb9f77533e74e3329f83a80","observation_id":"4ae26289-3377-4e46-8f47-369694799228","resolution":{"observed_at":"2026-08-06T18:47:52.990150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:47:52.994487Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.994487Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:fec3eaf09488a932f5c457d5d6bc767b4844805fa693fa5e42865254d03af910","observation_id":"73bca3c6-127e-4ed5-8307-793c812424b6","resolution":{"observed_at":"2026-08-06T18:47:52.994487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T18:47:52.998807Z","title":"Sheng, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:52.998807Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:28eba317e2bf495e7635e815fdccf051c9849b01651eeb03f029d35c1a7c6816","observation_id":"953f5c33-f686-48ba-b15d-14589505cdf6","resolution":{"observed_at":"2026-08-06T18:47:52.998807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:47:53.003183Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.003183Z"},"links":{"citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:0d51d7f8843437431ece06ddf849a048a7a9d35a0159bf4d5e68b64a6d3cf992","observation_id":"89149ea1-74f9-4a6e-b5a6-fc3827d7b7b3","resolution":{"observed_at":"2026-08-06T18:47:53.003183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-06T18:47:53.007802Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.007802Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:0e7ddf21de9f1c56793cf5b9cd8a5075671669711f0c5d57e307094a5866d0e6","observation_id":"70b477f0-1efe-40e1-acb5-a0f6cbcc92b2","resolution":{"observed_at":"2026-08-06T18:47:53.007802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-06T18:47:53.012363Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.012363Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:dd9e60d92c45a3355b2cfe33858a766ef07e79560770fff25adc6d695968e549","observation_id":"d01f2037-0923-4a59-94f8-19a5ee13f10d","resolution":{"observed_at":"2026-08-06T18:47:53.012363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T18:47:53.017126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.017126Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:7283dadd5f1977307b4bd38673453dffd2e213e1f1d088efd45d129fb1acf4f9","observation_id":"a1c3d17e-85a6-4121-b93c-b096f2e75002","resolution":{"observed_at":"2026-08-06T18:47:53.017126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T18:47:53.022014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.022014Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:8e5fd092c4f65036c06a72cadeee3889cfc6795d81731f92b15122eae6fb182e","observation_id":"99272396-9262-43cf-b742-4022c013c4f1","resolution":{"observed_at":"2026-08-06T18:47:53.022014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T18:47:53.026897Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:47:53.026897Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.07451"},"observation_digest":"sha256:80d7d2912845f986150a275c934be579b13bfff7928c30c26b169f5d34b5279a","observation_id":"753b1d4b-3e9c-4d5f-b4c2-96ad20b0e56f","resolution":{"observed_at":"2026-08-06T18:47:53.026897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 15 inbound Pith citation observations for arXiv:2507.07451."}