{"as_of":"2026-08-08T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67c6b082a0276f88d87cba6d72001d4de6389751380b636ec75197b9e1f864fd","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:57:38.738111Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T04:39:03.382391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.703268Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-06T04:39:03.382391Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03194","last_updated":"2025-08-05T08:03:12Z","snapshot_observed_at":"2026-08-06T11:32:36.516059Z","submitted_at":"2025-08-05T08:03:12Z","title":"Scaling DRL for Decision Making: A Survey on Data, Network, and Training Budget Strategies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T04:39:03.382391Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2508.03194"},"observation_digest":"sha256:e042ed55d8aecc7f99148fbcdc57d41958b3b7d96499b0c0f1293c4304dc81b3","observation_id":"56a88053-8484-4f20-8e2e-d2afacf86fab","resolution":{"observed_at":"2026-08-06T04:39:03.382391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":298,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:a79cbe1a3b9be83491837cf9335b2b6c130665eea91d2b9ecaae2ee3057baa58","observation_id":"f55dcc61-54c0-42e7-b913-376652390503","resolution":{"observed_at":"2026-05-18T00:02:24.819691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.04142","last_updated":"2026-04-05T15:00:29Z","snapshot_observed_at":"2026-07-06T22:53:10.816748Z","submitted_at":"2026-04-05T15:00:29Z","title":"OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T16:46:30.674244Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.04142"},"observation_digest":"sha256:02392c030c828bd87483f9c51b5f0521b2c1fe07c01b9b268986c5a687ae8d71","observation_id":"70c6515c-dc0f-448b-9b73-832627027942","resolution":{"observed_at":"2026-05-13T16:48:02.883638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:5e8380bb7f21cfb5cb6c7e70b8cefc3b777724140018f70526d2ba114d8d3949","observation_id":"387033bb-6cb1-4f23-9b62-1a342820f39f","resolution":{"observed_at":"2026-05-11T11:41:04.087868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T04:29:21.897215Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:1a65c27a68cddd35e1c41ed129b0a971ee5290a80a9e9a113707aad8a9f3b770","observation_id":"b66fa036-e05a-4695-81bc-fef0a840ab7d","resolution":{"observed_at":"2026-05-11T11:56:13.385814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:15f4b02f5a476e5b43ee08806a34ea4638511d32c2073689ef39674689bcc307","observation_id":"6b03ad2d-f6af-45dc-92fa-3ad994e68e0a","resolution":{"observed_at":"2026-05-10T23:15:49.306961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-07T08:55:02.984200Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:8ad2949aad3991c89564e51657f487794533b71672becc9829fba05d0eb07757","observation_id":"92c5b202-9bfe-4c5c-b64a-08617c072a60","resolution":{"observed_at":"2026-05-13T05:07:17.618672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:956e8a06e4ba82629de28a8881b26e64c6bdaac572c02f51a8b715cc0bc9c99b","observation_id":"1d775364-fee8-466c-b897-6c43696ec376","resolution":{"observed_at":"2026-07-01T21:16:13.350886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":"2507.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-04T08:09:40.703268Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model","venue":null,"work_id":"3acc1af6-eff2-4ff7-9eea-ab00848acbb3","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:f69059702df8d7bea714d6a3cddbc3860f887c88ae3d2132cce8ddca35293248","observation_id":"8710f2d7-6436-4e9b-b31c-6062714716a8","resolution":{"observed_at":"2026-07-04T08:09:40.704821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Squeeze the soaked sponge: Efficient off-policy reinforcement finetuning for large language model.arXiv preprint arXiv:2507.06892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:0b38141a33106234712be7e47931f5fa2e873adec828997185f8ff4812f5bea6","observation_id":"894710be-2893-4b06-bcb2-48495fcf0ba9","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-07-14T11:23:30.063231Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-14T11:23:30.063231Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7a0c137f352e2c2d9535c9d33293f7a6747ed94c09fb441e95cc76eb44a9d60a","observation_id":"4830619b-67bb-4586-920e-a111b79b15f6","resolution":{"observed_at":"2026-07-14T11:23:30.063231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-02T07:23:28.818300Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.818300Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7b1f983f2483060aaf350a3e16eeaa0c55261acd5823b476f55becb5af553883","observation_id":"a6ba5694-badf-4fad-8793-20ff8e40f96b","resolution":{"observed_at":"2026-08-02T07:23:28.818300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-01T12:54:27.855935Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:27.855935Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:5ca1d64666afb30f3479c82e4821afafb60919fbfb3021683b519ec93038335f","observation_id":"f8a5b6de-1ab0-41b3-90ec-3cb6462a186e","resolution":{"observed_at":"2026-08-01T12:54:27.855935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06892/citation-record","integrity":"/paper/2507.06892/integrity","json":"/paper/2507.06892/citation-record.json","paper":"/paper/2507.06892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.682384Z","title":"Courville, and Marc G","venue":null,"work_id":"f7cfec2e-a9a6-44d8-8c82-166355565413","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.569907Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:58480aabc2e5bbd1e2931cee8a9488a1e8277e3ffe830d1fc99bb88b5257ecfb","observation_id":"2610c449-92c3-4237-b68f-837cb95d3efd","resolution":{"observed_at":"2026-08-06T18:57:39.685294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T18:57:38.573983Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.573983Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:603f645177e529fcf8b11421d3ba131b3328ef52baf8de87e6121a889e2c9a40","observation_id":"c77a04f0-b335-4aca-835e-cf99a9b82da2","resolution":{"observed_at":"2026-08-06T18:57:38.573983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.673457Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"dfbeab93-9a65-4ff2-a359-453bdfd8f291","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.577490Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:670cfe9721388f8b4666bc15c31b17131969d8db2d557021a1c27d480b0f966d","observation_id":"2cb985f7-c2bf-461d-b3b7-ddd22a85de4a","resolution":{"observed_at":"2026-08-06T18:57:39.676627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.580390Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.580390Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:a31bfbb09958008892564a50841a3858d950fbb8bc67bb8b77b72790392c7d6e","observation_id":"80e48911-6d5a-4f96-b991-58bd963bb06b","resolution":{"observed_at":"2026-08-06T18:57:38.580390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.583323Z","title":"Asymmetric reinforce for off-policy reinforcement learning: Balancing positive and negative rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.583323Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:adf6825414f7084818d20e9b23dc2e6891d14fbebf94f6f3e002c79b27cb2fec","observation_id":"4ad64ff2-e8d6-4a4e-8250-b65159d4fdfd","resolution":{"observed_at":"2026-08-06T18:57:38.583323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T18:57:38.586349Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.586349Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:3079af27bc743b5743dd17d60f6e36269ce2d5403e7ae8e370dfcdd7c5c3928a","observation_id":"9f0eee0b-866b-48b0-bc3d-b6799b1b46d5","resolution":{"observed_at":"2026-08-06T18:57:38.586349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T18:57:38.589705Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.589705Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:d6699500f9e2a213ee644cd68328331f0e1f861d1b19d3317872243e89c53b4b","observation_id":"c988a462-281d-4c88-acf0-f800fc8c8105","resolution":{"observed_at":"2026-08-06T18:57:38.589705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.658058Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":"4256e277-790c-436f-bb40-8cb96d77465e","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.592847Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9281fb982e85e0fec4ef63ebbe4ddcb76a60e8372a09b66f1c25a84bd130c51e","observation_id":"dfd95391-ebaf-41cc-ac93-6aefd7da941e","resolution":{"observed_at":"2026-08-06T18:57:39.661204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-08T01:11:54.830004Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16400","snapshot_observed_at":"2026-08-06T18:57:38.595495Z","title":"Acereason-nemotron: Advancing math and code reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.595495Z"},"links":{"cited_paper":"/paper/2505.16400","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:662c02955aba05887c8fcae53c52d73b8baffdaab2ecd457eea325f1100bd224","observation_id":"162c4416-8a67-4ce8-9d07-a7313e31f590","resolution":{"observed_at":"2026-08-06T18:57:38.595495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05453","last_updated":"2025-03-07T14:23:40Z","snapshot_observed_at":"2026-08-07T17:22:02.848436Z","submitted_at":"2025-03-07T14:23:40Z","title":"Soft Policy Optimization: Online Off-Policy RL for Sequence Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05453","snapshot_observed_at":"2026-08-06T18:57:38.598767Z","title":"Soft policy optimization: Online off-policy rl for sequence models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.598767Z"},"links":{"cited_paper":"/paper/2503.05453","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:49e190de7d4ba29a69b1aa43c2e6c72a204be391c47046371cf18ca2989ff0c3","observation_id":"2ea8bd9b-b671-4073-ae7e-c9bc97ee0670","resolution":{"observed_at":"2026-08-06T18:57:38.598767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.601641Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn't","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.601641Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:6d3da2d56da7df39f00b17278f2d71a6c139889dd8835b0101567fd064271dc8","observation_id":"70a7c6b4-3295-4808-be17-964e2c5f0e00","resolution":{"observed_at":"2026-08-06T18:57:38.601641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.648724Z","title":"IMPALA: scalable distributed deep-rl with importance weighted actor-learner architectures","venue":null,"work_id":"0bd6c215-3ca0-4921-b880-b1120b66a080","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.604364Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:758d46154b4bc4af3e8cdaa3e53a182c81b1360007f5d01e9947028efc83d1dd","observation_id":"393233f6-6531-4951-acab-e6f7ab0deac5","resolution":{"observed_at":"2026-08-06T18:57:39.651742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.607005Z","title":"Concise reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.607005Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:758b20cb3f25c9f9e06777b2df9837db5361464e2e72845a43056ff33892c459","observation_id":"16e72a72-22cd-4a63-95f9-04c69ebf38df","resolution":{"observed_at":"2026-08-06T18:57:38.607005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.639636Z","title":"Fujimoto, H","venue":null,"work_id":"66a0a69c-1c55-4867-be9c-6d1e6aacc7b6","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.609444Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:6d255c01649f86e7c491063b86fbcad4363862dd0821d9d6ecdafbe13125f9f8","observation_id":"ed5e93d1-783f-4001-ad8c-aa6e1b1e5aa8","resolution":{"observed_at":"2026-08-06T18:57:39.642671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.630811Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"059f7541-6046-41f8-9619-37897fd21085","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.612270Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:0d9265d22b8cdacd443b4079577c7f3d36840ff7cc487a65adeb6f4eed12dd2e","observation_id":"a900bc4e-07ba-4cc7-83f7-964739ef6ac6","resolution":{"observed_at":"2026-08-06T18:57:39.633868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T18:57:38.614872Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.614872Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:af69f16493ac4f58be39a5327ff4e5679697c8613f55ef15b21ca7265617786f","observation_id":"70b85926-1f13-48d4-84d2-16cf5324ca0b","resolution":{"observed_at":"2026-08-06T18:57:38.614872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.621712Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"55b580aa-6071-495a-ac7e-3a2d13fb8ef2","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.617608Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:d4e86a0f14fac3c63de1843f0b7f0fc8c11bd5a820f583666235811664c2473c","observation_id":"be9c56bf-41f2-45f6-b4da-2a02afdfffcb","resolution":{"observed_at":"2026-08-06T18:57:39.624855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.612422Z","title":"O lympiad B ench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"044df911-93de-44e7-bf87-71d443a50c75","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.621112Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:17ab7ac042f11e32fb2c9c64b82855b6f5d708b021ddac84172df29603aed5e2","observation_id":"12e65803-a1fd-4ef8-a8de-6ab262a11134","resolution":{"observed_at":"2026-08-06T18:57:39.615595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-06T18:57:38.623857Z","title":"Skywork open reasoner 1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.623857Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c478ad8c50eb7aa3ec1766961cd28074f2a53b7a56d992afa8faebbf014ca918","observation_id":"eac0ca50-77da-4c6d-b617-3f70d76a2fe7","resolution":{"observed_at":"2026-08-06T18:57:38.623857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.626666Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.626666Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:a1d4d269ae5fd014677072152da8ee023e0fb6c291eda2cf5e6fdaf73732a7b0","observation_id":"04b5bf4b-de32-4e61-97f0-9d47fd639b78","resolution":{"observed_at":"2026-08-06T18:57:38.626666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.597464Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"bdd1c487-7e49-4147-b99d-b648c858228b","year":2018},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.629274Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:6c9af6d34d301846fe21364a0adc2cb4477dbdb3331ffb843b96945b2024f363","observation_id":"3328c8a4-0c39-45d6-89c0-85eb10fc3582","resolution":{"observed_at":"2026-08-06T18:57:39.600557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-05T04:34:26.284207Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-06T18:57:38.631941Z","title":"Dropout q-functions for doubly efficient reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.631941Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:11dc3517748961a83df1ef59e78742897cd0c99e0c3d535d4e45ab689dd495df","observation_id":"a378b549-95f8-4ce0-962c-75f61d17b505","resolution":{"observed_at":"2026-08-06T18:57:38.631941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.588477Z","title":"Ii-thought","venue":null,"work_id":"3c1c1376-468a-4325-8482-731b8f3d4bb8","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.634606Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:692ad114eab51e804b799651f494aafccde3e509b1416f7267ad075675fcc574","observation_id":"7cfd7d7e-9d71-4916-8f80-8d1013ceb891","resolution":{"observed_at":"2026-08-06T18:57:39.591562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T18:57:38.637134Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.637134Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:f931acc4a78ca1b75ff8c41b8e970d248c49e96733039e3acff4396d00dd9073","observation_id":"683bc374-3d9e-40c1-aa52-0171f9784ca8","resolution":{"observed_at":"2026-08-06T18:57:38.637134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06271","last_updated":"2023-10-10T03:05:44Z","snapshot_observed_at":"2026-08-04T12:23:50.873448Z","submitted_at":"2023-10-10T03:05:44Z","title":"Towards Mitigating Hallucination in Large Language Models via Self-Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06271","snapshot_observed_at":"2026-08-06T18:57:38.639909Z","title":"Towards mitigating hallucination in large language models via self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.639909Z"},"links":{"cited_paper":"/paper/2310.06271","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c3b0308beacf206e31a483075a9e928f712965b2c030a98d05897e3c57bba767","observation_id":"354f7b51-4215-4f86-b33f-d8765cb4fac0","resolution":{"observed_at":"2026-08-06T18:57:38.639909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.579387Z","title":"Kakade and John Langford","venue":null,"work_id":"7fa44b20-0dfd-4886-9568-3beb8e2b1a02","year":2002},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.643545Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:772ec710d4185338bf3f6b07635b05a0f04a0c1841a687d3e18dc7c59201df57","observation_id":"381f4a2a-5caf-4152-a782-427d95387ff5","resolution":{"observed_at":"2026-08-06T18:57:39.582131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T18:57:38.646294Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.646294Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:771ea2bcb9502d211a5cd416fa0217db1b85b56afc3e234a2bef54a03f214042","observation_id":"cd2317f9-283c-4d90-addd-5786421cb595","resolution":{"observed_at":"2026-08-06T18:57:38.646294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.570302Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"035833a1-a7f7-492f-9b67-fa37dae5c21e","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.649173Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4fca7f1e4c52c4e7e5bcbb6bf7c1549bc592a8c5d0cdfe207cabcf16b9701485","observation_id":"5c9e9e1f-94cb-4ccc-8aab-1cf469a1c64d","resolution":{"observed_at":"2026-08-06T18:57:39.573429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-07T04:48:15.415709Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09340","snapshot_observed_at":"2026-08-06T18:57:38.651814Z","title":"Repo: Replay-enhanced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.651814Z"},"links":{"cited_paper":"/paper/2506.09340","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:ff3a4bdf6a4ad2ccc594ec647ae33ddd0fdac0741c352f31a4159dc0a035c912","observation_id":"9a63b81c-201f-4b0c-8e2b-08465d99b10d","resolution":{"observed_at":"2026-08-06T18:57:38.651814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-06T18:57:38.654774Z","title":"From system 1 to system 2: A survey of reasoning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.654774Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:111ea848de5b5417ba347766b3970572323b693e544a3585d1ca13528c23036b","observation_id":"1ef5b0fc-e36b-4d2a-89a9-c32b6b72ce9c","resolution":{"observed_at":"2026-08-06T18:57:38.654774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14245","last_updated":"2024-02-22T03:14:03Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T03:14:03Z","title":"Enhancing Robotic Manipulation with AI Feedback from Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14245","snapshot_observed_at":"2026-08-06T18:57:38.657416Z","title":"Enhancing robotic manipulation with ai feedback from multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.657416Z"},"links":{"cited_paper":"/paper/2402.14245","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:46b759b800c7bda84240032408dcc2f490974789694b23d5ab06888998d5c835","observation_id":"77054f07-b2a7-4362-8750-e8324c27da23","resolution":{"observed_at":"2026-08-06T18:57:38.657416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15944","last_updated":"2025-03-20T08:34:53Z","snapshot_observed_at":"2026-08-07T22:10:57.570332Z","submitted_at":"2025-03-20T08:34:53Z","title":"From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.15944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.15944","snapshot_observed_at":"2026-08-06T18:57:39.004702Z","title":"From Chaos to Order: The Atomic Reasoner Framework for Fine-grained Reasoning in Large Language Models","venue":"cs.CL","work_id":"14bc022c-e17d-4c7b-b9f5-5cd1e9cb7c7a","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.660108Z"},"links":{"cited_paper":"/paper/2503.15944","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:21500681a46ad65d5e0a8f027960e9d120d0341fe24219730bf9582229d64737","observation_id":"19eb0e03-baf4-4282-a5d3-d0a919c91fd5","resolution":{"observed_at":"2026-08-06T18:57:39.010637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.561184Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"2538f422-6308-4be5-84b6-6f1bb548b598","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.662982Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:22dae4c37c9f3c1c472a41329ace80825b13a9669290d81f10a471ff8645c1c8","observation_id":"6be53a0b-78aa-4601-aa1a-3b61d86d2755","resolution":{"observed_at":"2026-08-06T18:57:39.564114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.551335Z","title":"Reining generalization in offline reinforcement learning via representation distinction","venue":null,"work_id":"4f5f13e3-8bc5-4950-9155-2747aa12489e","year":2023},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.665803Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9f06b034614507aae2afdab4494b8c9434a8a44b6e9d4a6e9ed40d378a9aa26d","observation_id":"bf3a4479-b0c9-4279-bdc4-58d442b206d5","resolution":{"observed_at":"2026-08-06T18:57:39.554466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.541741Z","title":"Iteratively refined behavior regularization for offline reinforcement learning","venue":null,"work_id":"89d047ef-3a76-4039-b9d2-1f7bdc623bba","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.668609Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:663c0d404167d1ded4bf97830ffb7192c7bb17808d02a68b9eaa053b47d53b7a","observation_id":"b3aa58f0-4432-4700-8bd8-5d8c5fc0f2eb","resolution":{"observed_at":"2026-08-06T18:57:39.545040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.671166Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.671166Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:76aa85bcebb31dd2866a540287343c8baa8c017941906273afbc196e9b743025","observation_id":"4ade3e9f-5330-4261-b1b4-e77e1e4854aa","resolution":{"observed_at":"2026-08-06T18:57:38.671166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.526866Z","title":null,"venue":null,"work_id":"525f219f-5c0d-4690-a729-28e3b93923e7","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.673658Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:3c824207e60fb3bf917dac1d8970088e8d38c75a1233e9b701f23d0efbac0be8","observation_id":"f9a26ac5-95fb-4a62-b7a7-1b638571f434","resolution":{"observed_at":"2026-08-06T18:57:39.530203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.518311Z","title":"Cassandras","venue":null,"work_id":"a7aac142-46b1-4bc7-8ce7-baa69dd3e4bb","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.676511Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9f787a26a3d1c44b11ce9cad868c824378063a280587e9b757e1a96e531cb0bc","observation_id":"e8d6d070-020a-4d9e-a63b-1ae8a827ee77","resolution":{"observed_at":"2026-08-06T18:57:39.521394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.509088Z","title":"Speq: Offline stabilization phases for efficient q-learning in high update-to-data ratio reinforcement learning","venue":null,"work_id":"509e7d8b-6565-4c55-b5b6-1263e5ec15be","year":2021},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.679047Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:1cd319b3f103253ba790a08d394a382859fa4228a971cafd96c4d0e1281bccf0","observation_id":"9b7553c1-3787-4eb4-bf64-4a81543fe049","resolution":{"observed_at":"2026-08-06T18:57:39.512153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-07T16:54:46.428327Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-06T18:57:38.681554Z","title":"Tapered off-policy reinforce: Stable and efficient reinforcement learning for llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.681554Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:af5b0542460992712cc33acffc2d61333cc726fed20af4fd27dc5ddf7fc84cdd","observation_id":"24c1ddbc-e70b-4886-9465-ec048c185c8d","resolution":{"observed_at":"2026-08-06T18:57:38.681554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.499677Z","title":"Jordan, and Philipp Moritz","venue":null,"work_id":"d6736722-ad55-4e56-98f4-d006a59cb37f","year":2015},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.684257Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:ad38c5b277fd0cdeace54c80bca9521d45917e17f28eb2ccc081d3081ab2df09","observation_id":"4d11505c-4543-4ea3-adc5-2d9f491d471d","resolution":{"observed_at":"2026-08-06T18:57:39.502652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.490898Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":"019a3451-cc82-451e-973d-1291c91cb9f1","year":2016},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.687132Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:e0b85913e01b41394080f9c143617bd4947215b0a07c89780bb0c1c6f6f229d2","observation_id":"22f9bee0-732a-4bae-ae6d-42f6cb655df2","resolution":{"observed_at":"2026-08-06T18:57:39.493797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T18:57:38.689779Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.689779Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:804ac481ed2486b8eeba411abeba56f3e16074008ef3d14502e170ca67b9877e","observation_id":"dcffece2-cacf-4009-9d27-8f172a16c27c","resolution":{"observed_at":"2026-08-06T18:57:38.689779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.692293Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.692293Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:c91a3c02803d0b645237e01db1ef8a4b26edf37f95293ecbceda4ef49f682fcd","observation_id":"6d95310c-4341-4732-a79a-c1e3bcae33cd","resolution":{"observed_at":"2026-08-06T18:57:38.692293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:57:38.694929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.694929Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:550315888d7bd33a397a32280faf781736e7b30197fb21356bb59cc5d874ba64","observation_id":"5439f3bd-5b71-454b-9616-ee3804e18e7c","resolution":{"observed_at":"2026-08-06T18:57:38.694929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.481882Z","title":null,"venue":null,"work_id":"89cae9d5-32ab-4702-a748-cf4ea7944a85","year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.697960Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:20d06b0052a86fb4ce98fd03f4f3a1e84895d0e95bb3967ec41a23463ac4f5a6","observation_id":"08bf06f9-9683-4cc3-b47e-4cd2db8693cb","resolution":{"observed_at":"2026-08-06T18:57:39.485092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:38.700774Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.700774Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:25b8d9f41002be067f22f5cc2613510121785a8c6ae72cf67ef272aec25c8aaf","observation_id":"451cb349-4f0e-4ef1-9500-466989e44479","resolution":{"observed_at":"2026-08-06T18:57:38.700774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.472542Z","title":"Sutton and Andrew G","venue":null,"work_id":"e0b2d885-05e9-469b-a891-7175b107bcee","year":1998},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.703468Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:3b010cd3a21d8fa5e056ecddadf4322aebabba01ba784b1858c6ca8fc0b4650f","observation_id":"fd9063f1-88c2-4cca-962d-8342577d4b07","resolution":{"observed_at":"2026-08-06T18:57:39.475642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19612","last_updated":"2025-03-28T18:02:54Z","snapshot_observed_at":"2026-08-07T16:38:29.815435Z","submitted_at":"2025-03-25T12:52:38Z","title":"RL-finetuning LLMs from on- and off-policy data with a single algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19612","snapshot_observed_at":"2026-08-06T18:57:38.706318Z","title":"Rl-finetuning llms from on-and off-policy data with a single algorithm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.706318Z"},"links":{"cited_paper":"/paper/2503.19612","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:4da0baabfcb0e0a4855bad3afe8077cd9f990e6298a07553281dea00481bcc4a","observation_id":"013e6b96-1d08-4581-a879-967f60f4dbef","resolution":{"observed_at":"2026-08-06T18:57:38.706318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.462658Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"200a68da-ee79-430f-9a29-96244ee6bd94","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.709490Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:988338fa107948e1686a6790604de290a5eb230c5465e638651b0a7137bdf1a9","observation_id":"34a51081-e03b-4d3c-891b-ecf941f8de30","resolution":{"observed_at":"2026-08-06T18:57:39.465782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T18:57:38.712144Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.712144Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:9ae0dba2035875904245226be89156b57651d75018bfaf468b82aa6caa7b5c43","observation_id":"a646dfcc-7460-4a39-807b-28dd653aa209","resolution":{"observed_at":"2026-08-06T18:57:38.712144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.452765Z","title":"Truly proximal policy optimization","venue":null,"work_id":"d6366e07-5bfb-44da-9db8-82390f327dce","year":2019},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.714875Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:be31a9830ef19937c664ae72a7796682ae3415360c4b92aa60c32dfee44ec3f1","observation_id":"36d7c104-2b2d-4e9b-a5a0-310b1a3e7b01","resolution":{"observed_at":"2026-08-06T18:57:39.456135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.443457Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"7d26bf96-d8f9-4e47-abf4-49db1904e776","year":2022},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.717354Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:e7ccdfe9cdec15b4e08c10446c439f4e99d7dc85c8c5c2cd87f6d640bc57bdb3","observation_id":"37f24888-f153-448b-8e6f-c7327f052b92","resolution":{"observed_at":"2026-08-06T18:57:39.446489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-06T18:57:38.720506Z","title":"Light-r1: Curriculum sft, DPO and RL for long COT from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.720506Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:cf0b74d0a4a47abd999258a561167369317ad2cd2a71bb79a4031021f1b8db16","observation_id":"f4d0928f-6f77-40d6-9eaf-e34070df6e62","resolution":{"observed_at":"2026-08-06T18:57:38.720506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-06T18:57:38.723557Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.723557Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:11f0a9498300e86d3fbe151011652df4e3eb2beb744390423b70000162b45860","observation_id":"5c9d34cd-b56e-4fc3-ba0e-28c5d0378d74","resolution":{"observed_at":"2026-08-06T18:57:38.723557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T18:57:38.726510Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.726510Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:7e9b3ebc2311bec0933dcb0cfd3763122590546adb038baf7cd73c0b30742636","observation_id":"28f9f242-705e-4d1b-8ae8-cc19763f253b","resolution":{"observed_at":"2026-08-06T18:57:38.726510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-06T18:57:38.729636Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.729636Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:45590caed92be420289fcd96ec157d989c3e7d0b7b1d51612a739956134a04af","observation_id":"1bd9843a-1ad8-4571-9604-2100e99d3afc","resolution":{"observed_at":"2026-08-06T18:57:38.729636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.434094Z","title":"Star: Self-taught reasoner bootstrapping reasoning with reasoning","venue":null,"work_id":"57233316-a314-4378-aa04-11433466ab35","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.732780Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:e0c2975834397e07363293a301c2967ac81e332f05ca32c43c6c19e26be6c42c","observation_id":"7ea91d13-5412-42af-b37b-2f39d9ddb1de","resolution":{"observed_at":"2026-08-06T18:57:39.437299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:57:39.423957Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search","venue":null,"work_id":"31d8bbfe-f2d5-478c-99ec-3ea08f9a43e7","year":2024},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.735478Z"},"links":{"citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:22848854f47d5e75045425d71af288d837ee2e1d2a7b3798b22b59a81edfb01a","observation_id":"67976d1d-e23a-47ed-b422-8588f9368580","resolution":{"observed_at":"2026-08-06T18:57:39.427422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-06T18:57:38.738111Z","title":"Adaptthink: Reasoning models can learn when to think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:57:38.738111Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2507.06892"},"observation_digest":"sha256:aed7165220b1c239e6947799bf20b3f38ac29979dad42db7a2398bfbdfbd9f20","observation_id":"5bd67773-33ef-40e1-8585-8922dcb3f4fd","resolution":{"observed_at":"2026-08-06T18:57:38.738111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":25},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 13 inbound Pith citation observations for arXiv:2507.06892."}