{"as_of":"2026-08-07T10:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f524867735590707136f9142214a58fb27f0a4fa1fe6eaeb995580177b1474c2","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:39:04.306845Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12380/citation-record","integrity":"/paper/2605.12380/integrity","json":"/paper/2605.12380/citation-record.json","paper":"/paper/2605.12380"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amo-bench: Large language models still struggle in high school math competitions","venue":null,"work_id":"c8f76e38-96aa-48ae-96df-7aff79b42d78","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:74b99b9ca03ee2ec85c78fb4d01d22d5ed4f6e1981cf2dfddda432668b24e86a","observation_id":"4c243dda-e7cb-451c-878d-e652851278d1","resolution":{"observed_at":"2026-05-13T10:17:39.146229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters for on-policy deep actor-critic methods? A large-scale study","venue":null,"work_id":"9c47a3d7-6e64-4365-b4b7-593c59796fbc","year":2021},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:7478653f9e0d3d5d25b6e0961d4f837d758e724bacd7f0ef2a1bbeae2da91317","observation_id":"71356322-f774-4891-b7e6-8a78977a6580","resolution":{"observed_at":"2026-05-13T10:17:39.079693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the training-inference gap in LLMs by leveraging self-generated tokens.Transactions on Machine Learning Research","venue":null,"work_id":"dfe1bd81-9d11-4e70-bf25-2952ed18089a","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:8f5fb08c77217cd273eb913aae987960d5f7da7b62e886d8e0d68efffc5e6b39","observation_id":"14d801f2-3185-4f2a-a32c-fa250507843a","resolution":{"observed_at":"2026-05-13T10:17:39.003365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.Nature, 645:633–638","venue":null,"work_id":"3d9d54dc-296b-46d7-8faf-1fa9ee5cc368","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:f31ff72b038786419bff88be31a146225c36deda0d20f665b0add5831ff8271c","observation_id":"e713ee0d-d843-4a8d-88bc-adb122cdaa83","resolution":{"observed_at":"2026-05-13T10:17:39.083999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implementation matters in deep policy gradients: A case study on PPO and TRPO","venue":null,"work_id":"6aa66f01-8fdf-46fe-bf50-f6b01be0d91e","year":null},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:22ff746b355a7ba6020c2b762e47b6af5a78eee2dab1a3658432d0146ba678ef","observation_id":"1ba607bc-0d2d-4c77-909d-a0e3b21c8406","resolution":{"observed_at":"2026-05-13T10:17:39.075355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IMPALA: Scalable distributed deep-RL with importance weighted actor-learner architectures","venue":null,"work_id":"8ceba3e6-c632-4391-b69f-be0f57b04cf7","year":2018},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:06006bc5b9e08d0b57d1179c799b4d5e4b5e0a1995f192fb86e690906276fe62","observation_id":"b40fdd02-35e4-42ec-8e59-9fd7e789199a","resolution":{"observed_at":"2026-05-13T10:17:39.066735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2382c510-d0bc-4837-8b57-987f3e8009bf","year":2019},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:c834bce3fc5dad14c1af5f181d25211a8103ec7a0f9fc1d625cebf04965d8d87","observation_id":"354d4686-ca58-4f1e-8a32-0c34540e9f08","resolution":{"observed_at":"2026-05-13T10:17:39.046404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15199","last_updated":"2020-06-26T20:21:12Z","snapshot_observed_at":"2026-07-06T09:33:10.947499Z","submitted_at":"2020-06-26T20:21:12Z","title":"DDPG++: Striving for Simplicity in Continuous-control Off-Policy Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2006.15199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.15199","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ddpg++: Striving for simplicity in continuous-control off-policy reinforcement learning","venue":null,"work_id":"24403c78-52cb-44e6-b2a8-9f7e3ec6ff9c","year":2006},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2006.15199","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:e3d2faab2b2229d15fa37f4198118f05bbe6bb5af245094b69fd360e7e43f731","observation_id":"8f999cdf-f5d1-4288-90bf-0f3f34668aa1","resolution":{"observed_at":"2026-05-13T05:42:21.015162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"00965762-bbd4-4d96-9e4f-518791f2222e","year":2020},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:cfbb4cac47d837626ce342400141f92c532eeb02fd595174479000007b7c212d","observation_id":"2e3b96a8-358f-4460-807b-976e67f738d6","resolution":{"observed_at":"2026-05-13T10:17:39.054682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lipton, Pratik Chaudhari, and Alexander J","venue":null,"work_id":"d283c666-a640-4a0f-ac3d-2b0911b53427","year":2024},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:6602c204fa06703800b02594a0c7daa522e74ce7fcb51645acb1849fcee6fbe3","observation_id":"61e706a3-94d9-459b-8ae9-df42c4a0f63c","resolution":{"observed_at":"2026-05-13T10:17:39.058601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous doubly constrained batch reinforcement learning.Advances in Neural Information Processing Systems, 34:11260–11273","venue":null,"work_id":"1a0f2e8b-d59d-43c2-8137-ccd453cbffeb","year":2021},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:14d152bb31a78738665c7bd0164511198f038808d87d94ab4e5c5ed49e30a3d9","observation_id":"49cee8d0-dc64-45e9-afc4-145bdf1dc056","resolution":{"observed_at":"2026-05-13T10:17:39.062522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":"7528bff0-3779-4746-b18a-0668af9ba02d","year":null},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:f193303e5b8d8483334155759d18941565621310a50444f7e0dd214831696ccd","observation_id":"f82cbb90-947e-4ca4-8a2f-87a56eeb337a","resolution":{"observed_at":"2026-05-13T10:17:39.071370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch size-invariance for policy optimization","venue":null,"work_id":"f84f1b75-329b-4dee-ab04-ea0dd98d4366","year":2022},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:89d9dc1b190b00246be3bca2f7cb16c8132f145429b51a484b931cdd127e0dea","observation_id":"f49c6e4b-aa79-4c2f-b54f-b06aa19579ff","resolution":{"observed_at":"2026-05-13T10:17:39.091633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The 37 implementation details of proximal policy optimization","venue":null,"work_id":"865cbb16-05c4-4f32-9f1d-a7c2bf1c0c6f","year":null},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:4ddd6c4bf635bfcdedf2fcc8d0f2686809159ae638eba132c91ca2ce2c4f28e3","observation_id":"acce5128-763f-4f8d-a388-c8df6444d004","resolution":{"observed_at":"2026-05-13T10:17:39.141074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A note on importance sampling using standardized weights.Technical Report 348","venue":null,"work_id":"5cdccecf-df4d-4b1f-a2da-fc8bb9ad2f94","year":1992},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:21607913f39d652fcadc91177e324ca599bfd893abb207600409453f8b994627","observation_id":"5ef1f5c4-d947-4f09-90d8-4824bbca8958","resolution":{"observed_at":"2026-05-13T10:17:39.017058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:4347e8c0ae0cfa8da39ee87fcd924fd5d4ed7bfc47f0bb082fecec0f30d0b27e","observation_id":"4182725d-9c30-4766-b8dc-ffa9773b8dd5","resolution":{"observed_at":"2026-05-13T05:42:21.047235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Budgeting counterfactual for offline rl","venue":null,"work_id":"1314dad8-9107-4f8d-873d-818e19ef2fe3","year":2023},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:e38f327a558264f419b33265fc0e0b5a651c35baa3040dfe68f80aca09bb1b0f","observation_id":"892412d3-78f1-4e34-9199-afed08f9ee8f","resolution":{"observed_at":"2026-05-13T10:17:39.021166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepscaler: Surpassing o1-preview with a 1.5b model by scaling rl","venue":null,"work_id":"7a06185a-26a8-4c3b-9357-9bd7934e4f91","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:48a6428895b37195070c0d06cb9ada164007938a0373aee21d92e2a848051da2","observation_id":"bd61730b-01e7-4b40-9f0c-17346b1a7ac7","resolution":{"observed_at":"2026-05-13T10:17:39.033251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:c22cf7b7514f0b4d1be1d0718ca0d170745adae59bc3f2f509bb4b1d975677fd","observation_id":"2a947907-4c24-4181-99e3-13b8c5a89aa2","resolution":{"observed_at":"2026-05-13T05:42:21.043232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 american mathematics competitions (amc 10 and amc 12)","venue":null,"work_id":"9bae68f5-e54e-498f-9aa3-78d602fcf915","year":2023},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:0abbd2025cc4055c4e4e13f05f0a1c1a0186bd69387327512ec48c9e333ee4fa","observation_id":"6cda9dfa-5239-4d64-86d4-d5c33b221210","resolution":{"observed_at":"2026-05-13T10:17:39.037920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:b21c41331627ddb1f3ab6a122ce9a97b2a896c2df18e3aa4286170164a5e89f6","observation_id":"dd2b72ee-884a-4499-a9a6-18ca007fddd7","resolution":{"observed_at":"2026-05-13T05:42:21.051093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.26788","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:59:38.002040Z","title":"Defeating the training-inference mismatch via fp16","venue":null,"work_id":"0130b8e1-ddae-4ab2-b584-1de5b6918454","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:969a4f15fda44c034dbaaa7ceb46fac54a6bd7a7edb94c788a50b02ee1423b59","observation_id":"6eea29ba-3c0e-4598-80c5-2a268297c87a","resolution":{"observed_at":"2026-05-13T05:42:21.009935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer Science & Business Media","venue":null,"work_id":"06340f75-35af-44b0-ac1e-a94fa65b0545","year":2013},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:4e5ae4785fde26f181acfbbefd03b725a4732b9ee861da54441ae5fdab8045ae","observation_id":"099a9314-ec89-4b4f-a306-e420fdf99257","resolution":{"observed_at":"2026-05-13T10:17:39.008314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trust region policy optimization","venue":null,"work_id":"881db330-647c-4131-8137-251f6873e6ec","year":2015},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:2e60c18eff73d821de046cccf7b7761d4a4ada86bfe11ef1b3582bd033728962","observation_id":"b8f8f53a-2266-4d34-a9f7-bc115d662516","resolution":{"observed_at":"2026-05-13T10:17:39.095829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:9152f21fd17cfceb89d979a0069268fcd646983d1542191f0d87cf9104412be6","observation_id":"2d472ba1-ecd6-41c2-8d3e-5a5fd4ed2db4","resolution":{"observed_at":"2026-05-13T05:42:21.038720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:0671e116dbdc2a9551c45eedb5e52bfb32c5466f4546a6a32717d6e696ca582a","observation_id":"2326cc52-513c-49e3-8af6-e7a2870fd943","resolution":{"observed_at":"2026-05-13T05:42:21.030358Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"db5daf0e-c6fd-4e73-bd32-023087fb8399","year":2020},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:a4ab22f49e557754c7a74780eed7f9d187ce1977e4bd8b52a96a1c150393ca79","observation_id":"be00e02d-b485-48a2-844d-3c8bd9006959","resolution":{"observed_at":"2026-05-13T10:17:39.012612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutton and Andrew G","venue":null,"work_id":"c94d346f-e4c5-4c0b-9dba-674870472fac","year":2018},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:e618e0b25863d3f41f80cc33d2dd97bc2277b01aa2445aa939916a98b4f2e249","observation_id":"b495a167-96d8-4f6b-bae2-077b10a8bf82","resolution":{"observed_at":"2026-05-13T10:17:39.087800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":"299a7074-2d2e-4ebd-be4b-24e2be9204d9","year":2024},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:868327a662438bada0ece7a8c7b049f17939f39cec87e547dfeb839e7789908d","observation_id":"83357d86-8e76-47b8-8529-4baf4de39174","resolution":{"observed_at":"2026-05-13T10:17:39.029351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3 technical report","venue":null,"work_id":"809e31b0-9599-4b97-a67a-d51c9040ce7e","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:1cda513037e6f8976eb22617e6e78f533ba05e25bb343a0e7f577d29120deb79","observation_id":"37a9a01a-18e1-46b6-a354-933ded269136","resolution":{"observed_at":"2026-05-13T10:17:39.118278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fp8 quantization — vllm documentation","venue":null,"work_id":"489c3f2d-2cab-48f3-b6d2-19194fdf54aa","year":2024},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:119156fdd18360d6334f4652a8da0f3f05d5e4e211c3c8f71cec651779fdbf5e","observation_id":"ec249c40-fe0a-42c7-b01a-5129ba583d0a","resolution":{"observed_at":"2026-05-13T10:17:39.121978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Williams","venue":null,"work_id":"ec830ffa-defe-4897-99f5-c56e95005168","year":1992},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:072d0195fb91b6d87cbb686775a8870398a12cbd97fb6005445f80638d120383","observation_id":"63f70013-7a03-4d88-85cf-34bce9076dca","resolution":{"observed_at":"2026-05-13T10:17:39.133369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jet-rl: Enabling on-policy fp8 reinforcement learning with unified training and rollout precision flow","venue":null,"work_id":"7c0d4e79-58e5-46e3-9016-47f6d525d1f7","year":2026},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:d79e1d9234a3ff7a5edf64a93444217e6dccf7462d25b52fc6c8ccc994dc8187","observation_id":"892475b6-3b25-4c68-a834-ba959471bee0","resolution":{"observed_at":"2026-05-13T10:17:39.114332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:898cd3950bb60a8c1f5efe743d5c9fc55f69b169258d5222abda08eb8a3b9b81","observation_id":"c50ed725-5222-48e1-a881-d227efddd534","resolution":{"observed_at":"2026-05-13T05:42:21.035003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination (aime) 2024","venue":null,"work_id":"e50ad2c4-1b31-4af6-b46c-ee32a1dfb887","year":2024},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:c7d4bb66ca3337df1b0161610c00de3c84335b5efa70bb611c397f8cefff8cde","observation_id":"b9b6840d-02a1-4000-9d8f-5a2c899b8ae3","resolution":{"observed_at":"2026-05-13T10:17:39.137116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:56:12.365057Z","title":"American invitational mathematics examination (aime) 2025","venue":null,"work_id":"52548e03-9011-44e4-b27b-dc41504358ee","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:b5e1636d3c5ecbe9a5154b8a436c608efd2b2f7960caab6780c5e9fac5ad6771","observation_id":"f952669a-9237-4939-9ad7-4ea5e9e98524","resolution":{"observed_at":"2026-05-13T10:17:39.103092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination (aime) 2026","venue":null,"work_id":"e43ed016-3a64-4d43-bc2e-10d98f76598e","year":2026},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:295679f5aa82813a4d245a56e865592244924242bff973b4c43b424912453ed9","observation_id":"d9e4ca4a-4bd6-45c6-a842-346f026050b8","resolution":{"observed_at":"2026-05-13T10:17:39.110087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:dd4c18f7f436fb285b307a63063848ce47bbd71a2ec8630bbdf97e56a351adef","observation_id":"f6945279-67c8-4ce3-abce-d53b6aa41c7a","resolution":{"observed_at":"2026-05-13T05:42:21.025655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:39:04.306845Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2605.12380"},"observation_digest":"sha256:59f7366751caef356624b7355b3945b63c43e948ee9ecf89551cea3f738dec97","observation_id":"cb8982e8-5366-41c5-9355-71f1628fd6e5","resolution":{"observed_at":"2026-05-13T05:42:21.020354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12380","last_updated":"2026-05-12T16:44:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:32:24.074369Z","submitted_at":"2026-05-12T16:44:47Z","title":"Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":9,"verified_fuzzy":27},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2605.12380."}