{"as_of":"2026-08-04T04:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37af76a9120679d7a9f87da44a710cc52a2dc9b9734e0f11230d4b80b75bb35a","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:57:49.286939Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:56:36.611575Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-02T12:16:14.744948Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"cited_work":{"arxiv_id":"2605.12070","doi":"10.48550/arxiv.2605.12070","metadata_source":"pith","pith_arxiv_id":"2605.12070","snapshot_observed_at":"2026-08-02T12:16:14.744948Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","venue":"cs.LG","work_id":"fc90bc76-d616-4cc5-8a0f-243b0a949e63","year":2026},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-03T03:43:09.098908Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:36.611575Z"},"links":{"cited_paper":"/paper/2605.12070","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:2f54ba1cd3295f087e5463e188312a0804acd07278992f0f0f9d2479de0d5c2d","observation_id":"f891b82f-e12e-4294-8fd7-2d1871075466","resolution":{"observed_at":"2026-08-02T08:58:21.176076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12070/citation-record","integrity":"/paper/2605.12070/integrity","json":"/paper/2605.12070/citation-record.json","paper":"/paper/2605.12070"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.086056Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"f42c8e62-7c0d-4824-b1a2-906653781f5c","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:fa6eccade909275a3fa97cc9fa5d0e8c7b9ecef44f3fb544b35db3b9bd2e57eb","observation_id":"4a5e0c94-92bd-403e-8da9-d4993c90e2a6","resolution":{"observed_at":"2026-05-13T09:42:33.922725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"65bd13f6-c36f-448c-86fb-2feb9f02e93d","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:3a5f6527617bba330ae9d724c886f4d615969108ff3c224696414fc51c2706b3","observation_id":"86d40475-e663-4cba-b2b3-22c2e2a98b27","resolution":{"observed_at":"2026-05-13T09:42:33.920908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:df28cc7f2878276b259ff5f379c729de3e6e59530991db066ba3e28799496a1f","observation_id":"58d05ae4-e8f2-4793-8c7d-7813d40ae441","resolution":{"observed_at":"2026-05-13T06:02:23.557756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:7d886069d2674b8fa3aef9f84707488d963912cd244dbb4228093dd2e5d75bdf","observation_id":"243d28b7-4cab-4dcb-aa7b-30b7bef80327","resolution":{"observed_at":"2026-05-13T06:02:23.573116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:aa3904d41b3737eb6a71597cdffe666057e719e80d72e07536798bc426c3178e","observation_id":"d4f29b51-a9d4-4994-8318-68e2048ae54d","resolution":{"observed_at":"2026-05-17T02:57:12.173630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":"144050d5-ea2f-44d6-a8e6-c310ad9da4d6","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:5a4341347e7c0d6ebccaed29825ff393866bfe8a29827a2d801741f0e4f774d6","observation_id":"d6efb9a3-b5a1-4520-8e78-302bf9fe19b1","resolution":{"observed_at":"2026-05-13T09:42:33.918869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"cited_work":{"arxiv_id":"2602.05765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.05765","snapshot_observed_at":"2026-07-02T21:27:24.190925Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","venue":"cs.AI","work_id":"9ad87be3-d22a-4d2d-a2e7-3cf44f51edd3","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.05765","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:bfb5b4ca53477987f66836eef942fd6eb0f4e54743b8a17f6492951111636d12","observation_id":"80e444e8-3257-47cd-9d51-1af09203b22a","resolution":{"observed_at":"2026-05-13T06:02:23.570402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26490","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:44.801876Z","title":"Vitabench: Benchmarking llm agents with versatile interactive tasks in real-world applications","venue":null,"work_id":"a9d216f9-8bb8-457e-a320-d1457744f75b","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:22cd2b860e5a82e65b54e191786ad05b3e5c766bcb33e8081b7a4fddb5afb40c","observation_id":"23f2fcd8-c8fc-4b4e-bc46-400f0d170df4","resolution":{"observed_at":"2026-05-13T06:02:23.564409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch size-invariance for policy optimization","venue":null,"work_id":"6e4e4cf7-929a-4528-9d51-c0a455765ed8","year":2022},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:76b6a375c4d2c4a44762d6d8152e4545a57b85eed345ab043737d91abe863853","observation_id":"a77987df-108c-4545-9349-22f3e287bc09","resolution":{"observed_at":"2026-05-13T09:42:33.924421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable asynchrony: Variance-controlled off-policy rl for llms","venue":null,"work_id":"7f06e052-92f2-4060-aab6-393ffb9ec423","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:92e05fb2a2296fcabd9c8d889a1465d1e17b4ace63195671ea2ca672ad203810","observation_id":"6083ae74-36f4-4064-aea4-5312a80d8551","resolution":{"observed_at":"2026-05-13T06:02:23.561246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T09:02:13.068592Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"55d06a5a-70ca-433f-966a-21dd9d276d2b","year":2023},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:a0fc760353cd5bee41df4bdb474f99e669939712c69364b9a34369cec9116118","observation_id":"b3444ef2-1355-4175-a5ed-9daa6d8c2ab2","resolution":{"observed_at":"2026-05-13T09:42:33.902836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.06547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.845413Z","title":"A-3po: Accelerating asynchronous llm training with staleness-aware proximal policy approximation","venue":null,"work_id":"12f20c93-c3e0-4e31-9b1a-e81c52887246","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:26597e47b99f6501dbd91df15a566c11415e28c8ce88cf3d80b8317b267d816d","observation_id":"9934be26-66fd-4b6b-9e49-ce933009aa73","resolution":{"observed_at":"2026-05-13T06:02:23.528218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When speed kills stability: Demystifying RL collapse from the training-inference mismatch","venue":null,"work_id":"82329cdf-d2ee-4cc2-abcb-238497d9fc41","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:8a1b2264b0867614b8d2739918df003873bb87d6eb0f157b3756007b9e41ec14","observation_id":"b829d819-d35e-4b0c-9cd7-5b8de5cde411","resolution":{"observed_at":"2026-05-13T09:42:33.900937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:40711bf13f35ab85c3eaa9395529aefb646c4628a54f3c1d599716fe254c55d8","observation_id":"736074fc-6e75-4b52-a98a-b7676343e11d","resolution":{"observed_at":"2026-05-13T06:02:23.522294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04879","last_updated":"2026-05-26T12:42:28Z","snapshot_observed_at":"2026-08-03T04:29:30.222718Z","submitted_at":"2026-02-04T18:59:04Z","title":"Rethinking the Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2602.04879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04879","snapshot_observed_at":"2026-07-09T22:26:37.209549Z","title":"Rethinking the trust region in llm reinforcement learning","venue":"cs.LG","work_id":"d2127175-a1c0-405f-b108-d2f862a0d427","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.04879","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:910299cc3d82639f6c9a8b735a6a5420cbd89bf422437011d0bef84ce24f1458","observation_id":"b2d56bc3-d8b7-4202-9c32-dc064c6545e0","resolution":{"observed_at":"2026-05-27T02:05:11.603431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-07-06T20:54:45.985432Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":"2503.14286","doi":"10.48550/arxiv.2503.14286","metadata_source":"pith","pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs","venue":"cs.LG","work_id":"885b5bf5-7859-4e5a-af07-52a7da4f25c1","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:454b3a6cd4c4930159c92a6bf5c89db1808437618e140f37831e792763601fb7","observation_id":"80cabeb2-26d8-4292-8949-9e574954a27f","resolution":{"observed_at":"2026-05-13T06:02:23.512700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:091b7b414e0f4ba8bef021b7d7c9d8060a96215053f89a78641b530833e39ee8","observation_id":"da8b7d41-10d5-40c8-9ec7-8343a3ae2312","resolution":{"observed_at":"2026-05-13T06:02:23.502320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:2a1d82c5b9d1a904e80e98e8a4f731b1fe28100bfbe1d04a40cede340f862b06","observation_id":"c1cfbc40-68d0-45cd-9e44-0d264e6ef316","resolution":{"observed_at":"2026-05-13T06:02:23.505475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10693","last_updated":"2026-05-08T10:19:00Z","snapshot_observed_at":"2026-07-06T22:45:25.047172Z","submitted_at":"2026-02-11T09:48:08Z","title":"VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training","version":3},"cited_work":{"arxiv_id":"2602.10693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10693","snapshot_observed_at":"2026-06-29T23:24:02.192004Z","title":"VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training","venue":"cs.LG","work_id":"4a29dafc-cbbe-406e-a56a-0fd2f1ed5dcb","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.10693","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:9037c95d84e652307cdce62d831afd42e12d7d1b5abd621e0d12477f9239646f","observation_id":"a3b1edf2-5521-487b-a66f-f39d305372c9","resolution":{"observed_at":"2026-05-13T06:02:23.516131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.839451Z","title":"Laminar: A scalable asyn- chronous rl post-training framework","venue":null,"work_id":"bcbca89e-28ee-4440-9d4e-eb8a792cce4d","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:57e273ba001c97cbe44f00392c8c8763da00c66db4d98957ad5dd60ac228aef7","observation_id":"22f492b9-3b1c-4b79-992f-c61670db853c","resolution":{"observed_at":"2026-05-13T06:02:23.508737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.023423Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"37ada09c-055c-4ab6-99e5-393107343cd6","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:8916dbcc66157faca9df1b6680abc18cddf8707d1eacdf90868201bdbc706b17","observation_id":"fd249724-412f-4d96-8d1a-171b34535e21","resolution":{"observed_at":"2026-05-13T09:42:33.915476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07629","doi":"10.48550/arxiv.2508.07629","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Klear-reasoner: Advancing reasoning capability via gradient-preserving clipping policy optimization.arXiv preprint arXiv:2508.07629","venue":null,"work_id":"2d3fe64a-7a53-4e46-b832-c2a7bb443af1","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:3acc1ea215653f30e5e308c77a0884c3a6cb6a9593a4d2225cbbc9ee5c8461b8","observation_id":"63cb8be7-490c-480a-9b90-15f5bd778d5b","resolution":{"observed_at":"2026-05-13T06:02:23.549528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:7dcb8532a589c2972f9418a13532cea322fb828c6b8598bc7e9ac690e16f353d","observation_id":"b20ee37d-8e70-47fa-b22a-ab0bdb940594","resolution":{"observed_at":"2026-05-13T06:02:23.540340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18855","doi":"10.48550/arxiv.2510.18855","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Every step evolves: Scaling reinforcement learning for trillion-scale thinking model","venue":null,"work_id":"8416f1a4-8196-4d83-84f4-eddf5383dd70","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:e02d04bcc15c536255f55bac8a1964a13005b51c02ca11e1f192f77fc6c7e264","observation_id":"4dab0159-f0c5-4a6b-b257-86db61318b35","resolution":{"observed_at":"2026-05-13T06:02:23.546490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:28.830041Z","title":"Ernie 5.0 technical report","venue":null,"work_id":"ffbea6f7-8129-4c8d-bcbf-1aa4cf16cf5f","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:383742713380814066e0f7a0b2ea0aac409b230d46c6ebb69c3440f880d524b9","observation_id":"3665664e-ce1f-4476-8860-bfcb504be7e3","resolution":{"observed_at":"2026-05-13T06:02:23.543107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-07-06T21:37:56.477028Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:58586e372ca0aea6cd850b19e52e491e63ddf829d7583b9b2e7d140425991360","observation_id":"f3660f3f-d005-46a3-a023-10a31f34b7e2","resolution":{"observed_at":"2026-05-13T06:02:23.534275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:26:14.207661Z","title":"Let it flow: Agentic crafting on rock and roll, building the rome model within an open agentic learning ecosystem","venue":null,"work_id":"a1afde43-96e3-49c9-af14-25f128d65fe3","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:6d2b0d510113d19821401c89d6d63f0fd2a53812904858e0536b7dc785e2a7a8","observation_id":"1b87c563-85bb-43ec-9f24-4f665cfaa99a","resolution":{"observed_at":"2026-05-13T06:02:23.537635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:1ddc9dca94d053521693577f099e9441e08fd8521f8a1e814c28076ca32f29ab","observation_id":"b029efc2-fed6-4bf5-823d-cfee5f79ba8a","resolution":{"observed_at":"2026-05-13T06:02:23.524895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your efficient rl framework secretly brings you off-policy rl training, August 2025","venue":null,"work_id":"b940eb8d-64de-4a02-bd25-843abf91f10f","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:962da440ee5b08efadb6da1f1e4260d1bb623f1e7abc52110316e1e55ae54c60","observation_id":"07b90231-bb85-44e8-94df-75d358c4b7cb","resolution":{"observed_at":"2026-05-13T09:42:33.910212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your efficient rl framework secretly brings you off-policy rl training, august 2025.URL https://fengyao","venue":null,"work_id":"f44c7225-73e5-4493-8dcd-53375ba33a8e","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:f859911416abadf59545b6d26ea4f825b253a8ecb96a99ccf1f30a3c3b582e9a","observation_id":"32303e9a-21cb-447b-b9b0-b2788502cca5","resolution":{"observed_at":"2026-05-13T09:42:33.917217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:f5a827f011a28e0456bf2dd44b2bccab123f58b903e547f75c91fdd9db6f20ae","observation_id":"26ad966d-6e42-4bc6-b296-acd744d36442","resolution":{"observed_at":"2026-05-13T06:02:23.530861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-10T13:57:07.038585Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:b924dbf6264d17845d67dfc6c45c125966dfe0c788c9829248cf03e186a94131","observation_id":"141c3492-816f-4804-b0a7-14d2c7e4c070","resolution":{"observed_at":"2026-05-13T06:02:23.554770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The landscape of agentic reinforcement learning for llms: A survey.Transactions on Machine Learning Research","venue":null,"work_id":"eccab108-6a63-4a1a-9560-d5336ca8de4f","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:c38c824c51543943ad8dd317b88c1b3e14c93f1df7cd4c77279f1c2b6da1bee7","observation_id":"99f9e4b1-c3e1-4ede-a81c-539796e9fa94","resolution":{"observed_at":"2026-05-13T09:42:33.912014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Small leak can sink a great ship–boost rl training on moe with icepop!","venue":null,"work_id":"399e2d21-5486-4ddc-9419-8b8d3ebf58e9","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:e36906028f0739708f4b4caa1f7ea5ba2e557822e823681f4208ed40be2595e2","observation_id":"8b232ab9-5f0a-47da-a982-e7ab8a5792f7","resolution":{"observed_at":"2026-05-13T09:42:33.908495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:48:39.913120Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices.arXiv preprint arXiv:2512.01374, 2025a","venue":null,"work_id":"2881a661-1c4c-4e66-abba-aa3a176aadff","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:b73f83d0703b23f4fb37cb66ce49d6981ae1d37fc0bd45ab1a468e4d8f173805","observation_id":"c7831df4-df25-4f4c-a67b-36852ae4c24b","resolution":{"observed_at":"2026-05-13T06:02:23.496418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-10T14:27:07.145784Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:d5d6b51e5c11ec36fd2930bc03d20a66b28d2a5c69ca7e71bf2796f20acbca27","observation_id":"9238bbf6-a52f-46fe-991e-3fdacb4541c9","resolution":{"observed_at":"2026-05-13T06:02:23.552263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.214162Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms?","venue":null,"work_id":"99a02056-55bc-45e6-8d10-7f31cf541473","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:a26aef91924f00e2d59f031cb6b149a8630941bd8da3adb712fe920c0694b161","observation_id":"806f8306-3f5d-4164-bd7e-59b441558a1c","resolution":{"observed_at":"2026-05-13T06:02:23.499553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583","venue":null,"work_id":"889462de-9d24-4aac-8847-18d7f5ed8899","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:c1aea90638dadf198990b2af7b166ef3a7fe215db22e2c0c19e471a8370f8e4b","observation_id":"b9b6f318-4fad-404f-ac68-15a895208590","resolution":{"observed_at":"2026-05-13T09:42:33.906563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limitations","venue":null,"work_id":"ac677dc7-1823-4cf9-82e4-b64c72e1d6f3","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:436a2580c2dbc8c23a6844423dfc02d7a84f3ad8b75888ab2bf5d06825ed04cd","observation_id":"5a4380e2-768b-4371-8664-b6fae4aaf663","resolution":{"observed_at":"2026-05-13T09:42:33.904611Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore IRB approval is not applicable","venue":null,"work_id":"7b446810-4b26-459e-8019-36ee1cee724b","year":null},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:de33c07c10c5ab93f873e2ece9235cb0f55267d5900fca195c5056e6bb64cb14","observation_id":"66624dd4-4111-4234-8af2-517fe92cdfea","resolution":{"observed_at":"2026-05-13T09:42:33.913667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":13},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2605.12070."}