{"as_of":"2026-08-11T13:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bcb9ce747941bb7add56e38a18ff2eb8fab9bb2709ecba700ece92715bae3232","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T09:36:04.735688Z","state":"measured"},{"denominator":130,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":130,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":120,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:53.603007Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:6b74fd54b2bb9c8351c41056b9345cf63a822f4d4f219ede0ca222c193009cf8","observation_id":"869bab39-fbf9-4e3b-b959-58f9c8efbeed","resolution":{"observed_at":"2026-05-22T19:32:01.334345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T18:46:11.571831Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2504.13818"},"observation_digest":"sha256:23c2e8ea38f39325a0b47bcff25d7e45708b5e9d8c169fe5de34a68d54a94f95","observation_id":"60307ffc-28ad-4d7c-a06a-facc7d2a605a","resolution":{"observed_at":"2026-05-22T18:46:56.959170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T00:26:48.291431Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2504.13958"},"observation_digest":"sha256:26e90726f9aa7d2a9e3bca2c87377707769db1b09edb7a520fdaddd09dc29a0f","observation_id":"51145a8d-48b2-44fc-a1bb-22881df61304","resolution":{"observed_at":"2026-05-14T00:26:48.575367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:49631b5bebaeee96437ec56cce024032f7280c8ea37788b3455dbec4cab38157","observation_id":"cee44b9b-7798-4947-ac7b-86376f501c6d","resolution":{"observed_at":"2026-05-15T19:51:04.931329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:3a86b6f7c5433688682fd5a2a65e7dcb5834e70ac33e1b96d331e4a97924669d","observation_id":"1fdb0580-cf6d-4827-9a89-6ee24940d15b","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T15:36:53.603007Z","title":"Vapo: Efficient and reliable rein- forcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-10T14:44:06.122614Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.603007Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:5c9b8d149ca7501c9bf340b6a655455470a98110183a418c4687364e3ee424fb","observation_id":"f78eea0f-e438-4e9a-bad1-a1df752bc050","resolution":{"observed_at":"2026-08-07T15:36:53.603007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T15:26:54.812847Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-09T16:48:40.808805Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.812847Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:684f2202759dad932beef90a7d2fba00d1947bda8f19a916d5cd559846df648c","observation_id":"aa196788-e30a-4150-803f-794700ddbea6","resolution":{"observed_at":"2026-08-07T15:26:54.812847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T14:55:17.382981Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17005","last_updated":"2025-05-22T17:58:26Z","snapshot_observed_at":"2026-08-09T19:43:56.609455Z","submitted_at":"2025-05-22T17:58:26Z","title":"R1-Searcher++: Incentivizing the Dynamic Knowledge Acquisition of LLMs via Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:17.382981Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.17005"},"observation_digest":"sha256:917f6f71ebcfe03a2416c99a4d6e03340cb09fd76fe784e09bb57cf893cba98f","observation_id":"4335d87f-8831-49c9-a802-ce15ccd97730","resolution":{"observed_at":"2026-08-07T14:55:17.382981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T14:13:12.862798Z","title":"VAPO: efficient and reliable reinforcement learning for advanced reasoning tasks.CoRR, abs/2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19815","last_updated":"2025-05-26T10:52:17Z","snapshot_observed_at":"2026-08-07T21:55:42.875455Z","submitted_at":"2025-05-26T10:52:17Z","title":"Deciphering Trajectory-Aided LLM Reasoning: An Optimization Perspective","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:12.862798Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.19815"},"observation_digest":"sha256:58d63bef2f38e605781481c4bc8d22501dabe2a9d0c4101205290169c946c550","observation_id":"125f54f4-7faa-47e8-8054-6daaba203bc9","resolution":{"observed_at":"2026-08-07T14:13:12.862798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T14:11:08.003933Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-08-07T16:09:17.796555Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:08.003933Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.19914"},"observation_digest":"sha256:58a96b4a77955682b95b35962c1bc04da95a4e140f686e52132c679733e5b6ba","observation_id":"e52cbf45-a0a6-4b75-9057-32083e2e5187","resolution":{"observed_at":"2026-08-07T14:11:08.003933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T13:46:40.447364Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-07T16:09:26.563632Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.447364Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:3c8e7850a23ddf17367fe01d01a3de6eb8f44170320036029d634826a05e67fb","observation_id":"3209e50a-0aff-4c99-8a20-2a8d9c5610d6","resolution":{"observed_at":"2026-08-07T13:46:40.447364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T04:26:47.283983Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.22312"},"observation_digest":"sha256:4a9a5589c2c9ea1e75f515d3fd0290d0dc568bbaaacae18541d852c49a6e406b","observation_id":"f0e7aab7-cfac-4690-8631-f363ae52bce6","resolution":{"observed_at":"2026-05-17T04:26:47.372535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T13:05:26.479274Z","title":"V APO: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv [cs.AI], 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22756","last_updated":"2025-05-28T18:18:49Z","snapshot_observed_at":"2026-08-10T01:26:26.516912Z","submitted_at":"2025-05-28T18:18:49Z","title":"Decomposing Elements of Problem Solving: What \"Math\" Does RL Teach?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:05:26.479274Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.22756"},"observation_digest":"sha256:09a61dc5c2e818779668f898415b3949d10f9c6fbb184bdc4c83e0c343ec99b5","observation_id":"0f4fdb04-2f99-40c7-9417-1ec1686aa36a","resolution":{"observed_at":"2026-08-07T13:05:26.479274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:7eb2f8ae658036cabaa8f77ea87a72137f13d2030b3133ec0678910901b27295","observation_id":"4fd6d89d-55ff-46da-b1b7-fae958d9c605","resolution":{"observed_at":"2026-05-15T14:24:22.020162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T12:02:47.802104Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:47.802104Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:d22d450e911aaa0d2ca1456bee3c147047ebac900a4fc5cd0e0a291956630f7d","observation_id":"32d60b21-8cf9-41d5-8188-815c95221139","resolution":{"observed_at":"2026-08-07T12:02:47.802104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T11:35:47.789603Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02096","last_updated":"2025-06-02T17:45:16Z","snapshot_observed_at":"2026-08-11T11:45:46.615149Z","submitted_at":"2025-06-02T17:45:16Z","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:35:47.789603Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.02096"},"observation_digest":"sha256:96d3745a8d008f096d53e4e4f96455a73b0fba612734961517a7046ef4f679dc","observation_id":"5816efab-176e-4812-b4af-4645f840aa09","resolution":{"observed_at":"2026-08-07T11:35:47.789603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T11:33:57.031251Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.031251Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:0e984152a1fc0cf8b91114d11463b59017a71b32daeffa229e526177d5c8868f","observation_id":"1871f2f7-c535-4ef7-9dcc-a2ad22c02ed6","resolution":{"observed_at":"2026-08-07T11:33:57.031251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2506.05760","last_updated":"2026-04-19T08:41:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-06T05:40:39Z","title":"Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-19T10:52:32.933138Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.05760"},"observation_digest":"sha256:90f9b2e7ab740b848787e012cbbc97d3f6bbc8b51ed22f6610fc921569b17a44","observation_id":"f61d086a-d96b-4c33-a3fe-7d28d77515fd","resolution":{"observed_at":"2026-05-19T10:53:02.871689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:49:40.307416Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.307416Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:1849d8e08d3477eaf9def28fc07f37c3704036752eb6f1d0a9080a8215e9ea5f","observation_id":"487a986d-c299-4028-900a-37dcdba052b3","resolution":{"observed_at":"2026-08-07T05:49:40.307416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:09:45.826337Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08745","last_updated":"2025-06-10T12:40:39Z","snapshot_observed_at":"2026-08-08T00:32:04.126170Z","submitted_at":"2025-06-10T12:40:39Z","title":"Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:09:45.826337Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.08745"},"observation_digest":"sha256:2bfd8349ee4af1566ab5e2143981a88fd94840e7e03e403a19babdfbf2bec597","observation_id":"6e11b935-4602-4260-818a-7337de2eb813","resolution":{"observed_at":"2026-08-07T05:09:45.826337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:01:24.270146Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.270146Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f2d3376c8b9ea9dc6ddedf3afb19c6cb4a5183425ee86c173b9e133cace22375","observation_id":"f9d31dd3-77a0-4581-918f-ffdecd649ba1","resolution":{"observed_at":"2026-08-07T05:01:24.270146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T04:39:38.584934Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-08T09:07:12.052492Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:39:38.584934Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.10406"},"observation_digest":"sha256:6bc38ddb0d54caaaac9e277ed9dd5b9df733d3413a500b09a5eaad081b836445","observation_id":"db25a27a-6821-4c88-840c-c455317f9b0e","resolution":{"observed_at":"2026-08-07T04:39:38.584934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T23:35:26.517415Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:26.517415Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:1040afa577936b1cbc8309d401fcc86c54245c827fc11fc97bbbfa5daae65ca1","observation_id":"97bae04e-4157-4166-85dd-bbe2f8c258f4","resolution":{"observed_at":"2026-08-06T23:35:26.517415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T22:59:47.748775Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20241","last_updated":"2025-06-25T08:36:12Z","snapshot_observed_at":"2026-08-10T15:52:12.663753Z","submitted_at":"2025-06-25T08:36:12Z","title":"Enhancing Large Language Models through Structured Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:59:47.748775Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.20241"},"observation_digest":"sha256:f07cae88d8a8ac9dc00b848f5a401f026d843a4ab7b84e96c89124a576a95750","observation_id":"5783c661-6638-4b03-8a33-e79151566a43","resolution":{"observed_at":"2026-08-06T22:59:47.748775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T21:45:11.615470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23840","last_updated":"2025-06-30T13:30:33Z","snapshot_observed_at":"2026-08-10T15:11:41.836176Z","submitted_at":"2025-06-30T13:30:33Z","title":"Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:11.615470Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.23840"},"observation_digest":"sha256:2a5cc338737195c9daca65034a245bbcc83ff0639dff2e10ef0bb3a1fde63167","observation_id":"70018833-dd4f-4183-901f-6204e44b044d","resolution":{"observed_at":"2026-08-06T21:45:11.615470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T21:02:38.855807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01327","last_updated":"2025-07-02T03:26:02Z","snapshot_observed_at":"2026-08-09T00:46:58.233525Z","submitted_at":"2025-07-02T03:26:02Z","title":"Reasoner for Real-World Event Detection: Scaling Reinforcement Learning via Adaptive Perplexity-Aware Sampling Strategy","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T21:02:38.855807Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.01327"},"observation_digest":"sha256:58f080478f96929041b922501dd32e130edad491d1721c0a6b46f4e67fa74d5d","observation_id":"48d27688-5e9e-45c2-a2d9-51bd55bfa345","resolution":{"observed_at":"2026-08-06T21:02:38.855807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T20:43:12.002417Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02076","last_updated":"2025-07-02T18:27:42Z","snapshot_observed_at":"2026-08-08T01:09:25.758170Z","submitted_at":"2025-07-02T18:27:42Z","title":"Reasoning on a Budget: A Survey of Adaptive and Controllable Test-Time Compute in LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:12.002417Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.02076"},"observation_digest":"sha256:f00e27840c6d9a24f7c5266f36fb80e4ec9ad5e8357a283e990b8a8f4b5912bb","observation_id":"a892dcce-a0ce-4d20-ac7f-b1ce29ef605d","resolution":{"observed_at":"2026-08-06T20:43:12.002417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T19:14:21.180458Z","title":"VAPO: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06181","last_updated":"2025-07-08T17:03:39Z","snapshot_observed_at":"2026-08-07T16:09:15.554628Z","submitted_at":"2025-07-08T17:03:39Z","title":"CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:21.180458Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.06181"},"observation_digest":"sha256:5e2030600d7d142e7e91750e63874bc60208394bb3edb7868c2ce567fbf5cac8","observation_id":"b2d19da5-4da5-4381-9748-8ff4e7f0b63e","resolution":{"observed_at":"2026-08-06T19:14:21.180458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T18:53:14.726477Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:14.726477Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:9880b312c252c4d3ccc113961b63949754204af5e5dca560ec9273e89a3afc11","observation_id":"2bcd14f6-b579-4a79-ae0e-9ebfb33ca07c","resolution":{"observed_at":"2026-08-06T18:53:14.726477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T17:48:18.637977Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10628","last_updated":"2025-07-16T15:30:11Z","snapshot_observed_at":"2026-08-11T00:34:58.024801Z","submitted_at":"2025-07-14T08:10:00Z","title":"GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:48:18.637977Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.10628"},"observation_digest":"sha256:ff313f173a723e9554d6f3c79605d7ab168f42cd4a14f47c2ac14f96348ae153","observation_id":"6db4e52d-390b-4fe6-8ba8-7ddc2ba375ef","resolution":{"observed_at":"2026-08-06T17:48:18.637977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T15:55:42.611272Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14683","last_updated":"2025-07-19T16:21:23Z","snapshot_observed_at":"2026-08-11T01:16:51.818498Z","submitted_at":"2025-07-19T16:21:23Z","title":"MiroMind-M1: An Open-Source Advancement in Mathematical Reasoning via Context-Aware Multi-Stage Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:55:42.611272Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.14683"},"observation_digest":"sha256:f472490bbabe3dff28c626cdfa5899de70b67d14cfa6d5cd624e07665fea4ed8","observation_id":"0815638b-df74-481c-8fa8-bdd6e337cb8d","resolution":{"observed_at":"2026-08-06T15:55:42.611272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-10T12:54:04.823142Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:50cc2beffa56adc2e407edd91a036bd625e88c220405a3b7151a22c54e19c3b0","observation_id":"3be5882a-233e-48b4-813e-08f3643fe0e1","resolution":{"observed_at":"2026-05-21T23:24:26.245092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T14:13:07.341887Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":298,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.341887Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:5884e6ffe5cfb4cdc13ebd1ba1d628b3d23b6cb6e9d2b0122c968db34d683f48","observation_id":"3f92bed6-70b5-4333-b3e0-f62e07a93083","resolution":{"observed_at":"2026-08-06T14:13:07.341887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-06T10:30:44.720568Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23726","last_updated":"2025-08-01T03:36:47Z","snapshot_observed_at":"2026-08-07T12:23:31.292936Z","submitted_at":"2025-07-31T17:00:30Z","title":"Seed-Prover: Deep and Broad Reasoning for Automated Theorem Proving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:30:44.720568Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2507.23726"},"observation_digest":"sha256:991a3db43a875109dc0311e56b61c7c5f995469458f0b0650632f8f3b7cb89de","observation_id":"82ae6b57-19d1-4374-887c-9e3150957299","resolution":{"observed_at":"2026-08-06T10:30:44.720568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T23:43:05.878469Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:05.878469Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:323f9cbbac6577ec97a202c5a3ded98c6b1506319617aa2263d6594623b23836","observation_id":"5c6ddd8e-ef9c-4744-9388-95e1c3ec7ba2","resolution":{"observed_at":"2026-08-05T23:43:05.878469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T23:29:16.807447Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-08T12:45:30.983934Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:16.807447Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:b4573910ba60f5ca8ea3b5a4bede48ede9a042be6fbbb29aa71072be8ccb3d09","observation_id":"fdd19e39-4745-4c4a-990f-a61fd25109b0","resolution":{"observed_at":"2026-08-05T23:29:16.807447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T23:25:49.975190Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05388","last_updated":"2025-08-07T13:38:49Z","snapshot_observed_at":"2026-08-06T12:42:41.700036Z","submitted_at":"2025-08-07T13:38:49Z","title":"An Explainable Machine Learning Framework for Railway Predictive Maintenance using Data Streams from the Metro Operator of Portugal","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:49.975190Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.05388"},"observation_digest":"sha256:f302b9fa9b62f526d775083911c312639fa0fb99829de5ed378ea022a1e82a6d","observation_id":"7b3fd920-5fa4-42b9-a1d5-0eb6394bca49","resolution":{"observed_at":"2026-08-05T23:25:49.975190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2508.08636","last_updated":"2026-05-20T08:06:05Z","snapshot_observed_at":"2026-08-04T03:35:42.053775Z","submitted_at":"2025-08-12T05:00:00Z","title":"InternBootcamp Technical Report: Boosting LLM Reasoning with Verifiable Task Scaling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T22:33:09.674822Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.08636"},"observation_digest":"sha256:29234e5ef005eda1c53f7b9d5d84d4e877f93afe788c8fcf32c46ce02ca5adb3","observation_id":"6eda87ac-b045-4ed7-bb6f-64f75a9649b6","resolution":{"observed_at":"2026-05-21T22:34:23.995667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T17:39:28.845867Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16697","last_updated":"2025-08-22T01:41:49Z","snapshot_observed_at":"2026-08-09T00:47:31.316896Z","submitted_at":"2025-08-22T01:41:49Z","title":"QueryBandits for Hallucination Mitigation: Exploiting Semantic Features for No-Regret Rewriting","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-08-05T17:39:28.845867Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2508.16697"},"observation_digest":"sha256:3252384ee0c6c384e796915fcb5f4e9468d297930b036032e7dfd47db57b9553","observation_id":"9b3c42bb-6f90-47f4-a99a-ce216d03afba","resolution":{"observed_at":"2026-08-05T17:39:28.845867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T12:45:41.959563Z","title":"V APO: efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.959563Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:0de7f14a82eb780ec853b1c92b4c66b68375fd26fd01dcaeb60570458c5b4a1a","observation_id":"bcf8172e-f661-4089-b7e5-131ca1103dfb","resolution":{"observed_at":"2026-08-05T12:45:41.959563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T11:43:29.342020Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-11T00:26:04.923492Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:43:29.342020Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02333"},"observation_digest":"sha256:03b31d4ad658cb56c1208e79d92a46af39e703b5fe369a4de2783ebf67e6e20c","observation_id":"cf81ad52-1075-4fd5-81a4-a154b849fd1d","resolution":{"observed_at":"2026-08-05T11:43:29.342020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-11T12:35:47.937091Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-13T10:13:58.774968Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02544"},"observation_digest":"sha256:22370d413318750d00510951087032c8882522ea17cf0943fa5a8f322106109a","observation_id":"a4c1acac-b9ed-4ac5-a94a-3d44a3cb00b3","resolution":{"observed_at":"2026-05-13T10:13:58.985799Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:36e022cd48b8eef4f8eb7e64d3d7b5f773159dd278bcdc986ea38bdd8c8c4795","observation_id":"b2ab2c70-a02f-4218-9207-3bb352e10aca","resolution":{"observed_at":"2026-05-18T19:21:48.013620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T10:31:37.947268Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-11T09:46:38.139449Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.947268Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:a80951b98b753dbd8e424648b058d8e0a2904b9f7cb1a07f1c18a0f2259b3f55","observation_id":"97bdd282-cc34-4964-b295-0a99b8da6273","resolution":{"observed_at":"2026-08-05T10:31:37.947268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T21:28:50.583503Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.07980","last_updated":"2025-09-12T17:15:56Z","snapshot_observed_at":"2026-08-07T14:28:58.369966Z","submitted_at":"2025-09-09T17:59:35Z","title":"Parallel-R1: Towards Parallel Thinking via Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T21:28:50.583503Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.07980"},"observation_digest":"sha256:ebf35acb4de95bed5bb41855cf3f1048e619cd9aa164c3a23bb85a842d361412","observation_id":"9691f506-e6da-4df4-b0aa-c82e74f335aa","resolution":{"observed_at":"2026-08-04T21:28:50.583503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T18:53:02.795969Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-07T12:25:43.109797Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.795969Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:3e159eb9de1bbde5cbd72a92a88c04ffacae257d56b61d6e04e56196bb846c32","observation_id":"785be2f1-8e1f-4b8f-86da-ff8b432162eb","resolution":{"observed_at":"2026-08-04T18:53:02.795969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2509.23102","last_updated":"2026-04-06T19:14:12Z","snapshot_observed_at":"2026-08-03T06:33:00.420621Z","submitted_at":"2025-09-27T04:18:33Z","title":"Multiplayer Nash Preference Optimization","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T13:09:54.433720Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.23102"},"observation_digest":"sha256:402483f6c8bbe46c1a2d8d6fd1e8f589dac4c0ad066f27650069c2d8349985d1","observation_id":"7b517741-e3b3-42c5-a97d-37e8906b71d3","resolution":{"observed_at":"2026-05-18T13:11:24.064514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2510.06062","last_updated":"2026-05-15T05:25:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-07T15:54:24Z","title":"When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T20:29:25.874620Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2510.06062"},"observation_digest":"sha256:b6a28c848c7795218feda663fc4b9bd9d8e62ba2ddd35c6586f1a951e3896e63","observation_id":"aa34e41b-b028-4c4c-87b7-ebd7c5eb4527","resolution":{"observed_at":"2026-05-21T20:30:35.546640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T09:48:10.988323Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13554","last_updated":"2026-06-08T06:02:10Z","snapshot_observed_at":"2026-08-04T09:47:55.188440Z","submitted_at":"2025-10-15T13:49:51Z","title":"Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T09:48:10.988323Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2510.13554"},"observation_digest":"sha256:5cc44889592dd025d4bbc969c1b39e5700cb986855d5675121413306bb45b956","observation_id":"77aaf1c0-0ea5-4a0e-b6c5-5f14e2f4fa33","resolution":{"observed_at":"2026-08-04T09:48:10.988323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2510.13786","last_updated":"2025-10-15T17:43:03Z","snapshot_observed_at":"2026-08-10T14:49:33.428173Z","submitted_at":"2025-10-15T17:43:03Z","title":"The Art of Scaling Reinforcement Learning Compute for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T16:29:13.954029Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2510.13786"},"observation_digest":"sha256:41c9054619a675aea9efcbaef05b07902c5edfa00f90479ba1af384e58a4733a","observation_id":"2216c8df-3317-471e-98f8-c4ba2496518a","resolution":{"observed_at":"2026-05-16T16:29:14.058755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2511.00066","last_updated":"2026-05-13T07:57:37Z","snapshot_observed_at":"2026-08-06T07:33:01.385285Z","submitted_at":"2025-10-29T08:07:47Z","title":"Sharpness-Guided Group Relative Policy Optimization via Probability Shaping","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T03:10:57.839146Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2511.00066"},"observation_digest":"sha256:6ca4ed57db11d970a4734d279ab1e74eafd46c449ac850bc1aa8846466476d61","observation_id":"80bd88de-c989-4673-bf72-378a661194e1","resolution":{"observed_at":"2026-05-18T03:12:22.335258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2511.05820","last_updated":"2026-05-14T01:51:33Z","snapshot_observed_at":"2026-08-10T22:50:16.194375Z","submitted_at":"2025-11-08T03:09:31Z","title":"From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2511.05820"},"observation_digest":"sha256:54fe09ea451681fc2fa9015e550d4b903116369cd97d99fd0b81f35fb726c0a4","observation_id":"894c1f32-963e-4af7-a059-60326dcbfa3a","resolution":{"observed_at":"2026-05-17T23:55:30.784895Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2511.07833","last_updated":"2026-05-09T19:03:03Z","snapshot_observed_at":"2026-08-07T14:38:48.465010Z","submitted_at":"2025-11-11T05:03:22Z","title":"MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T23:13:43.754235Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2511.07833"},"observation_digest":"sha256:f7c2eca1ef830ec6589d7a8372918f302acf15d09cea5041cc5a7790cd9c3f01","observation_id":"99842e8b-521f-4a83-b48a-a42e6b4d92f8","resolution":{"observed_at":"2026-05-17T23:15:26.734331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T22:36:11.481330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.10055","last_updated":"2026-06-02T09:56:13Z","snapshot_observed_at":"2026-08-05T14:12:50.521583Z","submitted_at":"2025-11-13T07:57:10Z","title":"Physical Plausibility Reasoning via HCM-GRPO: Empowering Compact Model for Superior Performance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T22:36:11.481330Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2511.10055"},"observation_digest":"sha256:2a51a3b11cdb002ec3359b413e06e06f1c4ac1eacdc31060f4a5712de1c979b0","observation_id":"11a595fe-f957-4204-b0ba-d491a1ebb9bf","resolution":{"observed_at":"2026-08-03T22:36:11.481330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T17:15:17.715125Z","title":"Vapo: Efficient and reliable re- inforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10414","last_updated":"2026-05-30T03:42:16Z","snapshot_observed_at":"2026-08-09T16:57:47.996624Z","submitted_at":"2025-12-11T08:27:02Z","title":"Boosting RL-Based Visual Reasoning with Selective Adversarial Entropy Intervention","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T17:15:17.715125Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2512.10414"},"observation_digest":"sha256:ec848ad4a10e0b9603d82f7220f51ab281d940c4afd3f68dd12ce66308fc3b5d","observation_id":"3088faac-586a-4cd9-a193-07003b081fbb","resolution":{"observed_at":"2026-08-03T17:15:17.715125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T16:43:57.954210Z","title":"Zhang, B., Zhou, K., Wei, X., Zhao, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-07T00:51:43.825252Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.954210Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:c2bbacb572d57f7b5e99a76bfc3b21b4ed0445809fe47d76882dca46b7222ddb","observation_id":"42998865-32a2-4ce8-880b-7e501606d255","resolution":{"observed_at":"2026-08-03T16:43:57.954210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T14:20:31.329087Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20957","last_updated":"2026-05-26T05:07:52Z","snapshot_observed_at":"2026-08-03T18:14:05.259857Z","submitted_at":"2025-12-24T05:27:53Z","title":"One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T14:20:31.329087Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2512.20957"},"observation_digest":"sha256:8284abb916e0064861e9d77e5cdca28b6e91a501f14919d0adf36801d6e169ed","observation_id":"90439b10-2e4c-44b2-aa78-c761068b8f09","resolution":{"observed_at":"2026-08-03T14:20:31.329087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T12:19:35.541027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-06T03:27:45.707151Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:35.541027Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:d566a2c4bcbea7d61f09649a6564cde5f55cddc327c64d2cb6bb17313da89c57","observation_id":"db471f3a-97b6-40fb-bb42-ceaf9af8a6a7","resolution":{"observed_at":"2026-08-03T12:19:35.541027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2601.07389","last_updated":"2026-05-06T07:45:21Z","snapshot_observed_at":"2026-08-11T04:42:30.789899Z","submitted_at":"2026-01-12T10:14:09Z","title":"On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T14:47:52.094353Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2601.07389"},"observation_digest":"sha256:1dc4d949ebd03f6c518cdfebecdf70acb152017f7e3b9fc069aa582f52c2d926","observation_id":"fd2c1ad8-9fa0-4e99-a721-4d17e4b3f26e","resolution":{"observed_at":"2026-05-16T14:48:00.539725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-10T11:34:20.766987Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T03:54:30.992080Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2601.18734"},"observation_digest":"sha256:942b63893bc286eafb69dd7c7c6470797a566726c2d7fb8e33ac299011588811","observation_id":"e2bf7a88-6870-4603-8b9a-e0b6ea87f3dc","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2602.01970","last_updated":"2026-05-15T12:23:06Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T11:24:36Z","title":"Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T14:09:26.842696Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.01970"},"observation_digest":"sha256:3ad1c113133c8d7c08d4b0e748478028565c126bca6082c65344d375d4bc6de3","observation_id":"449a277c-f700-4464-a621-dcb29aee9260","resolution":{"observed_at":"2026-05-21T14:10:13.176606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2602.03452","last_updated":"2026-05-06T05:26:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-03T12:17:25Z","title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:50.793194Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.03452"},"observation_digest":"sha256:639bab247e347b8ab080970fb88288eb385eb6b0c28273b4f98fc1f3c7003149","observation_id":"6a2394cc-416c-43cc-b30c-24eafab51e5d","resolution":{"observed_at":"2026-05-16T08:27:36.802347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T04:17:27.326104Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T23:12:50.234380Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.326104Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:6d0c08194ef83e8afe4510330d031c6b78169aa64912ebf8c2bc242c6af4076d","observation_id":"74b99aeb-af62-4ba0-bd79-f0d7da704245","resolution":{"observed_at":"2026-08-03T04:17:27.326104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:0874659f07fc64e40725c6a2344dd641749a806d760f84c54ea614be8f110695","observation_id":"8e752be5-0dd7-4d4d-a87e-60e8e5562434","resolution":{"observed_at":"2026-05-21T13:14:11.058227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-03T03:33:46.362138Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-03T03:33:41.469348Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:46.362138Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:8aa12df5753e373a7617eeeb087a24e561e2dbdc653f09c1299c6a68f7b060b5","observation_id":"64a40906-68d9-4469-b025-1701298f15cc","resolution":{"observed_at":"2026-08-03T03:33:46.362138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2602.15620","last_updated":"2026-05-25T12:27:41Z","snapshot_observed_at":"2026-08-02T22:51:59.891234Z","submitted_at":"2026-02-17T14:46:48Z","title":"STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T21:41:48.690125Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.15620"},"observation_digest":"sha256:64c2f4e1f172c6cc4343d43e6d0e69743e3a67f2259647d2a7d9cb5fd2d1328a","observation_id":"504cdea3-76e5-4404-92c9-143aeb7376bb","resolution":{"observed_at":"2026-05-15T21:46:43.335437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-02T22:52:04.254957Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15620","last_updated":"2026-05-25T12:27:41Z","snapshot_observed_at":"2026-08-02T22:51:59.891234Z","submitted_at":"2026-02-17T14:46:48Z","title":"STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:52:04.254957Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2602.15620"},"observation_digest":"sha256:8729ea5155bf1fa6e66cf073f9f20d3f298a69b2923d5813772a6e586748ef70","observation_id":"967afb4e-8c25-4313-b5f8-b9c7aa5998f5","resolution":{"observed_at":"2026-08-02T22:52:04.254957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.03671","last_updated":"2026-04-04T09:52:30Z","snapshot_observed_at":"2026-08-02T07:25:05.287765Z","submitted_at":"2026-04-04T09:52:30Z","title":"User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T17:24:18.413112Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.03671"},"observation_digest":"sha256:74b441baa4a96fb8e29cc6184ddb076ffbdcca1782670478a77ea619197e347f","observation_id":"191891a1-b127-4f5c-8b5d-3b0e56f91998","resolution":{"observed_at":"2026-05-13T17:28:02.564997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.10701","last_updated":"2026-04-12T15:54:11Z","snapshot_observed_at":"2026-08-11T05:04:54.803393Z","submitted_at":"2026-04-12T15:54:11Z","title":"Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:29.657563Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.10701"},"observation_digest":"sha256:f95cf8228eb1c9f5b2201d5fddaa049323572e2fd1b6977f67186baa666e10b2","observation_id":"b6a64307-21cd-4304-9cb3-6816ef54ec2d","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:12:06.985609Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:5260fcb6b8c4e50b5812a411903ddc995624a1468e8c72a74c6b92d8342aaa59","observation_id":"923793dc-5f35-49b3-a7ac-3c8654fd9e19","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T01:04:12.454268Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:78c83dfd9353b22747f73414f782f9cd5851f824ffff96c20dd4edff5c4d0a58","observation_id":"411907de-312b-4c76-bd8f-1d76d9157ba8","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:7aa6d7022b0799a3502f035e79443c088bc6432c408ad80159948890b5ccb122","observation_id":"70ce5b5d-9328-4a41-bc12-fcf2b4694078","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-08-11T12:08:50.693991Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:29.531510Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.20659"},"observation_digest":"sha256:c5aca6d7aee12743259f601e170908cae36b92c436e6ef7a0af703e9f9e1ee71","observation_id":"5ab556cc-f1a8-437f-8ab6-23c45982a90a","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.20755","last_updated":"2026-04-22T16:44:33Z","snapshot_observed_at":"2026-08-01T03:59:28.787636Z","submitted_at":"2026-04-22T16:44:33Z","title":"V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T23:48:32.613988Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.20755"},"observation_digest":"sha256:1af9a44b80a748e84a61b2144c1e0f94d186f93c12758dacb739eeb93e7b59c5","observation_id":"4cdcb9db-4dd2-4cc3-9e98-8167b6bf4829","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-07T10:42:27.644514Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:736d1493e984408945755809b43086c451b9f0d59adb300b8e72605b80e37c03","observation_id":"5fde5381-1677-40f0-a0dc-53384c164c73","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-02T15:28:14.099465Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.27039","last_updated":"2026-07-20T23:24:02Z","snapshot_observed_at":"2026-08-02T15:18:52.956023Z","submitted_at":"2026-04-29T17:09:21Z","title":"Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T15:28:14.099465Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.27039"},"observation_digest":"sha256:045abc7cf3f0b58cc62f28cd1059ac5b9dfd0c53d39cc70f5fbf8f05ec7306cd","observation_id":"f0372826-3cbd-4bdf-87b8-63565a2a8406","resolution":{"observed_at":"2026-08-02T15:28:14.099465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-10T20:23:29.058595Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:1e5f8a20c5b58b9865b1549f653188c59855d84b46fa92ccf5ad54bc7785f536","observation_id":"dc57751a-3ffd-4720-b218-b85a0efa5b07","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-10T20:23:29.058595Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:19b057ee2632cb35b2afa8b02684aea099d90f0addcb33c4194c07c4b87ac71d","observation_id":"4e618c80-c0f7-44ff-88bd-3904ba08c3ca","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-10T20:23:29.058595Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a610c272184dccc98eb365fedc858e3b57b7380ac89b138893ca2a75158a72bd","observation_id":"9d369771-597d-419a-80d7-d53f367730a9","resolution":{"observed_at":"2026-05-19T17:02:40.646826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.01327","last_updated":"2026-05-07T08:09:44Z","snapshot_observed_at":"2026-08-11T04:32:46.367266Z","submitted_at":"2026-05-02T08:47:45Z","title":"Segment-Aligned Policy Optimization for Multi-Modal Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T14:44:31.160543Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.01327"},"observation_digest":"sha256:109543657eca8987c9f16ffe984bd336f1f36afb8550042ff1311760cb642b2b","observation_id":"6b88b11e-4781-4203-9539-f00e70edb1cd","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.02469","last_updated":"2026-05-04T11:10:32Z","snapshot_observed_at":"2026-07-06T23:15:32.349713Z","submitted_at":"2026-05-04T11:10:32Z","title":"Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-08T19:34:22.546508Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.02469"},"observation_digest":"sha256:6db22cfeca813b150af2b222b00a49a8eeb24cf7f6feeee69634daa0fa40e1f9","observation_id":"8e95ec75-48e4-470a-a328-0090381acb83","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.06650","last_updated":"2026-05-07T17:55:21Z","snapshot_observed_at":"2026-08-10T23:06:59.515096Z","submitted_at":"2026-05-07T17:55:21Z","title":"Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T09:53:32.077464Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.06650"},"observation_digest":"sha256:52b02941d7eefb4845b386696b9dd4718c4bde5a83ef1a4c6fd92f1aa52d41ce","observation_id":"61cfe08d-8965-4df7-86c5-18d40af3610e","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:ad3ee0bc9e0f5339cf7e02f133dbe15a62b55255ead5e397c91474469152d720","observation_id":"69d2a109-293f-484e-8705-1d389312eccd","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.07137","last_updated":"2026-05-08T02:13:33Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T02:13:33Z","title":"Adaptive Negative Reinforcement for LLM Reasoning:Dynamically Balancing Correction and Diversity in RLVR","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-11T01:46:46.055118Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.07137"},"observation_digest":"sha256:e781ed0cf9837c6bd7c53c78c62a3ac4d8ac14bd91a6bb836d6616429bdc73b3","observation_id":"67bfa165-ca42-4238-80e1-a1e5357fe0a7","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-09T17:46:54.267669Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:3de146bf4d751c8b5cd0db93f9aba08077e9e08425c48f9f6781f5eed592acbd","observation_id":"5a6dba1b-5ed2-4efa-a3f6-fd00161f6faf","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.08283","last_updated":"2026-05-08T07:38:35Z","snapshot_observed_at":"2026-08-11T12:55:00.545868Z","submitted_at":"2026-05-08T07:38:35Z","title":"HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:42.836549Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.08283"},"observation_digest":"sha256:bdca93f1f47c5c85c20deac37dfcca6a2921cdb78ef7a76f19bd2ce5987ba5dd","observation_id":"7dc51aac-f164-4d54-9d6c-0debb28bc28c","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:c8ee6958472c95aa1b7a5823a25426729e34ac4001a04f1e0c76809392400420","observation_id":"df6a9d0c-c0e2-445d-90c0-6dfc2db03596","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-11T06:44:47.502612Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:ba00f45efd7bda112d50ee85d6a203c6f54bf3888b909a77493da5949a9bdf63","observation_id":"9c5d05cb-84d2-4d8a-a027-80237918ffb6","resolution":{"observed_at":"2026-05-19T18:07:42.410607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.08666","last_updated":"2026-05-09T04:07:20Z","snapshot_observed_at":"2026-08-11T12:21:39.667239Z","submitted_at":"2026-05-09T04:07:20Z","title":"The Cancellation Hypothesis in Critic-Free RL: From Outcome Rewards to Token Credits","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:24:03.186413Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.08666"},"observation_digest":"sha256:f22e7b46ae99e2393518d6c3b4abf9c2bb9b22e22d821c394c0e3b64e448957c","observation_id":"df6eefd8-704e-413a-8445-6a5dd9b8bd83","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.08905","last_updated":"2026-05-09T11:57:25Z","snapshot_observed_at":"2026-08-11T11:04:38.944000Z","submitted_at":"2026-05-09T11:57:25Z","title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T02:44:33.143247Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.08905"},"observation_digest":"sha256:2359e6a46561535bda2878b9cc63db10181a617207ae141503d23148f2449a76","observation_id":"6edc0c2f-3e88-41b7-8a6a-1681d33bfdf7","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.10937","last_updated":"2026-05-11T17:59:25Z","snapshot_observed_at":"2026-08-11T12:59:30.308378Z","submitted_at":"2026-05-11T17:59:25Z","title":"Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T03:33:40.994346Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.10937"},"observation_digest":"sha256:0d93861dfb6b217b8181891f45a29526b3ec5fe49a92be8e69de624f18bd25ce","observation_id":"68621520-2191-4db4-8138-03e16bedd881","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:238dc0645bc7815b2b8b4220e7d66f781775b12912e158276b2c9306a9b1151f","observation_id":"2202c49e-bac5-4af8-b90b-363913ac368b","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T07:30:41.399083Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:947356ac2226f7d3059a33e0e243d3d97d7bd301762435886010d6e1f26c0af7","observation_id":"e84725e5-8a72-46f1-860c-cefa163fcbdf","resolution":{"observed_at":"2026-05-13T09:36:04.819624Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:5ca48126ee4eec2519920ffaf78019181e77e5b784bc235cf49842372b6ae502","observation_id":"313e936e-be72-4dfb-bbb5-d37f5199f9bc","resolution":{"observed_at":"2026-05-15T06:05:06.381914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:210d5230de0f20f748561eafb7da3de88b8af4dd4ce793a2b837636d4048bf98","observation_id":"1ceaf6ca-ea55-4278-9bc6-143d28c75a6c","resolution":{"observed_at":"2026-05-15T03:14:52.654351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:d80443db8512f9e492b698db6aa80d271bcf126b39e80749f40dbe7ca61002ec","observation_id":"d207b28e-0eb3-451d-b031-739af31a52ac","resolution":{"observed_at":"2026-05-20T20:13:43.806981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-05T13:27:59.292796Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-20T14:42:55.368104Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.17497"},"observation_digest":"sha256:e6c885b6d9f2c4324dcb027ae2fe769a15f85d51b365228e2884db9db4134f5d","observation_id":"dbf033de-1706-4492-8b27-2e756aea105c","resolution":{"observed_at":"2026-05-20T14:43:22.093104Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.20863","last_updated":"2026-05-20T07:55:06Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:55:06Z","title":"PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T02:24:48.872065Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.20863"},"observation_digest":"sha256:e8d69887b557da850fdb61e6530bda9c84dae80bf1de47a906763f5332526650","observation_id":"cf985c6e-659f-47c6-8b7e-349cbab13ea0","resolution":{"observed_at":"2026-05-21T02:29:25.316981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-08-09T22:56:29.693538Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:780265f0469bd08ca60e28e0fd6ce7d33b74b00e72daf19ee510221835236e90","observation_id":"5aead835-031d-4dfa-9f94-aac20548c730","resolution":{"observed_at":"2026-05-22T07:51:15.656925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.27209","last_updated":"2026-05-26T16:02:00Z","snapshot_observed_at":"2026-08-03T11:00:10.339186Z","submitted_at":"2026-05-26T16:02:00Z","title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T16:51:36.524194Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.27209"},"observation_digest":"sha256:56b8017f1a5ec907ec12e28c708f94f10ad9d88139c6ea3e39f74a1003a5af2f","observation_id":"1a170f90-bce1-40cf-8f98-67734c5206f0","resolution":{"observed_at":"2026-06-29T16:53:40.530817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.05118/citation-record","integrity":"/paper/2504.05118/integrity","json":"/paper/2504.05118/citation-record.json","paper":"/paper/2504.05118"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:44141a4e95a12c9346bd4d67f4b72dfa40ae6e9eb29b20c6f701e0353660946b","observation_id":"9c526576-d64f-426d-a7b5-d38ad9a8d9a7","resolution":{"observed_at":"2026-05-13T09:36:04.752542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"e2a59025-aef0-493f-83c4-f1608cf2b5f0","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:c2ba46cbde26d8bdaa64e5062b0206155cd8bc73a94b4adb1745b19053d42500","observation_id":"688ae847-41cf-4bf9-99ad-4d51fd686aa5","resolution":{"observed_at":"2026-05-13T09:36:04.802369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"1109e15b-0e77-4d1f-9248-ed7317a8400c","year":1901},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:ea644fffe22b3ed05ddd17da9d1cd51cafb2da41d5a104c55213f364c10bf888","observation_id":"00603395-7d44-44e1-8647-37c0f2f2a5a2","resolution":{"observed_at":"2026-05-13T09:36:04.794506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"815cff7d-cce6-4360-ba9e-2c1f9f716e29","year":2023},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:ad93d30c8c04fe16f0f27d4a6c4d92a7c10e47067ca2eee26419d2e2d67700c0","observation_id":"bd1a6830-eb40-412a-8e10-317612742d39","resolution":{"observed_at":"2026-05-13T09:36:04.796897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 flash thinking","venue":null,"work_id":"80f81270-beb6-4b89-835f-428d42b2ca53","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:d9cc9fb3f35c341678c8bc0375516c0f7f4e54ae46f512b9ac861daebf75fe3d","observation_id":"54bfdffd-2437-46c1-a8a4-0f7b05e304ba","resolution":{"observed_at":"2026-05-13T09:36:04.798774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:ab023734230968c54ef561521d24ad6bb105451bcf631d2fcd43d03bfa0400d1","observation_id":"4f456f52-de83-49c3-8b8e-8e5b282cc5e4","resolution":{"observed_at":"2026-05-13T09:36:04.755391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/tea.3660180102","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fletcher","venue":"Journal of Research in Science Teaching","work_id":"de79c77f-1ff6-4f5e-99e4-400161208c7b","year":1981},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:a57db1c1861812d0358dffc14288cc9e0936a93fd13b8440e17a14815cef045f","observation_id":"c3c91aa5-54f2-49a9-ab0b-555645f948ee","resolution":{"observed_at":"2026-05-13T09:36:04.749395Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":"2501.03262","doi":"10.48550/arxiv.2501.03262","metadata_source":"pith","pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","venue":"cs.CL","work_id":"557f9e99-cb00-4dd2-92fd-67ddcddbb35d","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:b5c6df0c218f95b21bb7642b609355ee331fb92f90164dcdcdae57bda9babd8b","observation_id":"58a0cc0a-0bd5-45a3-82b7-ab3fd0e67920","resolution":{"observed_at":"2026-05-13T09:36:04.758229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:52:56.973979+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:6045ee54cb06d7669e589e33559ade26d84c14ccb0da4c81e6547ab448335ef9","observation_id":"ef616619-62d7-456f-a74b-5ad3aa7cc012","resolution":{"observed_at":"2026-05-13T09:36:04.760949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6","venue":null,"work_id":"a3b9e07e-1e76-4dda-90e1-b73c1b5f55c3","year":2019},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:52d076a880c6a7e4a89421329f7a641b6bf38ab930390ecaf409c401a1a78846","observation_id":"a6ae724f-7245-45ab-9641-f226e6dab474","resolution":{"observed_at":"2026-05-13T09:36:04.808364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:a8cef6b05a3158b035517b097072105f4fcb12fa407923cb865393d980452e2a","observation_id":"c5163c66-ef4e-4a53-bf4d-ca3bca05ad54","resolution":{"observed_at":"2026-05-13T09:36:04.763589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:c31cf76a85958b7f11469e279faab9e007b7029e7ea053ce09c0d5a74a535c9c","observation_id":"c951f2f0-aba4-4e01-895c-8ea9ac7923d8","resolution":{"observed_at":"2026-05-13T09:36:04.766765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":"fcb292ce-c500-45eb-b36a-9dc24c8eae23","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:d3c9f80cbfc8b2c44b39242cfcc42d2dfaa21090f91776296d7f7b09a923f04e","observation_id":"921b92d7-9113-462c-8c72-13811903954b","resolution":{"observed_at":"2026-05-13T09:36:04.813996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-imitation learning","venue":null,"work_id":"61022874-3bae-4750-9649-93c4c0859e8d","year":2018},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:71452a769fa091b91ad7595d001e64c9a847b384b6187a93cee4ecba20925e0f","observation_id":"d9a9a1f3-3173-4c61-a174-1ed47c6594cc","resolution":{"observed_at":"2026-05-13T09:36:04.815540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:a6f54abbd4ae8bc7a9648e4f42a7f110ed711d19ab726d445e718fa066d647ff","observation_id":"e5138e53-2eb9-4d0b-b972-f5e073b20d05","resolution":{"observed_at":"2026-05-13T09:36:04.769079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T07:46:03.949962Z","title":"Learning to reason with llms","venue":null,"work_id":"dc5c0335-dfe6-4806-9cbb-82b96f27483d","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:d7d16c69398457a35fd7c99c98d4a05df0749124a19cbef23f50c37e5872a721","observation_id":"58b95e6d-9afb-43e4-abdf-6665d147f98b","resolution":{"observed_at":"2026-05-13T09:36:04.819038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.543241Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"0da889ef-5bc8-4b11-bf2b-1be51ea93274","year":2022},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:c76e881c2a8ef1b6422b6499b5ec9de4b88b91380c9ee59b7ce180cddc7d50ab","observation_id":"2a726f58-9e07-4ca2-a1f1-5c8cdf11121b","resolution":{"observed_at":"2026-05-13T09:36:04.800565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"e7294634-d50e-40b8-ade0-371ab83d3990","year":2022},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:8b045ada058e794f6893802f66596b0ceab11fe003016e63117f721873e19c5d","observation_id":"c9d45b4f-945e-4ffc-b1f4-9762d8a36c91","resolution":{"observed_at":"2026-05-13T09:36:04.804265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwq-32b: Embracing the power of reinforcement learning","venue":null,"work_id":"43117c94-80de-441c-baf4-ad6d50f759a5","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:73157f8a7ff7fcbcbb938f6d2aeb6fdc0608472315503a9667c72bb72dcbf318","observation_id":"b3ead3f9-b96a-4ad2-91a3-9e7163ea00e8","resolution":{"observed_at":"2026-05-13T09:36:04.806179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":"1506.02438","doi":"10.48550/arxiv.1506.02438","metadata_source":"pith","pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","venue":"cs.LG","work_id":"38e3ca94-96f0-4b19-a355-0754931af8be","year":2015},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:1c0bdcf2714236ec854939296fc5a0d047387daf123b7359c178c70ccf232a70","observation_id":"cb693696-b6f7-4741-8fc1-9c4f2fab8ab0","resolution":{"observed_at":"2026-05-13T09:36:04.771754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:f724ae07fbde2e3c91f36a6d5050605591d95f730976ef69d995def3e413cc45","observation_id":"4e99da7b-53a5-44bb-a92d-df802a851e38","resolution":{"observed_at":"2026-05-13T09:36:04.774430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:291b7b7acedca8b1af649e43a23cf8fbd5ee3a02040a3c2cbe2b33a33eb36e15","observation_id":"1183393e-47ab-47b0-b3c7-9b97004be1b7","resolution":{"observed_at":"2026-05-13T09:36:04.777032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22230","last_updated":"2025-04-02T13:26:34Z","snapshot_observed_at":"2026-08-07T16:30:48.967400Z","submitted_at":"2025-03-28T08:26:41Z","title":"Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":"2503.22230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.22230","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring data scaling trends and effects in reinforcement learning from human feedback","venue":null,"work_id":"b7419524-b2c2-49b3-9745-04133e8060b2","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.22230","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:74d5fcee639a57af136a4503bfd2b57800f02a2844c42ea64f91dfe55ba10320","observation_id":"c8d13674-9209-4112-805a-b9c8a65c2ace","resolution":{"observed_at":"2026-05-13T09:36:04.780461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:37:16.125440Z","title":"MIT press Cambridge","venue":null,"work_id":"08830f93-868b-452b-b434-df395bac4fbe","year":1998},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:de69b0ccd9a3ac7d68a335e03b8f0df7fb582d727b61e851810d6583507eb833","observation_id":"ca9b81a1-66ca-455b-8290-ccc2cbf5ec36","resolution":{"observed_at":"2026-05-13T09:36:04.812195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:0641e27ce1f03016a36c79fbd7160d74c629d4a8c43696ef41cd28c567c8478b","observation_id":"8c62f649-2b1f-405b-890a-38a3d1fd38a5","resolution":{"observed_at":"2026-05-13T09:36:04.782893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:9a8a041622c2b09ce6280e5d73206ab0de5038b3941fb781208b2e3c7054d303","observation_id":"84ff15ce-ebef-48c2-9808-cad69e8cdd71","resolution":{"observed_at":"2026-05-13T09:36:04.786222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chi, Quoc V","venue":null,"work_id":"760b0f42-fef2-4f9e-aa95-9b11c1b0b015","year":2022},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:51dd5020dea17c8f9a17d1a95e081d1194375f482db6a31ff524648166824096","observation_id":"f214a403-d89c-41fc-b98b-d1afd8cce16a","resolution":{"observed_at":"2026-05-13T09:36:04.817487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"75484bd2-33a3-4034-a418-509394460f12","year":2024},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:195705ec2264cfeb6dc805ba08583e242cb3f5687ea7b98efaffef2b3e53bc7a","observation_id":"718a07f0-e92b-4450-aa93-1978f6489625","resolution":{"observed_at":"2026-05-13T09:36:04.810518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:986f4c1fcdae29334009ead88cb7727db022d92bd07e9c21c1a99e0a270f74d1","observation_id":"05d07834-058b-47ae-8bb5-ea8b5f0a98fa","resolution":{"observed_at":"2026-05-13T09:36:04.788911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T17:33:49.286933Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":"2503.01491","doi":"10.48550/arxiv.2503.01491","metadata_source":"pith","pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret","venue":"cs.LG","work_id":"b9f345a1-11ca-4214-b731-220afdbef297","year":2025},"citing_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T09:36:04.735688Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2504.05118"},"observation_digest":"sha256:2f4110f46c7347c9a8b4fd879e976fd64eaeb560a52e2b10b5a4c01546996c0c","observation_id":"5c60ecf9-6bdd-416f-ad2c-0f8b063fc3fe","resolution":{"observed_at":"2026-05-13T09:36:04.792060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T16:19:05.612581+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":15,"verified_fuzzy":14},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 100 inbound Pith citation observations for arXiv:2504.05118."}