{"as_of":"2026-08-10T04:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b5e18f6029e49e40c858e8d6475b29f9c0e764e38ba3d100fae774a51ddd6c3","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:29:01.355429Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26253/citation-record","integrity":"/paper/2607.26253/integrity","json":"/paper/2607.26253/citation-record.json","paper":"/paper/2607.26253"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-01T00:28:58.772850Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.772850Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:29a4ea2bdca284a19d3d2dd30bbcf2cb520ade40e0c31042465ceab2bca0b4cb","observation_id":"f23f478a-906b-4dba-8968-13c4034c7211","resolution":{"observed_at":"2026-08-01T00:28:58.772850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.283631Z","title":"Defaults and history warm-start.Defaults: B=64, k=8, n0=2, τlow=0.45, commit_min=k, prior Beta(1,1) , safety budget cap 6Bk","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.283631Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:43f5be97c39b0b4f73b60b5b16e2975079498bb18390d1a35242cdc1edc39b6a","observation_id":"42fec385-0f6c-4a7f-ad42-4db7fd3f3f69","resolution":{"observed_at":"2026-08-01T00:29:01.283631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-01T00:28:59.222616Z","title":"REINFORCE++: Stabilizing critic-free policy optimization with global advantage normal- ization.arXiv preprint arXiv:2501.03262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.222616Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:22b1203c358f5d45b4160dc8a9e3aec9146486063a6603402a4cb3a3fa838941","observation_id":"80cda614-70f7-4fb0-94b9-7af2c0d2baba","resolution":{"observed_at":"2026-08-01T00:28:59.222616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-01T00:28:59.355379Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.355379Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:d779b6f7aca25960057bb84ec049019a02ec87f8757064664adf98360bece972","observation_id":"a215fe56-9b28-4714-8304-5cbabf1ac35b","resolution":{"observed_at":"2026-08-01T00:28:59.355379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-01T00:28:59.555279Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.555279Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:f7d22e82512e70d1eedb9b1cb767e32fabc39fa5d355f9cf242dbc3bf2372830","observation_id":"d20c8011-8bc2-4e66-9541-d47de759d950","resolution":{"observed_at":"2026-08-01T00:28:59.555279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-01T00:28:59.796151Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.796151Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:7d6d44eae663c109a4df9c4ec02765d6db0625357a92ef47fd0ac63fc96bafd6","observation_id":"03a342d7-a398-48f5-8ca1-385ab2de3150","resolution":{"observed_at":"2026-08-01T00:28:59.796151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-01T00:29:00.198248Z","title":"Hybridflow: A flexible and efficient RLHF framework.arXiv preprint arXiv:2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.198248Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:d7b7e15f07659314a687e8e024597bcefea74bdfd9c9434d360b5728a6b3786b","observation_id":"42201871-fb30-4c5a-ad08-3988bd9e9c67","resolution":{"observed_at":"2026-08-01T00:29:00.198248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-01T00:29:00.283036Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.283036Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:a123ed639c7a2304b969409311e3a6bc145d22b2f016266ae0e0714f439b248d","observation_id":"89732fa3-96a4-41fc-be18-bd4b341bf644","resolution":{"observed_at":"2026-08-01T00:29:00.283036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T00:29:00.379265Z","title":"Kimi k1.5: Scaling reinforcement learning with LLMs.arXiv preprint arXiv:2501.12599,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.379265Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:990806e40e3a5356549a8648381cff971c587f07765cfd1d67b4c2db45851b99","observation_id":"50571580-36a6-424a-8913-78de2b074c5c","resolution":{"observed_at":"2026-08-01T00:29:00.379265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T00:29:00.565728Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.565728Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:41eae00fea0f35f507deec4f72dc10e1bcd8a31685d858a7b4e0658cc3e87235","observation_id":"b6913b44-d6af-4024-8b77-0ff5d948533a","resolution":{"observed_at":"2026-08-01T00:29:00.565728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-01T00:29:00.654824Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.654824Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:c5d1e0f610760fe563659112a5555273e9550069a5b778a6247253788d24ffd3","observation_id":"6a948e6b-bf0d-41df-8312-9c2aaf43771d","resolution":{"observed_at":"2026-08-01T00:29:00.654824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T00:29:00.753300Z","title":"Dapo: An open-source LLM reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.753300Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:69f1b59557695a96061c11d06dedfb1074edf2e7f7da20cc45509d3c5e5e2fd2","observation_id":"338eaa19-99eb-44a7-8929-46ed9e353858","resolution":{"observed_at":"2026-08-01T00:29:00.753300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-01T00:29:00.841014Z","title":"Srpo: A cross-domain implementation of large-scale reinforcement learning on LLM.arXiv preprint arXiv:2504.14286,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.841014Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:3ecdc1c3babd3bcc1484f8cc29c08384237147b0b19d8ae3676bd8e9ca4fafa6","observation_id":"0721e090-647b-4ff0-8756-616091f58f48","resolution":{"observed_at":"2026-08-01T00:29:00.841014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-01T00:29:00.908981Z","title":"Act only when it pays: Efficient reinforcement learning for LLM reasoning via selective rollouts.arXiv preprint arXiv:2506.02177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.908981Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:74bdb6996c66c28ba0237e95a61531899f839031a21949e11583b06023913994","observation_id":"3ea09dec-71d9-4b2d-9af3-1544d52c4ef9","resolution":{"observed_at":"2026-08-01T00:29:00.908981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11119","snapshot_observed_at":"2026-08-01T00:29:00.970654Z","title":"Trace: A unified rollout budget allocation framework for efficient agentic reinforcement learning.arXiv preprint arXiv:2606.11119,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.970654Z"},"links":{"cited_paper":"/paper/2606.11119","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:0326284abbf005e52f4083d41f062a017d27da50c4a2afb54850d466f6baa947","observation_id":"f751cbeb-b77d-4a11-9dca-32146724e119","resolution":{"observed_at":"2026-08-01T00:29:00.970654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.076408Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.076408Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:990510df8e092350da7b16313c8c981e1c2609ef37b879fd1f3643d91c662233","observation_id":"86be6341-bbd2-4899-a9b5-1988a1810648","resolution":{"observed_at":"2026-08-01T00:29:01.076408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.128562Z","title":"(ii) Rollout allocationsets how many rollouts each prompt or trajectory prefix receives (Zou et al.,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.128562Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:a90f8ac4eb9fb8597f1c536325f85cce4955e20e6e246c2b43f3e2b07cf6b291","observation_id":"65024ccb-bf7c-4201-81e3-831653382380","resolution":{"observed_at":"2026-08-01T00:29:01.128562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.176326Z","title":"These all commit budgetbeforea group’s own rollouts are observed (evaluate-then-filter even pays full groups for the prompts it discards)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.176326Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:5f00f2215ab7f9119e29d7d6c5b66bd1db223b11453b4f4305e8f5e152d3c15e","observation_id":"5d05d1d9-2726-4d08-9d4c-4cedbba0ae2a","resolution":{"observed_at":"2026-08-01T00:29:01.176326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.227004Z","title":null,"venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.227004Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:67d5ec6b971f72054e1b68ed3f01dab5bbfbd532b387c9ee1dc06666ffaca594","observation_id":"9d4b39cd-b87b-4933-b6a4-f9311b6897a8","resolution":{"observed_at":"2026-08-01T00:29:01.227004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.355429Z","title":"effective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.355429Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:757961f48fec1254208c3a7d31911605fbc32da1a52ecdf55631ae10d90bf011","observation_id":"107fcae4-0df2-49d0-b34f-af1453ae0ee4","resolution":{"observed_at":"2026-08-01T00:29:01.355429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-01T00:29:00.474113Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":1945,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.474113Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:fd4fae46c13dc1525ab9a16bfcc1241d6260247d21814de82dc71a69ce55389a","observation_id":"d9b913fd-6f47-4257-9f9b-58bbc8cb07c8","resolution":{"observed_at":"2026-08-01T00:29:00.474113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-01T00:28:58.867107Z","title":"Towards reasoning era: A survey of long chain-of- thought for reasoning large language models.arXiv preprint arXiv:2503.09567, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":1972,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.867107Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:5d2f9f5d78caa2a048c1cfaa756fbfedf557cacb5fab34bef7410d13e74b2671","observation_id":"0e536f69-a577-4dbf-aebd-b9ed1efaece0","resolution":{"observed_at":"2026-08-01T00:28:58.867107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T00:28:58.901148Z","title":"Deepseek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":1979,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.901148Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:ee3dd48a335ffc455b13a1511f43d69906046a6c08e0dd80c4a94e093e10dd6c","observation_id":"bfe76079-caa6-419c-a7f0-f4b776a83209","resolution":{"observed_at":"2026-08-01T00:28:58.901148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:28:58.813150Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning.arXiv preprint arXiv:2504.03380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.813150Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:e436db297af3477678c062238bff6f02f34236d89241504bad412e99dff21628","observation_id":"d27429d3-9be6-4af5-bdb1-fb5f2928fe5e","resolution":{"observed_at":"2026-08-01T00:28:58.813150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T00:28:59.925404Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.925404Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:01cc04944c1eaeae17e24214c51086416f5c3d37349d56367a161797f571bdc2","observation_id":"4a5b7f07-c35e-4f2d-b4f6-3fd4177e587e","resolution":{"observed_at":"2026-08-01T00:28:59.925404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T00:29:00.088737Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.088737Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:dc7d43b2373059fd4f1e4b22f3d88004bbaf3957ef0784736cb2a3ffc71d536f","observation_id":"766ae64a-0c69-4538-a432-6701f12ac801","resolution":{"observed_at":"2026-08-01T00:29:00.088737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-01T00:28:59.149242Z","title":"Thinkprune: Pruning long chain-of-thought of LLMs via reinforcement learning.arXiv preprint arXiv:2504.01296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.149242Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:9043d59d8f60408ce6c512bbc51046b4c418043b11eec8dfd310058237ad52e1","observation_id":"b92f760c-8126-4a5a-9a47-8ad5b54f81bf","resolution":{"observed_at":"2026-08-01T00:28:59.149242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-01T00:28:59.453562Z","title":"Limr: Less is more for RL scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.453562Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:33894b1841cebe6d59584f239b9e9fdd67e8c2c246a8054310a93795d8a99527","observation_id":"3843b153-84fa-4fee-90af-fe3a27f6222c","resolution":{"observed_at":"2026-08-01T00:28:59.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:28:59.637477Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models.arXiv preprint arXiv:2503.22342,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.637477Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:5198dac4e37767f576501f6a52ca4921f50348e86b01388410ae8b7404dd796d","observation_id":"069b4b90-4905-48ac-95f9-942c72db07fd","resolution":{"observed_at":"2026-08-01T00:28:59.637477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-01T00:28:59.008112Z","title":"Measuring mathematical problem solving with the MATH dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.008112Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:3dec6004be66861846178cd80b30588a339069ebe4edabba41321756d8722add","observation_id":"a1edf779-0458-4b8a-8c0d-1383f6c1e6a8","resolution":{"observed_at":"2026-08-01T00:28:59.008112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-01T00:28:58.939296Z","title":"Olympiadbench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:58.939296Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:22171f42f589dcb856081960ae4b5945a2979e20549b31e193562514ea1726c2","observation_id":"fc8e48d2-c3bb-4426-b1cc-fa095e22f5fa","resolution":{"observed_at":"2026-08-01T00:28:58.939296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:29:01.024615Z","title":"No LLM was used to generate experimental results, proofs, or claims; all theoretical statements and their proofs (App","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:01.024615Z"},"links":{"citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:9373d939e718ecfdfe5f32ce698fc2c8c05b5940202317d39376018c7879b985","observation_id":"0dced1ec-316c-45e3-85e1-ccff69ffac64","resolution":{"observed_at":"2026-08-01T00:29:01.024615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.26253."}