{"as_of":"2026-08-08T09:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f33dc73a6f30d41a0dbbbfae1fa1b2ac6a89295e3e1f7a40c207db426ab4f69","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:45:41.982954Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T14:49:39.188220Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:09:29.035824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2512.15146","last_updated":"2026-05-06T13:57:35Z","snapshot_observed_at":"2026-08-02T09:49:08.275256Z","submitted_at":"2025-12-17T07:21:54Z","title":"Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T21:53:30.911773Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2512.15146"},"observation_digest":"sha256:8c45d294a39df1239561726e6479beef868834e650d7b01f261919bf8886abbb","observation_id":"c7f55504-31e6-49ef-94f0-d257b98496ea","resolution":{"observed_at":"2026-05-16T21:53:35.117871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:2d7f9e8b7b1ce3c8549678f04a99b21a6d366072f2d8a0021fe0ec267a4e5561","observation_id":"0017b414-69ab-4557-ba87-51182b5626e4","resolution":{"observed_at":"2026-05-12T03:16:19.312129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2605.28247","last_updated":"2026-05-27T09:58:05Z","snapshot_observed_at":"2026-07-06T23:37:50.157617Z","submitted_at":"2026-05-27T09:58:05Z","title":"IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T14:49:39.188220Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2605.28247"},"observation_digest":"sha256:b60ba67343b14f697ee28b1b21c23a385cd206cb93bd594577d32c042b3819a9","observation_id":"3a17c0a3-cb51-4d50-becd-eea6adcefb54","resolution":{"observed_at":"2026-06-29T14:53:31.190838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:ce7a9a48c4c0fea45f7612078e38e174c21871922326ce444ef5d58b6f1e46a1","observation_id":"30d0e72f-8d3b-44f4-9bf3-76c60791f499","resolution":{"observed_at":"2026-07-01T21:16:13.366003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.04503","last_updated":"2026-06-03T06:34:42Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:34:42Z","title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T06:55:09.927034Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.04503"},"observation_digest":"sha256:c40a10a195dc9f81d99c73b1d24408da8c1cba0a1554c531e1f2a84ff9962735","observation_id":"0d6c5df4-001e-4297-abea-637ad4718b16","resolution":{"observed_at":"2026-07-02T07:26:46.260794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.09380","last_updated":"2026-06-08T11:57:17Z","snapshot_observed_at":"2026-08-02T13:37:53.223013Z","submitted_at":"2026-06-08T11:57:17Z","title":"Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T17:18:03.459289Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.09380"},"observation_digest":"sha256:0343b3943798fff261158072908b63a8c1716142b727e776fd229628a097cd08","observation_id":"642a7c29-2225-48ce-a3f3-600d24e1f83a","resolution":{"observed_at":"2026-07-03T00:17:29.544665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.19750","last_updated":"2026-06-18T03:31:19Z","snapshot_observed_at":"2026-07-06T23:55:01.487552Z","submitted_at":"2026-06-18T03:31:19Z","title":"Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T18:29:47.613424Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.19750"},"observation_digest":"sha256:78064be8a64adc45ca7ac42eca20e5313394f323d60cfbfa695033730c5c125d","observation_id":"c639ed77-de36-4ef0-ae45-59cbff164918","resolution":{"observed_at":"2026-07-04T03:09:29.037593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01321/citation-record","integrity":"/paper/2509.01321/integrity","json":"/paper/2509.01321/citation-record.json","paper":"/paper/2509.01321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.195171Z","title":"This objective aims to select a subset Y that is both diverse (as captured by det(SY)) and influential (as promoted by the product of weights ∏i∈Y wi)","venue":null,"work_id":"3d2fa4e8-73e5-4dc1-a03a-debb78887885","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.966040Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:afcdd96a46df1643161b8217639b90fa1b9fe745c01f740122cb7f0776a59f4e","observation_id":"88bfa3fa-7790-4cb2-a1f6-177f484a5ec9","resolution":{"observed_at":"2026-08-05T12:45:42.198696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:45:41.919862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.919862Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:e7eeaf70d342341615daf7e4fa60253a6c477fe767aefeaeefb7ed421504dfe1","observation_id":"5a34c283-42b9-4ecd-8940-9542f172ac93","resolution":{"observed_at":"2026-08-05T12:45:41.919862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1207.6083","last_updated":"2013-01-10T20:43:53Z","snapshot_observed_at":"2026-07-06T02:52:34.943660Z","submitted_at":"2012-07-25T18:45:43Z","title":"Determinantal point processes for machine learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.6083","snapshot_observed_at":"2026-08-05T12:45:41.926767Z","title":"Determinantal point processes for machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.926767Z"},"links":{"cited_paper":"/paper/1207.6083","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:bc728154104a990847c15e05aebca0bda66da41551c6844d84c1bebd4bd4f345","observation_id":"c075a77f-a5b2-4ff2-bfd0-c722d676654b","resolution":{"observed_at":"2026-08-05T12:45:41.926767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T12:45:41.937712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.937712Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:58079561e2f4086cca3ef17e95d558b6450f5729cc3fb83f42d6a07b108fd065","observation_id":"c9397d96-dbf1-4a87-929b-45ee2b2021b6","resolution":{"observed_at":"2026-08-05T12:45:41.937712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T12:45:41.944746Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.944746Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:56fa390d159b83766bf4c55550d37c13db181d48e35a54c22009ce88c5b6c129","observation_id":"0bd7a51a-db29-4631-b72a-09e361584711","resolution":{"observed_at":"2026-08-05T12:45:41.944746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T12:45:41.948669Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.948669Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:08b31931159aeff3596dd511ce1cd3d6b75aef4ed613fcc4a2fc1a00ef6011b3","observation_id":"d1159417-894d-428f-a0b1-3afcd9f06bff","resolution":{"observed_at":"2026-08-05T12:45:41.948669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T12:45:41.952290Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.952290Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:88dc3e8d0e51cc2b20d777e78f3c834db8f4112c07101bbf4465f688d7b4ec08","observation_id":"a9dcc236-a80b-4850-bcbb-1a067acc5307","resolution":{"observed_at":"2026-08-05T12:45:41.952290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-06T01:09:31.956094Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08819","snapshot_observed_at":"2026-08-05T12:45:41.956023Z","title":"Yue, Lovish Madaan, Ted Moskovitz, DJ Strouse, and Aaditya K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.956023Z"},"links":{"cited_paper":"/paper/2412.08819","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:9af3634ca3c1503f49a2e24e6e4cda896cf8191854531bcbe1c24653d934f557","observation_id":"43746aa5-ec9c-4df8-8e5c-4f0de72a7011","resolution":{"observed_at":"2026-08-05T12:45:41.956023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T12:45:41.959563Z","title":"V APO: efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.959563Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:6dbd7b6fea722875587bea4dc5baae5d5122d6e9e01639a029e4d1ae3cb07d5b","observation_id":"bcf8172e-f661-4089-b7e5-131ca1103dfb","resolution":{"observed_at":"2026-08-05T12:45:41.959563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T12:45:41.962651Z","title":"A survey of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.962651Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:03147092dacda06c179cd7928516c9ff2c1ac6fb8ded60b670420ac642d66dcb","observation_id":"5e0a894f-8988-445e-8468-2d97eeda04ba","resolution":{"observed_at":"2026-08-05T12:45:41.962651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.184654Z","title":"We train DeepSeek-R1-Distill-Qwen-7B and DeepSeek-R1-Distill-Llama-8B on 64×H200 GPUs, and Qwen2.5-Math-7B on 32×H200 GPUs","venue":null,"work_id":"393f21e2-7726-4e38-8a34-ba0220586614","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.969785Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:f031dfc827a96e209c84f0b2ceeb102445eb288202840d5726d0e0594863d40a","observation_id":"48f3f476-4dc4-4040-9d57-7bfa4cf05fbe","resolution":{"observed_at":"2026-08-05T12:45:42.188191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.155416Z","title":"We follow Zheng et al","venue":null,"work_id":"28197969-edbe-436c-bea4-d4008faf78ed","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.979652Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:1e40fdcfd962fb6340f9890f4f63e276a083bb79338907f31778d81e68f536c1","observation_id":"6e6c5ecd-519d-4fa9-952d-eb28c627c9b0","resolution":{"observed_at":"2026-08-05T12:45:42.158494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.143088Z","title":"• Random: Randomly samples data from the training set","venue":null,"work_id":"6851933c-c626-41b2-910c-5a9b365c5582","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.982954Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:f717da4d3278a6432f11648fc4a0831a06f25c616b9c951472e51d9a19f56c67","observation_id":"c3b2bdac-a2c9-44be-987f-c4d4608ca16d","resolution":{"observed_at":"2026-08-05T12:45:42.148614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.174819Z","title":"Similar to Yue et al","venue":null,"work_id":"4042df5c-089c-493e-82d1-886787b95a49","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.973389Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:e3a69339f873ae64f1ef731d6476ddc3e86f1d9e4007c548f78805faeb99932c","observation_id":"ceba9f09-7548-451a-a022-897a36409df8","resolution":{"observed_at":"2026-08-05T12:45:42.178162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T12:45:41.916058Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.916058Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:49bd29cc1222cdac2c01e7bb29851e3d5859a7f02ff0ddf2c780178ea2f1b711","observation_id":"c3b6a25e-7df7-48b1-9668-7093fca649c4","resolution":{"observed_at":"2026-08-05T12:45:41.916058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.165079Z","title":"User: \\n [question] \\n Please reason step by step, and put your final answer within \\boxed{}. \\n \\n Assistant:","venue":null,"work_id":"65adec8c-47b6-4ac3-baa2-9fb41950c07d","year":2021},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.976582Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:eb8dea9bdd92208041260c57384c501839181caed28c3a11ac180f7bbf1af811","observation_id":"05558ae2-4940-4aa7-8ec2-355ffabdf59b","resolution":{"observed_at":"2026-08-05T12:45:42.168425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T12:45:41.923179Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.923179Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:3df35064b55af077ba9f5df9e54b275bf189789f8f7c04e6d276b4a01599bff3","observation_id":"5bda1edf-bfb7-4388-b30d-6e23b180f3e0","resolution":{"observed_at":"2026-08-05T12:45:41.923179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11480","last_updated":"2026-04-25T08:46:54Z","snapshot_observed_at":"2026-08-07T21:28:45.095079Z","submitted_at":"2025-06-13T06:05:58Z","title":"LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11480","snapshot_observed_at":"2026-08-05T12:45:41.930273Z","title":"Learnalign: Reasoning data selection for reinforcement learning in large language models based on improved gradient alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.930273Z"},"links":{"cited_paper":"/paper/2506.11480","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:39f062ce8b4fd85043a6101e402104e95d8402a6ffeae649452d67b7a5cfe336","observation_id":"2940da6b-fcee-47ff-9612-fdcb03b71617","resolution":{"observed_at":"2026-08-05T12:45:41.930273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T12:45:41.941078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.941078Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:65b0d080c128b6cfc2258582dd6c58b96fda0e7d040c979c2070bad04a0afa16","observation_id":"6deb6c8d-754b-4b7d-ab59-6d44bd4c19f8","resolution":{"observed_at":"2026-08-05T12:45:41.941078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T12:45:41.933948Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.933948Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:dc3bbf77a8ad36e1658ddb2bf5cd91e697a92f53fcc4777d23dd27f447335d23","observation_id":"b113e1de-a27c-4a7e-9a9b-8bb9bd634cc6","resolution":{"observed_at":"2026-08-05T12:45:41.933948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.204985Z","title":"Zachary Ankner, Cody Blakeney, Kartik Sreenivasan, Max Marion, Matthew L","venue":null,"work_id":"300b967e-93d1-4e14-a9a9-da4875bbbb2e","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.912268Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:7e21838c713153ca7f3fcd7e911c85475d7608319916c7683ded09d4fee2eeda","observation_id":"fa6945b6-7936-49d9-b632-7454cdcb75f3","resolution":{"observed_at":"2026-08-05T12:45:42.208226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T12:45:40.381229Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 7 inbound Pith citation observations for arXiv:2509.01321."}