{"as_of":"2026-08-23T11:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a054dccdc89d0d7bcee4e4eaecbebc7637771b50081c9e0c37c0d2b93f52769d","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T23:54:32.621093Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.30789/citation-record","integrity":"/paper/2605.30789/integrity","json":"/paper/2605.30789/citation-record.json","paper":"/paper/2605.30789"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:54:32.621093Z","title":"H., Gendler, A., Baruch, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:8104205c6a8f4d024580e94a75377d4b6611cdee698c8e9760171ce112a5b416","observation_id":"e5184e25-d6fb-4bbd-a786-56bd3bfbc711","resolution":{"observed_at":"2026-06-28T23:54:32.621093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:c501d75f7f3850a87c78cd0650073eab7f649d12aab06b1773cb9877222ba44e","observation_id":"bfdad6d3-10ef-46a2-bef7-a27be517981d","resolution":{"observed_at":"2026-06-29T00:02:49.955865Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.06672","last_updated":"2026-05-25T01:59:00Z","snapshot_observed_at":"2026-08-15T03:51:46.044040Z","submitted_at":"2025-10-08T05:53:56Z","title":"XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation","version":3},"cited_work":{"arxiv_id":"2510.06672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.06672","snapshot_observed_at":"2026-06-29T00:02:49.998505Z","title":"Xrpo: Pushing the limits of grpo with targeted exploration and exploitation.arXiv preprint arXiv:2510.06672","venue":"cs.LG","work_id":"c1e825b8-b415-4c32-a6a6-b434dbb9a276","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2510.06672","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:4cd3cb98142a59f07dc491b976d0510200ea2acb6f4ce0cd02d3e608eac6b6c9","observation_id":"5678be66-f935-438d-b473-6875f7e76362","resolution":{"observed_at":"2026-06-29T00:02:49.999721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16737","last_updated":"2024-10-07T19:37:10Z","snapshot_observed_at":"2026-08-16T13:22:50.405013Z","submitted_at":"2024-08-29T17:32:35Z","title":"Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling","version":2},"cited_work":{"arxiv_id":"2408.16737","doi":"10.48550/arxiv.2408.16737","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.16737","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bansal, A","venue":"arXiv (Cornell University)","work_id":"a01c0015-f550-4bc7-bec6-9de4ffd6bd75","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2408.16737","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:a8c471a3829275b3171ebad65978c9153d95c21a87d98c46ff28596574891527","observation_id":"cee07469-cbc6-4be3-ba94-bfd7660981d9","resolution":{"observed_at":"2026-06-29T00:02:49.994111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":"2403.17297","doi":"10.48550/arxiv.2403.17297","metadata_source":"pith","pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternLM2 Technical Report","venue":"cs.CL","work_id":"dfa13e0e-1c3c-4fb6-943d-a19945bacdbe","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:c35625e23bffcc24685ded76d84f8e85a6badfa78e79cd87abfccc43329eaf63","observation_id":"cbcfb6d9-d078-4531-8dc4-62f770210d5b","resolution":{"observed_at":"2026-06-29T00:02:50.016446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:56:29.061325Z","title":"arXiv preprint arXiv:2505.09655 , year=","venue":null,"work_id":"f303b12c-5cef-494d-a329-b01b36477b0a","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:f34d4f2628877c0ca1c8b719cda97552800bec9dab0142656a3523152d796a1f","observation_id":"dbdbb877-69c4-4293-960d-ff94d5e1a27a","resolution":{"observed_at":"2026-06-29T00:02:50.013894Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:07.246466Z","title":"Jackpot: Optimal budgeted rejection sampling for extreme actor-policy discrep- ancy","venue":null,"work_id":"f0288666-a7a4-4813-8b9c-b580e1eda1e2","year":2026},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:41a0d5e9699c10bdb30e1a6a58b9503a33f1e280a8c2f07050a0c2d30a21a554","observation_id":"a6dbc338-87b0-4128-8cd4-667a5b19763e","resolution":{"observed_at":"2026-06-29T00:02:49.992299Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-12T16:05:03.602321Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:504085a1fe2dca871b9a9e8b6bfbc58244c8e131c56d8aa5c57234ed56c4d4c1","observation_id":"b0bb883e-4a60-4bb8-bfc1-db939bbe8524","resolution":{"observed_at":"2026-06-29T00:02:50.005480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:54:32.621093Z","title":"Minillm: Knowl- edge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:2b1717fd261b6a879a606e1e084ed9451c3e5d630a5d4cf057cc678057dbee45","observation_id":"34c1a450-5466-497c-be0a-2b225c0a4981","resolution":{"observed_at":"2026-06-28T23:54:32.621093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20194","last_updated":"2025-03-26T03:37:52Z","snapshot_observed_at":"2026-08-16T12:46:47.395574Z","submitted_at":"2025-03-26T03:37:52Z","title":"GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization","version":1},"cited_work":{"arxiv_id":"2503.20194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20194","snapshot_observed_at":"2026-06-29T00:02:49.975961Z","title":"arXiv preprint arXiv:2503.20194 , year=","venue":null,"work_id":"1ffb39a6-7543-4c31-8d99-5b4f6d535be2","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2503.20194","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:ba749a7a16fd26087d4125623451fd351deddea06c8ae025dfd9bf472d8114a8","observation_id":"b8ea111c-6918-4653-8877-3d35b65f6623","resolution":{"observed_at":"2026-06-29T00:02:49.977641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:5ded890f037c68eb19ae608c2185fde57a24ba53ac0c6b22e5245f408eb79ab2","observation_id":"877c50ac-8167-4cef-bc55-0d4066c5986e","resolution":{"observed_at":"2026-06-29T00:02:49.927751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-08-20T15:12:11.590394Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"cited_work":{"arxiv_id":"2510.10150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10150","snapshot_observed_at":"2026-07-04T08:29:41.999322Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","venue":"cs.LG","work_id":"32e0712a-e9d7-451f-8c18-f895f13eab70","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2510.10150","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:324d0c6686b7484de5a69a582a8a9f690bb9e50174f8e467331f9c3369708af5","observation_id":"e65d567a-c42f-4869-a487-3b2fea9c97ff","resolution":{"observed_at":"2026-06-29T00:02:49.943309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:d989a13069224df891abed18aa713573168fa982f13773dba4ad6363de6eddb2","observation_id":"9cf8a0d8-343e-48f9-8834-0ff07d2702ba","resolution":{"observed_at":"2026-06-29T00:02:49.930578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:672d8fc96a7646d521b404b6e29e61885083b54f23e38c34e2cafd92387f7928","observation_id":"2d32e68f-3b47-4b32-8ab0-b5f12967a60d","resolution":{"observed_at":"2026-06-29T00:02:49.999456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:464663e0a5cfd6e625b77e2f6d28ba70a0b8b9ce14edf097ec7fb6b16c5fd5bd","observation_id":"f8108edc-e84b-4b92-abd4-9be625991368","resolution":{"observed_at":"2026-06-29T00:02:50.008144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-16T14:56:35.674907Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":"2403.07691","doi":"10.48550/arxiv.2403.07691","metadata_source":"pith","pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":"cs.CL","work_id":"93ad9e7b-6db2-4249-a0fa-8a96ef124d53","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:53a80f4ac96cbda798e66dbe57df870c8d3e24fabf67494a490a7567caf17654","observation_id":"2f1e0915-0195-4718-ac64-e0c8493060fa","resolution":{"observed_at":"2026-06-29T00:02:50.005155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T12:58:08.761053Z","title":"Qerl: Beyond efficiency– quantization-enhanced reinforcement learning for llms","venue":null,"work_id":"0bcdf8a7-7852-486b-a113-1647508d8c87","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:8af5564d514c86071f49d8e6f27166cfa30863feb5c151c73713cb3135347248","observation_id":"30cc35bc-d992-49a3-977c-09b4320d912e","resolution":{"observed_at":"2026-06-29T00:02:50.011057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05993","last_updated":"2026-04-19T11:25:47Z","snapshot_observed_at":"2026-08-23T09:47:22.510489Z","submitted_at":"2025-11-08T12:50:41Z","title":"Revisiting Entropy in Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2511.05993","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.05993","snapshot_observed_at":"2026-07-04T03:49:30.169449Z","title":"Revisiting Entropy in Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"80adc027-2a49-4795-af10-381a8bf9557c","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2511.05993","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:1a9c6873a546fea49842aaf22e834cbd40fddb6a4a42bf1ee98545e2414d0f72","observation_id":"5a3bc79c-67c2-4a6c-9464-b222eb19007a","resolution":{"observed_at":"2026-06-29T00:02:49.991625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.14925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:29:50.890043Z","title":"A survey of reinforcement learning from human feedback.arXiv preprint arXiv:2312.14925","venue":null,"work_id":"c77a7cf8-1b17-4b88-9704-46dee2f8ca0f","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:69a5c1096a922d835232150d1afd8062bfe308633354da0fbc256a366364cd27","observation_id":"b75fb654-4b5b-422b-90b6-17d0088be00e","resolution":{"observed_at":"2026-06-29T00:02:49.997022Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21495","last_updated":"2025-06-26T17:25:49Z","snapshot_observed_at":"2026-08-16T08:59:36.284719Z","submitted_at":"2025-06-26T17:25:49Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","version":1},"cited_work":{"arxiv_id":"2506.21495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21495","snapshot_observed_at":"2026-07-04T20:40:08.218379Z","title":"Bridging Offline and Online Reinforcement Learning for LLMs","venue":null,"work_id":"59281c5e-5f1d-4aea-8621-3b9a8e29182b","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2506.21495","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:b07f2a22f7c1db11ea4a7f5eb5d9ed6da74ec24732476a9dd9703d6d59d3b394","observation_id":"7465628b-7cca-4c32-8f66-7c8684b401f7","resolution":{"observed_at":"2026-06-29T00:02:50.010858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-20T03:46:40.707829Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"cited_work":{"arxiv_id":"2411.19943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19943","snapshot_observed_at":"2026-07-08T01:14:27.537549Z","title":"arXiv preprint arXiv:2411.19943 , year =","venue":"cs.CL","work_id":"ba6fd699-ba05-4ff7-a077-bbcade21f6e4","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2411.19943","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:6c7b0c28e30ef88dfd3b0eb4011077421101bbd310d8c8120c5d6d9efd033242","observation_id":"a4016e76-460e-4422-a3b5-7515261b4ea6","resolution":{"observed_at":"2026-06-29T00:02:49.986417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22257","last_updated":"2025-05-30T03:55:41Z","snapshot_observed_at":"2026-08-17T19:23:37.482395Z","submitted_at":"2025-05-28T11:42:33Z","title":"Revisiting Group Relative Policy Optimization: Insights into On-Policy and Off-Policy Training","version":2},"cited_work":{"arxiv_id":"2505.22257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22257","snapshot_observed_at":"2026-07-04T08:09:40.626687Z","title":"Revisiting group rel- ative policy optimization: Insights into on-policy and off- policy training","venue":null,"work_id":"6a3cdbc2-27a6-44d4-8d98-35c8234b8616","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2505.22257","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:8c2c23cee1d5ba36c6d2ff1381d17db630aba739d5cb71fcff6b0197f5d42455","observation_id":"4561501a-a758-465f-99a2-04e64f88cb82","resolution":{"observed_at":"2026-06-29T00:02:50.008096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.01082","doi":"10.48550/arxiv.2407.01082","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"N., Baker, A., Neo, C., Roush, A., Kirsch, A., and Shwartz-Ziv, R","venue":"arXiv (Cornell University)","work_id":"fe0df337-9f35-4781-8063-a0595d03a3f4","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:b9706e74fe65fa8b928a8f6a27bd34e1ba9dbcdac61d1be07a85801c229606bb","observation_id":"acb52fa1-ebfd-4aca-a3c6-894ff4fcae75","resolution":{"observed_at":"2026-06-29T00:02:49.965115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:35.684737+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:35.684737+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:97ba5df359f9b17049dcec06dba367f2ccbe9c6c09bcc5dd5ea169b993047160","observation_id":"71d18420-4c65-4d7f-b1aa-5832cc82b84f","resolution":{"observed_at":"2026-06-29T00:02:49.994581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:a7485d5a31f242fd3bd49e38b9422cdc7151327b524f17b430ba33df7e607c44","observation_id":"f09f70c8-c90a-4d02-8d65-37e642f77bc8","resolution":{"observed_at":"2026-06-29T00:02:49.974561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:cb41ca16e4fd4563969706afdd4242987c369fcae03a6d12c966a58689dde420","observation_id":"41debccd-ddd4-44db-af2c-9b54ce718dbe","resolution":{"observed_at":"2026-06-29T00:02:49.982521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T23:54:32.621093Z","title":"Unchosen experts can contribute too: Unleashing moe models’ power by self-contrast","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:ec0c6c0c7223bd7d0ec9adc1249e058ef8b29e88fe659cdc36edf551e2c3e76e","observation_id":"807a29ab-7504-4fbb-90be-3cbbad3e2165","resolution":{"observed_at":"2026-06-28T23:54:32.621093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-08-15T23:34:04.639134Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":"2510.08141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-07-03T20:48:56.103707Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","venue":"cs.LG","work_id":"2f46a012-7c98-4bac-ba71-c90d6b4b7fc5","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:bb3fccd36c7a6b6a55ce0557ca6d20b67d6eb55636806483fb40caa248b7ec9e","observation_id":"a7b14d4f-91b1-4a2d-808d-11550e860520","resolution":{"observed_at":"2026-06-29T00:02:49.965076Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:5fbede21fa6b06f50e29469f3d76096f4a946f7d2d7554a3060f233f0b9fe432","observation_id":"7b9f45e6-bdd6-4685-9e04-d696d82f0e07","resolution":{"observed_at":"2026-06-29T00:02:50.002850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.09696","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T01:36:25.609734Z","title":"and Zuo, C","venue":null,"work_id":"6a78d888-f8e3-40a2-a776-9656f16a07fe","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:0ed7b7bf6516464562d0c468076f72b2b2aa07f33599115480b433b88db95a4a","observation_id":"bf9d075f-f5e3-4959-85d5-4501d0fd92c0","resolution":{"observed_at":"2026-06-29T00:02:49.977302Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-17T10:41:25.212329Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:21422f4b7c5e72ee0442d5ab44c786db14bcbc54f422d75d2613e14e568f9f64","observation_id":"d573ebba-a89f-4ef3-9e76-5f893d5e3882","resolution":{"observed_at":"2026-06-29T00:02:49.989463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-21T02:04:30.074424Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:8d77cd4c3f9a420f8ab3bdeadd9d5a3256c01374e1f8e3604b2472892f0eea44","observation_id":"f290c786-bea9-40a4-8232-55794a183199","resolution":{"observed_at":"2026-06-29T00:02:49.946076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.394004Z","title":"Exploring multi-temperature strategies for token-and rollout-level control in rlvr","venue":null,"work_id":"176f10fa-68a7-4fe9-a839-87a35639a826","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:2f505dd6d91cd0deec7ebddd49eec3e3be283b7909f1d74869122a114a6213b9","observation_id":"71cbf156-beb6-406f-a1d3-0c7dea7708d2","resolution":{"observed_at":"2026-06-29T00:02:49.986252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:38:39.386586Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":3,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2605.30789."}