{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48b8adc875bb3249cc26f8f4593a68da27ae76b14a9da098383c78ee17fac0c8","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:26:11.192134Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:52:47.185967Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.935150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d2eb5a10ecd50e13be41665fb2743fbfb741b55fef8abda733fba348d430c62a","observation_id":"cf2cc2bc-117b-4cd6-847a-ba838efe361b","resolution":{"observed_at":"2026-05-18T19:21:48.764302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-08-04T19:29:00.634858Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-07T09:00:49.598825Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:29:00.634858Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:b0a5331ef4ff03bf6865bd30d480809a49d9275a32a0bad61c65d88152149d6c","observation_id":"68eb5094-2f5b-4c44-a765-9f568ccab9f4","resolution":{"observed_at":"2026-08-04T19:29:00.634858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T20:30:17.581842Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2510.08141"},"observation_digest":"sha256:7e76c7848e8ce3ac9b34b867a2083434668d97b9ee4fca47b969b9e66e500144","observation_id":"728510a6-8d25-44f4-9359-2b8725dd0455","resolution":{"observed_at":"2026-05-21T20:30:35.435478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-07-31T14:35:45.739240Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:885d4d60e8890bcb8052c08239159b0baf7b2cc17dea07e258f55b8c748e0153","observation_id":"6766ed2b-4d7d-4775-9f0d-4641884c93d1","resolution":{"observed_at":"2026-05-17T22:25:22.674800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-08-02T20:44:47.413838Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22642","last_updated":"2026-06-18T19:10:56Z","snapshot_observed_at":"2026-08-04T14:01:22.477463Z","submitted_at":"2026-02-26T05:47:30Z","title":"Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T20:44:47.413838Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2602.22642"},"observation_digest":"sha256:f0a98c04923787a6520d90b26ff693d10ab19aeee7d3c78cf6b55d6582655d64","observation_id":"558a877a-ae86-41e9-b42b-c1f3052f6287","resolution":{"observed_at":"2026-08-02T20:44:47.413838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:13e4120b119e477875b70f40d6437dd8e0a3e5834a10334c63b5db1d9c0ae607","observation_id":"9622d80b-8959-4571-84e3-629ea3086da1","resolution":{"observed_at":"2026-05-11T05:20:59.951337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2604.23318","last_updated":"2026-04-25T14:11:23Z","snapshot_observed_at":"2026-07-31T10:26:51.719683Z","submitted_at":"2026-04-25T14:11:23Z","title":"Hidden States Know Where Reasoning Diverges: Credit Assignment via Span-Level Wasserstein Distance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T08:05:36.206946Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2604.23318"},"observation_digest":"sha256:9d77864d9aa60772492f1bb6fe6e07994369d68e636f2512b6cb4bd3c0f3d66c","observation_id":"4c9c248a-4723-453d-942f-2d66754ef541","resolution":{"observed_at":"2026-05-11T20:46:13.056711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T14:52:33.141693Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:4aae34faed21bf0acea8f727c6a15af6895208282827d40190d11b79bf03011c","observation_id":"58666f63-cb06-4f1a-9b0a-b2b0612dda90","resolution":{"observed_at":"2026-05-20T14:53:23.309046Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.17333","last_updated":"2026-06-05T06:47:16Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T08:52:31Z","title":"Leveraging Error Diversity in Group Rollouts for Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T19:03:10.268534Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.17333"},"observation_digest":"sha256:fa27a92f779b26b41b6a69cab8c978179a20bfcfcdea76744781e996254c625f","observation_id":"89914b81-2235-4847-bb65-3a9f4ecd70db","resolution":{"observed_at":"2026-06-30T19:05:00.406585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-05T09:01:36.711877Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-21T06:08:55.571828Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:257ed39a24848ddd37fdb765b2db9c1845bce6198e176be11796ccd48e8790af","observation_id":"b88c5685-4fd8-4dd7-9e91-768ecff1be67","resolution":{"observed_at":"2026-05-21T06:09:41.261365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-05T09:01:36.711877Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-30T17:15:53.286925Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:7db7cb4e7415e2f2e7f57fee5df0732dfa3651d8e00d2f19e4918b61b6721a9b","observation_id":"f711196d-2267-4ebf-9db1-99794f9289d3","resolution":{"observed_at":"2026-07-01T15:15:47.310221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2605.30789","last_updated":"2026-06-02T09:15:19Z","snapshot_observed_at":"2026-08-02T15:38:17.906891Z","submitted_at":"2026-05-29T03:25:56Z","title":"Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T23:54:32.621093Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2605.30789"},"observation_digest":"sha256:5028c9faaffbf66f1d53acb9ffd50ee5fbc4ec4a74ad4361b5426c410a5fd60f","observation_id":"d573ebba-a89f-4ef3-9e76-5f893d5e3882","resolution":{"observed_at":"2026-06-29T00:02:49.989463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:8beb4408631f6f72a7577dae9431b25f1821492a131f2cebb6479b669c930193","observation_id":"1d0ebd72-b3e4-4607-a14a-536159c26a1a","resolution":{"observed_at":"2026-07-03T09:47:59.936872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2606.29812","last_updated":"2026-06-29T05:45:18Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T05:45:18Z","title":"Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T06:10:41.786328Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2606.29812"},"observation_digest":"sha256:c1fcc6aa08345fb4a390b0021f3433cc30497be75f0ab0769959a0b86b75e915","observation_id":"e947bb10-d5b3-4419-b4d6-3f8825599d84","resolution":{"observed_at":"2026-06-30T06:14:19.253487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2606.31575","last_updated":"2026-06-30T12:33:19Z","snapshot_observed_at":"2026-07-07T00:05:17.259491Z","submitted_at":"2026-06-30T12:33:19Z","title":"Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T05:27:22.527220Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2606.31575"},"observation_digest":"sha256:bee8085ef835dbb6a00509a3e3e29595df4632c5d69ef65d0ec8ed20dc2f027a","observation_id":"71968d98-9133-4017-8a89-4e45d84158cd","resolution":{"observed_at":"2026-07-01T10:25:42.413060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-08-05T18:43:17.536451Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03467","last_updated":"2026-08-05T11:58:57Z","snapshot_observed_at":"2026-08-08T00:42:58.367082Z","submitted_at":"2026-08-04T11:02:26Z","title":"When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T18:43:17.536451Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2608.03467"},"observation_digest":"sha256:a70ff40f9541d4123a38e1bd75648019f2c798cb73c26180bbc8367ad2430e56","observation_id":"0a8f6b9b-0cad-4138-b6d3-a4bc95a6b36a","resolution":{"observed_at":"2026-08-05T18:43:17.536451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-08-08T00:52:47.185967Z","title":"Appendix A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03467","last_updated":"2026-08-05T11:58:57Z","snapshot_observed_at":"2026-08-08T00:42:58.367082Z","submitted_at":"2026-08-04T11:02:26Z","title":"When Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPO","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T00:52:47.185967Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2608.03467"},"observation_digest":"sha256:ab0674c40969d75e8da7c97f905ce8638a2b118eccf2f22de64a04cbf36d4e19","observation_id":"bbb13f40-929a-4252-ab59-dd58226c2ec5","resolution":{"observed_at":"2026-08-08T00:52:47.185967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21848/citation-record","integrity":"/paper/2507.21848/integrity","json":"/paper/2507.21848/citation-record.json","paper":"/paper/2507.21848"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12353","last_updated":"2025-06-14T05:30:09Z","snapshot_observed_at":"2026-08-07T08:59:45.729814Z","submitted_at":"2025-06-14T05:30:09Z","title":"Efficient Reasoning Through Suppression of Self-Affirmation Reflections in Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.12353","snapshot_observed_at":"2026-08-06T12:26:11.159006Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.159006Z"},"links":{"cited_paper":"/paper/2506.12353","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:443a7146319794f8b20150792b5d19b6c2bd555f08575763f4aab15ae369172d","observation_id":"d77ac373-6e99-49ab-a72e-7a0cf74997cd","resolution":{"observed_at":"2026-08-06T12:26:11.159006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-06T12:26:11.126635Z","title":"arXiv preprint arXiv:2506.14758","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.126635Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:c1e76da9afc5ce1ce37f234592115e0ff3026ffaf41ecef493dc869d384b417b","observation_id":"d0b5dd49-9c09-4373-a9ad-b18ec0b14f2e","resolution":{"observed_at":"2026-08-06T12:26:11.126635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-06T12:26:11.130126Z","title":"arXiv preprint arXiv:2502.01456","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.130126Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:63a10165d1a64a503cf80da0763ca6b0c9ef80964d1fd400568ade94d4e7e50a","observation_id":"2f9b77b4-4d73-438f-ae59-802b873f62e6","resolution":{"observed_at":"2026-08-06T12:26:11.130126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:26:11.133984Z","title":"arXiv preprint arXiv:2504.05185","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.133984Z"},"links":{"citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:7d969821812d405556bd0531048fa56f58fcbce0f50e9fb8e16017957cfc3fe1","observation_id":"ae609b57-5ef6-44cf-8f75-b48d85a05bab","resolution":{"observed_at":"2026-08-06T12:26:11.133984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-07T13:53:25.250668Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T12:26:11.136900Z","title":"arXiv preprint arXiv:2505.20282","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.136900Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:b2ce27acda49ccae0472abda0710dab94b34b6963b5bfd650ce9449492b3198b","observation_id":"43d43ab2-3aa5-49da-8317-3a3b660ecc44","resolution":{"observed_at":"2026-08-06T12:26:11.136900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T12:26:11.140006Z","title":"arXiv preprint arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.140006Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:a876ee7e1a8375d809abb125ba260fa3b43e21686dcf0886b1145a3fa125c856","observation_id":"ccdf164c-bf13-48e9-943b-2c4477f3f8e8","resolution":{"observed_at":"2026-08-06T12:26:11.140006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T12:26:11.149829Z","title":"arXiv preprint arXiv:2503.24290","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.149829Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:dd80619cd17db85911d338b21798e3e2430529753b9c4417b91ad242e53baa38","observation_id":"1f60f95d-8c20-4a20-b7b4-c6434b7f16bb","resolution":{"observed_at":"2026-08-06T12:26:11.149829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T12:26:11.152824Z","title":"arXiv preprint arXiv:2412.16720","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.152824Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:1ef0bd1dd216ffc416fd79ff122c6c6645536ac00b4501d1078a9e91a405ec7f","observation_id":"636b9b26-0998-42ca-942d-608d8a23df06","resolution":{"observed_at":"2026-08-06T12:26:11.152824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T12:26:11.161943Z","title":"arXiv preprint arXiv:2501.19393","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.161943Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:017ed91de73ce8ec1be6877e53c3e6e800c2ace5f7d9c4a55bf4091c068e73fb","observation_id":"43b0583d-889d-4377-9a2d-eec2da785756","resolution":{"observed_at":"2026-08-06T12:26:11.161943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T12:26:11.167724Z","title":"arXiv preprint arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.167724Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:82bdbabb374b9820bc5ba5d7e72c49a4bba862970513250e3c6eb3c7c2b874e0","observation_id":"e8f6cb66-e737-4fd9-ae59-baf9f5a0791c","resolution":{"observed_at":"2026-08-06T12:26:11.167724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00127","last_updated":"2025-04-30T18:48:06Z","snapshot_observed_at":"2026-08-07T17:34:13.816265Z","submitted_at":"2025-04-30T18:48:06Z","title":"Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00127","snapshot_observed_at":"2026-08-06T12:26:11.170585Z","title":"arXiv preprint arXiv:2505.00127","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.170585Z"},"links":{"cited_paper":"/paper/2505.00127","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:16634492bf8a62494d9261948d7cef2ff941962e8ac266bc14c5c1a314825069","observation_id":"d869d484-ae55-4538-8f5e-cefedf7cf522","resolution":{"observed_at":"2026-08-06T12:26:11.170585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T12:26:11.173550Z","title":"5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.173550Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:76217b5d6c1f44a3a1b9e0155be7fb2e0d8431edb7640f0d230f4346950b9422","observation_id":"10859b75-3b04-4d6a-8f61-5a3f70f0b845","resolution":{"observed_at":"2026-08-06T12:26:11.173550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19855","last_updated":"2025-03-25T17:19:38Z","snapshot_observed_at":"2026-08-07T16:37:44.743882Z","submitted_at":"2025-03-25T17:19:38Z","title":"Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19855","snapshot_observed_at":"2026-08-06T12:26:11.177203Z","title":"arXiv preprint arXiv:2503.19855","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.177203Z"},"links":{"cited_paper":"/paper/2503.19855","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:8cec70d61600b2f30dc08b6ff4c284585e35fc4456eb90ccdfbd2aa472839967","observation_id":"a5081309-1f68-478d-bee0-953e78a9b6a2","resolution":{"observed_at":"2026-08-06T12:26:11.177203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:26:11.180394Z","title":"arXiv preprint arXiv:2506.01713","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.180394Z"},"links":{"citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:2dd63345e1529dc65863a849784233d273d96dbeca233e364b263bc174836bca","observation_id":"67b691d7-64df-43f5-9953-dbe20f528a52","resolution":{"observed_at":"2026-08-06T12:26:11.180394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T12:26:11.183062Z","title":"5-math tech- nical report: Toward mathematical expert model via self- improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.183062Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:2da4cda4956c1abf7bac09fa228940d5f423abc14deb5494130373eabe2ab502","observation_id":"35a5df91-f167-48b6-8b40-cd7dc059882d","resolution":{"observed_at":"2026-08-06T12:26:11.183062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T12:26:11.186011Z","title":"arXiv preprint arXiv:2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.186011Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:5360e7ec14fa408a79623c24e790a9941565c10608d7f9ad25f09df9558116a7","observation_id":"7fe85726-aa59-461a-a040-c4053a797ed2","resolution":{"observed_at":"2026-08-06T12:26:11.186011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T12:26:11.188931Z","title":"Zhang, Q.; Wu, H.; Zhang, C.; Zhao, P.; and Bian, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.188931Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:9a8cc00518db56cf337e234454412e4322987b3891fa8d2878695f7a962750db","observation_id":"79f6c4c2-a856-43d0-a4a3-0617e3b1b1ab","resolution":{"observed_at":"2026-08-06T12:26:11.188931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05132","last_updated":"2025-03-10T01:52:08Z","snapshot_observed_at":"2026-07-06T20:48:18.268075Z","submitted_at":"2025-03-07T04:21:47Z","title":"R1-Zero's \"Aha Moment\" in Visual Reasoning on a 2B Non-SFT Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05132","snapshot_observed_at":"2026-08-06T12:26:11.192134Z","title":"arXiv preprint arXiv:2503.05132","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.192134Z"},"links":{"cited_paper":"/paper/2503.05132","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:3012421c7e357f7839eebef0658a7a0c0885706baa19704f0b27e64a987ed9f2","observation_id":"1c632aa7-4cc9-45bc-b549-9787c239eba3","resolution":{"observed_at":"2026-08-06T12:26:11.192134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T12:26:11.164984Z","title":"arXiv preprint arXiv:1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.164984Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:7e718dcaa0a19d0e84f9809e25c3293c405eb5ecda9bf13dd0c8a15b8b43136c","observation_id":"215984af-1c66-40ea-892b-a9c8e23202bf","resolution":{"observed_at":"2026-08-06T12:26:11.164984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T12:26:11.146760Z","title":"arXiv preprint arXiv:2103.03874","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.146760Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:80f11376fc9f0a2f78646b46db67c24e5cbcc20a6ca5b709c8667c9c1966d6e3","observation_id":"6a781e4e-ebb1-4424-b8b4-7cee598c08fd","resolution":{"observed_at":"2026-08-06T12:26:11.146760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-06T12:26:11.155945Z","title":"org/abs/2206.14858,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.155945Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:f4456bcfd540500f28adbb89955b711bdca2a1e44954fb2ce0e6999f7f12b748","observation_id":"83f14dab-ca0d-4b49-8f7d-1a69efff6c58","resolution":{"observed_at":"2026-08-06T12:26:11.155945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T12:26:11.143506Z","title":"arXiv preprint arXiv:2402.14008","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.143506Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:b310cbfb789f5af07c2048e8952d90c6a6c0f8dd07680b8f40ff6085a778c0be","observation_id":"db9b1184-dcf1-439e-b20d-5f4c0624b0df","resolution":{"observed_at":"2026-08-06T12:26:11.143506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-07T15:43:41.219115Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12346","snapshot_observed_at":"2026-08-06T12:26:11.122616Z","title":"arXiv preprint arXiv:2505.12346","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.122616Z"},"links":{"cited_paper":"/paper/2505.12346","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:9d941cce452e464be51c6a3698a687458e50d101f2e55c9687910fd00ebb4fd9","observation_id":"69b01b73-13c2-4459-890e-334ee896733b","resolution":{"observed_at":"2026-08-06T12:26:11.122616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 17 inbound Pith citation observations for arXiv:2507.21848."}