{"as_of":"2026-08-06T03:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ef2daf3013930ec70d353f24e0750979764266ddb2dcc683e0a51262244b0e3","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:41:55.435903Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11491/citation-record","integrity":"/paper/2605.11491/integrity","json":"/paper/2605.11491/citation-record.json","paper":"/paper/2605.11491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:5d89cd36931433b57f25f4b7dd1328fcef2355d17ec9399a9ebf58e2427c8a96","observation_id":"e2f35f59-3f5b-42a7-8ac4-4f3d2411b021","resolution":{"observed_at":"2026-05-13T01:42:02.811425Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:dc3851cfd1c4e6297fa9c9ebda1859c189848b204895f3cce3e02472a8c8c363","observation_id":"6f6d63a7-2c17-411a-9fc9-ac3db64bf02e","resolution":{"observed_at":"2026-05-13T01:42:02.800543Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"cited_work":{"arxiv_id":"2510.10150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10150","snapshot_observed_at":"2026-07-04T08:29:41.999322Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","venue":"cs.LG","work_id":"32e0712a-e9d7-451f-8c18-f895f13eab70","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2510.10150","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:3453fc60cd389f71b5f1b039b5b747f9ee71a2535504f74b42258f7f289c1840","observation_id":"8bfce8e4-612f-4640-a818-e1abc0c59a8f","resolution":{"observed_at":"2026-05-13T01:42:02.795189Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":"2510.08141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-07-03T20:48:56.103707Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","venue":"cs.LG","work_id":"2f46a012-7c98-4bac-ba71-c90d6b4b7fc5","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:03d121e4b73629797b0ecc18d7ee7b38b2c7a95e7e4263a63407f00b8bdb21c2","observation_id":"87a02fee-f3f3-4fe7-8db5-a601d0647c6e","resolution":{"observed_at":"2026-05-20T00:05:34.479506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":"2506.14758","doi":"10.48550/arxiv.2506.14758","metadata_source":"pith","pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Exploration: An Entropy Perspective","venue":"cs.CL","work_id":"5670d60c-ec64-40eb-93e1-1e51c35e9050","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:7f3d03b371c5c8a75e7f425e115647ee2bce2554e266ff3813dfd2728b955417","observation_id":"9909891d-4097-44cf-8064-9ff913c47680","resolution":{"observed_at":"2026-05-16T06:20:56.524904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2506.01939","doi":"10.48550/arxiv.2506.01939","metadata_source":"pith","pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","venue":"cs.CL","work_id":"e5e936f3-0cff-4732-b394-f607d7a63f5f","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:a8295eedf7021c6c6b06ba256830a8fa9acd98af91617179b6d11bd3d1e947ab","observation_id":"e40d96f9-c037-4971-9feb-e59ff445b2cb","resolution":{"observed_at":"2026-05-13T01:42:02.774087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.024018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18927","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.284515Z","title":"Bapo: Stabilizing off-policy reinforcement learning for llms via balanced policy optimization with adaptive clipping.arXiv preprint arXiv:2510.18927","venue":null,"work_id":"b2400ba2-08be-4be8-b3d4-f23f8ca50936","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:59a7a2d692a82ad505bf2357c9cb66ffa2305a1fba5af28a739bc78e319f9f68","observation_id":"409e0c23-fae1-4209-9552-8fb1b02c8fd8","resolution":{"observed_at":"2026-05-13T01:42:02.790418Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.847440Z","title":"Machine learning , volume=","venue":null,"work_id":"c1d54d34-8857-4268-be1f-002a7c436d05","year":1992},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:59c40cedfc09c899f3e41c9d22ec077d79f88ff5b99539db8dded76d6f85e19a","observation_id":"a26ff55e-ddb4-49a8-867c-f615d48eddf6","resolution":{"observed_at":"2026-05-13T14:32:53.455607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:27ae6195941847cfb3ff7c7d364233517dd93294510513214db749b55d9039dd","observation_id":"bc3c8fd7-f75e-4c7e-86eb-c4b302036285","resolution":{"observed_at":"2026-05-13T01:42:02.816167Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:b463c3f9a37a4c926c7357e5dbca019f1c9fa2aa2edb14a48e872e6031bca15e","observation_id":"03fd08bf-1307-4fe7-b355-87ef112d9050","resolution":{"observed_at":"2026-05-13T01:42:02.820384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:503d04cdb0460276cb1e2fa545c855cdb7210348ffda2a27b3d0f7098c49a630","observation_id":"b0bac2b1-d013-4666-839b-b59a9a17aed6","resolution":{"observed_at":"2026-05-13T01:42:02.825386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:e884e04ed151cf0200e88bd44ff0e46168e1993b0da9811f3fbb21c5cc942fae","observation_id":"d94312e7-493d-454c-9bd2-786486a3718b","resolution":{"observed_at":"2026-05-13T01:42:02.836357Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:caf3cf911e17fe01ed0bd0ffb8b5283b7ff0596796e3dc38721995666a6f586f","observation_id":"7c291eec-5958-4556-ada1-4f94cc98cd5c","resolution":{"observed_at":"2026-05-13T01:42:02.841611Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":"2501.12599","doi":"10.48550/arxiv.2501.12599","metadata_source":"pith","pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","venue":"cs.AI","work_id":"bff96ab1-bd6a-4585-be23-74fdb51969c7","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:4c529c2ffee303c09ad3a3f687327079f3a4bd4cdff734c392a1b28a1e215470","observation_id":"a0c2751b-e4fa-4cd0-ab9b-d6b9880ce0c3","resolution":{"observed_at":"2026-05-13T01:42:02.779591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.585868+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:71cf1335fe5d475b1b05e088dec3c7eaaa93eb60c4077358aa49a6e2803fab50","observation_id":"a5d6be59-57a9-4e0e-a3ae-b0ce35276256","resolution":{"observed_at":"2026-05-13T01:42:02.806304Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":"2505.22312","doi":"10.48550/arxiv.2505.22312","metadata_source":"pith","pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork Open Reasoner 1 Technical Report","venue":"cs.LG","work_id":"27740ebb-6704-4ef9-8878-5b81d4269869","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:7d6bde985cd859559cc962468a29011db67d7059378855e30e702130bfa1bc59","observation_id":"d8666732-3695-4570-a77c-4331444b0776","resolution":{"observed_at":"2026-05-17T04:26:47.432522Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:014effd684abe2d103cc38a5f2c8f87bbad0fa3cbd1c0808f70ddcecc105be7f","observation_id":"593fc83e-68ac-48f9-8324-5ed8eeed4b69","resolution":{"observed_at":"2026-05-13T01:42:02.878781Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face repository , volume=","venue":null,"work_id":"375dade2-d78c-495a-9dcd-10ee61b6eb49","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:6c243b72230a68d19ed7cc75651ff8988da7071b1824eedd5f0a7a8b0a5727dc","observation_id":"12bdea9b-e524-41c4-adb4-279bc59039e3","resolution":{"observed_at":"2026-05-13T14:32:53.444244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":"ba09338f-22de-410b-97fb-9f180124ac86","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:a424c9df7f9329afeaed0fc5a8d297030a2506511bc834be354ee76248fd154a","observation_id":"393d51c7-e30f-4bdd-ba3a-94ad9f71949c","resolution":{"observed_at":"2026-05-13T14:32:53.447795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"93310922-0345-40c5-bddd-e511b985c8e3","year":2023},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:840f2954bdfb3e6d34372a859a4745ac5ed7464be2e41cc118d947f0de6caa7c","observation_id":"7cd5a674-0e18-416b-9796-9344f8ec0fcb","resolution":{"observed_at":"2026-05-13T14:32:53.451592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:b38e8cf7920b210d4441d2e959566e8362ca69df0bfb688846a5455a48481a1b","observation_id":"512754f8-c52a-47f8-a672-582603f64108","resolution":{"observed_at":"2026-05-13T01:42:02.873990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:5b6155353771a3ce166082d1ab4b5990868ec9520b4790a2f1316cc2e0e01152","observation_id":"b923da60-a2e4-41d2-836a-d81b5c193d53","resolution":{"observed_at":"2026-05-13T01:42:02.883491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:19f3dc1e12e5284ffa6c75d18fa329cf5b920d3c5e0bcbe52a5d1c64e015a380","observation_id":"53e77c18-dc63-48ca-824c-5709335d6baf","resolution":{"observed_at":"2026-05-13T01:42:02.846948Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03493","doi":"10.48550/arxiv.2509.03493","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493","venue":"ArXiv.org","work_id":"d2abae43-fc14-4255-b3f8-027a818c366b","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:91fb78d088a8892176c7a2ea576f792fdfea6f6420bae250e0a8ebb4f143c3d9","observation_id":"f8a7630c-e457-43e5-b772-208d9c711fbc","resolution":{"observed_at":"2026-05-13T01:42:02.919880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhihu Zhuanlan , year=","venue":null,"work_id":"935ee124-d509-4073-b952-4863d2b7fa50","year":null},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:1659d41070c0aba6b122da10dd9a0792de94c4b09bd4d1f9f94a12cedcec88c5","observation_id":"339f55b3-9a09-42a7-871f-07a1d9229b69","resolution":{"observed_at":"2026-05-13T14:32:53.439655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:83605f0c617973621b794f531899a469f214233f67409bbe3ecbf23559414b63","observation_id":"64135884-6e2f-49d2-9914-5d90975be742","resolution":{"observed_at":"2026-05-13T01:42:02.902885Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine Learning , volume=","venue":null,"work_id":"ddeed0b5-a6d2-4b4a-9918-4985c3b290be","year":2021},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:aee5abac5fab93d77f01bc577899407c6919bab246b99eebac464f1f3f252e84","observation_id":"7703f9f8-8a80-44f9-af87-8c5dc26d385d","resolution":{"observed_at":"2026-05-13T14:32:53.412266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"12c09f54-1c34-4637-a6c2-aabba9e24490","year":2022},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:9b84d1698d8418c675d88547b1b56a4521929a47d04ca25fdbcf6f6b65c7944c","observation_id":"d643fba9-3ac5-4661-bda5-ce0b9609a086","resolution":{"observed_at":"2026-05-13T14:32:53.404701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"556f2b62-3305-439b-9b4b-9fb58dad2903","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:64ecb8874c98a2af6b8ec87f7fc380081a15602a856935a63e7639c3ba1de72b","observation_id":"6ab2c24a-6a69-42d1-81b1-7b2d204f26e5","resolution":{"observed_at":"2026-05-13T14:32:53.415706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"2b5f615f-1ebd-46ae-8292-030a4d1ae118","year":2016},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:bc83186eb0803ffdc73733ed593d64b2c237fbe79bad96be44c45d929b01bb29","observation_id":"138d3726-b1f2-4d58-9e97-e6ba8612f863","resolution":{"observed_at":"2026-05-13T14:32:53.419590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"ba1c1215-50e7-4da2-b006-862ef9000981","year":2018},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:16e49aec2332692926ffcbb8dcba75df1b9150e354d5ccd595cfcd7c1a8ec099","observation_id":"49ff38a0-1757-4a3c-a194-b628e658636f","resolution":{"observed_at":"2026-05-13T14:32:53.431823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02333","last_updated":"2025-09-08T14:50:44Z","snapshot_observed_at":"2026-08-05T11:43:24.211211Z","submitted_at":"2025-09-02T14:01:07Z","title":"DCPO: Dynamic Clipping Policy Optimization","version":2},"cited_work":{"arxiv_id":"2509.02333","doi":"10.48550/arxiv.2509.02333","metadata_source":"pith","pith_arxiv_id":"2509.02333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dcpo: Dynamic clipping policy optimization","venue":"cs.CL","work_id":"8c19db85-51aa-4d83-8ade-6f3bc8d1c75e","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2509.02333","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:8c2a4166ba0afa4c3822fe20e46b2e81ba299ea44efe34b5983034991b2207e1","observation_id":"f63ea4b3-fee7-4416-9b64-cae9c7f20040","resolution":{"observed_at":"2026-05-13T01:42:02.915611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:13c376afd9f033063717ca43dae73e94c57e827d8fe3ed1191be7677a9c8e526","observation_id":"e7a042dc-bc83-46d0-8a15-13d0b8cf2450","resolution":{"observed_at":"2026-05-13T01:42:02.938987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , organization =","venue":null,"work_id":"b228faf8-ffa6-4283-98e5-5584413fa34b","year":2024},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:be6a318bbce2d169116d0f4763f36ac9ee41d065bb74ac0a9a834fb57686b2d5","observation_id":"3c2f054b-53b2-4ebc-84ea-7a283a39378f","resolution":{"observed_at":"2026-05-13T14:32:53.435358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01347","doi":"10.48550/arxiv.2506.01347","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning.arXiv preprint arXiv:2506.01347","venue":"ArXiv.org","work_id":"90fa4c77-dcfb-4253-827e-9bde0d342fcb","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:fed4510d6e3bf21cdc135bfd48253d13b7c1aba5a6742b2d3c22d29874bbaa78","observation_id":"f8bde296-48e9-448e-982e-23f602f12800","resolution":{"observed_at":"2026-05-13T01:42:02.863401Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:508b70f14445cb70d3d00d225318bbbe41db27d4957f0f5fc856ba53355bec3f","observation_id":"b411e255-e80b-45f4-a5fc-aa0596bb71d1","resolution":{"observed_at":"2026-05-13T01:42:02.852730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"cited_work":{"arxiv_id":"2507.15778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15778","snapshot_observed_at":"2026-07-04T16:19:57.768398Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","venue":"cs.CL","work_id":"b5286fd9-b359-49d2-a6bc-e370a3293e23","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2507.15778","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:6e7d905f8298eb506286201c7728c1cc231c36ecb0fc19f98659ff1d349cbee2","observation_id":"e115b3b2-c420-4da2-824f-a708c6261f90","resolution":{"observed_at":"2026-05-20T00:00:22.139688Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02260","last_updated":"2025-08-04T10:08:10Z","snapshot_observed_at":"2026-07-06T22:07:21.387432Z","submitted_at":"2025-08-04T10:08:10Z","title":"Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.02260","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02260","snapshot_observed_at":"2026-07-03T11:28:04.423041Z","title":"X., and Wen, J.-R","venue":null,"work_id":"17ff35d2-6279-4121-9119-502d19646fd2","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2508.02260","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:698e855938fabfbb2bb60012748fceb6913bceaa70284803ce79d6fe2498ecb3","observation_id":"cd7ad71b-9101-475c-a584-a2de4c4843d3","resolution":{"observed_at":"2026-05-13T01:42:02.924935Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:108685d88deacd66538896a15dbdc4d595aefa623972401b2ddbb33c47883b7e","observation_id":"2980fee8-513b-4ed6-9c10-0537c68478ed","resolution":{"observed_at":"2026-05-13T01:42:02.888634Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , url=","venue":null,"work_id":"6f398b03-b633-4863-895d-2ffeac3bdfb9","year":2017},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:c7d1149fc8ba50da954f8938dda6c56865a41fbfe9e9e592a0b92d8882ecd262","observation_id":"cfaef6e5-7d2a-476b-9dd6-e4182d3eb683","resolution":{"observed_at":"2026-05-13T14:32:53.408478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23585","last_updated":"2025-06-04T01:41:37Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T15:58:04Z","title":"On-Policy RL with Optimal Reward Baseline","version":2},"cited_work":{"arxiv_id":"2505.23585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23585","snapshot_observed_at":"2026-07-04T07:59:40.759572Z","title":"arXiv preprint arXiv:2505.23585 , year=","venue":null,"work_id":"01536638-04c4-497f-9f2d-a985c831d600","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.23585","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:24a08be62e612f8ae49938a2e01144f6a15d6e02b1f459eec8385afbf711b2a3","observation_id":"bb1413e4-7d89-463c-8777-db47a92cb050","resolution":{"observed_at":"2026-05-13T01:42:02.898305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.214162Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms?","venue":null,"work_id":"99a02056-55bc-45e6-8d10-7f31cf541473","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:4b39d47a265e79f6b18047ef2350c2fd348d5e95d203e716f607425c2048f5b9","observation_id":"d38b3bcc-7b45-4ace-803e-c8c417aa7d82","resolution":{"observed_at":"2026-05-13T01:42:02.910063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05615","last_updated":"2025-06-05T22:03:38Z","snapshot_observed_at":"2026-08-05T03:52:50.635287Z","submitted_at":"2025-06-05T22:03:38Z","title":"When Maximum Entropy Misleads Policy Optimization","version":1},"cited_work":{"arxiv_id":"2506.05615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05615","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When maximum entropy misleads policy optimization","venue":null,"work_id":"2fc2b2b5-66d9-4d2b-9393-a6c80892f31f","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2506.05615","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:463722d26e78e50947e02705ebecfd5a5e0a77624aacf8cd81bdbbd4e8930f4b","observation_id":"f247a322-b1c6-4be2-9a99-b97a6a08b6c7","resolution":{"observed_at":"2026-05-13T01:42:02.858360Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:5e048e719d15e1d1ee3c37ccd190f3c0f68b6f1f9f2daa80def6f162cd53ac97","observation_id":"79c5031c-f0ec-4fe3-9a85-60c213abefb0","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the twelfth international conference on machine learning , pages=","venue":null,"work_id":"25208864-a0c7-4ab0-8572-0a5e94083719","year":1995},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:83b6e2d080249114409fe29250d76a54679767db152ea2abc72b7c8ff766023e","observation_id":"a14d97cd-74c9-44fa-afc8-c8ba359d7fc7","resolution":{"observed_at":"2026-05-13T14:32:53.423892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"9bf9a586-0817-440e-8ba9-9c9984e34585","year":1999},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:9b8ed7cb1785f6f5ed5b14fed094bf73f97244e666070fafc29add47708cb27d","observation_id":"0137a0e8-448b-4674-8edf-de7e6228ecc3","resolution":{"observed_at":"2026-05-13T14:32:53.427777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06451","last_updated":"2018-02-14T19:42:20Z","snapshot_observed_at":"2026-07-06T06:04:45.729921Z","submitted_at":"2017-10-17T18:08:04Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","version":3},"cited_work":{"arxiv_id":"1710.06451","doi":"10.48550/arxiv.1710.06451","metadata_source":"pith","pith_arxiv_id":"1710.06451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Bayesian Perspective on Generalization and Stochastic Gradient Descent","venue":"cs.LG","work_id":"0d0de3bb-2df6-4f6d-b6dc-8294ed38aeb2","year":2017},"citing_paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T01:41:55.435903Z"},"links":{"cited_paper":"/paper/1710.06451","citing_paper":"/paper/2605.11491"},"observation_digest":"sha256:aa5fb7f319f53c4e374d33cf32b6748432259dd1fd7ce4e4c8f18595eb7af2c3","observation_id":"a008f9aa-afcd-449e-9171-86d2674feece","resolution":{"observed_at":"2026-05-13T01:42:02.934283Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:56.137503+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:56.137503+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11491","last_updated":"2026-05-12T04:08:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T01:45:24.047701Z","submitted_at":"2026-05-12T04:08:17Z","title":"Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":28,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":14},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2605.11491."}