{"as_of":"2026-08-05T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b15b1484b29695d16a89d0bb3a3c854ce5f824bf6b38bc39e25b835dc83a0a5","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:49:04.365663Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16850/citation-record","integrity":"/paper/2607.16850/integrity","json":"/paper/2607.16850/citation-record.json","paper":"/paper/2607.16850"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:01.679794Z","title":"Intern-s1: A scientific multimodal foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:01.679794Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:3f36ef831a75b7acdb3f52932c704171ceb8f3138f03e1486dd01ec287a861fd","observation_id":"c3951752-7444-4b59-8d35-fce8cc369944","resolution":{"observed_at":"2026-08-01T19:49:01.679794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:01.738473Z","title":"Unifying count-based exploration and intrinsic motivation.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:01.738473Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:9803cffe3d948dcf0886c4188bfab137683eef8719b57df2ac1b3c8b767b515b","observation_id":"3b46324e-edd0-4cfe-bcef-8a8227970069","resolution":{"observed_at":"2026-08-01T19:49:01.738473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:01.851451Z","title":"Galaz-Montoya, Yuhui Zhang, Yuchang Su, Disha Bhowmik, Zachary Coman, Sarina M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:01.851451Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:073d862b8174fc258d3914e359c3f3dc929850acf7a977d365c9a06689ff3daf","observation_id":"49e41946-7ab5-47bb-9600-10b3ca458802","resolution":{"observed_at":"2026-08-01T19:49:01.851451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-01T19:49:01.949922Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:01.949922Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:6f01ed0f4300e4c93a146b0327d5bf9000ff2c2ec675639b02c56cd6c8a45a85","observation_id":"9fe5b607-b04b-47ea-a9e6-ccaa109ae846","resolution":{"observed_at":"2026-08-01T19:49:01.949922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.029824Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.029824Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:4b0116e000337ddb3ced05912bce79c656a645eb730daa3a008844cc186bd190","observation_id":"a62d2755-5846-4ce1-b287-335ffddf9c1e","resolution":{"observed_at":"2026-08-01T19:49:02.029824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.088843Z","title":"Lmdeploy: A toolkit for compressing, deploying, and serving llm.https: //github.com/InternLM/lmdeploy, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.088843Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:02850985a5e0a8f62d3f662e33c92c18a969bf9bc2699918789fadfb7464eb1a","observation_id":"cbacc640-2d73-45f0-986b-c457f1abeb3c","resolution":{"observed_at":"2026-08-01T19:49:02.088843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.149150Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.149150Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:5bdf55574de74186c89d260bfd1979e9ace0636a0d2950d601dca0d7a03821b6","observation_id":"04a0c6c7-b3be-495a-b945-f7751d827f69","resolution":{"observed_at":"2026-08-01T19:49:02.149150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-01T19:49:02.197871Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.197871Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:b0d04fb4b773a124124d6a94a5ab402b499fda8e490e36d367c1a7672ebf5f40","observation_id":"3915b89a-996d-4c6c-9071-91fc0fc6946b","resolution":{"observed_at":"2026-08-01T19:49:02.197871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.255082Z","title":"Physics: Benchmarking foundation models on university-level physics problem solving, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.255082Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:586047487c4ef01366f5d83b14f099d28f55b0b57f0db9de4874ffa8b2062460","observation_id":"4461ca0c-bc8c-4814-9e6a-cc35785395ca","resolution":{"observed_at":"2026-08-01T19:49:02.255082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.310544Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.310544Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:eb8548cde8b1c69bddf0da87bfbb49e85d93baa38820386655afd57a21bb523d","observation_id":"d7aedcc4-23a7-4909-afa3-fe71e0f4579a","resolution":{"observed_at":"2026-08-01T19:49:02.310544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-01T19:49:02.455134Z","title":"Open- reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.455134Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:80f4c4304ee2dbe56bf837ff24d094e8c65dd6d7761a2fdfcf9726015e13f70d","observation_id":"b8e718e4-f2f7-4523-b26b-60ae1d5827eb","resolution":{"observed_at":"2026-08-01T19:49:02.455134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-01T19:49:02.573280Z","title":"Openaio1systemcard.arXivpreprintarXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.573280Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:19cb0fa527bd8536a9ec5f428d08b24fc01321a1762a7f7c927d401a081f0312","observation_id":"297732f6-951e-4213-a9bd-9635c2534e19","resolution":{"observed_at":"2026-08-01T19:49:02.573280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.691616Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.691616Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:547da38c054c6d363d5c5a6e2e6134c5a7ee92999f45697c8a54ab98f0429164","observation_id":"b9b1ccc2-fbc0-4dd9-9747-bd436fbbe1ff","resolution":{"observed_at":"2026-08-01T19:49:02.691616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.784932Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.784932Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:a38b0bcc35e5212a10d1b3f43b1a5d3a1b920cc5e07db8854b8c7361c14202bb","observation_id":"1f86e6df-98a4-4f95-8ca5-60eb243347d5","resolution":{"observed_at":"2026-08-01T19:49:02.784932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:02.899076Z","title":"Chartqapro: A more diverse and challenging benchmark for chart question answering, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:02.899076Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:e67d081df0afb26969784dfef3f6c44990cfd734a0f7b2063295e4d7daa7076d","observation_id":"b241928e-20ea-4a2c-a831-18038e847613","resolution":{"observed_at":"2026-08-01T19:49:02.899076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.014633Z","title":"Generalizing verifiable instruction following, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.014633Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:7c7abba35c92edae0e1cdc9b3d294709e7cbdcdb8e8528d8b4ca1d6c468f7b3a","observation_id":"46aa9504-718a-4b22-829d-2be7b683ea05","resolution":{"observed_at":"2026-08-01T19:49:03.014633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.157878Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.157878Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:a604b49e9f8dfb384e5380274e141ca0ccf3496860776bffae2f1b39173df987","observation_id":"d17d23f4-238b-49bf-9c12-5d6606564c5f","resolution":{"observed_at":"2026-08-01T19:49:03.157878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T19:49:03.268973Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.268973Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:f7d645fe71d692f81fe77f4e50fa25f2a15d0ea30784bfd3362c2488950858ad","observation_id":"201f0c88-98b9-4c20-a6a3-3affea4d4f7e","resolution":{"observed_at":"2026-08-01T19:49:03.268973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.394154Z","title":"Qwenlong-l1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.394154Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:8e4d901a7914b895c9e588ae566c1e70a6b2392826986f1bfdfc0173243dce0a","observation_id":"fd8d8ef2-3a78-475b-95c9-fb5b9b1df638","resolution":{"observed_at":"2026-08-01T19:49:03.394154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.485381Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.485381Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:4a4633fc857b0010f534d74164bfe76c841bdf8eb89bab0d3d3fd6b388fd5e97","observation_id":"eab9fc93-71b2-4d8c-8344-cacc191fd3d1","resolution":{"observed_at":"2026-08-01T19:49:03.485381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T19:49:03.579148Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.579148Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:43ffd59f9d666e1ff61c3e180fc9ec6cd2a8f1936198774a9071f5b5022a2d8a","observation_id":"89f03583-36ba-4414-add0-7d01e18afa4c","resolution":{"observed_at":"2026-08-01T19:49:03.579148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.758433Z","title":"Tsybakov.Introduction to Nonparametric Estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.758433Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:486b9aa4f36b7a5b13e10c3fc3c8296bdb913f76c662342f26f51e07ec234ea2","observation_id":"23ed1846-5ab3-416e-9831-df6360788df9","resolution":{"observed_at":"2026-08-01T19:49:03.758433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:03.876845Z","title":"Dsdr: Dual-scale diversity regularization for exploration in llm reasoning.arXiv preprint arXiv:2602.19895, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:03.876845Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:150618c715cfb8f4b291a09d14ab3f8cfefaac28835e58098fb24f1785e14858","observation_id":"22122e75-0946-4a36-806e-175ba395cd3a","resolution":{"observed_at":"2026-08-01T19:49:03.876845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:04.006924Z","title":"On the entropy dynamics in reinforcement fine-tuning of large language models.arXiv preprint arXiv:2602.03392, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:04.006924Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:1e4c8d18225ce27c3ea82482f5faed716dd22c0bd594b9c4e8e0eb350c8b96b0","observation_id":"d7b49ccf-b3fd-4b4d-b601-a9cb8f659f00","resolution":{"observed_at":"2026-08-01T19:49:04.006924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:04.166574Z","title":"Cmphysbench: A benchmark for evaluating large language models in condensed matter physics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:04.166574Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:4e8d78b60ec3176338a773c18607b35dffc5eb85d61b9c76b413388b7855a65c","observation_id":"3146c057-b560-43ff-bf72-2a9c7f828dd9","resolution":{"observed_at":"2026-08-01T19:49:04.166574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:04.247560Z","title":"Entropic: Towards stable long-term training of llms via entropy stabilization with proportional-integral control.arXiv preprint arXiv:2511.15248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:04.247560Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:a7313a5a8d1a6efbe76aef54b351bcd4497d7ed7409b498fca52ef4c748cc405","observation_id":"82f2643d-472c-4884-a52b-aafeb3818f53","resolution":{"observed_at":"2026-08-01T19:49:04.247560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:04.312886Z","title":"Mmmu-pro: A more robust multi-discipline multimodal understanding benchmark, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:04.312886Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:ed3631cff56e9ae7cde163412fc62ab0aefd159e7fe40f1920a3f949a66973f7","observation_id":"743f9664-442b-4338-9ff5-41cb55f937b8","resolution":{"observed_at":"2026-08-01T19:49:04.312886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:49:04.365663Z","title":"Scientists’ first exam: Probing cognitive abilities of mllm via perception, understanding, and reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:49:04.365663Z"},"links":{"citing_paper":"/paper/2607.16850"},"observation_digest":"sha256:7f73ca41dc64cbcd60db3962f3da8598945aedd1739571f16d61e9ffa2dff069","observation_id":"35cdd4e2-41d7-4449-a764-0dc0ecc016d3","resolution":{"observed_at":"2026-08-01T19:49:04.365663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16850","last_updated":"2026-07-18T15:13:33Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T19:49:00.970766Z","submitted_at":"2026-07-18T15:13:33Z","title":"Group Entropy-Controlled Policy Optimization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2607.16850."}