{"as_of":"2026-08-07T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ac687c8c0e02f2533635c0163fa067fd4f4523fc7ab65e0af0b9e0efc386748","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T06:04:32.640299Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.11775/citation-record","integrity":"/paper/2605.11775/integrity","json":"/paper/2605.11775/citation-record.json","paper":"/paper/2605.11775"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author=","venue":null,"work_id":"a97dd6cb-60a3-4012-8ab7-f064623cfe5b","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:b017924e15f1e67f7c433f5a7d1a3249e5aa9dca631ab3ebab43b01aa45c68ab","observation_id":"557f233a-4fee-4e72-8364-09c3b847d187","resolution":{"observed_at":"2026-05-15T06:05:07.178340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:10:46.490082Z","title":"2026 , url=","venue":null,"work_id":"a00aeae4-e823-4d2b-a6dc-8b48b7c734f6","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:4e06439fff4b0f5a35407e7687898b30eed57a295d965cb078de32336355b20d","observation_id":"ce5fddca-35e7-41b5-8be1-4d5731ef2474","resolution":{"observed_at":"2026-05-15T06:05:07.298290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:565c81053b78376155050361767a74682e7fe74062c183e6f36807bc0b63ac4d","observation_id":"313e936e-be72-4dfb-bbb5-d37f5199f9bc","resolution":{"observed_at":"2026-05-15T06:05:06.381914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"POLARIS: A Post-Training Recipe for Scaling Reinforcement Learning on Advanced Reasoning Models , url =","venue":null,"work_id":"ec3e0a8b-d776-483b-9352-1ed1794cb239","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:1fafb76366be3b777fe82e92300c5727289c764d5c542dcec9557ea5cdb69694","observation_id":"f873a061-5c55-4445-81bc-85c975667337","resolution":{"observed_at":"2026-05-15T06:05:07.355452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for","venue":null,"work_id":"b2e8cefd-0776-4754-8fc4-54ef79e88a01","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:178d6e5158d3ab94c596622187e91aab3420a1296ea55287bc4cfd9cfbfe0b87","observation_id":"0a881924-055b-4ef7-8808-56063c53e986","resolution":{"observed_at":"2026-05-15T06:05:07.308112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15248","doi":"10.48550/arxiv.2511.15248","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Entropic: Towards stable long-term training of llms via entropy stabilization with proportional-integral control","venue":"Open MIND","work_id":"7efda974-8a81-45a9-b0bd-0b669d451303","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:6ab900fa243ae17f13d3923788800f8ebf84d989aac43565c82d56e7b99d14b4","observation_id":"182b54fa-f5fa-411b-a846-b5f255b77e46","resolution":{"observed_at":"2026-05-15T06:05:05.683882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , url=","venue":null,"work_id":"30870da5-3272-48cd-9eb0-2167d8ce88a4","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:c650b35d6e6b86fe6f78460535f9c4f60ba2113f0baf44254c5add0f0d12b3f9","observation_id":"c06b9d68-3e1f-4e47-91e1-e9bd88e40a56","resolution":{"observed_at":"2026-05-15T06:05:07.322782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond Magnitude: Leveraging Direction of","venue":null,"work_id":"2cfbfddd-78cf-4498-858e-dedf8fd936a8","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:32f505da90ed022ec9c92ffddd32423bf6a08ececdb7b765f47b92daf91d5c1a","observation_id":"a4d55725-1f74-4e37-bb09-f1f4a64a2498","resolution":{"observed_at":"2026-05-15T06:05:07.236941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse but Critical: A Token-Level Analysis of Distributional Shifts in","venue":null,"work_id":"8c1dfeee-a6dd-4f2d-bd41-0b6e9dd45162","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:d04d7d227ea0c0c42334eead40a2568e5cd02c0dfe85ca04a924784aeb0db519","observation_id":"37c4a159-06da-4d24-ae81-5085b1039e86","resolution":{"observed_at":"2026-05-15T06:05:07.313005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , url=","venue":null,"work_id":"d8dcd37f-eeeb-4b23-b9c3-5dff0600c102","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:64593723ca0117844e3d72c428a1d0cdda383b11a6f7fc854802aa39584a6458","observation_id":"f438d893-6709-4658-b4c7-667725a7f3e3","resolution":{"observed_at":"2026-05-15T06:05:07.262613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:32:42.732530Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"aba38d90-a03c-43b9-a4fe-4196a7bf7a61","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:4211be9fd0aa51ba610c655f001ab33061db0b498c037f00a7e10ee5c92366d1","observation_id":"de73cd91-e00d-45aa-9b59-b679f5d5985e","resolution":{"observed_at":"2026-05-15T06:05:07.205264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:11:42.092743Z","title":"The Twelfth International Conference on Learning Representations","venue":null,"work_id":"0971bb9b-52fd-4ee7-9bd9-38110d7f09c8","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:711ccbe2394d8deb5dd2201b7cb741c8d465b3881a577fb9e0672003310c1a0a","observation_id":"050d202a-b668-465f-9724-5a4ab47c1c86","resolution":{"observed_at":"2026-05-15T06:05:07.221413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face repository , volume=","venue":null,"work_id":"e547af6b-ea8a-4879-b17e-a3f0238449ae","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:18be3b98205e9d3ecf781f01ffa4cb7a661609d0531f61c2817d8c61b12f433c","observation_id":"3cc92413-f495-4bb0-8abd-edd46d9e0635","resolution":{"observed_at":"2026-05-15T06:05:07.210876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , note=","venue":null,"work_id":"8fc06359-3308-435c-bc21-c54c7ff974a6","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:7b8a6c59a73d3c1caa3fd2c4b63f70b42796b51eecb088bc878278276aa109cf","observation_id":"9896f1ff-195d-422b-a268-ca62a66e184c","resolution":{"observed_at":"2026-05-15T06:05:07.272200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , note=","venue":null,"work_id":"d9d34b36-5d42-409b-b71f-97e781c056bc","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:872790db9f9d36ef3cb21962daf6e753e0c7617502752e161ef3e78c1a92c746","observation_id":"eee99b74-a6f2-4a57-82ac-4634fb304340","resolution":{"observed_at":"2026-05-15T06:05:07.328451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:01:19.424889Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"b2df663d-da71-4df7-9177-dbce11bcd8e5","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:acc3aee66ac91a9a0518bc03e0e9277b81a30bcd72c4d8f52e0cd273b05d7f85","observation_id":"99306081-5c8e-40e0-9783-22c0df46b672","resolution":{"observed_at":"2026-05-15T06:05:07.195031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":"1b65ede2-a7b3-4502-a308-1227b7228001","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:c61cee60da892d5a9a5d94f30220af2d2a78c52483c45d1e0554ff1a742ea8cc","observation_id":"a18c04ee-9b41-4c31-b9e3-55586f324673","resolution":{"observed_at":"2026-05-15T06:05:07.318024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 41st International Conference on Machine Learning , pages=","venue":null,"work_id":"21c38549-4174-4909-8223-88e5d63ca234","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:c3b0ea66b5b4e47d3ff32439bde9addcecdc7784dd04822ed74507ee55547258","observation_id":"2bf86b94-26f7-4b77-9f91-79cd7260367e","resolution":{"observed_at":"2026-05-15T06:05:07.257769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:40:44.340159Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":"7a4fbace-b323-4b0f-a394-1b4f5664f601","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:8cb280ab0f8b4df269869e61ceaad53ac8a43c021b0ec941e33dc27898f4d86e","observation_id":"1a138f03-af49-4f6f-965d-7b6285561c74","resolution":{"observed_at":"2026-05-15T06:05:07.199878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T19:52:52.358673Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"3c9bea88-09c4-4133-96a0-b424254cb2ca","year":null},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:2d8db3dd41f32d5658b098289a3aec199b9f475b15759ca1f83691a97d49fc79","observation_id":"92fb0707-0513-4087-9512-cfdcd102e3a5","resolution":{"observed_at":"2026-05-15T06:05:07.251816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22117","doi":"10.48550/arxiv.2603.22117","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the direction of rlvr updates for llm reasoning: Identification and exploitation","venue":"arXiv (Cornell University)","work_id":"f4bbdde2-afd9-44a8-822a-145757254bc0","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:0f6068d0fe4844171ec071100761653d09b391f3d0b851d1a1156b051a4df74a","observation_id":"2ba9d8b1-cb94-4556-91c5-386517159698","resolution":{"observed_at":"2026-05-15T06:05:05.676421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupling Exploration and Exploitation for Meta-Reinforcement Learning without Sacrifices , booktitle =","venue":null,"work_id":"541d3e92-245f-49b7-af48-d6d4f1c2148c","year":2021},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:e00b581f34c924fa9a419e35b5edd2d03962866e9b6de075eb4744b034e03033","observation_id":"684f3e3d-be52-4585-89f5-ef1409597fbb","resolution":{"observed_at":"2026-05-15T06:05:07.189826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2026 , eprint=","venue":null,"work_id":"73d324d7-6a6c-4547-865b-dbb06ffe383c","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:a7846dd2eb1fa762e72859f01cbc021d4fc9ccd26925406af974d7d567857fed","observation_id":"5ea532d5-47c1-4dcb-bce0-9768d4bcfb0d","resolution":{"observed_at":"2026-05-15T06:05:07.246248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models","venue":null,"work_id":"449b2d19-d256-45d0-b57b-b38b18a54ec1","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:f7625a63b8dbc8a6693393359685e6ce51141b7a1e2357f3f8984e32792f1798","observation_id":"c407257f-d74f-49ac-ba54-04b7e24e2575","resolution":{"observed_at":"2026-05-15T06:05:07.216231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude code","venue":null,"work_id":"98df7263-6ce2-4e3c-abcc-f41686c13734","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:6b4df6c25cb1189831bdb98fa9d22c4e470381ec968f25e0e1f4dcc90f9797e5","observation_id":"1920804f-4cc4-4079-8e3f-4b55f205bb76","resolution":{"observed_at":"2026-05-15T06:05:07.302944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08468","last_updated":"2026-04-09T17:03:49Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:03:49Z","title":"TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis","version":1},"cited_work":{"arxiv_id":"2604.08468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08468","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TTVS: Boosting Self-Exploring Reinforcement Learning via Test-time Variational Synthesis","venue":"cs.LG","work_id":"b9e520a4-6d8d-4fe7-bf52-20b81ece2483","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2604.08468","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:e4eaeb2f56d0075aeaf519a05d28a4dfd444ba3c18e0f0aa0f8b7df26ab6cc7d","observation_id":"677e0d37-8cf0-4496-8131-0cc646a28049","resolution":{"observed_at":"2026-05-15T06:05:06.375698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.12851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:20.351963Z","title":"Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025 a","venue":null,"work_id":"2593c504-a867-461e-8504-1270698a93d3","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:b7c65ff1da69f06a16b929810e757376bec56133a22acab42e26d15f8f855445","observation_id":"927c14cb-bf21-4c27-a24b-109b5a3833f4","resolution":{"observed_at":"2026-05-15T06:05:06.405209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.09782","last_updated":"2026-05-08T07:55:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-10T13:42:12Z","title":"Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective","version":2},"cited_work":{"arxiv_id":"2602.09782","doi":"10.48550/arxiv.2602.09782","metadata_source":"pith","pith_arxiv_id":"2602.09782","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Flexible Entropy Control in RLVR with a Gradient-Preserving Perspective","venue":"cs.LG","work_id":"e4365fc4-990f-475a-9cad-708adb68b4e1","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2602.09782","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:1d050756dc1d581799148a12a4efe13f474422cc8984b08b230d8bd41a9ac8b3","observation_id":"5843447a-5e6c-4832-907c-262a029d902e","resolution":{"observed_at":"2026-05-15T06:05:05.721920Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16912","doi":"10.48550/arxiv.2512.16912","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration vs exploitation: Rethinking RLVR through clipping, entropy, and spurious reward","venue":"ArXiv.org","work_id":"7f004d68-d63a-4e92-8734-817f2def2322","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:8672fecd79dc4d8620e749b0ac6fa10c0b83943489d23c74818ff17666916cf0","observation_id":"5643cca9-9766-46b1-a244-d459dea31216","resolution":{"observed_at":"2026-05-15T06:05:05.599968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.00908","doi":"10.48550/arxiv.2512.00908","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond high-entropy exploration: Correctness- aware low-entropy segment-based advantage shaping for reasoning llms","venue":"ArXiv.org","work_id":"49b62e61-e949-4821-bcf4-f6ca4baf19ec","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:2012c95d190c71850b7211b74793c493a04f7bba4a05851d4d8edcd0962a5a1f","observation_id":"904c25f1-aa07-44cd-abb0-ccf7694504e7","resolution":{"observed_at":"2026-05-15T06:05:05.715670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i36.40290","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with exploration: An entropy perspective","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1dca8017-ef26-4784-bb13-14697377df46","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:15abc00334ab3b33a7fcb8347e223dc1ce098be63e776670e76cc763f9cecf1f","observation_id":"2fd17d16-dcca-478d-9018-e3d43b12d25d","resolution":{"observed_at":"2026-05-15T06:05:05.561384Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T04:45:43.043822Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:aaeb3f687eb1708b8f12a103a1ec4a960e23686f3c575353f0cea7e4bb3bb225","observation_id":"3596d672-72f2-4c79-b135-e472c245fe98","resolution":{"observed_at":"2026-05-15T06:05:05.642690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:a09702ea2fdc34bbc06d4b88d9d376c81a54e7d69c47cd2282272d3d0792786f","observation_id":"e5f3f6be-1f8d-4b43-b24e-4c2a57f78860","resolution":{"observed_at":"2026-05-15T06:05:05.659613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-05T19:35:12.428969Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2511.20347","doi":"10.48550/arxiv.2511.20347","metadata_source":"pith","pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Soft Adaptive Policy Optimization","venue":"cs.LG","work_id":"2d2c49f8-7feb-48c2-af7e-025b94c5d4f9","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:b5146fc0edb77af5a1fbdef1641e69dd09b85a59357f198bcc463af8b2c9e600","observation_id":"8856dd9e-94e2-4b81-9eb3-f3c951952dca","resolution":{"observed_at":"2026-05-15T07:14:32.897338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cruxeval: a benchmark for code reasoning, understanding and execution","venue":null,"work_id":"01b66f24-990b-44f2-9ed4-f686b24c799d","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:268627a3461d5b5fe79451dc594adfa9fb1d9cd68e792ff808acf56ce2324591","observation_id":"6ba870ad-b434-4d29-96d7-550254fd19fe","resolution":{"observed_at":"2026-05-15T06:05:07.241583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning","venue":null,"work_id":"a67a9421-7df1-4590-9787-2bd676fe4998","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:518dc0b4fec887cb994a49852e53bd697b074565288ae45c191da3d0192853c1","observation_id":"5e39f9a5-9ee6-4017-843e-11a10abceef8","resolution":{"observed_at":"2026-05-15T06:05:07.341060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.16649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:33:45.146128Z","title":"Justrl: Scaling a 1.5 b llm with a simple rl recipe","venue":null,"work_id":"fae7d2ce-42fc-469f-9b46-42b5103f2013","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:6b15558bc37db9ff29ff2c0d7a8bc6eabcec67ac09d634cf4ce014538220156e","observation_id":"6e75603b-2526-4ebc-b4cd-a2d248c8d701","resolution":{"observed_at":"2026-05-15T06:05:06.411153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"086d9f7b-6061-42fc-b963-501fb16f1b60","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:704cade419c94c7da3af9bfbe2fa085c46aac4e322f6f28628d5e6aa83df2f8a","observation_id":"fba3d225-0820-4d67-b561-0af838b82cf1","resolution":{"observed_at":"2026-05-15T06:05:07.232094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond magnitude: Leveraging direction of RLVR updates for LLM reasoning","venue":null,"work_id":"9928a774-cdfd-4340-8bbb-1b4cd8e634e5","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:4684d897c9be54de096611d9004a0d027ca60e7c414cddd5a130faeb77357234","observation_id":"9c7ad0fa-9c35-4b1b-8695-6f7a878a8d24","resolution":{"observed_at":"2026-05-15T06:05:07.345882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:78c0d305f00db8b44313be59e8d6cdb665e722938735ab88267d807c9012a20c","observation_id":"24ae3fb6-e3be-4267-9a71-6dd8dae4e587","resolution":{"observed_at":"2026-05-15T06:05:06.358962Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions","venue":null,"work_id":"0726aa37-e652-4706-b7fa-d290636cd7bd","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:864fba43d3a9be3eea60cb32344c179171d040f2b26cb54e9bd5f7686f92648b","observation_id":"b0d0c371-6857-4216-a62a-ab18fd029ed8","resolution":{"observed_at":"2026-05-15T06:05:07.282461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let's verify step by step","venue":null,"work_id":"de7c1191-6a99-49a0-9769-5d8ecfbd05fd","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:863e04cac63378093803daa7a1a30e65f5469a3a28fb7fdaba58b4e3be41756c","observation_id":"a2ef35dd-7d2d-48ad-8050-9688232c2bd3","resolution":{"observed_at":"2026-05-15T06:05:07.336982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupling exploration and exploitation for meta-reinforcement learning without sacrifices","venue":null,"work_id":"ec8928a5-7cb8-44e3-bc98-4687da78f20a","year":2021},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:1e375ee3b1e7283beea74b73907544a929f2ab77af12b11f010ba9051c6c9c26","observation_id":"2dde0b84-2aea-48ca-9a2d-70b6c24df2ee","resolution":{"observed_at":"2026-05-15T06:05:07.287566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sparse but critical: A token-level analysis of distributional shifts in RLVR fine-tuning of LLM s","venue":null,"work_id":"ec70d44b-8899-4e14-851f-6e49c1ffed70","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:5ae8db23fb8b8698b831665d35fffecc4b99436be4a636a29dd31d28e0bdd428","observation_id":"36da2de1-db94-4260-a5e6-412e8fd3eabe","resolution":{"observed_at":"2026-05-15T06:05:07.350658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T01:25:50.039674Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models","venue":null,"work_id":"3b9e4837-7ef7-4703-8021-44487dbe944c","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:b7dcb6e2a3d9aa34ae1e3bcd471897e49bdbab09076f419867b4ad9acde07f17","observation_id":"b0dff27b-85c0-4c12-85c9-957b900868f5","resolution":{"observed_at":"2026-05-15T06:05:07.226641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11682","doi":"10.48550/arxiv.2603.11682","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2603.11682 , year=","venue":"arXiv (Cornell University)","work_id":"b66e6aa6-1f10-408b-a82d-5e8f3f1254fb","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:e4e662fe6376ab3fa4ed0851976c9c59d211a5f4020e012048f2a70cdbf55bd2","observation_id":"070ce4c6-bb11-42bc-89fc-9f0f16a608a5","resolution":{"observed_at":"2026-05-15T06:05:05.708407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":"2505.22660","doi":"10.48550/arxiv.2505.22660","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Maximizing confidence alone improves reasoning","venue":"ArXiv.org","work_id":"471b6786-7627-4021-a6b3-7f5cd8c83643","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:3e0e0c37eade237abba043e324cfa167c5fb8fb0f6051eeadfb7d2ff17af21e7","observation_id":"b73e19ba-45b9-4726-b24c-e3606efe6291","resolution":{"observed_at":"2026-05-15T06:05:05.692197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:7249eea5f391c0537c1656832c8abc23ffe950f341ee25c3309493968a74f511","observation_id":"79a78249-4165-4de3-a3d8-78d1945ba278","resolution":{"observed_at":"2026-05-15T06:05:06.367627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03493","doi":"10.48550/arxiv.2509.03493","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493","venue":"ArXiv.org","work_id":"d2abae43-fc14-4255-b3f8-027a818c366b","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:f7398d52863adcec81ffc1c055a1600a23ce88b3128e3c8e51183e6a2a83c90f","observation_id":"64eb57fc-08ca-427f-b6b9-b07d867ba27d","resolution":{"observed_at":"2026-05-15T06:05:05.699864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20712","last_updated":"2026-04-23T12:06:05Z","snapshot_observed_at":"2026-08-01T01:36:06.945684Z","submitted_at":"2025-09-25T03:22:04Z","title":"CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2509.20712","doi":"10.48550/arxiv.2509.20712","metadata_source":"pith","pith_arxiv_id":"2509.20712","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"CE-GPPO: Coordinating Entropy via Gradient-Preserving Clipping Policy Optimization in Reinforcement Learning","venue":"cs.LG","work_id":"64b42ded-c050-4dc6-9bd5-2682d8acd718","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2509.20712","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:bfe24e8efe9d0052e07aee01078dbc616941278051d7b10d5726b3438a4ce3c7","observation_id":"b0deea67-a24b-4311-924c-526b4531eaaf","resolution":{"observed_at":"2026-05-15T06:05:05.608396Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1998.712192","doi":"10.1109/tnn.1998.712192","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MIT press, ??? (2018)","venue":"IEEE Transactions on Neural Networks","work_id":"54d27712-81f4-4312-83f9-32fee26ac9f9","year":1998},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:dc1f3f2b659350127f3ebe7fd67d97915f02d14c762a880a612f9b8346706baf","observation_id":"528c41a9-d157-4d40-be88-acf15de1cbbe","resolution":{"observed_at":"2026-05-15T06:05:05.617258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-17T00:20:41.635102+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T00:20:41.635102+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21625","doi":"10.48550/arxiv.2512.21625","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rethinking sample polarity in reinforcement learning with verifiable rewards","venue":"arXiv (Cornell University)","work_id":"0f345e40-45da-4508-98ad-f641e718c578","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:847559a1713b019fe2ea29228d634cf27a65d530cbffb58614f84844f55c5b9a","observation_id":"006a1428-f998-4e51-99ab-92ef524468ff","resolution":{"observed_at":"2026-05-15T06:05:05.634180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08690","last_updated":"2026-04-09T18:22:31Z","snapshot_observed_at":"2026-07-06T22:57:45.084987Z","submitted_at":"2026-04-09T18:22:31Z","title":"Skip-Connected Policy Optimization for Implicit Advantage","version":1},"cited_work":{"arxiv_id":"2604.08690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08690","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skip-Connected Policy Optimization for Implicit Advantage","venue":"cs.LG","work_id":"8e1bc5dd-aff9-456d-a9bb-9cc780f09d43","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2604.08690","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:10a020d846290d8d012b2a77133f16ad5e7418d6a3c459450d45fce0fd25c0e2","observation_id":"c4e907c9-0b5b-466c-ad64-da9b26aaa512","resolution":{"observed_at":"2026-05-15T06:05:06.343713Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":"146d19ca-62d6-47e6-ac4c-7a26f538252e","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:ef33c428ec83b738291dd64a221e95ee018f8b6405e2d3bfdbaa946e9a1cbe0d","observation_id":"297a523d-7f92-48ad-a280-3973a6a0d88c","resolution":{"observed_at":"2026-05-15T06:05:07.277297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"dd2cb589-3985-475f-8c51-9d82b0346c6f","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:e961f618e3a0d5f4ba185abbb150052acca22e34741ed46b529352427bef0669","observation_id":"111f4477-1712-4f52-80f1-8eda29f0efdd","resolution":{"observed_at":"2026-05-15T06:05:07.293189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:ceb55590c8eaa77cd47ba2cc68814c9292f439f43a14b420fff5cbb4a584b3eb","observation_id":"199a2e9b-eb9a-4a3a-940b-4e6a27353c78","resolution":{"observed_at":"2026-05-15T06:05:05.669079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.12011","doi":"10.48550/arxiv.2603.12011","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can RL improve generalization of LLM agents? an empirical study","venue":"arXiv (Cornell University)","work_id":"204096db-3127-47f7-873f-f84e74015524","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:1a2a8c726cab61dfa6d9714c5ff525f807d7840f2e71f386d464417d85a70579","observation_id":"2526582d-bd22-45fd-a8ca-d41b717612f9","resolution":{"observed_at":"2026-05-15T06:05:05.625527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BAPO : Stabilizing off-policy reinforcement learning for LLM s via balanced policy optimization with adaptive clipping","venue":null,"work_id":"6089446b-ee34-44f1-996f-afcd95fc99d9","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:494ee43eda4ce7dc24859a31d61c0d9b342684a95a945dfa534b550785775c28","observation_id":"74cbe1d4-6a43-45fa-ac36-e21311350669","resolution":{"observed_at":"2026-05-15T06:05:07.332968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:8b1033e55443c2188a1ba881fbe1c6dbc49b10c5200073e8bca7346c9d7c794f","observation_id":"ec936a71-24ac-4c62-bad9-098338dd98df","resolution":{"observed_at":"2026-05-15T06:05:06.418576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DAPO : An open-source LLM reinforcement learning system at scale","venue":null,"work_id":"da533b76-5643-45d4-b89f-d75aabf03820","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:b863fcbbcb8e57407a78001160c5ceb1bb3e1190d15b7eae6ad110880aa8a4f4","observation_id":"69d64e5d-9cc7-4ce0-b5fc-3631a6d2fb5e","resolution":{"observed_at":"2026-05-15T06:05:07.267547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16004","last_updated":"2026-04-17T12:27:36Z","snapshot_observed_at":"2026-08-02T20:20:44.264764Z","submitted_at":"2026-04-17T12:27:36Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","version":1},"cited_work":{"arxiv_id":"2604.16004","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16004","snapshot_observed_at":"2026-07-04T20:20:07.663758Z","title":"AgentV-RL: Scaling Reward Modeling with Agentic Verifier","venue":"cs.CL","work_id":"bba2b44a-06ba-4a37-95fc-5e5ede30502d","year":2026},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2604.16004","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:28e8bf4235f1cf5ff3f52f496411d42be2312343ba96a8c2502b6e5ceef375ad","observation_id":"456abcf3-3977-4592-8a7f-568bbf7d12d0","resolution":{"observed_at":"2026-05-15T06:05:06.388468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2509.08827","doi":"10.48550/arxiv.2509.08827","metadata_source":"pith","pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"7618c14b-e527-4268-9926-d4f462ea9925","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:42f7d2f94fbb133a9bf53ad885aca2ce73dee84e6a9e0cd0cde1f252b70c89ea","observation_id":"783afc32-a3c2-4eb0-b8e0-1f14ff5ed753","resolution":{"observed_at":"2026-05-18T00:02:25.511734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-01T20:37:21.838499Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":"2505.00024","doi":"10.48550/arxiv.2505.00024","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nemotron-Research-Tool-N1: Exploring tool-using language models with reinforced reasoning","venue":"ArXiv.org","work_id":"861a7bc1-6e5d-413f-84e6-523c0ff999b1","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:2828f66fd8c3e5c6bc9bd715db4046c9591489fca27412e64f3fdd1328de32dd","observation_id":"43e4fe24-08dc-4499-af74-b9b8f36dbb38","resolution":{"observed_at":"2026-05-15T06:05:06.427969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"American invitational mathematics examination (aime) 2024","venue":null,"work_id":"701bab9a-af68-485b-8cb3-9355bfaa67ab","year":2024},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:95cfa88c5af0ef02aeb6e237eaf194e5b48579898a34b635fa7fa1260de7701c","observation_id":"1af3f861-a842-4766-98b6-41912ba6e535","resolution":{"observed_at":"2026-05-15T06:05:07.183500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.23508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:27:36.603873Z","title":"Why reinforcement fine-tuning enables mllms preserve prior knowledge better: A data perspective","venue":null,"work_id":"61601728-a12e-4d63-ba96-7e14553a35c2","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:7c11db0ffa49b88600e1acc59d42f2971fb70553bb77883e8315fbd9bb014e82","observation_id":"2d6da1e6-b7fd-4619-afe4-228f2c821d11","resolution":{"observed_at":"2026-05-15T06:05:06.435798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:94c1ac54c49ee5f1ce9bd7915b74d3d4b1f1e6f2ff454136bedc51a1c1060487","observation_id":"f4af5695-b46f-47ec-a2b8-c376b1329923","resolution":{"observed_at":"2026-05-15T06:05:06.397134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:cbdb232c8587160221a0736251e99603ff444e6c3ab4e1ecb73e440e39f222cc","observation_id":"d4440e23-b9ac-4779-a490-10a0565f32c3","resolution":{"observed_at":"2026-05-15T06:05:06.350493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":30,"verified_fuzzy":36},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2605.11775."}