{"as_of":"2026-08-20T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:438a8b6ce331778d6e34dde682e03eea2a81d27fdc32e7f57a4e5dcb14779c82","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:29:01.735774Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:52:02.124869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T14:27:07.373132Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-08-14T07:39:12.121905Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-21T23:20:45.685446Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2507.15778"},"observation_digest":"sha256:5a2212306ad983cfa2112c6aeae7336d6e4a58ad3ceb5ff4ab59909582d9a040","observation_id":"e4be3531-b861-4d71-b485-7ec46ae5d5d7","resolution":{"observed_at":"2026-05-21T23:24:26.303073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2511.00066","last_updated":"2026-05-13T07:57:37Z","snapshot_observed_at":"2026-08-06T07:33:01.385285Z","submitted_at":"2025-10-29T08:07:47Z","title":"Sharpness-Guided Group Relative Policy Optimization via Probability Shaping","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T03:10:57.839146Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2511.00066"},"observation_digest":"sha256:03732f5fd8a6d017b22070defd3a15f024b5cacd6fbb99bbeb5cf885ef63fa7a","observation_id":"c743253d-9e0d-4fdb-aa86-b63a49ff7c4e","resolution":{"observed_at":"2026-05-18T03:12:22.271239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2602.15620","last_updated":"2026-05-25T12:27:41Z","snapshot_observed_at":"2026-08-16T20:49:49.237354Z","submitted_at":"2026-02-17T14:46:48Z","title":"STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T21:41:48.690125Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2602.15620"},"observation_digest":"sha256:3d590b47b303da6ae6be1261b2a6f0ce5f282c7e895823ba27aa4e132db52301","observation_id":"02ac3733-2f36-4d5f-8fbe-047402cdfd01","resolution":{"observed_at":"2026-05-15T21:46:43.296750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-08-02T22:52:02.124869Z","title":"Do not let low-probability tokens over-dominate in rl for llms.arXiv preprint arXiv:2505.12929, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15620","last_updated":"2026-05-25T12:27:41Z","snapshot_observed_at":"2026-08-16T20:49:49.237354Z","submitted_at":"2026-02-17T14:46:48Z","title":"STAPO: Stabilizing Reinforcement Learning for LLMs by Silencing Rare Spurious Tokens","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:52:02.124869Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2602.15620"},"observation_digest":"sha256:4220999be63a4e2d0a3888c9de7d15ec1d06d7cdbafae554b7c2b51cb07f95f0","observation_id":"cad0b166-4da6-4db6-a43a-72de0c98a855","resolution":{"observed_at":"2026-08-02T22:52:02.124869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-08-15T05:16:18.752791Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:29.531510Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2604.20659"},"observation_digest":"sha256:e386863ad25eb955f3c857a6c6879dd2a1063a20ddfae17751ad22fc5438347b","observation_id":"648c269a-14bd-455c-a677-c86f9c05996b","resolution":{"observed_at":"2026-05-10T00:14:46.307201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:7ba9f532ff51cf168d74f8233bb1e5ef0793adef5f1d19f778820e172523c289","observation_id":"4c3acee1-4909-4b4f-968c-40287fac6581","resolution":{"observed_at":"2026-05-13T06:12:22.793408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:1773ed785b5d57229c9dc185eacd86902ef861bea0e811c52128e2a1cb84fca0","observation_id":"ea8c1185-787b-401f-98a2-5f755ff490cd","resolution":{"observed_at":"2026-05-22T10:01:22.958441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-16T19:46:07.684977Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-21T06:08:55.571828Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:5c7f4064a87d6d7e4c047ead039ed487239fbadd224008a830be20a9deb3bc4c","observation_id":"6a685f5c-6fd3-43b6-8ad2-5f37239a67b5","resolution":{"observed_at":"2026-05-21T06:09:41.284703Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.21125","last_updated":"2026-05-30T15:03:07Z","snapshot_observed_at":"2026-08-16T19:46:07.684977Z","submitted_at":"2026-05-20T12:57:37Z","title":"Advantage Collapse in Group Relative Policy Optimization: Diagnosis and Mitigation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-30T17:15:53.286925Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.21125"},"observation_digest":"sha256:d11bc89e63bd52ffb69c17e806e376e8dfcb2e56a8c4bcf0abbfdb66eb77df78","observation_id":"b10868ed-2f85-4319-9de5-65ce2c902b99","resolution":{"observed_at":"2026-07-01T15:15:47.303183Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-08-12T16:52:00.941028Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T07:50:44.907952Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.22703"},"observation_digest":"sha256:f116dbd7399628e6e289d9dc819185063025cee6415c443e5c72167a00923c87","observation_id":"131054e5-b69f-4763-ab6b-3bc8dd993145","resolution":{"observed_at":"2026-05-22T07:51:15.632516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2605.25381","last_updated":"2026-05-25T03:10:51Z","snapshot_observed_at":"2026-08-15T15:09:20.713887Z","submitted_at":"2026-05-25T03:10:51Z","title":"Not only where, But when: Temporal Scheduling for RLVR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T22:34:44.791173Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2605.25381"},"observation_digest":"sha256:a9c11d3a7fffa4052b2b58c374c805968c4edf25506d1d46251b812cb60bfca0","observation_id":"fd100329-ae05-43c5-ba78-30f6b5c19ba2","resolution":{"observed_at":"2026-06-29T22:44:01.829569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":239,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:baf4d1d40c30b7d670dea8bc3739a66b4b8ee5356254983e69d5efa5a6cc30b7","observation_id":"76058b5a-fb62-4cd7-ac8a-b0925351b827","resolution":{"observed_at":"2026-07-01T20:56:13.433277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:8187fa96e4c0a4a3a9fde566303a0233288ad5d6ec52114d27a8128b8c244a42","observation_id":"d296df5d-1a88-43d9-bdd4-bdf8708b5267","resolution":{"observed_at":"2026-07-03T20:38:55.893132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:df05860b2a79fab6b427eaf4813e92d78654e4c1cdd26b4710026d6a131c3979","observation_id":"af7bf6e4-7168-4bd3-8cb3-3bc0f4d082bd","resolution":{"observed_at":"2026-07-04T09:09:43.578480Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"cited_work":{"arxiv_id":"2505.12929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12929","snapshot_observed_at":"2026-07-10T14:27:07.373132Z","title":"arXiv preprint arXiv:2505.12929 , year=","venue":"cs.CL","work_id":"965c4b96-d845-4417-bb01-9ec7fd03e93b","year":2025},"citing_paper":{"arxiv_id":"2607.07976","last_updated":"2026-07-08T23:00:54Z","snapshot_observed_at":"2026-08-12T14:19:36.332471Z","submitted_at":"2026-07-08T23:00:54Z","title":"When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T14:25:07.006233Z"},"links":{"cited_paper":"/paper/2505.12929","citing_paper":"/paper/2607.07976"},"observation_digest":"sha256:378862304b4913975ae24378d7c49dc31d107fc894b3c34f0879df66ace49d0b","observation_id":"de480b0e-a72d-4343-9e30-f44cbd760865","resolution":{"observed_at":"2026-07-10T14:27:07.374977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.12929/citation-record","integrity":"/paper/2505.12929/integrity","json":"/paper/2505.12929/citation-record.json","paper":"/paper/2505.12929"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:29:01.471084Z","title":"OpenAI o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.471084Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:08bc9c05d01286c5444b4d7561ef61500783d5224ef5e3bed04c7abc5c105195","observation_id":"5526fc05-a027-4cc4-87c6-ddaddea30bdd","resolution":{"observed_at":"2026-08-15T20:29:01.471084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:29:01.477574Z","title":"Deepseek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.477574Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:c32d58c5fde3967c5a4551c649beec1eb977792415a571db744d244c88b74597","observation_id":"5406fdbb-4131-4219-b078-e436f69483f6","resolution":{"observed_at":"2026-08-15T20:29:01.477574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:29:01.483089Z","title":"Kimi k1.5: Scaling reinforcement learning with LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.483089Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:17536c60e040887212cac76a905355a455df7757c443f176748788146ed3f3c0","observation_id":"6a56aad7-552c-4c90-a4cc-73f0a93fef00","resolution":{"observed_at":"2026-08-15T20:29:01.483089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.631388Z","title":"Monte carlo tree search boosts reasoning via iterative preference learning","venue":null,"work_id":"6c7c4f72-2d89-4a03-8780-75a9935f5c39","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.489299Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:93d5edfc13fe2d403233dcc912745ecd77eb795c82af153be6edd40cf5c8ba5f","observation_id":"849d660e-a703-481c-a394-af141c2fa03e","resolution":{"observed_at":"2026-08-15T20:29:02.636536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.615031Z","title":"Alphamath almost zero: Process su- pervision without process","venue":null,"work_id":"df23e493-ffc0-4c40-9c44-b0d77f5ec409","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.494519Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:1450089467615e56b13a21caef34f9ae18d1e2b4cbc10a23246367f1dc4c2cfe","observation_id":"8918163f-31d7-4a78-a55c-f9f82be8e9ec","resolution":{"observed_at":"2026-08-15T20:29:02.620104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.500140Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.500140Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:89d9b7a2e1212145de9e9dc0d5bed08dc1bc5c28233f764c51aaac97c4de4d33","observation_id":"9da1503d-f1d6-4bd1-982f-54a9245f8d6a","resolution":{"observed_at":"2026-08-15T20:29:01.500140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.588284Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"3a437397-c2cf-4780-b134-35ae91b7dad3","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.505500Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:1b9515594476e699c32e39af0dd7e99d7ae1c9605a3de1740acb25aeabd0d469","observation_id":"c1598d75-938b-4f66-afa4-48079d76a431","resolution":{"observed_at":"2026-08-15T20:29:02.593102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:29:01.510372Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.510372Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:57447dfd4b10f6a58f2e4a47691e360aff86681e6a3d2e2c88ba12171d3ca2e4","observation_id":"6bca8f1d-3e62-4948-9d66-ab6019275a4f","resolution":{"observed_at":"2026-08-15T20:29:01.510372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:29:01.515576Z","title":"DAPO: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.515576Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:7b021222c1223ce495c4eafcddc337fa7ac0ac159a6475e054d236ca22b0e1e6","observation_id":"05325b6c-6c2f-4ed9-b818-fd78ae52ee50","resolution":{"observed_at":"2026-08-15T20:29:01.515576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T20:29:01.521431Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.521431Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:82860cc48bb1e5531164f7981cde8c9305987b612642dcf38be80d8c4a763acb","observation_id":"65b6a274-cf18-4d2e-a71f-f91342c50a10","resolution":{"observed_at":"2026-08-15T20:29:01.521431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-16T12:40:48.744732Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:29:01.530228Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.530228Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:7a4e778a52ceb877c83e8986ebb490b0a3d4e42f03e2d6784beb0c572e32e986","observation_id":"ead49eaa-8eb3-46c2-b3bd-ebb996ea348c","resolution":{"observed_at":"2026-08-15T20:29:01.530228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.573720Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"30649b2a-a9a9-4e75-bb64-99e0b6c74807","year":2017},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.535467Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:ebbad3e1010fb17f1cfb99ea332bc8b58c5be726cec20a28e1ba2b53905ca113","observation_id":"86589244-9023-4876-b9c9-048fc525436b","resolution":{"observed_at":"2026-08-15T20:29:02.578463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-15T20:29:01.540427Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.540427Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:b84b967a1dc5e22292137cbdef5818f27d962420bbb54468b072e648a247c5ac","observation_id":"eb4ed842-0e90-48ff-81a3-24067ce60bff","resolution":{"observed_at":"2026-08-15T20:29:01.540427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.558197Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"e668b5a3-7c3b-4b8f-8f1b-1a5fa6abe955","year":2020},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.545522Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:cc093766fb328dcf1ba3ce5b0660e297a251ba218ddc9270a3ea1539c63b9fef","observation_id":"fff14750-b579-4fef-8a0f-808dd0f1ef5c","resolution":{"observed_at":"2026-08-15T20:29:02.563031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.543163Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"7c0d750b-a665-4311-9f78-2912d923d4c3","year":2022},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.550214Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:3254843f02b13dba58145df834e13e569d598190ec5dd5e503046d07875dd463","observation_id":"19befe5b-abac-4da2-b8f0-3019168b228a","resolution":{"observed_at":"2026-08-15T20:29:02.548096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:29:01.555019Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.555019Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:d609b8d78273a75c63659f0874226fdc5effb07459a7d98d57beda20c73b98e7","observation_id":"6f80dba7-3e47-4faf-9b55-d81fbd7307fb","resolution":{"observed_at":"2026-08-15T20:29:01.555019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.527092Z","title":"Language models are few-shot learners","venue":null,"work_id":"c38ea5eb-255f-4510-bb17-1f236cad150d","year":2020},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.560022Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:39420f02a5754efe91082046a1b3f8383e03101f0b4cfc127df102f4de8084c8","observation_id":"c0eb6887-8369-4124-bfd6-94ab3d1cf39f","resolution":{"observed_at":"2026-08-15T20:29:02.532709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:29:01.565135Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.565135Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:306dcdb52174409f8544a7615ea08e34722f7b33ac325cc8774386639eea8315","observation_id":"d9dff6a3-44c1-4cc3-99c9-622bed19f749","resolution":{"observed_at":"2026-08-15T20:29:01.565135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:29:01.570064Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.570064Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:a84706239879aa2aedb1358830fc087d109fbb570046eefeff2b142e8c24219c","observation_id":"8721c4e6-4de0-400d-88e9-f525a519c028","resolution":{"observed_at":"2026-08-15T20:29:01.570064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:29:01.574926Z","title":"LLaMA 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.574926Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:555e75bf056f558fb817c6427a725bb5f53983840981bd24b75783cabd88823d","observation_id":"c5494e24-675c-4573-9b1e-238c749465f7","resolution":{"observed_at":"2026-08-15T20:29:01.574926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:29:01.579804Z","title":"The LLaMA 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.579804Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:a5bfa727fa2450c60ddf08372dcf9f50bc3358fa0ca981fca75cffcd76df2afe","observation_id":"3a37f115-ddb2-40c6-8dbd-f4c0800be69e","resolution":{"observed_at":"2026-08-15T20:29:01.579804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T20:29:01.584511Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.584511Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:c38ee6b4b61eee79a762a874507847a8f47a9a00cc5ff529d65bbac783fddf0b","observation_id":"1a5ae833-4b33-4c01-a70a-33b0528dfe75","resolution":{"observed_at":"2026-08-15T20:29:01.584511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-15T20:29:01.589285Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.589285Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:9e9f8cfd1c41d253f56b63ab35f47a09f822651a3b85d5093ebbdeb1bb377ac5","observation_id":"592b6e06-1238-4e85-a6d8-5d22647b2ba2","resolution":{"observed_at":"2026-08-15T20:29:01.589285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T20:29:01.594462Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.594462Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:ea803fe740494993365ff35106578984fa733ed6457cd159c394ae13cbffbcef","observation_id":"eb40335f-8ec3-4346-905a-1d47c932203b","resolution":{"observed_at":"2026-08-15T20:29:01.594462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:29:01.599413Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.599413Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:a183c4e2bdacbe924e108ddcd2c5d91296ecc7a3ff214c2b02d91a97f17212e7","observation_id":"c936a1ed-f186-4dc2-beef-6ff0e6f89a4d","resolution":{"observed_at":"2026-08-15T20:29:01.599413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:29:01.604503Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.604503Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:e46557fb79b081beb9266d938ef69792ec91aa314ef37684a9f2afccc02ce2f7","observation_id":"4b64ba0f-edad-4a25-93c6-609c5fca5bf0","resolution":{"observed_at":"2026-08-15T20:29:01.604503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.511477Z","title":"The Claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"89839826-841e-4af3-b686-5687f2246df6","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.609712Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:180e7e42df88d4df2bfdc63315e2b0a3ff42108bda428be7b70e9cc296b0301f","observation_id":"e10b5731-abd3-4506-93b6-4454f4999754","resolution":{"observed_at":"2026-08-15T20:29:02.516490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.495248Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"bb6e4666-2e68-43f8-9ce7-819a8df96f9e","year":2023},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.614552Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:e5b2429e5a7b36d3c275be26c02926ca9241ed6459489d611e8282afb5301a37","observation_id":"70e37f1d-b0ac-4b72-90ed-508ec8d1f208","resolution":{"observed_at":"2026-08-15T20:29:02.500182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.479818Z","title":"From r to Q*: Your language model is secretly a Q-function","venue":null,"work_id":"ce5ac282-1e2f-4481-a028-6f11618e2d91","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.619470Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:e161f7847658e4c236ceb4e8a605260fe57adf39fe5394b593d889a68f0997b2","observation_id":"f45a84af-8051-43c6-9fe8-9a24b9753eb3","resolution":{"observed_at":"2026-08-15T20:29:02.484484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.464043Z","title":"Is DPO superior to PPO for LLM alignment? a comprehensive study","venue":null,"work_id":"1a14d124-c5c9-48a7-a745-8e182fb4e8b4","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.624457Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:54ed23e10d5af0ed3b9206e7c7f7090b8a959ffa8c5fe36460cf02f2557b45bf","observation_id":"886ec526-8660-4ab8-8745-dd8ab8c30c4d","resolution":{"observed_at":"2026-08-15T20:29:02.469600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.448258Z","title":"DPO meets PPO: Reinforced token optimization for RLHF","venue":null,"work_id":"5e799c51-9fbb-4efe-a7c3-63a2d5465c09","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.629387Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:45fe44bafbcbc11f9e4fac34544f8d030dd8b9ff318a0106510d672a9c75dcf4","observation_id":"af302d94-5822-44ae-9f6e-1e4bc9e9000c","resolution":{"observed_at":"2026-08-15T20:29:02.453265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.430952Z","title":"Sutherland","venue":null,"work_id":"e5809fa6-cf70-44f3-b7f0-1fa1f14b115e","year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.634236Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:72b417fb9c4bc41bfa8b098733c1afe82bd5046589c470c3c8ba3c54ff0e6380","observation_id":"ca71bb59-21f8-4a8c-a71f-2b463adc45f9","resolution":{"observed_at":"2026-08-15T20:29:02.436839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.413662Z","title":"ORPO: Monolithic preference optimization without reference model","venue":null,"work_id":"d7107245-21e8-4dc2-a8ea-5850620ffc05","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.639159Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:75fd32509616485d8707bec2bf8fffa8a566834cd35ab2626380201c654c6c3f","observation_id":"358cdf93-5346-44f3-85dc-ec67d831372a","resolution":{"observed_at":"2026-08-15T20:29:02.418963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.396883Z","title":"Contrastive preference optimization: Pushing the boundaries of llm performance in machine translation","venue":null,"work_id":"2b55a70e-396f-4bd5-bf7f-e6c66cca04ee","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.644026Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:c9681b4148429876491ecbc70461851ed3925ff49b37fd66d554ed3bf773cd6b","observation_id":"b03a277f-c07d-4d39-9843-a34a48e52781","resolution":{"observed_at":"2026-08-15T20:29:02.402551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.381528Z","title":"SimPO: Simple preference optimization with a reference-free reward","venue":null,"work_id":"6ec14bb4-3438-4d5a-9e15-7a6d34c4bc3b","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.648645Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:b70fe7324697ce70f34540ed247f304e08575810b0c7fbc846007bd3f66d177e","observation_id":"2598b004-24fb-4140-9093-fafc0e0d9354","resolution":{"observed_at":"2026-08-15T20:29:02.386629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.365635Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"edad32d9-51e7-4399-8f01-617f830b6021","year":2022},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.653279Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:1c5aa849e258c62d236e8b451b8646b78f5e54e137a43255c4d967cc85175a23","observation_id":"c609134d-aa82-41d7-b185-fd9961827394","resolution":{"observed_at":"2026-08-15T20:29:02.370794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.349254Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"90ec67cd-a121-4e15-8d80-307c72ada6a8","year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.657932Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:c5a2e6a596fbde936f468726740c69b07c88d2fb7200d1d801e8b986d5893018","observation_id":"382cad17-3053-43f5-b5a6-843a7bd4733f","resolution":{"observed_at":"2026-08-15T20:29:02.354290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-15T20:29:01.662434Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.662434Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:35c48b14ea4d22b83bb45fec6903c8c5177c7764aaab678e773988b117eb6f75","observation_id":"c454f95f-1eff-4265-8ec9-d772c025551e","resolution":{"observed_at":"2026-08-15T20:29:01.662434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-15T20:29:01.668030Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.668030Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:b3dc18a391b3897d9f0692948ee335d3701f732ea300d32e3c11ed54678c4a87","observation_id":"f56f0902-ac21-4a42-b8e3-70542325af25","resolution":{"observed_at":"2026-08-15T20:29:01.668030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-15T20:29:01.673051Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.673051Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:a8b988c3f3186f8426276d7e38e37d10207c6c9b7ef01631f687314b05c4c240","observation_id":"be9b3875-e80d-41f1-99ae-44df00a5b9fa","resolution":{"observed_at":"2026-08-15T20:29:01.673051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-15T20:29:01.677994Z","title":"V APO: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.677994Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:70c2632565dc356754f18b6b89d5df31e9adc5ffcac13aa7aa6621cd324f996a","observation_id":"b3a2ab91-fd47-4fbf-be6b-6453c3378dc6","resolution":{"observed_at":"2026-08-15T20:29:01.677994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-19T18:44:04.628527Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-15T20:29:01.683537Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.683537Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:40307a29b6d99baf06a8770e062e00bf834963aa38684e2639b294891b67a9c8","observation_id":"678ca9be-48c7-41f6-9b1e-2c2002903985","resolution":{"observed_at":"2026-08-15T20:29:01.683537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:01.688332Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.688332Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:e13f8addb98bab48b2ce90bcd668363affa6516047e53d2d95556bb9eeec2446","observation_id":"d493bbd5-ac1e-424f-ad86-3f04f77d726a","resolution":{"observed_at":"2026-08-15T20:29:01.688332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.322732Z","title":"Hybridflow: A flexible and efficient RLHF framework","venue":null,"work_id":"4bc9415a-1dc3-4312-a34f-70a373a90da3","year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.692734Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:172f61a4d48e7d52fdfe19a243044c08854722939715f71440f98a359116220a","observation_id":"d7c8b96d-491a-4a48-9c27-be32b1f6ca01","resolution":{"observed_at":"2026-08-15T20:29:02.327951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23123","last_updated":"2025-03-04T06:22:40Z","snapshot_observed_at":"2026-08-19T12:25:16.688145Z","submitted_at":"2024-10-30T15:31:54Z","title":"On Memorization of Large Language Models in Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23123","snapshot_observed_at":"2026-08-15T20:29:01.697399Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.697399Z"},"links":{"cited_paper":"/paper/2410.23123","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:da4d734447567af01f7ed8ca6e73e69763d7c64922475c5c902be46cccec972e","observation_id":"778f7272-2792-4308-8ac7-820d26be5555","resolution":{"observed_at":"2026-08-15T20:29:01.697399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-15T20:29:01.702314Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.702314Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:56b8869627cf6bd313ed1420ee1cd30fedcf5cc600493c28dba7048398c8104e","observation_id":"fd308106-049f-4688-bc4d-c98e4417cb56","resolution":{"observed_at":"2026-08-15T20:29:01.702314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.305502Z","title":"What is the name of this book? Touchstone Books Guildford, UK, 1986","venue":null,"work_id":"cd187db7-76f4-46ce-86d0-fe5e6ea7da88","year":1986},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.707311Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:55f66aa546768a36787d7c61052564cf38552c7ab8906339a7526a59927aeaa2","observation_id":"dbf63c99-bd86-4c73-b8d2-e1b74458d0fb","resolution":{"observed_at":"2026-08-15T20:29:02.311449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.288654Z","title":"Meta-logical problems: Knights, knaves, and rips","venue":null,"work_id":"ff2c7a58-caeb-4832-af35-4594c416f916","year":1990},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.712056Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:6ae0cbe8afdd9b633c74657c76a29f0e44d3be6a052e28e173933b159771d09f","observation_id":"166b8592-9003-4ddd-b4ad-2f844a56be24","resolution":{"observed_at":"2026-08-15T20:29:02.293570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.272217Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"50c11827-a81f-49de-96f7-ade58d9a7905","year":2024},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.716603Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:f843587600eabce139b24835568e5d53ad4011046a65f9bc45261d4c53fa59fa","observation_id":"dc81e272-2755-4b6f-8cba-3e83b7eeea38","resolution":{"observed_at":"2026-08-15T20:29:02.277686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.255397Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"9b7a292b-83dd-4e33-81d0-f1079a3e13dd","year":2022},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.721440Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:24c748397000592139dced4f0d9164b6f5a05495352efee54ca5246ed0b80dc1","observation_id":"1f3f9c9a-d5b5-41ca-b292-f76012178bd4","resolution":{"observed_at":"2026-08-15T20:29:02.260729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T20:29:01.726086Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.726086Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:759dc2404bf269ff426f61dca77e132dd8ae452ab1df123aa275f188cd41707b","observation_id":"2c0a9a57-5372-4268-9459-0029ae0f16da","resolution":{"observed_at":"2026-08-15T20:29:01.726086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.239364Z","title":"Approximating KL divergence","venue":null,"work_id":"b5c3bcdf-fa68-4437-96f7-b1d8ed65ab1d","year":2020},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.731218Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:56256f8c27078e4031b8bfa1f0aa4f66a4a57e854100bc1812beed6894432e87","observation_id":"1bcb8349-f2d1-4a3a-a853-68f3fa746092","resolution":{"observed_at":"2026-08-15T20:29:02.244387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:29:02.219923Z","title":"Lily is a knave or Lily is a knight","venue":null,"work_id":"d4633300-9c44-4e4b-a8f5-b355e0b2c2a8","year":1992},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.735774Z"},"links":{"citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:e5dd7fa1db9a09ac75d084eeffbfdbe5d78647d10094d6f099d71a939999591b","observation_id":"92e56b54-cf11-41e8-9be7-e9594d427974","resolution":{"observed_at":"2026-08-15T20:29:02.226983Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 15 inbound Pith citation observations for arXiv:2505.12929."}