{"as_of":"2026-08-12T15:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccc57ad737cb1984bb5e7a0ce049edb91b95699ae0afb10396ea260a69755665","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T06:57:03.100519Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:20:30.920209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:20:31.411452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.16995","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.16995","snapshot_observed_at":"2026-08-12T00:20:31.411452Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","venue":"cs.CL","work_id":"2b27bc3e-a652-42ec-8d33-96b556e54fb9","year":2026},"citing_paper":{"arxiv_id":"2608.08255","last_updated":"2026-08-08T17:32:34Z","snapshot_observed_at":"2026-08-12T15:16:54.960277Z","submitted_at":"2026-08-08T17:32:34Z","title":"Learning from Environmental Feedback: Credit Assignment across Multiple Timescales for Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:20:30.920209Z"},"links":{"cited_paper":"/paper/2604.16995","citing_paper":"/paper/2608.08255"},"observation_digest":"sha256:6e461391239d9e1788abba89f8e11f0e24c1c30eabfefc35aaa3d970991f5218","observation_id":"f1bdb373-645c-4c2d-b478-0a7e8fc05de0","resolution":{"observed_at":"2026-08-12T00:20:31.418525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.16995/citation-record","integrity":"/paper/2604.16995/integrity","json":"/paper/2604.16995/citation-record.json","paper":"/paper/2604.16995"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.938856Z","title":"online\" 'onlinestring :=","venue":null,"work_id":"38c07273-5071-4bbb-b2af-067af11becc7","year":null},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:b100f80cfb183cebdb0d2b71d2aa6bcb5712bf3cd6d28ab7e52dadaa45c5464b","observation_id":"3ec81a05-1c77-4b03-9511-0a94af6757e6","resolution":{"observed_at":"2026-05-21T14:55:15.525804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:56:11.963345Z","title":"write newline","venue":null,"work_id":"b6ace3ad-bd44-4a95-86ee-c7b73bd4cda2","year":null},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:606d9eec771ad88cf27264d6cdbb7bba06cdbb5645eac172804797248f9611ef","observation_id":"77497899-a400-4eed-af00-ff405fc54f83","resolution":{"observed_at":"2026-05-21T14:55:15.530524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d5315f2f-5e79-4ed6-8e6e-0cf4ac489ffd","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:cf45c071bb61f36639db1c274b3f061367ba88bc3324c42f5a54509aa6908594","observation_id":"0975fb6a-f936-43a8-a3fd-b0305a165f23","resolution":{"observed_at":"2026-05-21T14:55:15.532366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f4742e5-5e83-498c-832b-399ecc2bb9e5","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:e3624297b956d1f0dffe8b2706525bf4348b8af72631bbb6bc81e3b9c6b7b1dc","observation_id":"d36710cd-2d66-45b6-858c-68a541f2b5d7","resolution":{"observed_at":"2026-05-21T14:55:15.536500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:7cdd5ec50a59232c788489f11afcdf45ec5076103c278dc3cd4d45eb0a95457e","observation_id":"ffb3f9a7-bae6-4387-a39d-f03a74925aa4","resolution":{"observed_at":"2026-05-10T07:01:49.470700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:09db2ceeabfce562c6137ffd3393185f3e1ce827d2044b14f007ff4b61f06133","observation_id":"f1771139-640d-4c79-b493-af854a62b4c7","resolution":{"observed_at":"2026-05-12T12:31:34.026635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"351a13f7-89ed-4fd6-a547-7bd5566345f3","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:3b47bf94b710d914bafcf37c5aee178c704d5d141a808e7a1ef1f712518009dc","observation_id":"33ffb170-3324-48bc-a311-c6d1a2b3b52a","resolution":{"observed_at":"2026-05-21T14:55:15.561608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-12T09:05:47.308667Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.03817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":"3083983b-0b59-42d1-ab02-3d8cf8ecb075","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:629e1de8def2e90370aed3b5e42c83a2b4bdb3779a76c6f87b479703f9c3b5c6","observation_id":"8a1f5723-2969-4d0b-af72-950b586f1e0c","resolution":{"observed_at":"2026-05-10T07:01:49.475714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"62c2ba38-4858-44a7-8506-798152de4444","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:fd4c8fb519e4c6d648beabaa32bb7c704bb7b9cb6d090c3184872308799f4cdc","observation_id":"566cc16d-5202-4ecb-8586-b45f49c7df01","resolution":{"observed_at":"2026-05-21T14:55:15.563452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02864","last_updated":"2025-12-22T12:49:01Z","snapshot_observed_at":"2026-08-07T08:27:55.662438Z","submitted_at":"2025-11-03T16:04:07Z","title":"Mathematical exploration and discovery at scale","version":3},"cited_work":{"arxiv_id":"2511.02864","doi":"10.48550/arxiv.2511.02864","metadata_source":"pith","pith_arxiv_id":"2511.02864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mathematical exploration and discovery at scale","venue":"cs.NE","work_id":"b3882729-74ba-4d80-9240-bfe03c45c33b","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2511.02864","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:08914670babb684901cc46c273bb434761bbb4b996454133e4e028f50aace42b","observation_id":"d0c42ba5-f993-4ce8-a57f-e8ff472c2653","resolution":{"observed_at":"2026-05-10T07:01:49.446323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:15cc2bbd71eac87e2a89e7d30bccad7f69e8724cdf04c0d0440de831ae54c10f","observation_id":"15d98f44-dae8-4feb-9b38-332a03a75865","resolution":{"observed_at":"2026-05-10T12:43:44.770948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c04fce21-1c07-4b8e-820f-984dca093fa2","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:c0a34bbc9370d89b6de5427e424c658979ee8e3ff89063aa5141defef5f876ad","observation_id":"8241e895-015b-4158-968c-e2b2c8c22082","resolution":{"observed_at":"2026-05-21T14:55:15.528293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e5355503-a0c2-492d-9548-7ba81b482cde","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:1e61cb5d47222116c1028ba27c45eb4f7f21fdfb4167de1eae5fd817fd5cb8cb","observation_id":"7e810b50-e00e-4419-a74e-2208df121415","resolution":{"observed_at":"2026-05-21T14:55:15.534403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08649","last_updated":"2025-07-11T14:53:14Z","snapshot_observed_at":"2026-08-09T23:19:58.865305Z","submitted_at":"2025-07-11T14:53:14Z","title":"Leanabell-Prover-V2: Verifier-integrated Reasoning for Formal Theorem Proving via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2507.08649","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.08649","snapshot_observed_at":"2026-07-10T18:17:33.679581Z","title":"arXiv preprint arXiv:2507.08649 , year=","venue":"cs.AI","work_id":"17d5f8ea-985a-4a34-898a-911d4d6fe5ee","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2507.08649","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:eb268b672216180e397dc277ec210a44f173fabd11e18b2190974573c2b00dcc","observation_id":"828fdfcf-0e14-4045-a842-0079075aadc5","resolution":{"observed_at":"2026-05-10T07:01:49.441454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":"2510.18471","doi":"10.48550/arxiv.2510.18471","metadata_source":"pith","pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","venue":"cs.SE","work_id":"f48fa717-2e45-4d03-a1ee-0a89c02f3c3a","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:806a7b8808cabe981b18686b642da2673124580d0d8cf9ac52d8b83b7f584953","observation_id":"b9f4dcbc-5880-46cb-8691-fba541979f9c","resolution":{"observed_at":"2026-05-10T07:01:49.478225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Haotong Zhang, and Ion Stoica","venue":null,"work_id":"26cede13-48e7-49b7-a3c9-8aa59e80ad21","year":2023},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:3dabbb940c7fd7b5d75ce51042c91418e9f83b4b4155abfcf61e49136e74351f","observation_id":"e7b109b5-68e7-43ee-b788-bbfdb906e21b","resolution":{"observed_at":"2026-05-21T14:55:15.569301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-12T07:09:19.930689Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":"2502.14382","doi":"10.48550/arxiv.2502.14382","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"S*: Test time scaling for code generation","venue":"ArXiv.org","work_id":"b671edac-c05b-46dd-84a0-bad724e3222b","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:f3a01855675bc736af4e381111160b93f96b95fc8c9a13dd09eb143288a9742a","observation_id":"084d5fc7-7dfe-47e3-8c35-eb9ec42f3423","resolution":{"observed_at":"2026-05-10T07:01:49.460726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e7304dd-a2c9-4666-9c33-13762df8335e","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:5200fe7343d952f13cd5dc8487a63af8e2ef3e8c7f1e3c8a42e82373e1542797","observation_id":"f7513236-bdc9-4733-933c-919b15a33438","resolution":{"observed_at":"2026-05-21T14:55:15.542991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:0da04f004a02f946ef174ade667f2ca9b401f7709aaa3090096fb1a393d2a2bc","observation_id":"3bd4f56d-4dc1-463d-9567-a72a04affa89","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liu, and Jialu Liu","venue":null,"work_id":"e426d7f6-3171-4fa7-994f-3d29749b8a84","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:7a0c907496511bae52f1c69cf039265fac1e60a390c8ea014ee52f6465c1e4f9","observation_id":"50f8c7e8-bcf7-4ffe-8582-1721a190e9a4","resolution":{"observed_at":"2026-05-21T14:55:15.555714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06594","last_updated":"2025-06-01T10:36:07Z","snapshot_observed_at":"2026-08-12T08:39:21.554349Z","submitted_at":"2025-03-09T12:54:05Z","title":"Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation","version":2},"cited_work":{"arxiv_id":"2503.06594","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.06594","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://arxiv.org/abs/2503.06594","venue":null,"work_id":"fb9cdaee-fab4-4159-b4eb-3fdb85a79e08","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2503.06594","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:ce62fb5bf3931a6a2d3d728176dcc1c328597b4641937b8f42ce3c90dfd7520a","observation_id":"267c52bd-43f3-40d2-b00e-ee636677471a","resolution":{"observed_at":"2026-05-10T07:01:49.455674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"774bf3c1-142a-4ff0-90a6-2904604bba25","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:8970924a8a848e5ebdfff7496f02faedfb6f36423d5c9b952a933519ec7f3100","observation_id":"7b07e0c8-3e02-4f7a-82c4-bd952e3ac418","resolution":{"observed_at":"2026-05-21T14:55:15.574693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf0659d0-9a9e-4ae9-a606-39a29eca6c6a","year":2022},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:2a1dd8ecd7bb04ce59d2ec46e355a7be20955d275937a20383178484876a2a2f","observation_id":"f35a81de-7c7a-4c00-8068-85bb814299a7","resolution":{"observed_at":"2026-05-21T14:55:15.576846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:00411050fac3c8be4aa8173e48b2f2e6fc508dcc1f2b426dbec7e4f52216248d","observation_id":"4ec9e707-fc55-4dcd-a479-7aa308443d9f","resolution":{"observed_at":"2026-05-11T04:00:34.729655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10490","last_updated":"2025-06-29T05:43:22Z","snapshot_observed_at":"2026-08-01T14:47:14.023229Z","submitted_at":"2024-07-15T07:30:28Z","title":"Learning Dynamics of LLM Finetuning","version":4},"cited_work":{"arxiv_id":"2407.10490","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.10490","snapshot_observed_at":"2026-07-01T22:06:16.575794Z","title":"Learning dynamics of llm finetuning","venue":null,"work_id":"24759bc0-951c-4496-b75e-b6165ae8f967","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2407.10490","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:a3421ed9d2b14c86c6954006f1d265e871196f602058546bd10e807065200396","observation_id":"fc835128-3a56-42a2-86bb-8a2e16499593","resolution":{"observed_at":"2026-05-10T07:01:49.448711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:41996e911ca4b58aed9cc0c096545f9482adf926d57bd1bf7f117fb8674bef6f","observation_id":"57b873b7-101f-45e4-9ad2-c2024e6d23f1","resolution":{"observed_at":"2026-05-10T07:01:49.450983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:83a9479f98e47431a1f62ba159fbdddcb05159620055edf0dc680a04c03a85b7","observation_id":"aa85f6be-7ebd-4018-b803-58e7402a18b6","resolution":{"observed_at":"2026-05-10T07:01:49.453306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":"2009.01325","doi":"10.18653/v1/2022.naacl-main.6","metadata_source":"pith","pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to summarize from human feedback","venue":"cs.CL","work_id":"1fae7759-93bb-4cba-a0d5-ebff515b9d39","year":2020},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:08ac6172a2d539f10e6a8afdbbe2d0938e22f33fbc243acc851d5ec42c016905","observation_id":"e97a95ed-936f-4b32-b3c7-02c611786cd1","resolution":{"observed_at":"2026-05-18T01:46:18.838660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12017","last_updated":"2024-03-18T17:52:57Z","snapshot_observed_at":"2026-07-06T17:46:29.153377Z","submitted_at":"2024-03-18T17:52:57Z","title":"Supervised Fine-Tuning as Inverse Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.12017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.12017","snapshot_observed_at":"2026-07-02T20:57:23.060366Z","title":"arXiv preprint arXiv:2403.12017 , year=","venue":null,"work_id":"de3e9f02-ec63-49aa-8e04-0040a6ef63a2","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2403.12017","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:7a42336392191c8e828e74045fbb9aede558f4b3cf4d3ac63f3246c3a58a9704","observation_id":"4c8f68e1-facc-4105-b947-2b61dfe24128","resolution":{"observed_at":"2026-05-10T07:01:49.443854Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9012680a-562a-423a-8637-9f916c561b0e","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:2226118c57214d01302e786a7aa9551de07a940b592555dec4c377627cdd2a90","observation_id":"338164bb-6721-4a23-909a-40b141775f2c","resolution":{"observed_at":"2026-05-21T14:55:15.567485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15624","last_updated":"2025-01-25T11:10:39Z","snapshot_observed_at":"2026-08-02T18:32:46.919947Z","submitted_at":"2024-05-24T15:13:53Z","title":"Inverse-RLignment: Large Language Model Alignment from Demonstrations through Inverse Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2405.15624","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.15624","snapshot_observed_at":"2026-07-02T12:06:55.664941Z","title":"and van der Schaar, M","venue":null,"work_id":"3c5a60cf-1bc1-4cb2-b4c2-8efc08929404","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2405.15624","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:99bc2d3c383b123d7eae0d45e6718f51bfb728acf34158b9e31e286d5a137b4e","observation_id":"8296079b-4ebf-40a0-8935-3c49212b7bd7","resolution":{"observed_at":"2026-05-10T07:01:49.500518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8364ba55-5b6b-479c-968d-b7e801c6694c","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:0996ef5ed69f7e6db0bd1af8789f9a3e61df77d648f838efc36fa7c208a1022a","observation_id":"aca2a5bf-65e9-4038-9db7-09d3e536cd12","resolution":{"observed_at":"2026-05-21T14:55:15.540840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7ca4bfcd-f68b-4081-a2b5-dc5e8eee25a2","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:5264a5c290f61f874b33be1d553846ba17a66955841ba3d5bb7715b0e2c0d7f0","observation_id":"c1e9508d-5c33-4d73-9f4e-e8843132a5be","resolution":{"observed_at":"2026-05-21T14:55:15.559671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.14175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:56:13.583999Z","title":"Tianlu Wang, Ilia Kulikov, Olga Golovneva, Ping Yu, Weizhe Yuan, Jane Dwivedi-Yu, Richard Yuanzhe Pang, Maryam Fazel-Zarandi, Jason Weston, and Xian Li","venue":null,"work_id":"35428790-e2c6-471f-ba84-8bfb04edcb0a","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:275214dbf48b2750fbeae2ee132bd88bad9f3e4b187d8dd4c3d1188036628ae1","observation_id":"83ffb24a-c66c-4536-969b-f4492e885316","resolution":{"observed_at":"2026-05-10T07:01:49.483237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4092762c-429b-4e76-8962-20a7e90fd721","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:045b3f07bbae23e3ae5701a313cf1f736dba95b1c29ad648b49163a9668dad27","observation_id":"2abed577-c436-4d51-afd6-15a186e90882","resolution":{"observed_at":"2026-05-21T14:55:15.571089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msrl: Scaling generative multimodal reward modeling via multi-stage reinforcement learning","venue":null,"work_id":"8912e2ac-3457-46dc-b3f4-b4eebeddd6cf","year":2026},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:ab3dc37de2d69b5c3879cb30523f59d2c5b44037f8dde3516fd3753410557e73","observation_id":"4d8f7b00-749d-4690-87b3-5fd3a02809e1","resolution":{"observed_at":"2026-05-10T07:01:49.485580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f46c333-b61b-4aa7-9a5a-7dce8e0e0bbe","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:cc4646190ce00afd95932cae2405c493c4188b2c19f08c870eba15fd3014d82a","observation_id":"c8af3911-7863-44ad-87a0-472bec56d515","resolution":{"observed_at":"2026-05-21T14:55:15.545253Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a6a5316-c1ce-4e80-8210-f8063cb54897","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:24dd805070ffb569012fda7bbef560f2cfe0c0cc135fe0a489adfee1f3a7c281","observation_id":"987896e9-8a23-4fba-9a5d-b302312a374a","resolution":{"observed_at":"2026-05-21T14:55:15.551479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8038f04-b9e7-4346-9e7b-cde7fd1d026b","year":2023},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:773b9736b0628695dc291a1e78bc2571fbeb9ed25ea3731ad3e388b12a71babb","observation_id":"a05add80-9231-4bbe-8eed-f59ba42e59cc","resolution":{"observed_at":"2026-05-21T14:55:15.538844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00977","last_updated":"2026-05-14T04:25:16Z","snapshot_observed_at":"2026-08-05T08:37:33.456673Z","submitted_at":"2025-10-01T14:52:11Z","title":"It Takes Two: Your GRPO Is Secretly DPO","version":3},"cited_work":{"arxiv_id":"2510.00977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.00977","snapshot_observed_at":"2026-07-03T17:58:47.896297Z","title":"It Takes Two: Your GRPO Is Secretly DPO","venue":"cs.LG","work_id":"15d941cc-60bc-41eb-b65d-68ee8f196b92","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2510.00977","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:0121acdd398d77d66a10f3f7a5656663d4f2931b2d9ed741e210f9b6a7a7176a","observation_id":"964beff2-08cf-4683-916e-3735a1a8ba7c","resolution":{"observed_at":"2026-05-15T01:43:11.007781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.14768","doi":"10.48550/arxiv.2502.14768","metadata_source":"pith","pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","venue":"cs.CL","work_id":"b1f42628-30b7-4593-80ff-813523035c23","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:9447d6bfbed19afa05349dbb4a107a637074378b5f38023fcf651b706a8b30ed","observation_id":"4a79a9c6-e7c4-4681-a0d7-92eb0ac8bdeb","resolution":{"observed_at":"2026-05-16T20:57:51.136140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:913849ff5fd1502efacd989cb6bdb1caee1b0529a67dab772f40c983ac6519c5","observation_id":"64027dc7-37f5-4b37-9f66-ed52fc03ee4e","resolution":{"observed_at":"2026-05-15T23:17:03.075876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:8c7f25baebc3d3478c5f065c74a8b7d0d09b7ece0e33c872ac99598f961c03e7","observation_id":"224994c8-493a-40c4-a9a2-cfe69a5746ac","resolution":{"observed_at":"2026-05-11T10:15:55.036587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:889a48a0845387cda2c90965a86d72a40ea67126b1cd8b7f28d2bdfc7baa5e89","observation_id":"c8363d4e-eee7-401f-bc58-e1865fd4cee3","resolution":{"observed_at":"2026-05-10T07:01:49.495394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:edaa61c0c573ac05e3db86e1abad31e55e12e66b85c3820e69b1d5a2ca231ac4","observation_id":"bd8b9091-2d6c-4354-941c-51ef0de7d0bc","resolution":{"observed_at":"2026-05-10T07:01:49.487917Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce9c2484-d992-4000-9d47-ec3d454221db","year":2021},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:134ce29a19ab39c3391265b92029f4cb809543a043ec75fad6e6c31d6ae15e16","observation_id":"24495761-22ec-45de-8521-e71f187b863a","resolution":{"observed_at":"2026-05-21T14:55:15.565324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52a0bd95-60d9-4542-8116-dc6501bcc6c5","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:f6d8db763365ef33ee0120521c5240ee84aebed8301e04e0037768764cc90535","observation_id":"dde4905d-5d91-48c2-8471-467b3586a07f","resolution":{"observed_at":"2026-05-21T14:55:15.572846Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"624c99a7-e7f0-4a27-8826-fbeaea83fe06","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:5d25cd2938dba956b8924ccb44134521d206b32dc932282a078bc9d9a901f917","observation_id":"e13566b5-4de1-4557-8884-d490fc1d1882","resolution":{"observed_at":"2026-05-21T14:55:15.557760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:2173a5052eb12b86db7954f411fc4ad64ec9c70688b424686fa9367075aaa67e","observation_id":"844d362b-ca1a-40d3-85d7-cffa359a81c5","resolution":{"observed_at":"2026-05-10T19:22:54.227899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"275c8a80-935f-4feb-938f-256788472173","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:b41872e69a682d9c5d4917fd4de700db52205281ea4e765478e21ea0c26c4c2d","observation_id":"d08ba6a7-c231-4cca-ad25-bb2cc357cf19","resolution":{"observed_at":"2026-05-21T14:55:15.553670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":26,"verified_fuzzy":4},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2604.16995."}