{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:376156360b364339b5f73baad63653dd4d981a27350d1a68214a29b4b83bde3a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:38:47.682695Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:09:39.636062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:46:20.251611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-06T12:09:39.636062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22037","last_updated":"2025-07-29T17:39:48Z","snapshot_observed_at":"2026-08-06T15:54:16.679483Z","submitted_at":"2025-07-29T17:39:48Z","title":"Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:39.636062Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2507.22037"},"observation_digest":"sha256:c354f3948e3142b835d025c4948754e5415f91ec969bc7ace9eccb92c88dc5d3","observation_id":"d005cb89-ec4f-4219-824f-e9cb83aa415a","resolution":{"observed_at":"2026-08-06T12:09:39.636062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:47bf382b09d99d5c0a854bd6ce713ef40518d9aceae61cdee25892c2fd388dad","observation_id":"83c4f67c-abf3-4632-be6f-9ddc3cb4bbdb","resolution":{"observed_at":"2026-05-11T03:55:56.726774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:799d6b1b765ed1e37ffcd3e59d59519271e4d1e790b5de010f7422566e848684","observation_id":"32eafdbe-ed52-49a4-b269-446d843604d6","resolution":{"observed_at":"2026-05-22T05:51:08.263012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2606.02132","last_updated":"2026-06-02T07:53:40Z","snapshot_observed_at":"2026-08-03T12:22:05.499867Z","submitted_at":"2026-06-01T11:58:55Z","title":"Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T14:59:57.983338Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2606.02132"},"observation_digest":"sha256:6c5aa2e9f5b023cdd9da0705db643683ba1dcc3f5e3302e553119e5f21a8b5ab","observation_id":"6967ca88-cf8c-4aac-a953-bb8e16f81ff5","resolution":{"observed_at":"2026-07-01T22:46:20.253672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-14T15:45:54.532529Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T15:45:54.532529Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:bdec82f037a963d879cb6e1227f7b52005c1b41515a52bdef359de4cc4589907","observation_id":"2163f506-be2c-4659-b578-8de3e92f0899","resolution":{"observed_at":"2026-07-14T15:45:54.532529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-02T08:06:10.779080Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T08:06:10.779080Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:082f7dab03e7aa2c43b3d48d2f32f81c1f3502ae4ccbc59c7f8a43054dfcaea8","observation_id":"af84df61-620c-4d7d-b0a9-b19de84984bb","resolution":{"observed_at":"2026-08-02T08:06:10.779080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-04T04:30:27.449308Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.449308Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:becfa077003eaaf8881e9e1c767dc7df262754a9fcecfd0b2a0b57f11da6681e","observation_id":"ef30e1dc-c058-4e94-95c1-46f0948119e0","resolution":{"observed_at":"2026-08-04T04:30:27.449308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18086/citation-record","integrity":"/paper/2505.18086/integrity","json":"/paper/2505.18086/citation-record.json","paper":"/paper/2505.18086"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T14:38:42.693276Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.693276Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:e4c920096dbff2b5bf0483d62024f439604926a9efc3c6d617c37e71017df315","observation_id":"c9a7d3d8-c24b-4338-a122-6e5ccd4fa911","resolution":{"observed_at":"2026-08-07T14:38:42.693276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:38:42.839047Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.839047Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:bb23ebcf3af2a8ce2f7b96457c867f03c14f9a165b77dda98c5c12aeb59f1f8b","observation_id":"cbe93923-50d0-41cd-9438-741854849ba4","resolution":{"observed_at":"2026-08-07T14:38:42.839047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:38:42.993274Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.993274Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:bc9e606e2d40c52114678e14c2a5eed2d79de7449b7e5b20bb79fee3e666f8ba","observation_id":"3ca8bd60-b550-43a9-b38e-1fa1042351e7","resolution":{"observed_at":"2026-08-07T14:38:42.993274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T14:38:43.173424Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.173424Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:be59c277277b36ff9b6d7454f6e1d0c2d474328824dccb179ce1c324ac1544d9","observation_id":"ecb8034f-13b8-4298-b5b8-19ee820e5f47","resolution":{"observed_at":"2026-08-07T14:38:43.173424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:38:43.302144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.302144Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:4ca531502dc23f10994ae0ad5a3c4715eea56e6702b96636ee7d8063fdba5690","observation_id":"ad775c01-2cc7-44cc-8f75-7f57e29df208","resolution":{"observed_at":"2026-08-07T14:38:43.302144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:38:43.477652Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.477652Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:2ec7f8b3132dd6fecf6f85a04c3f9e56eade9c14151738304d6fcb51fc50033e","observation_id":"513424c0-8561-4ecf-946a-cf6e63e53b55","resolution":{"observed_at":"2026-08-07T14:38:43.477652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:43.607566Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.607566Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:4bde24912d0d98d55b614c7ff3c59d117dffbf47df83942b2fbad049a4e358e0","observation_id":"a1f10c50-543c-4187-9aba-4dc66166503e","resolution":{"observed_at":"2026-08-07T14:38:43.607566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:38:43.731606Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.731606Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:69c2134825a07137b284b9e85e596a7281d11f8b22307477fe19058ecb3c72cc","observation_id":"5d224063-e1c8-4345-b429-4bca1e0e5344","resolution":{"observed_at":"2026-08-07T14:38:43.731606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:49.523937Z","title":"Group robust preference optimization in reward-free RLHF","venue":null,"work_id":"6636f842-eef1-421b-9065-b80b31de5efb","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.873464Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:5b3f363c9e9297eb036e5b2c899fdeff2cc97289aa42ae4deb5766f0ab416a5e","observation_id":"945cf57e-8403-4d7f-b180-3496e2dbec1a","resolution":{"observed_at":"2026-08-07T14:38:49.661260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T14:38:44.107498Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.107498Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:35f516a411272b751a56e96b916cf94c6d6778a6edf40db07e9c7d3d83929e9e","observation_id":"2de9ee18-9ab1-4ab1-a720-4f5ab0da98dd","resolution":{"observed_at":"2026-08-07T14:38:44.107498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T14:38:44.256624Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.256624Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:f86799f21012fbad0dcc31cee0cd8c9617485f430a5de3961354270d019ec4fc","observation_id":"09bed22b-4186-4cc2-9e0c-4b544f4540bf","resolution":{"observed_at":"2026-08-07T14:38:44.256624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T14:38:44.377434Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.377434Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:6d2d0d59c645fb39033c15099214e376bd0aff89562bcaaca683edebe2455e8f","observation_id":"a05546bc-dc99-4b26-8b01-9c0784e78b85","resolution":{"observed_at":"2026-08-07T14:38:44.377434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-07-06T20:35:16.369243Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-07T14:38:44.636364Z","title":"The danger of overthinking: Examining the reasoning-action dilemma in agentic tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.636364Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:1d1805ac2a29e6a7276737e492169dc5919e0f42a4bb1e4f9779e19c74f8c6bd","observation_id":"b91f5d9f-a288-40d2-8523-5518f8dd2466","resolution":{"observed_at":"2026-08-07T14:38:44.636364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-07T06:50:02.841285Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-07T14:38:44.762699Z","title":"When more is less: Understanding chain-of-thought length in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.762699Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:801a35e87fdcec8ba21a36b4098c884d546732aaec8926479394209e0ca4e27e","observation_id":"1c8b41cd-4bc4-4d55-a372-8f305df9f6cb","resolution":{"observed_at":"2026-08-07T14:38:44.762699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:44.901523Z","title":"Dynamic early exit in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.901523Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:59da119867b88e6b959644e68952aee46054a4350d5798b0616c51d9c0abea5e","observation_id":"88487cad-08c9-4ba8-96d8-177b0f0632c0","resolution":{"observed_at":"2026-08-07T14:38:44.901523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:38:45.030627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.030627Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:df287912df03e2d1931e1170c42ae6345df82a4cdf03f3ffd589a677652312ad","observation_id":"e6ebe74d-386b-4f74-9ac0-e03020456fba","resolution":{"observed_at":"2026-08-07T14:38:45.030627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07686","last_updated":"2025-05-17T04:01:57Z","snapshot_observed_at":"2026-08-07T15:47:49.358830Z","submitted_at":"2025-05-12T15:50:44Z","title":"S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07686","snapshot_observed_at":"2026-08-07T14:38:45.299309Z","title":"S-grpo: Early exit via reinforcement learning in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.299309Z"},"links":{"cited_paper":"/paper/2505.07686","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:5c0273a04adcfbeb332a3896a91bc5781c72794d09a7035335c1925ccb3e606d","observation_id":"aaaf58df-ce8c-448f-a445-8adae971953e","resolution":{"observed_at":"2026-08-07T14:38:45.299309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:38:45.504178Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.504178Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:75725676e81879af4fae04718d1e15632c7ac9efb0318d8026a27f57cd9248fd","observation_id":"2ab6bda3-e684-4120-8286-37f5ceb9ed7b","resolution":{"observed_at":"2026-08-07T14:38:45.504178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T14:38:45.622242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.622242Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:ba719b56e1d89b2d95355a115436a64a328b40ed3e4f546dbd74a69937cb78a9","observation_id":"43b2069d-6689-4980-978e-fa6673d4508a","resolution":{"observed_at":"2026-08-07T14:38:45.622242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:48.795774Z","title":"Aime problems and solutions","venue":null,"work_id":"21fe34a9-096d-40d4-b313-cb8b0329b83e","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.747265Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:9600a8ccbf82301aa601741c1d81eb22c769924d7c0fc35789106c5b5658454f","observation_id":"f63de3ea-d04c-4cd4-ac5d-e3a980e3cb62","resolution":{"observed_at":"2026-08-07T14:38:49.078178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:45.879870Z","title":"Amc 2023, 2024","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.879870Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:e80ac312c522ae22a5daf0273dcb4127d652eecd7284dbece165a9e08e3b4327","observation_id":"f898c5e0-3baa-4776-a942-9b7e0c2f03a1","resolution":{"observed_at":"2026-08-07T14:38:45.879870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:46.047459Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.047459Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:fc94be79f216440d995cf516e45833c23359b46c1c41c441d5cc63a73c6a5d0f","observation_id":"af2ae48e-fb79-4463-9aec-7e25a8fbac07","resolution":{"observed_at":"2026-08-07T14:38:46.047459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:48.399033Z","title":"Learning to reason with llms","venue":null,"work_id":"a775e4a5-d0b0-469a-a201-408c57cc2c11","year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.312282Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:cbfcdd72ffad56b06874deae5693bcdb3710dad2a73655ce1de7eaa37de8b6fd","observation_id":"37b165fe-3c43-458e-999e-5afc1c52a00f","resolution":{"observed_at":"2026-08-07T14:38:48.564499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T14:38:46.432494Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.432494Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:9a02348128507816732856d70ea8b18c0e4a4b2d167ce844703cd79d4e3c7c9e","observation_id":"71d0c005-ec14-442e-885a-eded273fb183","resolution":{"observed_at":"2026-08-07T14:38:46.432494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-07-06T19:36:27.984192Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T14:38:46.529177Z","title":"On designing effective rl reward at training time for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.529177Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:d1884951131dba93ad25ff4f3fadfa769381ef1b3c57bb689081f2d8f0588c9f","observation_id":"0da1767a-63d3-4bbe-acac-d4186ae8de5c","resolution":{"observed_at":"2026-08-07T14:38:46.529177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T14:38:46.709657Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.709657Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:b461bc935a150c5a72394b0b8a511fba438e94a90581a902eb127637d058373a","observation_id":"143a71ca-8286-4c91-9cea-81e9229fdd6f","resolution":{"observed_at":"2026-08-07T14:38:46.709657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:38:46.831392Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.831392Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:0211c6f1c46ac3c70d452e7ad8fd80e4ef374db660c19e4ad1f1e3dcd351d867","observation_id":"ff791d8f-0479-4963-a508-1360be495822","resolution":{"observed_at":"2026-08-07T14:38:46.831392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-07T17:06:45.905806Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T14:38:46.973811Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.973811Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:5f7633cbeebc3ef10c9de1814f63612abc65f5c67204ed457a6decdc9fb6d412","observation_id":"8f6d38db-9d42-4123-b1f9-235377011f6b","resolution":{"observed_at":"2026-08-07T14:38:46.973811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:47.135822Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.135822Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:0fb98602aaeca2564f2419a0462e3044c8ca1a453ad4c1ef1575525aadbbd24d","observation_id":"13461ca3-1766-4edb-a8b9-c4016710b253","resolution":{"observed_at":"2026-08-07T14:38:47.135822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:47.237133Z","title":"Training language models to reason efficiently","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.237133Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:18f7d774c01fe8f363f652f0d5ef20cde26f272aa3cc14e3cf0e167a54d93081","observation_id":"ca3c6a0b-18fe-4b0e-a2cf-36a820f24d15","resolution":{"observed_at":"2026-08-07T14:38:47.237133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-07T14:38:47.403222Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.403222Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:0cb43419c28ec53b235ac6d601a65e5430d6091d0a60d4292b34f4a97a925c19","observation_id":"616be23c-0f78-40a6-8881-8a637368c55a","resolution":{"observed_at":"2026-08-07T14:38:47.403222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:38:47.561040Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.561040Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:f5dc8794b2a363108afc857de77a63746f5ef460c04f9bcb15f1dbaae4ac3529","observation_id":"445767f5-5ddd-4cc7-9d3a-4bb0c17866a8","resolution":{"observed_at":"2026-08-07T14:38:47.561040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T14:38:47.682695Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.682695Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:42782fd60f8aa65b83985eb87c3ab369dc8d752fd5e5ed4d7a64ebeb30fd5cff","observation_id":"456d2ebb-02e8-4cfb-b296-56ce53d3e3d9","resolution":{"observed_at":"2026-08-07T14:38:47.682695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:38:46.155558Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.155558Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:79e0b9654daf4a94f1745ec47a55fb75e80105a783d80319dff8f7fe526844cf","observation_id":"ac5f1b6b-6f50-4cac-89de-0faf5272030e","resolution":{"observed_at":"2026-08-07T14:38:46.155558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:49.326385Z","title":null,"venue":null,"work_id":"f2451916-f96f-4216-9652-502a36f9d139","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.956922Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:d8977a58cd7744f706b48247b3cab6d305dd51cb99995a4797842fd16067e0c2","observation_id":"df1278cb-0481-40ff-81f4-9e0813881153","resolution":{"observed_at":"2026-08-07T14:38:49.453422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T14:33:24.324919Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 7 inbound Pith citation observations for arXiv:2505.18086."}