{"as_of":"2026-08-20T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e1540adc83a6f2f145e1a663ccff377e236c25c5de5e0188b801d3e8587ef9b5","coverage":[{"denominator":263,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:33.995648Z","state":"measured"},{"denominator":111,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":111,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:14:04.060992Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2510.04978","last_updated":"2026-04-30T05:27:37Z","snapshot_observed_at":"2026-08-15T22:28:47.373430Z","submitted_at":"2025-10-06T16:16:03Z","title":"Aligning Perception, Reasoning, Modeling and Interaction: A Survey on Physical AI","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T09:56:36.716680Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2510.04978"},"observation_digest":"sha256:dd01cb3e6fe014b273c0d4a05dbad4b388966c3a0e6f5ed1281b75985a0163d1","observation_id":"39461bab-9f44-4b56-9a4f-484a762757cb","resolution":{"observed_at":"2026-05-18T10:01:13.986090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-02T20:14:04.060992Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the llm lifecycle.arXiv preprint arXiv:2509.16679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.23802","last_updated":"2026-07-08T14:47:50Z","snapshot_observed_at":"2026-08-19T20:50:06.927601Z","submitted_at":"2026-02-27T08:42:52Z","title":"EMO-R3: Reflective Reinforcement Learning for Emotional Reasoning in Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:04.060992Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2602.23802"},"observation_digest":"sha256:89e47a303a157a590f388e559308c8941478807691e4c17e12e0c41e03c7a624","observation_id":"0e13ce9d-1ac6-4f46-ba5e-ece760393791","resolution":{"observed_at":"2026-08-02T20:14:04.060992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-08-12T16:30:38.536151Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:d38d91a9e39d84fcb1af0fc3d5798f9a40df100b126f32c37a68bf355f06991e","observation_id":"8f5b7743-6b98-41d1-b985-12754fba7734","resolution":{"observed_at":"2026-05-11T05:20:59.998819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2605.02801","last_updated":"2026-05-04T16:42:18Z","snapshot_observed_at":"2026-08-15T17:04:09.575792Z","submitted_at":"2026-05-04T16:42:18Z","title":"Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T18:44:27.685266Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2605.02801"},"observation_digest":"sha256:5cae6e1c8781714c84411014017d5e5ab0cada599562c67cac0b9912587d2783","observation_id":"abc577b2-6a79-417c-8b8f-d5ddc2dc6734","resolution":{"observed_at":"2026-05-09T06:15:37.954804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2605.22263","last_updated":"2026-05-21T10:07:46Z","snapshot_observed_at":"2026-08-02T10:25:42.509450Z","submitted_at":"2026-05-21T10:07:46Z","title":"Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T08:06:30.862911Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2605.22263"},"observation_digest":"sha256:a73c1d4f6c2ebe6f23f08a5979cdf9b1244b54bbc82a816b595dc4cb34bb28de","observation_id":"4a6c27ff-3c2d-4266-a81b-35f03d40a2b4","resolution":{"observed_at":"2026-05-22T08:11:17.717331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2605.28699","last_updated":"2026-05-27T16:25:21Z","snapshot_observed_at":"2026-08-15T13:17:17.093525Z","submitted_at":"2026-05-27T16:25:21Z","title":"TRACER: Turn-level Regret Matching with Inner Reinforcement Credit for Cooperative Multi-LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T12:20:16.121824Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2605.28699"},"observation_digest":"sha256:88b219e9cd743ba7d2c9dacadf4afec52b51411c422e1f0659ac68fde362e5d7","observation_id":"5ef49bc2-7813-4ba6-8c46-9dddd3f78362","resolution":{"observed_at":"2026-06-29T12:23:23.797662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2606.17735","last_updated":"2026-06-16T09:55:45Z","snapshot_observed_at":"2026-08-06T04:38:28.462018Z","submitted_at":"2026-06-16T09:55:45Z","title":"Shattering the Autoregressive Curse: Dynamic Epistemic Entropy Orchestrated Erasable Reinforcement Learning for LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T00:48:56.892634Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2606.17735"},"observation_digest":"sha256:d6f66852212abb6565eaa67fa006a83d87cffdc6e18fa1844ea3ed788df49f96","observation_id":"bb33b206-c858-4eb3-88ed-e13ab3645cda","resolution":{"observed_at":"2026-07-03T21:08:58.849123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2606.18988","last_updated":"2026-06-17T12:08:20Z","snapshot_observed_at":"2026-08-06T08:59:20.055779Z","submitted_at":"2026-06-17T12:08:20Z","title":"ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T20:58:30.855338Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2606.18988"},"observation_digest":"sha256:297476960afcdfaeaa475ce98ab6d366c79bf575af17d65dde46cfe9eab3c71a","observation_id":"541498bc-8b4c-49a6-8fac-e794c3e3ff6b","resolution":{"observed_at":"2026-07-04T00:49:18.220604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2606.19771","last_updated":"2026-06-18T04:11:56Z","snapshot_observed_at":"2026-08-13T14:44:13.617317Z","submitted_at":"2026-06-18T04:11:56Z","title":"Beyond Entropy: Learning from Token-Level Distributional Deviations for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T17:37:43.856000Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2606.19771"},"observation_digest":"sha256:7cbc51d956eef7a506a47434097cd60630ff22445455bbeb93f97e192f2c1ca2","observation_id":"bda8178b-d2b3-48f7-adc5-2f88c545bbff","resolution":{"observed_at":"2026-07-04T03:49:30.086889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":"2509.16679","doi":"10.48550/arxiv.2509.16679","metadata_source":"pith","pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement learning meets large language models: A survey of advancements and applications across the LLM lifecycle","venue":"cs.CL","work_id":"f4d2b80d-8fa3-41ad-a490-eab600e35f2f","year":2025},"citing_paper":{"arxiv_id":"2607.08572","last_updated":"2026-07-09T15:04:05Z","snapshot_observed_at":"2026-08-15T19:24:09.025004Z","submitted_at":"2026-07-09T15:04:05Z","title":"Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T05:07:40.106099Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2607.08572"},"observation_digest":"sha256:1e598d91395301fe755d3343fd28f6b9f8de225b2e6d7ff49782de452c7b2baa","observation_id":"3a2061e6-be90-4961-b661-0e466d79821e","resolution":{"observed_at":"2026-07-10T05:16:48.097060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16679","snapshot_observed_at":"2026-07-14T15:30:23.485228Z","title":"arXiv , author =:2509.16679v1 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09803","last_updated":"2026-07-09T17:52:16Z","snapshot_observed_at":"2026-08-17T09:05:27.507731Z","submitted_at":"2026-07-09T17:52:16Z","title":"Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-14T15:30:23.485228Z"},"links":{"cited_paper":"/paper/2509.16679","citing_paper":"/paper/2607.09803"},"observation_digest":"sha256:865869c18f1ed04c9a043c60fb47bc33e7f227722dab1bbbcb59987f5b8965c6","observation_id":"725f57e9-41a6-4f37-b26a-26ef05d0775f","resolution":{"observed_at":"2026-07-14T15:30:23.485228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.16679/citation-record","integrity":"/paper/2509.16679/integrity","json":"/paper/2509.16679/citation-record.json","paper":"/paper/2509.16679"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:27.677675Z","title":"NeMo RL: A Scalable and Efficient Post-Training Library","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.677675Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:133aa81ed42fa2fb7599df232cfbee411e995fc578b5c974aa567cfaed16926c","observation_id":"75da94fe-2a7c-4b6d-8726-f40e5b02ced5","resolution":{"observed_at":"2026-08-04T16:07:27.677675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-04T16:07:27.711633Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.711633Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c915beb3a42501576918370804cdd1d613c462c9c9516488059f5dce704f7082","observation_id":"7b0aae59-024d-4ad4-bded-1c6c3f5b4e68","resolution":{"observed_at":"2026-08-04T16:07:27.711633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:27.751920Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.751920Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a8e1ba9f1a616d777c37c151ac3b87b04f114611374f14a8c1fb55e94d6aeaa3","observation_id":"dc88b0d3-dfa3-46bd-8d37-5731a868c0b8","resolution":{"observed_at":"2026-08-04T16:07:27.751920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-04T16:07:27.793366Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.793366Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:b8ad966bfa9166ea359b056c10f8ad283820fcaccab4bfcc074fbb34762da7c7","observation_id":"ae598da4-298a-45ac-841d-6fc736736556","resolution":{"observed_at":"2026-08-04T16:07:27.793366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:27.831930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.831930Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:8d81ccc86a5d97aed567d570351f27236fc97328396c3149eedeb3c0a68947fd","observation_id":"59a51287-89e9-49b0-8d36-c8fa5e843dfa","resolution":{"observed_at":"2026-08-04T16:07:27.831930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T16:07:27.872089Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.872089Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:165761e9b04c45289b3239b2b4d812819c4d56c2868d03e37cf5f5c300ee59bc","observation_id":"4b3e214e-4027-44e3-ad3e-539f0a8410da","resolution":{"observed_at":"2026-08-04T16:07:27.872089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-04T16:07:27.917251Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.917251Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a27cbf3a9f1a7b51fca5ffb609fbce40b94a579e000123883809042e4b04cc59","observation_id":"c3bdfe05-bfcc-4e36-90e5-fe91b5390176","resolution":{"observed_at":"2026-08-04T16:07:27.917251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10814","last_updated":"2025-03-13T19:03:41Z","snapshot_observed_at":"2026-08-18T21:38:46.671400Z","submitted_at":"2025-03-13T19:03:41Z","title":"Thinking Machines: A Survey of LLM based Reasoning Strategies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10814","snapshot_observed_at":"2026-08-04T16:07:27.952573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.952573Z"},"links":{"cited_paper":"/paper/2503.10814","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e2fa3abcf9708557729011a152033250c5c8db59f09e20b8590b33f15c8b96fd","observation_id":"75c084d6-33c5-44d8-81c1-3e1257b7ef9d","resolution":{"observed_at":"2026-08-04T16:07:27.952573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:27.987505Z","title":"Do, Yan Xu, and Pascale Fung","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:27.987505Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5a0ed32c28711de80b80f847769484d5b718f49e1f870ee7460b74b72615eb4b","observation_id":"1f7f2e04-4a7c-4d6a-8a75-32e8e1cf9336","resolution":{"observed_at":"2026-08-04T16:07:27.987505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-04T16:07:28.031833Z","title":"2025.𝜏2-Bench: Evaluating Conversational Agents in a Dual-Control Environment.arXiv preprint arXiv:2506.07982(2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.031833Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a9e655204eceb0af2512dbcc1ba664856af331b108439b66f284ef2eefab075c","observation_id":"cd246f83-02c2-4b8d-b500-eaf06e80367f","resolution":{"observed_at":"2026-08-04T16:07:28.031833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.068731Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.068731Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:7b6af4b13eabafca9c90b386048018a150c66e519d6365956a5f2fcb71f6179a","observation_id":"d82380ff-a5ea-4668-81f8-f646c6492e78","resolution":{"observed_at":"2026-08-04T16:07:28.068731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11223","last_updated":"2025-06-11T13:19:22Z","snapshot_observed_at":"2026-08-17T14:20:07.900972Z","submitted_at":"2025-01-20T02:16:19Z","title":"Reasoning Language Models: A Blueprint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11223","snapshot_observed_at":"2026-08-04T16:07:28.107428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.107428Z"},"links":{"cited_paper":"/paper/2501.11223","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:60db3fbaacc11e69adb592b0c2643e38d13ea13e418a31c3c56483eb5f9d474e","observation_id":"b1916877-41dd-489e-98f8-b63f121d0c27","resolution":{"observed_at":"2026-08-04T16:07:28.107428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.145291Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.145291Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:268bcdf947ee925c769529e4e39759a5e1ec1bc149ff1e333a4d290812a849a7","observation_id":"de9561ea-e3fb-4436-a269-e5d4cf91808e","resolution":{"observed_at":"2026-08-04T16:07:28.145291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-04T16:07:28.187255Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.187255Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:d04594a568509d5e68396217a83598c2ea9b0e0907e5417b11f606db34ce04b4","observation_id":"a8d8175f-0578-4fcc-a3dd-97a8dab4cdfe","resolution":{"observed_at":"2026-08-04T16:07:28.187255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.221722Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.221722Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:cf7b657cece2afffc98e08ad8d1813e7b1f7583175ae30ff6bc627bd83b73af5","observation_id":"04f9b39a-d183-48f0-97f9-8ea6c5e4c965","resolution":{"observed_at":"2026-08-04T16:07:28.221722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.259721Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.259721Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:122c3fdaab1c502d45c6560e9fe3aadab2c2a1e1014fec8dbe9d4641f67de58a","observation_id":"07a5c395-e85b-47e6-8944-e6f28aab8d59","resolution":{"observed_at":"2026-08-04T16:07:28.259721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-04T16:07:28.295561Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.295561Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1df37b3fb32e20e05d399ec56a0828b8849ce40f0be57b949005d1dbe73fa3d1","observation_id":"6f11dde3-5b1c-4a67-a18c-3dace7c545f6","resolution":{"observed_at":"2026-08-04T16:07:28.295561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.332269Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.332269Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:53ab96413eab7de7f7d72a3e05a5a10c2b46445e34de52c9397f33f5295858cc","observation_id":"64a5b613-97f8-40e5-bd7e-3f5e9678c71d","resolution":{"observed_at":"2026-08-04T16:07:28.332269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-16T22:33:00.173650Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-04T16:07:28.361696Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.361696Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:0afa7760e3d350f39f33a9becfcf1c2342f70e5161d6ac365e05305abadf018b","observation_id":"fe009cb9-2b50-4598-83d3-acbabef4f6b3","resolution":{"observed_at":"2026-08-04T16:07:28.361696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.398802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.398802Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:15cea73119b9739bfdd084088fb1cc3aed04476d37464cc5259d4747c3c3be68","observation_id":"d8b56924-bdac-44a4-8057-504c782c8133","resolution":{"observed_at":"2026-08-04T16:07:28.398802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10185","last_updated":"2026-04-27T07:59:24Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:14:22Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10185","snapshot_observed_at":"2026-08-04T16:07:28.414469Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.414469Z"},"links":{"cited_paper":"/paper/2406.10185","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:14c981bf8637c093e5e74a9fad383a4440d0f272257f14c54bf770d3ab2e5555","observation_id":"5722edcc-a5bd-4e16-9781-3eceeb8c3177","resolution":{"observed_at":"2026-08-04T16:07:28.414469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.452193Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.452193Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:3eb2b3762db444020638e7481aa3a3bb49aa2cbb6e50d43f212f9d4bf8c68c87","observation_id":"a7273204-5657-4801-966e-990054462abe","resolution":{"observed_at":"2026-08-04T16:07:28.452193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.487822Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.487822Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:9baa1896ab472894689eb3aff17059fc999cb593c1b11e9348ed6747cc232ce3","observation_id":"37c08c5d-0f4e-4c78-a89e-f2ee7125aaf4","resolution":{"observed_at":"2026-08-04T16:07:28.487822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13617","last_updated":"2025-05-26T10:35:23Z","snapshot_observed_at":"2026-08-16T12:01:30.710481Z","submitted_at":"2025-04-18T10:46:22Z","title":"Compile Scene Graphs with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13617","snapshot_observed_at":"2026-08-04T16:07:28.527593Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.527593Z"},"links":{"cited_paper":"/paper/2504.13617","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:0ffc7b221cc89a7ceb551853096eab8341a68abe546253a3877bbaf348112987","observation_id":"204d6904-3f0c-4a47-b150-6d88ee4dda7f","resolution":{"observed_at":"2026-08-04T16:07:28.527593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14965","last_updated":"2025-06-17T20:24:00Z","snapshot_observed_at":"2026-08-20T13:30:51.994408Z","submitted_at":"2025-06-17T20:24:00Z","title":"Revisiting Reinforcement Learning for LLM Reasoning from A Cross-Domain Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14965","snapshot_observed_at":"2026-08-04T16:07:28.561884Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.561884Z"},"links":{"cited_paper":"/paper/2506.14965","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:fff3ad5d44e006c5eec0f3b30c40a146bcf72227498ad723696a37a8db13e2f0","observation_id":"0336c218-8eeb-441a-85a1-478bcc30418e","resolution":{"observed_at":"2026-08-04T16:07:28.561884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T16:07:28.596194Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.596194Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1183b14cda4c20e493160bacc847c09fe2bccdf145f12f5f381d034c6bbc485c","observation_id":"13e3e9ae-e1a9-492a-8e82-60b49c83205e","resolution":{"observed_at":"2026-08-04T16:07:28.596194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T16:07:28.635398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.635398Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:cf665439cf75eeb0ecf1a0d33a9a64ed1b6e086be5c46c14fa2ba1cdd4f90f69","observation_id":"8a572717-c055-49e3-927a-3930807cca81","resolution":{"observed_at":"2026-08-04T16:07:28.635398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-04T16:07:28.674483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.674483Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e31a587d2e00101944e3a4d756d0d420e7fd155ce14cf77533e0d982d95c81f2","observation_id":"6506b4ce-8fa9-4950-8f8a-c64a4fefe82d","resolution":{"observed_at":"2026-08-04T16:07:28.674483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07065","last_updated":"2025-03-10T08:48:50Z","snapshot_observed_at":"2026-08-16T17:50:14.035660Z","submitted_at":"2025-03-10T08:48:50Z","title":"Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07065","snapshot_observed_at":"2026-08-04T16:07:28.711477Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.711477Z"},"links":{"cited_paper":"/paper/2503.07065","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:aa09e0b6d78bf327c82a0c1a6f2586ec6e33c4607c0a4fcbafc33f217e58265d","observation_id":"994cb6c9-e3dc-4725-8a93-657b246f0fd7","resolution":{"observed_at":"2026-08-04T16:07:28.711477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-17T08:52:56.038060Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16410","snapshot_observed_at":"2026-08-04T16:07:28.753936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.753936Z"},"links":{"cited_paper":"/paper/2505.16410","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c0f52e05f82099f622e5fff9aa22a6836faf685d4cc9ac6674b73584e7a6f8c3","observation_id":"c39a617e-8a38-456c-a1b9-3b25bf595665","resolution":{"observed_at":"2026-08-04T16:07:28.753936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-19T19:12:34.221057Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-08-04T16:07:28.792504Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.792504Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c08b33cbbc4f21189af2550577868b6ccac65931fcc309e297aa0375f28ff0f9","observation_id":"481bd3f4-b9cc-419d-be04-f5ae99ef2ace","resolution":{"observed_at":"2026-08-04T16:07:28.792504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.829289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.829289Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:dfcbb9109be1c60260bc8d703e30bf6255dc0783e5e801c9b945cc575a66988a","observation_id":"d8be9316-60c5-4dd4-8320-403e4905d74c","resolution":{"observed_at":"2026-08-04T16:07:28.829289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-08-15T17:40:05.031382Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-04T16:07:28.872411Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.872411Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6108cdaa9f347b521118a23f064c734f7fb807c06346e627ab15c6a83c89575a","observation_id":"303355bc-dd3c-43de-b77b-526cd55a09f5","resolution":{"observed_at":"2026-08-04T16:07:28.872411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.907544Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.907544Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1e09cb0f4619710ac8384cd1173a08fd356b76405580e21320da924ae808b146","observation_id":"cf3cca11-4862-4e85-a765-c753ea3879df","resolution":{"observed_at":"2026-08-04T16:07:28.907544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:28.916051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.916051Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a1e1a817d441a723e56d68a57f94eb9c36f8e6526c0d9d69d926eea0eba5a570","observation_id":"1db69603-4fa2-49dd-86c8-5e16e100152c","resolution":{"observed_at":"2026-08-04T16:07:28.916051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-16T17:02:25.944512Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-04T16:07:28.955737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.955737Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6e4230400eeded0ee572c2cf7ef975b88332dccf74d4d3aed77a009f9adc567f","observation_id":"b052fbbe-70e8-48c3-a101-990c49522374","resolution":{"observed_at":"2026-08-04T16:07:28.955737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-04T16:07:28.991482Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:28.991482Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:562ed0d395d1ccb7a49303014a302a88ceb9ad1a877b232ee53994e9764bb894","observation_id":"10e14da2-97a7-4a3f-b6da-1696f3588219","resolution":{"observed_at":"2026-08-04T16:07:28.991482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.027428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.027428Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:4f783635bd397ea0c3337cb2070652c40cc9c9be632b9022b693c6faa8ab7b3d","observation_id":"c001a136-ba18-4657-9af6-862cfa25bf17","resolution":{"observed_at":"2026-08-04T16:07:29.027428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-04T16:07:29.094583Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.094583Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:eaba515d16262655c7f74634316570798724704de03bbd505cd14e203ec27a90","observation_id":"b3b4b132-0618-47eb-a124-a9f0de000942","resolution":{"observed_at":"2026-08-04T16:07:29.094583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.131748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.131748Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:084e6528091488db2d1184665e28d3f7c6a66da73245c137038f2d96f6b9d85d","observation_id":"1d89261b-1454-43a4-a0b5-9ea6d18d6b1d","resolution":{"observed_at":"2026-08-04T16:07:29.131748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.163549Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.163549Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:98fe866278762a78406f10bc545ad381064c697e2e7ad3d9946d1d0652b1e1c4","observation_id":"b3d2f39a-8b98-457d-9cc5-1bf124dc3f08","resolution":{"observed_at":"2026-08-04T16:07:29.163549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T16:07:29.199481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.199481Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:38efe4ad5e54aaee1b9a301014b4b15566fa74297d08017201ca0b8bdb17def1","observation_id":"d8d6583d-a411-4896-ac62-6ef44ab2e356","resolution":{"observed_at":"2026-08-04T16:07:29.199481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.231088Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.231088Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f68f3798afeeaabe865d3790bfa886131affaf831c059a0008a52f25564be8e7","observation_id":"0a302257-1715-428a-ad23-c15f21868d2b","resolution":{"observed_at":"2026-08-04T16:07:29.231088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.276202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.276202Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:38d65aa39f12a60bbbb62b29d0e5ceea156ef4e3ff68df7366d3955d3b495830","observation_id":"74598496-fe99-4539-bf71-53871d05cb86","resolution":{"observed_at":"2026-08-04T16:07:29.276202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11967","last_updated":"2025-06-13T17:25:27Z","snapshot_observed_at":"2026-08-15T09:07:02.111235Z","submitted_at":"2025-06-13T17:25:27Z","title":"Visual Pre-Training on Unlabeled Images using Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11967","snapshot_observed_at":"2026-08-04T16:07:29.332714Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.332714Z"},"links":{"cited_paper":"/paper/2506.11967","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c4b38d8b74b545bebe8c7f158524fb4deb19f960f312b592724f5c6fcac66172","observation_id":"3770ca00-2666-4ab3-8baf-d1275f82cd24","resolution":{"observed_at":"2026-08-04T16:07:29.332714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-19T14:44:13.201251Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-04T16:07:29.383625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.383625Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:fa3c1b4faadf5f91e2f3f6efee327b2980cda17247c7ef0c27b707aae31a26b6","observation_id":"1eb84988-09be-4dc8-9337-a1b723f9e5a5","resolution":{"observed_at":"2026-08-04T16:07:29.383625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19713","last_updated":"2025-10-21T04:03:20Z","snapshot_observed_at":"2026-07-06T21:30:28.303379Z","submitted_at":"2025-05-26T09:01:56Z","title":"CAD-Coder: Text-to-CAD Generation with Chain-of-Thought and Geometric Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19713","snapshot_observed_at":"2026-08-04T16:07:29.460017Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.460017Z"},"links":{"cited_paper":"/paper/2505.19713","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c6b3e684ac06d8c86c50f3b10e5b296ad9b163229cc8f1a2b016a27fb0154b80","observation_id":"2d72453d-d5e8-45fc-a2a1-35a9ac617340","resolution":{"observed_at":"2026-08-04T16:07:29.460017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T16:07:29.511684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.511684Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:460be9136ca354c91d0d38638c07c075e52047652bcad3be1f1bde046deddbcd","observation_id":"319648f6-4b28-432e-a38d-9b768458a376","resolution":{"observed_at":"2026-08-04T16:07:29.511684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14674","last_updated":"2025-05-20T17:58:03Z","snapshot_observed_at":"2026-08-17T11:40:20.578047Z","submitted_at":"2025-05-20T17:58:03Z","title":"Reward Reasoning Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14674","snapshot_observed_at":"2026-08-04T16:07:29.589806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.589806Z"},"links":{"cited_paper":"/paper/2505.14674","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5d3c04ad663142805efcb89e3df218786c3916b2b5a4a8e4d76dc4684b38858d","observation_id":"c3900aa1-9feb-460d-9ceb-9b19a2dc5c8d","resolution":{"observed_at":"2026-08-04T16:07:29.589806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17063","last_updated":"2025-05-18T05:35:13Z","snapshot_observed_at":"2026-08-17T14:15:07.271596Z","submitted_at":"2025-05-18T05:35:13Z","title":"Synthetic Data RL: Task Definition Is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17063","snapshot_observed_at":"2026-08-04T16:07:29.655928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.655928Z"},"links":{"cited_paper":"/paper/2505.17063","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:4ccb9b2502b9abb4e020e9241d602bb1290a0ea21f8b78bbd9c399264a702e8f","observation_id":"e9aff45a-0e39-4acf-9076-ba84fa7fa73c","resolution":{"observed_at":"2026-08-04T16:07:29.655928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.717653Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.717653Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1dc505696918aaf43afb03d084b235ca0714b8b0df33e25361eed8aa5d54aad9","observation_id":"3bb229a9-44a0-47da-acb9-7bc50e4de767","resolution":{"observed_at":"2026-08-04T16:07:29.717653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.775830Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.775830Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:2ece1b5004fdcbfb4bea700dab7238f2f4f6d21e849ed0094ddfcebdf196b3f3","observation_id":"bd906e2e-ba42-45cf-b81b-8cf72f147eca","resolution":{"observed_at":"2026-08-04T16:07:29.775830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:29.891730Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.891730Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:5362035872d1d5b1439aaafbcab9297d030c93b9691c779f58b38a0e9eed04f1","observation_id":"9442083a-9dd8-4aa2-9f9f-c10435c2f283","resolution":{"observed_at":"2026-08-04T16:07:29.891730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.022962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.022962Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a5603908b76804a494bb9ea6a6318bab89f195199af66f5afc9cba4136304f60","observation_id":"d2e83bd1-7106-43b0-9502-5f17c29e3246","resolution":{"observed_at":"2026-08-04T16:07:30.022962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-19T07:02:37.182654Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02553","snapshot_observed_at":"2026-08-04T16:07:30.092931Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.092931Z"},"links":{"cited_paper":"/paper/2506.02553","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f3de731555e6f6c808b32208557f78ea4aafc5faf8dfc17e8dc936a86d6393d6","observation_id":"cff38d40-0384-4dfd-b50f-4b7a1be48da5","resolution":{"observed_at":"2026-08-04T16:07:30.092931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.153042Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.153042Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:8bd18fc175d3505c0d55a6eeee633e83f027cdcf026223c734676af7ab36156e","observation_id":"192b405b-a9bc-482a-98b8-9088abfc0528","resolution":{"observed_at":"2026-08-04T16:07:30.153042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.213135Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.213135Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:9ef86fdf6e6feb60c12deb19e30e7f637a86f214611adadbef28cb2d1a808a7c","observation_id":"3e89d2e0-c61a-481a-acad-d83d5fdb580e","resolution":{"observed_at":"2026-08-04T16:07:30.213135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.275148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.275148Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1331e7beee4134ad223b340abbf15aa87bd3febeb1b535352e294496e6c14679","observation_id":"fe72ef61-5397-4f90-b97a-143a3c5125c4","resolution":{"observed_at":"2026-08-04T16:07:30.275148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-04T16:07:30.345279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.345279Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:04a1864ed965a0787c54dcd2d2407662239428e406352f37067bf6415291540e","observation_id":"73fda0c8-0b55-468b-9458-326729616f46","resolution":{"observed_at":"2026-08-04T16:07:30.345279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.515852Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.515852Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:12a99143ae0bd077a55f2919ed8ab7ac6c8c55f79503281c731401d42304a471","observation_id":"51a23c9c-8d3c-461a-beaa-16414fcc4226","resolution":{"observed_at":"2026-08-04T16:07:30.515852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-04T16:07:30.575799Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.575799Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:49a5ddc607cc7071196e3ef0f72c7b73932dedeeea953b8e1043a72b10b48110","observation_id":"31792538-d656-4233-b016-9db69d3c341a","resolution":{"observed_at":"2026-08-04T16:07:30.575799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-18T04:26:49.778619Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-04T16:07:30.691620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.691620Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:92b0eda64b9c0a1c89408e7ca967d93f71e3f901ea3b2f9f705c821b744cdb8e","observation_id":"00ae4d2d-d592-4a4c-ab4d-5ea56b6be92b","resolution":{"observed_at":"2026-08-04T16:07:30.691620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-04T16:07:30.755317Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.755317Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:bdaa61fcbbd754e457e13b48e28d9eef1ccfe49ff01f2cfb19b632d6a2b6bb21","observation_id":"8ee7e32b-36b7-4bf1-9db7-2c0e8e53d450","resolution":{"observed_at":"2026-08-04T16:07:30.755317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12392","last_updated":"2025-05-26T05:28:49Z","snapshot_observed_at":"2026-08-18T19:44:39.778431Z","submitted_at":"2025-05-18T12:37:56Z","title":"SLOT: Sample-specific Language Model Optimization at Test-time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12392","snapshot_observed_at":"2026-08-04T16:07:30.821966Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.821966Z"},"links":{"cited_paper":"/paper/2505.12392","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:99e299ec3bec2cab478498d6c4964fc4d3fdbb486352a9909a709cc5a0a17a26","observation_id":"8fb8a73f-287e-4ea6-a7d3-064619ab26af","resolution":{"observed_at":"2026-08-04T16:07:30.821966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:30.883862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.883862Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6238d302d42b901ffd54b645af7914f65dfee6dec7652d2bfe61c1776018fdb6","observation_id":"fe90b436-1748-42c1-a9ec-edf95282059b","resolution":{"observed_at":"2026-08-04T16:07:30.883862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-16T12:45:24.960151Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-08-04T16:07:30.943890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:30.943890Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:efab8c300ba1f4b1acfbac86d4caf6d7a1a2d278e712849f7aa71266c9e4aff2","observation_id":"3966b4c6-aee4-4b0f-a038-e38f848f33ca","resolution":{"observed_at":"2026-08-04T16:07:30.943890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-20T03:02:12.904251Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23478","snapshot_observed_at":"2026-08-04T16:07:31.073651Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.073651Z"},"links":{"cited_paper":"/paper/2507.23478","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:ba7cdc6c2c465ee8c0b110860932b6a033f091d5c2e0a4c48597b66eddabd37c","observation_id":"460d4a8a-d80b-43fe-bcf5-c16251f52e35","resolution":{"observed_at":"2026-08-04T16:07:31.073651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-04T16:07:31.183592Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.183592Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:385c779c27dec1245508a37cd1165487d6bd43f9936f027060ce9dc3ef266f06","observation_id":"423caa36-317e-440e-bc6b-5f65775b5463","resolution":{"observed_at":"2026-08-04T16:07:31.183592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T16:07:31.253966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.253966Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:bae2290843c780bc043eab67995d0462a65f3f5b00e317b90cb82bbe4df1dade","observation_id":"5285291a-8157-4889-a271-cdd9944ca92b","resolution":{"observed_at":"2026-08-04T16:07:31.253966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-04T16:07:31.317615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.317615Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1d7fc9826dbd68b9d346c11966e8981f7c6d535bc0995a9fe73a9b386eaee3d0","observation_id":"dc91860a-5043-4c37-a387-c2d39244a6e2","resolution":{"observed_at":"2026-08-04T16:07:31.317615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-04T16:07:31.387671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.387671Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e2519f9d90737e067cb1a39b194ce4412bcdea10cb1bb1e0a479362e3a8b7d51","observation_id":"04086387-639e-4a0b-b1bf-1820ffbbd2a5","resolution":{"observed_at":"2026-08-04T16:07:31.387671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02666","last_updated":"2025-08-29T15:47:44Z","snapshot_observed_at":"2026-08-18T19:51:24.628281Z","submitted_at":"2025-05-05T14:15:02Z","title":"A Survey on Progress in LLM Alignment from the Perspective of Reward Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02666","snapshot_observed_at":"2026-08-04T16:07:31.458650Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.458650Z"},"links":{"cited_paper":"/paper/2505.02666","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:2a277d5b47c026d9ca0238dcfde0c9c35af88af09d4fbb572b65259034290128","observation_id":"6f62552a-42ae-461a-a31e-025c52a5da8e","resolution":{"observed_at":"2026-08-04T16:07:31.458650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-16T23:37:48.037791Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-08-04T16:07:31.520711Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.520711Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:132f7803dc763222e7f171abc052838367f97526b39d868b283d5dd00fb75994","observation_id":"2497ffc9-72aa-4900-8f5f-06a21319f463","resolution":{"observed_at":"2026-08-04T16:07:31.520711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14631","last_updated":"2025-05-21T05:17:34Z","snapshot_observed_at":"2026-08-14T02:59:07.680251Z","submitted_at":"2025-05-20T17:23:25Z","title":"Think Only When You Need with Large Hybrid-Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14631","snapshot_observed_at":"2026-08-04T16:07:31.525481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.525481Z"},"links":{"cited_paper":"/paper/2505.14631","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:464135becb1db96376892a4c8fa171d9f214c61e0e472186052ff016c2d0083c","observation_id":"11a487ad-e7a2-4edf-88fa-750f4e1bae50","resolution":{"observed_at":"2026-08-04T16:07:31.525481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-19T00:22:46.168418Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-04T16:07:31.560030Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.560030Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e5226b4dee5928ece9573f6b0209ed72eddf5140fcb21817984cec4cebfcc424","observation_id":"c595a2f4-a866-47f8-9ec6-70a2fc92d731","resolution":{"observed_at":"2026-08-04T16:07:31.560030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T16:07:31.622495Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.622495Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1a2696766bda9cd7aea52b9e02cb24ab246f882eae1e845274a43688ea79f6c0","observation_id":"ff833ea8-a32c-4dd3-9eb5-cbd452a1d7f4","resolution":{"observed_at":"2026-08-04T16:07:31.622495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:31.682882Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.682882Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:b85da53db63a781627f17af4deab799e92afca629cbb27cb575059f4f7f110d8","observation_id":"8d877f3d-03f5-4ab8-b772-c70b75a319ca","resolution":{"observed_at":"2026-08-04T16:07:31.682882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:31.731791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.731791Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:7326c71b6980ec93cde70cb1c94de38326d1bf7295f86392b89170d7119c241a","observation_id":"02979552-fac8-4515-b377-b34adf2a43c8","resolution":{"observed_at":"2026-08-04T16:07:31.731791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19187","last_updated":"2025-05-06T15:11:32Z","snapshot_observed_at":"2026-08-18T11:14:47.752016Z","submitted_at":"2025-02-26T14:50:50Z","title":"BIG-Bench Extra Hard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19187","snapshot_observed_at":"2026-08-04T16:07:31.880939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:31.880939Z"},"links":{"cited_paper":"/paper/2502.19187","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:cad69325bb9c87902457e2becd7e27c394a8125cf630bb1d5e38ec9096fa2b11","observation_id":"5ff89a9f-4a92-4457-9983-5683a446d207","resolution":{"observed_at":"2026-08-04T16:07:31.880939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.003360Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.003360Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:26e2c2fa9536138c3471be4e556ba37cd3d17b918c9e44fb232e3e6926938b0c","observation_id":"4fca4bac-f0e6-4cbd-8166-6baed38a03e1","resolution":{"observed_at":"2026-08-04T16:07:32.003360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14659","last_updated":"2021-03-26T18:01:48Z","snapshot_observed_at":"2026-08-16T18:36:00.757397Z","submitted_at":"2021-03-26T18:01:48Z","title":"Alignment of Language Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14659","snapshot_observed_at":"2026-08-04T16:07:32.253183Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.253183Z"},"links":{"cited_paper":"/paper/2103.14659","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:a62e5f24317fd44006a95c1b391c6a521f7160989a78d1226f2add9b70d42f6e","observation_id":"06574205-1244-4c8b-b693-d2455cf9930e","resolution":{"observed_at":"2026-08-04T16:07:32.253183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.342978Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.342978Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:9d07d863e09066bad8b950088b917bcf4db55fd7a1d6c2035532ac4c5e5acfac","observation_id":"a69d7b46-fc1f-49b9-8fc5-fe3c25a26548","resolution":{"observed_at":"2026-08-04T16:07:32.342978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.117928Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.117928Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f7a8498cb426b7976e62ba446811fd0583c955c0df5cde7438be96f4cab04ab6","observation_id":"7c8251bc-4df4-40ef-98e5-96a26da71e88","resolution":{"observed_at":"2026-08-04T16:07:32.117928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.558509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.558509Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:7e2e926c431b058b3b2dd00f5fed2ac7af9f4c90e081b80c7d5991fc21c0ee76","observation_id":"c7cbecd9-fc24-49bb-99c5-b6f5dd58c1ed","resolution":{"observed_at":"2026-08-04T16:07:32.558509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-16T12:54:10.475592Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-04T16:07:32.684144Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.684144Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:0837cf3e451c0beb7559e6a34a19abe8343451191ba12e00c7795942d18e572d","observation_id":"d1255068-badb-4245-80ee-4c78eba503a5","resolution":{"observed_at":"2026-08-04T16:07:32.684144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.450828Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.450828Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:bce0332727075d482e4a1b404223f7fad9627dd8560d3d1fc4a80ba93234fd5d","observation_id":"648ae64a-db90-4202-b7ff-5b8212cf3953","resolution":{"observed_at":"2026-08-04T16:07:32.450828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T16:07:32.864814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.864814Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1cadc93d1e36bd5e9ddd37cc42cd1b22a476ffa63e5e75659ee4992f578cec74","observation_id":"1d7a65e5-8847-4f1d-9a0e-78372b7d687d","resolution":{"observed_at":"2026-08-04T16:07:32.864814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.939767Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.939767Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:1e1221076a375b89d93e171a2d0c7390840c2c60971df125ac6cc58776fc6dc6","observation_id":"84e29578-dfb1-4258-aeb6-5a4d37540d91","resolution":{"observed_at":"2026-08-04T16:07:32.939767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.796991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.796991Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:ce2859ed020083d45180b1d01429f3193186594b9bf12ea9b44dbf0a2c6abb51","observation_id":"08dbc974-e252-4e5d-ad6b-9a2077e914ce","resolution":{"observed_at":"2026-08-04T16:07:32.796991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:33.051469Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.051469Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:6a01bcc69f5686645cc39908929bb302a51e41e15d3c38194c0857ae8514a1e3","observation_id":"cfe83f2a-4ba7-47b6-aaac-e62ec57aaf9d","resolution":{"observed_at":"2026-08-04T16:07:33.051469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:33.128629Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.128629Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:3af9dbd485d743baee59dd6f78f31b15c353a264fd384a5dbc7cc37c0283989a","observation_id":"6a0e690e-1d98-4c45-b51b-c1a304d95dfb","resolution":{"observed_at":"2026-08-04T16:07:33.128629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:32.978372Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:32.978372Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:b90538eb2a582123ceac7b93e38d4b101d3c7c3060216095388b226f850e9bca","observation_id":"b8cfb525-bb79-4e86-b03a-f8abf63d5b85","resolution":{"observed_at":"2026-08-04T16:07:32.978372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-04T16:07:33.334341Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.334341Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:bce5f8980aa30b9062c4dd356e44678745dd62e1130f22e82ce721e4afad844a","observation_id":"d8a6185a-fc02-4d71-8a46-355ab7680a42","resolution":{"observed_at":"2026-08-04T16:07:33.334341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-18T07:08:35.277799Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T16:07:33.433285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.433285Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:d2190a6d78783804362da4ae488b1d02cff591066f9ffd2a20884af1dbb9968b","observation_id":"ac6d0e7b-4034-494d-b8cf-bf0226db0283","resolution":{"observed_at":"2026-08-04T16:07:33.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06395","last_updated":"2025-06-11T06:21:59Z","snapshot_observed_at":"2026-08-16T19:48:43.811387Z","submitted_at":"2025-06-05T19:55:15Z","title":"Confidence Is All You Need: Few-Shot RL Fine-Tuning of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06395","snapshot_observed_at":"2026-08-04T16:07:33.243783Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.243783Z"},"links":{"cited_paper":"/paper/2506.06395","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e5ce43fea12a80abce658ee6ef95edc2998e80413e87e39636b38a246aff1bf6","observation_id":"0657594b-20a4-42e4-84e5-f1d2760997d2","resolution":{"observed_at":"2026-08-04T16:07:33.243783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:33.621256Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.621256Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:772591b0c8e11ea84c6c49c958c489a94fba38f79d6b64598ca8ddb5a13a84d3","observation_id":"0cb9acb6-6d08-4dee-9e45-d2c4442bcc98","resolution":{"observed_at":"2026-08-04T16:07:33.621256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:07:33.701387Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.701387Z"},"links":{"citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f8595c2bc5d205cb94b4b11da76634b9dca4ee1840da296bd2738773e6d1fbc3","observation_id":"fb5a63db-4682-4902-abd3-5b5346672270","resolution":{"observed_at":"2026-08-04T16:07:33.701387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23235","last_updated":"2025-06-29T13:45:54Z","snapshot_observed_at":"2026-08-13T20:45:58.890611Z","submitted_at":"2025-06-29T13:45:54Z","title":"Generalist Reward Models: Found Inside Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23235","snapshot_observed_at":"2026-08-04T16:07:33.529325Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.529325Z"},"links":{"cited_paper":"/paper/2506.23235","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:ce31ea080fd55d9c18a36dc2c823391c31d106dfee4a5a236129e5a41d3d3192","observation_id":"6f1922a0-0415-4eae-b74f-083630c02ee7","resolution":{"observed_at":"2026-08-04T16:07:33.529325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-19T22:56:54.842002Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-08-04T16:07:33.895807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.895807Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c3f1c1d3d8c65a8347c398540ba8359ef5ab0bd588c778fa6cc1d91f5d1bbbc5","observation_id":"6776643c-97a0-4199-9eb2-0fd15a3547b6","resolution":{"observed_at":"2026-08-04T16:07:33.895807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00883","last_updated":"2025-04-14T20:12:57Z","snapshot_observed_at":"2026-08-17T04:05:57.528138Z","submitted_at":"2025-04-01T15:11:11Z","title":"Improved Visual-Spatial Reasoning via R1-Zero-Like Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00883","snapshot_observed_at":"2026-08-04T16:07:33.995648Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.995648Z"},"links":{"cited_paper":"/paper/2504.00883","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:ffd0443e32f1bcbc5dbe3c72c30a4985320bd8504d022517f46904f25f690e05","observation_id":"2a7ed2cc-0db1-417c-8b68-aae1f1a6ccf7","resolution":{"observed_at":"2026-08-04T16:07:33.995648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":263},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 263 outbound references and 11 inbound Pith citation observations for arXiv:2509.16679."}