{"as_of":"2026-08-10T09:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6eddcf36d2fb85d42fd1d48eb2e47b32bfc3b4658b91a0fc515d8c65c470c39","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:25:49.495121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.174737Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-08T20:25:49.495121Z","title":"Reinforcement learning enhanced llms: A survey, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05078","last_updated":"2025-02-07T16:54:19Z","snapshot_observed_at":"2026-08-09T10:42:05.397076Z","submitted_at":"2025-02-07T16:54:19Z","title":"Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T20:25:49.495121Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2502.05078"},"observation_digest":"sha256:a3aa03ad919f40509699d84e97fb9ac422564dcbbc13845e9ee3a47eab37264d","observation_id":"03a804e4-8548-4dcf-a4d6-4073a43b8907","resolution":{"observed_at":"2026-08-08T20:25:49.495121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-07T15:08:12.936464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16241","last_updated":"2025-05-26T02:28:07Z","snapshot_observed_at":"2026-08-07T21:56:02.136924Z","submitted_at":"2025-05-22T05:19:42Z","title":"Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked Ciphers","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:08:12.936464Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2505.16241"},"observation_digest":"sha256:2e0af9db51363cde0e40bd5d871d28a27eedb882fd56b528303d9a8c86996fda","observation_id":"3b203e7a-088c-4dbc-b3f4-92ca1cebad40","resolution":{"observed_at":"2026-08-07T15:08:12.936464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-07T11:21:39.153862Z","title":"Reinforcement learning enhanced llms: A survey.arXiv preprint arXiv:2412.10400, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02726","last_updated":"2025-06-03T10:36:38Z","snapshot_observed_at":"2026-08-08T11:50:57.510769Z","submitted_at":"2025-06-03T10:36:38Z","title":"RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:39.153862Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2506.02726"},"observation_digest":"sha256:188ccc56881c43a8be7b2c3e85e314c15f2a681e2c9df0e8deb76cf4ed2947a4","observation_id":"74c35b06-33bc-4769-a41d-ee2412b33a4e","resolution":{"observed_at":"2026-08-07T11:21:39.153862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-07T10:19:34.611764Z","title":"Reinforcement Learning Enhanced LLMs: A Survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05748","last_updated":"2025-06-06T05:18:54Z","snapshot_observed_at":"2026-08-07T21:55:18.527116Z","submitted_at":"2025-06-06T05:18:54Z","title":"Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:34.611764Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2506.05748"},"observation_digest":"sha256:22f0318ce1c9520b06b409583ce5b40e223414e5396d8559d73dc67913cdc7f6","observation_id":"b3f198b2-d25f-4a79-afe5-066bbddecdb4","resolution":{"observed_at":"2026-08-07T10:19:34.611764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-07T01:03:40.631750Z","title":"Reinforcement learning enhanced llms: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12217","last_updated":"2025-06-13T20:40:13Z","snapshot_observed_at":"2026-08-10T00:49:00.307431Z","submitted_at":"2025-06-13T20:40:13Z","title":"From Emergence to Control: Probing and Modulating Self-Reflection in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T01:03:40.631750Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2506.12217"},"observation_digest":"sha256:3ece06ec7cc65cda965eaa1db9056a00cae88cfee067c82ac83107ab18bb87ab","observation_id":"271c3ef1-143a-4feb-a781-27cf896f307c","resolution":{"observed_at":"2026-08-07T01:03:40.631750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-06T23:26:45.293601Z","title":"Reinforcement learning enhanced llms: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18019","last_updated":"2025-07-04T14:29:40Z","snapshot_observed_at":"2026-08-09T01:56:23.536720Z","submitted_at":"2025-06-22T12:59:12Z","title":"Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:45.293601Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2506.18019"},"observation_digest":"sha256:20b00c58e005457295bff2bb0a8f2fcb24d6dc63cfb1b55989606bee3936c999","observation_id":"92ac68ef-15bb-45df-83c8-f1635466a8a7","resolution":{"observed_at":"2026-08-06T23:26:45.293601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-06T19:59:35.032860Z","title":"Reinforcement learning enhanced llms: A survey.arXiv preprint arXiv:2412.10400, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:35.032860Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:eafab6eb2defd23ac4b9bcc64f6d4111201d174abe20176f2d05010381079bf8","observation_id":"8d61cdcc-f5b3-4f50-ac9f-63d1b5addaf0","resolution":{"observed_at":"2026-08-06T19:59:35.032860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-06T19:45:56.908088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04706","last_updated":"2025-07-07T06:57:34Z","snapshot_observed_at":"2026-08-07T21:57:02.535601Z","submitted_at":"2025-07-07T06:57:34Z","title":"UrbanMind: Towards Urban General Intelligence via Tool-Enhanced Retrieval-Augmented Generation and Multilevel Optimization","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:45:56.908088Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2507.04706"},"observation_digest":"sha256:d08901dfc587d87f532724a2db8de352a20f50f8bd2406492c2a5a99fc1eb9be","observation_id":"4ac75bcc-2484-4701-8ee5-7d2205ab938f","resolution":{"observed_at":"2026-08-06T19:45:56.908088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-06T17:39:45.167344Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10284","last_updated":"2025-07-14T13:51:28Z","snapshot_observed_at":"2026-08-08T22:51:11.447471Z","submitted_at":"2025-07-14T13:51:28Z","title":"Prompt Informed Reinforcement Learning for Visual Coverage Path Planning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:45.167344Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2507.10284"},"observation_digest":"sha256:f645398734330fc0e0ad07ba4ae138a8879042ee6e92c089dff081d5b91b5c10","observation_id":"8454d102-a1f9-4778-ac7f-ca29f592db15","resolution":{"observed_at":"2026-08-06T17:39:45.167344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-06T16:15:03.669635Z","title":"Reinforcement learning enhanced llms: A survey.arXiv preprint arXiv:2412.10400(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14111","last_updated":"2026-08-05T22:03:49Z","snapshot_observed_at":"2026-08-09T23:09:14.608641Z","submitted_at":"2025-07-18T17:43:56Z","title":"CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning","version":11},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:15:03.669635Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2507.14111"},"observation_digest":"sha256:ce1becdad2bc52e5e77016a470240e305d2e9ffea9b6631b0810f7a05dad7ebd","observation_id":"d8a03833-3369-49cf-b682-b4d1928c1d0b","resolution":{"observed_at":"2026-08-06T16:15:03.669635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f10c2543642f951c1f5a44d5164bbd745566b36a49280bde51db0f1a5e869e7b","observation_id":"c802a854-f512-4e56-88f1-ed39a82c88db","resolution":{"observed_at":"2026-05-18T19:21:48.875324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-05T15:17:13.811953Z","title":"abcdefg”, then valid words are “faced","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03537","last_updated":"2025-08-27T17:26:44Z","snapshot_observed_at":"2026-08-09T15:45:12.294838Z","submitted_at":"2025-08-27T17:26:44Z","title":"AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:17:13.811953Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.03537"},"observation_digest":"sha256:745cacdbc512b4e5271f7e12b3ee55ce9c25567e6de7f3e9d6b88c4d528c7673","observation_id":"4337c025-72a6-4375-9146-b13ac84b2cc5","resolution":{"observed_at":"2026-08-05T15:17:13.811953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-04T20:49:37.841831Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.841831Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:68c4514f94692782f4f387469a762d4c8f2dc8a986c3a0cb16b2acc5fda5edbb","observation_id":"962487d1-4a09-403b-9316-9085a2f737fb","resolution":{"observed_at":"2026-08-04T20:49:37.841831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-08-04T16:07:42.090072Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:42.090072Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:db481ab32a0ab043046f7fe1c9248fc730af92fdb32b3b81e5b9755add5a5666","observation_id":"924608cf-7715-43ae-b943-b3fbfcb71f8a","resolution":{"observed_at":"2026-08-04T16:07:42.090072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2604.07851","last_updated":"2026-04-09T06:07:03Z","snapshot_observed_at":"2026-08-03T12:28:38.894496Z","submitted_at":"2026-04-09T06:07:03Z","title":"ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-10T17:29:34.145855Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2604.07851"},"observation_digest":"sha256:a5e202fe36d979a3ac5b16da8e94622d8f1a973d50e6ef0ff262ae90764f7327","observation_id":"1872373b-1b53-42ae-a144-2f468c9ec62b","resolution":{"observed_at":"2026-05-11T06:41:41.576325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:effa8638fd4cffe09e23171b5e49f583c168d96981b69981b03e816f6b43a6a0","observation_id":"bce1f1bb-2c66-4943-afcb-3754b3fa4315","resolution":{"observed_at":"2026-05-12T10:21:29.688214Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:2dc9a2d9397a900ac20a0df80d12d9a9409d39a3dd2bc1def7b4c112efd5b7de","observation_id":"97ae5a59-580d-44ff-afe6-7d7aa208166d","resolution":{"observed_at":"2026-05-11T22:11:16.839688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:3ecda8b0c585c1774ba08f404247718348e2a4dd7d253b0ccdc7e6e746c8253f","observation_id":"48e78007-5e78-49b1-a1c7-4e38121d42b0","resolution":{"observed_at":"2026-05-19T17:02:40.669713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:9b8215faa50b179ae605f7f8d91ddfac34ea38a82afc1737f9754b3629d69047","observation_id":"331828b8-536a-4a04-a4b7-0e41a4240678","resolution":{"observed_at":"2026-05-10T23:15:48.880543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2605.08368","last_updated":"2026-05-08T18:23:25Z","snapshot_observed_at":"2026-07-06T23:20:38.385189Z","submitted_at":"2026-05-08T18:23:25Z","title":"On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T00:52:51.509014Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2605.08368"},"observation_digest":"sha256:5574854e5b4c57d88ae895dde4900eb78017df6f9f729e0a57908dc525db03e8","observation_id":"da193571-0479-4764-91d0-ae53fc401e22","resolution":{"observed_at":"2026-05-12T08:36:26.836626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2605.20696","last_updated":"2026-05-20T04:49:13Z","snapshot_observed_at":"2026-08-08T21:53:45.805536Z","submitted_at":"2026-05-20T04:49:13Z","title":"Distributed Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T05:56:54.996304Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2605.20696"},"observation_digest":"sha256:b085451186b433519d81ebec7d41577b3edd6b4ef24219c76c81ed84d5207bba","observation_id":"bcf3352b-0cc0-411e-83c8-bc518ee2c6d2","resolution":{"observed_at":"2026-05-21T05:59:40.940560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2606.18747","last_updated":"2026-06-17T06:48:44Z","snapshot_observed_at":"2026-08-07T17:29:43.944723Z","submitted_at":"2026-06-17T06:48:44Z","title":"Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:48:59.539626Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2606.18747"},"observation_digest":"sha256:668d00a66c67ce484294950278663aa9147871786f744224ab592cbf251bfe94","observation_id":"51c7f75c-ae03-49f3-b4df-8b02fbed5ada","resolution":{"observed_at":"2026-07-04T00:59:20.399088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":218,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:ffc74e78493ae6f015d391a466630cc8a459e11dfa11518cf34ae4b1768e06f6","observation_id":"a585e21d-8c8a-485a-9f16-1ca05051fd09","resolution":{"observed_at":"2026-07-04T07:59:40.176238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10400/citation-record","integrity":"/paper/2412.10400/integrity","json":"/paper/2412.10400/citation-record.json","paper":"/paper/2412.10400"},"outbound":[],"paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:53:28.691375Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2412.10400."}