{"as_of":"2026-08-08T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9e37766f7cd4ff69cdfb923c3cdaa63d96fec529f193fc6f787dd445e175fe0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:11:08.137792Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T02:42:26.083324Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:fa15d282da860b76c79636c13d33027e109dcea1c6a04dceda3183e0927dab39","observation_id":"e620d219-e4d2-4d99-b7cc-e5b38a53b4cf","resolution":{"observed_at":"2026-05-17T12:04:10.444859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:b89aa2512438bfc4b68a8d04e39bd019034db63e0ef87fd0bc6524ce567a7432","observation_id":"5e742e69-9d5d-4e1b-ab04-905424c5eb95","resolution":{"observed_at":"2026-05-21T01:42:19.179140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T10:29:05.384381Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2412.06769"},"observation_digest":"sha256:6a353a9aa045c30425a18c7cd5db2404a411863454ce1b408380f3f3e0202af7","observation_id":"81073105-9561-4640-9bdf-431d133e25bb","resolution":{"observed_at":"2026-05-11T10:29:05.706544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-08T15:11:08.137792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06533","last_updated":"2025-02-10T14:56:25Z","snapshot_observed_at":"2026-08-08T15:05:57.951816Z","submitted_at":"2025-02-10T14:56:25Z","title":"Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T15:11:08.137792Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.06533"},"observation_digest":"sha256:82ff676c8f1e813cf1784bbe3e4687bdd74c428939c2c4240338c79e76ce0d73","observation_id":"0d0b062e-1036-4c1f-b7fe-403edeb2d6d2","resolution":{"observed_at":"2026-08-08T15:11:08.137792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-08T14:25:53.357179Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06773","last_updated":"2025-02-10T18:52:04Z","snapshot_observed_at":"2026-08-08T14:46:08.353497Z","submitted_at":"2025-02-10T18:52:04Z","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:25:53.357179Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.06773"},"observation_digest":"sha256:767686cf3b3a595e5dafcff6346a526470616833d607eff073894318122cc39a","observation_id":"943e4545-6612-4952-a7c6-53c23682a60a","resolution":{"observed_at":"2026-08-08T14:25:53.357179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T18:39:38.006409Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:38.006409Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:a681970423c8b60104497f7eb73bcf8ffe9b7643cccea3aa7ade8a399044ce55","observation_id":"c98a33f2-13cf-4e37-974c-51909915dc0d","resolution":{"observed_at":"2026-08-07T18:39:38.006409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:ef5dd2af854b30a110e0e53e6fd78dd534999a863ef6456e892242e158314542","observation_id":"23390e2f-76d4-4c61-b3fb-2f047a4552c5","resolution":{"observed_at":"2026-05-23T02:42:26.085841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:15:43.520186Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15778","last_updated":"2025-05-21T17:29:15Z","snapshot_observed_at":"2026-08-07T23:55:32.170893Z","submitted_at":"2025-05-21T17:29:15Z","title":"Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:43.520186Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.15778"},"observation_digest":"sha256:0020f0ce946679ade0f5eb35ec74827a33a5f1cf4275e6802888594ca9e026f1","observation_id":"1a9aa297-dd75-445b-9d9f-0739788963a9","resolution":{"observed_at":"2026-08-07T15:15:43.520186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:13:43.610133Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15793","last_updated":"2025-05-22T04:48:12Z","snapshot_observed_at":"2026-08-07T15:09:16.633906Z","submitted_at":"2025-05-21T17:47:24Z","title":"HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:43.610133Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.15793"},"observation_digest":"sha256:44096c62062bff15d0c64459da61f8fa19c337eccace400e18fd713d69613483","observation_id":"49fc1608-b320-4489-bbfa-ae4d409b03ac","resolution":{"observed_at":"2026-08-07T15:13:43.610133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:09:53.173407Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.173407Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:38637c02cc28e53bdb71e148235d34e9e58d0fd70c2ae18958e7ee0951296a89","observation_id":"d19f54ef-db2a-4b5b-867e-f353c9648dd4","resolution":{"observed_at":"2026-08-07T15:09:53.173407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T14:09:22.127164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19966","last_updated":"2025-05-26T13:26:56Z","snapshot_observed_at":"2026-08-08T05:15:41.561872Z","submitted_at":"2025-05-26T13:26:56Z","title":"Learning to Select In-Context Demonstration Preferred by Large Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:22.127164Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.19966"},"observation_digest":"sha256:9e2410df6548826eef20b4d4df660bef9ab31e37ebcf38b09c32fe32688df625","observation_id":"2120d7eb-4477-465d-8dea-891dc5dd9fb2","resolution":{"observed_at":"2026-08-07T14:09:22.127164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2505.23912","last_updated":"2026-05-13T21:21:09Z","snapshot_observed_at":"2026-08-02T15:55:45.353476Z","submitted_at":"2025-05-29T18:05:20Z","title":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T12:43:51.019983Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.23912"},"observation_digest":"sha256:8e934e000632e7a5d8c08c0035942ca53a4e8b5d2cc02125e43816587ec925f1","observation_id":"b280998b-7aeb-4866-9259-74fd9d347658","resolution":{"observed_at":"2026-05-19T12:47:17.959953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:38:59.544322Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24181","last_updated":"2025-05-30T03:43:24Z","snapshot_observed_at":"2026-08-07T12:28:41.940043Z","submitted_at":"2025-05-30T03:43:24Z","title":"SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:59.544322Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.24181"},"observation_digest":"sha256:dd8f3494d1b650cec7c09f0b10672d1adae29baf141c5f2320f0c0ac22049812","observation_id":"7e35f750-3716-42a7-88b1-4dbb4526b9d0","resolution":{"observed_at":"2026-08-07T12:38:59.544322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:19:28.455709Z","title":"Havrilla, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-07T12:10:18.330753Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.455709Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:9f000d62ee2eba604f36ce8f7225d56aa91219b8db9dbb11c95b0f22416e3c86","observation_id":"e135594d-1c46-4d77-8a61-9b2fe77ab4d0","resolution":{"observed_at":"2026-08-07T12:19:28.455709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T10:28:19.442762Z","title":"C., Nalmpantis, C., Dwivedi-Yu, J., Zhuravinskyi, M., Hambro, E., Sukhbaatar, S., and Raileanu, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05109","last_updated":"2025-06-05T14:53:35Z","snapshot_observed_at":"2026-08-08T02:17:06.461305Z","submitted_at":"2025-06-05T14:53:35Z","title":"Truly Self-Improving Agents Require Intrinsic Metacognitive Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:28:19.442762Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.05109"},"observation_digest":"sha256:ee46386ab7896d011566ec34a75b61aa79c4fddf75764c81834601e1db1fa3d9","observation_id":"a53a291c-66f3-4219-8f0f-dc8fd58cf89f","resolution":{"observed_at":"2026-08-07T10:28:19.442762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T04:53:56.348495Z","title":"arXiv preprint arXiv:2403.04642","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-08T13:48:32.149553Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:56.348495Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.09340"},"observation_digest":"sha256:16b48bb3e629f33315a8ec93186b4facf1661886525644ebb72268ef55c528fb","observation_id":"28fa47da-3602-46cb-bef4-1b7022a8e596","resolution":{"observed_at":"2026-08-07T04:53:56.348495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T04:47:42.354458Z","title":"Teaching large language models to reason with reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09659","last_updated":"2025-06-11T12:26:45Z","snapshot_observed_at":"2026-08-08T15:50:28.118051Z","submitted_at":"2025-06-11T12:26:45Z","title":"Intent Factored Generation: Unleashing the Diversity in Your Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:47:42.354458Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.09659"},"observation_digest":"sha256:78cf77e8f4f34763f89a667f64f7ab9a6b2842f26fe1389b12fa3d4f5b00cf0b","observation_id":"1c3bf2f5-bbaa-4cbe-aa0d-b4f53a75aaf8","resolution":{"observed_at":"2026-08-07T04:47:42.354458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:19:53.893423Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15710","last_updated":"2025-05-30T17:57:08Z","snapshot_observed_at":"2026-08-08T01:06:17.296161Z","submitted_at":"2025-05-30T17:57:08Z","title":"RAST: Reasoning Activation in LLMs via Small-model Transfer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:53.893423Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.15710"},"observation_digest":"sha256:f36f690f643ba675c9c7bade686c3f3b74a93769e53872784bc100e25ae3a5a8","observation_id":"31b4fc56-00b6-434c-9a07-5a53afa3bab2","resolution":{"observed_at":"2026-08-07T12:19:53.893423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T22:04:00.026680Z","title":"C., Nalmpantis, C., Dwivedi-Yu, J., Zhuravinskyi, M., Hambro, E., Sukhbaatar, S., and Raileanu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22769","last_updated":"2025-06-28T06:13:13Z","snapshot_observed_at":"2026-08-06T21:55:50.977658Z","submitted_at":"2025-06-28T06:13:13Z","title":"Learning Efficient Robotic Garment Manipulation with Standardization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:00.026680Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.22769"},"observation_digest":"sha256:34ec11b787415a97b09d94d0933cd9e8078cedfd3c84713c5a2c0f08a16391d4","observation_id":"30cebf1b-9edf-4c93-a4c6-0d06a81f86d1","resolution":{"observed_at":"2026-08-06T22:04:00.026680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T10:19:04.082222Z","title":"Teach- ing large language models to reason with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02870","last_updated":"2025-06-06T10:50:08Z","snapshot_observed_at":"2026-08-08T01:09:03.836574Z","submitted_at":"2025-06-06T10:50:08Z","title":"Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:04.082222Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.02870"},"observation_digest":"sha256:ae3948297e3629767b1bdaadd636e9d928128017ba9ce53d2ad89442db44c534","observation_id":"1e441468-f270-49bd-8275-064d1d46a9b2","resolution":{"observed_at":"2026-08-07T10:19:04.082222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T15:07:27.843871Z","title":"Teaching large lan- guage models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16773","last_updated":"2025-07-22T17:21:36Z","snapshot_observed_at":"2026-08-07T14:41:17.931131Z","submitted_at":"2025-07-22T17:21:36Z","title":"When LLMs Copy to Think: Uncovering Copy-Guided Attacks in Reasoning LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:27.843871Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.16773"},"observation_digest":"sha256:62234ece3029c240deb48c235b3b2b3db943174e71f60d6a253f7c3a1907f357","observation_id":"32d4999e-f949-4bcf-ba50-b84d03b796ca","resolution":{"observed_at":"2026-08-06T15:07:27.843871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T10:44:26.838066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23541","last_updated":"2026-07-28T08:43:59Z","snapshot_observed_at":"2026-08-07T20:39:01.921490Z","submitted_at":"2025-07-31T13:31:01Z","title":"Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:26.838066Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.23541"},"observation_digest":"sha256:046a00f987b2f6d5ad7dab05dfeaf5d07c2a8bfcd473c95790d9fcd25f4f56ce","observation_id":"2ee5efad-7c3b-49cb-b87e-062e32774c0e","resolution":{"observed_at":"2026-08-06T10:44:26.838066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:f1ed7c9e42dceecc53fb52285d70e5c91c709f20a54de573efe61b0be4c0de1c","observation_id":"4cccdf65-b86f-4eaa-8584-d24c5534aadb","resolution":{"observed_at":"2026-05-19T01:16:57.097300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2508.16745","last_updated":"2026-05-07T14:29:44Z","snapshot_observed_at":"2026-08-02T06:49:37.602255Z","submitted_at":"2025-08-22T18:57:08Z","title":"Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:49:26.966293Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2508.16745"},"observation_digest":"sha256:175c40b52f78c81e9e874fdaa3b5023fbc72edce8db0df52f0aebd449171cee8","observation_id":"d1ae46cd-7879-4233-b5ff-171a85413323","resolution":{"observed_at":"2026-05-18T20:51:50.809262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-04T10:53:08.022212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.022212Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:85ac5931826da516f34e4b82880992a95af53f58c6b93f9ce325d4a05ae8e173","observation_id":"7c481f30-7042-4931-9867-16411b6c3d47","resolution":{"observed_at":"2026-08-04T10:53:08.022212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:317c55dbe5b3823ca28af6c047d6372778b932d2eac386c559b3d2dcb73f3c52","observation_id":"86d251eb-e19e-42fc-aca2-e7b41d675a63","resolution":{"observed_at":"2026-05-18T05:20:54.606098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2512.07461","last_updated":"2026-05-14T12:43:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:39:43Z","title":"Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T01:11:26.411893Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2512.07461"},"observation_digest":"sha256:8bd9ba74ce6561e178608fd8c4354c62529e53fa57d4d009e4c8b0ed02d89363","observation_id":"f7fc2164-4bbc-444f-8172-de9b9d233944","resolution":{"observed_at":"2026-05-17T01:13:47.929498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.08299","last_updated":"2026-04-19T12:06:32Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:32:07Z","title":"SeLaR: Selective Latent Reasoning in Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T18:27:36.132030Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.08299"},"observation_digest":"sha256:97358eaca8cb7f6fbfe37998055854cd02099ede30dc3cbc2aa06f15a6546578","observation_id":"f81f4d0a-b7c7-4490-9bbc-57456cdccdf8","resolution":{"observed_at":"2026-05-11T00:35:49.556259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.16382","last_updated":"2026-03-25T20:54:12Z","snapshot_observed_at":"2026-08-03T07:36:56.480996Z","submitted_at":"2026-03-25T20:54:12Z","title":"LiFT: Does Instruction Fine-Tuning Improve In-Context Learning for Longitudinal Modelling by Large Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T00:13:44.570359Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.16382"},"observation_digest":"sha256:ae7832ba83da5510a8998703cc16f0f2be29c930c1ce95ed9ce28cad01800453","observation_id":"3fa2893a-9d5a-40d5-a0d3-b56879453ce5","resolution":{"observed_at":"2026-05-15T00:18:22.899179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:02aaf03f649dcb6224c69042dc37bc412b0d5921c98c5d8f163cc7e115322dc3","observation_id":"6a38efa3-6279-45c4-b446-85466f863fef","resolution":{"observed_at":"2026-05-11T14:16:06.034886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:f2f9665f552fba49317d07a6f529a1020d53739d1756f9437a2040f971a80261","observation_id":"94c2ee82-3972-41d2-9102-f160f9404b65","resolution":{"observed_at":"2026-05-10T06:26:27.797962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.05893","last_updated":"2026-05-07T09:03:49Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:03:49Z","title":"Logic-Regularized Verifier Elicits Reasoning from LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T10:54:01.229934Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.05893"},"observation_digest":"sha256:5a117eafb9cb1acaa6595e375d4de22387f5a604d3bc06a2226140848f13002e","observation_id":"d02a8372-ccfc-427e-8cbc-d60d3256639e","resolution":{"observed_at":"2026-05-11T19:51:10.941397Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.08221","last_updated":"2026-05-06T13:58:55Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T13:58:55Z","title":"NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:40.815981Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.08221"},"observation_digest":"sha256:b92d3a6bb1ae5dbdfd8ee7c54f5cb3d36496ec15a4811a49f57f221130a7e659","observation_id":"dda6e555-6545-49a4-8474-436f8a5da3d9","resolution":{"observed_at":"2026-05-12T08:41:24.258184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-02T08:39:07.747479Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:5e7e01df584570574bb8794eb081ea7d46ebcf2c0c5b4cb7b10241e8d0fe3d60","observation_id":"d6d976ea-a5e7-40f6-8fe6-1d56bae82ff5","resolution":{"observed_at":"2026-05-13T01:57:06.061818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.11746","last_updated":"2026-05-12T08:24:47Z","snapshot_observed_at":"2026-08-03T19:32:09.592136Z","submitted_at":"2026-05-12T08:24:47Z","title":"When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:30:12.558660Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.11746"},"observation_digest":"sha256:579926d88ebda1ee74a9803e9031b5fdf5e72c45742c50bc62dfed7ec6fc21ca","observation_id":"c81a34d1-d755-4ac4-914f-1d137bb1437d","resolution":{"observed_at":"2026-05-13T06:32:24.335451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T11:29:31.754741Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-08T16:37:02.317008Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-02T11:29:31.754741Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2606.14502"},"observation_digest":"sha256:5980419723ca72f126253d3af45021f84cd6b2597e3484b4e594e2ae77df8cb8","observation_id":"9a1e33e8-a197-49ed-ae07-e9a23d3c2147","resolution":{"observed_at":"2026-08-02T11:29:31.754741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2403.04642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1c5adb8ff9aff10503e816e7afa2ec87735fc0d929f2ceef9dc300dd1b89706a","observation_id":"40d461bd-51fb-4411-a91d-074baac150f9","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T08:40:36.004785Z","title":"arXiv preprint arXiv:2403.04642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.004785Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b77584e872b7d1e9cd14f70c91d72d0acda73c96d013efabdea31efca0c19777","observation_id":"15e17f8c-3d1d-4117-a752-b61ea7913795","resolution":{"observed_at":"2026-08-02T08:40:36.004785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T13:26:28.373498Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18266","last_updated":"2026-05-21T15:50:29Z","snapshot_observed_at":"2026-08-07T22:53:32.484235Z","submitted_at":"2026-05-21T15:50:29Z","title":"Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T13:26:28.373498Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.18266"},"observation_digest":"sha256:9d14bde48f1ca199cf1acb5575125e337636b2a0e166666df572c308204c16c0","observation_id":"58f57867-c9d6-4227-84b9-37c8ca272be2","resolution":{"observed_at":"2026-08-02T13:26:28.373498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T06:32:19.440448Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:19.440448Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:e74f55aa59c72d0343797f0dad061cf8463eedb150c30c0adfb7ca1b35eb12f5","observation_id":"d3178038-8e0d-482d-b8e8-4a088c93762d","resolution":{"observed_at":"2026-08-01T06:32:19.440448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T07:34:56.790463Z","title":"arXiv preprint arXiv:2403.04642 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.790463Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d7446500be9d3570e3cbd4033ed8fa2f2ea376ed64fcfb60e741f0bb81624c3c","observation_id":"46f0c937-c1c1-42b7-b42e-7b9169cd431c","resolution":{"observed_at":"2026-08-01T07:34:56.790463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T00:57:34.320933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25996","last_updated":"2026-07-28T17:12:41Z","snapshot_observed_at":"2026-08-08T13:45:03.380671Z","submitted_at":"2026-07-28T17:12:41Z","title":"RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:57:34.320933Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.25996"},"observation_digest":"sha256:f975209bd8f4e891990497793131ef9d1abcce26d158ac9c42f54ca4c4278ccd","observation_id":"639afc79-1014-4fc7-896c-13a2914bd6db","resolution":{"observed_at":"2026-08-01T00:57:34.320933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-05T15:25:40.180493Z","title":"Teaching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03644","last_updated":"2026-08-04T13:29:00Z","snapshot_observed_at":"2026-08-08T18:58:23.959751Z","submitted_at":"2026-08-04T13:29:00Z","title":"Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:40.180493Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2608.03644"},"observation_digest":"sha256:cb1263d3fb56b89f9a1984146752a32519d4a67f865b71a6fe68e2f97f56be34","observation_id":"3b9c5573-8ad2-4bc5-88c1-ea212ae184dc","resolution":{"observed_at":"2026-08-05T15:25:40.180493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.04642/citation-record","integrity":"/paper/2403.04642/integrity","json":"/paper/2403.04642/citation-record.json","paper":"/paper/2403.04642"},"outbound":[],"paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2403.04642."}