{"as_of":"2026-08-09T18:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9410a2041423e5675c74f148dd88d6f2c70b6d89516911c766a54f112c50ae9","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:42:06.520147Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06024/citation-record","integrity":"/paper/2509.06024/integrity","json":"/paper/2509.06024/citation-record.json","paper":"/paper/2509.06024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.155669Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.155669Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9a82276757a22a5053ad5a060d02a08d6181f736c11440a65602b77302bb41a7","observation_id":"22cd9d77-5bc3-43bf-9b6e-012dd366a55d","resolution":{"observed_at":"2026-08-05T04:42:05.155669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.213407Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.213407Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:1b81e2540b71c0bc2fe657c0932d04cea5b5919eca87494c7abc2dda3fac3069","observation_id":"2c9f5930-0553-42f5-9e99-0b969903eda9","resolution":{"observed_at":"2026-08-05T04:42:05.213407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T04:42:05.231836Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.231836Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7f506c4fee3e2c20aa8f08c2ba5b029a861e856793e40609829203fe4134f40e","observation_id":"c27a294e-71ce-4d0c-af54-188db47e8299","resolution":{"observed_at":"2026-08-05T04:42:05.231836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14851","last_updated":"2025-05-09T05:26:43Z","snapshot_observed_at":"2026-07-06T20:25:49.871084Z","submitted_at":"2025-01-24T15:49:10Z","title":"JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14851","snapshot_observed_at":"2026-08-05T04:42:05.339231Z","title":"Justlogic: A comprehensive benchmark for evaluating deductive reasoning in large language models.arXiv preprint arXiv:2501.14851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.339231Z"},"links":{"cited_paper":"/paper/2501.14851","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2c86f654fd7aa7fe210513a5dbf3a0cd457e938410aa855d402294ad94e53406","observation_id":"69fdc157-bbdc-465c-b495-18e1571d5675","resolution":{"observed_at":"2026-08-05T04:42:05.339231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15652","last_updated":"2025-07-21T01:15:52Z","snapshot_observed_at":"2026-08-08T11:24:13.510948Z","submitted_at":"2025-02-21T18:20:35Z","title":"Empowering LLMs with Logical Reasoning: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15652","snapshot_observed_at":"2026-08-05T04:42:05.386445Z","title":"Empower- ing llms with logical reasoning: A comprehensive survey.arXiv preprint arXiv:2502.15652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.386445Z"},"links":{"cited_paper":"/paper/2502.15652","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:599619e7c060abcfed5a1a942b39fd9eadef96f565c602aac920579042dd0aeb","observation_id":"7e793c40-6723-4edc-a07b-443d5e24281c","resolution":{"observed_at":"2026-08-05T04:42:05.386445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.790620Z","title":"Self- playing adversarial language game enhances llm reasoning.Advances in Neural Information Processing Systems, 37:126515–126543, 2024","venue":null,"work_id":"ac303a56-4213-4517-9eba-57ea9a5e9fd4","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.458658Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:f942b8a1a0a9f31c64d721d55a2c55f347ec2e6897f7aa24305b7728c586e7f8","observation_id":"212bd76f-6364-41ed-ac58-8ef82c2f2f98","resolution":{"observed_at":"2026-08-05T04:42:07.796428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05867","last_updated":"2020-05-05T17:33:38Z","snapshot_observed_at":"2026-08-07T18:32:48.669874Z","submitted_at":"2020-02-14T04:23:28Z","title":"Transformers as Soft Reasoners over Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05867","snapshot_observed_at":"2026-08-05T04:42:05.511121Z","title":"Transformers as soft reasoners over language.arXiv preprint arXiv:2002.05867, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.511121Z"},"links":{"cited_paper":"/paper/2002.05867","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:cf4f24261453dee4e09904ad3f117367e9ec0da3e4f1c46ffbdf1a01f68749cd","observation_id":"0e1d43cc-a800-41fa-9bd3-ba158b18055a","resolution":{"observed_at":"2026-08-05T04:42:05.511121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T04:42:05.571433Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.571433Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c157181d321f3e97944cb0ab2f3545677682d5cf15c8f4d558979affc23753fd","observation_id":"0a96dd2b-7f59-414c-b992-b6f92d214188","resolution":{"observed_at":"2026-08-05T04:42:05.571433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.669140Z","title":"Gemini 2.0 flash thinking, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.669140Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2d65ba3fa2ec2082ba8e542b2b6fc8356565596ff72a47aab507fd6ceda0087d","observation_id":"09d5c820-15d6-4f1a-9671-70f7e1198aab","resolution":{"observed_at":"2026-08-05T04:42:05.669140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T04:42:05.728700Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.728700Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:4942c0fd0075d955ce3e8f6f4291b66da26d92a0ac6fc441b23f9379c8c55079","observation_id":"5269d331-add4-4aea-a46d-b61819dccfba","resolution":{"observed_at":"2026-08-05T04:42:05.728700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:05.798953Z","title":"Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies.Transactions of the Association for Computational Linguistics, 9:346–361, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.798953Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:1b4064b175f2b00a021bd46146600ea01ff242e5aa27bbaa733b5154d08c95ad","observation_id":"9a8ec324-7c9d-4337-b5a0-2ec0abbe9e96","resolution":{"observed_at":"2026-08-05T04:42:05.798953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-05T04:42:05.864107Z","title":"Logicgame: Benchmarking rule-based reasoning abilities of large language models.arXiv preprint arXiv:2408.15778, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.864107Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:3fdef760e96f316502b0eaed474e122610e5a47462e38d5fb1f9f2a0fc1689c1","observation_id":"e546555a-3bc0-4ed5-b677-ec87a70695d5","resolution":{"observed_at":"2026-08-05T04:42:05.864107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T04:42:05.932027Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:05.932027Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:1497689f0c1c00fc0cb8694649f1e3f1204d68eb006422377961a1d28f0adcbe","observation_id":"bcd6ed91-71c9-4de7-b825-c40330044a9d","resolution":{"observed_at":"2026-08-05T04:42:05.932027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-09T17:25:13.891240Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-05T04:42:06.003231Z","title":"Folio: Natural language reasoning with first-order logic","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.003231Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:f8e1853419a4aa3c91d0e9da1a00497dc4eaf336d7e63ad84cbd8b681e8039e3","observation_id":"c1d3bab2-ec8e-4b06-b5ea-c4ff44d58900","resolution":{"observed_at":"2026-08-05T04:42:06.003231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.068109Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.068109Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:e1160659014769ab444f16fcfdd3cf3043eb9e7cba6f190d7c3da08ca74783c5","observation_id":"a19a564f-598b-4599-a236-031e91b38bdf","resolution":{"observed_at":"2026-08-05T04:42:06.068109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-05T04:42:06.155144Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.155144Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:cf90cef26d9a0deba534f040854425fcbe33160b35b3226e045e97c2c9d82275","observation_id":"355d0c2c-b29a-472a-a57c-407d9fa9959e","resolution":{"observed_at":"2026-08-05T04:42:06.155144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04585","last_updated":"2025-04-20T05:49:38Z","snapshot_observed_at":"2026-07-06T19:28:43.743447Z","submitted_at":"2024-10-06T18:46:28Z","title":"Reasoning-Enhanced Healthcare Predictions with Knowledge Graph Community Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04585","snapshot_observed_at":"2026-08-05T04:42:06.221502Z","title":"Reasoning-enhanced healthcare predictions with knowledge graph community retrieval.arXiv preprint arXiv:2410.04585, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.221502Z"},"links":{"cited_paper":"/paper/2410.04585","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5ee7c3fa459da09b3d73c77227385e5e1d75856007a3d3399ebdcbd062cff90f","observation_id":"18da2e70-102c-4c7f-8c81-4fd3f7fa4496","resolution":{"observed_at":"2026-08-05T04:42:06.221502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.718521Z","title":"Boardgameqa: A dataset for natural language reasoning with contradictory information","venue":null,"work_id":"39365a33-e88b-4680-a3a5-ae3df30dd675","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.241979Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7eb66d446672944327d4dfbab2187725bdf9de5203947dd4f3e465f329db56b8","observation_id":"6442c8e8-9681-4416-9224-33767f2bbff7","resolution":{"observed_at":"2026-08-05T04:42:07.734162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.697619Z","title":"Buy 4 REINFORCE samples, get a baseline for free! In Deep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019","venue":null,"work_id":"d58a4469-1f5f-4d2d-9797-639d108e579b","year":2019},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.247220Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7e8112772a67e6ed3c1923e204dc797e0a6b461f0bc37b2a572baa59de4a2f28","observation_id":"2922c9ec-3339-4875-bddc-725e62d6c14e","resolution":{"observed_at":"2026-08-05T04:42:07.704465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.670878Z","title":"Chain of code: Reasoning with a language model-augmented code emulator","venue":null,"work_id":"17bbc1e1-5bf5-4c16-8fb5-71e75ac70b47","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.254413Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:67c6a61d0c13127fd33c6cc776df7ef0a92e4df1ff037da4722ee9ceafe83f07","observation_id":"ee6cc1d8-bbdd-4b9b-9e66-7843aa934929","resolution":{"observed_at":"2026-08-05T04:42:07.678037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07316","last_updated":"2025-05-21T13:38:27Z","snapshot_observed_at":"2026-08-09T12:20:15.885014Z","submitted_at":"2025-02-11T07:26:50Z","title":"CodeI/O: Condensing Reasoning Patterns via Code Input-Output Prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07316","snapshot_observed_at":"2026-08-05T04:42:06.261278Z","title":"Codei/o: Condensing reasoning patterns via code input-output prediction.arXiv preprint arXiv:2502.07316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.261278Z"},"links":{"cited_paper":"/paper/2502.07316","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:835683532477ace367b70e714c8648e20825848bdc39964ecbcd5e871c4d9a0e","observation_id":"03c8f9e5-1a42-40d5-b2da-16e5218e12b3","resolution":{"observed_at":"2026-08-05T04:42:06.261278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.266810Z","title":"Limr: Less is more for rl scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.266810Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5d662c95e52cc6aa6d07ddf62e51c1cf6c90ea47e8d43fa970406e498960ca77","observation_id":"0a7f6c22-c1a8-4074-a35e-e00a8c6b8587","resolution":{"observed_at":"2026-08-05T04:42:06.266810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.639824Z","title":"From system 1 to system 2: A survey of reasoning large language models, 2025","venue":null,"work_id":"ab8f18ac-7b22-4e74-a242-fea44d14886d","year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.271252Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8cfa085ed425144c50768fc57777c1e57e2f028e0eb390c7ac74716c1aa20dba","observation_id":"c4c61012-3a83-4b03-9eea-bf583e5e64ee","resolution":{"observed_at":"2026-08-05T04:42:07.644307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-09T16:32:38.768816Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-05T04:42:06.276239Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning.arXiv preprint arXiv:2502.01100, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.276239Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9ab204ce66c0763cdca0c6dfca13a73dcf1f4783403da483b3a27def98475cc2","observation_id":"29969c6a-139c-4e09-a049-55ed9bb828c8","resolution":{"observed_at":"2026-08-05T04:42:06.276239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.622105Z","title":"Natural language inference in context-investigating contextual reasoning over long texts","venue":null,"work_id":"5aa94114-9df0-4b04-9de3-f75d24518e5b","year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.280844Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:92961a6cb6f97d2c7d87979768afebaaead8a5162f8c7f77a1b9d7cfc99806a9","observation_id":"8423668f-70ee-447b-833a-9dee553df8a4","resolution":{"observed_at":"2026-08-05T04:42:07.628502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.605718Z","title":"Logiqa 2.0—an improved dataset for logical reasoning in natural language understanding.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:2947–2962, 2023","venue":null,"work_id":"906621f6-65c9-40bb-8e83-75acdf167aa5","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.285793Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:01bc90e17489ac2af88e2bc7959c7a8cd422e2a0396a1d534c395831ccb216bf","observation_id":"3e1a4b64-531c-4654-89b3-9a8337c56d83","resolution":{"observed_at":"2026-08-05T04:42:07.610533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.587785Z","title":"大模型逻辑推理研究综述 (survey on logical reasoning of large pre- trained language models)","venue":null,"work_id":"2133bec2-ed05-41df-b5d4-3c1faa6caa39","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.291168Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:534e988649a7726c19cbcf57ec6819f4f9ebd849108a7f8becfb9105e00b6e3c","observation_id":"95a44259-4307-4cc3-8ac1-b9ac02df23cf","resolution":{"observed_at":"2026-08-05T04:42:07.593555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-09T06:25:20.879304Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-05T04:42:06.296264Z","title":"Logiqa: A challenge dataset for machine reading comprehension with logical reasoning.arXiv preprint arXiv:2007.08124, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.296264Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5a307ff9126970c2f3e8a56525449016b6574e35191f88122995098a58fc26fb","observation_id":"273438f4-5775-49f5-885a-3fef33514fc5","resolution":{"observed_at":"2026-08-05T04:42:06.296264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.302217Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.302217Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:f35d3ffe2b18a5aefc847b5574665c305e00674afb8ce9006b3af0000a9e4477","observation_id":"6b5f3609-3501-456a-943d-3574cbc9e3f6","resolution":{"observed_at":"2026-08-05T04:42:06.302217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.555036Z","title":"Reasoning with large language models for medical question answering.Journal of the American Medical Informatics Association, 31(9):1964–1975, 2024","venue":null,"work_id":"9ebccaeb-741a-466d-8fea-c068dc9729a9","year":1964},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.310288Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d89f893de2918ced761edff316469aa24bd41e6297e4f9aa4ae0579818b0fdf8","observation_id":"8e4789af-807a-449b-9d8d-a0c69a8ccd72","resolution":{"observed_at":"2026-08-05T04:42:07.560070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.537257Z","title":"Improve mathematical reasoning in language models by automated process supervision, 2024","venue":null,"work_id":"50fb517a-80d4-4a38-acdc-f2d809a362e5","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.316399Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d220989b1542bc4d280c73ea36937bf0e6053e9e6e7730cd1e324275a253ca09","observation_id":"1e5db605-f610-426a-a1aa-ccd084413474","resolution":{"observed_at":"2026-08-05T04:42:07.543417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.320941Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.320941Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d7904813bc1f45f739025f90768b3ca78e534dc51a00530fd8ec3c386c016e83","observation_id":"8ca36034-17c8-4859-8c4b-7a18a21a1959","resolution":{"observed_at":"2026-08-05T04:42:06.320941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.325245Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.325245Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:6d281af85116588f382206224c5c1a1dfc8bf286f630bf9be2d8dbde1220e6f3","observation_id":"a64b2246-ff11-42ec-b052-3c2b371c4d6d","resolution":{"observed_at":"2026-08-05T04:42:06.325245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.481332Z","title":"Enhancing reasoning capabilities of llms via principled synthetic logic corpus.Advances in Neural Information Processing Systems, 37:73572–73604, 2024","venue":null,"work_id":"95a344c9-21e2-47e0-9a45-ebeb3253fdb8","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.329775Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:8edb6b584b4780ff614425bd059996d19b1713fd8573fbf423604a69f819e912","observation_id":"89658dd5-f79b-4562-8d19-88c8603d5be1","resolution":{"observed_at":"2026-08-05T04:42:07.489665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.460211Z","title":"Advanced semantics for commonsense knowledge extraction","venue":null,"work_id":"e0fbb3d0-22be-4560-ac0b-fc5418f36e47","year":2021},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.334589Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c77ab1b3c3c59391b1986a2e5b5b6924aaccfc8a55a5bf223bf9296c8fe8f13c","observation_id":"9965ee69-3d72-4e05-9625-12449474ce55","resolution":{"observed_at":"2026-08-05T04:42:07.465259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.340441Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.340441Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:9c8f74e62004bcc21b596d9993b0e840e64f61a0970ed33109f63eaeda2b0510","observation_id":"a2abe552-b684-461c-8ee6-e02b32a85bb3","resolution":{"observed_at":"2026-08-05T04:42:06.340441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.345622Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.345622Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:fdabd730313abbfa09493f58f37ddc7c7c0cb05481ba86a59503b1358007dbd4","observation_id":"a124621e-0d8f-45cd-878f-6db8f00f9a15","resolution":{"observed_at":"2026-08-05T04:42:06.345622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.416190Z","title":"Making reasoning matter: Measuring and improving faithfulness of chain-of-thought reasoning","venue":null,"work_id":"1bd53f35-6b66-48b6-8483-2c80e6bc5c5e","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.350765Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:943f2c61dc6253057ac133bf4b38b45e5a33a642bc793052f8a861e82aed474f","observation_id":"36668151-2c8f-4385-8f61-4c85f13e2149","resolution":{"observed_at":"2026-08-05T04:42:07.421265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.355048Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.355048Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:25a4b429cb9b9fbe11635162df04e756d763f997afd35bd8dba80bc2c17bf51b","observation_id":"c84e8efc-0eb1-408a-b7e6-609ab6f1ef72","resolution":{"observed_at":"2026-08-05T04:42:06.355048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.361130Z","title":"Qwq-32b: Embracing the power of reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.361130Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d73fc7da8cbe47a23c41bc5442e5007e6c274faf1c57e8030fdee4248ae0ae69","observation_id":"bfc4097e-25ec-4b96-a47e-faf186ca7e4d","resolution":{"observed_at":"2026-08-05T04:42:06.361130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-07-06T13:59:15.998573Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-08-05T04:42:06.366029Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought.arXiv preprint arXiv:2210.01240, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.366029Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:5dcb32e2b83a913b4470f789a289e4e7efe4860b54958caa8b18a857c578211c","observation_id":"e8703507-c9af-4c01-8e63-1957d0e91145","resolution":{"observed_at":"2026-08-05T04:42:06.366029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.375987Z","title":"Testing the general deductive reasoning capacity of large language models using ood examples.Advances in Neural Information Processing Systems, 36:3083–3105, 2023","venue":null,"work_id":"fdf633af-3448-4112-b33f-94537da06be0","year":2023},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.371099Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:f1172cb49f1725c54008531d1266f49b850aef804b9d15002303b73f842643fb","observation_id":"b0f0895b-9acb-461c-9d78-6c8844fc20b8","resolution":{"observed_at":"2026-08-05T04:42:07.381247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.375876Z","title":"High-dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.375876Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:09b2c9c45d5fc1095e2238310941ba4d701a118a1ee5ecd6b10d5bfffd059b31","observation_id":"53e22eda-0e18-4252-9fd6-6c8b7321b991","resolution":{"observed_at":"2026-08-05T04:42:06.375876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.380438Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.380438Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:a0d76aa666e46638954ca6ff84a3af0256056a6f400df7badc5408f221f6daf0","observation_id":"4665d72d-0ab1-45b7-9720-a7522d293317","resolution":{"observed_at":"2026-08-05T04:42:06.380438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.327263Z","title":"Automatic solutions of logic puzzles","venue":null,"work_id":"1f1ab41d-8f3d-4057-90dd-ade30e1626f4","year":2009},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.384947Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c91252db8842e1dce0315f68efde2658e483a9cc0d7b155253610a486d396f55","observation_id":"76bf7573-9660-4de6-b51b-193c6c08f8cc","resolution":{"observed_at":"2026-08-05T04:42:07.332435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T04:42:06.390455Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.390455Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2d5cdc02d3b79b390059f1714481b8ec00483bb8b028578bb363f0cf5c4901d8","observation_id":"e2a07ee8-ad48-43d5-bdb8-7c983b3c3e7d","resolution":{"observed_at":"2026-08-05T04:42:06.390455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02508","last_updated":"2025-06-16T03:29:47Z","snapshot_observed_at":"2026-08-09T11:50:28.856427Z","submitted_at":"2025-02-04T17:26:58Z","title":"Satori: Reinforcement Learning with Chain-of-Action-Thought Enhances LLM Reasoning via Autoregressive Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02508","snapshot_observed_at":"2026-08-05T04:42:06.395257Z","title":"Satori: Reinforcement learning with chain-of-action-thought enhances llm reasoning via autoregressive search.arXiv preprint arXiv:2502.02508, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.395257Z"},"links":{"cited_paper":"/paper/2502.02508","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7298971bbbb446d043c6498726f45a51874a29ea680a091556f88e3eb9b941be","observation_id":"d3877bd5-b1fc-4b05-8349-1711b53a8446","resolution":{"observed_at":"2026-08-05T04:42:06.395257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-01T16:38:42.947080Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-05T04:42:06.402593Z","title":"To cot or not to cot? chain-of-thought helps mainly on math and symbolic reasoning.arXiv preprint arXiv:2409.12183, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.402593Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:184a0b5261a6302b18f197c7300d8fa4e85fd3daa2837de113dfd9c1b97f35d1","observation_id":"8531279f-7ae6-4beb-933a-c0eb75e3c785","resolution":{"observed_at":"2026-08-05T04:42:06.402593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.408266Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.408266Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:3909ec67eca73130a3ab76e92bc75e81da966a5f715a35d905d4aa8964f70b96","observation_id":"f8b7f272-204d-465c-a1aa-7444d57cf1f9","resolution":{"observed_at":"2026-08-05T04:42:06.408266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T04:42:06.413231Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.413231Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:b449d286d90b5e8f3a5b07b61aeb57f53ee093575b520153eba0cbedbbc76df6","observation_id":"c3f4937f-ea0b-4334-a053-bd4aaf3d7510","resolution":{"observed_at":"2026-08-05T04:42:06.413231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14790","last_updated":"2024-10-04T04:58:12Z","snapshot_observed_at":"2026-07-06T18:49:25.288816Z","submitted_at":"2024-07-20T07:43:07Z","title":"Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?","version":2},"cited_work":{"arxiv_id":"2407.14790","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14790","snapshot_observed_at":"2026-08-05T04:42:06.618084Z","title":"Step-by-Step Reasoning to Solve Grid Puzzles: Where do LLMs Falter?","venue":"cs.CL","work_id":"0a1d010d-e125-4202-af0d-3370fa6d816b","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.419474Z"},"links":{"cited_paper":"/paper/2407.14790","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:a12a24582fa52c86ff21713114289254e4dd25297cf2eb2676528ac00ec8d4df","observation_id":"dad3b24a-8875-480f-9a86-f853f97c303b","resolution":{"observed_at":"2026-08-05T04:42:06.625878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.297134Z","title":null,"venue":null,"work_id":"9f095218-93f8-4215-9349-19af41c670b0","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.424640Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:d0c344e94dc1f76a0dfbec439443e09a215c8715874829f3162e977b5f498e90","observation_id":"c0cf8e43-d49e-4adf-a9be-78609e07433b","resolution":{"observed_at":"2026-08-05T04:42:07.302087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.429383Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.Advances in Neural Information Processing Systems, 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.429383Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:21d866d766d08c395196f1c4d5faf726d49f01a21f2ba71816d38cb63d3ea011","observation_id":"d9c6894b-eabb-43b7-9ca1-1543ab1a513c","resolution":{"observed_at":"2026-08-05T04:42:06.429383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.257484Z","title":null,"venue":null,"work_id":"ea6829f2-0a05-4b18-88dc-5840bea03a47","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.435873Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7519c15550a83b24721099b788c4e766ed3b66d9fd9aaf34857ba10558fb6580","observation_id":"543ede4a-f228-40e4-8e54-4343af2b16e0","resolution":{"observed_at":"2026-08-05T04:42:07.263273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.239471Z","title":"Legalreasoner: A multi-stage framework for legal judgment prediction via large language models and knowledge integration","venue":null,"work_id":"3699f55f-682b-4f38-b79b-5c0db25baf25","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.440662Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:7738d2857de0548a0ccc1249ab4876f04f62e3acf36ff8e0c55b532d666d3822","observation_id":"71bd38f1-573f-4554-bff1-6b107809ad40","resolution":{"observed_at":"2026-08-05T04:42:07.244773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.445735Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.445735Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:3a66cb1bd8665c9ff689ac68cbcca82445f36cc0254e50aad8c941c089578362","observation_id":"8ce955bc-2e1d-48be-a995-f1f6c09e22ea","resolution":{"observed_at":"2026-08-05T04:42:06.445735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.210874Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":"af7ad4f3-4b4f-41eb-a232-f8a95b3f0274","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.450159Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:b8b00827c915a0da5e1395a83bff8021dddf7f46c52755b560acf08bad24aaf8","observation_id":"2c2e16b8-680b-44d5-8e29-414d7bb94455","resolution":{"observed_at":"2026-08-05T04:42:07.216188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.455832Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.455832Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:23f1b7eb813fb304f4051143fde0cf9df390641ebb1f1509cc3e7bdabddb76b6","observation_id":"36449521-a3f2-453d-a8b9-af3ee859ceb8","resolution":{"observed_at":"2026-08-05T04:42:06.455832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T04:42:06.460031Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.460031Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:194a00a16381c916e15233adc5db65ed7740b3a75ffaec15cdf698d32e68610c","observation_id":"94806828-92e3-4d58-bd00-648bf406b4d7","resolution":{"observed_at":"2026-08-05T04:42:06.460031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.464464Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.464464Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:4887d9984e44f1847b351aed0e5423fe6efcf3571e40f11b7b7c5c909b6a65f5","observation_id":"95b6e9fb-a1bd-4f56-8651-e9a10cae643d","resolution":{"observed_at":"2026-08-05T04:42:06.464464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.168725Z","title":"Lawllm: Intelligent legal system with legal reasoning and verifiable retrieval","venue":null,"work_id":"30927bc6-8f69-4fd5-b4c5-e515d1d6912c","year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.469293Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:43b034896f9debbe56004966e0efbccfd10894f89b20942728a004ca780b1882","observation_id":"652cb997-1e1d-4751-bc58-5e4b95ddbf04","resolution":{"observed_at":"2026-08-05T04:42:07.174320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:06.474025Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.474025Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:87376465fd6d494a8f01cd8c33b2ee389c70062e403f45b131af7b661b4e3dbe","observation_id":"a2e9bfbd-2315-4212-ae65-7a9fcd6943c1","resolution":{"observed_at":"2026-08-05T04:42:06.474025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-04T20:04:21.125115Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-05T04:42:06.478842Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.arXiv preprint arXiv:2406.03816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.478842Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:574b12597db0ae3a09a7a82c6a210aa85cedddd71644dd72fd8677e6e29a155f","observation_id":"4404c5fd-2fa1-423a-a3b1-419b3d1c9fc1","resolution":{"observed_at":"2026-08-05T04:42:06.478842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.130156Z","title":"R1-reward: Training multimodal reward model through stable reinforcement learning, 2025","venue":null,"work_id":"ac909891-a20c-459f-9d68-e0182a9f4658","year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.485081Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:c80410200e3eb375b9682cf1b82e26f52ab9cd6a4e36e57afa0d69ba23067a29","observation_id":"cb0d3350-691f-4d83-82e6-406ba2ede228","resolution":{"observed_at":"2026-08-05T04:42:07.136777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16906","last_updated":"2025-02-24T07:02:31Z","snapshot_observed_at":"2026-08-07T17:54:07.006732Z","submitted_at":"2025-02-24T07:02:31Z","title":"AutoLogi: Automated Generation of Logic Puzzles for Evaluating Reasoning Abilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16906","snapshot_observed_at":"2026-08-05T04:42:06.489294Z","title":"Autologi: Automated generation of logic puzzles for evaluating reasoning abilities of large language models.arXiv preprint arXiv:2502.16906, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.489294Z"},"links":{"cited_paper":"/paper/2502.16906","citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:087b16966c29d63ea7e5eeaa8d40fed652edabf59614d53842eb7295d8b5d4ce","observation_id":"921924ed-5215-4ebe-ba12-99a806a60fa3","resolution":{"observed_at":"2026-08-05T04:42:06.489294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.110190Z","title":null,"venue":null,"work_id":"a2eae4fa-ce1d-4e36-ae63-8dc41c71d061","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.495133Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0ee2d256f66302f740eecacfe61bce167f64d189923764bbd5c438219a275b2c","observation_id":"d8179a4a-a3d1-4047-9b5b-e87933e7816b","resolution":{"observed_at":"2026-08-05T04:42:07.115497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.083463Z","title":null,"venue":null,"work_id":"ccdfd23b-2897-4d02-8fc4-00dd60a1ce4d","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.500166Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:bf244106a6d87da8a4079e637f71652857747ad07ec589869f48ae9ff002a2b2","observation_id":"031ed804-4040-4d9e-b669-bb1e4e812f50","resolution":{"observed_at":"2026-08-05T04:42:07.090966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.064458Z","title":null,"venue":null,"work_id":"07e523fc-7960-4ecd-a656-be8e6ee8546e","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.504954Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:bc2cfbb4ea43fd1e836ca090cb2aa5e4fe7043dff75166a6b9ec3117ade97fbd","observation_id":"0c848a07-871c-470a-92bc-4a2048ff9b50","resolution":{"observed_at":"2026-08-05T04:42:07.069307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.044749Z","title":null,"venue":null,"work_id":"4367c484-386e-402a-b6f7-5e62f2818776","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.510163Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:2f072aa937a262a62bf07a80af35f8d65358a4ab000dbdecba07a4ba10f90df1","observation_id":"63fdc848-2390-47ce-b156-8f6f6ed1cfdf","resolution":{"observed_at":"2026-08-05T04:42:07.050266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.025586Z","title":null,"venue":null,"work_id":"ba3cf461-7f32-4532-8fc3-c4c544a44329","year":null},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.515259Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:0ea63f548edc0bd403aef51bceb08f4babcd96e6af380eaa6dc1f3c0c0e50cec","observation_id":"e0dcc09d-4cc0-470b-9de8-7480d9989c85","resolution":{"observed_at":"2026-08-05T04:42:07.031013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:42:07.006819Z","title":"Alice studies","venue":null,"work_id":"64cdae06-55ba-4934-9e7c-2928263b18d3","year":2022},"citing_paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T04:42:06.520147Z"},"links":{"citing_paper":"/paper/2509.06024"},"observation_digest":"sha256:82cac3b60fba2e2ac6a0e6ec4ae833716c257f51cd3c49ab06b066e4d14da38a","observation_id":"5ceff70f-fa52-4110-b4aa-9ba3b33e5eb8","resolution":{"observed_at":"2026-08-05T04:42:07.011688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06024","last_updated":"2025-09-07T11:52:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T03:19:32.912528Z","submitted_at":"2025-09-07T11:52:18Z","title":"Rethinking Reasoning Quality in Large Language Models through Enhanced Chain-of-Thought via RL"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2509.06024."}