{"as_of":"2026-08-19T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e537bd9d9ab83bde20f38c639899ca8d065c5f10301074bfda611acccbb3c7c0","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:52:57.142548Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.21909/citation-record","integrity":"/paper/2601.21909/integrity","json":"/paper/2601.21909/citation-record.json","paper":"/paper/2601.21909"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:52.404126Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.404126Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:6211a455d4947bf3aaef4ab7d0960e58c90572873e82c48d146feb93c5eb5623","observation_id":"03949154-0246-4626-8627-8107394126c9","resolution":{"observed_at":"2026-08-03T06:52:52.404126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-16T14:22:43.713388Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-08-03T06:52:52.486546Z","title":"Large language models for mathematical reasoning: Progresses and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.486546Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:f2fddec2d784e8573084c4d5368467fe565a64cc99a79eef6ec61c2f9e65781c","observation_id":"d299b128-0f29-4165-b051-41baea0c6acf","resolution":{"observed_at":"2026-08-03T06:52:52.486546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:52.557446Z","title":"T., Feltovich, P","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.557446Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:ce034a23ce5ec73bcd9b01557922843070c466cfb26427ba25a548c7498d6399","observation_id":"597b6f69-0fa5-4b2c-a2ba-c6d6f82b2314","resolution":{"observed_at":"2026-08-03T06:52:52.557446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-03T06:52:52.660916Z","title":"V., Levine, S., and Ma, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.660916Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:ceb574f4c9b2a77bac394dbe5df00686d6df70ca3a9620e89ffe11095add18be","observation_id":"0adb5e2d-88aa-4787-bc8d-36d6c8ffda88","resolution":{"observed_at":"2026-08-03T06:52:52.660916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T06:52:52.737461Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.737461Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:bb9e98d86a599eeba6f790d570774b08ab0f651677a5b2a0b27c8be1a72a44b6","observation_id":"824797b2-2eab-49ae-887d-e0890fd45205","resolution":{"observed_at":"2026-08-03T06:52:52.737461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:52.808175Z","title":"Supervised reinforcement learning: From expert trajectories to step-wise reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.808175Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:3d09da72fb8a684cb9d5a9d68ea1ee2b054d41c0df94e14942f57815733e91f4","observation_id":"fd41cb3a-75b2-4c37-9399-d6b65ca77288","resolution":{"observed_at":"2026-08-03T06:52:52.808175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:52.870407Z","title":"Theory-based causal transfer: Integrating instance-level induction and abstract-level structure learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.870407Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:5fa000dc651d695f1856f50fbf0b44fc32faf89d3821c6a1beee1ac6dc6cc181","observation_id":"73c088e9-c972-4317-a839-67884c173e3d","resolution":{"observed_at":"2026-08-03T06:52:52.870407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.10435","last_updated":"2023-01-27T15:30:27Z","snapshot_observed_at":"2026-08-12T07:50:34.802331Z","submitted_at":"2022-11-18T18:56:13Z","title":"PAL: Program-aided Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.10435","snapshot_observed_at":"2026-08-03T06:52:52.931921Z","title":"Pal: Program-aided language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.931921Z"},"links":{"cited_paper":"/paper/2211.10435","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:98f93302bcf04e45ad9f07a030efa1743a642f621c7205210aa6d50714d1ab46","observation_id":"df9b6a1c-a1b5-441b-9afe-7731a3d85953","resolution":{"observed_at":"2026-08-03T06:52:52.931921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:52.993653Z","title":"Structure-mapping: A theoretical framework for analogy","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:52.993653Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:3f23e8d07dd680c8837915d54602d399fbbcaad4c6576c5f15408062f3f44701","observation_id":"881a0dfa-63aa-45f2-b32b-e6a75935e05e","resolution":{"observed_at":"2026-08-03T06:52:52.993653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.043616Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.043616Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:908a68084690e24563154f2fc1b5ecd21ab3070b818ea06c1cf4d6d7164d7ef5","observation_id":"1055b0a2-c601-4c8f-b63e-53dd459cef29","resolution":{"observed_at":"2026-08-03T06:52:53.043616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T06:52:53.099722Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.099722Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:64959b73d2ef9bb494ba8abff1784a1a0d3bd2a5029e61121c1043a599f9bb84","observation_id":"38085235-490f-481d-967a-19f282a016ca","resolution":{"observed_at":"2026-08-03T06:52:53.099722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T06:52:53.153009Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.153009Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:84a0e7e8564965dedb7cddc6a1e91fff3aeccf94e4be51d2b465a5d01a95e2bc","observation_id":"a1b5cdaa-abd4-4682-ac5e-a3ad8e8a9f89","resolution":{"observed_at":"2026-08-03T06:52:53.153009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.218331Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.218331Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:cf7a2ec4d6c87f9eae0328fb2908be3b07709a96b709e0b98090e14b150d70ae","observation_id":"df4db203-8bbe-46bf-8811-8df07b58f0c7","resolution":{"observed_at":"2026-08-03T06:52:53.218331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.265125Z","title":"Compositional generalization through abstract representations in human and artificial neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.265125Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:02559cbf17bff38b3ea05a9ef5d899a578e27a859430a8d20c8db528e85a299a","observation_id":"f3fd5b45-d18c-46ea-aba0-9bf7d3a6e83f","resolution":{"observed_at":"2026-08-03T06:52:53.265125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T06:52:53.321726Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.321726Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:0e6130e0d97a74febc8158740ec0e70b73e85c5b235d1410260eea17443b67f8","observation_id":"84ea9a23-a26b-43c0-8f05-4286be73c63a","resolution":{"observed_at":"2026-08-03T06:52:53.321726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.380471Z","title":"Mawps: A math word problem repository","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.380471Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:2e947b28bc1e8b09e4e533301281308142c8e72d198eae6067c824d225f3fbd0","observation_id":"2b567197-d207-410b-876c-2ca94fb4ada5","resolution":{"observed_at":"2026-08-03T06:52:53.380471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-16T12:54:10.475592Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-03T06:52:53.480561Z","title":"M., Cholakkal, H., Shah, M., Yang, M.-H., Torr, P","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.480561Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:5dec3fddd1508ca52644ee992fe1a7750391edc8c95e3ab28d1b29154fca740d","observation_id":"ad00f497-f171-44a3-ba37-c4661987a3df","resolution":{"observed_at":"2026-08-03T06:52:53.480561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.644931Z","title":"D., Cohen, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.644931Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:644e7c0e3ed16c12378ed8da737077725196b1743520f7a31d376f74fbc35d40","observation_id":"719c9849-4aec-4584-ade7-6c8d7cfd1fb0","resolution":{"observed_at":"2026-08-03T06:52:53.644931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:53.794665Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.794665Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:d3f542fbbf8874672593e9adfc77120751e5544438a526ce6c70a53a404a51ea","observation_id":"b284252d-bd80-4853-b5c9-9039367201bd","resolution":{"observed_at":"2026-08-03T06:52:53.794665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-18T00:48:14.021998Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-03T06:52:53.945286Z","title":"N., Zhu, S.-C., Rajpurohit, T., Clark, P., and Kalyan, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:53.945286Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:96c15d1ed3fafeb43c0cb8d37a6a30ed83dfb1413e9ee7ebf0899690a7cf6aa7","observation_id":"0f778b08-1513-4b56-9814-1927e1be69d3","resolution":{"observed_at":"2026-08-03T06:52:53.945286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.119238Z","title":"Towards a unified view of large language model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.119238Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:1a3a0d2259f31e674d19fce11e3741c79f4e12b581ed32c00581d88c40eb63f9","observation_id":"5234a885-8a0e-45ed-9088-f77498cf2e92","resolution":{"observed_at":"2026-08-03T06:52:54.119238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.246041Z","title":"W., and Behrens, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.246041Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:22c61866bb7b9acbdf8f998bbd89f5deab67f45dffe9ddbee4ee13c356c01515","observation_id":"991f4cc9-d33c-47b8-ba09-2ce868d5f25c","resolution":{"observed_at":"2026-08-03T06:52:54.246041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.354117Z","title":"A diverse corpus for evaluating and developing english math word problem solvers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.354117Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:485595fe51dc78255f7ce7887d92901a56547398e2a28a5b0d2a6be5306de656","observation_id":"aed24ea8-d1cd-4731-b99f-36337b5a6877","resolution":{"observed_at":"2026-08-03T06:52:54.354117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-16T08:54:56.543625Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-03T06:52:54.465200Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.465200Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:8834b90f9ca034c9c9e63e5aeaf68903de6b356ee53a683ac99cab98b97acfbc","observation_id":"b9b6fbf3-2b7f-4a9c-9775-b33ea1aee5ba","resolution":{"observed_at":"2026-08-03T06:52:54.465200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.554149Z","title":"Abstraction and analogy-making in artificial intelligence","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.554149Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:ce622fac58510c8e45fce44f75a1756429afcee913026a04332d52ba3621af95","observation_id":"d77c5eee-0496-4cb1-bdee-1941e1b767d8","resolution":{"observed_at":"2026-08-03T06:52:54.554149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.633374Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.633374Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:c38692ce7d8e0c12a9c8e5d27f6925e37bdc7c0478fda141fd8cfb5ad25a1327","observation_id":"4cf0a90d-4661-4c33-a30c-9e30a453e41f","resolution":{"observed_at":"2026-08-03T06:52:54.633374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:54.696039Z","title":"Plan-tuning: Post-training language models to learn step-by-step planning for complex problem solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.696039Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:3166f3af216eab6569c4b7c29be531fa978a3b84b2d90fe8e16ed0a2a9755d92","observation_id":"07e30e33-408e-4ecf-a777-7ff068f5df06","resolution":{"observed_at":"2026-08-03T06:52:54.696039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.07191","last_updated":"2021-04-15T06:11:12Z","snapshot_observed_at":"2026-08-07T13:11:17.300265Z","submitted_at":"2021-03-12T10:23:47Z","title":"Are NLP Models really able to Solve Simple Math Word Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.07191","snapshot_observed_at":"2026-08-03T06:52:54.747035Z","title":"Are nlp models really able to solve simple math word problems? arXiv preprint arXiv:2103.07191, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.747035Z"},"links":{"cited_paper":"/paper/2103.07191","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:44726df9b649a26802e91be6a725c43b94251273bb830e9c41faecc0a013997b","observation_id":"47b807f3-2509-471b-bee4-cc3985adb1e6","resolution":{"observed_at":"2026-08-03T06:52:54.747035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-03T06:52:54.813802Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.813802Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:9a6d8a57e4fe2d70b93c79157742ab7d5c30be24cd05551da902319e3b02fc32","observation_id":"5ada046a-e456-41ad-8116-866789fcc489","resolution":{"observed_at":"2026-08-03T06:52:54.813802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T06:52:54.896415Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.896415Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:0a9dbfd8f6a78fd45abfda60b3a79e8378ac001f2f04fe3bbc7cb9b5c98880d5","observation_id":"6be17ceb-6d13-4a5d-98d0-563f1a98f517","resolution":{"observed_at":"2026-08-03T06:52:54.896415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T06:52:54.976326Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:54.976326Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:8e505b66c0ab221e492a95f8d3632665f7c76728583d03c680badddc40c97988","observation_id":"7f0ce054-c423-4a49-890b-4e73028b022d","resolution":{"observed_at":"2026-08-03T06:52:54.976326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:55.035510Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.035510Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:5df6e974b0fa189d81b4fccf5b9f2e23641a3d3a327d97ba192f3407ebd86b1e","observation_id":"1dfbcecf-f88a-41a9-917c-a0789484b3b8","resolution":{"observed_at":"2026-08-03T06:52:55.035510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:55.120800Z","title":"Cognitive load during problem solving: Effects on learning","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.120800Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:93f445d94508c5fa1e16ca2749dbb3e23737b96d6208170fcc2bae5c54cb1c64","observation_id":"d225e297-c130-4775-ae51-6de35305665d","resolution":{"observed_at":"2026-08-03T06:52:55.120800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T06:52:55.203049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.203049Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:b949a6b689912c97fb4a172197508de3785da08ef9eebe9a193bd7f0c6c2ccc4","observation_id":"02ef53d2-8ade-4ccb-a886-6e490e394334","resolution":{"observed_at":"2026-08-03T06:52:55.203049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-03T06:52:55.390388Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.390388Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:83ace7ed34d980f91b766e2f0fc669375d1bcc35a0921fded6af9e6e6238492b","observation_id":"25f6e867-6b54-4b22-9a09-7d0307f3f696","resolution":{"observed_at":"2026-08-03T06:52:55.390388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21931","last_updated":"2025-07-29T15:46:26Z","snapshot_observed_at":"2026-08-17T18:23:47.068492Z","submitted_at":"2025-07-29T15:46:26Z","title":"Post-Training Large Language Models via Reinforcement Learning from Self-Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21931","snapshot_observed_at":"2026-08-03T06:52:55.624948Z","title":"M., Lin, H.-c., and Ga s i \\'c , M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.624948Z"},"links":{"cited_paper":"/paper/2507.21931","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:95531ff7d21858323ec4e265924571da38c0e55cf384e637f1b25b9c0fc9edc8","observation_id":"6b42ea3d-cb52-4bb2-a765-04e608af4a2d","resolution":{"observed_at":"2026-08-03T06:52:55.624948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:55.778877Z","title":"X., Kurth-Nelson, Z., Kumaran, D., Tirumala, D., Soyer, H., Leibo, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:55.778877Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:dbc94bbb270f73993658a7dcd252234172192900442f226ea1d97c5997042caa","observation_id":"57a344f1-34a7-4e3f-8772-3b5bc2852c5b","resolution":{"observed_at":"2026-08-03T06:52:55.778877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-17T06:22:42.572723Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08446","snapshot_observed_at":"2026-08-03T06:52:56.005103Z","title":"A survey on large language models for mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.005103Z"},"links":{"cited_paper":"/paper/2506.08446","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:735db2c2f779d43c0648adbb331d2e1ebe14ad732d8e7322dcb61a90020ef829","observation_id":"42edb151-c342-42d8-acae-edab792b795b","resolution":{"observed_at":"2026-08-03T06:52:56.005103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21438","last_updated":"2026-05-07T19:45:35Z","snapshot_observed_at":"2026-07-06T19:41:06.495019Z","submitted_at":"2024-10-28T18:34:25Z","title":"UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21438","snapshot_observed_at":"2026-08-03T06:52:56.188957Z","title":"Uft: Unifying fine-tuning of sft and rlhf/dpo/una through a generalized implicit reward function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.188957Z"},"links":{"cited_paper":"/paper/2410.21438","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:daf12ef77088ac628cdb941c6ef7b80961e73ef2986abe75fa841ca638f10333","observation_id":"3b9fa72b-c343-4503-a22c-74467f29fb60","resolution":{"observed_at":"2026-08-03T06:52:56.188957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:56.343925Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.343925Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:8a501186f203854f250895bf4df88066fb9eabac3e79d3857093a30911b08b72","observation_id":"8c00f3af-7000-416b-bbea-f5d2c84d4de0","resolution":{"observed_at":"2026-08-03T06:52:56.343925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:56.504633Z","title":"M., Meder, B., and Schulz, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.504633Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:50396fb5d0e68f3c08bf150bd5f547d0f1a6bfff812a36e55bc1797f42281f33","observation_id":"98225bc7-fb84-4608-8e11-aab62dc43bc2","resolution":{"observed_at":"2026-08-03T06:52:56.504633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-17T18:51:13.219936Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-03T06:52:56.712409Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.712409Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:f14eb56da046d0042b205310be324149c347a1aa3d514cb3749b070b8ce8e6a9","observation_id":"0f05880c-5c37-43ad-9651-56f7c529caa2","resolution":{"observed_at":"2026-08-03T06:52:56.712409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T06:52:56.775626Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.775626Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:e5e87987fe71f9fa2bc833d889c9a9d7b2bed29bceba2105d1b71676e0587142","observation_id":"705591ad-5f76-428e-8bec-44a4f72c5fef","resolution":{"observed_at":"2026-08-03T06:52:56.775626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:56.923171Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:56.923171Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:baa59d142bb14c42f734d6e1ec5dbfb7bab74049bf7dab51142a457c181c78dd","observation_id":"aa4efabc-a5cb-4037-a9a2-d13caf639587","resolution":{"observed_at":"2026-08-03T06:52:56.923171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:57.031345Z","title":"Groundedprm: Tree-guided and fidelity-aware process reward modeling for step-level reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:57.031345Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:0570a7fed72580210b659903b5f310c41538dd4f374406aad4fe5f14b7f29379","observation_id":"1f62c9ae-3988-48bd-8147-6254c80880f5","resolution":{"observed_at":"2026-08-03T06:52:57.031345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:52:57.142548Z","title":"Y., Garvert, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T06:52:57.142548Z"},"links":{"citing_paper":"/paper/2601.21909"},"observation_digest":"sha256:fb557cceb1b7fe31330945f83dad3bdb030a8f23314b7577e3f719a3a535256d","observation_id":"1bbcb95d-0914-45b9-bdb9-a641c5ca952c","resolution":{"observed_at":"2026-08-03T06:52:57.142548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.21909","last_updated":"2026-05-28T16:50:42Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T16:19:01.554758Z","submitted_at":"2026-01-29T16:00:48Z","title":"From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2601.21909."}